别急着嘲笑Gemini:AI模型评价中的认知偏差与进化真相

当我们嘲笑一个AI模型时,我们在嘲笑什么
最近,社区里出现了大量对Gemini新版本的调侃与批评。开发者们习惯性地在社交平台上晒出模型的失误案例,用一种略带优越感的口吻评价它"还差得远"。这种现象在每一个新模型发布时都会周期性上演。
背景知识:Gemini模型系列
Gemini是Google在2023年12月发布的大型语言模型系列,旨在与OpenAI的GPT-4和Anthropic的Claude竞争。该系列包括Ultra、Pro和Nano三个版本,采用多模态架构,能够同时处理文本、图像、音频和视频。与早期多模态模型采用的"拼接式"架构(分别训练视觉编码器和语言模型再通过适配层连接)不同,Gemini从训练阶段就将多种模态数据混合输入,实现了"原生多模态"(natively multimodal)——这意味着模型在理解跨模态关系时更加自然,能够同时理解视频中的画面内容、背景音乐和字幕文字之间的语义关联。这种架构的技术难点在于不同模态数据的tokenization策略和注意力机制的设计,Google利用其在视觉Transformer(ViT)和音频处理(如AudioLM)方面的长期积累来解决这些挑战。
2025年3月,Google发布了Gemini 2.5 Pro版本,进一步提升了推理能力和上下文窗口长度。Gemini的发布标志着Google正式进入生成式AI的核心竞争领域,但每次版本更新都会引发社区的密集测试和评价。这些测试往往采用"红队测试"(Red Teaming)方法——这一概念源自军事和网络安全领域,指专门组建一支团队来扮演"对手"角色,系统性地测试防御体系的弱点。在AI安全领域,红队测试通常包括对抗性提示注入(Prompt Injection)、越狱攻击(Jailbreaking)、事实性错误诱导等多个维度。然而社交媒体上的"民间红队测试"与专业红队测试有本质区别:专业测试关注系统性风险和可复现的漏洞,而社交媒体上的测试往往追求"戏剧性效果"。
社交平台上对AI模型的集体「挑刺」行为,背后有着深层的传播学动力。算法推荐机制天然偏好高互动内容,而模型的荒谬失误——比如编造不存在的API、在简单算术上翻车、生成自相矛盾的代码——恰恰是高传播性内容。研究显示,负面信息的传播速度约为正面信息的6倍(Vosoughi等人2018年在Science发表的假新闻传播研究提供了类似的传播不对称性证据)。这意味着一个精心构造的失败案例可能获得数万次转发,而模型在数百万次日常交互中的稳定表现几乎不会被任何人分享。这种传播不对称性,加上社交媒体的"表演性批评"文化——展示自己能找到模型弱点本身成为一种社交货币——共同塑造了公众对模型能力的扭曲认知,产生显著的"选择性展示偏差"。
但一位YouTube创作者提出了一个耐人寻味的反问,值得整个技术社区停下来思考:我们今天嘲笑的这些"不够聪明"的模型,其实早已远远超越了当年被我们奉为里程碑的产品。

ChatGPT 3.5 Turbo:一个被遗忘的对比坐标
这位创作者的核心论点很直接:还记得当年ChatGPT 3.5 Turbo刚问世的时候吗?
那时候,互联网上充斥着这样的声音——"看来软件工程要完蛋了,兄弟们(looks like software engineering is over, boys)"。无数开发者被3.5 Turbo的表现震撼,甚至开始担忧自己的职业前途。它一度被视为改变行业的分水岭。
技术里程碑回顾:3.5 Turbo的突破性
ChatGPT 3.5 Turbo于2023年初发布,是OpenAI在GPT-3.5基础上针对对话场景优化的版本。它采用了RLHF(基于人类反馈的强化学习)技术——这一技术的核心流程分为三步:首先用监督学习微调预训练模型,然后让人类标注员对多个模型输出进行偏好排序来训练一个奖励模型(Reward Model),最后使用PPO(近端策略优化)算法让语言模型的输出最大化奖励模型的评分。这一技术最早由OpenAI在InstructGPT论文中系统化提出,后来成为ChatGPT成功的核心秘密。
值得注意的是,RLHF并非没有争议——它可能导致模型过度迎合人类偏好(所谓的"sycophancy"谄媚问题),也可能使模型在安全性上过度保守。此后的对齐技术演进十分迅速:2023年斯坦福提出的DPO(Direct Preference Optimization)通过将偏好学习问题重新表述为一个简单的分类损失函数,完全绕过了奖励模型的训练,大幅降低了对齐训练的工程复杂度和计算成本。之后又涌现出KTO(借鉴行为经济学中的前景理论)、IPO、ORPO等变体,而Anthropic提出的Constitutional AI(宪法AI)则走了另一条路——用AI自身来评判AI输出是否符合预设原则,减少对人类标注员的依赖。这些对齐技术的快速迭代本身就是AI领域加速进步的一个缩影。
相比前代,3.5 Turbo的响应速度提升了约25%,成本降低了90%,这使得它成为首个真正实现商业化大规模部署的对话AI。当时,它在代码生成、文本创作和问答等任务上的表现让开发者社区震惊,被认为是"iPhone时刻"级别的技术突破。
然而放到今天的坐标系里回看,创作者毫不客气地评价:"ChatGPT 3.5 Turbo相比现在的Gemini,简直就是垃圾(absolute garbage)"。

这句略显夸张的表述背后藏着一个真实的技术现实:模型能力的迭代速度快到让我们不断刷新"及格线"。这种快速迭代背后有其理论基础——Scaling Laws(缩放定律)。2020年,OpenAI研究者Kaplan等人发现,模型性能与参数量、训练数据量、计算量之间存在幂律关系:只要持续增加这三个要素,模型性能就会持续且可预测地提升。这一发现直接催生了"大力出奇迹"的训练范式。然而到2024-2025年,行业开始意识到单纯的预训练缩放可能正在遭遇收益递减,于是"测试时计算"(Test-time Compute)成为新的前沿方向——通过在推理阶段让模型进行更多的"思考"(如链式推理、自我验证),用推理阶段的算力换取更高的输出质量。OpenAI的o1系列和Google的Gemini 2.5 Pro都采用了这一思路,这也解释了为何新一代模型在复杂推理任务上的提升尤为显著。
从2020年GPT-3到2025年的Gemini 2.5 Pro,顶级模型在标准基准测试上的得分每6-9个月就会有显著跃升。例如,GPT-3.5在代码生成任务HumanEval上的通过率约为48%,而GPT-4达到67%,Claude 3.5 Sonnet达到92%,短短两年内提升了近一倍。我们对AI的期待值随着每一次发布水涨船高,以至于忘记了自己曾经为哪个版本欢呼过。
AI模型评价中的认知双重标准
创作者进一步戳破了一个尴尬的真相。他指出,那些今天嘲笑Gemini新版本的人当中,有一半在当年正是对着ChatGPT 3.5 Turbo惊叹"这就是未来"的那批人。
"你们当中有一半人,当年看着3.5 Turbo说:'这就是我要的(that's me)'。你以为呢?你真的以为那就是极限了。"

这里揭示了一种典型的认知偏差:我们总是用当下最先进的产品作为唯一的参照系,来贬低所有新产品的不足,却选择性遗忘了技术进步的绝对幅度。
换句话说,今天被吐槽"不够好"的Gemini新版本,其绝对能力早已把当年那个让所有人惊呼"软件工程要终结"的模型甩在身后。我们批评的不是模型退步了,而是我们的期待值涨得太快。
理解评测的局限性
这种认知偏差部分源于AI评测方法论的局限。当前AI领域的主流评测基准各有侧重:MMLU(Massive Multitask Language Understanding)包含57个学科的选择题,测试模型的广泛知识储备;HumanEval由164道Python编程题组成,评估代码生成能力;GSM8K包含8500道小学数学应用题,测试多步推理能力;而ARC(AI2 Reasoning Challenge)则侧重科学常识推理。然而这些基准面临严重的"数据污染"(Data Contamination)问题——测试题可能已出现在模型的训练数据中,导致分数虚高。此外,基准测试的选择题格式与真实应用场景差距很大,一个在MMLU上得分95%的模型在实际开放式对话中可能表现平平。
这也是为什么社区越来越重视Chatbot Arena这类基于真实用户盲评的动态排行榜。Chatbot Arena由UC Berkeley的LMSYS团队创建,采用了源自国际象棋的Elo评分系统——用户向两个匿名模型同时提问,选择更偏好的回答后系统据此更新排名。这种"盲评"机制有效避免了品牌偏见,截至2025年已积累超过百万次人类投票,成为业界最受认可的模型排行榜之一。与此同时,SWE-bench等更贴近实际工作场景的评测也在崛起——SWE-bench由Princeton大学团队从Django、Flask、scikit-learn等12个真实Python开源项目中收集了2294个GitHub issue,要求模型理解完整代码仓库上下文、定位问题并生成修复补丁。这与"从零写一个函数"的HumanEval有本质区别,更接近软件工程师的日常工作。最初GPT-4在SWE-bench上的解决率不到5%,而到2025年初结合Agent框架的最佳系统已能解决超过50%的问题——这一进步幅度远超传统基准所能反映的。
更重要的是,缺乏历史对比基准的评测容易陷入"锚定效应"——人们仅以当前最强模型为参照系,而忽略了纵向的进步幅度。当3.5 Turbo的4K上下文窗口在2023年初还被认为是"足够用"时,今天的Gemini 2.5 Pro已经提供了超过100万tokens的上下文能力。从4K到100万tokens,这一跨越背后涉及多项关键技术创新:标准Transformer架构的自注意力机制计算复杂度为O(n²),上下文长度翻倍意味着计算量将增至四倍。为突破这一瓶颈,研究者们发展了稀疏注意力(Sparse Attention)、滑动窗口注意力(Sliding Window Attention)、RoPE(旋转位置编码)外推技术以及Ring Attention等分布式推理方案。这些技术的叠加使得百万级上下文成为可能,但长上下文中的"迷失在中间"(Lost in the Middle)问题——模型对序列中间部分的信息检索能力弱于首尾——仍然是活跃的研究方向。这本身就是数量级的技术跨越。

AI进化背后的三个技术启示
这段看似调侃的评论,实际上触及了AI行业一个值得警惕的现象。
期待值的通货膨胀正在扭曲判断
每一代模型都在重新定义"合格"的标准。当GPT-3.5让人惊艳时,我们的基准线还很低;当GPT-4、Claude、Gemini陆续登场后,基准线被不断推高。今天的"平庸",在两三年前可能就是"神迹"。
这种"能力通货膨胀"现象在AI领域尤为显著。研究表明,大语言模型的能力提升速度甚至快于芯片领域的摩尔定律——后者是每18-24个月晶体管密度翻倍,而前沿AI模型的基准测试得分在某些任务上每6-9个月就能实现显著跃升。去年被认为是"超级智能"的表现,今年可能仅被视为"基本合格"。这种期待值的持续通胀,让我们越来越难以客观评价单个模型的真实价值,也让开发者和用户形成了"永远不满足"的心理状态。心理学中的"享乐适应"(Hedonic Adaptation)理论可以部分解释这一现象:人类天生会快速适应新的刺激水平,并将其视为"新常态",从而需要更强的刺激才能获得同等的满足感。这一效应在消费电子领域早有先例——每一代iPhone发布时都会有用户抱怨"没有创新",尽管每代产品在绝对性能上都有可观的提升。
评价AI模型需要历史纵深
单纯用"它犯了什么错"来评判一个模型是片面的。更有价值的评估方式是把它放进技术演进的时间轴里:相比半年前、一年前的同类产品,它进步了多少?解决了哪些过去无解的问题? 只盯着缺点而忽视进步曲线,容易得出失真的结论。
这需要建立一种"纵向对比"的评测思维。例如,GPT-3.5的上下文窗口仅4K tokens,且在复杂推理任务上常常出现逻辑错误——它无法可靠地执行超过3步的数学推理链,在代码调试中经常"修一个bug引入三个新bug";而今天的Gemini 2.5 Pro不仅拥有百万级上下文,在多步推理、代码调试、多模态理解等任务上也有质的飞跃。更关键的是,新一代模型引入的"测试时计算"范式使得它们能够在遇到复杂问题时自主分解任务、验证中间步骤,这是GPT-3.5时代完全不具备的能力。如果我们仅关注它在某个边界案例下的失误,而忽略了这些绝对能力的提升,就会陷入"只见树木不见森林"的误区。
开发者需要调整心态拥抱工具进化
对于开发者而言,这段话也是一剂清醒剂。与其在社交媒体上比拼谁能挖出模型更离谱的失误,不如思考如何在现有能力边界内充分利用这些工具。毕竟,那个曾让你担忧"软件工程要完蛋"的模型,如今已成了你眼中"不够看"的东西——这本身就说明了工具进化的速度,也说明了人类适应与驾驭工具的能力。
更重要的是,理解AI模型的"能力边界"比单纯批评其失误更有价值。每一代模型都有其擅长和不擅长的领域,理解这些边界并设计合理的工作流,才是真正将AI工具转化为生产力的关键。例如,当前最先进的模型在结构化数据分析、长文档摘要、代码重构等任务上已经能显著提升效率,但在需要最新实时信息、高度专业化的领域知识或涉及复杂物理推理的场景中仍有明显局限。
成熟的AI应用策略不是期待模型"无所不能",而是通过架构设计将模型的优势与人类判断力有效结合。RAG(检索增强生成)是这一方向的基石——由Meta AI在2020年提出,核心思想是在生成回答前先从外部知识库中检索相关文档。其完整技术栈涉及文档分块(Chunking)、向量嵌入(Embedding)、向量数据库(如Pinecone、Weaviate、Milvus)、相似度检索以及重排序等多个环节,解决了模型知识截止日期和幻觉这两个核心痛点。而2024-2025年兴起的AI Agent架构则更进一步,赋予模型使用工具(搜索引擎、代码解释器、数据库查询)、规划多步行动和自我反思的能力。从简单的单轮问答到RAG再到多步Agent工作流,这一演进路径体现了AI应用从"被动回答"到"主动执行"的根本转变。当我们过度关注失败案例时,往往会忽略这些架构层面的创新已经在真实生产环境中带来的巨大效率提升。
结语:对AI技术进步保持敬畏,也保持清醒
这位创作者用一种幽默而略带讽刺的方式,提醒我们重新审视对AI的态度。嘲笑新模型的不足很容易,但如果能记住我们曾经为哪些"如今看来不堪"的版本激动过,也许会对技术进步多一分敬畏,少一分傲慢。
AI的发展是一条陡峭的曲线。今天我们眼中的"垃圾",可能正是几年前我们梦寐以求的"未来"。而今天让我们不满意的Gemini,很可能在不远的将来,成为我们回头看时又一个"当年真好"的注脚。
技术进步从来不是线性的,而是在每一次迭代中累积起来的指数级跃升。从Scaling Laws驱动的参数规模扩张,到RLHF和DPO带来的对齐能力提升,再到测试时计算开启的推理能力新范式,每一次技术突破都在重塑我们对"智能"的定义。当我们批评一个新模型时,不妨问自己:它真的退步了吗?还是只是我们的期待值又涨了一轮?保持这种历史纵深的视角,我们才能更准确地评估AI的真实价值,也更理性地规划它在实际工作中的应用边界。
核心要点
- 认知双标现象:开发者用当下最强模型作为唯一参照系,选择性遗忘技术进步的绝对幅度,这种"享乐适应"效应在技术社区中尤为显著
- 历史对比坐标:今天被批评的Gemini在绝对能力上已远超当年让人惊叹的ChatGPT 3.5 Turbo,无论是上下文长度、推理能力还是多模态理解
- 能力通货膨胀:AI模型能力每6-9个月显著跃升,从Scaling Laws到测试时计算的范式转移持续推动进步,期待值持续攀升导致"永远不满足"
- 评测方法论缺陷:社交媒体的传播不对称性放大失败案例(负面信息传播速度约为正面信息的6倍),标准基准面临数据污染问题,Chatbot Arena和SWE-bench等新型评测正在弥补这一缺陷
- 技术进步的敬畏:从4K上下文到百万tokens(涉及稀疏注意力、RoPE外推等关键创新),从48%到92%的代码通过率,SWE-bench解决率从5%到50%,两年内实现数量级突破
- 实用主义态度:理解模型能力边界并通过RAG、Agent工作流(从被动回答到主动执行的范式转变)、人机协作等架构设计合理工作流,比单纯批评失误更有价值
相关推荐

AI数字员工系统实测:所谓免费背后的营销套路解析
针对B站流行的「AI超级员工系统」「AI数字员工」推广视频,本文拆解其视频剪辑智能体、DeepSeek脚本助手两大功能模块,揭示其大模型二次封装的技术本质与免费引流背后的营销套路及账号安全风险。

WorkBuddy入门指南:让AI真正替你上班的桌面智能体
WorkBuddy是一款能直接操作本地电脑的桌面AI智能体。本文详解其定位、与CodeX的差异、常见认知误区及文件管理、协同办公等实战能力,帮你从AI提问者进化为AI管理者。

LangGraph入门指南:AI Agent的操作系统全解析
LangGraph 被称为 AI Agent 的操作系统,本文系统梳理其与 LangChain 的关系、状态节点边三大要素、持久化 checkpoint、human-in-the-loop 及子图等核心能力与学习路径。