Gemini 3.5 Pro为何缺席?谷歌新模型发布背后的真实困境

谷歌近期一口气发布了两款新模型——Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite,但外界最期待的旗舰级 3.5 Pro 依然缺席。这场看似产品线补齐的发布,实际上暴露出谷歌在旗舰模型研发上遭遇的真实困境。本文将拆解两款新模型的实际表现,并分析 Pro 版迟迟未到背后的深层原因。
Gemini 3.5 Flash Lite:廉价模型的定位升级
本次发布中最出人意料的角色,是定位轻量的 Gemini 3.5 Flash Lite。它的性能一举超越了此前的 3.0 Flash,在代码测试和长上下文理解两项关键能力上都有明显进步。
更值得关注的是它的速度表现——输出速度达到每秒 350 个 token,是谷歌当前所有模型里最快的。Token是大语言模型处理文本的基本单位,一个token大约对应英文中的3-4个字符或中文中的1-2个字。每秒350个token意味着模型每秒可以生成约260个英文单词,这在实时对话、代码补全等需要即时响应的场景中至关重要。这种极致的输出速度通常依赖于推测解码(Speculative Decoding)、KV缓存优化以及底层TPU硬件加速等多重技术手段的协同。虽然价格相比前代有所上涨,但这种速度优势在实时交互和高并发场景中价值巨大。
谷歌还首次让 Lite 版承担起轻量级的编程和智能体(Agent)任务,等于把"廉价模型"的能力定位整体往上提了一档。这一动作背后的逻辑很清晰:在旗舰迟到的情况下,用高性价比的入门产品稳住开发者生态的底盘。

Gemini 3.6 Flash:效率优化而非完整换代
Gemini 3.6 Flash 是本次发布的主力。官方强调它主要在三个方面做了优化:多步骤任务编排、全站代码重构,以及通用推理能力。
核心改进:更"克制"的智能体行为
3.6 Flash 最核心的变化是降低了"动作偏好"(action bias)。通俗地说,模型开始懂得"先观察、再分析",在没有明确授权的情况下绝不擅自改动用户的文件。
动作偏好是AI智能体研究中的一个重要概念,指模型在面对任务时倾向于立即执行操作而非先进行充分的信息收集和分析。在软件开发场景中,高动作偏好的智能体可能在未完全理解上下文的情况下就修改代码文件,导致引入新bug或破坏现有功能的连锁反应。降低动作偏好通常需要在RLHF(基于人类反馈的强化学习)阶段对模型的决策策略进行精细调校,让模型学会在"执行"和"询问确认"之间做出更审慎的判断。
对开发者而言,这种克制的行为模式确实非常实用,能有效避免 AI 智能体在自动化任务中造成不可控的破坏。
独立评测揭示的尴尬数据
然而,独立评测的数据让事情变得有些微妙。3.6 Flash 的智能评分与 3.5 Flash 完全持平,都是 50 分——也就是说,在"聪明程度"上并没有实质提升。
真正的进步体现在效率上:任务平均耗时从 2.7 分钟降低到了 1.3 分钟,几乎缩短了一半。这对需要快速迭代的开发者来说是实打实的收益。

但问题也随之而来。有开发者实测发现,3.6 Flash 在某些任务中消耗的 token 反而更多了。这意味着虽然输出单价降到了每百万 token 7.5 美元,但单次任务的总成本却未必下降。这种现象可能源于模型在降低动作偏好后增加了更多的"思考步骤"和中间推理过程,导致生成的token总量反而上升——本质上是用更多的计算量换取了更审慎的行为。
再加上目前 3.6 Flash 还不支持模型微调,而 3.5 Flash 早就具备这一能力,不少开发者的直观感受是:3.6 Flash 更像一个"提前上阵的效率优化版",而非一次完整的代际更新。模型微调(Fine-tuning)允许开发者在预训练模型基础上使用特定领域数据进行二次训练,将通用模型定制为专属的行业工具。缺少微调支持意味着开发者只能依赖提示工程来引导模型行为,在精度和一致性上都受到限制,这对企业级应用部署而言是一个不可忽视的短板。
Gemini 3.5 Pro到底卡在哪里?
真正的悬念,是那个迟迟未到的 3.5 Pro。谷歌官方的回应是"还在与合作伙伴测试",但据彭博社披露,真正的瓶颈主要出在编程能力上。
据报道,谷歌曾在 6 月底紧急调整过训练数据,试图提升 Pro 版的编码表现,但结果仍不理想。大模型的编程能力高度依赖训练数据中代码语料的质量、多样性和规模。紧急调整训练数据可能涉及增加高质量代码仓库(如经过严格审查的开源项目)、通过模型自我博弈生成合成代码数据,以及精细调整代码与自然语言数据的配比。编码能力之所以难以突破,部分原因在于代码推理需要模型具备严格的逻辑一致性和长链推理能力——代码中一个微小的逻辑错误就会导致程序完全无法运行,这与自然语言写作中可以容忍一定模糊性形成了根本性矛盾。

3.5 Pro可能直接跳代到Gemini 4
更关键的信号是,谷歌自己已经透露下一代 Gemini 4 的预训练已经开始,内部称其为"最雄心勃勃的预训练"。这基本印证了外界的猜测:3.5 Pro 很可能被直接跳过,等谷歌把技术打磨到位后,直接以 Gemini 4 Pro 的身份亮相。
这种"跳代"策略在业界并不罕见——与其硬推一个不够成熟的旗舰版本损伤品牌口碑,不如集中资源做好下一代。历史上,微软曾跳过Windows 9直接发布Windows 10,苹果也跳过了iPhone 9。在AI领域,这种策略往往出现在技术路线发生重大调整时:与其发布一个过渡性产品让用户和开发者承担API迁移和适配成本,不如将多个版本的改进积累到下一个大版本中一次性释放,既节省生态适配成本,也能在市场竞争中制造更大的声量和期待感。
人才流失对谷歌AI研发的隐性冲击
过去几个月谷歌 AI 团队的人事变动,也在一定程度上拖慢了旗舰模型的研发节奏。
Gemini 联合负责人 Noam Shazeer 于 6 月转投 OpenAI,DeepMind 的副总裁、诺贝尔化学奖得主 John Jumper 则去了 Anthropic。多位核心成员的接连出走,对旗舰模型研发的冲击可想而知。

Noam Shazeer 是2017年那篇开创性论文《Attention Is All You Need》的八位共同作者之一,Transformer架构正是从这篇论文中诞生,成为当今所有大语言模型的技术基石。他最初在2023年通过谷歌以26亿美元收购Character.AI的交易回归,如今再度离开,对谷歌的象征意义远超个人层面。John Jumper则因领导AlphaFold蛋白质结构预测项目获得2024年诺贝尔化学奖,他的离开意味着谷歌在AI for Science方向上失去了最具标志性的领军人物。
顶尖 AI 人才在头部公司之间的高速流动,正成为影响大模型研发进度的一个隐性但关键的变量。当前AI行业的人才争夺已进入白热化阶段,顶尖研究者的年薪加股权激励可达数百万至数千万美元。核心研究者的离开,往往意味着技术路线的中断、团队协作默契的丧失,以及数月甚至更长时间的重组成本。更深层的影响在于,这些顶尖人才往往带走的不仅是显性知识,还有大量难以文档化的实验直觉和调参经验。
谷歌的策略:稳阵脚而非秀肌肉
综合来看,谷歌这轮发布的核心逻辑并不是"秀肌肉",而是"稳阵脚":
- 旗舰 Pro 暂时拿不出手,就让 Flash 系列顶上来,把效率和性价比打到极致;
- 同时扶正更有潜力的 Lite 版,守住开发者生态的基本盘;
- 把有限的研发资源集中投向 Gemini 4,为真正的反击蓄力。
这种策略本质上是一场"以时间换质量"的赌博。在OpenAI、Anthropic和Meta都在加速迭代的竞争格局下,谷歌选择暂时牺牲旗舰产品线的更新节奏,把赌注押在下一代架构的技术突破上。这个选择的风险在于:如果Gemini 4的交付时间过长,开发者生态可能在等待中逐渐向竞品迁移;但如果Gemini 4最终能实现代际级的性能跃升,谷歌就有机会重新定义竞争格局。
谷歌在旗舰模型上确实遇到了坎,但他们没有选择干等,而是先把能交付的产品交付出去。至于能否靠 Gemini 系列在这场大模型竞赛中翻盘,还要看接下来 Gemini 4 的真功夫。
核心要点
相关推荐

DeepSeek Harness保姆级教程:插件化AI Agent实战指南
详解DeepSeek Harness安装配置、四种Agent预设模式、第三方模型接入及插件管理,附带个人博客和任务管理应用两个实战案例,手把手教你搭建插件化AI Agent。

Gemini决策闭合基准实测:285次运行99.3%通过率解读
一份聚焦LLM决策闭合能力的基准测试,285次实测中Gemini取得99.3%语义通过率。本文解析其方法论亮点:语义正确与格式合规的分离评分,以及冻结基准跨模型对比的实验设计。

Qwen 3.8 27B发布:本地部署最强稠密开源模型解析
阿里通义千问Qwen 3.8 27B以开放权重形式发布,被誉为目前最好的本地部署稠密模型。本文解析其技术定位、27B参数量优势、开放权重的战略意义及社区评价。