Gemini Flash三周换代价格腰斩,DeepSeek开源Agent底座Harness

Gemini 3.7 Flash:三周换代,价格直接砍半
谷歌的迭代节奏正在变得越来越激进。昨晚发布的 Gemini 3.7 Flash,距离上一代 3.6 Flash 仅隔三周,主打写代码和智能体(Agent)场景。首发价格颇具攻击性——每百万 Token 输入 0.75 美元、输出 3.75 美元,正好是上一代的一半。
这里有必要解释一下 Token 定价的经济学。Token 是大语言模型处理文本的基本计量单位,大致相当于一个英文单词的四分之三或一个中文汉字。API 调用按输入和输出的 Token 数分别计费,输出价格通常高于输入,因为生成文本的算力消耗远大于理解文本。每百万 Token 的定价直接决定了开发者的运营成本——对于一个日均处理百万次请求的智能体应用来说,单价降低 50% 意味着每月节省数万美元。这也是为什么价格战在开发者市场如此有效:成本敏感型应用会迅速迁移到更便宜的模型上。
价格腰斩的背后,是能力的实打实提升。在网页开发的 Arena 榜单上,Gemini 3.7 Flash 从第 19 名一跃升至第 8 名。三周换代、价格减半、性能跃升,这一系列组合拳释放的信号非常清晰:谷歌铁了心要抢开发者市场。

从产品策略看,Flash 系列定位在低延迟、低成本的高频调用场景,恰恰是智能体和代码生成这类需要大量 Token 交互的应用最敏感的成本环节。谷歌的模型家族采用分层策略:Pro 系列追求最强性能,Flash 系列则通过模型蒸馏、量化压缩等技术,在可接受的精度损失范围内大幅降低推理延迟和计算成本。蒸馏是指用大模型的输出作为训练信号来训练小模型,使小模型继承大模型的部分能力但体积更小、速度更快。这种分层策略让不同场景的开发者各取所需:需要极致准确性的用 Pro,需要高频快速调用的用 Flash。谷歌选择在这个细分市场用价格换份额,意图非常明显:先把开发者生态圈住,再谈长期变现。
DeepSeek 开源 Agent 底座 Harness:一切皆插件
同一晚,DeepSeek 也放出了大招——Agent 底座 Harness 预览版正式开源,采用 MIT 协议,面向全球开放测试。
MIT 协议是最宽松的开源许可之一,允许任何人自由使用、修改、分发代码,包括商业用途,唯一要求是保留原始版权声明。相比之下,GPL 协议要求衍生作品也必须开源,Apache 协议则附带专利授权条款。DeepSeek 选择 MIT 协议,意味着企业可以将 Harness 直接嵌入闭源商业产品中,无需担心法律风险。这种策略的商业逻辑是:通过最大化采用率来建立事实标准,再通过增值服务(如云托管、企业支持)实现变现。
Harness 的核心理念是「一切皆插件」:模型、工具、技能、沙箱、界面全部可以自由组合与替换。智能体(Agent)是指能够自主感知环境、做出决策并执行动作的 AI 系统,区别于简单的问答式大模型交互。Agent 底座是构建这类系统的基础框架,负责协调模型推理、工具调用、记忆管理和多步规划等核心流程。Harness 采用的「一切皆插件」架构,本质上是微内核设计思想在 AI 框架中的应用——核心系统只负责消息路由和插件生命周期管理,所有功能模块都以标准化接口接入。整个框架核心用 REST 编写,REST(表述性状态转移)是一种广泛使用的 Web API 设计风格,这意味着任何能发 HTTP 请求的编程语言都可以与之交互,极大降低了集成门槛。框架内置一百多个官方插件,还配套了一个插件商店。对开发者而言,这相当于拿到了一整套搭建智能体的「积木」——不必从零造轮子,直接在标准化组件上拼装自己的 Agent 应用。

这与谷歌用价格抢市场的思路形成了有趣对照:一个用开源降低门槛,一个用定价降低成本,两者都在争夺同一批 Agent 开发者。当底层模型能力逐渐趋同,谁能提供更好的开发者体验和更低的迁移成本,谁就能占据生态高地。
OpenAI UltraFast:推理速度飙升 14 倍
OpenAI 则在推理速度上做文章,预览了新服务 UltraFast,由芯片公司 Cerebras 提供算力支撑。在旗舰模型 GPT-5.6 上,UltraFast 的输出速度冲到 750 Token/秒,比标准模式快 14 倍,而质量不缩水。首批将在 OpenAI API 中限量开放。

这里值得关注的是算力供应商的选择。Cerebras 以晶圆级芯片(Wafer-Scale Engine)著称,其架构在推理低延迟场景上具备天然优势。传统芯片从硅晶圆上切割出数百个独立芯片(die),每颗芯片面积通常不超过几百平方毫米。Cerebras 的革命性之处在于将整块 12 英寸晶圆直接做成一颗芯片,面积达 46,225 平方毫米,是最大 GPU 的 50 多倍。这种架构将数十万个 AI 计算核心和大容量 SRAM 片上存储集成在一起,数据无需在芯片之间传输,从根本上消除了分布式系统中的通信瓶颈。在推理场景中,这意味着中间结果可以全部驻留在片上,避免了访问外部 DRAM 的延迟(通常差 10-100 倍),因此能实现极低的单 Token 延迟。这种架构对需要大量顺序生成的自回归推理尤其有利。OpenAI 引入 Cerebras,说明「推理不止靠 GPU 集群」这一趋势正在被头部厂商正式采纳。
对智能体应用来说,速度就是体验。一个需要多轮工具调用和推理的 Agent,等待时间的每一次缩短都直接影响可用性。14 倍的加速,本质上是在为 Agent 时代的实时交互铺路。
AI 攻克数学难题:从工具到队友
在前沿研究层面,AI 的数学能力再度突破。668 号哈达玛猜想相关难题被 Anthropic 的数学家团队解开,参与者是三名人类研究者与 Claude。
哈达玛猜想是组合数学中的经典未解问题,由法国数学家雅克·哈达玛于 1893 年提出,涉及特定阶数的方阵(哈达玛矩阵)是否存在的问题。哈达玛矩阵的元素只有 +1 和 -1,且所有行向量两两正交,在信号处理、纠错编码和量子计算中有广泛应用。猜想认为,当矩阵阶数是 4 的倍数时,这样的矩阵一定存在,但至今仍未被完全证明。去年 Claude 只做到 64 阶版本,这次补上了最后一步,2000 阶以下的情形被全部扫清。

在被视为数学能力试金石的 Frontier Math 上,50 道开放题已解决 4 道,GPT 和 Claude 各占 2 道。Frontier Math 是由 EpochAI 创建的数学基准测试,包含数百道由专业数学家出题、尚无已知解答的开放性问题,被认为是衡量 AI 数学推理能力的最严格标准。此前 AI 模型在该测试上的通过率不足 2%,每解出一道都意味着 AI 真正参与了前沿数学发现。这个数字看似不多,但意义重大——这些都是此前尚无解的开放性问题。AI 在数学研究中的角色,正从检索和计算的「工具」,转变为能够参与推理协作的「队友」。
布林亲自下场:Gemini 竞赛白热化
人事层面的动向同样透露出竞争的紧迫感。谷歌联合创始人谢尔盖·布林近几个月一直敦促核心 AI 员工全力投入 Gemini 研发。今年 4 月 Anthropic 预览新模型并短暂领先时,布林在全员大会上明确要求 DeepMind 加快步伐。
Gemini 曾在去年 11 月短暂登顶,如今又落后,创始人亲自下场催进度,这一轮竞争的压力可见一斑。结合此前 Flash 系列三周一迭代的激进节奏,谷歌显然把大模型竞赛提升到了公司战略的最高优先级。
总结:AI 大厂竞争进入贴身肉搏阶段
从这一晚的密集动态可以看出,AI 大厂的竞争已经进入贴身肉搏阶段:谷歌用价格和迭代速度抢开发者,DeepSeek 用开源降低 Agent 门槛,OpenAI 用异构算力拉开推理速度差距,而 AI 在数学等硬核领域的突破则不断抬高能力天花板。
这种竞争格局与云计算市场的演进路径极为相似。当主流大模型在核心能力指标上差距不断缩小——GPT、Claude、Gemini 在代码生成、文本理解等通用任务上表现日趋接近——开发者的选择就不再取决于模型本身,而转向周边因素:API 稳定性、文档质量、SDK 覆盖度、社区活跃度、定价策略和迁移成本。正如当年计算资源成为标准化商品后,AWS、Azure、GCP 的竞争焦点转向了开发者工具链和生态系统,AI 行业也正在经历同样的转型:从「谁的模型最强」到「谁的开发者体验最好」。当模型能力趋于同质化,成本、速度、生态和开发者体验,正成为下一阶段真正的胜负手。
相关推荐

Spring AI 2.0实战:用Java构建智能Agent完整指南
深入讲解Spring AI 2.0核心更新,通过航空智能客服实战项目演示如何用Java构建AI Agent,涵盖Tools、MCP、Skill等关键技术,为Java开发者提供进入AI应用开发的完整路径。

Spring AI 2.0实战:手撸企业级代码助手Agent
深入解析Spring AI 2.0核心更新,通过Agent Utils工具库逆向Claude Code思路,从基础对话到完整Agent,逐步构建企业级代码生成助手。涵盖ReAct范式、Tools调用、MCP接入、长期记忆等关键技术。

MiniMax Code CLI实测:同模型对比Claude Code,工具链差异有多大
通过三个真实项目对比MiniMax Code CLI与Claude Code接入同一模型的产出差异,从安装配置到全栈项目实战,揭示CLI编程工具的工具链适配如何决定最终开发效率与代码质量。