AI一周复盘:四大厂集体降价,Copilot付费转化率仅4.5%

引言:AI行业迎来密集事件周
过去一周,AI行业发生了一连串重磅事件——OpenAI公开发布GPT-5.6家族、xAI推出Grok 4.5、谷歌Gemini 3.5 Pro延期、微软Copilot转化数据曝光,以及DeepSeek旧API即将退役。相比任何单一的基准测试成绩,这一周最值得关注的信号是:近前沿推理成本在四家厂商同时下降,这将实质性改变哪些任务在经济上值得被自动化。
所谓「近前沿推理」(near-frontier inference),指的是性能接近当前最顶级模型、但成本已大幅下降的推理服务。其背后有一套清晰的经济学逻辑:AI自动化是否值得部署,本质上取决于「模型调用成本」与「任务产生价值」之间的比值。与传统软件自动化不同,大模型推理的成本结构是每次调用都产生边际成本,且与任务复杂度(token消耗量)正相关——这意味着存在一条「自动化经济线」,只有当单次调用成本低于人工处理成本的某个临界比例,规模化部署才具备商业可行性。
值得注意的是,这一成本结构与传统SaaS授权费用有本质区别:传统SaaS是固定订阅制,边际调用成本趋近于零;而大模型推理按token计费,意味着使用量越大、成本越高,企业在规模化部署前必须精确测算每个业务场景的token消耗量与产出价值比。当每百万token的价格从数十美元降至个位数,文档审查、代码生成、客服回复等原本需要人工完成的任务,其自动化ROI会发生质变:原本处于临界点以下的场景(如每日处理数万份中等复杂度文档)将突然跨越盈亏平衡点,引发部署需求的非线性增长——这也是为何业界将本周的集体降价视为「行业拐点」而非普通促销。
本文基于OpenAI、xAI、Meta官方博客,以及Euronews、Bloomberg、TechCrunch、CNBC等媒体的本周报道进行梳理与分析。
OpenAI GPT-5.6家族:三款定位各异的新模型
OpenAI在7月9日结束有限合作伙伴预览后,正式向公众发布了GPT-5.6家族,包含三款定位不同的模型:
- Sol:面向前沿推理场景;
- Terra:以约1/2的成本提供上一代旗舰性能;
- Luna:主打快速与低成本。
除文本模型外,OpenAI还推出了GPT-Live-1,这是一款支持全双工的语音模型。与传统「半双工」语音AI不同——后者必须等用户说完才开始处理,处理完才能回复——全双工(Full-duplex)模型能够同时进行音频输入和输出的处理,支持实时打断、插话和情绪感知,从根本上改变了人机对话体验。
全双工语音交互在技术层面需要解决几个核心挑战:回声消除(模型在输出音频的同时接收输入,自身发出的声音会被麦克风重新拾取形成干扰环路)、打断处理逻辑(实时判断用户插话是「有意打断」还是「背景噪声」),以及流式推理架构(在接收到不完整的用户输入时就开始生成响应)。
从系统架构角度看,这一挑战比表面更深:传统语音AI采用「ASR(语音识别)→LLM(语言模型)→TTS(语音合成)」三段式流水线,每个环节串行处理,延迟叠加往往超过2秒;而真正的全双工需要将音频编码器、语言模型和音频解码器整合为一个端到端的流式系统,使「感知」与「生成」能够并行运行。此前GPT-4o虽支持语音模式,但底层仍是串行的「听→想→说」流程;这意味着人机交互可以从「语音版文字输入」升级为真正的「实时对话代理」,对客服、陪伴、实时翻译等场景具有重要意义。同时上线的 gpt-realtime-2.1 将 p95 延迟(即95%的请求响应时间)降低约25%,进一步减少绝大多数用户在实际使用中感受到的「卡顿」。
Terra以「旗舰性能、腰斩成本」为卖点,是本周大模型降价浪潮的关键一环。
xAI Grok 4.5:加入降价竞赛,独立评测待验证
xAI发布了Grok 4.5,据称与Cursor协同训练,定价为输入每百万token 2美元、输出每百万token 6美元。官方宣称其在编程、法律、金融等任务上达到了Opus级别的表现。
不过需要谨慎看待:目前尚无第三方独立评测数据。在结果落地之前,「对标顶级模型」更多是厂商的市场定位,实际能力仍有待检验。但从定价看,Grok 4.5已明确加入这一轮降价竞争。值得关注的是「与Cursor协同训练」这一细节——这暗示xAI可能采用了针对特定工具使用场景的强化学习微调策略,类似于DeepSeek在数学推理上的专项训练路径,而非单纯的通用能力提升。这类面向特定工作流的训练方式,在垂直场景评测中往往能产生超出参数规模预期的表现,但在跨领域泛化上则存在不确定性。
谷歌的动荡:Gemini 3.5 Pro延期与人才流失
谷歌将Gemini 3.5 Pro的发布推迟至7月17日,官方称这是一次完整的架构重建,将支持200万token的超长上下文窗口。200万token意味着模型可以在一次调用中处理约150万个英文单词——相当于整部《战争与和平》约10倍的篇幅,对法律文档全文审查、超大型代码库分析等场景具有突破性意义。
架构重建的核心目标之一,正是解决超长上下文中普遍存在的「注意力稀释」问题。Transformer的自注意力机制(Self-Attention)在理论上能够关注序列中任意位置的信息,但在实践中存在显著的位置偏差——模型对位于序列头部和尾部的内容有更强的记忆保留,而对中间段落的关注度显著下降,这一现象被斯坦福研究者命名为「lost in the middle」效应。对于200万token的超长上下文,若将整份法律合同塞入上下文,关键条款可能因位于文档中部而被模型「忽视」——这使得超长上下文是否真正可用(而非只是参数上的数字游戏)成为此次架构重建能否成功的核心考验。
更值得警惕的是人才层面的震荡:一周之内,四位资深DeepMind研究员相继离职——Shazeer加入OpenAI,Jumper、Adler、Pritzel转投Anthropic。其中Noam Shazeer是2017年划时代论文《Attention Is All You Need》的联合作者之一。理解这篇论文的意义需要了解它所取代的技术:此前主流的LSTM(长短期记忆网络)虽能处理序列数据,但梯度在时间步上的反向传播会逐渐消失(梯度消失问题),有效上下文长度受到严重限制;Transformer通过自注意力机制允许序列中任意两个位置直接计算相关性,从根本上消除了这一限制,同时高度并行化的计算图使其能充分利用GPU算力——正是这两个特性的结合,为后来GPT-3、PaLM等超大规模训练奠定了技术基础。Shazeer此后在稀疏混合专家模型(MoE)领域的贡献也已被GPT-4、Gemini等主流模型广泛采用。顶级AI研究员的流动之所以敏感,在于他们不仅带走个人能力,更带走了对前沿方向的判断力和未发表的研究思路——这类「元认知」层面的能力,才是真正难以替代的核心资产。受此影响,Alphabet市值一度蒸发约2250亿美元,折射出资本市场对「人才即护城河」这一判断的高度认可——在AI领域,顶级研究员的流向往往被视为技术竞争格局变化的先行指标。
微软Copilot:4.5%转化率的市场警示
微软计划在8月前将旗下多个Copilot应用整合为统一产品。但本周最具启示意义的数据是:在4.5亿M365席位中,转化为付费Copilot的比例不足4.5%。
这个数字揭示了AI产品化的核心矛盾,也折射出企业软件采购的深层逻辑:企业预算审批需要可量化的ROI证明,而通用AI助手的价值往往是弥散性的效率提升,难以在财务报表中显现。对比来看,GitHub Copilot在代码补全场景的企业采用率显著高于通用Copilot——正是因为「减少开发者查文档时间」这一价值可以被工程团队清晰量化。
「能做所有事」与「把一件事做好」之间的张力由此可见:通用助手的价值主张是「降低信息处理的边际成本」,但企业付费的逻辑是「解决具体的、可量化的业务痛点」。当一款工具的卖点是「帮你写邮件、总结文档、生成PPT」,用户很难在预算审批中说清楚ROI。相比之下,专注于特定工作流(如合同审查、代码补全、客服自动化)的垂直AI工具,往往更容易打通「价值感知→付费决策」的链条。这与许多从业者的观察一致——市场真正的需求在于任务专用型自动化,而非「什么都能帮一点」的泛用助手。对服务中小企业客户的开发者而言,这一判断尤为值得重视。
Meta与开源生态:Muse Image与Ollama融资
Meta发布了超级智能实验室(Superintelligence Labs)的首个模型Muse Image——一款具备Agent能力的图像生成模型,能够调用搜索、代码等工具并进行自我优化。该模型默认基于公开的Instagram照片训练(可选择退出),再次引发数据授权与隐私的讨论。
开源领域同样活跃:
- Ollama 完成6500万美元B轮融资,月活开发者达890万——这一规模表明本地推理已从极客小众走向主流开发者群体,Ollama正成为本地大模型运行生态的基础设施层;
- Gemma 4 通过多token预测(multi-token prediction)技术,在Apple Silicon上于Ollama中运行速度提升约90%。
多token预测(MTP)是Meta提出的训练范式改进:传统自回归语言模型每次只预测下一个token,在推理时必须串行执行N步才能生成N个token;MTP通过在训练时引入额外的预测头(prediction head),让模型同时学习预测未来2到4个token,从而在推理阶段实现一定程度的并行化。这一思路与推测性解码(Speculative Decoding)有异曲同工之处——后者通过小模型预生成草稿、大模型并行验证的方式提升吞吐量,而MTP则将并行预测能力内化到模型训练本身,减少了对额外草稿模型的依赖。
Apple M系列芯片的统一内存架构(UMA)则解决了另一个瓶颈:传统PC架构中CPU内存与GPU显存是物理隔离的,大模型权重需要在两者之间频繁搬运,这一带宽瓶颈在推理时尤为显著;UMA将CPU与GPU共享同一块高带宽内存池,彻底消除了数据传输延迟,使本地运行70B以下参数量的模型成为可行选项。两种技术的叠加,正是此次速度提升约90%的底层原因。
本地推理与端侧优化的持续进步,正让开源模型在成本与性能上更具竞争力。
开发者注意:DeepSeek旧API 7月24日退役
对使用DeepSeek的开发者,一个重要提醒:deepseek-chat 与 deepseek-reasoner 将于7月24日正式退役。
官方提供了一行代码的迁移方案,但有个细节需注意:deepseek-reasoner 默认映射到的是 v4-flash 的 thinking 模式,而非 v4-pro。重度推理工作负载不应盲目信任别名映射,应显式切换到 v4-pro,以避免性能落差。
这也是一个关于工程架构的重要提醒——抽象你的模型层。所谓「抽象模型层」,源自软件设计中的依赖倒置原则(Dependency Inversion Principle):高层业务逻辑不应直接依赖低层实现细节,而应依赖抽象接口。在大模型应用开发中,LiteLLM是当前最主流的开源实现之一,它提供了统一的OpenAI兼容接口,后端可无缝切换至Anthropic、Google、Cohere、本地Ollama等数十个供应商,切换时业务代码零修改;LangChain和LlamaIndex也提供了类似能力。
采用这类抽象层还带来另一个工程优势:在当前模型迭代周期以月为单位的行业背景下,能够便捷地对不同模型进行A/B测试,将性能评估与成本核算纳入常态化的工程流程。模型可插拔性已从「nice to have」变为生产环境的基本工程要求——DeepSeek此次退役事件,正是硬编码模型别名所带来风险的典型警示:任何直接依赖特定模型名称字符串的生产代码,都隐含着一个不可控的单点故障。
分析:降价潮的意义远超跑分
本周最核心的判断是:Terra、Grok 4.5引入定价同时降价,其意义远超任何单一基准成绩。
当近前沿推理成本在一周内于四家厂商同时下探,「哪些任务在经济上值得自动化」的边界随之改变。过去因成本过高而无法规模化的场景,如今可能突然变得可行。这一变化在数学上可以理解为:当token单价下降50%,原本ROI为0.8(低于部署阈值)的场景,其经济可行性可能直接跃升至1.6,触发从「不值得做」到「必须做」的跳变——而非线性的渐进改善。
另一边,微软4.5%的转化率与降价潮形成鲜明对照:技术能力和成本都在改善,但通用助手依然卖不动。市场的真实信号是——为具体任务提供确定性的自动化价值,才是当前AI落地的主线。
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。