GPT-5.6降价超20%:OpenAI、DeepSeek多模态等AI竞争全解析

OpenAI宣布GPT-5.6 Sol降价,幅度超20%
在8月22日的AI行业动态中,最引人关注的消息莫过于OpenAI宣布将在未来三个月内下调GPT-5.6 Sol模型的价格。此次降价不仅覆盖API调用费用,同时也包含订阅价格,下调幅度超过20%。
据日报披露,调整后的定价为每百万token输入4美元、输出20美元。在大语言模型的API定价体系中,token是计费的基本单位——一个token大约相当于英文中的0.75个单词或中文中的1-2个字符。不同模型采用不同的分词器(Tokenizer),如OpenAI使用的tiktoken基于BPE(Byte Pair Encoding,字节对编码)算法,将高频字符组合合并为单一token,这意味着同一段文本在不同模型中的token数可能存在差异,直接影响使用成本的计算。模型处理请求时,输入文本(prompt)和生成的输出文本分别按token计数,输出token通常比输入token更贵,因为生成输出需要逐token进行自回归推理,每生成一个新token都要重新计算注意力权重,计算开销更大。
值得进一步理解的是,输入输出价格比通常维持在1:4到1:5的水平,这一比例反映了底层推理架构中KV Cache(键值缓存)机制的影响——输入token可以并行处理并将注意力计算的中间结果缓存下来,而输出token必须串行生成,每个新token的生成都需要访问之前所有token的KV Cache,随着序列长度增长,内存带宽逐渐成为瓶颈。从硬件利用角度看,Prefill(预填充)阶段属于计算密集型(Compute-bound),GPU的算力利用率较高;而Decode(解码)阶段则是内存带宽密集型(Memory-bound),大量时间花在读取KV Cache而非实际计算上。这种异构需求是推理系统优化的核心挑战,也解释了为何输出定价显著高于输入。
这一价格调整体现了当前大模型市场竞争的激烈程度——随着开源模型和竞争对手的不断涌现,降低推理成本、提升性价比已成为头部厂商争夺开发者与企业客户的核心策略。
你可能没注意到,对于现有的Pro、Plus等订阅方案用户,使用方式保持不变,这意味着OpenAI在推进降价的同时,力图保持存量用户体验的稳定性,避免因价格结构调整引发用户困惑。

降价背后的市场逻辑与技术支撑
GPT-5.6 Sol的降价并非孤立事件。从行业视角看,模型能力趋于同质化的当下,价格战成为不可回避的竞争手段。当API成本降至更亲民的水平,开发者的接入门槛随之降低,进而扩大整个生态的用户规模——这是典型的以量换价、以生态换市场份额的打法。
值得注意的是,降价的底气来自于推理效率的持续优化:包括模型蒸馏、量化压缩、推测解码(Speculative Decoding)等技术的成熟,使得单次推理的算力成本在过去一年中下降了数倍,为商业层面的价格下调提供了技术支撑。具体而言,模型蒸馏(Knowledge Distillation)是指将大模型的知识压缩到更小的模型中,通过让小模型学习大模型的输出概率分布,保留大部分能力的同时大幅降低计算需求。量化压缩(Quantization)则是将模型参数从高精度浮点数(如FP32,32位浮点数)降低到低精度表示(如INT8或INT4),减少内存占用和计算量,在精度损失极小的情况下将推理速度提升2-4倍。推测解码(Speculative Decoding)使用一个轻量级的"草稿模型"快速生成候选token序列,再由大模型批量验证,从而将自回归生成的串行瓶颈转化为部分并行操作,推理速度可再提升2-3倍。
这些技术并非孤立使用,现代推理系统通常采用多层优化栈协同工作:硬件层面使用定制推理引擎(如NVIDIA TensorRT-LLM优化、AMD的ROCm生态)充分利用芯片特性;系统层面采用连续批处理(Continuous Batching)和分页注意力(PagedAttention,由vLLM项目开创),将显存管理从固定分配转为按需分页,类似操作系统的虚拟内存机制,显存利用率可提升3-5倍;算法层面则结合上述蒸馏、量化和推测解码。这种全栈优化的叠加效应使得过去18个月内每token的推理成本下降了约10倍,为商业降价创造了充足空间。
Codex活跃用户突破2000万,安全扫描功能上线
OpenAI旗下的编程助手Codex同样带来了多项好消息。Codex负责人Typo宣布,为庆祝活跃用户突破2000万人这一里程碑,官方将为所有用户提供一次可存储并随时使用的额度重置机会,并预告稍后将分享更多利好消息。

2000万活跃用户的规模,充分说明AI编程工具已从早期尝鲜阶段进入规模化应用阶段。回顾AI编程辅助工具的发展,其经历了三个明确的阶段:第一阶段是简单的代码补全(如早期的TabNine),基于统计语言模型预测下一行代码;第二阶段是基于大语言模型的上下文感知编程助手(如GitHub Copilot、Cursor),能够理解项目结构、开发意图乃至整个代码仓库的上下文;第三阶段正在形成,即具备自主代码生成、测试、调试和部署能力的AI编程代理(Coding Agent)。Codex的2000万活跃用户规模表明市场已牢固进入第二阶段,并开始向第三阶段过渡。
值得注意的是,"活跃用户"与"付费用户"是不同指标,前者包含免费层用户,但如此大规模的活跃使用本身即构成强大的数据飞轮效应——更多用户使用产生更多反馈数据,驱动模型持续优化,优化后的模型又吸引更多用户。具体来说,当开发者接受或拒绝AI的代码建议时,这些隐式反馈信号(Implicit Feedback)被收集用于RLHF(基于人类反馈的强化学习)或DPO(直接偏好优化)训练。编程助手的反馈数据维度极为丰富:包括补全接受率、编辑距离(用户对建议的修改幅度)、代码存活率(建议代码在后续提交中是否被删除或重写)等多维信号,这些都构成了高质量的训练数据来源。
开发者对AI辅助编程的依赖程度持续加深,这也解释了为何各大厂商纷纷在编程工具上加码投入。作为参考,GitHub Copilot在2024年初公布的付费用户数约为130万,而整个AI编程辅助市场在不到两年内实现了用户量级的跨越式增长,反映出这一工具已从"锦上添花"变为开发者日常工作流的核心组成部分。值得关注的是,编程助手的商业模式也在演进——从单纯的固定月费订阅制向基于消耗的混合计费模式转变:简单的单行补全按固定月费覆盖、复杂的多文件重构和代理任务按实际token消耗计费,这与云计算从预付费向按量付费的历史演进路径高度一致。
Codex Security安全扫描功能详解
除用户激励外,Codex还宣布其Codex Security安全扫描功能已支持在Mithos 5中使用。该功能可调用Anthropic旗下最强大的安全模型,为代码库扫清安全隐患。目前已面向Enterprise企业用户以公测形式开放。
这一点颇具看点:OpenAI的产品集成了竞争对手Anthropic的安全模型,反映出在AI安全这一关键领域,厂商之间存在跨阵营的能力互补。Anthropic以Constitutional AI(宪法AI)方法论和对AI安全研究的深度投入著称,其模型在识别有害内容、检测代码安全漏洞等方面具有差异化优势。这种跨阵营合作在科技行业并非罕见——类似于苹果设备默认使用Google搜索、竞争对手共同参与开源标准制定。在AI安全领域,这种合作可能预示着安全评估将从各家自建转向行业共建,因为安全能力的提升是非零和博弈:一家模型的安全漏洞可能损害整个行业的公众信任。
传统的静态应用安全测试(SAST,Static Application Security Testing)工具基于规则匹配和数据流分析,通过预定义的漏洞模式库逐行扫描源代码,容易产生大量误报(False Positives,即将正常代码误判为安全漏洞)且难以理解复杂的业务逻辑漏洞。与之互补的动态应用安全测试(DAST)则在运行时检测漏洞,但覆盖面受限于测试用例的完整性。而基于大语言模型的安全扫描代表了第三种范式——它能够理解代码的语义意图和业务上下文,识别包括SQL注入、跨站脚本(XSS)、不安全的反序列化、权限绕过、敏感数据泄露、供应链攻击等深层次安全问题。更重要的是,LLM驱动的安全扫描能够生成人类可读的漏洞解释和修复建议,而非仅仅抛出一个告警编号。这种AI原生的安全审计方式,正在成为企业级代码安全保障的新标准。对于企业级用户而言,代码安全审计正成为AI编程工具不可或缺的能力配置。
DeepSeek推出多模态模型V4 Flash Vision
在开源与国产模型阵营,DeepSeek推出了多模态模型DeepSeek V4 Flash Vision EXP。作为一款实验版模型,它在文本与多模态任务中均表现优异。

多模态模型是指能够同时处理和理解多种数据类型(如文本、图像、音频、视频)的AI模型。与纯文本模型不同,多模态模型需要将不同模态的信息映射到统一的表征空间中,通常通过视觉编码器(如ViT,即Vision Transformer)将图像切割为固定大小的图块(Patch),每个图块经过线性映射后转化为一个token,再与文本token一起送入Transformer架构进行联合推理。当前主流的多模态融合方案主要有三种路径:早期融合(Early Fusion)在输入阶段即统一编码;交叉注意力融合(Cross-Attention Fusion)在Transformer的中间层通过交叉注意力机制实现模态交互;适配器融合(Adapter Fusion)则通过轻量级适配器模块将视觉特征注入预训练的语言模型。
DeepSeek作为以MoE(Mixture of Experts,混合专家)架构著称的模型系列,其多模态版本在架构设计上具有天然优势。传统Dense(稠密)模型处理每个token都需要激活全部参数,而MoE架构通过门控网络(Gating Network)为每个token只激活一小部分专家网络(通常是数百个专家中选择少量几个),使得模型可以拥有极大的总参数量(决定知识容量)但实际推理时只使用一小部分(决定计算成本)。DeepSeek V3已展示了在671B总参数下仅激活37B参数的高效推理模式。在多模态场景中,视觉token和文本token的特征分布差异较大,MoE的路由机制可以自然地学会将不同模态的token分配给擅长处理该模态的专家网络,实现模态专业化而无需显式设计分支结构——这可能是DeepSeek多模态版本在效率和效果上取得平衡的关键。
"Flash"命名通常暗示其采用了推理加速优化技术,如FlashAttention等高效注意力计算方法。FlashAttention通过对注意力计算进行分块(Tiling)处理,减少GPU高带宽内存(HBM)与片上SRAM之间的数据搬运次数,在保持数学等价性的同时将注意力计算速度提升2-4倍,显存占用从序列长度的二次方降低到线性级别。这意味着Flash系列模型在保持模型性能的同时显著降低推理延迟和显存占用,尤其适合处理包含大量视觉token的多模态输入场景——一张高分辨率图像经ViT编码后可能产生数百甚至上千个视觉token,如果没有高效的注意力计算机制,多模态推理的延迟和成本将急剧上升。
据介绍,该模型不仅在多模态能力上有所突破,在纯文本能力方面相较于此前的V4 Flash 0731版本也实现了一定进步。目前该模型已上线DeepSeek API平台,供开发者调用。
官方工具链同步升级
配合模型发布,DeepSeek Harness团队宣布新增官方多模态支持,支持原生普遍请求,同时提升了运行稳定性与整体使用体验。用户将版本更新至V0.1.1 RC.1即可体验新功能。

模型能力与配套工具链的同步升级,体现出DeepSeek在构建完整开发者生态上的清晰思路——单纯的模型能力已不足以形成护城河,稳定易用的工具链才是留住开发者的关键。在AI行业中,"工具链"(Toolchain)指围绕核心模型构建的一整套开发支持体系,包括SDK(软件开发工具包)、CLI工具(命令行接口)、调试环境、文档系统、模型微调框架、部署工具、监控面板等。
历史经验表明,开发者生态的粘性往往不在于模型本身,而在于围绕模型构建的工具链完善程度——类似于iOS和Android的竞争核心并非操作系统本身,而是各自的开发者生态。亚马逊AWS的成功同样印证了这一逻辑:早期的云计算厂商在基础设施能力上差异不大,但AWS凭借最完善的工具链、最丰富的文档和最活跃的社区,建立了难以撼动的市场地位。DeepSeek Harness作为官方工具链,提供标准化的模型调用接口和多模态支持,降低了开发者的集成成本,这是从"模型提供商"向"平台型公司"转型的关键一步。
匿名模型OS Alpha登顶调用量榜首
本期日报还提到一则耐人寻味的消息:匿名模型OS Alpha在社区引起广泛讨论。据OpenCode透露,该模型推翻了DeepSeek连续56天的调用量榜首地位,昨日调用量达到2.6T。在OpenRouter平台上,其单日调用量达1.99T,排名全球第一。
OpenRouter是一个统一的AI模型API聚合平台,开发者可以通过单一接口调用来自OpenAI、Anthropic、Google、Meta等多家厂商的模型,无需分别接入各家API。平台提供标准化的调用统计和性能排名,使其成为衡量模型实际市场热度的重要风向标——类似于移动应用领域的App Store排行榜,但衡量的是开发者和应用对模型的真实调用需求而非终端用户下载量。
匿名模型登顶调用量榜首这一现象背后,涉及AI行业一套成熟的灰度发布方法论。除OpenRouter外,LMSYS Chatbot Arena也是重要的匿名测评平台,采用ELO评分系统(源自国际象棋等级分制度)让用户在不知道模型身份的情况下进行盲评。这种机制的核心价值在于消除"品牌锚定效应"——研究表明,当用户知道模型来自顶级厂商时,评分会系统性地偏高5-15%。然而这种机制也有其局限:调用量排名反映的是开发者群体的偏好,可能存在价格敏感性偏差(便宜的模型调用量天然更高)、任务类型偏差(编程任务在OpenRouter上占比过高)和采样偏差(OpenRouter用户不代表整体市场)。因此,调用量榜首需要结合质量评分、用户留存率和付费转化率综合解读。
2.6T的调用量(T即Trillion,万亿)意味着该模型在单日内处理了约2.6万亿个token,这不仅反映了模型的受欢迎程度,也暗示其背后有强大的推理基础设施支撑——处理如此规模的调用量,保守估计需要数万张高端GPU(如NVIDIA H100或更新的B200)持续运行。社区猜测该模型可能来自即将发布新版本的头部厂商,因为只有少数组织具备支撑如此规模调用的算力储备。匿名发布策略本身也具有战略价值:厂商可以在正式发布前收集大规模真实场景数据,验证模型在生产环境而非合成Benchmark中的实际表现,同时制造市场话题。当匿名模型在调用量上击败已知强者时,往往意味着其在实际体验上已获得开发者社区的自发认可,这比任何官方benchmark都更具说服力。
此外,OpenCode还宣布在其套餐中加入V4 Flash多模态模型,目前已可用,并建议用户升级至最新版本。
总结:AI竞争进入价格、生态、安全多维度较量
综合本期动态可以看出,当前AI行业的竞争已从单一的模型能力比拼,演变为价格、生态、安全、工具链等多维度的综合较量。OpenAI以降价巩固市场、以用户里程碑强化生态;DeepSeek以多模态突破补齐能力短板;匿名模型的异军突起则预示着新一轮竞争的开始。
对于开发者和企业用户而言,这样的竞争格局无疑是利好——更低的成本、更强的能力、更完善的安全保障,正在成为AI应用落地的坚实基础。从更宏观的视角看,AI行业正在经历类似云计算早期的发展轨迹:先是技术突破驱动的能力竞赛(2022-2023年,以GPT-4为代表的模型能力飞跃),继而是价格战推动的市场普及(2024-2025年,各厂商竞相降价、开源模型快速追赶),最终将走向以生态完整度和企业级可靠性为核心的成熟竞争阶段——届时,SLA(服务等级协议)承诺、数据隐私合规、模型可解释性、长期技术支持等"软实力"将取代单纯的模型性能,成为企业客户选择AI供应商的决定性因素。我们正处于从第二阶段向第三阶段过渡的关键节点。
核心要点
核心要点
核心要点
相关推荐

MCP新版本发布:无状态协议如何重塑AI工具调用架构
MCP(Model Context Protocol)新版本引入无状态协议设计,带来更强可扩展性与可靠性。9月9日五小时免费直播,核心维护者与开发团队深度解析MCP协议演进、服务器构建实践与AI智能体生态。

Fable 5 对决 Opus 5:AI 生成 2D 精灵图实测对比
通过相同提示词对比 Claude Fable 5 与 Opus 5 生成 2D 骑士精灵图的实测结果,从文件数量、动画组数、技术实现到成本全面分析两款 AI 模型在游戏美术生成上的差异与各自优势。

750美元从零训练3个LLM:一位开发者的实战复盘
一位开发者花费750美元从零训练了3个大语言模型,涵盖SwiGLU、GQA、KV缓存等现代架构技术迭代,并分享了预训练、SFT微调、GRPO强化学习的实战教训与五条关键工程经验。