GPT-5.6发布:三款新模型上线,Codex正式并入ChatGPT

一场凌晨的"较劲"
就在OpenAI发布会结束一小时后,Anthropic官方在凌晨2点01分紧急发布了一条帖子,将所有用户的5小时限额和每周限额全部清零重置。乍看之下像是在发福利,但对一下时间线就会发现端倪:OpenAI发布会凌晨1点刚刚落幕,一个小时后Anthropic就有此动作。
更耐人寻味的是,Codex负责人还专门跑到评论区挑衅:"I smell fear"(我闻到了恐惧的味道)。这场看似平静的产品发布,背后是两大AI巨头之间日趋白热化的竞争。那么OpenAI这次到底发布了什么,能把对手刺激成这样?
发布会的核心其实就两件事:GPT-5.6全新模型家族,以及一次重大的产品合并。
GPT-5.6:三款模型一次性发齐
OpenAI这次一口气推出了三款新模型,命名颇有深意:旗舰版 Soul(太阳的意识)、均衡版 Tola(地球的意识)、走量版 Luna(月亮)。日月星辰,一次到位。
细看命名逻辑,会发现这与Anthropic的三档体系(Opus、Sonnet、Haiku)如出一辙——明摆着是照着对手的分档方式来设计的。Anthropic的三档命名源自音乐术语(Opus意为"作品",Sonnet为十四行诗,Haiku为俳句),以文学体裁暗喻模型的能力层级,形成了相当清晰的品牌认知。OpenAI此番以天体命名对标,显然是在刻意打破对手已建立的心智优势。但这样的对标反而是件好事:OpenAI过去的命名一向以混乱著称,"o1 mini""o3 high"这类叫法让很多人根本分不清谁更新、谁更强。
命名规则终于收敛清晰
这次的命名逻辑终于有了统一标准:
- 数字代表代际:5.7一定比5.6更新、更强
- 名字定义档位:同一代里,Soul > Tola > Luna
- 跨代以数字为准
混乱了好几年的命名体系,现在总算理顺了。这对开发者和企业用户尤为重要——在构建生产环境时,模型版本的可预测性直接影响系统集成和成本规划的稳定性。
在规格方面,GPT-5.6上下文长度达到100万Token,最大输出12.8万Token。值得一提的是,100万Token的上下文窗口意味着可以一次性处理约75万字的文本——相当于同时"阅读"数十份完整的企业报告或整个中型代码库,这对长文档分析、大型项目重构等任务具有实质性意义。API价格方面,旗舰版Soul为5美元输入/30美元输出,较上代基本减半;走量版Luna仅需1美元输入/6美元输出。

跑分惊人:性能与成本双重领先
OpenAI这次主推了新基准 Agent Test: Last Exam(智能体的最终考试)。该测试衡量的不是单点做题能力,而是覆盖55个行业的长线程工作流——把AI当员工,让它持续执行任务,检验能否把事情做对、做完。
这一基准的设计思路代表了AI评测领域的重要转向。与MMLU(大规模多任务语言理解)、HumanEval(代码生成正确率)等传统静态基准不同,Agent Test: Last Exam模拟的是多步骤、跨工具调用、长时程的真实工作场景——AI需要自主制定计划、处理中间结果、应对意外状况,更接近企业实际部署AI Agent的复杂度。这类"过程性"评测正逐渐取代"知识点"评测,成为行业衡量模型实际价值的新标尺。
在这套测试中:
- Soul 得分 53.6 分
- Anthropic旗舰模型 Opus 4.5 得分 40.5 分
整整高出13分。但真正让对手感到压力的,不只是分数,还有价格。据实测分析,即便是中档的Tola和走量的Luna,也能跑赢对方旗舰,而成本仅为对方的十六分之一。同样的任务,人家一块钱搞定,你却要花十六块——这个差距确实难以弥补。
编程实测:一句话生成体感游戏
测试第一时间对GPT-5.6进行了实战验证,基于上期视频中的体感游戏项目做了拓展。此前用Codex 5.5制作的"坐姿监控"和"体感切水果"完成度不错,但"体感穿墙"和"双轮对打"体验一般。
切换到GPT-5.6后,仅凭极简的提示词、基本一轮对话,就完整生成了两款新体感游戏:
- 星河指挥家:站在摄像头前,通过挥手、下蹲、展开身体让星河重新连接,配有音乐伴奏
- 霓虹急跑(地铁跑酷类):左右摇摆身体切换跑道,举手跳跃、下蹲滑行、挥手击碎障碍物

实测表明,模型对任务的理解、规划和执行能力相当出色。游戏规则、画面、音效、体感识别全部一次性生成,完成度和可玩性都令人满意。这几款游戏已发布至GitHub,附有详细的部署文档。
重头戏:Codex与ChatGPT正式合并
这次发布会的另一大动作,是OpenAI将Codex和ChatGPT正式合并为一个App。Codex独立桌面应用直接下线,整体并入全新的ChatGPT桌面应用。
要理解这次合并的战略意义,需要了解Codex的技术演进路径。OpenAI的Codex最初于2021年作为专注代码生成的模型推出,是GitHub Copilot的底层引擎,彼时的核心能力是将自然语言注释转化为代码片段。经过数年深度迭代,它早已不是当初的代码补全工具——它积累了一整套Agent基础设施:如何将模糊的大任务分解为可执行的子步骤、如何在沙箱环境中安全运行代码、如何通过工具调用操控文件系统和浏览器界面,以及如何在数小时的持续任务中保持方向不偏移。这套能力体系,正是当前所有Agent产品最难啃的硬骨头。
更新后打开会发现,原来的Codex应用图标变成了一个问号。从ChatGPT App进入后,呈现全新入口页——原来的ChatGPT对话窗口被直接替换为Codex的对话窗口,二者界面几乎一模一样。原Chat对话窗口被折叠到左上角,可通过"Work"方式切换。

所有历史聊天记录,包括此前设计的自定义GPTs,全部被折叠隐藏进左侧聊天入口。可以看出,OpenAI对Codex模式的重视程度极高。对老Codex用户来说页面变化不大;但只用过ChatGPT的用户,可能需要一些时间重新适应。
从ChatBot到Agent:产品逻辑的根本迭代
这次合并背后的逻辑相当清晰,而理解它需要先厘清ChatBot与Agent的本质区别。传统ChatBot采用单轮或多轮对话模式:用户问、AI答,每次交互相对独立,AI本身不主动发起行动,也无法跨越对话边界去操作外部系统。而Agent(智能体)则具备完整的"感知-规划-行动"闭环:它能主动拆解目标、调用搜索引擎或代码执行器等外部工具、根据中间结果动态调整策略,并持续执行直到任务完成——整个过程中用户可以完全不介入。这不是量变,是范式的转换。
Codex长期深耕编程场景,已将一整套实战能力系统化提炼:大任务如何拆解、如何安全运行、如何操控电脑界面,甚至能持续执行数小时的任务而不跑偏。

OpenAI意识到,这套能力为什么只能用于写代码?做PPT、做报表、搭网站、跑流程,本质上调用的都是同一套引擎。所以更准确的说法是:不是把Codex"并入"ChatGPT,而是把Codex这台发动机装进了ChatGPT这个拥有最大流量入口的"车壳"里。名义上Codex被合并,实际上它成了整个产品的地基——ChatGPT从ChatBot正式升级为Agent。这是一次根本性的产品逻辑迭代。
收缩战线,为上市铺路
合并背后还有几个现实考量:
第一,算力资源有限。 GPU撑不起两条并行的产品线,与其让多个团队争夺资源,不如集中火力做一张牌。训练和运行大型语言模型所需的GPU集群成本极为高昂——据业内估算,GPT-4级别模型单次训练成本超过1亿美元,日常推理服务的算力消耗更是持续性支出。在融资尚未完成上市的阶段,资源集中化是维持竞争力的必要策略。
第二,抢占用户心智。 过去一年,Anthropic凭借出色的编程能力,在企业级市场的渗透率据称已反超OpenAI。加之近期Anthropic封号、限额问题频出,口碑有所受损;而Codex口碑持续爆棚。OpenAI趁此时机将Codex"扶正"为主入口,并向免费用户开放,意在用消费级流量抢占Agent市场的先机。
第三,为上市做准备。 发布会还带来一份"阵亡名单"——去年高调推出的AI浏览器Atlas已宣布逐步关停,满打满算活了不到一年。这也说明OpenAI正在主动收缩战线,将资源集中到统一的App生态中,为接下来的商业化和估值做铺垫。产品线的精简和用户数据的集中,也有助于向潜在投资者呈现更清晰的商业模式和增长故事。
竞争逻辑正在改变
看完这场发布会,最大的感受是:AI圈的竞争,正在从"谁更聪明"转向"谁能把聪明真正落地、用起来"。
模型就像发动机,产品才是车。发动机再强,最终买单的还是看车好不好开。调教得好、驾驭得好,就能用更简单的模型把事情干得更漂亮。OpenAI这次做的事情,本质上就是把最强的发动机塞进同一台车里,顺手把方向盘也换了——从"你问我答"升级成"你派活、我交付"。
至于这台车能否跑赢下一轮竞争,我们拭目以待。
核心要点
相关推荐

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。

匈牙利算法详解:原理、复杂度与工程实现指南
深入解析匈牙利算法(Hungarian Algorithm)的核心原理、O(N³)时间复杂度优势及工程实现方法。涵盖分配问题定义、算法步骤详解、Python/C++实用工具库推荐,以及在多目标跟踪、资源调度等场景中的应用实践。

Hermes Control Deck:用手机远程操控Codex的开源硬件控制台
Hermes Control Deck是一个开源微型控制台项目,支持通过实体按钮和手机远程界面控制Codex编程助手,提供会话恢复、实时状态监控、远程审批等功能,为AI编程交互带来全新体验。