GPT 5.6+Codex深度实测:三档模型与Ultra模式全解析

OpenAI近日更新了Codex并上线了全新的GPT 5.6模型。与以往仅区分标准版和Pro版不同,这次更新在模型分级、思考档位、上下文长度以及Agent自主循环能力上都有明显变化。本文基于B站UP主一整天的实测体验,梳理GPT 5.6的核心升级与实际使用感受。
全新三档模型分级:Sol、Terra、Luna
此次GPT 5.6最大的结构性变化,是引入了类似Anthropic Claude家族(Opus/Sonnet/Haiku)的三档分级体系。三个档位分别以天体命名,能力从高到低依次为:
- Sol(太阳):最高级档位,对标之前的GPT 5.5,也可类比市面上的Fable 5。
- Terra(地球):中间档位,能力大致相当于此前的GPT 5.5。
- Luna(月亮):最经济的档位,主打低成本调用。
模型分级体系的行业背景:这种分层设计已成为主流大语言模型厂商的标配策略。Anthropic率先以Opus/Sonnet/Haiku三档命名,对应「强力旗舰/均衡主力/轻量快速」的梯度设计;Google则以Gemini Ultra/Pro/Flash/Nano构建四档体系;Meta的Llama系列同样按参数量划分出多个规模档位供开发者按需选用。这一设计趋势的技术根源在于:模型规模(参数量)与推理成本之间存在超线性关系——将模型参数量翻倍,推理延迟与算力开销的增长往往远超两倍。因此,单一模型无法同时满足「极致性能」与「低成本高并发」两种截然不同的需求场景。通过分级,厂商可以在同一产品线下覆盖从企业级复杂推理到终端设备轻量推断的全谱系用例,开发者也能根据任务复杂度动态选择,在准确率与Token开销之间实现精细权衡。
从API定价来看,这套体系明显是在对标Claude。标准GPT 5.6定价与GPT 5.5保持一致;Terra为每百万输出15美元、Luna为6美元;Sol定价为每百万输出30美元,相比Fable 5的50美元更具性价比。实测认为,Sol与Fable 5能力差距不大,但尚未完全追平Fable 5的最强水平。
这套分级体系的核心价值在于:开发者可根据任务复杂度灵活调配模型。需要精细推理时用Sol,将Terra或Luna作为子Agent调用,在保证效果的同时显著压缩Token开销。

Ultra思考档位:更激进的子Agent协同
除模型分级外,GPT 5.6在思考强度上同样新增了一个档位。此前Codex的思考强度最高只能调到Extra High,现在多了Ultra档位。
Ultra模式的核心逻辑是:非常积极地调用多个子Agent协同执行任务,走的是Dynamic Workflow路线——与Claude Code中的Ultra模式思路相近。
Dynamic Workflow与子Agent协同架构:Dynamic Workflow(动态工作流)是Agent系统架构的一种重要范式,与之相对的是Static Workflow(静态工作流)。静态工作流在执行前预定义好全部步骤,适合流程固定、输入输出格式可预期的场景,优点是可预测性强、便于调试;动态工作流则允许主Agent在运行时根据中间结果实时决定是否拆解子任务、调用哪些子Agent以及以何种顺序执行——本质上是把「规划」与「执行」融为一体的自适应调度。在这种架构中,主模型充当编排者(Orchestrator),将复杂编程任务分解为可并行或串行的子任务,交由能力更轻量的子Agent分别执行,主模型负责汇总与校验最终结果。这种架构的突出优势是能够处理需求模糊、中途需要反馈的复杂任务,但代价是Token消耗呈乘数级扩大——因为每个子Agent都需要独立的上下文窗口与推理开销,而主模型还需为所有子任务的输出进行二次阅读与整合,实际总消耗往往是单次直接执行的数倍甚至数十倍。
在Codex中,Ultra模式下模型会主动拆解并推进更多子任务以提升整体效率,代价是Token开销明显上升。值得关注的是,子Agent的触发逻辑也随之改变。此前Codex的提示词明确规定,用户不主动要求则不触发子Agent;现在即便用户没有明确指令,Codex也会主动调用子Agent推进任务,界面上还为不同子Agent增加了带图标的新UI设计。

上下文扩容与自主循环能力增强
在上下文长度方面,GPT 5.6在Codex内的可用上下文从GPT 5.5的约26万Token提升至约35万,增加了近10万。
上下文长度与Token经济学:上下文长度(Context Window)是大语言模型单次能「记住」并处理的文本总量,以Token为单位计量(中文约1字≈1.5Token,英文约0.75词≈1Token)。从GPT-3的4K到GPT-4的128K,再到如今GPT 5.6在Codex中提供的约35万Token,上下文的扩张直接决定了模型能处理多大规模的代码库或文档——35万Token大约相当于一次性读取并理解一个中等规模开源项目的全部源代码。然而,更长的上下文并非没有代价:Transformer架构的自注意力机制(Self-Attention)计算复杂度与序列长度呈二次方关系,即上下文翻倍会导致Attention矩阵的计算量增长到原来的四倍,推理延迟与显存占用同步大幅上升。近年来虽有FlashAttention、稀疏注意力(Sparse Attention)等工程优化手段一定程度上缓解了这一瓶颈,但在百万Token量级下仍面临显著的算力压力。这也是为何Codex尽管模型API本身支持100万Token上下文,却对订阅用户设置35万上限——这是在用户体验流畅度、成本控制与功能完整性之间取得的工程妥协。提一嘴,模型在API层面本身支持100万上下文,Codex目前仍未向订阅用户开放全量额度。
更值得关注的是自主循环能力的提升。以往需要通过特定指令反复提醒Codex「持续循环直到达成目标」,而现在只需交给它一个任务,即便不开启相关模式,也能自主持续运行两三个小时,对目标的理解与工具调用都更加准确。
Skill调用能力同样有明显进步。当用户配置了三四十个甚至更多Skill时,GPT 5.5面对职责重叠的Skill往往「不知所措」,甚至一个都不用;GPT 5.6则能更积极、更准确地从中挑选合适的Skill执行。这一改进在技术上与模型对「工具选择」(Tool Selection)任务的指令跟随能力提升密切相关——当可用工具数量膨胀时,模型需要在有限的注意力资源下完成工具描述的语义对齐与候选排序,属于典型的「长列表理解」挑战,GPT 5.6在此场景下的表现明显更稳健。
修复「对话写入产物」的关键痼疾
在本次升级中,实测认为最重要的改进是修复了GPT 5.5长期困扰用户的严重问题:模型会把本该反馈给用户的对话内容,直接写进交付产物里。
「对话写入产物」问题的技术根因:大语言模型在生成结构化产物(如代码、HTML、文档)时,面临「元层级混淆」(Meta-level Confusion)的经典挑战:模型需要同时维护两种截然不同的输出模式——面向用户的自然语言解释层,以及面向机器执行的结构化内容层。当模型对「当前应在哪个层级输出内容」判断失准时,就会将本属于对话层的描述性语言渗透进产物层,形成「对话写入产物」问题。从技术根源看,这通常源于RLHF(基于人类反馈的强化学习)训练阶段对输出边界的奖励信号设计不够精确——人类标注者在评分时可能对「内容大体正确」的输出给出较高分,而忽视了「描述性文字混入代码」这类细粒度的格式违规。修复此类问题需要专门构造针对性的对比数据对(正确格式示例 vs 格式越界的错误示例),并通过额外的监督微调(SFT)轮次强化模型对输出边界的判断,是模型对齐工程中技术上颇具挑战性的细节任务,往往需要数轮迭代才能彻底消除。
举个典型例子:让它制作一个「蓝色配色、简约极客风格」的页面时,GPT 5.5会把「这是一个蓝色极客风格的网站」这类面向用户的描述,直接嵌入HTML代码中——这也是其此前写文档和做前端效果差的主要原因之一。经过一整天实测,GPT 5.6在写文档和输出HTML的过程中均未再复现此类问题。

在设计能力上,GPT 5.6相比前代也有所提升,但仍保留了一些固有风格偏好:喜欢字重大、行高小、对比度强的非主流排版,偏爱米色或灰色背景,并常叠加网格纹理与绿色渐变。整体而言,设计风格已比以前顺眼许多,但个性化倾向尚未完全消除。
额度消耗显著加快,需提前规划用量
虽然GPT 5.6的API价格与GPT 5.5相同,但实测中发现订阅额度的消耗速度明显加快。以往很难在5小时内用完的额度(200美元档),如今放一个任务跑一两个小时就能耗尽。仅一天时间,周额度就消耗了26%,远超以往水平。

订阅额度与API定价的差异逻辑:AI模型的订阅套餐(如ChatGPT Pro的200美元/月)与按量计费的API定价之间存在结构性差异。订阅套餐本质上是一种「算力预购+折扣捆绑」模式:厂商预先估算订阅用户的平均使用量,以低于API单价的折算比例提供额度,并依赖用户使用分布不均匀(轻度用户的剩余额度补贴重度用户的超额消耗)来维持整体商业平衡——这与健身房会员卡的盈利逻辑如出一辙。当模型升级带来更积极的Token消耗(如Ultra模式的多Agent拆解、更长的上下文处理)时,厂商在维持API价格不变的前提下,实际上面临两种调整选项:一是提高订阅价格以覆盖上升的算力成本;二是在不声张的情况下缩减订阅套餐可折算的真实Token总量,即悄然调低「杠杆比」。后者对用户而言感知更隐蔽,体现为「同样的钱,额度用得更快了」,在商业上却更易推行。历史上,多个AI厂商都曾通过这种方式在不正式提价的情况下收窄套餐的实际价值,值得重度用户保持警觉。
对于开销激增,有两种可能的原因:一是上下文变长直接带动Token消耗上升;二是Codex在订阅套餐中调整了「杠杆」,缩减了可折算的真实Token额度。由于API价格并未变化,单纯换模型理论上开销差别不大,因此后者的可能性更值得留意。
不过,三档模型体系也给了用户更多腾挪空间——在使用订阅套餐时,将Terra或Luna作为子Agent调用,可以有效控制整体Token支出。
总结:效果更强,但成本需要精细管控
综合此次实测,GPT 5.6+Codex的核心变化可以概括为:模型分级更精细、思考档位更激进、上下文更长、自主循环与Skill调用能力显著增强,并修复了「对话写入产物」这一长期痼疾。这些改进整体提升了Codex作为AI编程Agent的可用性与稳定性。
另一面是,Ultra模式和更积极的子Agent调用带来了明显的额度压力。对订阅用户而言,如何在效果与成本之间取得平衡——合理搭配Sol/Terra/Luna三档模型——将成为使用GPT 5.6时不可回避的一门功课。
核心要点
- 三档分级(Sol/Terra/Luna) 对标Claude体系,让开发者可按任务复杂度选择模型,在效果与Token开销之间精细权衡。
- Ultra思考档位 采用Dynamic Workflow架构,通过多子Agent并发拆解任务,但Token消耗呈乘数级增长,需谨慎开启。
- 上下文从26万扩至35万Token,约可覆盖一个中等规模开源项目的全量代码,但受Self-Attention二次方复杂度限制,全量100万额度仍未对订阅用户开放。
- 「对话写入产物」痼疾已修复,这一源于RLHF奖励信号精度不足的元层级混淆问题,是本次升级中对实际使用影响最大的改进。
- 额度消耗明显加快,订阅用户应警惕厂商悄然压缩套餐杠杆比的可能,并主动用Terra/Luna作子Agent来控制整体支出。
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。