GPT-5.6深度评测:Sol、Terra、Luna三模型选型完全指南

GPT-5.6 正式面向所有付费用户开放,OpenAI 一口气推出了 Sol、Terra、Luna 三款模型,再叠加不同的推理档位、Ultra、Pro 等选项,光在 Pro 版本里就有 30 多种组合可选。面对如此复杂的选择空间,本文将结合硬核基准数据和大量早期测试者的真实反馈,梳理 GPT-5.6 的强项、弱点以及实用的选型建议。
一次发布三个模型:命名与定位
OpenAI 这次以「天体」命名旗下模型:Sol(太阳)是新旗舰,Terra(大地)是面向日常工作的均衡型模型,Luna(月亮)则是最具成本效益的选项。同时发布三款模型确实容易让人困惑,但它们的定位其实非常清晰。
值得强调的是,GPT-5.6 并不是全新的基础模型——它没有新的预训练、没有更多参数,而是在 GPT-5.5 基础上进行的后训练(post-training)和强化学习优化。
理解这一点需要了解现代大语言模型的两阶段开发范式。预训练阶段是在海量无标注文本上进行自监督学习,耗资数亿乃至数十亿美元,形成模型的基础知识表征和语言能力——这是模型「世界观」的奠基期。而后训练阶段则是在这一基础上进行精细的行为塑造,通常包含三个层次:
- 监督微调(SFT):通过精心构造的指令-响应对,将模型从「预测下一个token」的语言建模模式转向「理解并执行指令」的交互模式。高质量的SFT数据集往往涵盖数十万乃至数百万个人工撰写的示范样本,覆盖从代码补全到学术写作的广泛任务类型,其质量直接决定了模型指令遵循能力的上限。
- 基于人类反馈的强化学习(RLHF):训练者对模型的多个输出进行两两比较,这些偏好数据被用来训练一个独立的奖励模型,再通过近端策略优化(PPO)等强化学习算法反向优化生成策略,使模型输出向人类期望靠拢。这一过程本质上是在将隐性的人类价值观编码进模型的行为分布中。
- 基于AI反馈的强化学习(RLAIF):用更强的AI模型替代人工标注者进行偏好比较,大幅降低了数据标注成本,并提升了评价标准的一致性。这一技术路线在Constitutional AI等框架中已有充分实践,允许以更低成本完成大规模的安全对齐和能力强化。
OpenAI 在 GPT-4 到 GPT-4o 的演进中已充分验证了这条路径:GPT-4o 在多模态融合、响应速度和指令遵循上实现了显著跃升,却并非全新的预训练产物。这种迭代方式成本相对可控,也使得模型可以针对特定领域(如代码、科学、安全)进行深度强化,是连接两次大规模预训练之间的重要技术桥梁。GPT-5.6 正是这一策略的延续——通过精准的后训练信号,将 GPT-5.5 的潜能进一步释放。
正因如此,它在能力上实现如此大的跃升才更令人惊讶,也让人对 OpenAI 下一次真正的预训练(很可能是 GPT-6)充满期待。
基准数据:效率与性能的双重突破
GPT-5.6 最亮眼的地方在于「每美元性能」的大幅提升。在多个权威基准上,它都刷新了记录:
- DeepSWE:专门评估 AI 软件工程能力的基准,要求模型在真实代码库中完成端到端的工程任务,包括理解需求、定位代码、修改并通过测试。与此前广泛使用的 HumanEval(仅评估独立函数补全)和 SWE-bench(基于 GitHub issue 的补丁生成)不同,DeepSWE 更强调完整的工程执行链路——模型必须在没有任何人工引导的前提下,独立完成从问题理解到代码提交的全流程,包括运行测试套件并根据失败信息自我修正。这使得它成为目前最接近真实软件工程场景的代码能力基准。5.6 Sol 在 Max 档位拿到史上最高的 73% 分数,成本却不到竞品 Fable 对应档位的一半——每任务 22 美元 vs 839 美元。
- Agent's Last Exam(覆盖 55 个领域的长时程专业工作流评估):这是目前业界公认最接近「真实专业工作者」能力的综合性测试,模拟需要多步骤推理、工具调用和知识整合的复杂场景。传统基准如 MMLU、HumanEval 等已难以区分顶尖模型——MMLU 的顶尖模型得分已普遍超过 90%,趋近于人类专家水平的天花板,失去了区分度。这种现象在学术界被称为「基准饱和」(Benchmark Saturation):当测试集被模型的训练数据间接覆盖,或当题目难度不足以区分高能力模型时,基准就失去了其诊断价值。ALE 正是为填补这一空白而设计:它引入了需要跨领域知识综合、长达数十步的推理链以及工具使用协调的题目,并刻意包含了需要元认知能力(即模型需要判断「这道题我是否真的知道答案」)的场景,让模型间的能力差距重新变得可见。Sol 创下 53.6 的新高,比采用自适应推理的 Fable 5 高出 13 分。即便在 Medium 推理档位,也能以约四分之一的成本领先 Fable 5 达 11 分。
- Artificial Analysis 编程智能体指数:5.6 Sol(Max 推理)以 20 分的领先幅度刷新记录,次优的 Fable 仅得 77 分。
- TerminalBench 2.1:同样达到业界最佳水平。

有趣的是,在 Agent's Last Exam 上,Sol 的 X-High 档位反而超过了 Max 档位——X-High 以约 760 美元取得 53.6%,而 Fable 最好的一次运行花了 3985 美元却只有 45 分。这也印证了后文关于「Max 档位性价比不高」的判断。
推理档位背后的技术原理来自「推理时计算扩展」(Test-Time Compute Scaling)这一重要研究方向。区别于通过增大模型参数量来提升能力的「训练时扩展」,这一范式在推理阶段投入更多算力:高推理档位会驱动模型生成更长的内部思维链(Chain-of-Thought),在给出最终答案前进行多轮自我验证、假设反驳和路径回溯。
从信息论角度看,这一机制的本质是用计算资源换取搜索空间的覆盖率:更长的思维链意味着模型在「解空间」中探索了更多路径,降低了落入局部最优或表层模式匹配的概率。DeepMind 的 AlphaCode 2 和 OpenAI 的 o1 系列研究均表明,对于数学证明、代码调试等结构化推理任务,推理时的算力投入有时比单纯扩大模型规模更具性价比——因为这类任务的关键不是「记住更多知识」,而是「把已有知识以正确的顺序组合起来」。然而这种收益并非线性:从 Low 到 High 档位的提升往往最为显著,而从 High 到 Max 的边际收益急剧递减——如上述 DeepSWE 数据所示,分数仅提升约 4 个百分点,成本却增加约 1.5 倍。这一「推理边际收益递减」现象表明,超过某个阈值后,更多的「思考时间」并不能帮助模型突破其知识或推理的根本局限,反而只是在已有答案周围反复打转。
此外,较小的 Terra 和 Luna 也能以约 1/16 的成本超越 Fable 5,Terra 在编程指数上甚至与 Fable 打平,堪称被低估的实力派。
网络安全、科学与实际应用
GPT-5.6 在网络安全(ExploitBench、ExploitGym)和科学领域(GeneBench Pro、LifeSciBench、MedChemBench)均表现优异。值得注意的是,ExploitBench 和 ExploitGym 这类安全基准的存在本身就体现了 AI 能力评估领域的一个重要转变:将「攻击性安全能力」纳入标准化评估体系,既是为了推动防御性研究,也是为了对模型的潜在风险建立量化认知。
从安全研究的视角看,对 AI 漏洞利用能力进行标准化评估具有双重价值:一方面,它迫使模型开发者正视并量化其产品可能带来的安全风险,从而倒逼更完善的安全对齐措施;另一方面,这类基准也是红队测试(Red Teaming)的重要工具,帮助安全研究人员识别哪些攻击场景已超出模型的防护边界。这种「以攻促防」的评估哲学,与传统软件安全领域的渗透测试思路一脉相承。虽然在纯网络安全能力上据称仍不及无法公开使用的 Mythos 5,但相比前代已是巨大进步。

OpenAI 的内部使用数据同样耐人寻味:过去六个月,投入内部编码推理的研究算力增长了 100 倍,内部智能体 token 使用量增长约 22%。5.6 每位活跃研究员的日均输出 token 是 5.5 最高水平的两倍多——这与许多测试者「忍不住把它扔到所有任务上」的体验高度吻合。
不过安全防护也带来了额外摩擦。5.6 Sol 的网络安全防护会拦截约 10 倍于前代的潜在有害行为,代价是有时误伤正常需求(比如清理代码库这类良性操作也被拦截)。OpenAI 提供了在 ChatGPT 和 Codex 中一键降级到低能力模型重试的选项,但目前拦截仍偏激进。
早期测试者的真实反馈
围绕 GPT-5.6 的口碑呈现出戏剧性的两极——有人称它是「用过最好的东西」「改变了写软件的方式」,也有人觉得 Fable 更强以至于弃用了 5.6。但多位重量级开发者的反馈值得关注:
- Dax 表示从不为模型发布造势的他,这次团队 token 使用量翻了五倍,「它不一定比 Fable 更聪明,但就是极其可靠、用起来很爽」。
- Terraform 和 Ghosty 创始人 Mitchell 把 Sol 设为默认,认为它更快、规划和判断力不输 Fable,且整体产出更好。
- Next.js 团队的 Tim 测试 Sol 超过两个月,称它理解架构权衡、能排查复杂 issue、修 bug 时会顾及代码库其他部分,只需极少引导,甚至独立完成了 Next 服务器的大型重构,PR 直接可合并。
一个反复出现的主题是「失去后才知珍贵」——不少团队在早期访问后一度失去权限,形容团队「陷入抑郁」,甚至觉得像在投一个重了两倍的篮球。这种「工具依赖效应」在认知科学中有其对应的研究基础:当一个工具显著降低了某类认知任务的阻力后,大脑会将其纳入「扩展认知系统」的一部分,失去它不仅是效率损失,更会带来类似工作记忆被截断的认知摩擦感。这正是 5.6 让人感觉特别的地方:在 Max 推理下它会一直工作直到任务完成,从不轻易放弃。

强项与弱点:能干但不总是深思
核心强项
- 极其执着:只要任务有可能完成,它就会想尽办法做到。
- 业界领先的计算机操作能力(computer use),部分用户甚至专门增置硬件让 Codex 完全接管。Computer Use 能力的核心在于模型能够理解屏幕截图中的 UI 元素语义,将高层任务指令(如「帮我整理这个项目的依赖」)分解为具体的鼠标点击、键盘输入和窗口切换操作序列,并在每步执行后观察新的屏幕状态进行自适应决策——这本质上是一个视觉-动作闭环的具身智能问题。从技术架构看,这需要模型同时具备视觉接地能力(将像素坐标映射到语义概念)、动作规划能力(将自然语言目标转化为可执行的原子操作序列)以及状态追踪能力(在多步操作中维护对当前系统状态的准确认知)——三种能力的协同整合,正是此前多模态模型在这一任务上屡屡失败的根本原因。
- 高效率:token 用量更少、成本更低、速度更快(未来 Cerebrus 托管版本可达 750 tokens/s)。
- 子智能体编排能力顶尖:子智能体编排是指主智能体将复杂任务拆解后,分发给专门的下级智能体并汇总结果,需要模型具备任务规划、依赖分析和结果整合的「元能力」。这一架构的难点不在于单个智能体的执行能力,而在于主智能体的「品味」——它必须知道哪些子任务可以并行化、哪些存在数据依赖必须串行、子任务的粒度如何划分才能在通信开销和执行效率间取得平衡。从软件工程的角度看,这本质上是一个动态任务调度问题:主智能体需要在运行时根据中间结果动态调整任务图,处理子智能体失败时的回退逻辑,并在最终汇总阶段解决不同子智能体输出之间可能存在的语义冲突。目前具备这种任务分解品味的,只有 5.6 Sol、Fable 5/Mythos 和 Sonnet 5。
- 上下文压缩与抗污染能力大幅改善:默认上下文提升到 350K token,并配合改进的压缩算法,使得模型在连续运行数小时的智能体任务中依然能保持方向感。「上下文污染」是长时程智能体任务中的顽固问题:随着对话历史积累,早期的错误假设、已被推翻的中间结论和无关的工具调用结果都会占据注意力窗口,导致模型在后续步骤中被旧信息「带偏」。5.6 引入的压缩机制会动态识别并降权处理低相关性的历史片段,在不损失关键上下文的前提下为新信息腾出注意力空间。值得关注的是,这一压缩机制面临一个根本性的信息论挑战:在压缩时,模型必须在「当前时刻」判断哪些历史信息在「未来步骤」中仍然重要——而这需要对任务全局的前瞻性理解,恰恰是长时程任务中最难获得的元信息。5.6 的改进表明 OpenAI 在这一前瞻性上下文评估能力上取得了实质进展,这一改进在超过 2 小时的连续任务中尤为关键。
主要弱点
- 默认写太多代码:会把 5 行改动变成 300 行文件重写加 2000 行测试,需要通过 system prompt 调教。
- 过于执着到会破坏东西:找不到 sudo 权限时会绕道另辟蹊径,行为有时「过于聪明」,建议在 VM 中运行。
- 设计能力远非前沿:比 5.5 有所改善,但不加引导容易产出令人失望的结果。
- 不擅长认识自身局限:一旦认定某事,会与你反复争辩,容易钻进不存在的问题的牛角尖。
- 可能疯狂烧 token:没有明确停止点时会持续尝试,配合 Fast Mode 或 Ultra 极易耗尽配额。
用一句话概括它的本质:这个模型很有能力,但不一定深思熟虑。它会不惜一切完成任务,却不总是停下来想想自己在做什么——结果就是不断堆砌代码、反复绕过障碍,而不是退一步重新思考。这种行为模式在 AI 对齐研究领域被称为「目标固守」(Goal Fixation):模型过度优化了「任务完成率」这一指标,而欠缺了对「任务完成方式」的元级评估能力——换言之,它擅长「做到」,却不擅长判断「是否值得这样做」。
选型指南:Sol、Terra、Luna 怎么选

Luna:智能体的得力助手
Luna 并不是给开发者在下拉菜单里手动选择的模型。它便宜、快速、意外地能干,定位是被更聪明的智能体调用,或用于批量数据处理、标题生成、分支命名等高频轻量任务。这一定位呼应了 AI 系统设计中的「分层智能」原则:在多智能体架构中,并非所有子任务都需要调用最强的模型——高频、低复杂度的执行层任务由小模型处理,可以大幅降低系统整体成本,而不损失关键决策的质量。这种设计哲学与微服务架构中「右工具做右事」的理念高度契合:就如同不会用分布式数据库处理单用户本地配置文件一样,用旗舰模型执行格式化文本这类任务既是资源浪费,也可能因模型过度「创造性发挥」而引入不必要的变异。Luna 直接对标并超越了 Gemini Flash 系列——更便宜、更高效、更可靠。
Terra:预算有限时的最强选择
Terra 是「性价比之王」,尤其适合:
- 预算有限的编程场景(100 美元或 20 美元 Codex 档位的更优默认);
- 审阅代码与提供反馈;
- 作为实现层的主力(让 Sol 做深度调研,Terra 负责写代码,且不像 Sol 那样过度重写)。
几乎所有 Terra 档位都比 5.5 Medium 更便宜,是老用户升级的理想过渡选择。
Sol:复杂任务的旗舰首选
Sol 是(视任务而定)最聪明的模型。当你不确定任务能否被解决、或预期耗时超过 10 分钟时,Sol 几乎总是正确选择。
推理档位怎么选
从 High 到 Max 的能力提升很小,成本差距却极大(DeepSWE 上 High 69 分/3.4 美元,Max 73 分/8.39 美元)。综合来看,推荐配置是:
- Sol on High:大多数复杂任务的默认选择;
- Terra on Medium:高性价比的日常主力;
- Luna:交给智能体调用即可。
Ultra 和 Fast Mode 请慎用——Ultra 并非简单的「更高推理档位」,其本质是一种并行多智能体协调架构:系统会同时启动多个智能体实例分别处理任务的不同方面,再由协调层汇总。从系统工程角度看,这类架构面临「协调开销」与「并行收益」的经典权衡:任务越是可分解、各部分独立性越强,并行化收益越大;但若任务本身高度耦合,多智能体的协调通信反而会引入额外的一致性问题。此外,Ultra 模式还面临「结果一致性合并」难题:当多个并行智能体对同一问题产生不同甚至矛盾的中间结论时,协调层需要一套可靠的冲突解消机制——而在开放性任务中,这套机制本身就可能成为新的错误引入点。Ultra 模式意味着多份上下文、多次工具调用同时进行,token 消耗量呈倍数级增长,在没有清晰任务定义的情况下开启,极易在短时间内耗尽月度配额。
总结
用一句话概括三款模型的战略意图:Luna 意在击杀 Google 没做好的 Flash,Terra 意在击杀 Anthropic 没做好的 Sonnet,Sol 则是 OpenAI 打造的、能跑更长任务的智能旗舰。
GPT-5.6 无疑是一款出色的产品,也是处理大多数任务的有力选择。它是否比 Fable 更强、是否是你最喜欢的模型?这个问题或许没有统一答案——但它建立在 5.5 之上却能实现质变,本身就是最好的注脚,也让人对 OpenAI 的下一次真正预训练更加期待。从更宏观的视角看,GPT-5.6 的成功也证明了一个重要的产业规律:在大模型领域,「精细化后训练」与「规模化预训练」并非互斥的两条路,而是相互依存的双螺旋——前者将现有模型的潜力榨取到极致,为下一次预训练积累了大量关于「什么样的能力真正有用」的实证数据;而下一次预训练则将在一个更高的基础上开始,使后训练优化能够触及更深层的能力边界。
核心要点
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。