GPT-5.6三模型实测:Sol/Terra/Luna与Claude差距还有多远?

OpenAI GPT-5.6 系列首测:Sol、Terra、Luna 全面评测
OpenAI 已经开始推出 GPT-5.6 系列的预览版,这次一口气发布了三个模型。作为长期做模型基准测试的内容创作者,我提前拿到了这三个模型的体验权限,用自己的测试集跑了一遍。这篇文章就来聊聊这些模型到底是什么、实测表现如何,以及我个人的总体看法。
三个模型:Sol、Terra、Luna
OpenAI 在 6 月 26 日发布了 GPT-5.6 系列,目前只通过 API 以限量预览形式开放,同时也向少数合作伙伴通过 Codex 开放,官方称几周内会全面开放。
你可能没注意到,正式发布前 OpenAI 先应政府要求向美国政府展示了这些模型的能力,并采取了分阶段发布的方式,这在其历史上还是头一回。这种谨慎的发布策略本身就暗示了模型能力已经到了相当的高度——尤其是在网络安全方面。值得一提的是,此次预先向政府演示并非寻常惯例,背后的驱动力很可能正是 Exploit Bench 等安全敏感基准上的亮眼表现:当一个通用大模型具备了可观的漏洞分析与利用能力,监管前置就成了必要的风险控制手段。Exploit Bench 专门衡量 AI 的网络安全攻防能力,覆盖漏洞识别、利用链构造和渗透测试场景,属于「任务完成型」评估范式——相较于传统选择题或文本生成打分,此类评估要求模型在沙盒化环境中完成端到端的渗透测试流程,更能直接反映模型在真实攻防场景中的实用威胁等级,这也正是监管机构高度关注的核心维度。
关于命名,OpenAI 解释说数字代表「代数」,而 Sol、Terra、Luna 则是会长期保留的「能力层级」,各自按不同节奏迭代。这一命名策略标志着 OpenAI 从「版本号迭代」向「能力层级品牌化」的重要转变,与 Anthropic 将 Claude 系列分为 Haiku、Sonnet、Opus 三档的思路高度相似——通过固定的层级名称,让开发者建立长期的产品心智,无需每次更新都重新评估选型。对于企业客户而言,这种稳定的命名体系降低了迁移决策成本;对于 OpenAI 自身,则可以在同一品牌下灵活调整底层模型,而无需频繁更改 API 端点名称:
- Sol:旗舰款,能力最强
- Terra:面向日常工作的均衡型模型
- Luna:主打速度快、价格便宜
这意味着这套命名体系大概率会长期沿用下去。

官方能力与定价
从官方公布的数据看,GPT-5.6 在多个基准上表现亮眼。OpenAI 称它在 Terminal Bench 2.1 上达到了当前最强水平。
Terminal Bench 是专门评估 AI 在命令行环境中执行复杂任务能力的基准,与传统对话评测有本质区别——它要求模型在真实或仿真的 shell 环境中自主完成多步骤任务,涵盖文件系统操作、进程管理、脚本编写和依赖调试等场景,考验的是模型的多步骤规划、工具调用与迭代纠错能力。2.1 版本进一步引入了多工具协同维度(如同时操作 git、docker 和包管理器),更贴近真实的 DevOps 和系统工程场景。这类「任务完成型」评估范式与传统的选择题或文本生成打分相比,更能反映模型在真实工程场景中的实用价值,也因此成为衡量「代理能力」代际跃迁的核心指标。
在面向长程生物任务的基准上也有很强结果,而在 Exploit Bench 上,Sol 能和 Anthropic 的模型一较高下,同时只用约三分之一的输出 Token。这也解释了为何 OpenAI 此次选择先向政府展示再公开发布——当模型在安全敏感能力上有实质突破,审慎的分阶段上线就成了必要的风险管控措施。
此外,这次还新增了最高档的推理强度,以及一个新的 Ultra 模式。Ultra 模式采用多代理(multi-agent)并发架构:系统将复杂任务分解后,同时调度多个子代理并行处理不同子任务,最终由协调层汇总结果。这一模式在工程上融合了「mixture of agents」和「orchestrator-worker」两种设计范式——前者侧重多个同质模型的集成投票以提升结果稳健性,后者侧重将异质子任务分配给专项子代理以提升深度。Ultra 模式能显著提升需要并行推理或多视角验证任务的处理质量,但会相应成倍增加 Token 消耗,更适合高价值代码审计、复杂研究报告生成或关键业务决策支持等对质量要求极高、成本敏感度较低的场景。
定价一览(每百万 Token)
| 模型 | 输入价格 | 输出价格 |
|---|---|---|
| Sol | $5 | $30 |
| Terra | $2.5 | 有竞争力 |
| Luna | $1 | $6 |
OpenAI 表示 Terra 的价格相比 GPT-5.5 只要一半。他们还改进了提示词缓存机制——这是一种将重复出现的上下文前缀在服务端临时存储、避免重复计算的技术。其工作原理是:当模型接收到与此前请求共享相同前缀的输入时,直接复用已计算的 KV Cache(键值缓存),跳过对该前缀的注意力计算,从而同时降低延迟和计费成本。GPT-5.6 新增了明确的缓存分界点,允许开发者精确控制哪些内容进入缓存,相比此前的隐式缓存更具可预测性。这一改进对代理式应用尤为重要——在典型的多轮代理工作流中,系统提示词和工具定义往往占据上下文的大半,若每次调用都重新计算,成本会随调用链长度线性增长;明确的缓存控制能让开发者在设计系统架构时就将成本纳入考量,而非事后被动优化。缓存最短可保留 30 分钟,输出速度最高可达每秒数百个 Token。从成本和速度来看,这套定价确实相当到位。
实测:King Bench 3 跑分结果
我让三个模型都跑了一遍自己设计的 King Bench 3 测试集,涵盖前端任务、Three.js 任务、SVG 生成、一道高难度数学题,以及一个长程代理任务。
所谓长程代理任务(long-horizon agentic task),是指需要模型在无人类干预的情况下,自主完成包含多个依赖步骤的复杂工作流——这与单轮问答有本质区别,要求模型具备状态追踪、错误恢复和工具调用编排能力。与单轮问答相比,这类任务要求模型在执行过程中维护跨步骤的状态上下文、识别并从中间错误中恢复,并动态调整后续行动计划。这类任务是衡量模型从「智能助手」向「自主执行单元」演进程度的核心指标,对 MLOps、DevOps 以及低代码平台领域影响深远。具体而言,这里的任务要求模型先生成数据集,再在本地微调一个模型,最后自己把整套流程做成一个 Web UI,整个闭环过去几乎只有专门的 MLOps 工具链才能完成。

总分结果(满分 70):
- Sol:55 分(约 78.6%)
- Terra:约 62.9%
- Luna:31 分(约 44.3%)
分项才是关键
先别看 Sol 的总分就觉得它一般,分项表现比总分更值得深究。
那道高难度数学题上,Sol 和 Terra 都拿了满分 10 分——能做对这题的模型真的非常少。
更惊人的是长程代理微调任务:三个 GPT-5.6 模型都拿了满分 10 分,就连最便宜的 Luna 也完整跑通了数据集生成、模型微调和网页 UI 的整套流程。这一结果揭示了一个重要的行业信号:当一个通用模型可以自主完成此前需要专业 MLOps 工具链才能实现的完整闭环流程——从数据标注、训练脚本编写到服务部署——软件开发和数据工程的自动化程度将迎来实质性提升,原本需要多个专业角色协作的工作流有望被单一代理节点压缩。作为对比,之前的 GPT-5.5 和 Opus 4.7 在这项任务上只能拿两三分。在长周期的后端代理任务上,这些模型是真的很强。

短板在前端
它们的明显短板集中在前端。比如用 Three.js 做的项目、折叠桌动画、SVG 熊猫这些视觉类项目,Sol 基本都只有六七分,而 Fable 5 在这些项目上能拿到九分甚至满分。
坦白说,我的测试集本身就比较偏前端和视觉类任务——因为这些地方最能立刻看出质量差距。Three.js 等三维渲染框架要求模型同时掌握 WebGL 着色器语法、场景图管理和光照模型的精确实现,任何一处坐标变换或矩阵运算的偏差都会直接导致渲染结果可见失真;SVG 生成则需要模型对贝塞尔曲线路径指令、viewBox 坐标系和 CSS 变换矩阵有精准的几何直觉。这类「视觉-代码对齐」能力——即从语义描述精确映射到像素级正确的渲染输出——历来是纯文本训练范式的薄弱环节,需要大量高质量的「代码-渲染结果」配对训练数据,也是多模态输入对模型能力影响最显著的维度之一。所以 GPT-5.6 在我这里的分数其实是被低估了,不是模型不行,而是前端依然不是 OpenAI 的强项,而我的基准偏偏在这方面卡得很严。
与 Fable 5、Opus 的横向对比
在我的综合排行榜上,各模型成绩如下:
- Fable 5:88.57%(第一)
- Opus 4.8:87.14%
- GM 5.2:81.43%
- Sol:78.57%
- GPT-5.5:38.57%

Sol 的成绩基本是上一代 GPT-5.5 的两倍,提升幅度相当显著。这种代际跃迁式的能力提升——尤其是在代理任务和数学推理上的突破——很可能反映了训练范式的根本性变化:从单纯的指令微调(instruction fine-tuning)向结合过程奖励模型(process reward model,PRM)的强化学习路线迁移。PRM 在训练时不仅对最终答案进行奖励,还对中间推理步骤的质量给予细粒度反馈,这使模型在需要多步推理、自我验证和中间纠错的场景中获得了质的增益,而非仅仅在最终输出上「碰运气」——这与 GPT-5.6 在长程代理任务上的表现高度吻合。
总体评价与选型建议
这是一次扎实的增量升级,而非范式转变。 提升确实很大,但本质上还是 GPT-5.5 自然的下一步,只不过更强也更便宜。Sol/Terra/Luna 这套命名我觉得营销意味较浓——OpenAI 应该是想对标 Anthropic 把 Fable 包装成「全新模型类别」的做法,让自家发布也显得像个全新的产品线。
它到 Fable 的级别了吗?还差一点。 Fable 依然是综合表现最强的模型,这点在我的测试里几乎各项都能看出来。不过 Sol 已经非常接近,甚至在某些项目上胜过 Fable,尤其是在网络安全方面和代理任务的 Token 效率上表现出色。在长程代理任务上,它和 Fable 完全打平。
Fable 的明显短板是价格——它是目前最贵的选择。而 Luna 在同等能力档里几乎是最便宜的,尤其是对需要高频调用的代理式应用而言,$1/百万 Token 的输入价格配合改进后的提示词缓存机制,实际运营成本可以压得相当低。在系统提示词较长的多轮代理场景中,缓存命中率越高,边际调用成本越趋近于零——若系统提示词占总 Token 的 60% 以上,命中缓存后的实际计费成本可能仅为标价的三至四成,这意味着高并发代理应用的月度 API 账单可能比直觉预期低出一半以上。这对需要大规模部署代理工作流的团队而言具有显著的经济意义。
三款模型选型建议
- 重度前端/视觉任务:优先选 Fable 5 或 Opus 4.8
- 后端代理式或长周期任务:Sol 很值得选,成本还低很多
- 追求性价比的代理式场景:Luna(输入仅 $1/百万 Token)可能是目前最划算的选择
注:以上结论基于预览版测试,正式发布前相关数据可能有所变化,仅供参考。
结语
这次发布比宣传低调一些——算不上范式转变,但确实是一次扎实、定价合理的升级,已经把与 Fable 的大部分差距补上了。整体来看,GPT-5.6 系列是值得认真对待的选手。欢迎在评论区分享你的看法。
核心要点
核心要点
相关推荐

为什么我拒绝阅读AI创作的小说:真实性危机与阅读本质的反思
当AI能以假乱真地模仿人类写作时,我们为何还要在意文字背后是否有真实的人?探讨拒绝阅读LLM创作小说背后的深层逻辑,从阅读本质、真实性危机到内容创作行业的未来走向。

GPT-2+Seedance 2.5实测:AI黑暗奇幻战斗片能力边界在哪
创作者使用GPT-2配合Seedance 2.5制作黑暗奇幻战斗场景,从角色一致性、镜头运动、视觉连续性和动态动作四个维度压力测试AI电影制作的真实能力边界与当前局限。

Cursor Ultra低价代理:便宜背后的真实风险与隐患
深入分析Cursor Ultra低价代理转售的运作模式,揭示团队席位拆分、地区定价套利等灰色操作背后的账户封禁、数据泄露等风险,并为开发者提供实用的安全建议。