GPT-5.6三模型深度评测:Sol、Terra、Luna实测对比分析

OpenAI发布GPT-5.6三模型体系
OpenAI于6月26日正式预览了GPT-5.6系列,这一次不再是单一模型,而是同时推出三款定位各异的产品:旗舰级的 Sol、面向日常工作的均衡型 Terra,以及主打快速低价的 Luna。
这套命名逻辑值得关注——OpenAI明确表示,数字(5.6)代表世代,Sol、Terra、Luna则是可以按各自节奏独立演进的"能力层级"(durable capability tiers)。这套命名体系未来将长期沿用。
将Sol/Terra/Luna定义为"持久能力层级"而非版本号,本质上是在构建一套类似半导体行业"产品线架构"的品牌体系:不同层级面向不同价格敏感度与性能需求的用户,且可以独立迭代而不互相绑架。这与Anthropic的Haiku/Sonnet/Opus三层体系、Google的Gemini Flash/Pro/Ultra体系高度同构——行业正在形成"旗舰-均衡-经济"三档的市场分层共识。数字版本(5.6)代表世代,能够避免因某一层级迭代而强迫用户重新评估整条产品线,同时也为未来的子品牌溢价定价留下空间。这种分层策略在芯片行业(如英特尔Core i3/i5/i7,高通骁龙7/8系列)已被证明是高效的市场细分工具,能够在保持品牌统一性的同时最大化不同消费群体的覆盖率。
目前该系列仅通过API和Codex向少数合作伙伴开放有限预览,正式全面发布(GA)预计在未来几周内到来。本文基于一位获得早期访问权限的评测者对三款模型的完整基准测试结果展开分析。
值得关注:分阶段发布背后的信号
OpenAI在正式发布前先向美国政府预览了模型能力,并应政府要求进行"分阶段发布"——这在OpenAI产品史上尚属首次。从侧面来看,这些模型在能力上,尤其是网络安全领域,已经达到相当敏感的水平。
这一做法折射出AI安全治理体系的演进。美国政府对AI模型的审查通道正在逐渐机制化——国家标准与技术研究院(NIST)于2023年发布的AI风险管理框架(AI RMF),以及拜登政府的行政命令要求高性能模型在公开发布前需向相关部门提交安全报告。在网络安全领域,若模型能够自主发现漏洞或生成可用exploit,则被归类为高风险能力(high-risk capability),需要更严格的访问控制。值得注意的是,这种"政府优先预览"机制与核技术、生物技术领域的双重用途研究监管逻辑高度相似——当一项技术同时具备民用价值和潜在武器化风险时,政府介入评估往往早于公开发布。分阶段发布不仅是监管合规的体现,也是OpenAI在政策层面主动建立信任背书的策略性动作。
GPT-5.6能力宣称与定价策略
OpenAI为GPT-5.6列出了多项SOTA(当前最佳)成绩:
- Terminal Bench 2.1:测试命令行工作流中的规划、迭代与工具协调能力,宣称达到业界最佳
- GeneBench:在长周期生物学任务上表现强劲
- ExploitBench:Sol的表现与Anthropic的Mythos Preview相当,但仅消耗约三分之一的输出token
Terminal Bench和ExploitBench是新兴的AI能力评测基准,专门衡量模型在真实工程和安全场景中的表现,而非传统的知识问答或推理题。ExploitBench要求模型自主理解目标系统漏洞并生成可执行的攻击链,这与早期仅测试"能否识别漏洞类型"的评估有本质区别——后者考察的是知识记忆,前者考察的是真实世界的攻击规划能力,涉及侦察、漏洞利用、权限提升等完整渗透测试流程。token效率指标(Sol仅消耗Mythos三分之一输出token)在安全场景中至关重要:更少的推理步骤意味着更低的延迟与成本,也代表模型对问题的内在理解更为精准,而非依赖暴力枚举路径。在自动化渗透测试等实时场景中,token效率直接决定系统的实际可用性。
此外,OpenAI还新增了 max reasoning effort(最高推理强度) 选项,以及能够为复杂任务启动子智能体(sub-agents)的 ultra模式。

定价:颇具竞争力
本次定价策略对开发者相当友好(每百万token):
| 模型 | 输入 | 输出 |
|---|---|---|
| Sol | $5 | $30 |
| Terra | $2.50 | $15 |
| Luna | $1 | $6 |
OpenAI称Terra在与GPT-5.5能力相当的前提下价格降低了一半。同时改进了prompt缓存机制,加入显式缓存断点和30分钟最短缓存生命周期,并计划于7月在Cerebras平台上以最高 750 tokens/秒 的速度部署Sol。成本与速度层面的提升均相当显著。
Prompt缓存(Prompt Caching)是通过复用相同前缀的KV缓存(Key-Value Cache)来降低重复计算成本的技术。在Transformer架构中,每个token的注意力计算需要访问所有历史token的Key和Value矩阵;对于系统指令、工具定义等固定前缀,每次请求从头计算会造成巨大的算力浪费。在长上下文场景或多轮对话中,这类固定内容可能占据总token的30%至70%。OpenAI此次引入"显式缓存断点"意味着开发者可以手动指定缓存边界(而非依赖系统自动识别),这对RAG(检索增强生成)系统和多轮智能体任务的成本控制尤为重要——开发者可以将长篇知识库文档设为固定缓存前缀,仅对用户查询部分收费。30分钟的最短缓存生命周期则保证了缓存在连续工作流中的有效性,避免短时间内重复任务因缓存过期而产生额外成本。
值得一提的是,750 tokens/秒的推理速度来自Cerebras的晶圆级芯片(Wafer-Scale Engine)架构。与传统GPU集群不同,Cerebras将整块晶圆作为单一处理器,消除了芯片间通信瓶颈,可将内存带宽提升数十倍。这使得推理延迟从秒级压缩至毫秒级,对于需要实时响应的智能体应用场景(如代码执行循环、多轮工具调用)具有决定性意义。OpenAI选择与Cerebras合作部署Sol,也折射出头部AI厂商在推理基础设施层面正在积极寻求GPU之外的差异化算力路线。
基准测试实测:分项拆解比总分更有价值
评测者通过自建的 KingBench 3 测试集对三款模型进行考核,涵盖前端任务、Three.js、SVG生成、高难度数学题,以及一个长周期智能体任务(要求模型自主生成数据集、在本地微调Gemma模型并构建配套Web UI)。
最终得分(满分70):
- Sol:55分(78.6%)
- Terra:44分(62.9%)
- Luna:31分(44.3%)

智能体任务:三款模型全部满分
光看总分容易低估这组模型的真实能力,分项数据更能说明问题:
- 在高难度数学题上,Sol和Terra都拿到了满分10分——这道题极少有模型能完整作答。
- 在智能体微调任务上,三款模型全部满分10分。即便是最便宜的Luna,也完整完成了数据集生成、模型微调到Web UI搭建的全流程。
这一智能体微调任务堪称综合能力的终极考验:模型需要依次完成数据集构建(包括数据清洗与格式化)、调用本地微调框架(如LoRA/QLoRA对Gemma进行参数高效微调)、以及构建具有交互界面的Web UI,整个流程涉及跨工具调用、多步骤规划与错误自我修正。LoRA(低秩适配)是一种参数高效微调技术,通过在原有权重矩阵旁注入可训练的低秩分解矩阵,以极少的可训练参数实现模型特化,是目前本地微调最主流的方案。GPT-5.5和Opus 4.7仅能得2-3分,根本原因在于这类任务要求模型在执行过程中维持长程上下文一致性,并能在局部失败时重新规划,而非单纯的代码生成能力。三款GPT-5.6模型全部满分,说明其在"智能体循环(agentic loop)"的稳定性上实现了结构性突破——模型不仅能生成代码,还能感知执行结果、识别错误并自主重试,这与简单的单步代码补全有本质差异。
作为参照,同一任务此前GPT-5.5和Opus 4.7仅能得到2至3分,而GPT-5.6直接与顶级模型Fable 5打平。这说明在长周期、后端、智能体类任务上,这一系列已经达到相当高的水准。
前端任务:仍是OpenAI的软肋
失分主要集中在前端与视觉任务。在Three.js隐形眼镜案例、折叠桌动画、SVG熊猫等测试中,Sol仅得6至7分,而Fable 5能稳定拿到9至10分。

Three.js是基于WebGL的3D渲染库,要求模型不仅能生成语法正确的JavaScript代码,还需理解3D空间坐标系、材质光照系统与动画时间轴的组合逻辑——这类任务对"空间推理能力"和"多系统协调编程"有极高要求。SVG生成同样考验模型对坐标变换、贝塞尔曲线和图层叠加的精细控制,而非简单的文本输出。前端任务之所以是多数LLM的弱项,根本原因在于视觉正确性(pixel-level correctness)缺乏明确的文本损失信号:一段能够运行的Three.js代码可能在视觉上完全错误,而这种错误在训练时的强化学习阶段难以被自动评分系统捕捉。相比之下,后端代码有明确的单元测试输出作为验证信号,强化信号更为清晰,模型因此能更有效地从失败中学习。这一结构性差异解释了为何多数顶级模型在前端视觉任务上的表现始终滞后于其后端能力。部分前沿研究正尝试引入视觉渲染截图作为强化学习奖励信号(即让模型"看到"自己生成代码的渲染结果),但这一方向目前仍处于早期探索阶段,尚未在主流商业模型中大规模落地。
评测者指出,其测试集本身偏重前端与视觉任务,这在一定程度上拉低了GPT-5.6的总分。并非模型整体偏弱,而是前端至今仍非OpenAI的强项,而这套基准对此有较大权重。
横向对比:GPT-5.6在排行榜上的位置
在该评测者的模型排行榜上,当前各模型得分率如下:
- Fable 5:88.57%(榜首)
- Opus 4.8:87.14%
- GLM 5.2:81.43%
- Sol:78.57%
值得单独强调的是,上一代GPT-5.5仅为38.57%。Sol基本上将上代成绩翻了一倍,无论如何衡量,都是一次显著的代际跨越。

评测结论:强力增量,而非范式革命
评测者给出了几点核心判断:
其一,这是相对GPT-5.5的增量式改进,而非新范式。 一次非常出色的增量,但仍是增量。Sol/Terra/Luna的命名体系"营销味较浓"——评测者认为,这与Anthropic将Fable定位为"新物种"有关,OpenAI也希望本次发布看起来像"全新的东西"。但从实际能力来看,这是从5.5自然演进而来的下一步:更强、更便宜。
其二,Sol达到Fable级别了吗? 还差一点。Fable整体仍是最强模型,在绝大多数分项上保持领先,但Sol已非常接近,部分场景甚至超过Fable。其网络安全和智能体基准上的token效率尤为亮眼,智能体任务上更与Fable打成平手。相比之下,Fable最大的问题是价格昂贵,而Sol及更廉价的Terra、Luna在各自定位的能力段上,性价比几乎无可匹敌。
GPT-5.6选型建议
- 前端密集型工作:Fable 5或Opus 4.8仍是首选
- 后端、智能体、长周期任务:Sol是极佳选择,且成本大幅降低
- 预算受限的智能体场景:Luna($1/百万token输入)可能是当前最具性价比的低价智能体模型
需要提醒的是,以上结论均基于预览版,正式GA前仍可能有所调整。总体而言,这是一次扎实的发布——不是营销所渲染的范式革命,而是定价合理、大幅缩小与Fable差距的强力增量升级。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。