GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?

OpenAI的GPT-5.6预览来了
OpenAI于6月26日悄然推出了GPT-5.6系列预览版本,一次性发布三款定位各异的模型:旗舰款 Soul、主打日常办公平衡型的 Tara,以及兼顾速度与性价比的 Luna。目前三款模型正通过API进行有限预览,并向少数合作伙伴开放了Codex访问权限,官方称全面发布将在未来几周内到来。
有一个细节值得关注:正式发布前,这些模型曾向美国政府提供预览以评估其能力,并应政府要求采取分阶段发布策略——这在OpenAI的产品发布历史上尚属首次,某种程度上也暗示了新模型在网络安全等敏感领域所达到的能力水位。
行业背景:在AI安全监管日益收紧的背景下,向政府提供预览评估已成为顶级AI实验室的新常态。美国AI安全研究所(AISI)与英国同名机构自2023年起开始与主要AI公司签署合作协议,要求在公开发布前对前沿模型进行「预部署评估」,重点关注模型在生物武器合成、网络攻击自动化、核扩散信息等「危险能力」维度上的表现。这套评估框架的核心方法论是「危险能力评估」(Dangerous Capability Evaluation,DCE):评估者会构造专门的对抗性提示,测试模型能否提供实质性帮助(即超越公开信息所能提供的帮助)来实施大规模危害。OpenAI此次主动配合分阶段发布,与Anthropic的「负责任扩展政策(RSP)」以及DeepMind的「前沿安全框架」一脉相承——RSP要求Anthropic在模型具备特定危险能力时自动触发额外安全措施,相当于给模型发展设置了「熔断机制」。这折射出整个行业在能力边界扩张时对安全治理的集体焦虑:当模型能力接近甚至超越人类专家水平时,单纯的技术对齐已不足够,结构性的监管介入正在成为行业共识。
本文基于一位B站UP主提前获得内测资格后的真实测评,结合其自建基准测试KingBench 3,来看看GPT-5.6三款模型的实际成色,以及它们与Anthropic当前最强模型Fable之间的真实差距。
命名逻辑与定价策略
数字代表代际,名字代表档次
OpenAI对这次命名做了新的解释:数字(5.6)代表模型代际,而 Soul、Tara、Luna 代表长期能力档次,三者会各自独立迭代,这套命名体系将长期保留。这与Anthropic将Fable定位为「全新模型类别」的做法有异曲同工之处——都在试图给用户耳目一新的感觉。
命名体系背后的商业逻辑:OpenAI的版本命名策略反映了大语言模型从「单一旗舰」向「模型家族」演进的行业趋势。此前GPT-4系列已尝试通过GPT-4o、GPT-4o mini等后缀区分档次,但仍依赖单一主版本号。GPT-5.6引入「数字+专有名词」双轨制,本质上借鉴了芯片行业的产品线管理逻辑——如同英伟达将GPU架构代号(Hopper、Ada)与SKU(H100、H800)分层命名,允许同一代际的不同规格产品独立迭代,而不必绑定在同一发布节奏上。这种策略还有更深的竞争意图:在Anthropic以「Sonnet/Opus/Haiku」构建三级产品线、Google以「Flash/Pro/Ultra」划分档次之后,AI大厂已普遍意识到单一旗舰模型会制造「等待新版本」的用户惰性。赋予中低端型号独立品牌名称,等于给它们赋予了独立的市场生命周期,允许用性能渐进迭代而不是价格战来保持用户粘性。从消费心理学角度看,「Luna」比「GPT-5.6 mini」更容易建立产品认知,这种具名策略正在成为头部AI公司的标准打法。
定价:这次相当有诚意
三款模型的定价梯度清晰:
- Soul:输入 5 美元 / 输出 30 美元(每百万Token)
- Tara:输入 2.5 美元 / 输出 15 美元,官方称能力可媲美GPT-5.5,价格却便宜一半
- Luna:输入 1 美元 / 输出 6 美元
技术解读:大语言模型的定价以「每百万Token」为单位,Token是模型处理文本的基本单元,大致对应0.75个英文单词或1.5个中文汉字——一篇1000字的中文文章约合650-700个Token,一段500词的英文代码约合600-700个Token。输入与输出分开计费源于计算成本的非对称性:生成Token需要逐步进行自回归采样(每次根据已生成内容预测下一个Token),远比编码输入更消耗算力,因此输出价格通常为输入的4-6倍。
这一定价结构的背后是「预填充」(Prefill)与「解码」(Decode)两阶段的根本性算力差异:预填充阶段处理输入时,所有输入Token的注意力计算可高度并行化,GPU的矩阵运算单元(Tensor Core)利用率接近峰值;而解码阶段受自回归串行限制,每次只能生成一个Token后才能进入下一步,GPU的计算单元大量处于等待状态,实际利用率可能仅为预填充的10-20%。这种根本性的计算架构差异,使得输出的边际成本可达输入的4-8倍,直接决定了定价结构。
随着知识蒸馏技术(将大模型内隐知识压缩进小模型参数,而非简单缩减规模)和推测解码(Speculative Decoding,由小型「草稿模型」快速预测多个Token,再由大模型并行验证,被拒绝的Token回滚重生成)的成熟,中低端模型的性价比仍有较大提升空间,这也是Tara和Luna长期商业竞争力的技术基础。
Prompt缓存(KV Cache)是降低重复请求成本的关键技术——在Transformer注意力机制中,每个Token需要与序列中所有历史Token计算注意力权重,其Key矩阵和Value矩阵一旦计算完毕,在处理后续Token时无需重新计算,可直接从显存(HBM)中读取。当相同的系统提示被多次使用时(如企业部署中固定的角色设定),模型可直接复用缓存的KV矩阵,完全跳过预填充计算,通常将延迟降低40-60%、成本降低50-90%。OpenAI此次引入「显式缓存断点」(Explicit Cache Breakpoints),意味着开发者可主动标记哪段Prompt需要被优先缓存——这相比此前的隐式自动缓存更加精准,对系统提示较长(超过1000 Token)的企业级API调用场景,成本控制效果尤为显著。
此外,新版本通过显式缓存断点优化了Prompt缓存机制,保证缓存至少30分钟有效期,运行速度最高可达每秒750个Token(约合562个英文单词/秒,适用于实时流式输出场景)。无论从成本还是速度来看,这次升级都相当务实。
官方宣称的性能亮点
OpenAI声称GPT-5.6在多项基准上表现突出:
- 在 Terminal Bench 2.1(涵盖命令行工作流规划、迭代与工具协调)上达到业界顶尖水平
- 在长周期任务测试 Gingbench 上表现优异
- 在 Exploit Bench 上,Soul的表现足以媲美Anthropic的Mist Preview,而Token消耗仅为其三分之一

新增功能同样值得关注:模型引入了「最大推理努力」选项,以及全新的「超级模式」,能调动智能体处理复杂任务。这些能力补强,是本次升级的核心价值所在。
基准测试可信度说明:Terminal Bench 2.1、Gingbench和Exploit Bench均为近年兴起的实战型基准,相比学术界常用的MMLU或MATH,这类基准更注重模型在真实工程环境中的执行能力。其中Exploit Bench专门测试模型辅助网络安全分析的能力——包括漏洞识别、概念验证代码生成和防御建议——是少数经过安全红队设计、兼顾攻防双向能力评估的标准化测试之一。Token效率(完成相同任务消耗的Token数量)作为附加维度被引入评估,反映了行业对「高性价比智能」而非单纯高分的转向。值得关注的是,官方基准与第三方实战基准在排名上的分歧往往揭示了更深层的训练优化方向差异:当一款模型在官方基准上遥遥领先,却在社区实战测试中表现平平时,通常意味着该模型的强化学习微调阶段针对特定基准格式进行了过度优化(即「基准过拟合」),而非全面提升了通用推理能力。此次GPT-5.6在Exploit Bench上的Token效率优势,若能在更大规模的社区测试中得到验证,将是其在网络安全工程场景中真实竞争力的重要佐证。
KingBench 3实测:细分项比总分更有看头
基准测试生态背景
AI基准测试生态正在经历从学术标准向实战导向的范式转移。传统基准如MMLU(大规模多任务语言理解,涵盖57个学科的选择题集合)、HumanEval(GitHub公开函数的代码补全测试)因被大量训练数据「污染」,已逐渐失去区分顶级模型的能力——当模型在预训练阶段见过大量与测试题高度相似的数据时,测试分数反映的是「记忆」而非「推理」。这一现象被称为「基准饱和」(Benchmark Saturation):GPT-4发布时MMLU得分约86%,而如今多个开源模型已突破90%,但实际使用体验的差距远不如数字差距显著。
社区自建基准因此兴起以填补这一空缺:Chatbot Arena(LMSYS)通过大规模人类盲测(用户不知道对比的是哪两款模型)构建ELO排名,具有较强的防作弊性;LiveBench使用每月从最新竞赛和论文中抽取的题目,从根本上杜绝训练集泄露;而KingBench这类个人开发者基准则更注重特定工作流的实战还原——它们的局限性在于样本量小、评估主观性较强,但优势在于能快速响应行业热点场景,捕捉官方基准难以量化的「实际好用程度」。KingBench 3涵盖Three.js 3D渲染、SVG矢量图形生成、数学推理以及多步骤智能体任务,是目前最接近真实软件工程场景的测试之一,也是区分「能聊天的模型」与「能干活的模型」的关键指标。
总分表现
UP主使用自建的KingBench 3进行评测,该测试集涵盖前端开发(Three.js开发、SVG生成)、一道高难度数学题,以及一项长周期智能体任务——模型需自行生成数据集、在本地微调一个Gemma模型,并独立构建一套Web UI。
三款模型的总分如下:
- Soul:55分,约78.6%
- Tara:44分,约62.9%
- Luna:31分,约44.3%

别被总分迷惑:细分项才是关键
初看Soul的78.6%似乎表现平平,但细分项揭示了截然不同的故事。
在高难度数学题上,Soul和Tara双双拿到满分10分——这是很少有模型能做到的成绩。而在智能体微调任务中,三款GPT-5.6模型全部满分:即便是最便宜的Luna,也独立完成了数据集生成、Gemma微调和网页UI的完整流程,得分与Fable五不相上下。
技术背景:「智能体任务」(Agentic Task)与传统单轮问答有本质区别:模型需在多个步骤中维持目标一致性,自主调用工具(文件系统、代码执行器、网络请求),并在中间步骤出错时进行自我纠错。完成「生成数据集→微调Gemma→构建Web UI」这一完整流程,模型需要跨越至少数十个决策节点,每个节点的错误都可能导致后续步骤级联失败。
这里存在一个关键的「误差累积效应」:智能体任务中早期步骤的微小偏差会在后续步骤中指数级放大,最终导致任务失败。具体到这个测试场景:如果数据集生成阶段格式错误(比如字段名大小写不一致),微调脚本可能抛出解析异常;即便微调成功,若超参数选择不当(学习率过高导致灾难性遗忘),最终模型质量会严重下降;而Web UI阶段若对模型API调用接口理解有误,整个演示流程将无法运行。学术界将此建模为「长程依赖」问题——模型需要在数十乃至数百个决策步骤中维持对初始目标的精确理解,并具备「元认知」能力(即意识到当前中间结果是否偏离目标)。GPT-5.6在此类任务上的满分表现,暗示OpenAI在强化学习微调(RLHF/RLAIF)阶段对多步骤工具调用链进行了针对性的奖励设计,使模型学会了在工具调用失败时主动回退并尝试替代方案,而不是盲目继续后续步骤。
Gemma是Google DeepMind于2024年2月发布的开源轻量级语言模型系列,提供2B和7B两种参数规格,采用与Gemini相同的技术架构但大幅缩减规模,设计目标是可在消费级GPU乃至高端笔记本上本地运行。因参数量小、微调所需显存门槛低(7B模型在单张RTX 4090上即可微调),以及完全开放权重可本地部署的特点,Gemma成为评估模型「能否引导另一个AI完成学习任务」的理想测试载体。能独立完成此类任务,意味着模型具备了真正的「工程师级」端到端执行能力:不仅理解任务目标,还能根据本地环境动态调整执行策略。值得一提的是,「灾难性遗忘」(Catastrophic Forgetting)是微调小型语言模型时的核心挑战——当模型在特定任务数据上持续训练时,它会逐渐「遗忘」预训练阶段习得的通用知识,导致微调后的模型在新任务上表现优秀,却在基础推理上急剧退化。能够在微调指令中预判并规避这一问题,是更高层次工程判断力的体现。
作为对比,GPT-5.5和Opus 4.7在同一任务上往往只能拿到两三分。换句话说,在长周期后端代理任务上,GPT-5.6系列表现极其出色。
前端开发仍是短板
但在前端与视觉任务上,模型表现明显吃力。Three.js隐形眼镜案例、折叠桌动画、SVG熊猫案例中,Soul只能拿到六到七分,而Fable五能拿到九到十分。
为何前端更难:Three.js是基于WebGL的JavaScript 3D图形库,它将底层OpenGL ES着色器语言(GLSL)封装为JavaScript API,允许在浏览器中实现实时3D渲染。SVG(可缩放矢量图形)则是基于XML的二维矢量图形标准,通过精确的数学坐标描述形状、路径和样式。这两类任务要求模型将抽象视觉意图精确转化为具有空间几何关系的代码——任何坐标、颜色或层级关系的偏差都会直接反映在视觉输出上,且难以通过语言描述来验证正确性。
更深层的原因在于「空间-语义双向映射」能力的结构性差异:生成正确的Three.js代码不仅需要理解JavaScript语法,还需要在三维欧氏空间中准确建模物体间的位置(Translation Vector)、旋转(Quaternion或Euler Angle)与缩放(Scale Factor)关系,并理解透视投影、法线方向对光照计算的影响;SVG的复杂曲线路径则要求精确计算三次贝塞尔曲线的控制点坐标,稍有偏差便会产生视觉上完全错误的形状。
纯语言预训练的模型倾向于以语义关系(「大的在上面」「颜色更深」)描述空间,而非以坐标关系(「Y轴偏移0.3个单位」「opacity: 0.7」)理解语义,导致在精确图形输出上存在系统性弱点。相比之下,后端代理任务具有更明确的二元成功/失败信号(代码抛出异常vs.正常返回结果),这种清晰的奖励信号更适合强化学习微调,也更有利于模型通过「执行-报错-修复」循环发挥自我纠错能力。这一结构性差异解释了为何GPT-5.6在后端满分、却在前端持续落后于Fable——这不仅是训练数据分布的问题,也与模型对「空间-视觉」关系内部表征的深度有关。Anthropic的Fable在此类任务上的持续领先,可能与其在视觉理解方向上更深度的多模态对齐训练密切相关,其视觉编码器与语言模型之间的融合方式,使其在将视觉意图转化为精确坐标描述时具备了结构性优势。
UP主坦言,自己的基准测试偏向前端和视觉任务,因此GPT-5.6的总分被一定程度低估——前端开发依然不是OpenAI的强项。
与竞品横向对比
在综合排行榜上,各模型得分如下:
- Fable五:88.57%(稳居榜首)
- Opus 4.8:87.14%
- Gemini 5.2:81.43%
- Soul:78.57%
- GPT-5.5:38.57%

最惊人的对比来自代际差距:Soul的得分几乎是上一代GPT-5.5的两倍,无论从哪个角度看,这都是一次显著的能力跃升。
横向对比的方法论局限:值得注意的是,KingBench 3作为单一评测者的自建基准,样本量有限(总分70分对应约10-15个测试用例),且UP主自述测试集偏向前端与视觉任务,这系统性地压低了GPT-5.6在后端任务上的相对得分。Opus 4.8以87.14%接近Fable的成绩尤为值得关注——这意味着Anthropic同时保有前两名,与其在多模态对齐上持续投入的战略一致。Gemini 5.2的81.43%则反映了Google在代码生成与多语言任务上的持续进步,与其Gemini 1.5 Pro以来在长上下文处理(支持100万Token上下文窗口)上的技术积累密切相关。在解读任何单一基准排名时,理解测试集的构成偏向与评估者的使用场景,至少与关注排名数字本身同等重要。GPT-5.5的38.57%与Soul的78.57%之间接近一倍的代际差距,在同一产品线内实属罕见——这一跳跃幅度通常需要架构级创新(如从Transformer到Mixture-of-Experts的升级)或训练范式的根本性转变(如大规模引入合成数据或多模态预训练),而非简单的数据扩容或计算规模提升。这一数据点本身值得深究,也为外界推测GPT-5.6底层架构变化提供了重要线索。
客观评价:进步扎实,但谈不上颠覆
本质是5.5的增量迭代
UP主给出了冷静判断:GPT-5.6相比GPT-5.5属于增量提升,属于演进而非革命。Soul、Tara、Luna的命名营销味道较浓,意在对标Anthropic的Fable、制造「全新类别」的印象,但深入观察实际表现,它更像是「性能更强、价格更优」的5.5迭代版。
能追上Fable吗?
答案是「还差一点,但已经很接近」。Fable依然是综合能力最强的模型,尤其在前端和视觉任务上优势明显。但Soul在以下两个方向已实现追赶甚至超越:
- 网络安全任务的Token效率
- 智能体基准测试表现

在智能体任务上,Soul已能与Fable比肩,而Fable最大的软肋是成本——它是目前最昂贵的选择。相比之下,Soul的 5美元/30美元定价具备明显性价比优势。
能力收敛的行业意义:Soul与Fable在智能体任务上的接近,标志着顶级AI模型正在进入「能力收敛期」——即最强模型之间的性能差距正在缩小,而定价与生态成为新的竞争主轴。这一趋势对企业决策者的含义在于:在工具调用、代码执行、多步骤自动化等核心企业场景中,选型标准正在从「哪款模型更聪明」转向「哪款模型更便宜、更稳定、更易集成」。OpenAI此次定价策略的务实性,可能比性能数字本身更具战略意义。历史上,算力成本每18个月下降约50%(类摩尔定律曲线在AI推理领域的体现),这意味着今日的「性价比选手」Luna,很可能在一年后成为主流企业场景的默认首选——届时Soul级别的能力可能已以Luna的价格提供。这一预判也解释了OpenAI为何要给三款模型赋予独立品牌名称:当成本曲线持续下移、能力曲线持续上移时,拥有独立品牌的产品线才能在不引发「自我蚕食」恐慌的情况下,让用户自然地从低端向高端迁移。从更宏观的视角看,「能力收敛」并不意味着竞争终结,而是意味着竞争维度的升级:当所有顶级模型都能「做到」某件事时,「做得多快」「花费多少」「与现有系统多易集成」将成为决定市场格局的新变量,这与PC时代从「能不能运行Office」到「运行Office有多流畅」的竞争演变高度相似。
选型建议
基于本次预览测评,给出如下参考建议(正式发布前仍可能有所变化):
- 重度前端与视觉开发:Fable或Opus 4.8依然是首选
- 后端代理任务、长周期自动化任务:Soul是极佳选择,且成本低得多
- 性价比最优的代理模型:Luna按单位输入成本计算,几乎碾压所有竞品
总体而言,GPT-5.6是一次定价合理的强劲升级,弥补了与Fable之间的大部分差距。虽然不如官方宣传的那般颠覆,但确实值得重点关注——尤其对于成本敏感、以后端代理任务为主的开发者而言,GPT-5.6系列可能是当下最具吸引力的选项之一。
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。