GPT-5.6三款新模型实测:Soul/Terra/Luna全面解析

GPT-5.6三剑客登场:Soul、Terra与Luna
OpenAI近日突然预览了下一代前沿模型系列GPT-5.6,一口气推出三个型号:Soul、Terra和Luna,每个都针对不同使用场景做了明确定位。
Soul是这次的旗舰模型,相比GPT-5.5是一次明显的大升级,定价维持不变——每100万输入Token 5美元,每100万输出Token 30美元。Terra定位为均衡款,成本约为Soul的一半,主打效率,更适合日常高频使用。Luna则是系列中的Flash模型,面向大批量任务,兼顾速度与低价,定价低至每100万输入Token 1美元、输出Token 6美元,是性价比最高的选择。
Token与定价逻辑:Token是大语言模型处理文本的基本单位,通常一个英文单词约对应1-2个Token,中文字符约对应1-2个Token。模型的定价以每百万Token计算,分为输入(Prompt)和输出(Completion)两部分,输出Token通常更昂贵,因为生成过程需要逐个Token自回归推理,计算量远大于一次性编码的理解过程。三档定价的策略本质上是算力资源的分层定价——旗舰模型通常参数规模更大、推理步骤更深,消耗更多GPU显存与计算周期;轻量模型则通过架构精简或知识蒸馏(Knowledge Distillation)技术降低推理开销,知识蒸馏通过让小模型模仿大模型的输出分布来继承其能力,而非从零训练,从而显著压缩部署成本并让利给用户。这种分层定价模式在云计算领域早有先例(类比AWS的不同EC2实例规格),但应用于AI模型时更具动态性:随着硬件成本下降(如H100到B200的代际演进)和推理优化技术进步(量化、投机采样等),同等性能的Token价格往往每隔6-12个月就会出现显著下滑,这一趋势在过去两年已有充分验证。
值得关注的是,据称三个模型全都配备了50万Token的超大上下文窗口。这一数字意味着模型可以同时处理约37.5万个汉字或数百页文档,对于长文档分析、复杂代码库理解和多轮深度对话具有革命性意义。
上下文窗口的技术演进:上下文窗口(Context Window)是指模型在单次对话或任务中能够同时"看到"和处理的最大Token数量。从技术层面看,扩大上下文窗口面临两大核心挑战:其一是标准Transformer注意力机制(Attention Mechanism)的计算复杂度随序列长度呈平方级增长(O(n²)),意味着处理50万Token所需算力并非4K Token的125倍,而是远超这一数字的量级,内存占用同样急剧膨胀;其二是"迷失在中间"(Lost in the Middle)问题——斯坦福大学2023年的研究表明,即使模型技术上能处理长上下文,其对文档中间部分的关注度也会显著低于首尾,导致实际有效利用率大打折扣,模型可能"看了"但并未真正"理解"中段内容。近年来,滑动窗口注意力(Sliding Window Attention)、稀疏注意力(Sparse Attention)将计算复杂度压缩至近线性、以及RoPE(旋转位置编码)改进对超长距离位置关系的更好建模,这些技术的协同突破才使50万Token级别的上下文窗口从理论走向商业落地。相比之下,GPT-3.5的上下文窗口仅有4K Token,GPT-4初代为8K-32K,短短三年技术演进速度惊人。GPT-5.6这一代的核心思路,是在智能、速度与成本之间给用户提供更灵活的取舍空间。
这次发布的节奏本身也颇具戏剧性。此前业界曾预测GPT-5.6可能在6月发布,后又传言推迟至7月,但OpenAI最终提前上线。分析认为,这与近期Anthropic和美国政府之间持续发酵的监管风波密切相关。
受限发布:仅对可信合作伙伴开放
目前,GPT-5.6系列仅在API和Codex中做有限的预览,且只对少数经美国政府批准的可信合作伙伴开放。背后原因,正是美国政府正在对前沿AI模型展开更严格的国家安全审查。
AI国家安全审查的政策背景:美国对前沿AI模型的监管,根植于《出口管理条例》(EAR)和NIST AI安全框架的双重体系。2023年拜登政府签署的AI行政令首次将"双重用途基础模型"(Dual-Use Foundation Models)纳入国家安全管控范畴——所谓"双重用途",是指同一模型既可用于合法的医疗研究或代码开发,也可能被用于设计生化武器或发动网络攻击,要求超过特定算力阈值(当时定为10²⁶ FLOPs)的模型训练必须向政府报告安全测试结果。网络安全能力是审查的核心关切——当一个AI模型能够自主发现零日漏洞(Zero-Day Vulnerability,即尚未被厂商知晓和修补的安全漏洞)或渗透政府系统时,它实质上具备了"进攻性网络武器"的潜力,美国国家安全局(NSA)和网络安全与基础设施安全局(CISA)均参与对此类模型的评估。值得注意的是,这一监管框架并非孤立存在,而是嵌套于更宏观的《芯片与科学法案》(CHIPS Act)和AI出口管制体系之中——限制特定算力芯片出口(如NVIDIA H100/H800)与限制前沿模型访问,共同构成美国维持AI技术优势的两条平行战线,前者卡住硬件供给,后者管控软件能力,形成双重封锁。

好消息是,GPT-5.6 Soul已悄悄推送给部分Codex用户。用户可在Codex数据分析面板中查看自己是否进入首批名单。据推测,未来两三周内,大部分用户应能陆续获得访问权限。
能力方面,OpenAI宣称GPT-5.6是目前最强模型,并在TerminalBench 2.1智能体编码任务上刷新了SOTA成绩,明显超越GPT-5.5,同时超过Claude Opus 5、Fable 5和Gemini Pro。
SOTA与TerminalBench评测体系:SOTA(State of the Art)是AI领域描述某一任务上当前最佳性能的术语,通常以标准化Benchmark(基准测试)的得分来量化和比较。TerminalBench 2.1是专门针对AI智能体(Agent)在真实终端环境中执行编码任务的评测集,与传统的静态代码补全测试(如HumanEval、MBPP)有本质区别:它更强调模型在动态、多步骤任务中的规划、工具调用与自我纠错能力。智能体编码任务(Agentic Coding)代表了AI辅助编程的下一阶段:模型不只是在光标处补全代码片段,而是能自主分解复杂需求、调用Shell命令和外部API、执行并观察结果、在出错时回溯调试并迭代改进——这一闭环能力更接近真实工程师的工作方式,因此业界普遍认为其参考价值高于HumanEval等传统静态Benchmark。需要指出的是,Benchmark竞赛本身存在"数据污染"(Data Contamination)风险——若模型训练数据中包含测试集的题目或高度相似的内容,模型得分可能虚高,无法真实反映泛化能力。这也是为什么学界和产业界持续推出新评测集,并倾向于使用动态环境测试(如TerminalBench这类每次运行都有随机性的设计)来规避静态榜单失真的重要原因。
模型在生物学和网络安全方向也有大幅提升,在高级漏洞研究类任务中,仅需约三分之一的输出Token即可给出有竞争力的结果。OpenAI还推出了新的Max Reasoning模式,以及可调用多个子代理的Ultra模式。
GPT-5.6 Soul实测:从Minecraft到宝可梦RPG
以下是对GPT-5.6 Soul的一系列真实测试,也是本次评测最值得关注的部分。
Minecraft克隆项目——Soul生成的游戏落地页表现出色,支持多种选项配置,并能真正生成可交互的游戏世界。进入游戏后的环境表现比此前在Fable中看到的Demo更有生命力,涵盖多种方块类型、云朵动画、沙漠地形、怪物合成系统和昼夜循环。虽然拾取方块等部分功能尚不完善,细节精细度也未达到Fable级别,但整个生成过程仅耗时约90分钟,完成度已相当可观。

宝可梦风格RPG——Soul凭借一段简短的Prompt,在31分钟内一次性生成了一个模拟器风格的游戏。受版权限制无法完全复刻,但其生成的致敬作品包含多个道馆、8枚可收集徽章、初始伙伴选择,乃至内置后期挑战系统。
SpaceX星舰仿真——在与GPT-5.5 Pro的横向对比中,Soul生成的星舰助推器回收捕获仿真效果准确且真实,助推器被夹臂精确接住,整体流程呈现到位。
在Boxo平台上,Soul约耗时44分30秒完成的成果,相比GPT-5.5 Pro提升明显,尤其在制作3D世界时表现格外熟练。这些提升的核心原因在于:推理预算扩大了,内部思考空间从约768提升至接近1000。
推理预算与思维链扩展的原理:推理预算(Reasoning Budget)是指模型在给出最终答案之前,被允许进行内部"思考"所消耗的Token上限。这一概念源于Chain-of-Thought(思维链,CoT)技术——2022年谷歌研究团队发现,通过让模型先生成中间推理步骤再得出结论,可以在数学推理和逻辑题上显著提升准确率,原理类似于人类解题时"先打草稿、再写答案"的认知过程。推理预算从768提升至接近1000,意味着模型有更充裕的"草稿空间"进行自我校验(检查前面步骤是否矛盾)、多角度推演(同时探索几种解法路径)和主动纠错(发现错误后回溯重来),这在需要多步骤规划的游戏生成、复杂代码架构等任务中尤为关键。代价是在推理阶段消耗更多Token(直接影响用户成本),但换来的是更高的输出质量。OpenAI的o系列模型率先将这一机制商业化,如今已成为前沿推理模型的标配设计。值得一提的是,推理预算的动态分配本身也在成为新的研究热点——理想情况下,模型应能根据任务难度自适应调整思考深度:简单的问候语快速作答,复杂的代码架构设计充分推演,而非对所有请求一律消耗固定预算,这正是"自适应计算"(Adaptive Computation)方向的核心命题,也是降低推理成本的重要潜力所在。
虽然在部分场景会消耗更多Token,但换来的是更充分的推理过程和更高的输出质量。从早期跑分看,GPT-5.6 Soul整体仍略低于Fable 5,但差距极小,部分项目已能打平甚至反超。
Fable 5解禁在即:国家安全博弈背后的真相
另一条重磅消息,是关于Anthropic的Fable 5被下架事件出现了新进展。据报道,Fable 5曾能攻入美国政府的安全系统,这是其被禁用的核心原因。

如今,特朗普政府已接近允许Anthropic恢复Fable 5的访问权限,最早可能本周就会解除限制。Anthropic官方声明确认,自6月12日起,公司一直在与政府密切合作,推动Mithos 5和Fable 5的恢复上线。目前政府已批准将Mithos 5重新部署给部分负责关键基础设施的美国机构,约100个组织已重新获得访问权限。
不过,重新上线的版本很可能经过"安全瘦身"——配备更严格的安全护栏(Safety Guardrails,即对特定类型输出的过滤与拒绝机制)、更严格的访问控制,甚至削弱网络安全相关能力,面向公众的开放程度也可能比此前收紧许多。
针对"Anthropic CEO Dario在制造恐慌"的质疑,此前的分析并不认同这一说法。美国政府拥有NSA、情报机构、网络安全专家和科学顾问,不可能仅因某位CEO的表态,就去限制一个价值数十亿美元、影响AI竞赛格局的前沿模型。监管层真正担心的三点是:能力落入错误的人手中、中国通过蒸馏等方式获取或复现这些能力、针对美国基础设施的进攻性网络行动。
知识蒸馏与能力扩散风险:知识蒸馏(Knowledge Distillation)最初由Hinton等人在2015年提出,是一种将大型"教师模型"的能力迁移至小型"学生模型"的技术——核心思路是让学生模型不仅学习正确答案的标签,更学习教师模型输出的完整概率分布(即"软标签"),后者包含了远比硬标签更丰富的知识结构信息。在AI安全语境中,这意味着竞争对手即使无法直接获取模型权重(权重是模型的"源代码",受严格保护),也可以通过大规模API调用来收集输入输出对,进而训练出行为高度相似的模仿模型,从而绕过出口管制——这正是美国政府在制定AI监管政策时面临的根本性悖论:完全开放API会加速能力扩散,而过度封锁则会扼杀本国AI生态的创新活力和开发者生态。从技术可行性看,蒸馏并非万能——大规模调用顶级API成本极为高昂,且蒸馏出的学生模型往往只能复现教师模型的"表面行为模式",而非其内在的深层推理结构与泛化能力,这在网络安全等需要对未知场景深度泛化的领域尤为明显。然而这一潜在风险已足够引发监管层的高度警惕,这更像是基于情报机构内部能力评估的国家安全决策,而非某位高管几句话就能触发的连锁反应。
GLM 5.5传言与企业市场的暗战
来自ZAI(GLM背后公司)的消息同样值得关注。据传该公司正在展示一款新模型,在发现安全漏洞方面的能力可能已能与被视为网络安全最强的Claude Mithos一较高下,而这款模型很可能正是GLM 5.5。

这条消息从侧面印证了中美AI实验室在网络安全方向的竞争已进入白热化阶段。关键问题在于:它能否在真实安全工作中接近Mithos的水准,还是仅在特定Benchmark上表现亮眼,仍有待验证。
中美AI能力竞争的结构性背景:GLM系列模型由清华大学知识工程实验室(KEG)与智谱AI联合研发,是中国在基础大模型领域自主研发路径的代表性成果之一。与美国实验室主要依赖私人风险资本(OpenAI背后是微软与红杉等VC,Anthropic背后是谷歌与亚马逊)不同,中国的前沿AI研发呈现出"产学研政"深度融合的特征——高校承担基础架构研究与人才培养,企业负责大规模工程化落地与商业化推进,国家战略资源(算力补贴、数据要素市场、应用场景开放)形成合力支撑。网络安全能力的追赶尤为政治敏感:AI辅助漏洞发现能力不仅是技术竞赛的维度,更直接关乎国家网络攻防的战略资产储备,一旦某国AI在此方向形成代差优势,在全球关键基础设施安全格局上的影响将是结构性的,这也解释了为何美国政府对"中国通过蒸馏复现顶级安全能力"的担忧如此之深,已上升至国家安全委员会层面的议题。
另一个值得关注的商业案例来自Anthropic。据报道,按付费交易计算,在美国企业支出中,Anthropic的商业和企业使用量已超过OpenAI。其中的逻辑颇具洞见:AI竞争已不只是比谁的模型更聪明,而是比谁的模型能真正嵌进企业每天的工作流——就像90年代Windows和Office所做的那样。
工作流经济学与企业AI采购逻辑:工作流经济学(Workflow Economics)描述的是企业评估AI工具时的核心决策框架:不是比较模型在抽象Benchmark上的能力分数,而是量化其对具体业务流程的ROI(投资回报率)和TCO(总拥有成本)。软件开发场景之所以成为企业AI的最早突破口,在于其可量化性极强:代码审查时长、Bug修复周期、功能交付速度(Story Points per Sprint)均可精确测量并转化为工时成本,企业能用数字清晰向财务部门证明AI带来的价值。这与AI在创意写作或战略咨询中的应用截然不同——后者的价值评估高度主观,ROI难以量化。随着各大模型厂商竞相推出IDE插件(如Cursor、GitHub Copilot)、企业知识库深度集成(RAG架构)和端到端工作流自动化工具,AI的竞争主战场正从"模型智能的绝对分数"迁移至"系统粘性与生态锁定"。从历史先例看,Oracle和SAP数十年来的企业市场护城河并非来自技术持续领先,而是来自深度嵌入企业ERP核心流程后极高的迁移成本(替换一套SAP系统往往需要数年时间和数千万美元)——这种"粘性优先于智能"的商业逻辑,正是各大AI厂商在激烈竞争中争相复制的战略蓝图。
软件开发场景之所以成为Anthropic的突破口,正是因为工作本身高度数字化,企业能清晰看到"构建更快、Bug更少、评审更短"的实际价值。
当然,这并不意味着OpenAI已输掉企业市场。更现实的格局是企业针对不同任务搭配不同模型:Claude写代码、Gemini做多模态、OpenAI处理生产力任务、低成本模型处理低价值工作。AI竞赛的下一阶段,本质是工作流经济学——谁的系统能让流程更顺畅、更省心,同时让企业觉得钱花得值。
Grok 4.5浮出水面:下一个前沿挑战者?
最后,马斯克近日发文暗示XAI可能正在准备下一次重大发布。据其表述,Grok 4.5已进入私有Beta阶段,正在SpaceX和特斯拉内部测试,综合性能约达Claude Opus水平。该模型基于XAI全新的1.5万亿参数V9基础架构,并使用了Cursor数据做额外训练以强化编码能力。
MoE架构与万亿参数模型的技术内涵:Grok 4.5所基于的1.5万亿参数V9架构,极有可能采用了混合专家(Mixture of Experts, MoE)设计——这是当前训练超大规模模型的主流路径。MoE架构的核心思想是将模型分割为若干"专家"子网络,并配备一个轻量级"路由器"(Router)模型,对于每一个输入Token,路由器动态选择最相关的Top-K个专家参与计算,其余专家保持静默。这意味着模型拥有1.5万亿总参数(决定了知识容量的上限),但每次前向推理实际激活的参数量通常只有总量的10%-20%左右,从而在保持超大知识容量的同时,将单次推理的计算成本控制在稠密模型的小分之一以内。GPT-4、Gemini Ultra以及Mixtral系列均被外界推测或确认采用了类似架构。使用Cursor数据做额外训练则是领域微调(Domain Fine-tuning)的典型策略——Cursor作为日活跃用户数量庞大的AI编程IDE,积累了海量真实开发者交互数据,涵盖多样化的编程语言、代码风格和调试场景,以此训练可以让模型的编码行为更贴近真实开发者习惯与期望,而非仅仅在竞赛性算法题目上表现优异。此外,XAI独特的战略资产在于马斯克旗下特斯拉(自动驾驶决策数据)和SpaceX(航天工程仿真与控制数据)的内部真实场景数据,这些高度专业化的垂直领域数据在全球绝大多数AI实验室均无从获取,可能构成其在特定工程场景下难以复制的独特优势。
Grok 4.5有望成为前沿AI竞赛中又一个分量十足的新玩家。可以预见,随着GPT-5.6逐步全面开放、Fable 5可能解禁、GLM 5.5即将登场以及Grok 4.5蓄势待发,接下来数周的AI竞赛将异常精彩。
核心要点
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。