GPT-5.6三款新模型发布:Luna、Terra、Sol主打智能体长任务
GPT-5.6三款新模型发布:Luna、Terra、Sol主打智能体长任务
OpenAI推出GPT-5.6家族:Luna、Terra、Sol
OpenAI最新旗舰模型GPT-5.6正式全面开放,一次性推出三个不同规格版本:Luna、Terra与Sol,分别对应从小到大的能力与算力层级。与以往单一旗舰的发布策略不同,这种分档打法让开发者可以根据任务复杂度与成本预算灵活选型,延续了OpenAI「让智能更普惠、更易负担」的产品思路。
三款模型共享相同基础规格:知识截止日期均为2026年2月16日,均支持百万级(1M)token上下文窗口,以及最高128,000 token的输出长度。无论选择哪一档,开发者都能处理超长文档、大型代码库或复杂多轮对话,差异主要体现在推理能力与调用成本上。
定价策略:「每token成本」为何已难以说明问题
三款模型按每百万输入/输出token计费:Luna为$1/$6,Terra为$2.50/$15,Sol为$5/$30。作为对比,Anthropic的Claude Opus系列为$5/$25,Claude Fable 5则高达$10/$50。
然而,正如资深AI观察者Simon Willison所指出的,单看「每百万token价格」如今已很难说明问题。理解这一判断,需要先了解推理Token(Reasoning Tokens)的本质:它是现代大语言模型在生成最终答案之前,在内部进行「思维链」推导时所消耗的token。以OpenAI的o系列和Anthropic的Claude扩展思维模式为例,模型会先生成数千乃至数万个「思考步骤」token——这些token通常对用户不可见,但会被计入计费。这意味着一个标价看似便宜的模型,若针对某类任务触发了大量推理过程,实际账单可能远超预期。不同模型完成同一任务时消耗的推理token数量可能相差极大——标价更低的模型如果需要数倍推理token才能得出答案,实际成本反而可能更高。真正有意义的比较维度,已从「单价」转向「完成特定任务的总成本」。
核心卖点:长时间运行的智能体任务表现
OpenAI这次最重磅的基准测试主张,集中在「长时间运行的智能体(agentic)任务」上,反映出整个行业重心正从「一问一答」向「自主完成多步骤复杂工作流」迁移。
要理解这一转变的意义,需要厘清智能体任务与传统问答模式的本质差异。传统大语言模型交互是「单轮问答」:用户输入一个问题,模型返回一个答案,整个过程在毫秒到秒级完成。而智能体任务则要求模型自主规划、拆解目标,循环调用工具(搜索、代码执行、文件读写、API调用等),并根据每步执行结果动态调整策略,整个流程可能持续数分钟乃至数小时。这种模式下,模型需要具备长期记忆管理、错误恢复、资源调度等能力,对上下文窗口长度和指令跟随稳定性的要求远高于单轮问答——这正是GPT-5.6强调百万token上下文与长时间运行能力的根本原因。
官方援引了名为 Agents' Last Exam 的评测——覆盖55个专业领域、模拟长时间运行专业工作流的评估体系。数据显示:
- GPT-5.6 Sol 取得 53.6 的新高分,比采用自适应推理的Claude Fable 5高出 13.1分
- 在「中等推理强度」下,Sol仍以约四分之一的估算成本领先Fable 5达11.4分
- 更小的Terra与Luna也能在约1/16的成本下超越Fable 5
OpenAI强调,GPT-5.6的训练目标是「从每一个token中榨取更多有用的工作产出」。若这些数据经得起独立验证,真正的意义不在于跑分更高,而在于性价比曲线的整体下移——让原本需要顶配模型才能完成的智能体任务,可由更廉价的中小型号承担。
一个值得关注的例外:SWE-Bench Pro编程评测
并非所有基准都对GPT-5.6有利。在广受关注的编程评测 SWE-Bench Pro 上,Claude Fable 5以 80% 的成绩大幅领先GPT-5.6 Sol的 64.6%。
理解这一结果,需要了解SWE-Bench的设计原理:该基准由普林斯顿大学研究团队于2023年提出,核心设计是从真实GitHub仓库中提取已解决的Issue,要求模型自动生成能通过对应单元测试的代码补丁。其Pro版本进一步筛选了更复杂、跨文件修改的真实工程问题,被视为衡量模型「真实软件工程能力」的黄金标准之一。然而,该基准的局限在于:测试用例依赖仓库原有测试套件的质量,若原始测试不完整或存在歧义,评测结果就会失真。
耐人寻味的是,就在GPT-5.6发布前一天,OpenAI「恰好」发表了一篇专门审计SWE-Bench Pro的文章,指出该基准存在质量问题:
基于这些结果,我们估计约30%的SWE-bench Pro任务本身是「有问题的(broken)」,并建议模型开发者仔细审视相关结果。
评测集确实可能存在噪声,OpenAI的质疑在技术层面有其依据;但在自家模型落后的基准发布前夕主动质疑该基准,也难免被解读为预防性公关操作。对开发者而言,理性的态度是:不迷信任何单一基准,尤其是模型厂商自报的数据,应结合自身实际工作负载进行验证。
真实体验:竞争力强,但未必全面碾压
提前获得GPT-5.6 Sol访问权限的Simon Willison给出了相对克制的一手评价:Sol「确实非常能干」,但在他日常使用的复杂编程任务上,「到目前为止并未让我觉得比Fable更强」。
这一观察与SWE-Bench Pro的分数形成呼应,也提醒我们:官方营销所强调的「长任务智能体优势」,未必能在每一个具体场景(尤其是硬核代码任务)中直接转化为体感提升。模型选型终究要回归「你到底要用它做什么」这一根本问题。
不可忽视的新API能力
对开发者而言,随GPT-5.6一同更新的API能力往往才是最有实用价值的部分。官方模型使用指南中隐藏了几项颇具想象空间的新特性:
编程式工具调用(Programmatic Tool Calling)
要理解这一特性的价值,需要先了解它与现有MCP协议的关系。**MCP(Model Context Protocol)**是Anthropic于2024年底提出并开源的标准化协议,旨在统一AI模型与外部工具、数据源之间的通信接口,类似于「AI领域的USB-C标准」。MCP的调用模式以「单次声明式调用」为主——模型选择调用哪个工具,等待结果,再决定下一步。
而GPT-5.6的编程式工具调用则更进一步:该功能允许模型「编写并运行JavaScript来编排工具调用」——模型不再只是「一次调用一个工具」,而是可以用代码编写循环、条件分支、并行调用逻辑,将多个工具的调用编排成完整的脚本。这有望弥合MCP与完整终端会话之间的鸿沟,让模型像人类工程师一样组合CLI工具链完成任务,相当于从「点菜」升级为「自己下厨」。
原生多智能体(Multi-agent)支持
模型现在可以「拉起子智能体(subagents)进行并行的、聚焦的工作」。过去需要开发者在应用层自行搭建的「主智能体+子智能体」模式,如今直接内置进核心API,大幅降低了构建复杂智能体系统的门槛。
提示缓存断点(Prompt Cache Breakpoints)
OpenAI引入了类似Claude的显式提示缓存机制,值得深入了解其技术原理:提示缓存的核心是复用已计算的KV缓存(Key-Value Cache)。在大语言模型推理过程中,输入序列的每个token都需要经过Attention机制计算,生成对应的键值向量并存入缓存。若每次请求都包含相同的长前缀(如系统提示、工具定义、长文档),重复计算这些部分既耗时又耗费算力。提示缓存允许API将这些计算结果保留在服务器端,后续请求命中缓存后,缓存部分的计费通常可打折至原价的10%~25%。Anthropic最早引入显式缓存断点标记,让开发者精确控制哪些内容需要缓存;OpenAI此次跟进,允许开发者手动指定缓存断点,而不必完全依赖API自动检测。对于大量使用长系统提示或RAG(检索增强生成)场景的团队,这可带来可观的成本节省。此外,图像请求新增了 detail: original 选项,可在处理前完全不对图片进行缩放,为视觉敏感任务保留完整图像信息。
结语:竞争焦点从「更聪明」转向「更划算」
GPT-5.6家族最核心的叙事,并非某个维度上的绝对碾压,而是效率——用更低成本完成同样甚至更多的智能体工作。三档产品线、内置多智能体与编程式工具调用,都指向同一方向:让自主完成长任务的AI变得更便宜、更容易部署。
当然,SWE-Bench Pro上的落后、发布前夕的基准质疑,以及提前体验者「未见明显超越」的评价,也都提醒我们保持冷静。在模型迭代日益频繁的当下,最可靠的判断依据始终只有一个:拿你自己的真实任务,亲手跑一遍。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。