GPT-5.6发布:旗舰模型Sol亲自训练小模型,AI递归自我改进成真

OpenAI GPT-5.6 深度解析:Sol训练Luna,递归自我改进走入现实
OpenAI 正式发布了 GPT-5.6 系列模型,但真正引发讨论的并非榜单成绩,而是一个耐人寻味的细节:在发布会直播中,OpenAI 表示——旗舰模型 Sol 亲自完成了小模型 Luna 的后训练(post-training)。这意味着 AI 开始参与开发下一代 AI,「递归自我改进」(recursive self-improvement)不再只是理论。
所谓递归自我改进,是 AI 安全领域长期讨论的核心命题。其哲学根基可追溯至1965年,英国数学家 I.J. Good 在其论文《关于第一台超智能机器的推测》中首次系统阐述了「智能爆炸」假说:一旦机器能设计出比自身稍强的版本,这个过程便可无限迭代,形成远超人类控制的加速循环。这一假说后来成为 AI 安全研究的核心焦虑来源,Nick Bostrom 在2014年的《超级智能》一书中将其发展为「控制问题」的理论框架。在技术实现路径上,递归改进分为能力改进(让 AI 更聪明)和效率改进(用更少资源做同样的事)两条线索。Sol 训练 Luna 更接近后者——利用更强的旗舰模型系统化地优化较小模型的训练流程,属于有限度、有监督的递归改进,而非科幻作品中完全脱轨的自主进化。尽管如此,这一公开承认的生产级落地案例,标志着该议题从思想实验正式进入工程现实。
Sol 训练 Luna:「AI 训练 AI」的关键实验
GPT-5.6 家族包含三款模型,命名颇有天体意味:Sol(太阳)是最大、最智能、也最昂贵的旗舰;Terra(大地)定位中端,面向日常专业工作;Luna(月亮)则是主打规模化、重复性任务的成本控制型模型。
最令人震撼的是 OpenAI 公开的一个细节:他们展示了一名研究员在 Codex 中使用的真实提示词,让 Sol 自主为 Luna 启动后训练任务。这个提示词非常简短——大意是「找到训练配置、找到合适的 GPU、启动脚本并确保它能跑通」。剩下的工作交给 Sol 自己完成。
值得深入理解的是,后训练(Post-Training)并非对模型的简单微调,而是决定模型最终「性格」与能力边界的关键阶段,也是现代大语言模型研发中最具决定性的工程环节。其技术演进折射了整个行业认知的深化:第一阶段的监督微调(SFT)通过高质量人工标注的问答对,将预训练模型的「下一词预测机器」特性转化为「任务执行助手」;第二阶段的基于人类反馈的强化学习(RLHF)——由 OpenAI 在 InstructGPT 论文(2022)中系统提出——引入奖励模型和 PPO 算法,让人类偏好信号驱动模型行为优化,ChatGPT 的对话质量飞跃很大程度上源于此;近年兴起的基于 AI 反馈的强化学习(RLAIF)则试图用更强的 AI 模型代替人类标注者,Anthropic 的 Constitutional AI 是代表性实践。预训练负责让模型学习语言规律和世界知识,消耗算力占比极大;而后训练则决定安全边界与任务执行风格,对最终用户体验影响显著。Sol 主导 Luna 的后训练,意味着数据筛选的判断标准、奖励模型的构建逻辑、训练超参的调优策略,这些原本依赖资深研究员直觉与经验的环节,正被旗舰 AI 系统性接管。

这与 Andrej Karpathy 近期开源的 Auto Research 项目思路高度一致。该项目所代表的「AI 自主科研」范式,在技术上延续了神经架构搜索(NAS)和元学习(Meta-Learning)的核心思想,但将其扩展到了更完整的研究周期:给 AI 智能体一套真实的语言模型训练环境,让它自主提出假设、设计实验、执行训练、解读结果并迭代方向,若实验带来提升就保留结果,否则丢弃,循环往复。Google DeepMind 的 AlphaCode、FunSearch 等项目已在数学和算法优化领域验证了类似路径的可行性。区别在于,OpenAI 不是用家用电脑上的小模型跑这套思路,而是用当前最前沿的旗舰模型来驱动整个流程——当最强的前沿模型被用于优化下一代模型的训练时,AI 研发的迭代速度理论上将以过去难以想象的节奏加快。OpenAI 研究员坦言,「自动化研究员」的到来似乎已不再遥远。
值得关注的是,Anthropic 近期招募 Karpathy,业界普遍猜测正是瞄准类似方向。多家前沿实验室都在向「AI 加速 AI 研发」这一目标推进。
五大前沿实验室同台竞技
这次发布恰逢竞争白热化的节点。据视频作者观察,过去 24 小时内 xAI/Grok 与 Meta 也相继发布了具备前沿竞争力的模型,一夜之间「前沿 AI 实验室」从少数几家扩张至五家,节奏令人目不暇接。
OpenAI 此次还引入了新的推理强度档位——Ultra 模式。这一设计背后是「链式思考」(Chain-of-Thought)与测试时计算扩展(Test-Time Compute Scaling)两大研究方向的融合产物。Google 研究员在2022年的论文中发现,允许模型在给出最终答案前生成中间推理步骤,可大幅提升复杂任务准确率。OpenAI 的 o 系列模型将这一思路推进为可控的「思考 token」机制:模型在生成可见答案之前,先在隐空间进行大量内部推演,而这部分推演的深度与长度可以被外部参数控制,即「思考预算」(Thinking Budget)。此前 Anthropic 也有类似的多档推理设计(low / medium / high / extra high),而 OpenAI 在 max 之上进一步加了 ultra 档,专门用于处理最高强度的复杂任务。Ultra 模式相当于给模型开放几乎无上限的思考空间——但这也引出了「过度思考」(Overthinking)问题:模型在简单问题上消耗大量推演 token 却反而引入更多不确定性。这种分级推理设计的本质,是让模型根据任务难度动态分配思考预算——简单任务快速响应,复杂任务深度推演,从而在成本与质量之间找到最优平衡点。
性能对比:更强、更便宜、更快、更省 token
GPT-5.6 的核心叙事不只是「分数更高」,而是在同等甚至更高分数下,成本、延迟和输出 token 全面占优。OpenAI 特别用图表强调了「智能 vs 成本」这条效率曲线。
几个关键数据:
- 在 Agent's Last Exam 上,Claude Fable 5 得分 40.5%,花费高达 $2,300;GPT-5.6 Sol 得分 53.6%,成本仅 $763。
- 在 Artificial Analysis 编码智能体指数上,GPT-5.6 Sol 拿到 80 分,创下 SOTA,比 Fable 5 高 2.8 分,同时输出 token 不到其一半、耗时不到一半、成本约为其三分之一。
- 在 Terminal Bench 2.1、DeepSWE 1.6、BrowseComp 等多个基准上,GPT-5.6 Sol 均处于「智能-成本曲线」的最优位置。
需要说明的是,Agent's Last Exam(ALE)代表了新一代评估范式的核心设计理念。传统 AI 评估基准(如 MMLU、HumanEval)本质上是静态知识测试——给定一个输入,判断输出是否正确。随着 AI 智能体能力的提升,这类基准越来越难以区分顶级模型的真实差距,因为强模型的静态准确率已趋近天花板。ALE 将评估场景迁移至真实工具调用环境,要求模型在其中完成需要多步规划、工具调用、错误纠偏的完整任务链,以最终交付成果的质量而非单步准确率计分——这种设计更接近真实工作场景,也使得评估成本本身成为一个有意义的维度:完成同一任务消耗 token 越少,意味着模型的规划效率越高、路径越优化。对企业决策者而言,「分数/成本」比远比绝对分数更具参考价值:在大规模批量任务场景中,$2,300 与 $763 的差距直接决定业务可行性与实际 ROI。

一个有趣的细节:max 模式下的得分反而略低于 ultra,这与前述「过度思考」现象相互印证——模型在被允许无限延伸推理链时,并非总能收获更优质的结果。此外,OpenAI 据传近期有显著的算法改进,并采用了 Cerebras 芯片,据称能让 GPT-5.6 的推理速度提升约 10 倍——这也解释了其「效率默认拉满」的产品定位。
需要说明的是,图表中对比的 Gemini 3.1 Pro 已是旧版本,Google 的 3.5 Pro 尚未发布,因此这条效率曲线的最终格局仍有变数。
ChatGPT Work:Codex 走向全民使用
OpenAI 同时推出了独立桌面应用 ChatGPT Work,需单独下载安装。它的定位类似 Anthropic 的 Claude Cowork——本质上是「面向所有人的 Codex」,而不仅仅服务开发者。用户可以连接自己所有的工具、工作流和文档,让它跨财务、运营、市场、销售、工程等场景协同完成任务。
Computer Use 与设计能力的双重跃迁
如果说榜单数据是「意料之中」,那么这次真正令人印象深刻的,是设计能力与计算机操作(computer use)的深度结合。
Computer Use 能力的技术实现横跨计算机视觉、自然语言理解与强化学习三个领域,其核心挑战在于将非结构化的屏幕像素信息转化为有意义的语义状态,再将高层指令分解为可执行的底层操作序列(鼠标移动坐标、按键事件、文本输入等)。Anthropic 于2024年10月率先在 Claude 3.5 Sonnet 中公开演示 Computer Use 能力,开启了这一方向的行业竞争。相较于传统 RPA(机器人流程自动化)工具需要预先录制固定操作路径,AI 驱动的 Computer Use 具备泛化理解能力,能够处理界面变更、异常弹窗等动态情况。其技术核心在于将视觉理解(看懂屏幕)与动作规划(决定下一步操作)闭环结合,本质上是一个持续的「感知-决策-执行」循环。与 API 调用不同,Computer Use 无需软件提供专用接口,理论上可操控任何图形界面程序,大幅扩展了 AI 智能体的行动边界。值得注意的是,这一能力同时引入了新的安全风险——模型可能被恶意网页通过「提示注入」(Prompt Injection)劫持,执行用户未授权的操作,这一攻击面目前仍是安全研究的重要课题。
作者做了一个测试:让模型创建一个类似《僵尸毁灭工程》(Project Zomboid)风格的生存丧尸模拟游戏,要求画风阴郁写实,用 GPT Image 2.0 生成大量视觉素材,并通过 computer use 自行检查效果,最后构建一个完整的介绍页面。

结果相当惊人。模型生成的介绍页面中写道:它「反复启动真实游戏和 Chromium,发送键盘与指针输入,打开每个面板,捕捉渲染像素并检查游戏状态」,并强调「这些是开发过程中的真实截图,而非设计稿」。换句话说,它真的构建了一个可运行的游戏——包含疼痛、体温、系统性感染、完整合成系统等大量机制,然后自主截图、用截图搭建了演示网页。

作者还展示了博物馆网站、室内设计演示、交互式波干涉解释器,以及一个可视化科幻宇宙尺度(从千年隼、企业号到戴森环、拉里·尼文「环形世界」)的网站。整体设计干净、锐利、极简且配色讲究,相较前代有明显进步。
不过体验并非全无波折:作者同时运行多个 ultra 模式的 Codex 实例时,全部因「所选模型已达容量上限」而冻结——推测是发布初期访问量过大所致。
结语:「自动化 AI 研究员」还有多远?
GPT-5.6 显然不是一次增量更新。从「Sol 训练 Luna」到全面领先的成本-性能曲线,再到 computer use 与设计能力的融合,这次发布串起了一条清晰的主线:AI 正在越来越深地参与到自身的开发与生产之中。
从 I.J. Good 1965 年的思想实验,到 RLHF 让人类偏好驱动模型行为,再到今天旗舰模型直接接管小模型的后训练流水线——这条技术演进线索在 GPT-5.6 的发布中汇聚成一个具体的工程现实。正如作者所言,当模型在「计算机操作」和「设计」两个维度同时达到某个临界点时,一些「魔法般」的事情就开始发生。而 OpenAI 研究员那句「自动化研究员并不遥远」,或许正是这次发布留给业界最值得深思的一句话。
核心要点
- Sol 训练 Luna 是首个被顶级实验室公开承认的生产级递归自我改进案例,标志着 AI 参与 AI 研发从思想实验进入工程现实
- 后训练技术栈(SFT → RLHF → RLAIF)的演进终点,正是由最强模型全面接管训练流程的每个环节
- 分级推理与思考预算机制解决了计算资源按任务难度动态分配的问题,但也暴露了「过度思考」这一新的工程挑战
- Agent's Last Exam 等新一代评估基准将「成本效率」纳入核心维度,「分数/成本」比成为企业部署决策的关键指标
- Computer Use 能力打破了 AI 对专用 API 接口的依赖,理论上可操控任何图形界面程序,同时引入提示注入等新型安全风险
相关推荐

EmbeddedSass for .NET:告别Node.js依赖的Sass编译方案
EmbeddedSass for .NET基于官方Embedded Sass协议,让.NET开发者无需Node.js即可原生编译Sass/SCSS。本文解析其技术原理、应用场景及与ASP.NET生态的集成方式。

旧金山到新加坡时差:硅谷科技人的跨太平洋日常
旧金山与新加坡之间存在15-16小时时差,频繁往返两地已成为科技从业者的常态。本文解析SF到SG时差挑战、两大科技中心的连接趋势,以及AI行业全球化布局背后的人才与资本流动。

Anthropic官方Claude Code插件目录发布:精选高质量扩展生态
Anthropic发布官方Claude Code插件目录claude-plugins-official,提供经过审核的高质量插件精选集。了解官方目录的定位、核心价值及对AI编程工具生态的深远影响。