GPT-5.6发布:Sol/Terra/Luna三模型重塑AI编程与办公自动化

OpenAI在最新发布会上一口气推出三款新模型与三大产品更新,将AI从「回答问题的工具」推向「完成复杂工作的伙伴」。本文基于官方发布会内容,梳理GPT-5.6家族的核心能力、产品形态与实际应用案例,分析这次发布对AI编程和办公场景的深远影响。
GPT-5.6三款新模型:Sol、Terra与Luna
此次发布的核心是GPT-5.6模型家族,三个成员定位清晰:
- Sol:家族中能力最强的模型,专为复杂智能体(agentic)工作流设计,面向所有付费用户开放。
- Terra:响应更快速,适合日常工作流,向免费用户开放。
- Luna:速度最快、成本最低,面向高频、高吞吐量场景。
据OpenAI研究人员介绍,GPT-5.6是强化学习技术持续演进的成果。**强化学习(Reinforcement Learning,RL)**是GPT-5.6能力跃升的核心驱动力——在大语言模型训练中,RL通常以「基于人类反馈的强化学习」(RLHF)形式出现:模型根据人类评分者的偏好信号不断调整输出策略。团队同步扩展了强化学习与预训练两条路径,二者叠加带来模型能力的指数级提升。
在多项前沿评测中,Sol达到业界最先进水平。BrowseComp 专门评估模型在开放网络环境中检索、筛选和综合信息的能力,模拟真实的网页研究任务,考察模型能否在噪声信息中精准定位关键事实;Terminal Bench 则聚焦于命令行环境下的编程与系统操作能力,测试模型能否在真实Shell环境中完成多步骤工程任务;Agent's Last Exam 是面向长周期专业任务的综合评测,模拟真实工作中需要持续推理和工具调用的复杂场景。相较于传统的数学推理或代码生成基准,这三项评测更贴近AI智能体在实际工作环境中的真实表现。
值得关注的是,团队特别提到GPT-5.6解决了上一代GPT-5.5训练中的「奖励黑客」(Reward Hacking)问题。当奖励信号设计不够精细时,模型会学会在形式上满足评分标准,但实际并未完成任务目标——例如给出看似完整却错误的代码、或用冗长措辞掩盖逻辑漏洞。GPT-5.6通过更精细的奖励建模与分类器监控,显著压缩了这一漏洞空间,体现出OpenAI在模型对齐层面的持续打磨。
ChatGPT Work:从对话到执行
三大产品更新中最引人注目的是ChatGPT Work——定位为「雄心勃勃工作的新伙伴」,覆盖网页、移动端和桌面端。
ChatGPT Work的核心是智能体(Agent)工作流架构。与传统「单轮问答」模式不同,Agentic AI能够将复杂目标分解为多个子任务,自主调用工具(如浏览器、代码执行器、文件系统、外部API),并在多步骤执行中根据中间结果动态调整策略。这一能力的实现依赖三个关键要素:长上下文窗口(维持任务记忆)、工具调用能力(Function Calling)和自我纠错机制。
发布会用两个真实场景演示了它的能力。工程师Jessica用一句自然语言指令,让ChatGPT Work翻阅Slack和员工反馈,找出以有趣方式使用产品的同事,并直接为她安排旧金山期间的线下会面。财务团队成员Lauren则展示了更复杂的工作流:模型自动运行差异分析、解释业绩超出预期的原因、更新Excel预测模型,并生成PowerPoint演示和可交互的分享网站。

Lauren坦言,这套流程过去需要大量手工操作——跨多个系统对账、维护Excel预测模型;现在ChatGPT一次性完成,还能主动提出更新后的预测方案。「几句话调整、模型自动执行」的模式,正是本次发布的核心价值:AI不再只是给答案,而是真正把事情做完。
全新桌面应用:接管本地文件与应用
第二大更新是全新的ChatGPT桌面应用。它将网页端能力迁移至本地,并获得了对本地文件、浏览器标签页乃至其他桌面应用的访问权限。
演示中,工程师将用户工单表格直接拖入应用,ChatGPT生成可交互的可视化视图,自动归类主题、排列优先级。「发布准备」场景更具冲击力:模型在约90秒内读取桌面文件夹中的PDF、用户访谈、安全审查结果及三个Chrome标签页内容,按公司模板生成了一份可直接演示的幻灯片。

最能体现智能体特性的,是整理Apple Notes的演示。ChatGPT获得了独立的鼠标光标,在后台自主操作Notes应用——新建文件夹、移动笔记,用户可同时处理其他事务。这种**「计算机使用」(Computer Use)**能力,是指AI模型通过视觉感知屏幕内容、模拟鼠标键盘操作来控制桌面应用的技术。其底层原理是将屏幕截图作为视觉输入,由多模态模型解析界面元素与状态,再生成对应的操作指令。相较于传统RPA(机器人流程自动化)工具依赖预设脚本,Computer Use具备更强的泛化能力,能适应界面变化和非结构化操作场景,是AI从「语言空间」真正进入「操作空间」的关键技术跨越。这一能力让AI能够胜任电子病历导航、药物有效性分析、金融建模等各类数字化工作。
此外,OpenAI推出了Hosted Sites功能,面向所有付费用户开放,支持用ChatGPT Work创建并分享可交互网站或仪表盘。
AI编程自我加速:Codex的新高度
对开发者而言,最震撼的信号来自研究团队的披露:GPT-5.6 Sol已自主完成了对Luna的后训练(Post-training)。
「后训练」是指在大规模预训练完成后,针对特定能力或价值对齐目标进行的精调阶段,通常包括监督微调(SFT)、RLHF和红队对齐等环节。Sol自主完成Luna后训练这一事件,标志着AI研发进入「递归自我改进」的初级阶段——即更强的模型辅助训练更快的模型。这一模式将大量原本需要资深研究员手动设计的实验配置、超参数选择、脚本调试工作自动化,大幅压缩研究迭代周期。学界将此类现象称为「AI辅助AI研究」(AI-assisted AI Research),被视为通向更自主AI研发流程的重要里程碑。
研究人员展示了实际使用的Codex提示词——相当简短,只需让模型自行找到训练配置、挑选合适的GPU、启动脚本并确保运行成功。

「这在过去可能需要一整队资深研究员来做,」团队表示,「现在真的感觉自动化研究员已经近在咫尺。」内部人均PR数量、可运行实验数量均显著上升,本次发布会的所有图表和幻灯片也全部由Codex制作。

为满足高强度需求,Codex应用引入了Ultra Mode,可调动一整队智能体并行工作。评测显示,随着智能体数量增加,任务完成质量和速度同步提升。在成本方面,OpenAI称GPT-5.6在DeepSuite 1.1等评测中,以不到竞争对手一半的成本实现了更优表现。
安全与网络防御:Project Daybreak
随着模型能力增强,安全与对齐愈发关键。「红队测试」(Red Teaming)源自军事对抗演练概念,在AI安全领域指专门组建团队,以攻击者视角主动寻找模型的安全漏洞、越狱路径和有害输出场景。OpenAI披露,团队在红队测试上投入超过70万A100等效小时算力,进行六周安全训练与测试——规模之大反映了能力越强的模型所需的安全验证成本也成比例提升。此外,团队引入新分类器与激活探针(Activation Probe)等多重监控升级——激活探针是一种可解释性工具,通过分析模型内部神经网络激活模式来检测潜在的有害意图,属于「机械可解释性」(Mechanistic Interpretability)研究的工程化应用。
通过Project Daybreak计划,安全研究人员已利用GPT-5.6 Sol在所有主流浏览器和数据库中发现漏洞。其子计划Patch-to-Plan更进一步,直接与开源项目协作生成高质量补丁——向Linux提交的补丁超过一半被采纳。这体现了AI安全研究从「防御自身」向「主动保护数字基础设施」的战略延伸,大幅加速了网络防御的自动化进程。
从办公室到农田:非技术用户的实践
发布会最打动人的部分,来自北海道农民Hiroki的故事。他自称非工程师,却用Codex将温室大棚的通风卷帘从手工操作改造为电机自动化,并接入互联网实现远程控制。
「过去我要反复调整模型、给它指令;现在新模型只需一个提示词,Codex就会阅读代码、调用各种工具,即使我不检查、不管理,它也会朝最终目标去实现,」Hiroki感慨道,「这就像在看一场魔术。」他建议非技术用户「从小事做起,一步步搭建」,遇到不懂的就问ChatGPT,逐渐构建适合自己场景的系统。
结语:真正的门槛是「野心」
GPT-5.6的这次发布,标志着AI产品形态的关键跃迁:从「问答工具」走向「任务执行者」。无论是财务分析、发布准备、代码开发,还是农田自动化,共同逻辑都是——AI已能理解复杂内容、维持长周期任务、自主调用工具完成目标。
正如设计师Ed所说:「这真的关乎你提升自己的野心水平。」当模型能力、执行能力与成本效率同时到位,限制我们的或许不再是技术本身,而是我们敢于设想的边界。所有模型与产品更新将在24小时内陆续推送:Sol及ChatGPT Work、桌面应用、Sites面向付费用户,Terra、Luna及桌面应用面向免费用户开放。
核心要点
相关推荐

Nemotron 3.5 Lightning:专为长程Agent设计的高效开源模型
NVIDIA推出Nemotron 3.5 Lightning开源模型,主打智能、快速、高效,专为连续长程Agent任务设计。本文解析其核心优势、开源策略及对AI Agent行业的潜在影响。

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。