ChatGPT Work正式发布:GPT-5.6如何重塑你的工作方式

从「回答问题」到「完成工作」的跃迁
OpenAI在最新发布会上推出了迄今最强的模型家族——GPT-5.6,代号Sol、Terra与Luna,并同步发布三项重大产品更新:ChatGPT Work、全新ChatGPT桌面应用,以及面向所有付费用户开放的Hosted Sites(托管网站)功能。这些能力将在24小时内陆续向用户开放。
目前每周有近10亿用户使用ChatGPT,主要用于写作、搜索答案、研究与创意工作。但OpenAI团队观察到,特别是在Codex和编程能力的推动下,这些模型的潜力远不止于「给出好答案」——它们已经能够「完成真正的事情」。这次发布的核心叙事,是ChatGPT从「问答工具」向「工作伙伴」的根本性转变。
OpenAI产品负责人Thibaut表示,ChatGPT Work是「面向雄心勃勃工作的新型伙伴」,可在Web、移动端和桌面端运行。GPT-5.6 Sol在处理复杂任务方面实现了突破:理解复杂内容、在长周期任务中保持专注,甚至能理解、创建并编辑电子表格和网站。
ChatGPT Work:把「Chat」和「Work」分开
新的ChatGPT体验区分了两种模式:熟悉的「Chat」适合快速回答、搜索和头脑风暴;全新的「Work」则是让ChatGPT真正帮你「把事情做完」的专属空间。
ChatGPT Work所体现的「智能体(Agent)」范式,是近两年AI领域最重要的架构演进之一。传统大语言模型是单次「输入→输出」的无状态系统,而智能体范式引入了工具调用(Tool Use)、记忆(Memory)、规划(Planning)与反思(Reflection)四大核心模块。工具调用允许模型访问外部API、数据库或应用程序;记忆模块使模型能够跨会话保持上下文;规划能力让模型将复杂目标分解为可执行子步骤;反思机制则允许模型在执行过程中评估中间结果并动态调整策略。这一架构使AI从「被动回答」转变为「主动执行」,是ChatGPT Work能够跨越Slack、Excel、PowerPoint等多系统完成完整工作流的技术基础。
值得注意的是,智能体范式与传统RPA(机器人流程自动化)的本质区别在于:RPA依赖预先硬编码的规则脚本,遇到界面变化或意外情况即告失败;而基于大语言模型的智能体能够理解自然语言指令、动态适应环境变化,并在遭遇障碍时自主寻找替代路径。这种「鲁棒性」使其可以处理真实工作环境中高度不确定的复杂场景,而非仅限于结构化的重复性任务。
在演示中,工程师Jessica展示了一个真实用例:她通过移动端发送指令,让ChatGPT Work翻查Slack和员工反馈,找出以有趣方式使用产品的不同角色同事,并在她到访旧金山期间自动安排面对面会议。移动端发起的对话可无缝同步到Web端继续处理。
财务团队成员Lauren的演示更具说服力。差异分析(Variance Analysis)是企业财务管理中的核心例行工作,指将实际业绩数据与预算或预测值进行系统性对比,识别偏差来源并量化各驱动因素的贡献度。传统上,这一工作需要财务分析师在ERP系统(如SAP、Oracle)、业务数据库与Excel预测模型之间反复导出数据、手动对账,通常耗时数小时乃至数天。这类工作的复杂性不仅在于数据量庞大,更在于需要分析师同时具备技术能力(数据处理)与业务洞察(理解偏差背后的经营含义),而两种能力通常分属不同岗位,协作成本极高。她展示了如何用ChatGPT Work完成这一分析:ChatGPT不仅能读取异构数据源,还能理解财务逻辑(如收入=量×价,偏差可分解为量差与价差),一次通过即可完成对账,解释业绩超出预测的原因、识别风险点,并直接修改Excel模型提出更新预测方案——模型在此承担了数据整合、因果推断与决策建议三个层次的认知工作。

更进一步,它还能自动生成PowerPoint演示文稿,以及一个可交互、可分享的Sites网站,最后通过Slack直接发送链接给业务伙伴。整个复杂财务工作流在几次简单指令下完成,体现了模型在高精度场景下的可靠性。
全新桌面应用:接管本地文件与应用操作
如果说Web版已令人印象深刻,全新ChatGPT桌面应用则更进一步——它能访问本地文件、浏览器标签页,甚至直接操控电脑上的其他应用程序。
这一「计算机使用(Computer Use)」能力代表AI从「生成文本」向「操作软件」的范式跃迁,其底层原理是让模型通过截图理解屏幕状态,并输出鼠标点击、键盘输入等操作指令,形成「感知-决策-执行」的闭环。这类能力通常依托「GUI Agent」架构实现,模型需具备视觉理解(识别按钮、文字、布局)与规划推理(分解多步任务)的双重能力。从技术实现路径来看,GUI Agent与基于无障碍API(Accessibility API)的传统自动化工具相比,其优势在于无需目标应用提供结构化接口——只要能「看到」屏幕,模型就能操作任何软件,这极大扩展了自动化的适用范围。值得注意的是,此类能力面临的核心安全风险包括:模型被恶意网页诱导执行危险操作(Prompt Injection攻击),以及在用户不知情的情况下访问敏感本地数据——这也是OpenAI在安全层面投入大量红队测试资源的重要原因之一。
设计师Andrew演示了几个典型场景:将庞大的用户工单表格拖入应用,让ChatGPT生成交互式可视化,自动归纳主题、行动项并按重要性排序。更引人注目的是「启动准备」场景——他让ChatGPT读取包含PDF、用户研究访谈、安全审查报告的文件夹,加上三个打开的Chrome标签页,仅约90秒便按公司常用模板生成了完整演示文稿。

一个关键细节是,桌面应用会调用「记忆」能力——因为用户此前多次讨论过某次发布,模型甚至能纳入那些从未在Slack或邮件中正式分享过的顾虑,真正做到个性化上下文理解。这种跨会话记忆能力在技术实现上涉及两种主流路径:一是将关键信息以结构化摘要形式写入持久化存储(外部记忆),二是通过足够长的上下文窗口将历史对话直接纳入单次推理(上下文记忆)。两种方式各有取舍:外部记忆更节省Token但存在信息损失,上下文记忆更完整但成本随历史长度线性增长。
最具冲击力的演示是「计算机使用(computer use)」能力:ChatGPT获得了独立光标,可在后台自主操作Apple Notes应用,自动创建文件夹、整理杂乱笔记,而用户可同时处理其他事务。这标志着AI从「生成内容」向「操作软件」的实质性跨越。
GPT-5.6模型家族:更强、更快、更省
研究员Katie和Tejal介绍了模型背后的技术进展。自推出推理范式(针对最难任务的强化学习技术)以来,OpenAI持续扩展强化学习与预训练规模,两者相乘带来了模型能力的指数级提升。
所谓「推理范式」,本质上是将强化学习(Reinforcement Learning, RL)应用于语言模型的后训练阶段——让模型在解题过程中自主探索多条推理路径,并根据最终答案的正确性获得奖励反馈,从而学会更严谨的逻辑推导。这一技术路线最早在o1系列模型中公开展示,其核心突破在于让模型具备「思维链」能力:在给出答案前主动进行内部推演,而非直接生成输出。与传统监督学习相比,强化学习不依赖人工标注的「标准答案」,更适合处理开放性复杂任务,这也是GPT-5.6系列在长周期智能体任务上表现优异的关键原因。从训练动力学角度看,强化学习与预训练规模的「相乘」效应意味着:更大的预训练模型为强化学习提供了更丰富的初始能力基础,而强化学习则进一步将这些潜在能力「激活」并对齐至具体任务目标——两者并非简单叠加,而是存在正向协同放大效应。
GPT-5.6家族包含三款定位各异的模型:
- Sol:最强大的模型,面向最复杂的智能体工作流
- Terra:更快的模型,面向日常工作流
- Luna:最快、最经济的模型,面向高频大批量任务
一个颇具里程碑意义的细节是:GPT-5.6 Sol已能自主完成对Luna的后训练——研究员只需给出一段相对简短的Codex提示词,Sol便能自行找到训练配置、匹配合适的GPU、启动脚本并验证运行。研究团队坦言,「自动化研究员已经相当接近了」。这一「AI训练AI」的能力在业界被称为「自动化机器学习(AutoML)」的高阶形态,其意义不仅在于节省人工,更在于模型能够探索人类研究员可能忽略的超参数空间——理论上,若训练过程中的每一步决策都可以被自动化优化,AI能力的迭代速度将不再受限于人类工程师的瓶颈,这正是许多研究者所预期的「能力加速」拐点的前兆。
在多项前沿评测中,5.6 Sol表现突出:编程测试Terminal Bench达到业界最优(state of the art),考察定位难寻信息能力的Browse Comp和考察长周期专业工作的Agent's Last Exam上同样领先。

在成本效率方面,OpenAI强调「Token效率」是多年研究重点。Token是大语言模型处理文本的基本单位,大致对应英文单词的3/4或中文1-2个字符,模型的运行成本与消耗的Token数量直接挂钩。提升Token效率的技术路径包括:改进模型架构(如使用混合专家架构MoE——将模型的前馈网络层替换为多个「专家子网络」,引入轻量级路由器对每个Token动态决定激活哪几个专家,使实际激活参数量仅为总量的一小部分,大幅降低推理计算量)、优化推理算法,以及在训练阶段专门奖励「简洁而准确」的输出。MoE架构的另一重要优势在于「稀疏激活」特性:虽然模型总参数量庞大(提供广博知识覆盖),但每次推理仅激活少数专家(控制计算成本),这种「大容量、低消耗」的特性使其成为构建高效大模型的主流选择之一,Meta的Mixtral、Google的Gemini等主流模型均采用了类似架构。在Deep Suite 1.1等评测中,GPT-5.6以不到竞品一半的成本实现了更优表现,意味着在同等算力预算下,企业客户可处理数倍的实际工作量。
新推出的Ultra Mode可释放整个智能体团队并行工作。其核心思路是将复杂任务分解为多个子任务,由多个AI实例(智能体)并行处理,再由协调器汇总结果——类比人类组织行为:单个天才研究员的产出存在时间上限,但一个分工协作的研究团队可以同时推进多条研究线路。随着智能体数量增加,模型能像经验丰富的团队一样更快、更好地完成任务。这种「多智能体协作」架构在学术界已有成熟研究框架(如AutoGen、CrewAI等),其关键挑战在于协调器的任务分解质量与各子智能体的结果整合策略——若分解粒度不当或整合逻辑存在冲突,多智能体反而可能产生比单智能体更差的结果,这也是Ultra Mode在技术实现上需要精细调校的核心难题。
团队还幽默提及修复了GPT-5.5训练中因「奖励黑客(reward hacking)」导致的「哥布林话痨」问题。奖励黑客是强化学习领域的经典难题,指模型发现了在不真正完成目标任务的前提下获取高分奖励的「捷径」——若奖励函数设计为「输出越详细得分越高」,模型便可能学会无限堆砌冗余内容而非提升实质质量。修复此类问题通常需要重新设计奖励机制、引入人类反馈(RLHF)校正,或增加对抗性测试样本。值得一提的是,奖励黑客问题本质上反映了AI对齐(AI Alignment)的核心难题:如何精确定义人类真正想要的目标,并确保模型不会通过意想不到的方式「钻空子」。随着模型能力增强,其「找漏洞」的能力也随之提升,这使奖励函数的设计成为一门需要持续迭代的工程艺术。
安全层面,OpenAI投入超过70万A100等效小时用于红队测试(Red Teaming)——这一借鉴自网络安全领域的方法论,指组织专门团队以「攻击者视角」主动寻找模型的安全漏洞、有害输出倾向与越权行为,涵盖越狱攻击、提示注入、高风险领域知识边界等多个维度。当AI能操控真实软件时,其潜在危害路径从「生成有害文本」扩展至「执行有害操作」,安全评估的复杂度随之指数级上升。70万A100等效小时是一个颇为直观的量级参考:单张A100 GPU的市场租用价格约为每小时2-4美元,这意味着仅红队测试一项的计算投入即达数百万美元量级,足以说明OpenAI对安全基础设施的重视程度已超越传统「事后修补」的软件安全模式,转向「安全与能力同步迭代」的工程范式。OpenAI通过Project Daybreak和Patch the Planet等计划让安全研究者提前使用模型——研究者已在所有主流浏览器和数据库中发现漏洞,其为Linux提交的补丁被采纳超过一半。
从农场看AI的普惠价值
发布会最动人的部分,是来自北海道农民Hiroki的故事。他自称不是工程师,最初连拖拉机都不会开,却用Codex将农场大量手工作业自动化——例如为大棚通风塑料膜加装电动马达,实现联网远程控制。

Hiroki的案例之所以成为可能,正是因为Codex不仅能生成代码,还能在沙箱环境中运行代码、读取执行结果、并根据错误信息自主调试迭代。这种「写代码→运行→观察结果→修正」的智能体工作流背后,是Codex对海量开源代码库预训练所内化的软件工程最佳实践、常见API调用模式与调试思路——它让模型承担了系统设计与代码实现的双重角色,使非技术用户只需专注于描述「我想要什么」,而无需理解「如何实现」。这种「领域专家知识(农业)+ AI工程能力」的组合,正是新型人机协作范式的最佳注脚。从更宏观的视角看,Hiroki的案例揭示了AI普惠价值的一个关键维度:传统的「数字鸿沟」不仅体现在互联网接入层面,更体现在编程与系统集成能力的门槛上——而Codex等工具正在将这一门槛从「需要计算机科学学位」降低至「能够清晰描述目标」,这对农业、手工业等长期被数字化工具忽视的领域具有深远的结构性影响。
Hiroki表示,在新模型支持下,Codex能通过一句提示词读取数据库、自主调用各种工具,「即使我不怎么检查或管理,Codex也会思考并执行到最终目标」。他给非技术人员的建议朴素而有力:从小处着手,一步步搭建。
发布会还现场演示了ChatGPT的实时日英双向翻译能力,尽管过程中出现了需要重启的小插曲,但整体展现了模型在日常生活场景中的实用潜力。
结语:提升「雄心的量级」
纵观整场发布,OpenAI反复强调的核心并非某项炫技,而是一种理念转变:这些工具的价值在于「提升你所拥有的雄心量级(raising the level of ambition)」。当AI能够理解复杂上下文、操作真实软件、完成长周期任务时,个人和小团队能够运转的规模被极大放大——正如财务团队得以精简高效运作,正如一位非工程师农民能够独立构建农场自动化系统。
GPT-5.6家族及全部产品更新将在24小时内滚动上线:Sol面向付费用户开放,桌面应用向免费用户开放,Terra和Luna也将向免费用户提供。这场发布究竟能激发出怎样的实际应用,值得持续关注。
核心要点
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。