GPT-5.6发布:ChatGPT Work、Sites与桌面客户端全面升级

文章正文
OpenAI再次以一场深夜发布刷新了行业节奏。GPT-5.6模型家族正式面向全球推出,同时上线的还有面向办公场景的ChatGPT Work、可将成果一键变网站的ChatGPT Sites,以及大幅升级的桌面客户端。这一次,OpenAI不再只是升级模型参数,而是试图把ChatGPT、Codex与Work三条产品线彻底打通,构建一个覆盖对话、编程与办公的完整智能体生态。
GPT-5.6模型家族:三档定位,编程能力正面反超
GPT-5.6采用了清晰的三档产品策略。旗舰模型GPT-5.6 Soul主打高强度复杂任务,将在24小时内逐步向付费用户开放;定位日常任务的GPT-5.6 Terra与快速模型GPT-5.6 Luna则向免费用户开放。这种分层不仅是性能梯度,更是一套精细的成本与场景划分逻辑。
这种三档产品策略延续了OpenAI自GPT-4时代开始探索的"Good-Better-Best"分层定价模型——一种在云计算和SaaS行业被广泛验证的商业逻辑,通过差异化性能与价格,同时服务免费用户(扩大市场覆盖)和付费用户(提升ARPU,即每用户平均收入)。这一模式的经典先例来自云存储(Dropbox的免费/专业/团队三档)和CRM软件(Salesforce的Essentials/Professional/Enterprise分层),其核心原理是通过"免费层"降低用户获取成本,再借助"旗舰层"的稀缺性和高性能激励用户向上迁移。在AI领域,这一逻辑叠加了算力成本的现实约束:旗舰模型的推理成本往往是轻量模型的数十倍,分层定价本质上也是对计算资源的差异化分配机制。值得注意的是,将模型分别命名为"Soul""Terra""Luna",也延续了AI厂商赋予产品以情感化、人格化命名的品牌策略,旨在降低用户对技术产品的心理距离感。
在第三方评测平台Artificial Analysis上,GPT-5.6 Soul综合得分达59分,与竞品Claude Fable 5仅差1分。但真正值得关注的是编程榜单——GPT-5.6 Soul得分达80分,比对手高出2.8分,这是OpenAI在编程能力上少见的正面反超。
在Ultra模式下,模型默认启用4个Agent并行处理,重负荷场景可扩展至16个。这意味着GPT-5.6已从单一推理模型演进为可编排的智能体系统,在BrowseComp、SWE-bench Pro等复杂评测中兼顾了更高分数与更快速度。
评测体系背景:SWE-bench(Software Engineering Benchmark)由普林斯顿大学团队开发,包含来自真实GitHub仓库的软件工程任务,要求模型在给定代码库和问题描述的情况下自动生成修复补丁,被业界视为衡量代码智能体实战能力的黄金标准。SWE-bench Pro是其难度升级版,引入了更复杂的跨文件依赖和更模糊的需求描述,进一步压缩了模型"背题"的空间。BrowseComp则是OpenAI内部开发的网络信息检索与综合推理评测,专门考察模型在多步骤网页浏览、信息交叉验证场景下的表现。与传统的封闭式问答基准不同,这两项评测共同的方法论特点是"开放环境+真实工具调用"——模型必须像真实工程师一样与外部环境交互,而非仅凭参数内的静态知识作答,因此远比传统数学或逻辑题更能反映模型在生产环境中的实际能力。随着SWE-bench逐渐成为行业标准,各大厂商在该榜单上的排名博弈也折射出整个AI编程助手市场的竞争格局。

内部数据揭示的算力爆发
官方披露的内部数据颇具冲击力:GPT-5.6让研究员的日均Token输出量达到GPT-5.5时期峰值的两倍以上,内部推理算力份额在6个月内增长100倍,智能体Token使用量增长约22倍。这些数字背后,是模型从"辅助工具"向"自主生产力"角色转变的信号。
在安全层面,GPT-5.6配备了分层防护,经过约70万A100 GPU小时的红队测试,有害活动阻止量比前代高出约10倍。OpenAI特别强调,尽管模型在生物与网络安全领域能力增强,但均未触及风险阈值,且能力侧重防御而非端到端攻击。
红队测试规模解读:红队测试(Red Teaming)源自冷战时期的军事对抗演练,在网络安全领域被发扬为"以攻代守"的系统性漏洞评估方法,近年来被引入AI安全领域,特指针对大语言模型进行系统性越狱(Jailbreak)、有害内容诱导、能力边界探测等对抗性评估。OpenAI的红队通常由内外部专家组成,涵盖生物安全、网络攻防、社会工程学等多个专业领域。70万A100 GPU小时是一个极为庞大的计算量——NVIDIA A100是当前主流AI训练与推理芯片,单卡峰值算力约为312 TFLOPS(FP16)。以数百张GPU持续运行为例,70万小时的累计算力意味着数百张卡持续运行数周,这一量级远超一般功能测试的资源投入。这一数字的公开披露具有双重意涵:对监管机构而言,它是安全合规投入的量化凭证;对公众和企业客户而言,它是构建信任的品牌资产。在AI监管日趋收紧的背景下,将"可信AI"作为竞争差异化要素,正成为头部厂商的共同战略选择。
ChatGPT Work:直击企业办公核心场景
如果说模型升级是常规操作,那么ChatGPT Work才是OpenAI此次真正的战略重心。Work可帮助用户完成信息搜集、数据分析、文档撰写、Excel建模、PPT制作乃至网站生成等一系列办公任务,直接切入企业生产力的核心场景。
Work率先向Pro、Lite、Enterprise和EDU用户开放,Plus与Business用户随后跟进。这套定价与开放节奏,显示OpenAI意在从个人订阅走向企业级办公协作市场——这正是微软Copilot与Google Workspace激烈争夺的战场。值得注意的是,企业办公软件市场长期被微软Office 365(年收入超500亿美元)和Google Workspace主导,二者的共同壁垒在于"数据锁定"与"工作流惯性"。OpenAI选择从任务执行层切入而非另起炉灶构建文档编辑器,是一种典型的"寄生式整合"策略——借助现有工具的数据与场景,用AI能力叠加价值,而非正面替代。
桌面客户端的能力跃迁
配合Work,OpenAI对ChatGPT桌面客户端进行了大规模升级。新版应用获得了访问本地文件、读取浏览器标签页以及操作部分桌面软件的能力,并支持Computer Use功能。这意味着ChatGPT不再局限于对话框,而是能真正"接管"用户的电脑,完成跨应用的实际操作。
Computer Use技术原理:Computer Use功能本质上是一种基于视觉-语言模型(VLM,Vision-Language Model)的GUI代理技术。其工作流程可分为三个循环环节:感知(模型通过持续截图捕获屏幕状态,并将像素信息解析为语义描述)、规划(模型基于当前状态和用户目标制定下一步操作计划)、执行(通过操作系统级别的API模拟鼠标点击、键盘输入、滚动等动作)。这一能力最初由Anthropic在其Claude 3.5模型中于2024年10月率先商业化落地,被命名为"Computer Use",随后引发行业密集跟进,微软、Google等也相继在各自生态中推进类似能力。其核心技术挑战有三:一是跨应用状态一致性管理,模型需理解不同软件的UI逻辑差异;二是错误恢复机制,当操作失败时需识别异常并回退;三是用户授权边界的精细控制——在"技术上能做什么"与"安全上应该做什么"之间维持清晰边界,防止误操作或敏感数据泄露。这也是OpenAI将此功能与Work产品线深度绑定、而非向所有用户开放的重要原因。

话说回来,OpenAI推出了ChatGPT Sites公开测试功能。用户可将工作成果或创意直接转化为交互式网站或Web应用,并通过URL一键分享,适用于实时仪表盘、项目跟踪工具、原型、内部门户和报告等场景。这进一步降低了从"想法"到"可交付产品"的门槛。
Codex风波与三次限额重置
在这场发布中,还夹杂着一段耐人寻味的插曲。OpenAI联合创始人兼CEO Sam Altman专门发文承诺"Codex不会消失",回应了社区对Codex被边缘化的担忧。
Codex的历史地位:Codex是OpenAI于2021年推出的代码专用模型,也是GitHub Copilot的原始底层引擎,曾是AI辅助编程领域的开创性产品,其发布标志着AI从"能读代码"迈向"能写代码"的历史节点。Codex基于GPT-3架构针对代码数据微调而来,在HumanEval等早期编程基准上展示了令人震惊的能力,直接催生了AI编程助手这一全新市场品类。随着GPT-4及后续模型在编程能力上的全面超越,Codex逐渐淡出公众视野,但在企业API客户和开发者社区中仍保有相当的使用基础和历史依赖。这折射出AI产品更迭过程中一个普遍性矛盾:旗舰新模型的上线往往引发老用户对既有工作流稳定性的焦虑,即所谓的"技术债"与"迁移成本"问题。对于依赖Codex API构建产品的开发者而言,模型的突然下线或能力变更意味着集成代码重构、提示词(Prompt)工程重调以及潜在的业务中断风险。这也是为何OpenAI需要在发布窗口内主动进行预期管理——在AI平台化竞争中,开发者生态的信任度与工作流稳定性,往往比单次性能分数更能决定平台的长期黏性。
Codex负责人随后宣布ChatGPT Work与Codex的使用限额已全面重置,并在北京时间13点30分再次发文进行二次重置,希望用户"有时间真正尝试雄心勃勃的任务"。
短时间内多次重置速率限制,一方面反映了OpenAI推动用户深度体验新功能的迫切,另一方面也暗示了发布初期算力调度的紧张。这种"缝合"三条产品线的做法虽然野心十足,但整合过程中的摩擦同样值得持续观察。
竞争对手密集跟进,行业进入白热化
OpenAI的发布并未独占舞台,多家厂商在同一时段密集出手。
Meta发布了多模态推理模型MuSpark 1.1,同步开放Meta Model API公开预览。该模型专为Agentic任务打造,具备100万Token上下文窗口,可接受文本、图像、视频、PDF和音频等多种输入,能够协调多智能体系统、零样本适配新工具,并以最少人工干预完成陌生界面导航。API向美国开发者开放,注册即赠20美元免费额度。
百万Token上下文的技术意义:理解超长上下文的价值,需要先理解Token的尺度感。在中文场景中,1个Token大约对应0.5到1.5个汉字,100万Token意味着模型可在单次对话中处理约50万至100万字的内容——相当于同时"阅读"十几本长篇小说或数千页技术文档。这一能力对Agentic任务尤为关键:智能体在执行多步骤任务时,需要持续追踪工具调用历史、中间计算状态、用户指令变更以及外部环境反馈,超长上下文可显著减少因"遗忘"中间状态导致的执行错误和逻辑断裂。然而,这一能力的实现面临严峻的工程约束:Transformer架构的标准注意力机制(Self-Attention)计算复杂度与序列长度呈平方关系(O(n²))增长,意味着将上下文从10万扩展到100万Token,理论计算量将膨胀100倍。为此,学界和工业界开发了滑动窗口注意力(Sliding Window Attention)、稀疏注意力(Sparse Attention)、线性注意力近似等多种优化方案,但如何在保持远程依赖捕获精度的同时控制推理延迟和成本,仍是各家厂商在架构层面持续博弈的核心工程问题。

Kimi宣布K2.7 Code High Speed全面开放,官方数据显示常规编程场景下输出速度约为180 Token/秒,整体输出速度约为标准版的5到6倍。High Speed模式采用差异化定价,积分消耗为标准版的3倍,用户可按需在Standard与High Speed间灵活切换。
Google Cloud则宣布由DeepMind开发的AlphaEvolve正式GA。该工具以进化算法为基础,用大语言模型对源代码进行编译和筛选,自动迭代出更优算法方案。在正式发布前,它已在多个高难度领域取得突破——在Frontier超算上生成XS-scale级GPU内核,为量子处理器设计的纠错方案将错误率降低10倍,在药物发现中将分子模拟速度提升4倍,并在物流场景中将仓库路径效率额外提升10.4%。
AlphaEvolve的技术根源:AlphaEvolve所采用的进化算法(Evolutionary Algorithm)是一类受达尔文自然选择理论启发的元启发式优化方法,核心思路是在解空间中维持一组候选方案(种群),通过选择(保留适应度高的个体)、交叉(组合优秀方案的子结构)、变异(随机引入新特征)等操作迭代生成更优解。经典进化算法自20世纪60年代兴起,在工程优化、调度问题、神经网络结构搜索(NAS)等领域有广泛应用。AlphaEvolve的创新之处在于将大语言模型引入"变异算子"这一关键环节——由LLM对源代码进行语义级别的理解与改写,而非传统的随机比特翻转或字符替换,极大提升了搜索效率和生成方案的语法可行性与逻辑合理性。这种将神经网络与进化计算结合的思路,学界称为"神经进化(Neuroevolution)",近年来因LLM的崛起而获得新的生命力。AlphaEvolve的直接前身是DeepMind于2023年底发表在《Nature》上的FunSearch系统,后者曾在卡普集(Cap Set)等数学开放问题上发现了数十年来的首个新解法,证明了"LLM+进化搜索"范式在高难度组合优化领域的真实价值,为AlphaEvolve的工程化落地奠定了学术基础。

此外,ElevenLabs发布了11 Agent Spotlight,为对话式AI智能体打造观测与改进层,支持实时监控成功率、延迟,自动检测异常并归类对话话题,帮助企业将智能体从"上线部署"推向"持续迭代闭环"。
从模型竞赛走向生态整合
这一夜的密集发布传递出一个清晰信号:AI行业的竞争焦点正在从"谁的模型更强"转向"谁能把模型、编程与办公整合成完整的生产力闭环"。OpenAI以GPT-5.6叠加ChatGPT Work、Sites与桌面客户端升级,本质上是用一整套产品矩阵来占领用户的实际工作流。
话说回来,Meta、Google、Kimi等对手在多模态、算法进化与推理速度上各自发力,说明单点突破已经不足以构筑护城河。接下来真正的较量,将取决于谁能让智能体在真实办公与开发场景中稳定、可靠地跑起来。
核心要点
核心要点
相关推荐

Codex、Cursor、Claude Code:AI编程助手怎么选
深度对比OpenAI Codex、Cursor和Claude Code三大AI编程助手的核心优势与适用场景,帮助开发者根据实际工作流选择最合适的工具组合,提升编程效率。

Google Gemini与Pixel联手五大足球俱乐部,AI重塑比赛日观赛体验
Google宣布Gemini AI助手与Pixel手机将与全球五家顶级足球俱乐部合作,通过实时数据解读、智能问答互动等AI功能全面升级球迷比赛日体验,标志着AI深度融入体育娱乐领域。

共享记忆的公共AI:当所有用户共用一个大脑会怎样?
一个反常规的AI项目让所有用户共享同一份记忆,引发隐私安全与集体智慧的激烈讨论。本文深入分析共享记忆AI的设计理念、技术风险与未来可能的混合架构方向。