OpenAI合并Codex与ChatGPT:三款新模型+Agent工作流深度解析

文章正文
OpenAI近期做出了一个引人注目的产品决策:将Codex与ChatGPT整合为统一应用,同时发布三款新模型,并将Sites功能升级为完整的编程平台。这不仅是产品层面的合并,更代表着OpenAI对「智能体原生(Agent Native)」未来的战略押注。
所谓「智能体原生」,是近两年AI产品领域兴起的核心范式转变。传统软件以「工具原生」思维设计——用户主动发起每一步操作,软件被动响应。而「智能体原生」意味着系统从架构层面就假设AI Agent是主要的执行者:界面、API、权限模型都围绕「让AI自主完成多步骤任务」而设计,而非仅仅「回答单一问题」。这一转变类似于移动互联网时代从「桌面原生」到「移动原生」的范式迁移——不是把PC网页搬到手机上,而是重新思考原生能力如何重构产品逻辑。
本文基于B站创作者Riley Brown与开发者Ross Mike的深度对谈,从模型能力、实操工作流到产品战略,全面解析这次更新对开发者和非技术用户意味着什么。
三款新模型:SOUL、TERRA与LUNA的差异定位
OpenAI一口气发布了三款GPT-5.6系列模型:SOUL、TERRA和LUNA。其中TERRA和LUNA主要面向普通用户的日常任务——据对谈者估算,大约70%的任务根本用不上超大型模型,这两款轻量模型足以胜任。
真正值得开发者和自动化爱好者关注的是SOUL。它代表了当前OpenAI最强的自主任务处理能力。相比GPT-5.5,SOUL在Token效率和工具调用能力上均有明显提升。
Token效率:被忽视的核心竞争力
Ross Mike提出了一个常被忽视的观点:评估一个模型不能只看智能指标,更要看「Token使用效率」和「工具调用次数」。
理解这两个概念需要一点技术背景。Token是大型语言模型处理文本的基本单位,大约对应0.75个英文单词或半个中文字;「Token效率」衡量的是模型完成同等质量任务所消耗的Token数量,直接影响API调用成本和响应速度。而「工具调用(Tool Use/Function Calling)」是指模型识别何时需要调用外部函数——如搜索引擎、代码执行器、数据库——并以结构化格式生成调用指令,再将结果整合进最终回复。在自主任务中,工具调用次数过多会导致「上下文污染」:每次调用的返回结果都会占用宝贵的上下文窗口,积累到一定程度后模型开始「迷失」,难以追踪任务目标与当前状态的关系。
他举例称,Gemini虽然在智能指标上极其出色,但一旦涉及自主任务就容易失控——会调用15到20个不同工具,最终陷入自我混乱。相比之下,GPT-5.5的强项正是Token效率高、善于调用工具,而5.6把这一点推向了新高度。此外,5.6比5.5更「主动」——过去的模型执行到某一步会反复询问「是否继续下一步」,而5.6能在获得完整计划后直接执行到底再统一汇报。

不过双方都坦言,5.6「还算不上划时代的产品」,更像是一次版本迭代,真正的变革要等到GPT-6。Anthropic的Fable系列目前在纯粹智能和超高难度任务上仍是独一档的存在。但考虑到成本——5.6与5.5价格相同却更强——其性价比极具竞争力。
Codex Agent工作流实战:四个核心技巧
对谈中最具实操价值的部分,是Ross Mike分享的几个核心工作流。这些方法揭示了如何把新Codex的Agent能力发挥到极致。
技巧一:计算机操控,被严重低估的自动化利器
Ross Mike极力推荐的第一个功能是「计算机操控(Computer Use)」。他甚至专门购置了一台迷你电脑,用于远程接入让模型操作。
「计算机操控」是一类让AI模型直接感知并操作图形用户界面(GUI)的技术,本质上是给模型配备了「眼睛和手」。其工作原理通常包含两层:视觉感知层(模型通过截图或屏幕录制理解当前界面状态)和动作执行层(模型输出鼠标坐标、键盘指令等操作序列,由底层驱动程序执行)。Anthropic于2024年10月率先将此能力以API形式开放;OpenAI随后跟进并整合进Codex工作流。两者的核心差异在于执行环境:Anthropic方案默认接管用户本机桌面——出现棕色渐变覆盖,导致用户无法同时操作电脑——而Codex的计算机操控在后台静默的云端沙盒中运行,用户完全不受干扰,在多任务并行场景中具有明显的体验优势。
最典型的应用场景是自动化测试:开发完一个功能后,直接让智能体通过计算机操控进行端到端测试——自动启动浏览器、模拟表单提交等界面交互,发现边缘情况并反复验证。这相当于把传统软件团队里的QA测试岗位交给了智能体。
技巧二:循环工作流,通用于任何领域的优化方法
「循环(Loop)」是本次对谈反复强调的核心方法论,由三个要素构成:
- 清晰的提示词:明确告诉智能体你想要什么
- 反馈机制:让智能体有办法评估自己的产出
- 明确的成功标准:给出可判断「是否达标」的量化界限
在开发场景中,可以让SOUL模型审查自己刚写的代码并打1到5分,然后告诉它「持续修改直到自评达到5分」。Ross Mike指出,写代码的智能体给自己打分往往相当严格。

这套循环思路同样适用于营销领域。Riley Brown分享了他的做法:抓取竞争对手投放时间最长(意味着转化率高)的20条广告作为高质量参考样本,让AI生成文案后逐一对比打分,循环优化直到达标。相同逻辑也适用于YouTube缩略图设计、视频脚本创作等场景——关键在于用高水平范例作为AI的「评判标尺」。
技巧三:善用工具生态,拼乐高式构建应用
Ross Mike指出,当前已形成一个围绕智能体的「积木块经济」——智能体不再需要从零搭建,而是像拼乐高一样组合现成模块。

他举例说,让Codex构建一个Replit克隆版时,智能体自动选用了Convex做数据库、Vercel的AI SDK生成应用内代码、Daytona作为沙盒。他特别推崇Vercel的Eve框架,因为它用文件名和文件夹结构组织架构(Agent、Skills、Tools、Sandbox等),让智能体能轻松访问和修改——这正是「为智能体使用而设计」的工具典范。
技巧四:多线程并行,让智能体始终以最佳状态工作
使用多个独立线程是提升Agent效率的关键技巧,好处有两点:其一是把互不依赖的功能拆开并行处理;其二更为关键——每个新线程都拥有全新的上下文环境。
理解这一点需要了解「上下文窗口(Context Window)」的机制:它是模型在单次推理中能够「记住」的信息总量,以Token数衡量,通常在12万至20万Token之间。随着对话轮次增加,窗口逐渐被历史消息、工具调用结果、中间产物填满,导致模型对早期指令的「注意力」被稀释——学术界称之为「Lost in the Middle」效应。多线程策略本质上是用「重置上下文」换取「持续高水准输出」,类似于软件工程中的「无状态服务」设计理念:不依赖历史状态、每次请求独立处理,系统整体更稳定可预测。
一个已占用12万Token上下文的智能体,表现远不如全新启动的智能体。Ross Mike曾一次启动10个线程分别测试10个功能,然后去陪家人,让工具自行完成工作。
Sites升级:Codex变身完整氛围编程平台
本次更新将Sites功能全面开放。用户点击「创建网站」后,可一键生成托管在互联网上、可分享给他人的网站,体验类似Replit或Lovable。此前该功能仅限团队版用户,现已向所有用户开放。

更便捷的是,无需专门切换到Sites标签页——在Codex中连续按Command N新建对话,输入「Sites」即可直接开始建站,还可选择托管在OpenAI平台或Vercel上。这本质上将Codex打造成了一个完整的「氛围编程(Vibe Coding)」平台。
「氛围编程」一词由OpenAI联合创始人Andrej Karpathy于2025年2月首次提出,迅速成为AI编程领域的流行语。其含义是:开发者不再精确指定每一行代码的实现细节,而是用自然语言描述「感觉上想要什么样的产品」,由AI负责将模糊意图转化为可运行代码;开发者持续提供反馈、接受或修改AI的产出,整个过程更像创意协作而非传统编程。Replit、Lovable、Cursor等工具的兴起,正是这一编程范式商业化落地的集中体现。
此外,内置浏览器现已支持多标签页。值得关注的是,OpenAI宣布停止独立浏览器项目Atlas,将资源集中到强化Codex内置浏览器——这进一步印证了其「智能体原生」的战略方向。
为何合并ChatGPT与Codex?战略意图解读
对于专业开发者而言,「Work标签页」这个推特热议的功能实用性有限。真正的战略意图在于用户教育。
OpenAI拥有近10亿用户,但其中大多数只把ChatGPT当作「发文字问问题的地方」,甚至有人认为Claude才是真正的智能动作代理平台。这既是品牌认知问题,也是用户习惯问题。合并的目的,是让海量用户逐渐意识到ChatGPT能完成复杂的知识型工作,并慢慢建立对Agent能力的认知与信任。
走向AI操作系统:超级应用的终极形态
对谈者用「超级应用」和「AI操作系统」来形容整合后的Codex。这一产业逻辑有深刻的历史背景:「超级应用」概念源自亚洲移动互联网语境——微信、支付宝通过在单一入口聚合通讯、支付、出行、购物等高频场景,形成难以被替代的平台护城河。AI时代的「超级应用」逻辑与此类似,但实现路径有根本差异:传统超级应用靠人工集成第三方服务,而AI操作系统通过Agent能力实现「意图级集成」——用户无需知道底层调用了哪个API或打开了哪个应用,只需用自然语言表达目标,系统自主编排完成。这与微软将Copilot深度嵌入Windows、苹果将Apple Intelligence整合进iOS的战略如出一辙:谁控制了用户的「意图入口」,谁就掌握了下一代计算平台的分发权。
整合后的Codex正演变为一个智能体原生的操作系统——当用户提出需求,它会直接在内置浏览器中打开页面、调出小型应用(如AI草拟的邮件应用),用户审阅后直接发送或反馈修改意见。用户几乎可以靠「跟AI聊天」完成所有操作。OpenAI合并ChatGPT与Codex,正是争夺这一入口的关键布局。
结语:真正的机会在于教育与想象力
对谈最后,两位创作者都谈到了各自的下一步方向。Ross Mike开始重拾那些「以前觉得自己搞不定」的梦想项目,同时着力提升AI尚不擅长的能力——设计(色彩、排版、间距)和写作表达,因为「想清楚自己要什么并准确沟通」才是获得好结果的关键。
Riley Brown则认为,当前最大的机会不在工具本身,而在教育领域:「工具迭代太快,人们根本跟不上。」帮助企业部署这些工具、教会他们高效工作流,将是巨大的市场空缺。
正如对谈中那句点睛之语:「现在大多数产品其实就是个Markdown文件——别把时间花在做Markdown上,要花时间建造真正有用的东西。」 在最先进模型的加持下,真正的瓶颈已经不是技术,而是想象力。
核心要点
相关推荐

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。

Claude分享链接被谷歌收录索引:隐私风险与防护指南
Claude的分享对话链接和Artifacts可能被Google搜索引擎抓取收录,导致敏感信息公开泄露。本文分析技术根源、隐私安全影响,并提供用户自我保护的实用建议。