GPT-5.6发布:Codex接管ChatGPT,AI Agent时代正式开启

OpenAI重拳出击:GPT-5.6正式发布
一觉醒来,AI圈再次震动。OpenAI在最新一轮更新中发布了GPT-5.6系列模型,并对整个产品架构进行了一次力度颇大的重组。据B站UP主唐展(带你玩转AI编程)的实测分析,这次更新不只是模型能力的常规迭代,更是产品逻辑的根本性转变——ChatGPT与Codex的APP正式合并,Agent时代的信号愈发清晰。
从官方公布的测评数据来看,GPT-5.6系列旗舰模型在多项主流大模型基准测试中,取得了不低于主要竞争对手(对标Claude系列)的成绩。这里有必要了解一下大模型基准测试(Benchmark)体系的背景:主流评估框架包括MMLU(大规模多任务语言理解)、HumanEval(代码生成能力)、MATH(数学推理)、GSM8K(小学数学)以及LMSYS Chatbot Arena(真实用户偏好对比)等,覆盖逻辑推理、知识问答、代码生成、多步推理等核心维度。值得警惕的是,基准测试存在"过拟合"风险——部分模型可能专门针对测试集优化,导致跑分亮眼但实际应用表现平平。因此,结合真实场景的人工实测往往比单纯跑分更具参考价值。
但真正令人眼前一亮的,是GPT-5.6在成本和响应延迟上的显著优势。这意味着OpenAI走的是「能力够强 + 性价比拉满」的路线,直接瞄准Claude在编程与Agent场景中的优势地位。

性价比成为新的竞争焦点
过去一年,大模型的竞争已逐渐从「谁更聪明」转向「谁更划算」。当模型能力趋于同质化,成本与延迟就成了开发者做选择时的核心砝码。在大模型商业化竞争中,API调用成本(通常以每百万Token计价)和响应延迟(Time to First Token,TTFT)是企业客户选型时的核心指标。以GPT-4 Turbo与Claude 3 Opus的价格战为例,2024年OpenAI多次主动降价,将输入Token价格压低至早期版本的十分之一以下。对于Agent应用场景,成本问题尤为突出:一个复杂的Agent任务可能需要数十次模型调用,单次任务的总Token消耗可能是普通对话的数十倍。延迟同样关键——Agent任务通常是多步串行执行的,每一步的响应延迟会累积叠加,直接影响用户体验和自动化流程的整体效率。GPT-5.6在维持顶尖能力的同时压低调用成本,实际上是在争夺开发者与企业用户的信任——尤其是那些需要大规模、高频次调用模型的Agent应用场景,OpenAI此举本质上是在抢占Agent规模化落地的经济可行性门槛。
Codex「接管」ChatGPT:产品逻辑的深层重构
这次更新最耐人寻味的一点,是ChatGPT与Codex的深度融合。在理解这一变化之前,有必要回顾Codex的技术历史:Codex是OpenAI于2021年发布的代码专用AI模型,最初基于GPT-3架构针对代码数据进行微调,曾是GitHub Copilot的底层引擎。其核心能力在于理解自然语言描述并生成对应代码,支持Python、JavaScript、Go等数十种编程语言。与通用对话模型不同,Codex从设计之初就强调"任务执行"而非"对话交流"——它更擅长将模糊的需求拆解为可执行的代码步骤。随着GPT-4系列通用能力大幅提升,Codex在2023年曾被宣布停止独立API服务,转而融入ChatGPT生态。此次以"Agent引擎"形态重新回归产品核心,标志着OpenAI对Codex定位的再次重塑。
表面上看,这是ChatGPT「吸收」了Codex的编码能力;但据唐展的实测观察,真相恰恰相反——无论使用Work模式还是编码模式,底层实际运行的都是Codex。

换句话说,与其说是ChatGPT整合了Codex,不如说是Codex「接管」了ChatGPT。这一架构选择透露出一个重要趋势:OpenAI正在将以Agent为核心的执行引擎作为产品的底层驱动力。传统的「对话式AI」外壳依然保留,但内核已被替换为更擅长任务执行、工具调用和多步推理的Agent系统。
为什么说这是Agent时代的转折点?
对话(Chat)与执行(Agent)代表了AI应用的两种根本范式,理解这一区别对于把握此次更新的深意至关重要。对话式AI以"单轮或多轮问答"为核心交互单元,模型接收输入、生成文本输出,整个过程是被动响应的。Agent AI则引入了"感知-规划-行动"的闭环机制:模型不仅能生成文字,还能调用外部工具(如浏览器、代码执行器、文件系统)、分解复杂目标为多个子任务、根据中间结果动态调整执行路径。从技术架构看,Agent系统通常包含任务规划器(Planner)、工具调用层(Tool Use)和记忆管理模块(Memory)。OpenAI的Function Calling、Tool Use API以及Codex的代码执行能力,正是构建Agent系统的关键基础设施。当Codex接管ChatGPT底层时,意味着每次"对话"背后都潜藏着完整的Agent执行能力——AI产品的核心竞争力,已从「能聊什么」转向「能做什么」。

这也解释了为何OpenAI此次「收紧产品线、砍掉冗余、集中力量」。据唐展分析,OpenAI削减了部分边缘产品,将资源集中投入以Codex为核心的Agent能力建设。这种战略收缩,往往意味着方向已经明确。
实测对比:一天之内的能力跃迁
为验证新模型的实际表现,唐展进行了一次直观的横向对比实验:先用OpenCode加上OMO工具制作了一个Mac APP,GPT-5.6发布后,再用「Codex + GPT-5.6 + Go」的技术栈将同一应用重新实现了一遍。Go语言(Golang)由Google于2009年发布,以高并发处理能力、编译速度快、二进制部署简单著称。在AI工具链的背景下,Go的优势在于构建高性能的后端服务、CLI工具和系统级应用——与Python在模型训练和脚本领域的主导地位形成互补。选择Go作为验证语言颇具深意:它不仅测试了GPT-5.6对非Python主流语言的代码生成能力,也反映了一个趋势——随着AI编码助手能力的提升,开发者可以更自由地选择最适合特定场景的语言,而无需受限于AI工具的语言偏好。

对比结果
两次制作仅相隔一天,但成果质量出现了明显提升。新方案生成的Mac APP在完成度和细节表现上均更为出色。这种「同一任务、不同工具链」的对比,比单纯跑分更具说服力——它直接反映了新模型在真实开发工作流中的可用性。
需要说明的是,这类演示属于单一来源的个人实测,具体效果因项目复杂度、提示词质量和工具配置而异。但从趋势上看,AI编程工具的迭代速度确实在持续加快,「一天一个样」已经不再是夸张。
对开发者意味着什么?
对于AI编程从业者来说,GPT-5.6与Codex的融合带来了几个值得重点关注的变化:
工具链正在收敛。 当官方产品本身已集成强大的Agent编码能力,第三方工具的生存空间可能随之压缩。开发者有必要重新审视自己的技术栈选择。
成本优势可能改变竞争格局。 如果GPT-5.6能在保持能力的同时大幅降低调用成本,那些此前因价格因素转向其他方案的团队,可能会重新评估是否回归OpenAI生态。对于构建Agent应用的团队而言,调用成本的差异尤为敏感——多步骤的Agent任务会将单次价格差距成倍放大。
Agent能力正在成为标配。 无论对话还是编码,底层统一由Agent引擎驱动,意味着「多步任务自动化」将从进阶功能变为默认体验,开发者的工作方式也将随之改变。
结语:竞争进入深水区
这一轮更新,OpenAI以「能力对标、成本领先、架构重构」的组合拳,向Claude等竞争对手发起了正面挑战。而Codex接管ChatGPT底层的产品逻辑,则清晰地标示了行业从「对话时代」向「Agent时代」的历史性过渡——这不仅是产品功能的升级,更是AI交互范式从被动响应到主动执行的根本性转变。
对于普通用户和开发者而言,最好的验证方式依然是亲自上手体验。技术演进的节奏越来越快,唯有保持动手实践,才能真正判断这些「重磅发布」究竟含金量几何。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。