Codex并入ChatGPT:GPT-5.6如何重塑AI助理体验

Codex时代的终结与新起点
OpenAI近日宣布了一项重要变动:Codex正式并入ChatGPT,作为独立品牌的Codex将成为历史。另一边,GPT-5.6模型也随之上线。过去分散在编程助手(Codex)与通用对话助手(ChatGPT)之间的能力,如今被整合进了统一的产品体验。
值得回顾的是,OpenAI Codex最初于2021年发布,是基于GPT-3架构专门针对代码生成任务微调的模型,也是GitHub Copilot早期版本的底层引擎。Codex并非凭空出现,而是建立在GPT-3(1750亿参数)的基础上,通过对GitHub上数十亿行公开代码进行专项微调而成。其核心突破在于将自然语言与编程语言的语义空间对齐——模型不仅学会了代码的语法规则,更理解了函数意图、API调用逻辑和算法结构之间的关联。Codex在当时代表了AI辅助编程的重大突破——它能理解自然语言描述并生成对应代码,支持Python、JavaScript、Go等数十种编程语言。然而,随着GPT-4及后续模型在代码能力上的全面超越,这种"代码理解能力"与多模态推理能力逐步融合,使得通用大模型本身已能在推理过程中自动切换自然语言与代码两种"思考模式",独立维护Codex品牌的战略价值因此逐渐降低,此次并入ChatGPT实际上是产品线收敛的必然结果。
据实测分享,这次合并并非简单的品牌重组,而是能力层面的深度融合。开发者不再需要在"写代码用Codex、聊天用ChatGPT"之间来回切换——一个入口即可调度从任务规划、信息检索到实际执行的完整链路。这种整合思路,折射出OpenAI打造"超级助理"的产品野心。
GPT-5.6实战:从回答问题到完成任务
GPT-5.6最值得关注的进化,在于它从"回答问题"升级到了"主动完成任务"。测试中有人故意抛出一个极其宏观的指令——"帮我一年多赚100万",本意是观察模型如何应对模糊需求,结果却相当出人意料。

模型没有给出"努力工作、多元投资"之类的套话,而是展现出清晰的主动规划能力:
主动信息收集与用户画像
它首先根据用户名字,主动检索其公开信息、社交账号和内容数据,并进行系统性分析。这一步相当于AI在执行任务前,先自行构建了对用户的完整画像,而非等待用户逐条输入背景。
建立长期跟踪机制
更进一步,模型主动搭建了一套持续追踪机制,每天自动搜索AI行业的最新机会、企业需求及潜在合作信息。每天早上9点,它会主动推送整理好的选题清单,并标注哪些值得重点跟进、哪些可以跳过。

这种"定时主动交付"的能力,已经超越了传统对话式AI的被动应答模式,更接近真正的助理角色。
这里涉及一个关键的技术概念——Agent(智能体)型AI。Agent型AI的技术架构通常包含四个核心组件:感知层(接收输入)、规划层(任务分解与策略制定)、执行层(调用工具、API或浏览器)、记忆层(维护上下文状态)。所谓Agent型AI,是指能够自主分解目标、调用工具、执行多步骤任务的AI系统,区别于传统的单轮问答模型。
与单轮问答不同,Agent在执行一个复杂任务时可能需要数十次甚至数百次模型推理调用,每次调用都消耗Token(语言模型处理文本的基本计量单位)。以GPT-4o的定价为例,每百万输入Token约需5美元,输出Token约需15美元——一个涉及网络搜索、数据分析和报告生成的中等复杂任务,可能轻松消耗数十万Token,折合数美元至数十美元。Token消耗与API调用费用直接挂钩,这正是此次测试"把token拉爆了"的根本原因。这也使得Agent的商业模式设计——是按任务收费、按Token收费还是订阅制——成为行业尚未完全解决的核心问题。目前业界普遍面临的挑战是:Agent能力越强、任务越复杂,推理链越长,Token消耗呈指数级增长,如何在能力与成本之间取得平衡,是Agent商业化落地的核心难题之一。
跨设备协同:手机遥控电脑执行任务
此次更新中,对创作者和自由职业者尤其友好的新功能,是跨设备任务协同能力。

用户可以直接通过手机端的ChatGPT,控制电脑上运行的Codex任务。这为日常工作流带来了几个实质性改变:
- 远程监控进度:人在外出时也能实时了解AI执行到哪一步;
- 随时响应决策:AI遇到需要人工判断的节点,会直接在手机推送询问,用户回复或批准即可让任务继续;
- 随时追加需求:临时产生新想法,无需回到电脑前,口头交代即可。
这种跨设备协同的实现,依赖于云端异步执行架构。任务并非在本地设备运行,而是由OpenAI服务器端的Agent持续运行,移动端仅作为轻量级控制界面——类似于远程桌面控制与云计算的结合。
值得注意的是,这种设计也体现了当前主流AI Agent框架的安全规范,即**"人在回路"(Human-in-the-Loop,HITL)原则。Human-in-the-Loop并非单纯出于安全考量,它同时解决了当前大语言模型的一个根本局限:模型在长链推理中存在"幻觉漂移"**风险,即随着推理步骤增加,错误假设会被不断放大和继承。在关键决策节点引入人工确认,相当于为推理链插入"校准锚点",防止任务在错误方向上越走越远。Google DeepMind、Anthropic等主流AI安全机构均将HITL列为高风险AI系统的必要设计原则之一。当前的争议在于:如何在保留安全性的同时降低确认频次,避免用户陷入"确认疲劳"——这也是下一代Agent设计需要重点解决的课题。
"云端持续执行 + 移动端轻量决策"的组合,让AI真正渗入碎片化的工作场景。它把AI从一个需要专心坐在电脑前操作的工具,变成了一个可以"托管"事务的智能伙伴。
AI红利:先行者的认知优势
关于这轮AI浪潮的受益格局,有一个值得关注的观察。据转述,投资人王玉泉在近期访谈中提到:AI发展至今,真正受益的其实仍是少部分人和少部分公司,大多数人还处于迷茫期,没想清楚AI究竟能干什么。

这一判断颇为务实,且有其理论依据。社会学家埃弗雷特·罗杰斯在其经典的**"创新扩散理论"**中指出,任何新技术的普及都遵循S形曲线:从最初的创新者(约2.5%)、早期采用者(13.5%),到早期多数、晚期多数,最终才到达落后者。目前AI应用可能仍处于早期采用者向早期多数过渡的阶段,真正大众化普及尚需工具易用性的持续提升与使用成本的进一步下降。
这一过渡阶段对应的是罗杰斯理论中著名的**"鸿沟"(Chasm)——后来由杰弗里·摩尔在《跨越鸿沟》中深化的概念:对AI工具而言,这道鸿沟不仅体现在使用习惯上,更体现在"提示词工程"(Prompt Engineering)**的认知门槛,即能否准确描述任务、拆解需求、迭代优化输出。这也解释了为何企业级AI采用率远高于个人用户的深度使用率——组织内有专人负责降低这一认知门槛,也解释了为何技术能力与实际渗透率之间始终存在时间差——工具越强大,能真正驾驭它的人反而越稀缺。
不过也有积极的一面:越来越多的人正在摸索出AI的真正用法,而Codex这类工具的持续简化,正在降低使用门槛。当宏观任务可以口头下达、后台自动执行时,AI的实用价值才真正开始向普通用户渗透。
历史类比:蒸汽机与互联网的普及规律
AI最终将像蒸汽机、互联网一样,成为影响所有人的基础设施。这一类比有其深刻的历史依据:蒸汽机在18世纪发明后,真正改变生产力格局花费了约50年;互联网在1990年代商业化后,移动互联网的全面普及又花费了近20年。
经济学家埃里克·布莱恩约弗森(MIT)的**"生产率悖论"研究表明,这类"通用目的技术"(General Purpose Technology,GPT)**带来的生产率提升往往存在10-20年的滞后期。其核心解释是:技术本身只是"可能性前沿"的扩展,真正的生产率提升需要三个条件同步成熟——技术可靠性达标、配套人才储备充足、组织流程完成重构。以电力为例,电动机问世后,工厂真正按电力逻辑重新设计生产线(而非仅用电动机替换蒸汽机)花费了约30年。
AI领域面临类似挑战:多数企业目前仍在用AI"替换"原有工作流中的单个环节,而非从底层重新设计面向AI协作的工作方式——后者带来的效率提升可能是前者的10倍以上。组织架构和人员技能的适应本身就需要时间,这正是滞后期存在的根本原因。
而在技术普及的过程中,谁能更早地真正上手实干,谁就更有可能抓住这一轮红利窗口期。
小结
Codex并入ChatGPT,加上GPT-5.6的能力升级,标志着OpenAI在"通用AI助理"这条路上迈出了重要一步。从被动问答到主动规划,从单设备工具到跨端协同,这些变化正在重新定义我们对AI助手的期待边界。
需要说明的是,本文所述实测体验来自单一用户的分享,具体效果可能因任务复杂度、账号权限和使用场景而存在差异,token成本问题在实际使用时也值得提前评估。但无论如何,一个更主动、更能干的AI时代,确实已经到来。
核心要点
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。