Codex并入ChatGPT:GPT-5.6三档版本Sol/Terra/Luna详解

Codex 客户端为何变成了 ChatGPT?
用过 Codex 的开发者最近应该注意到了一个明显变化:客户端更新后,Codex 摇身一变成了 ChatGPT,并新增了「工作模式」。另一边,OpenAI 也悄然上线了 GPT-5.6,一口气拆成 Sol、Terra、Luna 三个版本。
理解这次变化需要一点背景:OpenAI Codex 最初于2021年发布,是专门针对代码生成场景微调的语言模型,也是 GitHub Copilot 的底层引擎。Codex 基于 GPT-3 架构,在数十亿行公开代码上进行了专项训练,能够理解自然语言描述并生成对应代码。此次将 Codex 客户端并入 ChatGPT 生态,标志着 OpenAI 将「代码智能」从独立产品线收拢为统一平台的一个功能模块——编程助手正从单一代码补全工具演进为能读懂整个代码仓库、执行多步骤开发任务的「智能体」(Agent)。
这次更新的核心是入口的重新整合。更新后,桌面端左上角可以在「工作模式」和「Codex 模式」之间自由切换,旁边还保留了独立的聊天入口。三者职责划分更清晰:
- 聊天模式:快速问答、搜索资料、临时改文案等轻量交互。
- 工作模式:日常深度工作,如行业研究、生成文档与 PPT,支持读取本地文件、调用桌面应用和浏览器。
- Codex 模式:专注软件开发,负责读仓库、改代码等专业编程任务。
「工作模式」所描述的能力——读取本地文件、调用桌面应用、控制浏览器——本质上是大语言模型与外部工具结合的「智能体」(AI Agent)范式。Agent 与普通聊天模型的核心区别在于:它不仅能生成文本,还能执行动作、观察反馈并据此调整后续行为,形成「感知-决策-执行」的闭环。实现这一能力的关键技术包括函数调用(Function Calling)、工具使用(Tool Use)以及多步骤规划。OpenAI 将这些能力整合进「工作模式」,是其将 ChatGPT 从被动响应的聊天界面转型为主动执行任务的「数字员工」的重要战略步骤。
简单说,这次更新最大的价值就是入口合并了,任务边界反而更清楚了。
GPT-5.6 三版本:Sol、Terra、Luna 差在哪?
GPT-5.6 拆分为 Sol、Terra、Luna,本质上是把「能力、速度、成本」做成三个档位,让用户按任务重要程度自由选择。
将旗舰模型拆分为多档次版本,是当前 AI 厂商的主流商业策略。Anthropic 的 Claude 系列分为 Haiku、Sonnet、Opus 三档;Google 的 Gemini 系列同样有 Flash、Pro、Ultra 之分。这种分级背后的技术逻辑是「模型蒸馏」与「推理优化」——更轻量的版本往往通过知识蒸馏(将大模型的能力迁移到小模型)或减少推理步骤来降低算力消耗。对用户而言,分级模型的核心价值在于「按需付费」:不必为所有任务都支付旗舰模型的溢价,而是根据任务复杂度动态选择,在总体成本不变的情况下获得更高的单次使用价值。
Sol:旗舰版,能力上限最高
Sol 是三者中能力天花板最高的版本,适合复杂研究、长流程开发、重要报告和专业 PPT 等对质量要求极高的场景。任务越重要,就越应该选 Sol。
Terra:均衡版,日常主力首选
Terra 是能力与成本的平衡点,适合日常研究、改代码、整理资料等常规工作。对大多数用户来说,Terra 已足够应付绝大部分需求。

Luna:速度最快,成本最低
Luna 主打速度快、消耗低,适合总结、改写、分类、批量处理等轻量高频任务。任务越轻量,就越应该选 Luna。
这套「Sol → Terra → Luna」的梯度设计,让用户自己在质量和成本之间做取舍,而不是一刀切地用最贵的模型处理所有任务。
GPT-5.6 成本对比:三档版本性价比一览
成本是大家最关心的问题。在理解计费数字之前,有必要了解 Token 这一基本概念:Token 是大语言模型处理文本的基本计量单位。以英文为例,大约每4个字符构成1个 Token;中文由于字符密度更高,通常1个汉字对应1-2个 Token。模型的计费分为「输入 Token」(你发送的提示词和上下文)和「输出 Token」(模型生成的回复)两部分,且输出 Token 的单价普遍高于输入 Token,因为生成过程比读取更消耗算力。Credits 则是 OpenAI 面向订阅用户的内部计费货币,将复杂的 Token 计费抽象为更直观的数字。
按官方 Credits 换算,三个版本的性价比差异清晰可见:
| 版本 | 输入(每百万 Token) | 输出(每百万 Token) |
|---|---|---|
| GPT-5.5 | 125 Credits | 750 Credits |
| Sol | 125 Credits | 750 Credits |
| Terra | 62.5 Credits | 375 Credits |
| Luna | 25 Credits | 150 Credits |
Sol 的价格与上一代 GPT-5.5 持平,Terra 是 Sol 的一半,Luna 只有 Sol 的五分之一。
换算到 Plus 账号的 5 小时窗口,大致可用条数为:
- GPT-5.5:15–80 条
- Sol:15–90 条
- Terra:20–110 条
- Luna:50–280 条

需要注意的是,这些数字并非固定值。实际消耗受上下文长度、推理强度、工具调用次数及缓存命中率等多重因素影响,仅供参考。理解这一机制有助于用户主动控制成本:缩短上下文、减少不必要的工具调用、善用缓存,都是降低 Token 消耗的有效手段。
编程能力:GPT-5.6 Sol 对比 Claude
编程方向是本次升级的重头戏。根据 Artificial Analysis 的编程智能体指数,GPT-5.6 Sol 在开启 Max 模式后得分达到 80 分,比 Claude Fiber 5 高出 2.8 分,而输出 Token 和完成时间都不到对方的一半。
与 GPT-5.5 相比,GPT-5.6 每个 PR(Pull Request,即代码合并请求,是软件开发中将新功能或修复合并到主代码库的标准流程)大约只消耗三分之一的 Token,中位耗时几乎减半——不仅答得更好,还答得更快、更省。

理性解读这些数据很重要:Artificial Analysis 的编程智能体指数通常基于 SWE-bench 等标准化任务集——这类测试让模型在真实 GitHub 仓库中独立定位并修复 Bug,以通过率作为核心指标。需要特别注意的是,基准测试存在「分布偏差」:测试集中的任务类型、难度分布和仓库规模,未必能代表真实开发场景的多样性。此外,「Max 模式」通常意味着模型被允许使用更多推理步骤和工具调用,这会显著提升得分,但同时也会大幅增加 Token 消耗。基准测试是「理想工况」,实际开发中的复杂度和不确定性要高得多,参考此类数据时应同时关注测试条件、成本和延迟,而非仅看单一分数。
如何选择?Sol / Terra / Luna 选型指南
面对三种模式和三个版本,选型逻辑其实很简单:
- 快速问答、搜索资料、临时改文案 → 聊天模式
- 日常工作、从头分析 → 工作模式(Terra)
- 重要报告、复杂研究、专业 PPT、长流程开发 → 工作模式或 Codex 模式(Sol)
- 大量总结、改写、分类等高频轻任务 → Luna

核心原则始终是:任务越重要越往 Sol 走,任务越轻量越往 Luna 走。
总结
这次更新最值得记住的三点:
- 入口合并:Codex 并入 ChatGPT,桌面端可自由切换聊天、工作、Codex 三种模式。
- 边界更清晰:工作模式负责研究与文档生成,Codex 模式专注软件开发。
- 按档位分家:GPT-5.6 通过 Sol、Terra、Luna 三档,把质量、速度、成本的取舍权交还给用户。
对普通用户而言,最值得关注的是新增的「工作模式」——它将研究、文档生成、本地文件读取、桌面应用调用等 Agent 能力整合到一起,让 ChatGPT 从「聊天工具」进一步向「工作平台」演进。这一转变与行业内 Copilot、Cursor 等产品将 AI 深度嵌入工作流的趋势高度一致,也预示着 AI 助手的竞争正从「谁回答得更准」转向「谁能帮你做得更多」。感兴趣的话,更新后不妨亲自上手体验。
相关推荐

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。

匈牙利算法详解:原理、复杂度与工程实现指南
深入解析匈牙利算法(Hungarian Algorithm)的核心原理、O(N³)时间复杂度优势及工程实现方法。涵盖分配问题定义、算法步骤详解、Python/C++实用工具库推荐,以及在多目标跟踪、资源调度等场景中的应用实践。

Hermes Control Deck:用手机远程操控Codex的开源硬件控制台
Hermes Control Deck是一个开源微型控制台项目,支持通过实体按钮和手机远程界面控制Codex编程助手,提供会话恢复、实时状态监控、远程审批等功能,为AI编程交互带来全新体验。