Codex Harness开源:AI护城河从模型转向运行时

从CI外壳到完整引擎:OpenAI的一次全面开放
2026年8月19日,OpenAI正式开源了Codex Harness。这一事件之所以值得关注,是因为它标志着AI竞争焦点的一次深层迁移——护城河正在从模型本身,搬到围绕模型运转的"运行时"(Runtime)。
所谓运行时,指的是程序在实际执行过程中所依赖的全部基础设施——包括内存管理、任务调度、状态恢复、并发控制等。在AI Agent语境下,运行时还额外承担了上下文窗口管理、工具调用编排、成本监控等职责。它是将模型的"智能"转化为可靠产品行为的关键中间层。
回顾时间线:2025年4月,OpenAI仅仅开源了Codex的CI(Continuous Integration,持续集成)外壳,也就是面向自动化构建和测试流程的最外层命令行接口,开发者通过它触发代码检查和测试运行等标准化流程;而一年之后,引擎盖下的东西全部打开了。这次开源包含了Rust核心、应用服务器以及完整的AST(抽象语法树)处理能力。开源仅三天,项目就在GitHub上斩获了107,000颗星,热度可见一斑。
Rust是一门系统级编程语言,以零成本抽象、内存安全(无垃圾回收)和极致性能著称,常用于对延迟和吞吐量要求极高的基础设施。OpenAI选择Rust重写性能敏感路径,意味着在Agent频繁的工具调用、状态切换和并发任务中,可以避免传统GC语言(如Python、Go)带来的停顿和内存开销。而AST是源代码的结构化表示,编译器和代码分析工具通过AST理解代码的逻辑层次。Codex Harness内置完整的AST处理能力,意味着它不是简单地把代码当文本处理,而是能够理解代码结构、识别函数边界、追踪变量引用,从而实现更精确的代码生成和修改。
这次开源的核心内容是Agent运行时和集成接口,具体包括Rust核心、CI、应用服务器以及技能库、插件库。需要说明的是,AI的扩展能力和云端服务并没有开源,但模型可以随意替换——这一点非常关键,它意味着开发者不会被锁死在OpenAI的模型生态内。
Harness到底解决了什么问题
要理解Harness的价值,需要先厘清一个核心分工:模型负责思考,Harness负责干活。
在实际的Agent系统中,光有一个聪明的模型远远不够。何时停止推理?上下文太长了怎么办?断点如何恢复?工具调用需不需要审批?成本如何控制?事后如何审计?这一系列棘手的工程问题,全都由Harness来回答。换句话说,模型只是提供智能,而把智能真正落地成可用产品的所有"脏活累活",都是运行时层面的责任。

这些问题在传统软件工程中各有成熟解法,但当执行主体从确定性程序变为概率性的大语言模型时,每一个问题都需要重新设计。例如"何时停止"——传统程序有明确的终止条件,而LLM可能陷入无意义的循环推理;"断点恢复"——传统程序的状态是确定性的,而Agent的"思维状态"包含了不可精确序列化的推理上下文。这就是为什么Agent运行时需要专门的工程设计,而非简单套用现有的任务调度框架。
这也解释了为什么运行时会成为新的护城河。模型的能力正在快速趋同,而如何高效、可靠、可控地调度模型完成复杂任务,才是真正区分产品优劣的地方。
三层接口:从脚本到产品全覆盖
Codex Harness提供了三层递进式的接入接口,覆盖了不同开发场景:
- 第一层 Codex Exec:一行命令即可跑起来,适合快速试验和脚本化任务;
- 第二层 TypeScript SDK:支持程序化编排,方便开发者构建自定义流程;
- 第三层 应用服务器:将完整的Agent循环嵌入你自己的产品中。
这种分层设计让不同需求的用户都能找到合适的切入点,从个人开发者的快速验证,到企业级产品的深度集成,都有对应的路径。这也是成熟开发者工具的典型设计哲学——低门槛进入,高天花板扩展。
惊人的性能数据:同一模型得分提升近3倍
本次开源最引人注目的一组数据是:在完全相同的模型下,仅靠Harness策略的优化,ARC-AGI-3的得分就从13.3%飙升到38.3%,提升接近三倍,同时输出Token还节省了约六倍。

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由François Chollet于2019年提出的一项AI推理能力基准测试,专门评估系统在面对全新问题时的抽象推理和泛化能力。与传统AI基准不同,ARC的每道题都是独一无二的视觉模式变换谜题,无法通过记忆训练数据来作弊。ARC-AGI-3是该基准的第三个版本,难度进一步提升,被认为是衡量系统"真实智能"的黄金标准之一。从13.3%到38.3%的提升幅度在这个基准上极为显著——人类在ARC测试上的平均正确率约为85%,而此前大多数AI系统的得分长期徘徊在较低水平。
这个结果非常有说服力地印证了"运行时决定成败"的观点。同样的大脑,配上不同的执行框架,最终表现天差地别。其背后的秘密主要有三点:
- Rust重写:所有性能敏感的路径都用Rust重写,保证了执行效率;
- 模型无关:兼容任意端点,可以随意替换底层模型;
- 上下文工程:保留关键推理内容,压缩过期信息,从而在提升准确率的同时大幅降低Token消耗。
上下文工程(Context Engineering)是2025-2026年间兴起的一个关键工程实践领域。即使模型支持百万级Token的上下文窗口,实际使用中也面临三重挑战:首先是成本——每个Token都有计算开销,上下文越长推理越慢越贵;其次是注意力稀释——研究表明模型在极长上下文中容易"遗忘"中间内容(学术上称为Lost in the Middle现象);最后是相关性衰减——早期的推理步骤可能已经过时。Codex Harness的上下文工程策略包括摘要压缩(将冗长的中间步骤浓缩为要点)、选择性保留(只保留与当前任务相关的历史信息)、分层缓存(高频访问的内容保持原文,低频内容压缩存储)。正是这些精细的工程优化,使得同一模型在不同运行时下表现出如此巨大的差异。
对不同群体而言,这次开源意味着:开发者能用上和商业产品完全相同的运行时;企业获得了现成的沙箱与审批机制;整个行业见证护城河从模型向运行时的转移;而开源社区则多了一份生产级的参考实现。
Codex Harness vs DeepSeek Harness:造引擎还是装引擎
2026年可以说是"Agent运行时元年",两家巨头把运行时摆上了台面。那么问题来了:Codex Harness和DeepSeek Harness该怎么选?
二者的定位有本质差异。DeepSeek Harness是通用运行时,一切皆插件,采用MIT协议;Codex Harness则是编码智能体平台,经过生产验证,采用Apache协议。 用一个比喻来说:一个是造引擎,一个是装引擎。DeepSeek开放内部结构,让你构建属于自己的平台;Codex则开放成熟的循环,让你直接嵌入使用。
关于两种开源协议的选择,背后体现了不同的商业哲学。MIT协议极其简短(约170个英文单词),本质上只要求保留版权声明和许可声明,对使用者几乎没有额外约束,是"最自由"的主流开源协议。Apache 2.0协议则在MIT的基础上增加了两个关键条款:一是明确的专利授权——贡献者自动将相关专利授权给使用者,降低了专利诉讼风险;二是修改声明要求——对原始代码的修改必须标注。DeepSeek选择MIT体现了其"完全开放、不设限制"的哲学;OpenAI选择Apache则更注重专利保护的清晰性,这对企业用户在法律合规层面尤为重要。

更有意思的是,Codex还能作为子代理装进DeepSeek Harness中——两者并不互斥,甚至可以协同工作。
DeepSeek Harness的五个独有优势
- 一切皆插件的架构
- 事件溯源可审计
- 支持Hook与Ralph长任务
- 权限三层分离
- 模型完全中立
事件溯源(Event Sourcing)是一种软件架构模式,系统不存储当前状态,而是存储导致当前状态的所有事件序列。这意味着系统的每一步操作都有完整的历史记录,可以随时回放、审计甚至回滚到任意时间点。在AI Agent场景中,当一个Agent执行了错误操作时,运维人员可以精确追溯到是哪一步推理、哪一次工具调用导致了偏差,这对于金融、医疗等高合规行业至关重要。
权限三层分离通常指将认证(Authentication,确认身份)、授权(Authorization,确认权限)和执行(Execution,实际操作)分离到不同的系统组件中。这种设计确保即使Agent拥有强大的执行能力,其行为边界仍然受到严格的权限控制——Agent知道自己是谁、被允许做什么、以及实际能触达哪些资源,三者互相独立又互相制约。
这些特性使它特别适合自研平台和高合规场景。
Codex Harness的三个核心优势
- 经过生产验证的运行时
- 最短的接入路径
- 硬核的性能数据
代价则是它围绕OpenAI生态构建,Add与云端服务不开源。

一句话选型建议
如果要造引擎,选DeepSeek Harness;如果要装引擎,选Codex Harness。具体来说:自研平台、多模型中台选前者;编码工具集成、CI/CD场景选后者。
所谓多模型中台,是指企业内部统一管理和调度多个AI模型的平台层——不同业务线可能需要不同模型(代码生成用一个、文档处理用另一个、数据分析用第三个),中台负责统一接入、负载均衡、成本核算和权限管理。在这种场景下,DeepSeek Harness的"一切皆插件"和"模型完全中立"的设计哲学显然更加契合。
结语:竞争焦点的转移
随着两家巨头相继开放运行时,AI领域的竞争正在从"谁的模型更强",转向"谁的框架更可靠、更开放、更省Token"。这是一个值得所有AI从业者关注的信号——在模型能力逐渐趋同的今天,工程化的运行时能力,或许才是下一阶段真正的差异化竞争力所在。
这一趋势与互联网历史有着惊人的相似性。2000年代,搜索引擎的核心竞争力是算法(PageRank);到了2010年代,算法趋同后,竞争焦点转移到了数据和基础设施。如今AI领域正在经历类似的演进:模型(算法)正在趋同,而运行时(基础设施)正在成为新的战场。掌握运行时意味着掌握了AI应用的"最后一公里"——从智能到产品之间那段最关键、也最容易被低估的距离。
核心要点
相关推荐

Shoggoth隐喻:AI对齐问题的深层焦虑与思考
Shoggoth(修格斯)隐喻将大语言模型比作戴着笑脸面具的克苏鲁怪物,精准揭示了AI对齐的核心难题。本文解析这一AI文化符号的由来、含义及其背后关于能力与理解鸿沟、RLHF对齐局限性的深层思考。

AI经济学研究入门指南:经济学博士生的系统路线图
面对AI经济学这个庞大领域,经济学博士生该如何系统入门?本文梳理AI经济学四大研究主线、文献阅读方法、技术学习优先级,提供从Acemoglu到Brynjolfsson的完整知识体系搭建路径。

自托管ASR模型vs云端API:成本与可靠性全面对比
深入分析自托管ASR开源模型与Google等云端语音识别API的成本差异、可靠性对比及盈亏平衡点计算,提供Whisper、IBM Granite等方案的实用选型建议,帮助团队做出最优技术决策。