Codex零基础入门教程:安装、模型选择与实战全解析

OpenAI Codex不只是代码助手,更是能控制电脑、自动化任务的全能智能体工具平台。
本文系统介绍了OpenAI推出的Codex工具平台——定位对标Anthropic Claude Code,但功能已超越传统代码助手,可控制电脑、操作浏览器并执行自动化任务。文章涵盖四种接入方式(桌面应用、IDE插件、CLI、云版本)、模型与推理等级的选择建议(99%场景用GPT-5.5中度推理即可)、核心插件(电脑控制、Chrome、GitHub)的安装与用法,以及一个从零构建多人国际象棋游戏的完整实战案例。进阶部分重点讲解了Compact压缩上下文、Fork分叉、Plan计划模式、Shopping智能体循环等关键命令,以及解决模型记忆缺失问题的AGENTS.md文件机制,并介绍了Worktree并行开发、代码审查和定时任务等高级功能。
Codex是什么:OpenAI对标Claude Code的全能工具
Codex是OpenAI推出的、对标Anthropic Claude Code的开发工具。但正如视频作者反复强调的,它远不止是一个编程助手——其功能复杂度和应用场景都超出了很多人的想象。
最基础的用途当然是写代码,让你调用OpenAI的顶级模型(如GPT-5.5系列)完成编程任务。但Codex更有趣的地方在于:它可以直接控制你的电脑、操作浏览器、自动化重复性工作,甚至能帮你在Spotify上找到并播放一首歌。换句话说,它是一个能真正接管设备、执行任务的智能体工具,而非仅限于代码生成。
需要注意的是,OpenAI在命名上确实容易让人混淆:它们既有过叫Codex的模型(真正的LLM),现在又有了名为Codex的工具。本文讨论的是后者——那个能用多种方式接入、功能齐全的工具平台。
多种使用方式与安装门槛
Codex提供了四种主要的使用途径,适配不同的使用场景:
- 独立桌面应用:支持Windows和Mac(暂无Linux版本),功能最齐全,也是作者最推荐的方式。
- IDE插件:可安装到Cursor、VS Code、Windsurf等主流编辑器中,在编辑器内直接使用Codex界面。
- CLI命令行界面:虽然没有漂亮的图形界面,但优势在于可以在Linux或服务器上24小时不间断运行。
- 云版本:直接在浏览器中运行,适合需要在手机上临时操作的场景。
关于费用,使用Codex需要ChatGPT订阅账号登录。作者指出,最低每月20美元的Plus计划即可使用,而且使用额度相当慷慨——大约是同类工具的5到10倍。除非你长期使用最高端模型并24小时运行,否则很难触及上限。至于通过OpenAI API密钥接入的方式,作者明确表示不推荐,因为成本会高得多。
模型与推理等级:99%的人用GPT-5.5中度就够了
在新建对话时点击模型选择器,可以看到两个关键维度:模型和推理等级。
推理等级分为轻度、中度、高度和超高度。等级越高,结果通常越好,但耗时也会显著增加——可能是四五倍,极端情况下甚至十倍。作者提到自己有些任务在超高度推理下跑了30分钟。因此,推理等级的选择本质上是在"质量"和"等待时间"之间权衡。
模型方面,GPT-5.5是当前最强的前沿编码模型,几乎适用于所有任务;上一代模型和更小更快的模型则适合简单问答或快速改UI,尤其是在额度快用完时作为备选。
作者给出的实用建议非常直接:对99%的人来说,一直用GPT-5.5、推理等级设为中度即可。 如果额度充足,可以开启快速模式让运行更快;处理复杂任务时再把推理等级调到高度或超高度。

插件系统:电脑控制与浏览器自动化
Codex最吸引人的功能之一,是它丰富的插件生态和对设备的控制能力。
进入插件页面,几个核心插件值得优先安装:
- Computer Use(电脑控制):安装并授权后,Codex可以打开应用、操作系统。有意思的是,当它控制电脑时,它使用的是自己的光标,你仍然可以同时正常使用电脑。
- Chrome扩展:安装后Codex能控制浏览器,打开标签页、搜索内容、调试应用。
- GitHub:对任何编程项目都强烈推荐。它提供版本控制能力,让你保存更改、云端存储、跨设备访问、团队协作,以及在Codex出错时回退代码。

除此之外还有Google Drive、幻灯片、电子表格、Slack、Gmail等插件可按需添加。作者演示了两个电脑控制的例子:让它打开记事本写便条,以及让它找到并播放Drake最热门的歌——在发现本机没装Spotify后,Codex自动改用Chrome完成了任务。这种灵活应变的能力,正是智能体工具的价值所在。
Computer Use技术本质上是让AI模型通过截图感知屏幕状态,再模拟鼠标点击和键盘输入来操控界面,属于「GUI Agent」范畴。这与传统的API调用或脚本自动化有本质区别:它不需要目标软件提供任何接口,理论上可以操控任何有图形界面的程序。Anthropic在2024年率先推出了同名功能,OpenAI随后跟进。值得注意的是,这类技术目前仍不稳定——模型可能误识别UI元素或在界面变化时失效,因此更适合用于辅助型任务,而非完全无人监督的关键业务流程。
实战:用Codex从零构建多人国际象棋游戏
作者通过一个完整案例展示了Codex的编码流程。首先建议为每个编程任务创建一个新项目(本质上是你电脑上的一个文件夹),这样可以把相关聊天记录归类整理。
创建项目时有几个选项:连接Codex web(信息发送到云端)、本地工作(在自己电脑上),或创建Worktree(项目的克隆副本,用于同时处理多个任务而不冲突)。项目创建后会自动连接Git并创建Main分支。切换到"完全访问模式"可以省去反复批准操作的麻烦。

作者给出的提示是:构建一个使用WebSocket后端、带数据库记录分数和ELO等级分、支持多人对战的国际象棋游戏,先做MVP再完善。Codex随即开始创建多个文件,右侧面板可以实时查看文件、代码更改和预览标签页。
第一轮完成后,游戏已经能在本地运行:输入用户名加入游戏、匹配对手、走棋、记录走法、更新排行榜。作者还演示了浏览器视图中的实用功能——截图保存到剪贴板,以及标注功能(选中具体HTML元素后直接提出修改要求,比如改标题、换棋盘颜色)。标注让反馈更有针对性,Codex能据此做精准修改。
命令系统:Status、Compact、Fork、Plan、Shopping
Codex内置了大量以斜杠开头的命令,几个关键命令需要掌握:
Status与上下文管理
/status显示你的使用限制和上下文占用情况。了解上下文很重要——当对话历史、工具调用过多,上下文填满时模型表现会变差。
Compact压缩上下文
/compact会把当前对话的所有内容生成摘要,添加到一个全新对话中。作者演示时上下文从22%降到了4%。建议在达到70%-90%占用率时手动压缩,而不是等Codex自动处理。
Fork分叉
/fork会复制当前所做的一切到新的工作树中,让多个智能体在各自的代码库副本中并行工作,最后再合并、解决冲突。
Plan计划模式
在做复杂任务前,Plan模式会先向你提出澄清问题,再生成详细计划。作者用它规划了一个"Chess.com克隆版"的扩展方案,包含着陆页、统计数据、谜题模式等,Codex会逐项询问细节后生成完整计划文档。
Shopping目标循环模式
/shopping命令会让Codex持续运行直到目标达成——这就是近期热议的"智能体循环"。它会规划、执行、检查目标是否完成,没完成就继续。使用要点是设定清晰的目标和完成条件,但要注意这会消耗大量额度。
上下文窗口(Context Window)是大语言模型一次能处理的文本总量上限,以Token(子词单元)计算。GPT-4级别模型通常支持128K Token,约合10万汉字。当对话历史、代码文件、工具调用记录不断累积并接近上限时,模型会开始「遗忘」早期内容,导致回答质量下降、忘记之前的设计决策甚至产生前后矛盾。/compact命令通过将长对话压缩为结构化摘要来重置这一计数,是长时间开发会话中维持模型表现稳定的关键操作。
Worktree与代码审查

Worktree是Git提供的功能,用于支持并行智能体。如果多个智能体在相同文件上工作就会产生冲突,而Worktree让每个智能体在仓库的独立副本中工作。这属于较进阶的开发者功能,配置略复杂,但对多任务并行场景很有用。
代码审查则是通过/review命令实现,它能自动将当前更改与GitHub上的内容对比,或审查未提交的更改,发现错误并给出评论。作者建议:在推送到远程仓库前,应该总是先做一次审查。
Git Worktree是Git 2.5引入的功能,允许同一个本地仓库同时检出多个分支到不同目录,各目录共享.git对象数据库但拥有独立的工作区。这与传统做法(克隆多份仓库副本)的区别在于:所有Worktree共享同一套提交历史和配置,切换和合并更加高效。在多智能体开发场景中,这意味着可以让多个AI实例同时处理不同功能分支,最终通过标准Git合并流程整合结果,而不必担心各智能体的中间状态互相污染。
记忆机制:AGENTS.md文件是关键
作者特别强调了一个容易被忽视的事实:默认情况下,Codex不会记住你过去做过的事情。 每次新建对话,它都是从零开始,只会审查当前仓库内容来加载相关上下文。它不会保留完整对话历史,也可能忘记你告诉过它的偏好。
解决方案是创建一个AGENTS.md记忆文件——这在各类AI编程工具中都很常见。这个文件会在每次开始工作前自动加载到模型中,适合存储项目规范、技术栈、运行方式、使用偏好等你不想反复重复的重要信息。
作者让Codex自动创建了这个文件,填入项目规范、技术栈、运行方法等内容。之后新建对话询问项目规范时,Codex无需搜索文件就能立即回答,因为AGENTS.md已被加载进系统信息。代价是上下文使用量会略高一些,但对于长期项目和多人协作来说非常值得。
AGENTS.md的设计思路源于AI编程工具的「规则文件」惯例。Cursor有.cursorrules,Cline有.clinerules,Claude Code也有类似的CLAUDE.md。这类文件的核心作用是将隐性知识显式化——把只存在于开发者脑中的项目约定写成文字,让每次新启动的无状态模型也能获得项目上下文。在大型团队中,这个文件还能作为AI行为规范的载体,确保不同成员调用AI时遵循一致的代码风格和架构决策,相当于给AI定制了一份「入职手册」。
定时任务与更多扩展
Codex还支持定时任务,类似其他工具的功能,可以在电脑开机时自动运行。典型用例包括:每日简报(早上打开电脑搜索新闻)、每周回顾、项目监控(有变化时执行操作)。你可以通过对话创建,也可以从模板选择,设置运行时间、使用的模型和运行环境。
除此之外,Codex还支持添加MCP服务器、配置钩子、连接Git环境等更多高级能力。对于想实现自动化的用户来说,这些功能提供了很大的想象空间。
小结
从这份教程可以看出,Codex的定位已经远超传统的代码助手。它融合了编码能力、电脑/浏览器控制、智能体循环、记忆管理和自动化任务于一体。对新手而言,掌握"GPT-5.5+中度推理"的默认配置、善用插件和AGENTS.md文件,就能快速上手;而Worktree、Fork、代码审查等进阶功能,则为专业开发者提供了并行开发和质量保障的工具链。
相关推荐

OpenAI全量推送GPT-6与Intelligent UI:ChatGPT告别纯文本
OpenAI向全部ChatGPT用户推送GPT-6模型,并上线Intelligent UI智能界面,可动态生成按钮、滑块与交互图表。本文解析双旗舰下放策略、交互革命及三大使用边界。

智能体底座(Harness)比模型本身更关键:YC深度解析Agent架构演进
YC在Harness Night分享会上提出:决定智能体能力的关键不是模型本身,而是外层的Harness底座。本文梳理从GPT-2到自改进Harness的演进,解析Prime Agent、OpenJarvis、QM三大实践及Agent架构设计要点。

用n8n搭建LinkedIn线索抓取与丰富化自动工作流
一套基于n8n的LinkedIn线索抓取与丰富化自动工作流:只需填写职位、地点、行业和公司规模,系统即可自动生成含专业邮箱和验证状态的客户名单并写入Google表格。本文解析其流程、输出字段与合规注意事项。