新版Codex全攻略:从基础到高阶的完整实操指南

OpenAI 近期对 Codex 进行了大规模更新,不仅将其与 ChatGPT 桌面端整合为同一应用,还带来了更强的多智能体协作、更丰富的插件生态、图片批注编辑以及持久记忆等能力。本文基于 B站UP主的完整实操教程,系统梳理新版 Codex 从基础使用到高阶开发的全套玩法,帮助你真正把这个工具用好。
Codex基础界面与项目文件夹
界面布局与模型选择
新版 Codex 已与 ChatGPT 桌面端合并,顶部可在 ChatGPT 与 Codex 之间自由切换。ChatGPT 更偏向聊天和办公,而 Codex 功能更丰富,更适合代码开发和项目执行。Codex 的定位本质上是一个 AI Agent 平台——AI Agent(智能体)是指具备自主感知环境、制定计划、调用工具并执行任务能力的AI系统,区别于传统的"一问一答"式聊天机器人。多智能体协作(Multi-Agent Collaboration)则是让多个Agent各司其职、并行或串行地完成复杂任务。这一范式在2024-2025年成为AI应用的核心趋势,其底层逻辑是将大型任务拆解为子任务,分配给具有不同工具权限和专业能力的Agent,最终汇总结果,从而突破了单一模型的上下文窗口限制和能力瓶颈。
在模型选择上,教程给出了明确建议:开发或较难的任务用 GPT-5.x(High 档),小型任务用轻量模型即可。首次执行任务时把模型调高、提示词写清楚,能让第一次输出的质量更有保障。
项目文件夹的正确用法
项目文件夹是桌面端 AI Agent 的核心。它可以存放文档、表格、图片、代码以及任务规则,Codex 不仅能读取分析,还能直接创建、修改和整理其中的文件。
创建项目时可以添加多个源文件夹:
- 主文件夹:默认工作空间,通常存放任务规则和最终生成结果;
- 补充文件夹:作为个人知识库,存放品牌规范、历史方案、参考数据、论文笔记等。
以 UP主的实际工作流为例,他把大模型论文、技术报告和研究笔记整理成补充知识库。研究 DeepSeek Harness 时,新建专属研究文件夹并设为主文件夹,再让 Codex 深入调研——收集官方文档、项目仓库、发布说明,横向对比不同作者的操作方法,最终生成一份带来源链接的深度调研报告,还附上了 13 张不同作者用法的分析卡片。
计划模式与权限设置
Codex 提供了计划模式,先生成方案供你确认后再执行;权限则分三档:
- 请求批准:每次风险操作都询问;
- 帮我批准(推荐):AI 自行处理低风险操作,高风险才确认;
- 完全访问权限:AI 全权负责,一般不推荐。
值得一提的是快照功能:同时按下两个 Command 键即可把页面快照发给 AI,快照会带上 URL 链接,让 AI 清晰看到桌面内容,比普通截图强很多。此外,运行过程中还能通过"调整方向"按钮中断并追加上下文。

本地办公文件处理能力
真实办公场景中,我们更多面对 Excel、PPT、Word 等本地文件。新版 Codex 在这方面的表现相当亮眼。
数据分析与文档生成一条龙
以"基于手机配件近四个月销售数据做经营汇报"为例,Codex 可以借助插件完成完整链路:
- 使用 spreadsheet 插件套用模板生成 Excel 分析表;
- 使用 data analytics 插件按照"数据质量检验→构建图表→结果验证"的流程执行,避免直接套用空白表格;
- 使用 document 插件配合自定义模板生成 Word 版经营报告;
- 使用 presentation 插件从 Word 提炼要点生成 PPT;
- 甚至可以生成 HTML 网页。
更关键的是编辑体验:在 Word、PPT、HTML 中都可以直接选中某段内容或添加批注评论,把修改需求发送到对话框,非常接近人类的协作方式。PPT 还能直接调用生图功能添加配图。

多任务并行执行
新版多智能体能力更稳定。你可以在一条指令里安排多个任务,Codex 会自动新建多个独立对话分工执行——比如同时研究 DeepSeek Harness 和分析电商数据,两个任务并行推进,完成后统一汇报结论和文件位置。这一"一条指令、多对话并行"的设计,极大提升了处理繁杂事务的效率。
生图与图片批注修改
生图是 Codex 的另一大功能。以亚马逊北美站户外电子手表卖家为例,Codex 能读取产品图、联网校验亚马逊图片规范,再生成符合尺寸要求的产品图和 A+ 图片。
对于图片修改,Codex 新增了图片批注编辑能力,可以直接在图上添加评论、擦除、调整大小。而针对精细修改难以用文字描述的痛点,教程推荐了 GitHub 上开源免费的 Covered 插件——把图片拖入画布圈出要改的区域并标注(如"把手表数字改成 9.14""去掉太阳光"),再连同截图发给 Codex,就能精准描述修改意图。
一个实用 Tips:做图时应多与 AI 沟通。比如儿童短袖的"吸湿速干"卖点,AI 会建议改写为"运动后快速干爽、不易着凉感冒",让消费者更有具象化感受。
持久记忆与CLI联动
agents.md的两级配置
Claude Code 有 CLAUDE.md,Codex 对应的则是 agents.md,分两级配置:
- 全局配置:在设置-个性化中,写入个人偏好、代码风格、常用工具;
- 项目级配置:位于工作区根目录,提供特定项目的技术栈、架构说明。
agents.md 和 CLAUDE.md 代表了一种新兴的"AI工程实践"——通过结构化文本向AI声明项目约束、代码风格、技术栈偏好和工作规范。这种做法借鉴了软件工程中 .editorconfig、.eslintrc 等配置文件的思路,但面向的"执行者"从IDE和Linter变成了AI。分层配置(全局→项目→子目录)的设计则参考了Git配置的优先级机制,确保通用规范和项目特殊需求能够共存而不冲突。随着AI编程工具的普及,维护好这类配置文件正在成为开发者的新基本功。
优先级上,越靠近当前工作目录优先级越高,Codex 会自动合并各层配置并遵循"后者覆盖前者"的逻辑。例如顶层放通用规范,frontend 和 backend 文件夹各放专属 agents.md,层层递进不会冲突。
CLI联动打通业务流
Codex 可直接操作终端,因此能调用飞书 CLI、钉钉 CLI、GitHub CLI 等工具。教程演示了两个典型场景:
- 让 Codex 读取文章链接及评论,调用飞书 CLI 修改文档并用红色标记 AI 改动;
- 电脑装机工作室将各平台订单 Excel 数据自动填入飞书多维表格,自动跳过重复项,实现销售部与技术装机部之间的跨部门信息联通。
这类方法同样适用于电商选品调研、客户跟进、销售线索管理等场景,让分散的数据真正流动起来。
插件、Skill与自动化
插件生态:Skill + MCP + CLI的集合
新版插件本质是把干一类活所需的工具打包,且支持自建插件。值得补充的是,MCP(Model Context Protocol)是Anthropic于2024年底提出的开放协议,旨在为AI模型提供标准化的工具调用和上下文注入接口,类似于"AI世界的USB接口"。在MCP之前,各平台的插件实现方式各不相同,开发者需要为每个平台单独适配。MCP的出现推动了插件生态的标准化,但随着Codex等平台将Skill、CLI调用和原生插件深度整合,MCP在实际使用中的必要性有所降低——平台内置的能力已经覆盖了大部分MCP原本要解决的问题。
以下是几类值得关注的插件:
- 视频类:remotion(React)、hyperframes(HTML/CSS)用代码做视频;chatter card 是对话式 AI 剪辑插件,剪口播非常丝滑;
- 设计类:Product Design(OpenAI 版设计插件),能自动调用多个子智能体协同开发页面,视觉效果高度还原参考风格;
- 浏览器类:Chrome 自动化控制你正在使用的登录状态浏览器,适合操作后台、报销系统;ChatGPT 内置浏览器则在右侧打开,适合临时查资料、填问卷;
- 系统类:Computer Use 可跨平台接管鼠标键盘完成桌面任务,但额度消耗快;录制技能可以把手动演示的工作流录成可复用的专属技能包。
Computer Use(计算机使用)是指AI通过模拟鼠标点击、键盘输入和屏幕截图识别来操作桌面应用程序的能力。这项技术由Anthropic在2024年10月率先公开演示,其技术原理是AI通过周期性截取屏幕画面,利用视觉理解能力识别界面元素的位置和状态,然后生成对应的鼠标坐标和键盘指令来完成操作。优势是无需API适配即可操作任何GUI应用,但截图识别和坐标计算消耗大量token,速度远慢于直接API调用,且在界面元素密集或动态变化时容易出错,因此更适合作为其他自动化手段的补充,用于处理那些没有CLI或API的传统软件。

Skill:越用越懂你的技能库
Skill 是给 AI 的一项专属技能。教程演示了创建 AI 动画 Skill 的完整过程:放入参考图 → 用 Skill Creator 反复确认细节 → 生成图片测试 → 调用 hyperframes 渲染视频。做完后还能把使用中遇到的经验和坑写回 Skill,让它越来越贴合自己的需求。
真正好用的 Skill 往往是根据自己工作流定制的——老师做备课 Skill,电商做上新 Skill,自媒体做脚本分镜 Skill,办公可做周报、会议纪要 Skill。相比之下 MCP 目前用得已经不多。
自动化:综合运用的集大成
自动化之所以放在最后讲,是因为它综合运用了前面所有能力。概念很简单:把原本手动发送的工作设为按固定时间自动执行。比如设定每天早上 9 点自动调用 AI 新闻和 GitHub 热点的 Skill,汇总后以飞书文档发送——每天准时收到最新资讯。

AI编程高阶玩法
最后是代码开发中的高阶功能,教程通过开发一个 AI 工作台并部署上线完整演示。
Goals目标模式
当需求文档写得非常详细时(包含技术栈、设计基调、架构示意图、功能点),可用目标模式让 AI 一次性执行到位。但要注意:任务表述不清 AI 就容易跑偏,前期一定要写清楚。
分支与Worktree的区别
两者区别可以用一句话概括:
- 分支到新聊天:对话分开了,文件没分开——保留上下文另开思路,但操作同一份文件,适合做 plan 讨论;
- Worktree:对话和项目目录都分开了——基于 git 单独切一份工作区,互不覆盖,适合同时开发两个功能。
注意 Worktree 依赖 git,项目必须已初始化并至少提交过一次。
从技术原理上讲,Git Worktree 是 Git 2.5 版本引入的特性,允许在同一个仓库下同时检出多个工作目录,每个目录对应不同的分支。传统的Git工作流中,切换分支意味着整个工作目录的文件都会被替换,未提交的修改可能丢失或产生冲突。Worktree 解决了这个问题:你可以在 path-A 目录开发 feature-A,同时在 path-B 目录开发 feature-B,两者共享同一个 .git 仓库但文件完全独立。在AI编程场景中,Worktree 的价值更加突出——它允许AI在一个独立的工作区大胆实验,即使生成的代码有问题,也不会影响主分支的稳定代码。
Hook钩子:工作流的安全阀
Hook 是挂在工作流指定节点自动触发的脚本,特别适合那些每次都要做又容易忘的事。Hook 机制在软件工程中有着悠久的历史,Git本身就内置了 pre-commit、post-merge 等十余种钩子,用于在特定操作前后自动执行检查脚本。在AI编程工具中引入Hook机制是对DevOps安全实践的延伸:当AI拥有直接读写文件和执行命令的权限时,误操作的风险显著放大——例如AI可能在调试时将API密钥写入公开文件,或意外修改生产环境的数据库配置。
教程演示了一个安全 Hook:当 AI 涉及修改 .env、数据库文件或核心代码时,先弹出高风险警告,等用户确认后再执行——有效防止 API key 泄露等风险。通过在关键操作节点设置 Hook,相当于为AI的自主行为安装了"安全阀",实现了"AI自主执行"与"人类最终把关"之间的平衡。
站点一键部署
开发完成后,可通过插件将项目一键部署到站点。Codex 会自动完成从传统 Next.js 服务端到云端兼容架构的迁移,支持设置访问权限、自定义域名、查看浏览量和数据库表内容,省去繁琐运维。
总结
新版 Codex 已经从一个代码工具进化为覆盖办公、设计、知识管理、自动化和全栈开发的综合 AI Agent 平台。它的核心价值在于:用项目文件夹管理上下文、用 agents.md 沉淀偏好、用 Skill 沉淀经验、用插件扩展能力、用自动化解放双手。对于希望深度使用 AI 提效的个人与团队,这套工具链值得认真投入学习和定制。
相关推荐

AI编程助手对资深开发者真的提效了吗?瓶颈迁移的真相
AI编程助手真的提升了资深开发者的生产力吗?本文深入分析AI代码生成工具在复杂代码库中的实际表现,揭示生产力瓶颈从代码编写向验证监督迁移的现象,帮助开发者重新定位AI辅助编程的真实价值。

异性恋悲观主义:为什么现代约会让人越来越绝望
异性恋悲观主义正成为一种文化现象:女性用自嘲谈论与男性的关系,背后是政治倒退、经济不平等与情感困境的交织。本文深入探讨这一趋势的成因,以及如何在悲观中保持希望。

用Claude Code整理机器学习笔记:CS189自学实践与方法论
一位自学者用Claude Code将UC Berkeley CS189机器学习课程的零散笔记按主题重构,采用双文档结构梳理知识脉络与概念空白,展示AI辅助学习的高效方法论。