Codex屏幕录制转技能:演示一遍,永久自动执行

OpenAI Codex Record and Replay:做给 AI 看,比写提示词快十倍
OpenAI Codex 最近上线了一项名为 Record and Replay 的新功能,核心理念简单直接:你在 Mac 上操作一遍工作流,Codex 在旁边"看着学",然后自动生成一个可复用的技能文件,以后每次需要时直接调用即可。不用写提示词,不用逐步描述,直接做给 AI 看——这可能是目前门槛最低的 AI 自动化方案。
为什么需要 Record and Replay 功能?
日常工作中,很多人都被重复性操作折磨过。以下是三个最典型的痛点:
第一,重复操作做到手软。 每周发视频、填报销、建工单,同样的步骤来来回回十几遍,一不小心还填错字段。
第二,提示词越写越长。 想让 AI 帮忙干活,得把每一步都交代清楚——点哪个按钮、填哪个框、点保存——写得比自己做还累。
第三,个人偏好说不清。 命名规则、字段顺序、审核流程这些习惯你心里有数,但要写成文字就头大,AI 也总理解错。
说到底,能用嘴说清楚的事不一定能用文字写清楚,展示比描述快十倍。 Record and Replay 正是基于这个洞察而设计的。
Codex Record and Replay 的工作原理
Record and Replay 是 OpenAI Codex 的一项新功能,整个流程分为三个核心步骤:

第一步:录制(Record)
打开 Codex 的插件面板,选择 Record Skill,批准屏幕录制权限,然后像平时一样操作你的工作流。你不需要做任何额外的事情,就像正常干活一样。
第二步:AI 学习与技能生成(Learn)
Codex 会观察你的每一步操作和每个窗口内容。录制结束后,它自动分析整段流程,生成一份 SKILL.md 的技能文件。这份文件包含四个关键信息:
- 什么时候用这个工作流
- 需要哪些输入参数
- 具体执行步骤是什么
- 怎么验证结果
这里的技术核心是 Computer Use 能力——OpenAI 在 2024-2025 年间逐步推出的一项关键技术,允许 AI 模型像人类一样操作计算机:移动鼠标、点击按钮、输入文字、读取屏幕内容。这项技术代表了 AI 从「语言助手」向「数字劳动力」的关键跨越。
要理解 Computer Use 的技术意义,需要先了解它与传统自动化方案的本质区别。在 Computer Use 出现之前,让 AI 操作电脑主要依赖两种路径:一是调用应用程序的 API 接口(如 Google Calendar API、Slack API),但这要求目标软件必须开放接口,覆盖范围极为有限;二是传统 RPA 工具通过录制 UI 元素的精确坐标来模拟操作,但极度脆弱,软件一旦更新就可能失效。Computer Use 开辟了第三条路:让 AI 直接"看屏幕、动鼠标",像人类一样通过视觉感知来理解和操作任意图形界面,从根本上绕开了 API 依赖和坐标脆弱性两大历史难题。
从技术架构来看,Computer Use 的底层依赖于多模态大模型的视觉-动作联合建模:模型以截图作为输入,通过目标检测和语义理解定位 UI 元素,再输出结构化的操作指令(如鼠标坐标、键盘事件)。与传统脚本自动化不同,Computer Use 不依赖 DOM 结构或 API 接口,理论上可以操作任何有图形界面的软件。值得注意的是,Anthropic 的 Claude 也在同一时期推出了类似的 Computer Use 功能,两家公司的竞争显著加速了这项技术的成熟——Claude 的实现侧重于通过截图序列推断操作意图,而 OpenAI 的方案则更深度整合了桌面端的辅助功能 API,两种路径各有侧重。这类技术的核心挑战在于如何让 AI 准确理解复杂的图形界面,并在不同应用、不同分辨率、不同主题皮肤下保持操作的稳定性。
值得一提的是,Computer Use 技术的成熟还受益于强化学习(Reinforcement Learning)在 UI 交互领域的应用。研究人员通过构建模拟桌面环境,让 AI Agent 在虚拟界面中反复试错,积累了大量"操作-结果"对应数据。这种训练范式与纯语言模型的监督学习截然不同——模型需要学习的不仅是"看懂界面",还要学会"在不确定情况下采取最优行动",例如当目标按钮被弹窗遮挡时,应先关闭弹窗再继续操作。这种具身决策能力(Embodied Decision Making)是 Computer Use 区别于普通视觉模型的核心特征,也是其能够处理复杂、多步骤工作流的根本原因。
第三步:自动重放(Replay)
新建一个对话,让 Codex 调用这个技能,传入每次不同的参数(比如本期视频的标题、数据文件路径等),它就能自动完成整个流程。
用四个字概括就是:以眼代写。与其把每一步写清楚,不如直接做给 AI 看。
实操演示:完整录制流程详解

以发布 YouTube 视频为例,完整的操作流程如下:
- 打开 Codex,切换到 Plugins 面板,确认 Computer Use 和 Record & Replay 都已就绪
- 点击 Record Skill 开始录制
- 录制开始前,Codex 会让你简单描述准备展示什么(例如:"我要演示怎么发布一个油管视频,从电子表格复制元数据,上传缩略图,添加字幕,然后保存为私密发布")
- 开始正常操作,Codex 会实时跟踪每一步进度
- 流程走完后,点击 Stop Recording 按钮结束录制
录制过程中,Codex 会实时显示进度,例如"第一步:打开发布表格,完成了""第二步:复制标题和描述,完成了"等,让你清楚知道 AI 正在跟踪哪些操作。
SKILL.md 技能文件:可读、可编辑、可定制

录制结束后,Codex 自动生成的 SKILL.md 文件是纯文本格式,这一点非常关键。
SKILL.md 采用纯文本 Markdown 格式来描述自动化流程,这一设计选择背后有深刻的技术考量。传统的 RPA(Robotic Process Automation,机器人流程自动化)工具如 UiPath、Automation Anywhere 通常将录制的操作存储为结构化的 XML 或 JSON 配置文件,普通用户难以阅读和修改。而 SKILL.md 使用自然语言描述每个步骤,本质上是一种"可执行的文档"——人能读懂、能修改,AI 也能解析和执行。
这种方式属于计算机科学中 Programming by Demonstration(示范编程,简称 PbD)的范畴。PbD 是人机交互领域的经典研究方向,核心思想是让系统通过观察用户操作自动推断意图并生成可复用程序,最早可追溯到 1980 年代的学术研究,1993 年 Allen Cypher 编辑的论文集《Watch What I Do》是该领域的奠基性文献。
要真正理解 PbD 的历史局限与当代突破,需要回顾这一领域走过的弯路。早期 PbD 系统的核心瓶颈在于"意图推断"问题:当用户点击某个按钮时,系统无法区分这是"因为这个按钮在屏幕左上角"还是"因为这个按钮标着'保存'"——前者是位置依赖,后者是语义依赖,两者对应完全不同的泛化策略。受限于规则引擎的能力,早期系统只能选择保守的位置依赖策略,导致录制的脚本极度脆弱。1990 年代 Apple 的 Automator 和 Microsoft 的宏录制功能是 PbD 理念的早期商业实践,但它们生成的脚本一旦遇到 UI 变更就会立即失效,这也是这类工具始终未能大规模普及的根本原因。大语言模型的出现彻底改变了这一局面——LLM 天然具备语义理解能力,能够将观察到的操作序列抽象为自然语言描述("点击标有'发布'的蓝色按钮"),再在执行时将自然语言重新解释为具体操作,从而实现跨场景的泛化。SKILL.md 正是 LLM 时代 PbD 理念的最新实践:它不再存储"点击坐标(342, 156)",而是存储"点击标有'发布'的蓝色按钮",这一抽象层次的提升是整个方案能够泛化的根本原因。
从更宏观的视角看,SKILL.md 的设计还体现了一种重要的 AI 系统设计哲学:人类可审计性(Human Auditability)。当 AI 执行的操作以人类可读的自然语言记录下来,用户就能在事后审查 AI 的"思维过程",发现潜在的错误或偏差并加以纠正。这与传统黑盒自动化系统形成鲜明对比——后者的执行逻辑往往深埋在二进制代码或加密配置中,用户无从审查。随着 AI Agent 承担越来越多的关键业务流程,这种透明度将成为企业合规和风险管理的重要保障。SKILL.md 格式的另一个隐含优势是版本控制友好性:纯文本文件可以直接纳入 Git 等版本控制系统,团队成员可以像协作开发代码一样协作维护自动化技能库,这对于企业级部署场景尤为重要。
你可以对生成的技能文件进行二次编辑:
- 修改步骤描述:让流程更精确
- 添加命名约定:统一文件命名规则
- 补充边界情况处理:比如"如果缩略图不存在,跳过上传"
- 添加禁止规则:比如"绝不将视频设为公开发布"
改完之后,Codex 以后执行就按你调整的版本来。这意味着技能文件不是一次性的黑盒,而是一个持续迭代的自动化脚本,只不过它是用自然语言写的。
使用前的准备工作与安装配置
在使用 Record and Replay 之前,需要确认以下条件:
系统要求:
- 目前仅支持 macOS,需要先安装 Codex 桌面 APP
- 在 Codex 设置中安装 Computer Use 插件
- 授予屏幕录制和辅助功能权限(在系统设置 → 隐私与安全性中操作)
Codex 需要用户授予的这些权限涉及 macOS 的 Accessibility API(辅助功能框架)。这套框架基于 AXUIElement 对象模型,将整个屏幕的 UI 层级暴露为可遍历的树状结构,每个节点包含角色(AXRole)、标题(AXTitle)、值(AXValue)等属性,并支持 AXPress、AXSetValue 等操作——最初为视障用户的屏幕阅读器(如 VoiceOver)设计,如今也成为 AI Agent 的重要基础设施。
这套 API 的设计哲学值得深入理解。与纯截图方案相比,Accessibility API 提供的是"语义层"而非"像素层"的 UI 描述:AI 可以直接查询"页面上所有可点击的按钮"并获得带有文字标签的结构化列表,而不必从像素矩阵中识别按钮的位置和文字。这一差异在实践中意义重大——语义查询的计算开销远低于图像识别,准确率也更高,尤其在处理小字体、低对比度等视觉识别困难的场景时优势明显。然而,Accessibility API 并非万能:部分使用非标准 UI 框架的应用(如某些游戏引擎构建的软件)不会向系统暴露语义信息,此时 AI 只能退回到纯视觉识别模式。这也解释了为什么 Codex 同时申请屏幕录制权限和辅助功能权限——两者互为补充,共同构成完整的"感知"能力。Apple 出于安全考虑,要求用户在"系统设置 → 隐私与安全性"中手动授权,防止恶意软件在用户不知情的情况下控制电脑。目前仅支持 macOS 而不支持 Windows,与两个平台的辅助功能框架成熟度密切相关——Windows 的 UI Automation 框架虽然功能类似,但 Win32、WPF、UWP、Electron 等不同技术栈的应用在 API 暴露程度上参差不齐,整体一致性不及 macOS,这也是为什么大多数 Computer Use 类产品都优先支持 macOS 的深层原因。
从安全架构的角度看,Codex 对权限的处理方式也值得关注。macOS 的 TCC(Transparency, Consent, and Control)框架要求每项敏感权限都必须经过用户明确授权,且授权记录存储在系统级数据库中,应用无法自行修改。这意味着用户始终保有对 AI Agent 感知能力的最终控制权——一旦发现异常,只需在系统设置中撤销权限,AI 就立即失去操控屏幕的能力。这种"人在回路"(Human-in-the-Loop)的权限设计,是当前 AI Agent 安全框架的重要组成部分,也是监管机构和企业安全团队在评估 AI 自动化工具时的核心关注点之一。
区域限制:
- 首发区域不包括欧洲经济区、英国和瑞士
- 企业版用户需要在
requirements.toml中确认 Computer Use 是启用状态
安装步骤很简单:打开 Codex → Plugins → 安装 Computer Use 插件 → 系统设置授权 → 确认插件状态为"已启用"。
适用场景与注意事项
哪些任务适合用 Codex 自动化?
只要是你在电脑上重复做的操作,都能录一次、以后让 Codex 自动做:
- 发布视频(YouTube、B站等平台)
- 填写报销单、创建工单
- 下载报表、整理数据
- 提交 Pull Request
- 安排会议、预定工位
最关键的是,你不需要编程背景,不需要写复杂提示词,只要是你能做一遍的事,Codex 就能学着做。
从 RPA 到 AI Agent 的技术演进
Record and Replay 的出现标志着自动化技术从传统 RPA 向 AI Agent 的重要演进。传统 RPA 工具如 UiPath、Blue Prism 诞生于 2000 年代,通过录制 UI 元素的精确坐标或 XPath 路径来实现自动化,这类方案的致命弱点是「脆弱性」:一旦应用升级导致按钮位置偏移或 DOM 结构变化,录制的脚本就会立即失效。Gartner 数据显示,RPA 项目的维护成本通常占总成本的 30%-50%,企业往往需要专职的 RPA 维护团队来应对每一次 UI 变更。
这一痛点催生了"智能 RPA"(Intelligent RPA)的概念,各大 RPA 厂商开始在传统框架上叠加 OCR、计算机视觉等技术,试图提升脚本的鲁棒性。然而这些方案本质上仍是规则驱动的,泛化能力有限。而基于大模型视觉理解的 AI Agent 方案,将「点击第 3 行第 2 列的按钮」升级为「点击标有"保存草稿"的按钮」,通过语义理解替代坐标定位,大幅提升了对 UI 变更的容忍度——即使按钮位置移动了、界面改版了,AI 仍然能通过语义理解找到正确的操作目标。
值得关注的是,这一演进对企业 IT 格局的影响远不止于技术层面。传统 RPA 的高维护成本催生了一个规模可观的"RPA 实施与维护"服务市场,大量咨询公司和系统集成商依赖这一市场生存。AI Agent 方案若真正实现"自适应 UI 变更",将从根本上压缩这一市场空间。与此同时,"全民自动化"(Citizen Automation)的愿景也将从口号变为现实——非技术用户无需依赖 IT 部门或外部顾问,即可自主创建和维护自动化流程。这也解释了为什么 Codex 将 SKILL.md 设计为可读可编辑的纯文本格式:它的目标用户不是 RPA 工程师,而是每天被重复操作困扰的普通职场人。对于企业用户来说,这意味着自动化流程的维护成本将大幅降低,真正实现"全民自动化"的愿景。
从更长远的视角看,AI Agent 自动化的普及还将催生新的工作形态和职业分工。当重复性操作被大规模自动化后,人类工作者的价值将更多体现在"定义什么值得自动化"和"审查自动化结果是否符合预期"这两个环节——前者需要对业务流程的深刻理解,后者需要批判性思维和质量判断能力。这与历史上每一次自动化浪潮的规律一致:机器替代的是重复性劳动,而非判断力和创造力。SKILL.md 的可编辑性和 Codex 的实时进度反馈,都是在有意强化人类对自动化流程的掌控感,这背后是产品团队对"人机协作"而非"人机替代"这一定位的深思熟虑。
隐私安全与录制技巧

隐私安全方面: 录制期间 Codex 会看到你的屏幕内容,所以不要录入密码、密钥等敏感信息。权限随时可以在系统设置里撤销。
录制技巧方面:
- 操作不要太快,给 AI 足够的观察时间
- 流程要聚焦,只做你想让 Codex 学会的任务,别做无关操作
- 不同的工作流拆成不同的技能,别混在一起
- 最长支持 30 分钟录制,正常工作流完全够用
- 录制结束后,务必检查生成的
SKILL.md,把自己的偏好设置补充进去
总结
Record and Replay 是 Codex 在自动化方向上的一次重要升级。它把"写提示词"这个门槛直接降到了"做一遍给 AI 看"——你不用精确描述每一步,不用担心偏好说不清,只需要做一次你熟悉的事,剩下的交给 Codex。
从技术演进的角度看,这代表了人机交互的一个重要趋势:从"告诉 AI 怎么做"转向"展示给 AI 看"。这一转变的背后,是 Programming by Demonstration 这一古老学术理念与大语言模型视觉理解能力的结合——前者提供了方法论框架,后者赋予了真正的泛化能力。当 AI 能够通过观察屏幕操作来学习任务时,自动化的门槛将大幅降低,真正实现"录一次,用一辈子"。这一演进路径也预示着未来 AI 助手的形态:不再是需要精心调教的工具,而是能够通过观察和模仿快速习得新技能的数字同事。
目前这项功能还有平台限制(仅 macOS)和区域限制,但作为一个方向性的产品,它已经展示了足够的潜力。对于那些每天被重复操作困扰的用户来说,这可能是目前最值得尝试的 AI 自动化工具之一。
核心要点
- Record and Replay 让用户通过演示而非描述来教会 AI 工作流,将自动化门槛降至最低
- SKILL.md 采用纯文本 Markdown 格式,是 Programming by Demonstration 理念在 LLM 时代的最新实践,核心突破在于用语义描述替代坐标定位;其纯文本特性还带来了人类可审计性和版本控制友好性两大隐含优势
- Computer Use 技术通过视觉-动作联合建模与强化学习训练,让 AI 能操作任意图形界面,与 Anthropic Claude 的竞争加速了该技术成熟
- macOS Accessibility API 提供语义层 UI 描述,与屏幕录制权限互补,共同构成 AI Agent 的完整感知能力;macOS TCC 框架确保用户始终保有对 AI 感知能力的最终控制权
- 这一演进标志着自动化从脆弱的坐标依赖 RPA 向语义理解 AI Agent 的根本转变,将深刻影响企业 IT 服务格局,并推动人类工作者向"定义与审查自动化"的更高价值环节迁移
- 当前限制:仅支持 macOS,不覆盖欧洲经济区、英国和瑞士
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。