Agent Skills入门:从会用AI到会开发智能体技能

从「会用AI」到「会开发Agent」
当越来越多人学会了如何和大模型对话、如何写提示词,一个新的分水岭正在出现:你是只会用AI,还是能开发出可复用、可扩展的Agent技能体系?
Agent Skills(智能体技能)正是这条分水岭的核心概念。它让AI从「聊天工具」升级为具备特定专业能力的智能体。本文基于B站UP主的实战教程,梳理Agent Skill的结构、原理与定制方法,帮助你理解如何结合Claude Code、Codex等工具打造属于自己的技能体系。
整个学习路径其实只做三件事:理解Skill、定制Skill、推荐Skill——由易到难,逐步掌握。

为什么是Agent,而不是简单的对话?
要理解Agent Skill,首先需要理解Agent(智能体)这个概念本身。传统的大模型交互是"一问一答"式的——用户提出问题,模型返回结果,交互结束。而Agent则赋予大模型自主规划、工具调用和多步推理的能力,使其能像一个"数字员工"一样,接收一个目标后自主拆解任务、调用工具、验证结果,直到完成目标。
Agent的核心架构通常包含四个关键组件:感知模块(接收用户输入和环境信息)、规划模块(将复杂目标拆解为可执行的子任务序列)、行动模块(调用工具或生成输出)、记忆模块(维护短期对话上下文和长期知识)。这一概念最早由学术界提出,2023年斯坦福大学的"生成式智能体"论文展示了25个AI角色在虚拟小镇中自主生活、社交和协作的场景,首次证明大模型驱动的Agent可以涌现出复杂的社会行为。同年AutoGPT项目在GitHub上获得超过15万星标,展示了Agent自主迭代完成任务的可能性,但也暴露了早期Agent在循环控制和成本管理上的不足。
2024-2025年,OpenAI、Anthropic、Google等公司纷纷将Agent能力集成到产品中,Agent从实验性概念正式进入工程化落地阶段。工程化的核心问题从"能不能做"转向了"如何做好"——如何让Agent的能力可控、可预期、可复用。而Agent Skill,正是让这种工程化能力"可插拔、可复用"的关键设计模式。
什么是Agent Skill:用「职业技能」类比理解
Skill翻译过来就是「技能」。这个概念其实非常直观——每个职业都有对应的专业技能。
比如你是一名学生,你会写语文、数学、英语作业;如果你是一名程序员,你就具备理解需求、编写代码、调试Bug等技能。这些技能属于你这个职业所对应的能力集合。
而Agent Skill,本质上就是把「人的职业技能」迁移到AI智能体身上。人有多少种专业技能,Agent就可以拥有多少种对应的Skill。
技能的四个组成要素
每一项技能都有对应的规范。以程序员的「编写代码」技能为例,在真正干活之前,你需要具备四样东西:
- 开发流程:写代码之前,你要把业务完全捋顺——先做什么、后做什么,业务与业务之间有什么关联性。
- 参考文档:可能是API文档,也可能是需求文档,总之是你实现功能时需要查阅的资料。
- 开发工具:前端用VS Code,Java用IDEA,医生用针线器械——不同职业需要趁手的工具。
- 静态资源:比如做网页时需要的图片、音频、视频等素材。

有了这四样东西,你才能真正把一个项目落地。而Agent Skill的设计,正是把这套「人类做事的完整规范」抽象成了机器可执行的结构。
Agent Skill的文件结构详解
四要素的技术对应关系
教程中给出了一个非常清晰的映射关系,把人类做事的四要素翻译成了Agent Skill的目录结构:
| 人类做事要素 | Agent Skill 对应 |
|---|---|
| 开发流程 | SKILL.md 文件 |
| 参考文档 | references 目录 |
| 开发工具 | scripts 目录 |
| 静态资源 | assets 目录 |
把这些内容打包成一个文件夹,它就构成了一个完整的Agent技能。
只有SKILL.md是必需品
这里有一个关键点需要强调:不是每个文件和文件夹都是必需品,唯一必需的只有 SKILL.md。
references、scripts、assets 这三个要根据实际需求来添加——有时候一个都不需要,有时候三个全都要。具体取决于你的技能要完成什么样的操作。

这种「按需扩展」的设计哲学,正是Agent Skill的灵活性所在:简单任务用一个Markdown文件就够了,复杂任务则可以挂载脚本、文档和资源,形成一个功能完整的能力包。这种设计与Unix哲学中的"做好一件事"原则不谋而合——每个Skill聚焦于一个明确的能力领域,通过组合不同的Skill来应对复杂场景。
references目录:Agent的本地知识库
references目录的设计理念与当前AI领域广泛采用的**RAG(Retrieval-Augmented Generation,检索增强生成)**技术一脉相承。RAG的核心思想是:大模型的参数化知识有时效性和准确性的局限,通过在推理时动态检索外部知识库来补充上下文,可以显著提升回答的准确性和时效性。
RAG技术自2020年由Facebook AI Research(现Meta AI)首次提出以来,已经成为企业级AI应用的标配架构。其典型流程是:将文档切分为语义片段,通过嵌入模型(如OpenAI的text-embedding-3-small或开源的BGE模型)转化为向量,存储在向量数据库(如Pinecone、Weaviate、ChromaDB)中,用户查询时先检索最相关的文档片段,再将其作为上下文传入大模型生成回答。
references目录采用的是一种**「轻量级RAG」**——它省去了向量化和向量数据库的复杂基础设施,直接让Agent以文件读取的方式获取知识。将API文档、需求规格、设计规范等放入其中,Agent在执行任务时会主动检索这些文档获取必要信息。这种方式虽然在大规模文档检索上不如完整RAG方案高效,但在文档数量有限(如项目级别的API文档、设计规范)的场景下,胜在部署简单、零额外依赖,非常适合个人开发者和小团队使用。相比将所有知识都塞进提示词(受上下文窗口限制),这种方式更加灵活和可扩展,也避免了信息过载导致的"注意力稀释"问题。
scripts目录:让Agent能"操作世界"
scripts目录存放的是Agent可以执行的脚本和工具,这与大模型领域中的**Function Calling(函数调用)**机制密切相关。Function Calling是OpenAI在2023年6月首次引入的能力,允许大模型在对话中识别出需要调用外部工具的场景,并生成结构化的函数调用请求。Anthropic的Claude同样支持Tool Use功能。
scripts目录将这一能力落地到文件系统层面:Agent可以直接执行目录中的Python脚本、Node.js脚本或Shell命令,完成诸如图像处理、数据库查询、API调用、文件格式转换等大模型本身无法完成的操作。这使得Agent的能力边界从"生成文本"扩展到了"操作世界"。
值得注意的是,scripts目录中的脚本设计应当遵循幂等性原则——即同一个脚本多次执行应该产生相同的结果。这是因为Agent在推理过程中可能会因为验证需要或错误重试而多次调用同一脚本,幂等性设计可以确保不会产生意外的副作用(如重复创建文件或重复发送请求)。
SKILL.md内部剖析:元信息与指令
元信息:技能的身份证
以一个「餐厅物料设计」的Skill为例,SKILL.md 的顶部是元信息(Metadata),包含两个核心字段:
- 名字:这个技能叫什么。
- 描述:它具体能做什么事。
比如描述可以写成:「为某餐厅生成符合品牌调性的物料设计创意。当用户说要做某种物料(海报、包装盒等)时,你需要输出该物料的设计创意。」
元信息是Agent判断「什么时候该调用这个技能」的依据,写得越精准,触发越准确。
Metadata的设计原理:声明式配置与Skill路由
元信息的设计借鉴了软件工程中"声明式配置"的思想。在微服务架构中,每个服务都有自己的服务描述文件(如OpenAPI/Swagger规范),告诉调用方"我是谁、我能做什么、怎么调用我"。SKILL.md的元信息承担的是完全相同的角色:名字用于索引和引用,描述用于语义匹配。
这种设计与Kubernetes中的Label/Selector模式异曲同工。在Kubernetes中,Pod通过标签声明自己的属性,Service通过选择器找到匹配的Pod提供服务。类似地,Skill的元信息就是它的"标签",Agent的路由逻辑则是"选择器"。当Agent面对一个用户请求时,它会遍历所有可用Skill的元信息,通过语义相似度判断哪个Skill最适合处理当前任务——这个过程类似于操作系统根据文件扩展名选择默认程序打开文件。
这种设计使得Skill的注册和发现可以完全解耦——添加新Skill不需要修改Agent的核心代码,只需将Skill文件夹放入指定目录即可被自动发现和加载,这就是所谓的**「约定优于配置」**原则在AI Agent领域的应用。描述字段的撰写建议采用「动作+对象+条件+输出」的结构,例如「当用户请求[对象]的[动作]时,根据[条件]生成[输出格式]」,这种结构化表述能显著提升语义匹配的精度。
指令:技能的执行逻辑
元信息之下的内容,都被称为指令(Instructions)。就像我们平时和大模型聊天时发出的每一句自然语言,其实都是一条指令。
在这个案例中,指令部分包含了:
- 品牌核心元素:品牌名、风格、IP形象、主色调、字体等。
- 任务定义:当用户说要做某种物料时,输出符合品牌风格的对应设计。
- 输出格式:主题创意是什么、视觉风格是什么、画面构成是什么、细节建议是什么。

描述得越细致,生成的内容就越符合心意。 这正是Skill工程化的价值所在。
Agent Skill和提示词有什么区别
看到这里,很多人会疑惑:这不就是提示词吗?
没错,SKILL.md 确实有点像提示词,但它的功能要远大于提示词。原因在于:Skill不止有一个Markdown文件,它还可以挂载 references、scripts、assets,对应扩展出更多能力——查文档、跑脚本、调用资源。这让它的能力边界和复用性,远超单纯的一段提示词。
从更本质的角度看,提示词工程(Prompt Engineering)通常是"一次性"的——你在对话窗口中精心构造一段提示词,获得满意的输出,但下次使用时可能需要重新调整。它本质上是一种临时性的、面向单次交互的优化手段。而Skill工程化则引入了软件工程的核心理念:模块化、可复用、可版本控制。
这种从临时指令到工程化模块的演进,与软件开发史上从脚本编程到框架化开发的转变高度类似。早期开发者直接编写一次性脚本解决问题,随着需求增长才逐渐抽象出可复用的库和框架。一个Skill文件夹可以被Git管理、可以在团队间共享、可以像npm包一样被安装和卸载。
更关键的是,Skill通过挂载scripts目录,可以执行真实的系统命令和脚本(如Python脚本、Shell命令、API调用),这意味着它不再受限于大模型的文本生成能力,而是获得了与外部系统交互的能力。此外,Skill的可组合性也是超越提示词的重要特征:多个Skill可以被编排成一个工作流(Workflow),例如先调用「需求分析Skill」理解用户意图,再调用「代码生成Skill」编写代码,最后调用「测试Skill」验证结果,形成完整的自动化流水线。这种从"文本指令"到"可执行能力包"的跃迁,是两者的根本差异。
实战应用:让Agent Skill帮你干活
掌握结构之后,Skill就能落地到真实场景。教程中给出的例子极具代表性:
「帮我做一张Aven餐厅的惠灵顿炖牛排,仅需38元、先到先得的促销海报。」
只需一句简单的提示词,配置好的Skill就会按照品牌风格、定位、目标客群等维度,生成符合需求的海报创意。
除了物料设计,教程还推荐了一批高频实用的Skill:
- 前端页面Skill:快速生成网页界面
- PPT制作Skill:自动化演示文稿
- 文档处理Skill:批量处理文本文档
- 表格处理Skill:结构化数据操作
Claude Code与Codex:Skill的最佳运行环境
这些Skill之所以能真正"干活",离不开强大的运行环境。Claude Code是Anthropic推出的命令行AI编程工具,它允许开发者在终端中直接与Claude模型交互,Claude可以读取项目文件、理解代码上下文、执行命令、修改文件,本质上是一个具备文件系统操作能力的编程Agent。其核心优势在于超长上下文窗口(最高支持200K token)和强大的代码理解能力,能够一次性读取大型项目的多个文件并理解其整体架构。它采用"人在环中"(Human-in-the-Loop)的设计,对于文件修改、命令执行等敏感操作会请求用户确认。
Codex则是OpenAI推出的类似产品,更强调异步任务执行,支持在云端沙箱中运行代码,适合处理耗时较长的批量任务。两者的共同演进方向是从"辅助编程"走向"自主编程"——不再只是补全几行代码,而是能够理解一个模糊的需求描述,自主完成从架构设计到代码实现再到测试验证的完整开发流程。
Agent Skill正是为这类工具设计的**"能力扩展包"**——通过加载不同的Skill,同一个工具就能胜任不同领域的专业任务。这种设计使得Skill具备了跨平台复用的可能性:同一套Skill既可以在Claude Code中运行,也可以适配到Codex或其他兼容的Agent运行时环境中。
将这些Skill结合Claude Code、Codex等工具,就能构建起一套可复用、可扩展的智能体技能库——用一次配置,换来长期的自动化收益。
写在最后
Agent Skill的核心思想,是把「人类做事的完整方法论」——流程、文档、工具、资源——结构化封装成机器可以理解和调用的能力包。它比提示词更强大、更可复用、更易扩展。
对于想从「会用AI」进阶到「会开发Agent」的开发者来说,理解 SKILL.md 的结构、掌握四要素的映射关系,是迈出的第一步。接下来的定制与实战,才是真正把AI变成「专业员工」的关键。
随着Agent生态的逐渐成熟,我们可以预见Skill将走向标准化——就像今天的Docker镜像可以在任何兼容的容器运行时中执行一样,未来的Agent Skill也将实现跨平台、跨模型的无缝迁移。掌握Skill的设计思维,就是在为这个即将到来的Agent原生时代做准备。
核心要点
核心要点
相关推荐

零依赖AI记忆层:不用向量数据库也能搞定Agent记忆
探讨零依赖AI Agent记忆层方案,分析在无需向量数据库的情况下如何实现智能体记忆能力。对比传统RAG架构的优劣势,解析适用场景与技术权衡,为开发者提供更灵活的技术选型思路。

Linear创业故事:从离开Coinbase到重新定义开发者工具
Linear联合创始人Jori Lallo在2018年离开Coinbase,投身开发者项目管理工具赛道。七年间,Linear凭借极致的开发者体验在Jira、Asana等巨头林立的红海中成功突围,其创业历程揭示了垂直深耕与反共识创业的核心逻辑。

AWS S3为何被称为世界第八大奇迹?云存储的隐形力量
一条技术圈热门推文将AWS S3列为世界第八大奇迹。本文解析S3凭借11个9的数据持久性、无处不在的架构渗透力,如何成为现代数字文明的隐形基石,以及这个玩笑背后的深层技术文化。