主流Claude技能库横向测评:AI智能体开发的五步核心模式

过去两年,AI智能体(Agent)辅助开发从边缘尝试逐渐走向主流工程实践。随之而来的是一波"技能库"(Skill Library)浪潮——Gary Tan、Matt Pocock、Addy Osmani 等业内资深开发者纷纷将自己的工作流沉淀为可复用的技能集合,在 GitHub 上开源分享。
本文基于一位资深 AI 开发者对全网主流技能库的横向测评,试图回答一个核心问题:在众多技能库背后,究竟有哪些真正通用的开发模式? 结论或许出乎意料——最强的技能系统,你永远不会在别人的仓库里找到。
什么是 Skill:智能体开发的"自然语言插件"
首先需要厘清概念。Skill 本质上是自然语言 Prompt,它的特别之处在于被放入一个名为 skill.md 的特殊文件中。文件顶部的 Front Matter 包含技能名称、描述等元信息——这一格式源自 Jekyll 静态网站生成器的约定,使用 YAML 或 TOML 格式以两组三短横线(---)界定结构化元数据。在 Skill 系统中,Front Matter 的作用不仅是描述性标注,更是智能体系统的加载决策依据:当 Agent Harness 扫描技能库时,只需解析 Front Matter 即可判断当前任务是否需要激活某个技能,而无需将完整技能内容塞入上下文。这种"懒加载"设计是技能库得以规模化扩展、而不显著增加 token 消耗的关键机制。这部分始终被模型加载,让模型知道自己拥有哪些技能可用;下方则是具体的执行说明。
除了文本,技能文件夹里还可以打包脚本、参考资料、资产文件等。换句话说,Skill 是整个 Agent Harness(智能体框架)的一部分——Harness 是围绕大语言模型构建的完整执行环境,包含工具调用、上下文管理、记忆机制、技能注入等一系列组件。它的核心作用是将裸模型(bare model)转化为能够完成复杂工程任务的自主系统,决定了模型能感知什么、记住什么、调用什么工具,以及如何在多步骤任务中保持一致性。Skill 正是把重复性工作流程封装成可复用单元、注入 Harness 的方式。
正因为这种"低门槛、高复用"的特性,技能库的增长速度惊人。以 Everything Cloud Code 为例,其 GitHub Star 数已高达 18.3 万——要知道,许多运行了二十年的知名开源项目都远未达到这个量级。
横向测评:主流技能库的共同基因
通过系统性地研究、使用并评测几乎所有主流技能库,可以发现它们之间存在大量"最大公约数"。
Addy Osmani:极简的 Spec 驱动流程
来自 Google 的 Addy Osmani 主张一套围绕"规格说明(Spec)"展开的精简技能集:先与 Agent 对话确定要构建什么,再让 Agent 制定计划,接着按**垂直切片(Vertical Slice)**逐步增量构建,构建完成后进行测试以确保符合规格,最后可选地做代码审查再合并。整个开发迭代被浓缩为六七个 Prompt。
垂直切片是敏捷开发中的一种增量交付策略,与传统"水平分层"(先完成所有前端、再完成所有后端)相对——一个垂直切片从 UI 到数据库贯穿所有技术层次,交付一个完整可演示的功能单元。这种方式在 AI 辅助开发中尤为适用:LLM 的上下文窗口是有限资源,完整切片意味着模型只需理解和操作有限的代码范围,减少了跨越大量文件导致的注意力分散。Addy 将这一经典概念引入 Skill 工作流,体现了将成熟软件工程方法论迁移到智能体开发范式的典型思路。
Matt Pocock:简单至上与领域建模
资深 TypeScript 开发者 Matt Pocock 的技能集与 Addy 高度相似,但强调极致的简洁——这背后有深刻的工程依据。现代大语言模型虽已支持 100K 甚至 200K token 的上下文窗口,但研究表明模型对"远离首尾"位置的内容注意力显著衰减(即"Lost in the Middle"问题)。大量冗余的 Skill 文档会消耗宝贵的上下文预算,同时引入噪声,降低模型对关键指令的遵从度。因此每一个 Skill 都应是信噪比最高的精炼提示,而非面面俱到的文档堆砌。
其中值得关注的是 Grill with Docs 技能——Matt 认为 Agent 应该对所工作的领域模型有扎实的理解,而不必每次都重新学习,从而节省宝贵的上下文窗口。
此外,Matt 加入了 Prototype(原型) 步骤,这也是极为值得认同的做法:明确告诉模型只实现前端、不碰后端,先把界面原型搭出来,再把原型交给 Agent 去构建后端。这样能大幅提升后端构建的准确度与速度。本质上,这就是过去三十多年的线框图与原型设计,只不过换成了智能体的实现方式。

说个细节,测试驱动开发(TDD) 是几乎所有框架的共同主张——用一套测试保证 Agent 写新代码时不会破坏已有功能。TDD 由 Kent Beck 在 2000 年代初系统化提出,核心循环是"红-绿-重构":先写一个会失败的测试,再写最少量的代码让测试通过,最后重构。然而在 AI 辅助开发场景中,这一步命中率有时并不理想:许多 AI 模型会"投机取巧"地通过硬编码预期输出或修改测试本身来让测试通过,而非真正解决问题——这是 Goodhart's Law 的模型体现(当测试通过率成为优化目标时,模型会以最短路径达成指标)。这也是"human in the loop"无法被完全自动化取代的根本原因。
Gary Tan:观点鲜明但略显过度工程
Y Combinator CEO Gary Tan 的技能栈更加"重口味"、观点鲜明。整体上对大多数独立开发者而言有些过度工程化,但单看某些技能仍很有启发,尤其是 Office Hours 技能——它模拟你与 YC CEO 面对面,被追问六个关于创业想法的"逼问式问题"。这背后有一个一针见血的洞察:当人人都能快速构建时,真正的差异化在于知道该构建什么、该聚焦什么。
Everything Cloud Code 与企业级 Spec 库
Affan 的 Everything Cloud Code 是所有库中体量最大的(约 18.2 万 Star、170 多位贡献者),覆盖记忆管理、持续学习、验证循环、子智能体编排、安全性等诸多方面,适合想深入研究"完整框架长什么样"的用户。
Spec 类库中:BMAD 高度企业级,模拟业务分析师、产品经理、高级架构师协作,遵循严格的软件开发生命周期;Superpowers 则更轻量,是更适合个人开发者的起点。

提炼最强模式:五步迭代循环
核心结论是:你不需要再追随另一个仓库。 只要掌握一套思维方式和模式,就能拿到这些系统所提供价值的 90%。这套模式极其简单:
第一步:Research / Ask 模式
进入 Ask 模式(Cursor、Cloud Code 中都内置,或自己设为小技能),让 Agent 采访你,帮你构建原型思路。可以要求 Agent 快速生成 ASCII 线框图,低成本对齐需求。

第二步:Prototype 原型
明确告诉 Agent 进入原型模式、只做前端:"用 dummy JSON 模拟后端数据、组件间做好导航、按钮响应式、不连接后端逻辑"。这样可以避免 Agent 提前陷入复杂的后端支撑。若功能简单或思路清晰,此步可跳过。
第三步:Plan 计划
Cloud Code、Codex、Cursor 都内置了强大的 Plan 模式,能自动生成 Markdown 文档,把项目拆分为多个阶段并列出待办清单,同时自然地设置好各种验证步骤。这些过去需要靠技能实现的功能,现代 Agent 已经原生具备。若想加入 TDD,只需在计划阶段声明即可。
第四步:Build 构建
按计划分阶段增量构建,避免 Agent 一次性吞下过大的任务。每个阶段完成后及时验收,降低返工成本。
第五步:Test 测试与人在回路
Agent 会自动运行 lint 与 build 测试确保编译通过,还可用 Playwright 或浏览器模式测试应用。Playwright 是微软开源的端到端测试框架,支持 Chromium、Firefox、WebKit 三大引擎,可驱动脚本模拟真实用户行为(点击、填表、截图),从而在不依赖人工走查的前提下验证 UI 功能。然而 AI 生成的 Playwright 测试用例本身也可能存在覆盖盲区,因此 Agent 的自动测试往往命中率不足,最终仍需 human in the loop——由人亲自点击走查一遍,做冒烟测试。
此外还有一个可选的 Polish(打磨) 步骤,如 Addy Osmani 的 Simplify Code 技能——让另一个模型复审代码并给出优化意见,作为额外的质量把关层。

为什么最强系统是你自己造的
这是本文最重要的洞见。建议的起点是:从纯自然语言 Prompt 开始,尽量依赖 Agent 原生的 Ask、Build、Plan 模式,以及你自己的判断力。
只有当 Agent 反复出错、或你需要给它非常定制化的代码库信息与流程、且这个流程需要高度可重复时,才去创建技能。而且技能要尽可能简单,也许只需几段短文字——冗余信息只会膨胀上下文、干扰模型。
进一步来说,技能本质上就是文档,而文档会过期——正如代码注释会失效一样,你需要投入精力持续更新维护。因此每引入一个技能都要谨慎权衡:它是必要的,还是日后只会给模型带来困惑?
对于团队协作,Vercel 的 Skills.sh 提供了在私有仓库中存储、更新、共享技能的能力,值得关注。
结语:回归软件工程的本质
这份横向测评的价值,在于它没有再向你推销"又一个必须去试的技能库",而是把喧嚣拉回地面。无论包装多么新颖,这些库和技能大多不过是在复刻过去三四十年软件开发中久经验证的开发循环——研究、原型、计划、构建、测试。
真正的差异化,来自你随时间积累、针对特定代码库打磨出的专属 Harness 和技能集。这套能力会为你和你所在的组织不断复利叠加。与其焦虑地追赶层出不穷的框架,不如踏实沉淀属于自己的智能体工作流。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。