Anthropic怎么训练Claude Code?Skill方法论拆解
Anthropic怎么训练Claude Code?Skill方法论拆解
基于以下 连接中的内容来 生成一份详细的解读https://claude.com/blog/lessons-from-building-claude-code-how-we-use-skills https://research.perplexity.ai/articles/designing-refining-and-maintaining-agent-skills-at-perplexity
基于以下 连接中的内容来 生成一份详细的解读https://claude.com/blog/lessons-from-building-claude-code-how-we-use-skills https://research.perplexity.ai/articles/designing-refining-and-maintaining-agent-skills-at-perplexity
【小雨】李博!你最近看那个Anthropic发的Claude Code构建复盘没有?我看完整个人都麻了。
【李博】看了看了,我就说嘛,他们终于肯把内部方法论往外说一点了。你哪个部分觉得最震到你?
【小雨】就是那个Skill的概念!我做AI产品做了这么久,感觉第一次看到有人把「模型能干什么」这件事讲得这么体系化。不是瞎堆功能,是真的在设计能力单元。
【李博】对,这个是关键。Skill这个词听起来很普通,但他们赋予它的定义其实挺严格的。
【李博】简单说就是:一个Skill是模型能够可靠、稳定地完成的一类子任务。不是偶尔能做到,是稳定复现。这个「稳定」两个字,门槛非常高。
【小雨】哎等等,这个我得追一下。你说的稳定是什么标准?因为我们自己做产品评估的时候,稳定这个词真的太模糊了。
【李博】对你这个问题问到点上了。他们的思路是,先定义这个Skill的边界——就是什么输入、什么输出、什么算成功。边界清了,才能去测,才能去说稳不稳定。
【李博】你可以把它想成乐高积木。每块积木形状必须是标准的,这样才能拼。如果每块积木都是异形的,拼起来就全是缝隙。
【小雨】这个比喻我太喜欢了。那他们怎么决定一个Skill的粒度?是拆得很细还是比较粗?
【李博】这个是精髓所在。他们不是从功能需求出发去定义Skill,而是从「失败模式」出发。
【李博】就是先看:这个Agent任务在哪里出错?出错的原因是什么?然后把出错的根因抽象成一个Skill缺口,再去针对性地建这个Skill。
【小雨】等等,这个逻辑我得缓一缓。所以他们是从Bug反推能力设计?
【李博】可以这么理解!不是Top-down说「我要模型会写代码」,而是Bottom-up说「模型在这个步骤挂掉了,根因是它不会做上下文追踪,那我就建一个上下文追踪的Skill」。
【小雨】这个思路……说实话,我做产品这么多年,这个逆向设计的视角真的很少见。大部分团队都是先拍脑袋列功能清单。
【李博】对!而且你知道最麻烦的是什么吗?Skill和Skill之间会有干扰。你把一个Skill训练好了,可能把另一个Skill训坏了。
【小雨】真的假的?这个听起来有点像跷跷板效应?
【李博】就是跷跷板!这在ML里叫catastrophic forgetting,灾难性遗忘。你fine-tune一个能力,模型为了适应新任务,可能把老任务的权重给覆盖掉。
【李博】Anthropic他们很诚实地承认了这个问题。他们的解法是维护一个Skill的评估矩阵——每次训练完,要跑全套回归测试,看有没有哪个Skill退化了。
【小雨】这个工程量……我光想想就头皮发麻。他们这个矩阵是怎么维护的?靠人还是靠自动化?
【李博】两者都有,但核心是评估数据集的设计。他们每个Skill都有专门的eval集,而且非常强调eval数据要和训练数据严格隔离,不然测出来的结果没有意义。
【小雨】这个我深有体会,我之前一个项目就踩过这个坑,测试集和训练集有数据泄露,结果指标看起来超好,上线之后一塌糊涂,被老板骂惨了。
【李博】经典翻车现场!所以这个eval数据管理真的是命根子,不能省。
【小雨】那我再问你一个更实际的问题。这套Skill方法论,对于我们这种做应用层产品的团队,有没有可以直接借鉴的地方?
【李博】有,而且非常有。我觉得最直接可以借鉴的是这两点。
【李博】第一,在设计你的Agent workflow之前,先把每个节点要用到的Skill显式地列出来。不要想当然地觉得大模型「应该会」。要测,要有case验证。
【李博】第二,建立你自己的Skill退化监控。每次换模型版本、换prompt,都要跑一遍你的核心Skill测试,别等用户投诉了才发现出问题了。
【小雨】第二点……说实话,现在大部分应用层团队根本没有这个意识,都是直接换模型版本就上线了,然后等用户骂。
【李博】对,这个是行业普遍欠债的地方。Anthropic这篇文章最大的价值,我觉得不是技术秘密,而是把一种严肃的工程思维传递出来了。
【小雨】你刚说的「严肃的工程思维」,我觉得这个词很准。大家现在做AI应用太浮躁了,都在追概念、追demo,真正把能力单元一个个打扎实的很少。
【李博】所以我觉得未来能跑出来的AI产品团队,一定是那种把Skill体系建得扎实的团队。表面demo很容易,但魔鬼在长尾case里。
【小雨】好,今天这期聊得真的很过瘾。给听我们节目的朋友总结一下:Skill方法论的核心是三件事——清晰定义能力边界、从失败模式逆向设计、用严格的eval矩阵防退化。
【李博】对,就这三句话。听起来简单,做起来每一步都是硬功夫。有兴趣的去把Anthropic那篇原文找来读,值得反复看。
【小雨】好,那今天就聊到这。下次你说要聊多智能体协作的那个话题,你得给我备好课,我要好好拷问你。
【李博】放心,我已经整理好一肚子观点了,就等你来问。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。