Claude Code诞生始末:从内部实验到改变编程范式

起源:一个意外诞生的编码代理
Claude Code的诞生,源于Anthropic内部一个名为"Labs Team"的原型团队。2024年底,团队成员Boris加入这个团队时,他们的任务是找到"下一个大产品"——一个能够推动模型前沿发展的产品方向。
当时的编码工具市场存在明显的"产品过剩"(product overhang):模型已经具备了强大的能力,但市场上的产品——自动补全工具、简单的问答助手——远远没有释放这些能力。所谓"产品过剩",是AI行业中一个重要概念,指的是底层模型能力已经远超当前产品所能展现的水平,存在巨大的未被释放的潜力。2024年时,大语言模型已经能够理解复杂代码逻辑、进行多步推理、处理大规模代码库,但市场上主流的编码辅助工具仍停留在单行自动补全或简单的问答对话层面,远未触及模型的能力天花板。团队决定全力以赴,构建一个真正的编码代理。

编码代理(Coding Agent)与传统编码助手有本质区别。传统工具是被动响应式的——用户输入代码,工具预测下一行;而编码代理是主动执行式的——用户描述目标,代理自主规划步骤、编写代码、运行测试、修复错误,形成完整的行动闭环。这种从"辅助"到"代理"的跃迁,要求模型具备规划能力(planning)、工具使用能力(tool use)、自我纠错能力(self-correction)和上下文管理能力(context management),这正是新一代模型带来的关键突破。
但最初的Claude Code"相当糟糕"——只能完成大约10-20%的编码工作。真正的转折点来自底层模型的进化:Sonnet 4、Opus 4以及后续的Opus 4.5。Boris坦言:"当我思考代码编写比例的阶梯式变化时,根本原因就是模型变好了。"
为什么选择编码?AI安全研究的最佳试验场
一个有趣的视角是:Anthropic选择编码作为核心产品方向,并非纯粹出于商业考量,而是与公司的核心使命——AI安全——深度绑定。
Boris解释道:"如果你在Anthropic随便拉住一个人问'你为什么在这里',他们会说AI安全。"研究AI安全需要在真实环境中观察模型行为,而编码是模型与世界交互的最自然方式。编码领域有几个独特优势:
- 训练数据丰富:代码要么能运行,要么不能
- 评估标准清晰:编译通过与否、测试通过与否一目了然
- 解空间有限:不像诗歌有无限种"正确"写法,正确的代码解决方案是有限的
- 商业价值高:帮助Anthropic建立可持续的商业模式,避免依赖广告
这些特性使编码成为AI对齐研究的理想试验场。在编码环境中,研究人员可以精确衡量模型是否"按照人类意图行事"——代码是否实现了用户想要的功能,是否引入了安全漏洞,是否在权限范围内操作。这些都是可验证的,不像自然语言对话中的对齐问题那样模糊。
从CLI到全平台:Claude Code的产品形态演进

Claude Code的产品演进经历了多个阶段。最初只是一个终端CLI工具,后来扩展到桌面应用、移动应用(iOS和Android)、Slack应用、GitHub应用等多种形态。选择CLI(Command Line Interface,命令行界面)作为初始形态并非偶然——终端环境天然具备文件系统访问、进程管理、环境变量控制等能力,这些都是编码代理执行任务所必需的。相比之下,基于浏览器的Web应用受限于沙箱安全模型,无法直接操作本地文件系统。
Boris强调,为工程师构建产品的独特挑战在于:"工程师对工具的使用方式极其固执己见,这不是一个消费级产品。"工程师群体对工具有极高的定制化需求——从快捷键绑定到工作流集成,任何不符合既有习惯的设计都可能导致工具被弃用。
而Boris本人的工作方式也经历了三次范式转变:
- 第一阶段:在IDE中用自动补全写代码
- 第二阶段:用提示词指导Claude Code写代码(后来直接卸载了IDE)
- 第三阶段:不再直接提示Claude,而是编写"循环"——让自动化流程来提示Claude并决定下一步做什么
"我的工作是写循环"——这句话或许定义了未来工程师的核心职责。这里的"循环"本质上是一种元编程:工程师不再编写解决具体问题的代码,而是编写"指导AI如何解决问题"的流程逻辑。这类似于从手动操作机床到编写数控程序的跃迁——抽象层级提升了一个维度。
Cloud Co-work的诞生:让非工程师也能用AI编程

Cloud Co-work的灵感来自一系列"非工程师使用Claude Code"的真实故事。一位数据科学家自己搞定了终端、Node.js安装和API密钥配置,只为用Claude Code做数据分析。一位Twitter用户用它来监控和管理番茄植物的生长。当非工程师群体开始突破技术门槛来使用这个工具时,团队意识到:是时候构建一个更友好的产品了。
在探索过程中,团队尝试了多种方案:
- Slack机器人:构建体验良好的聊天机器人太难——Slack的消息格式限制、线程模型和实时性要求都增加了复杂度
- Web应用:浏览器中的体验不够好,且无法访问本地文件系统——这是浏览器安全沙箱的根本限制,即使使用WebAssembly或File System Access API也无法完全突破
- 拖拽文件的摩擦:即使是一点点额外操作,也足以让体验变差——用户体验研究反复证明,每增加一个操作步骤,用户流失率就会显著上升
最终,Co-work在大约8-9天内完成构建,100%使用Claude Code开发。关键洞察是:文件系统访问是必要的,用户需要能直接操作桌面上的文件。桌面应用形态(基于Electron或类似框架)完美解决了这个问题——它既提供了图形化界面的友好性,又保留了本地文件系统的完整访问权限。
对Anthropic内部工程生产力的颠覆性影响
自Claude Code发布以来,Anthropic内部的工程生产力发生了惊人变化:
- 代码产出:每位工程师的代码量增长了"数百个百分点",此前公布的3倍数据已经"非常过时"
- 新人入职:从过去的数周缩短到两天
- 知识获取方式改变:新人问"怎么查询数据库",答案是"打开Claude Code,让它在代码库中查询"
- 角色融合:设计师在提交代码,财务人员在提交代码,幕僚长在提交代码
更有意思的是,通常随着工程团队规模扩大,人均生产力会下降(新人需要老人指导,代码质量下降)。这在软件工程领域被称为"布鲁克斯定律"(Brooks's Law)——出自Fred Brooks的经典著作《人月神话》,其核心观点是"向一个已经延期的项目增加人手,只会让它更加延期",因为沟通成本随团队规模呈二次方增长。但在Anthropic,这个规律被打破了——Claude Code让每个新成员都能快速上手并独立产出,大幅降低了团队间的沟通和知识传递成本。AI代理充当了"永远有耐心的资深工程师"角色,随时回答问题、解释代码库架构、指导最佳实践。
对创始人和企业的实操建议

Boris对创始人给出了两条核心建议:
第一,给每个人尽可能多的token。 引用黄仁勋的话:"买得越多,省得越多。"让团队成员充分实验,发现AI能自动化的工作流。这里的"token"指的是大语言模型处理文本的基本单位——每次调用AI都会消耗token,而企业通常按token用量付费。给予充足的token预算,本质上是降低团队尝试AI自动化的心理门槛和经济门槛。
第二,有意识地"资源不足"配置项目。 如果一个项目看起来需要四个工程师,试试只放两个,给他们充足的token,让他们想办法。这会产生复合效应——因为他们自动化了流程,下次做同样的事会更便宜。这种复合效应(compounding effect)意味着自动化投资的回报会随时间指数增长:当工程师第一次用AI自动化某个工作流时,需要投入时间编写提示词、设计流程、验证输出;但一旦自动化流程建立,后续每次执行的边际成本趋近于零,且这些流程本身可以被进一步自动化,形成"自动化飞轮"。
本质上,这是一种"提高前期成本、降低持续成本"的策略,类似于预编译:前期投入大量工作,让重复性任务变得轻松高效。这与DevOps领域的基础设施即代码(Infrastructure as Code)理念异曲同工——前期投入编写自动化脚本看似"浪费时间",但长期来看节省的人力成本是指数级的。
品味的终结与价值观的崛起
Boris分享了一个发人深省的观察:他曾坚持代码库只用函数式编程、不用类。函数式编程(Functional Programming)和面向对象编程是软件工程中两大主流范式——函数式编程强调不可变数据、纯函数和组合,面向对象编程以类(class)为核心组织单元,强调封装、继承和多态。在工程师社区中,选择哪种范式往往带有强烈的个人偏好甚至"信仰"色彩。但当模型开始写所有代码后,它们自然地使用了类——而业务目标照样达成,甚至更快。
"每次我觉得自己在某方面很特别,我都会被证明是错的。"
他认为,当前人们津津乐道的"产品品味是最后的护城河"也将被侵蚀。他目前运行着数百个Claude实例,它们在分析Twitter反馈、GitHub Issues和Slack消息,自主判断下一步该构建什么。这本质上是将产品经理的"用户洞察"能力自动化——通过大规模并行处理用户反馈,AI可以发现人类产品经理可能遗漏的模式和需求。现在大约20%的建议是好的,但随着模型进步,这个比例会持续上升。
那么,在AI编程时代,人类最终独特的贡献是什么?Boris的回答意味深长:
"我认为我们最终要教给模型的是价值观。就像我们教孩子如何做一个好人一样,我们要教模型如何做一个好模型。"
这或许是AI时代最深刻的命题:当技术能力不再是瓶颈,方向感和价值判断才是人类最后的、也是最重要的贡献。这与AI对齐(AI Alignment)研究的核心问题一脉相承——如何确保越来越强大的AI系统按照人类的价值观和意图行事。不同于技术能力可以通过更多数据和计算来提升,价值观的传递需要人类的深度参与和持续校准。
核心要点
相关推荐

为什么Go是AI辅助编程的理想语言
深入分析Go语言为何契合AI辅助编程需求:极简语法降低生成难度、gofmt统一代码风格、显式错误处理提升可验证性、快速编译加速迭代循环。探讨AI时代编程语言设计价值观的转变。

Fan:开源浏览器Agent,让AI自动操作网页执行任务
FanAgent是一款开源的浏览器AI Agent,能自主理解网页内容、点击元素、填写表单,支持多任务并行。适用于签证申请、文献检索、旅行订票等场景,开发者可基于其构建垂直行业助手。

Qwen3 27B深度评测:推理能力强大却过度思考的解决方案
深度评测Qwen3 27B开源模型的推理能力与过度思考问题。分析27B参数规模的性能优势、过度思考的原因与代价,并提供关闭思考模式、分场景配置等实用优化建议。