Base44实战:Claude Code如何支撑1到80人快速扩张

从独立开发者到80人团队
在Anthropic的一场分享中,vibe coding平台Base44的产品负责人Yoav和AI团队负责人Gabriel,讲述了一个颇具代表性的AI时代团队扩张故事:从一个单人创始工程师,一路成长到80人的工程团队,而Claude Code在这个过程中扮演了「效率放大器」的关键角色。
什么是vibe coding? Vibe coding是2024年前后兴起的一种AI辅助软件开发范式,由Andrej Karpathy等人推广,核心理念是通过自然语言描述意图、由AI生成代码,让开发者甚至非技术用户能够「感受式」地构建软件,而非逐行编写代码。这一范式的底层支撑是大语言模型在代码生成领域的突破性进展——2023年后,GPT-4、Claude 3等模型在HumanEval等代码基准测试上的通过率超过85%,使「描述需求→生成可运行代码」的闭环在实际产品中成为可能。HumanEval是OpenAI发布的代码生成标准评测集,包含164道函数级编程题,pass@1(一次生成即通过)指标是衡量模型代码能力的行业基准;早期GPT-3的pass@1约为零,而GPT-4和Claude 3已突破85%,意味着绝大多数日常编程任务可以由AI一次性完成。软件开发因此经历了从「精确指令」到「意图表达」的范式转变:过去开发者需要精确掌握语法、API调用路径和边界条件,而现在只需清晰表达业务目标,AI负责将意图翻译为可执行代码。这一范式转变的深层意义在于:软件开发的「认知门槛」从掌握精确的语法和API调用路径,下降到能够清晰表达业务意图——即从程序员的「声明式思维」转向产品经理的「目标导向思维」。这也解释了为何vibe coding平台的用户群不再局限于专业开发者,而是向产品经理、设计师、创业者乃至领域专家延伸:编程能力的核心瓶颈从「技术执行」转移到了「需求表达」。Base44正是这一趋势的产品化落地——它将AI代码生成能力包装成可视化界面,使产品经理、设计师和创业者都能直接构建可运行的应用。
Base44是一个让技术与非技术用户都能构建软件的平台。创始人Maor启动项目后不久便有了可用产品,并通过在LinkedIn和Twitter上「build in public」积累了大量关注。产品实现盈利后,Yoav加入团队——凭借盈利能力、AI导向的用户群和一位执行力极强的创始人,Base44迅速吸引了众多公司的目光,最终被Wix收购。
整个扩张过程被拆解为两个阶段:从1人到15人,以及从50人到80人。而贯穿始终的核心方法论只有一个词——保持简单(keep it simple)。
阶段一:1到15人的四大挑战
收购后,Base44需要在保持速度的同时快速扩张,从两人小队变成15人团队。他们面临四个无法线性扩展的难题:新人入职、代码审查、产品质量验证,以及庞大产品面的快速上手。
用两个提示词解决入职
面对入职难题,团队没有搭建复杂的onboarding文档和夜间更新流程,而是选择了极简方案:每位新工程师只需在开始工作前使用两个提示词。第一个是让Claude遍历所有commit,生成一份「谁在负责什么」的组织地图;第二个是在深入某个模块前,让Claude用mermaid图表画出该组件的工作原理。
关于Mermaid图表: Mermaid是一种基于文本的图表生成语言,开发者可以用类似Markdown的简洁语法描述流程图、时序图、类图等,工具自动渲染为可视化图形。它被广泛集成到GitHub、Notion、Obsidian等平台,无需专业绘图软件即可生成技术架构图。Mermaid的设计哲学体现了「图表即代码」(Diagrams as Code)的理念:将架构文档纳入版本控制体系,使其与代码同步演化,而非成为独立维护的静态文件。这一特性恰好契合了AI辅助文档生成的需求——Claude可以基于最新代码状态随时生成准确的架构图,而不是依赖可能已经过时的人工维护文档。让Claude生成Mermaid图表意味着新工程师能获得一份随时可在浏览器中渲染的组件关系图,兼具可读性和可维护性。
这套方法的精妙之处在于实时性——你不需要费心维护随时过期的文档,Claude基于最新代码库随时为你生成。一个提示词,就能给新人提供开始工作所需的全部认知。
Claude Code的能力边界: Claude Code是Anthropic推出的命令行AI编程助手,允许开发者在终端环境中直接调用Claude模型处理代码任务,包括代码生成、重构、调试、代码库分析等。与GitHub Copilot等IDE插件不同,Claude Code更强调对整个代码库的深度理解和多步骤自主执行能力,支持读取本地文件、运行命令、调用外部工具(通过MCP协议),被视为「Agentic编程」的代表性工具之一。
所谓「Agentic编程」,是指AI不再被动响应单次查询,而是能够自主规划多步骤任务、调用工具、在执行过程中动态调整策略——更像一位能独立完成任务的初级工程师,而非只会回答单个问题的查询系统。这一范式的实现依赖于「工具调用」(Tool Use)能力:模型不仅能生成文本,还能根据任务需要选择并调用外部工具——文件系统、终端命令、API接口等——并将工具返回结果纳入下一步推理。从架构角度看,Agentic系统的核心是「规划-执行-观察」(Plan-Act-Observe)循环:模型首先将复杂任务分解为子任务序列,逐步执行并将每步结果作为下一步的输入上下文,直到达成最终目标。这与传统的「一次查询-一次响应」模式有本质区别。Claude Code在这一范式中的独特性在于其「全局代码库感知」能力:通过读取项目结构、分析Git历史、调用终端命令,它能像一位真正理解整个代码库的工程师一样工作,而非仅基于当前文件片段给出建议。正是这种对全局代码库的感知能力,使其能够胜任「遍历所有commit生成组织地图」这类需要跨文件理解的任务。
用Claude复刻创始人的代码审查能力
创始人Maor对进入Base44后端和Agent的代码极为谨慎,坚持亲自审查每个PR。为了放大他的审查能力,团队在积累了一两周的PR评论后,让Claude分析这些历史评论,提炼出最关键的注意事项,写入指令并定期运行——由此得到了一个「Maor化身」的PR审查员,全程无需搭建复杂流程。

效果立竿见影。团队印象最深的案例是WhatsApp集成功能:涉及第三方集成、Agentic流程和Meta新API,原本预估需要一到两周。结果新工程师周四晚上用那两个提示词完成onboarding,周日早上功能就已就绪,PR审查仅有两三个小意见,随即上线生产。
用Haiku模型量化用户挫败感
如何确保产品(尤其是Agent)在生产环境中真正为客户服务?团队放弃了常见的做法——花大力气搭建完整的eval套件(对15人团队而言成本过高),转而利用已有的海量生产流量。
他们观察到一个简单规律:当一切正常时,用户默不作声、径直进入下一个功能;而一旦出问题,用户会在对话里频繁抱怨功能不可用。这是一个极强的信号。于是他们用轻量的Haiku模型对每条消息进行分类,判断用户的挫败感高低。
为什么选择Haiku而非更强的模型? Haiku是Anthropic Claude系列中定位轻量、高速、低成本的模型(对应的是更强大但更昂贵的Sonnet和Opus)。在高频、大规模的生产环境分类任务中,使用Haiku是一种典型的成本优化策略——牺牲部分推理深度,换取每次调用数毫秒级的延迟和极低的token费用。这一设计体现了AI工程中「模型能力与任务复杂度匹配」的核心原则:判断一条消息是否包含挫败感,不需要顶尖推理能力,却需要处理海量并发调用。在实际工程决策中,这种分层选型(model tiering)策略能够带来数量级的成本差异——以每百万token计价,Haiku的费用通常是Opus的1/10到1/20,而对于情感分类这类任务,两者的准确率差异往往不超过5%。值得注意的是,「模型分层」不仅是成本优化手段,更是系统架构设计的核心决策之一:在一个完整的AI系统中,从简单的文本分类、意图识别(适合Haiku级别),到复杂的多步骤推理、代码生成(需要Sonnet/Opus级别),将不同任务路由到能力匹配的模型,不仅降低成本,还能优化整体系统延迟——轻量模型的响应速度通常比旗舰模型快3-5倍。错误地将Opus用于简单分类,在规模化生产环境中会形成巨大的隐性成本浪费;而将Haiku用于需要深度推理的任务,则会造成准确率下降。
每次发布新版本Agent时,先让一小部分用户使用,追踪挫败感指标——无论改动的是基础设施、提示词还是模型,都能验证效果。
阶段二:一夜从40到80人
随着外部招聘增加、Wix内部人员转岗,甚至合并了另一个vibe coding产品,团队在「一个晚上」内从40人翻倍到近80人。Gabriel负责讲述这一阶段的三个新挑战:规模化实验、更强的评估体系,以及QA的可扩展性。

从历史实验中蒸馏A/B测试指南
规模化实验的难点在于:你不能指望每个新人都懂得该测哪些KPI、测多久,或什么时候可以直接大胆上线。团队希望把产品管理的决策「左移」到开发流程中。
他们的目标是:当PR就绪时自动运行流程,由机器人在GitHub上评论——是可以直接发布、灰度上线,还是需要A/B测试、测多长时间、监控哪些KPI,并自动在PostHog上开启实验。外壳好搭,难的是背后的判断逻辑,而团队从未明文规定过这些「产品直觉」。
他们再次选择了不开会:把PostHog上过去100个实验及其对应的PR喂给Claude Code(通过PostHog MCP连接),让Claude蒸馏出第一版指南。
PostHog与MCP协议的技术背景: PostHog是一款开源的产品分析平台,提供用户行为追踪、A/B测试、漏斗分析等功能,因可自托管和数据所有权完整而受到初创团队青睐。与Mixpanel、Amplitude等SaaS产品分析工具相比,PostHog支持完全自托管部署,企业可将用户行为数据保存在自己的基础设施上,避免第三方数据泄露风险,这对于处理敏感用户行为数据的AI产品公司尤为重要。MCP(Model Context Protocol)是Anthropic提出的开放协议,允许AI模型通过标准化接口连接外部数据源和工具——相当于给AI装上了「插件总线」。其核心设计思想是将「工具能力」与「模型能力」解耦:任何数据源或服务只需实现MCP服务端,即可被任何支持MCP的AI模型调用,无需为每个模型单独开发集成。从更宏观的视角看,MCP协议代表了AI工具生态从「碎片化集成」走向「标准化互联」的重要一步——在MCP出现之前,每个AI工具与外部系统的集成都需要定制开发,形成大量重复的「粘合代码」;MCP通过定义统一的服务发现、能力描述和调用规范,使工具生态能够像USB接口一样即插即用。通过PostHog MCP,Claude Code可以直接读取历史实验数据,省去了手动导出数据再粘贴给模型的中间步骤,实现了AI与业务数据的实时打通。这种「AI直连业务数据源」的模式,正在成为企业AI工作流的基础架构范式。
结果相当出色——虽不完美,但几小时后就有了可迭代的工作文档。有些功能值得测7天,有些因为可能微弱影响转化率和付费率而需要整整一个月。最后他们用Base44自己搭建了一个中心看板,连接BigQuery、PostHog和GitHub,让所有人一眼看清哪些实验在跑、成效如何、是否推高了AI成本。
构建用户模拟器做真实评估
到了80人规模,evals终于成为「值得投入」的事,但仍需短平快、不能占用顶尖AI工程师数月时间。团队意识到,他们真正需要的不是评估模型输出,而是检验用户构建出的App是否正确运行。

关键的顿悟在于:当用户请求一个App、其中一小部分不工作时,这不代表eval失败——评估套件应当把「拒绝」反馈回去,让Agent修复缺失部分。最终他们构建了一个用户模拟器,接入CI/CD流水线:任何AI代码的改动都会启动一个真实的Base44实例,用Stagehand模拟真实用户操作,同时观测延迟、交互轮数、成本和消耗的credits。
Stagehand与AI驱动测试的范式转变: Stagehand是Browserbase开发的AI浏览器自动化框架,在Playwright等传统自动化工具基础上叠加了AI理解能力,允许用自然语言描述用户操作(如「点击注册按钮并填写表单」),而无需手动编写选择器和断言。传统E2E测试的最大痛点是UI变化会导致选择器失效,需要持续维护——这在快速迭代的AI产品中尤为致命,因为界面可能每隔几天就发生结构性变化。Stagehand通过视觉语言模型(VLM)理解页面截图,以语义而非DOM结构来定位元素:VLM将页面截图转化为语义理解(「这是一个蓝色的主要操作按钮,位于表单底部」),而非依赖脆弱的CSS选择器(「#submit-btn-v2-mobile」)。按钮的视觉语义在迭代中往往保持稳定,而其DOM结构可能因前端重构而频繁变化,这使得语义定位的稳定性远高于传统选择器方式。将其接入CI/CD流水线,代表了从「测试代码逻辑」向「测试用户体验」的范式转变——每次代码提交都会自动触发一个模拟真实用户的测试智能体,而不是仅仅验证函数输入输出是否符合预期。这一模式的深层意义在于:当软件的核心逻辑由AI动态生成时,传统的单元测试和集成测试失去了稳定的「测试锚点」,而端到端的用户行为模拟成为唯一可靠的质量验证手段。
最经典的eval是「Hello World」冒烟测试,有趣的是它能在最小的模型上通过。
用Skills封装QA能力
对于消费级产品,如何在不线性增加测试人员的前提下做好QA?团队知道Claude Code能操作浏览器(Playwright、MCP、browser use等工具众多),但缺少关键拼图——每次都要重新学习平台的选择器、流程,以及该在数据库和Mixpanel里查看哪些事件。
于是他们把常见流程封装成Skills。Skills封装是Agent工程中的一种模块化设计模式:将一系列复杂的操作序列、平台专属知识(如特定选择器、API调用路径、数据库字段名)预先编写为结构化指令,供AI Agent在执行任务时复用,而无需每次从零学习上下文。其本质是将专家的隐性知识(tacit knowledge)显式化——把原本存在于工程师脑海中的「这个按钮的选择器是什么、该查哪张数据库表、这个操作会触发哪些事件」,转化为AI可直接引用的结构化指令库。从技术架构角度看,Skills本质上是一种「上下文压缩」机制:Agent的上下文窗口有限,每次从零探索平台环境会消耗大量token并引入错误;而预编译的Skills相当于为Agent提供了「领域专家记忆」,使其能在无需反复试错的前提下直接进入有效操作状态。这与软件工程中的「函数封装」思想高度类似,但其封装的对象从「代码逻辑」延伸到了「操作知识」——不仅包含做什么(what),更包含如何在特定业务环境中正确执行(how in context)。Skills机制解决了Agent工程中一个根本性矛盾:通用AI模型具备广泛的世界知识,却缺乏特定业务环境的专属知识(如内部系统的字段命名约定、特定团队的测试标准)。通过将这类知识编码为可复用的Skills,团队实际上在构建一个「组织知识库」,使AI Agent能够像一位了解公司内部约定的老员工一样行动,而非像一个聪明但对业务一无所知的新人。
一个Skill教会Claude Code遍历大多数功能会触及的主要用户流程;对新功能则信任Claude自行理解。他们还构建了CLI工具来抽象API和数据库,专门用于测试环境的搭建——比如覆盖数据库配置以测试「特定订阅层级用户在接近credit上限时」这类边缘场景。最终所有努力被整合进一个「如何做好QA」的元Skill。PR一打开,Agent就触发、生成测试计划、发送到Base44应用、开始测试并附带截图回报,覆盖约80%的场景,遇到力所不及处也会主动标注缺失能力。
贯穿始终的四条核心方法论

Gabriel最后总结了四条共通思路,对任何规模的团队都有借鉴价值:
第一,珍视简单。 追求「大胆而简单」,在时机未到时刻意不去构建复杂系统。evals就是典型——他们一直等到合适的规模才全力投入。
第二,taste可以被编码。 「品味」常被视为人类对抗机器的最后护城河,但通过分析历史PR评论、历史A/B实验等行为数据,可以把团队相当大一部分的决策直觉沉淀为可执行的指南。这一洞察的深层逻辑在于:专家的「直觉」往往是大量过往决策模式的压缩表达,而这些模式恰好可以通过历史数据被AI提炼还原。认知科学将这类知识称为「程序性知识」(procedural knowledge)——它们隐藏在行为序列中,难以被专家本人直接言说,却可以通过观察行为模式来逆向提炼。大语言模型在这种「行为模式压缩与还原」任务上的优势,源于其在预训练阶段接触了大量人类决策案例,形成了对「高质量判断」的隐式理解:当你将100个历史PR评论输入Claude时,模型不仅在识别文字模式,更在重建评审者的价值优先级体系。值得注意的是,这种「taste编码」并非要替代人的判断,而是将人的判断从「每次重新发明轮子」升级为「在AI提炼的基准之上做增量决策」——PR审查机器人不会取代Maor的判断,而是过滤掉95%的机械性检查项,使Maor能将有限的注意力集中在真正需要高级判断的边缘案例上。这一模式揭示了人机协作的高效分工:AI负责将历史最佳实践系统化执行,人负责处理历史中从未出现过的新问题。
第三,用自己的产品(dogfooding)。 Base44在实验看板、评估工具、QA流程中反复「吃自己的狗粮」,从中获得快速迭代的反馈闭环。
第四,瓶颈会不断移动。 解决完当前问题后,新的瓶颈随之浮现——比如如何做好「上线后验证」:一个PR进入生产后,怎样自动确认它真正推动了正确的业务指标,而不是让人持续人工盯守。
Base44的这套实践,给出了一个务实的参考样本:在AI工具足够强大的今天,小团队完全可以用极简的提示词与工作流,撬动过去需要大量流程和人力才能实现的规模化扩张——前提是克制住把一切复杂化的冲动。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。