梁文锋深度自白:DeepSeek的克制哲学、开源策略与AGI路线图

文章正文
近期一份在投资圈流传的文字稿引发广泛关注——DeepSeek创始人梁文锋在一场长达3小时44分钟的投资者交流会上,罕见地系统阐述了公司的组织理念、定价逻辑、开源策略、AGI技术路线图以及对国产芯片的判断。这份由录音整理成的42页文稿,透露出许多此前外界难以窥见的思考细节。
本文基于B站UP主对该文字稿的精读整理,梳理其中最关键的观点。需要提醒的是,文字稿属录音转写,个别数字与专有名词可能存在误差,其中的判断也未必都对——梁文锋本人也强调「每个人观点不一样,没有对错之分」。
用愿景代替组织:没有KPI的公司
梁文锋说,DeepSeek「没有组织,靠一个愿景来组织」。公司没有KPI,没有考核。他提到二十年前最崇拜GE前CEO杰克·韦尔奇,如今回看,韦尔奇说的大部分东西可能都过时了,但有一点说对了——一个公司最重要的是它的愿景。
而DeepSeek的愿景甚至不成文,从没写下来过,它体现在做事的方法和对待世界的态度里。
管理上其实是两条线并行:从下到上,每个人想做什么自己做,没人管他;从上到下是正式分工,比如集体做V4。他的标准是,正式工作最好不超过员工时间的一半,剩下一半留给自由探索。公司基本不加班——一是研究需要松弛的环境,二是足够聚焦,要做的事情本就不多。
这种「克制」的组织哲学,是整场交流会出现频率最高的关键词。
克制定价:只赚10个月回本的利润
梁文锋算了一笔账:AI最终可能占到人类社会GDP的10%。面对这么大的利益,想一个人独占,理论上就不符合客观事实,会被历史抛弃。所以他的结论是:你越克制,越有可能做成。只要做成了,随便分一点点,利益就已经足够大。
落到定价上,DeepSeek的API只赚一个他认为合理的利润:买一批设备,10个月收回成本,大概对应6倍利润。财务上服务器按3-5年摊销,商业上10个月回本,他觉得就够了。

降价那段尤其有意思。当价格降到四分之一时,公司群里很多人在欢呼——因为花了这么多精力把MoE做好,目的就是「便宜、好用、大家都用得起」。
MoE架构背景:MoE(Mixture of Experts,混合专家模型)是一种神经网络架构,其核心思想是将模型拆分为多个「专家」子网络,每次推理时只激活其中一小部分,而非让所有参数参与计算。这种设计让模型的「总参数量」与「激活参数量」可以相差数倍乃至数十倍,在保持模型整体能力的同时大幅降低单次推理的计算开销。DeepSeek V3即采用了MoE架构,总参数量约671B,但每个token的激活参数仅约37B。正是这一架构上的突破,使得DeepSeek能够在API定价上大幅低于同类产品,同时仍维持合理的利润率——因为推理成本的下降直接映射到服务器算力需求的降低。
这对竞争对手是坏事,收入直接掉一半,但在DeepSeek内部是共识。
为什么不继续降?因为他对需求没有信心了——这个价格所有人都用得起,再降需求也不会增加。他还提到,某次春节用户暴涨完全不在他们的剧本里,他们也没去抢用户、没拿用户变现。用他的话说:「后面还有西瓜,前面的可能都是芝麻。」
开源长期策略:一点都不担心被复现
梁文锋对开源的态度非常直接:「我们会开源,最强的模型可能也会开源,因为看不到闭源有什么必然的好处。」
他不担心别人部署DeepSeek的模型来竞争,反而希望大家都部署起来。他真正担心的是别人「部署不起来」——细节没做对,成本降不下去。
逻辑还是那笔账:在只赚6倍利润的情况下,开源不影响商业模式,因为第三方部署可能需要20倍成本,比他自己还高。只有当你想赚100倍利润时,开源才会影响你。
他还专门澄清:开源出去的模型和自己部署的是同一个,不会「留一手」。甚至对包括阿里、智谱、月之暗面在内的竞争对手,他也表示:「你如果复现不了,你讲,我告诉你怎么复现。」
AGI技术路线图:下一个瓶颈是持续学习
这是梁文锋讲得最系统的一段。他把AI的发展理解成一个阶梯:
- 前一阶段的阶梯是思维链,让模型自己思考,把智能上限抬高一层;
- 当前阶段的阶梯是Agent,能做的事情范围更大。
思维链与Agent的技术背景:思维链(Chain-of-Thought,CoT)是2022年由谷歌研究员提出的提示技术,通过引导模型逐步展示推理过程而非直接给出答案,显著提升了模型在数学、逻辑和多步骤问题上的表现。OpenAI的o1系列模型将这一思路内化为模型训练本身,使「慢思考」成为模型的内生能力。Agent(智能体)则是在思维链基础上的进一步延伸:模型不仅能推理,还能感知环境、调用工具、执行多步骤任务,并根据反馈动态调整行动计划。Agent的典型能力包括浏览网页、执行代码、调用API等,其本质是将语言模型从「对话系统」升级为「自主行动者」。梁文锋将这两者视为AI能力发展的连续阶梯,而非彼此割裂的技术跃迁。
每一步都踩在前一步上,没有一步是白走的。

那Agent之后呢?他说下一个瓶颈很清楚——持续学习。你招一个员工,他花两个月熟悉公司就能上手,而AI没有这两个月的学习过程,你得把所有上下文都喂给它,这不现实,所以AI还替代不了员工。
持续学习的技术背景:当前主流大语言模型采用的是「预训练+微调」的静态学习范式:模型在训练完成后权重即被冻结,部署阶段不再从新数据中更新知识。这意味着模型的知识存在「截止日期」,也无法像人类员工那样在实际工作中不断积累特定领域的经验。持续学习(Continual Learning)试图解决这一问题,让模型能够在不遗忘已有知识的前提下,持续从新数据和交互中学习——这被称为克服「灾难性遗忘」(Catastrophic Forgetting)问题。目前学术界的主流方案包括弹性权重巩固(EWC)、渐进式网络(Progressive Neural Networks)以及基于记忆回放的方法,但在超大规模语言模型上实现高效、稳定的持续学习仍是尚未解决的开放问题。梁文锋将其列为Agent之后的下一个关键瓶颈,正是因为这一能力的缺失,使AI至今难以真正替代需要「入职适应期」的人类员工。
一旦模型能像人一样持续学习,就能做到任何事情。
再往后是「起点」:模型自己研究、自己开发下一个版本,实现自我迭代。他强调这不是突变,而是一个较长的渐进过程。起点之后,才轮到具身智能走进现实世界。
按这个顺序,每一步都能用前面的技术开发后面的,做起来最轻松;反过来先做具身,是个苦活。也正因为这张路线图,DeepSeek不会以视频生成、世界模型为主线——他认为图文视频跟智能上限关系不大,商业上是好生意,但不会因为是好生意就去做。多模态会做,V4后续版本会支持原生多模态,但它只是一个组件,主线仍是把AI训练做好,然后解决持续学习。
与美国的差距:核心只有「资源」二字
谈到与美国的差距,梁文锋的回答只有一个词:资源。人才上几乎没有差距,因为最聪明的那批人有一半多一点还留在国内。人才的差距本质也是算力的差距——卡少,能做的实验就少。
据文字稿,DeepSeek目前大概拥有2万张H系列等效算力,且大部分是最近才到位的。而目前世界上最大的模型激活参数约800B,国内还在几十B激活的规模,差了一个数量级。要训练同样大的模型,需要5万张GB300——这还只是训练,不算研究,哪怕把500亿全花掉也训不起。
所以策略是:先在几十B激活的规模上做好,下一步做到150B、250B。他总结当下的叙事是「落后美国一到两年,但只用了美国二十分之一的算力」,未来要把这个时间差缩到六个月甚至三个月。
至于融资的钱怎么花,他说得很实在:「只要价格合理,能买多少卡就买多少卡。如果半年之内把钱花完,那太幸福了。」在他看来,把钱变成英伟达卡,比放在银行里更稳定。
国产芯片:英伟达在掘自己的坟墓
关于国产芯片,梁文锋的原话颇为大胆:「英伟达是在掘自己的坟墓,CUDA打的护城河正在快速瓦解。」

他给出三个原因:
- AI能写代码,有了AI之后,重建一套软件生态比以前容易多了;
- DeepSeek自研了高级语言TileLang,用它重写CUDA算子,代码量小很多、效率大幅提高。V3训练虽然还用英伟达的卡,但已经基本不依赖英伟达的生态;
- AI计算卡市场已比游戏卡更大,专用芯片没有理由再跟游戏用的架构绑在一起。
CUDA生态与TileLang的技术背景:CUDA(Compute Unified Device Architecture)是英伟达于2006年推出的并行计算平台与编程模型,经过近二十年的积累,围绕CUDA形成了包括cuDNN、cuBLAS、NCCL等在内的庞大软件生态,深度绑定了全球AI训练与推理的基础设施。开发者学习CUDA、优化CUDA算子的成本极高,这形成了英伟达硬件的强大护城河——即便竞争对手推出性能相当的硬件,缺乏成熟软件生态也难以被采用。TileLang是DeepSeek自研的高级编程语言,旨在以更简洁、更可移植的方式描述张量计算(Tensor Computation),使同一套算子代码能够编译到不同硬件后端(包括英伟达GPU、华为昇腾等),从而在底层将模型训练与特定硬件厂商解耦。这一技术路线与Meta的Triton语言、Apache TVM等开源编译器方向一脉相承,其战略意义在于:一旦高级语言的抽象层足够完善,「只有英伟达卡才能高效训练大模型」的局面将从根本上被打破。
华为这边,950超节点在性能和价格上可以平替GB200/GB300,代价是四张华为卡顶一张英伟达卡,同时落后约两年。
华为950超节点背景:华为昇腾910B是目前国内量产的主力AI训练芯片,其单卡算力与英伟达A100相当,但在显存带宽、互联带宽等指标上与H100/H800仍有差距。梁文锋提到的「950超节点」指华为即将推出的新一代集群方案,通过将多张昇腾芯片以高速互联(类似英伟达NVLink)紧密耦合,在系统级性能上对标英伟达GB200 NVL72超节点。「四张华为卡顶一张英伟达卡」的说法,折射出当前国产芯片在单卡算力密度和互联效率上与顶级英伟达产品之间的差距,但梁文锋的判断是,这一差距可以通过软件优化和规模堆叠部分弥补,且随着TileLang等工具链的成熟,国产芯片的「可用性」瓶颈将先于「性能」瓶颈得到解决。
华为近期给了DeepSeek大约1.6万张卡的产能,只相当于4000张B系列,训不了下一代模型,但可以帮华为把生态先做好。
他的预言是:一年之内,国产芯片生态完全没有问题,这件事会被验证,剩下的只是产能问题。
五个行业判断:大模型公司不会有暴利
交流会最后,梁文锋给出了几个行业判断:
第一,团队稳定是唯一的核心利益。 钱不是问题,资源不是问题,只要团队不走就一定能做成AGI。本次融资后大家拿到的期权较多,最大的风险得到很大解除。
第二,大模型公司不会有暴利。 中国做基模的公司太多,而美国只有三家。中国资源分得太散,最终一定会收敛。大模型公司的差距只有成本和时间,不存在暴利空间。

第三,先发优势并不持久。 聊到Anthropic超过OpenAI,他认为这不是长期优势,很快会消失,OpenAI和Google大概率会交替上升。DeepSeek内部有一半人平时觉得OpenAI更好。
第四,中国在全球AI分工中很可能是产量最大的一方。 中国产的AI价格会系统性地更便宜,最终中国的AI很可能是「三体之一」。
第五,商业底线清晰。 如果B端能有几个亿美金收入,公司离盈利就不远了;最坏情况下,全力卖API也能支撑一个上市公司。
结语
把整场交流会压缩来看:DeepSeek用愿景代替组织,用克制代替扩张,只赚10个月回本的利润,把开源当作长期策略,下一步锁定持续学习,同时押注国产芯片生态一年内翻身。
这份文字稿最令人印象深刻的,还是那句朴素却坚定的话——「后面还有西瓜,前面的可能都是芝麻。」在一个普遍追逐短期变现的行业里,这种长期主义与克制的姿态,本身就是一种稀缺的战略选择。
核心要点
相关推荐

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。

Claude分享链接被谷歌收录索引:隐私风险与防护指南
Claude的分享对话链接和Artifacts可能被Google搜索引擎抓取收录,导致敏感信息公开泄露。本文分析技术根源、隐私安全影响,并提供用户自我保护的实用建议。