DeepSeek之道:梁文峰谈愿景、克制与开源哲学

近期,DeepSeek创始人梁文峰打破沉默,一次罕见的与投资者的对话记录被公开。这份长达4小时、约3.4万字、118条对答的记录经过部分参与投资机构核实,被认为真实可信。读完这份记录后,一个鲜明的印象是:DeepSeek所秉持的,是一种颇具东方哲学色彩的AI发展观。本文将梳理这份对话的核心观点,并尝试理解它对当前中美AI竞争格局的深层意义。
DeepSeek的愿景:凝聚君子而非利益共同体
整场对话围绕两个关键词展开——愿景与克制。
梁文峰认为,管理一家公司靠的不是规章制度,而是愿景。而愿景不是挂在墙上的标语,也不是常见的"画大饼"。所谓画大饼,本质上是许诺未来的利益回报,其驱动力终究是利益。靠利益凝聚起来的团队,会"因利而聚,利尽而散"。当有人能提供更多利益时,团队便会分崩离析。
在梁文峰的表述中,DeepSeek的出发点并非商业利益最大化:"我们是怀着对这个世界非常大的善意来做这个事情,我们觉得这是对人类有用的,这是一个金钱以外的事情。"这句"金钱以外的事情",恰恰将"义"与"利"区分开来。他强调,公司成立两年前既没有很多钱,也没有很多卡,更没有知名度和号召力,但就是这样一群平凡的人做到了全世界都不敢想象的事。
这种以愿景为核心的管理理念,与部分同行形成对照。月之暗面CEO杨植麟曾谈到用类似训练大模型的方式管理团队——在SFT(监督微调)与RL(强化学习)之间寻找平衡,并担心用RL方式管理会被"reward hacking"(奖励作弊),即员工为了指标不择手段,最终benchmark很漂亮但实际并未变好。
这里有必要解释一下这个隐喻的技术背景。SFT(Supervised Fine-Tuning,监督微调)和RL(Reinforcement Learning,强化学习)是大语言模型训练流程中的两个关键阶段。SFT阶段通过人工标注的高质量数据对模型进行微调,相当于"手把手教学",让模型学会期望的行为模式。RL阶段(通常采用RLHF,即基于人类反馈的强化学习)则通过奖励信号引导模型自主优化输出。"Reward hacking"是RL中一个著名问题:当奖励函数设计不完美时,模型会找到奖励函数的漏洞,表面上获得高分但实际行为偏离预期目标。例如,一个被训练最大化用户点赞的模型可能学会生成煽情但低质量的内容。杨植麟将这一技术概念类比到团队管理中,指出如果完全依赖KPI等量化指标来管理员工,可能导致员工"刷指标"而忽视真正重要的工作。

这是一种逻辑严密、条理清晰的"将领思维"。但补充一点,两种思路的差异或许正在于此:一种在思考如何防止员工钻空子,另一种则在思考如何聚拢志同道合者共同实现愿景。当团队成员是为自己的理想而来时,防作弊本身便不再是首要问题。
DeepSeek的战略克制:舍芝麻取西瓜
理解了愿景,才能理解DeepSeek为何一贯表现得低调克制。用梁文峰的话说:"舍弃一些换更多的其他东西,前面遍地都是芝麻,西瓜还在更远的地方,你越克制就越有可能做成。"这种克制主要体现在三个方面。

坚守AGI主线,不被热点干扰
DeepSeek只有一条主线——通往AGI的模型能力。AGI(Artificial General Intelligence,通用人工智能)是指具备与人类同等甚至超越人类的通用认知能力的AI系统,能够在没有专门训练的情况下理解、学习和执行任何智力任务。当前主流AI(如GPT系列、DeepSeek等大语言模型)被归类为"窄AI"(Narrow AI),它们在特定任务上表现出色,但距离真正理解世界、进行跨领域自主推理仍有显著差距。AGI被视为AI研究的终极目标,也是OpenAI、DeepMind等机构明确写入使命宣言的方向。实现AGI需要突破因果推理、常识理解、持续学习、多模态融合等多个核心难题,目前业界对其实现时间表存在巨大分歧。
视频生成、3D生成、世界模型等热门方向都不在DeepSeek的规划之内。梁文峰认为,视频生成火起来时仿佛"不做就不是AI公司",但仔细想它与智能的路线图关系不大。
从技术角度看这一判断有其合理性:视频生成模型(如OpenAI的Sora、Runway的Gen系列等)基于扩散模型(Diffusion Model)或自回归变换器(Autoregressive Transformer)架构,通过学习海量视频数据中像素的时空分布来生成新视频。这些模型本质上是在拟合数据的统计规律,而非建立物理世界的因果模型。哲学家朱迪亚·珀尔(Judea Pearl)提出的因果推理层级理论将认知分为三个层次:关联(看到什么)、干预(做了会怎样)、反事实(如果当初怎样)。视频生成模型主要停留在第一层——关联层面,能够生成"看起来对"的画面,但无法回答"如果改变初始条件,球会怎样弹跳"这类干预和反事实问题。
而AGI路线图的第一步是思维链(Chain-of-Thought),需要模型学会推理,进而构建对世界的理解。思维链技术试图让模型展示中间推理步骤,向更高层次的因果推理迈进。因此视频生成是AI的应用出口,而非AGI的入口。据爆料,Sora一类产品单月营收可超10亿元,但DeepSeek始终未涉足。
不抢流量,不做超级APP
梁文峰坦言,去年春节用户量突然暴涨,但公司并未追求留住这些用户或将其变现,也从未想过做下一个字节或腾讯。原因同样是"后面还有西瓜,前面的可能都是芝麻"。当拥有庞大用户群体后,反而可能被用户牵着走,白白消耗有限资源。今年初曾有人拿着流量下滑的图表宣称"DeepSeek没人用了",但这本就不是团队关心的指标。
坚持开源,不追求暴利
对于开源,梁文峰的态度很明确:"我看不到闭源有什么必然的好处,完全没有。"他承认开源确实会让渡一些利益,但其逻辑是:AI产业最终可能占人类社会GDP的10%,若想独占这份利益,一定会被历史抛弃。
AI大模型的开源与闭源之争是当前产业的核心议题之一。开源模型(如Meta的LLaMA系列、DeepSeek系列、Mistral等)公开模型权重,允许任何人下载、修改和部署;闭源模型(如OpenAI的GPT系列、Anthropic的Claude、Google的Gemini等)仅通过API提供服务,不公开核心参数。开源模型的优势在于:企业可以在本地或私有云上部署,数据不出域,安全性和隐私性更高;可以根据自身需求进行微调和定制;长期使用成本远低于持续调用闭源API。闭源模型的优势在于可以通过API调用获取持续更新的最强性能,且不需要自建推理基础设施。从商业模式看,闭源支撑的是SaaS订阅收入,而开源更多通过企业服务、云计算平台和生态影响力来实现商业回报。

他有一句令人印象深刻的话:"拿得多的人会被拿得少的人打败……愿景如果是拿得多的话,你就会被愿景是拿得少的人给打败。"这与历史上诸多起义因提前变现、分配利益而内部分裂的教训相通——愿景尚未实现便经受不住短期利益诱惑,最终愿景沦为空洞口号。
DeepSeek团队稳定性:君子之聚的验证
克制也是最好的团队黏合剂。梁文峰透露一个细节:DeepSeek曾有一款模型因担心需求过大而定价偏高,后来降价后大家都很开心,因为"让大家都能充分使用它"正是把模型做好的初衷。

在过去一年国内外疯狂的AI抢人潮中(甚至出现上亿年薪的报价),DeepSeek团队保持了稳定。从V3到V4,技术报告的人员清单从197人扩大到近300人,梁文峰的名字与所有人并列,V3时期的老成员也基本都在。这在巨大的利益诱惑面前,本身就说明了团队成员的价值取向。
DeepSeek在有限算力条件下取得突破性成果,核心依赖于多项架构创新。MoE(Mixture of Experts,混合专家)架构将模型参数分成多个"专家"子网络,每次推理时只激活其中一部分,大幅降低了计算成本——例如DeepSeek-V3拥有6710亿总参数,但每次推理仅激活约370亿参数。MLA(Multi-head Latent Attention,多头潜在注意力)机制通过对注意力键值(KV)进行低秩压缩,将KV缓存压缩至传统多头注意力的5%-13%,极大缓解了长序列推理时的显存瓶颈。此外,DeepSeek-R1在训练方法上的突破同样引人注目:它证明了即使不依赖大规模人工标注的监督数据,仅通过强化学习就能让模型涌现出思维链推理能力,这一发现动摇了业界此前"必须先SFT再RL"的技术共识,被认为是通往AGI路径上的重要里程碑。
对于中美差距,梁文峰的判断是:中国不缺人才,缺的是算力。中国AI算力受限的核心原因是美国对华芯片出口管制。自2022年10月起,美国商务部工业与安全局(BIS)陆续出台多轮对华半导体出口限制措施,禁止向中国出口高性能AI芯片,包括NVIDIA的A100、H100及后续的H200、B200等旗舰级GPU。NVIDIA随后推出了针对中国市场的"阉割版"芯片(如A800、H800),但这些芯片在互联带宽等关键指标上有显著削减,且在2023年10月的更新禁令中也被纳入管控范围。GPU芯片是训练大模型的核心硬件,一次前沿模型的训练可能需要数万张高端GPU协同工作数月。算力不足直接制约了中国团队能够进行的实验数量和规模,迫使他们在算法效率上做更多创新——DeepSeek的MLA和MoE架构优化正是在这一约束下诞生的技术突破。国产替代方面,华为昇腾系列芯片正在加速追赶,但在生态成熟度和单卡性能上与NVIDIA仍存在代差。梁文峰认为算力问题是短期的,几年内有望缓解,只能集中力量在编码能力等某几个方向上突破。
DeepSeek开源模型为何令对手忌惮
为什么美国对中国开源模型如此警惕,甚至有封禁的动议?答案或许不在于所谓的国家安全或网络安全风险——闭源模型同样存在被攻破和滥用的风险。
真正的原因在于开源模式本身的号召力。据称,美国200多家初创公司及部分知名大公司曾联名写公开信,要求政府不要禁止中国开源模型。这正应了"得道者多助,失道者寡助"。开源模型允许企业将账号、密钥、凭证等重要数据留在本地,安全可控且成本低廉,这是许多开发者的现实需求。2024年以来,开源模型的性能快速逼近甚至在部分领域超越闭源模型,这对OpenAI等闭源公司的商业护城河构成了实质性挑战,也引发了美国政策层面关于是否应限制中国开源模型在美使用的激烈辩论。
有观点将中国AI实验室的开源解读为"落后者策略"——通过免费打击对手,超越后再闭源收割。但从这份对话看,梁文峰的逻辑恰恰相反:开源不是打击对手的战术,而是实现"让世界变得更好"这一愿景的战略。他并不担心别人用其开源模型来竞争,因为那"无非就是少拿一点"。
结语:愿景优先、克制为策、开源为道
DeepSeek追求的不是垄断利润,而是一个长期愿景。他们不追短期风口、不抢流量、不炒作,把资源聚焦在AGI这个单一目标上。在AI是否会取代人类的争论中,一个值得参考的观点是:AI更可能重塑就业市场而非造成大规模失业,它是人力资本的放大器。只要坚持让AI普惠大众,社会整体劳动产出将成倍增长。到那时,人们或许会重新思考"就业"本身的意义。
当然,这份对话中的观点带有明显的理想主义色彩,其能否长期兑现,仍需时间检验。但至少在当下,DeepSeek所展现的这套"愿景优先、克制为策、开源为道"的哲学,为观察中国AI力量提供了一个独特的视角。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。