Kimi K3开源2.8万亿参数:为何令华尔街恐慌

Kimi K3:一个中国开源模型撼动美股
7月16日,月之暗面(Moonshot AI)上线了参数规模高达2.8万亿的Kimi K3模型,并计划在7月27日开源权重。这是目前已放出权重的最大规模模型。更引人注目的是它引发的市场反应:消息一出,英伟达领跌,带动美股科技股全线走低。一个中国开源模型,为何能让华尔街如此紧张?
答案不只在于模型本身的性能,更在于它对整个AI产业估值逻辑的冲击。当一个开源模型能以几十分之一的成本逼近前沿水平时,「砸钱堆算力」的旧叙事开始动摇。
K3的技术优势究竟在哪里
K3的2.8万亿参数看似惊人,但它采用的是稀疏的混合专家(MoE)架构:896个专家中,每个token仅激活16个,激活比例约为1.8%。这意味着单次推理实际消耗的算力,远小于账面参数所暗示的规模。
混合专家架构(MoE)是近年来大语言模型规模化的关键技术路径。 MoE的核心思想是将模型参数分配给多个「专家」子网络,但在处理每个输入token时,只由一个动态的「路由器」(Router)选择少数几个专家参与计算。这种设计实现了「参数量」与「计算量」的解耦——一个2.8万亿参数的MoE模型,实际激活参数量可能只相当于几百亿参数的稠密模型,在推理成本上获得数量级的优势。MoE最早由Jacobs等人于1991年提出,近年被Google的Switch Transformer、Mixtral以及DeepSeek等模型大规模应用于LLM领域,现已成为超大规模模型的主流架构选择。值得注意的是,MoE的路由策略本身也是一门学问:如何防止大量token被路由到少数「热门专家」而导致负载不均衡(即「专家坍塌」问题),是各家实验室竞相攻克的工程难题。路由器需要在「让专家充分专业化」与「避免部分专家始终闲置」之间找到精妙平衡,否则模型在分布式硬件上的实际吞吐量将大打折扣。K3声称在896个专家中实现了更均衡的路由分配,这在如此规模下并不容易做到——此前业界普遍认为专家数量超过数百个后,均衡路由的工程复杂度会呈指数级上升。
技术层面,K3使用了自研的Kimi Delta Attention机制,解码速度最高提升6.3倍,上下文窗口支持100万token。注意力机制(Attention Mechanism)是现代大语言模型的核心计算模块,由Vaswani等人在2017年的论文《Attention Is All You Need》中系统提出,其本质是让模型在生成每个词时,动态地「关注」输入序列中最相关的部分。 然而,标准全注意力的计算复杂度随序列长度呈平方增长(O(n²))——序列长度翻倍,计算量变为四倍——处理百万级长上下文时会造成巨大的显存和计算开销,在工程上几乎不可行。Kimi Delta Attention通过差分化的注意力计算减少冗余运算:其核心思路是对相邻层或相邻位置的注意力权重做差分,只计算「变化量」而非每次从头全量计算,从而大幅削减在长序列中大量重复、冗余的注意力运算,将上下文窗口扩展至100万token。这相当于约75万词的英文文本,或约500本普通小说,对需要处理超长合同、完整代码库或学术文献的企业用户而言具有实质意义。这一方向并非K3独创:微软的LongRoPE通过旋转位置编码的动态调整、DeepSeek的多头潜在注意力(MLA)通过低秩压缩键值缓存,都是解决同一问题的不同工程路径,反映了业界在长上下文扩展上的系统性竞争。定价方面,输入每百万token仅需3美元、输出15美元,大约是顶级闭源模型的零头。
要说实话,在综合评测排行榜上,K3目前位列第四,前面还有Claude Fable 5和GPT 5.6 SO。它只在前端代码生成这一项登顶,并未全面超越。但它已经咬住了第一梯队的位置——这本身就是一个信号。

市场为何出现剧烈反应
K3的评测成绩公布后,美股盘前纳斯达克100期货一度跌超1.8%,英伟达领跌科技七巨头。半导体指数从6月底高点回落约20%,进入技术性熊市,美光一度跌逾30%。亚洲市场同样承压,日经225当天一度跌超4%。
高盛将这轮下跌定性为一次「去杠杆」——市场开始重新审视:如果一个开源模型用几十分之一的成本就能逼近前沿,那么无限堆算力的时代是否接近尾声?不少人将这一幕称为「DeepSeek时刻」的重演。「DeepSeek时刻」是指2025年1月DeepSeek R1发布后引发的全球AI产业震动。 彼时DeepSeek R1以远低于同级别美国模型的训练成本,实现了与OpenAI o1相当的推理能力,英伟达单日市值蒸发近6000亿美元,创美股历史单日最大跌幅纪录。这一事件的深层冲击在于颠覆了「算力=能力」的线性叙事——市场此前普遍相信持续投入更多高端GPU、Scaling Law(规模定律)就会持续奏效。所谓Scaling Law,是指由OpenAI研究人员(Kaplan等人)在2020年提出的经验性规律:模型能力会随参数量、数据量和计算量的增加而可预测地提升,且这种提升遵循幂律关系,意味着每一次能力跃升都需要算力的成倍投入。这一规律曾长期支撑英伟达、台积电等算力供应商的高估值逻辑,并推动微软、Google、Meta等科技巨头宣布数百亿乃至逾千亿美元的AI资本开支计划。但DeepSeek和K3相继证明,在算力受限条件下通过架构创新同样可以实现弯道超车,令市场开始质疑Scaling Law是否已触及边际收益递减区间——即继续堆算力所带来的能力提升越来越有限,而架构效率的价值被系统性低估。K3沿袭了同一套冲击范式,因此被称为「重演」。你可能没注意到,此次发布刻意抢在上海世界人工智能大会开幕之前,时间点的选择颇有深意。
对闭源公司的定价冲击
这件事对美国闭源模型公司,尤其是Anthropic,构成了直接的定价压力。X上一位硅谷科技创业者、前Meta产品经理发布的K3系列评论引发大量转发。他的核心质疑是:当最好的开源模型已能追平甚至在部分任务上超过闭源产品,Anthropic凭什么给Claude Fable定那么高的价格?企业为什么要为高出一大截的价格买单,还要接受更不友好的数据条款?

他还指出,Anthropic的估值是Kimi的约50倍(近1万亿美元对200亿美元),这背后的逻辑十分脆弱:如果你的商业模式完全建立在「必须永远第一」的基础上,那只要有一个开源对手在某个关键维度赢一次,定价逻辑就会动摇。更何况,企业一旦能用上前沿开源模型、数据又不出自己的防火墙,为什么还要把数据交给第三方闭源平台?
产业链上下游的重新定价
影响可以从两个方向来看。
上游:算力与芯片承压
如果开源模型能以低成本逼近前沿,市场对高端芯片和无限扩张算力的预期就需要重新计算——这正是英伟达和半导体板块当天大跌的根本逻辑。
但有一个关键点不可忽视:便宜和开源≠不需要算力。训练一个2.8万亿参数的模型本身代价高昂,只是「钱花在哪、由谁来花」发生了改变。算力需求并未消失,而是从少数闭源巨头向更分散的企业定制场景转移。这一转移对英伟达的实际影响可能比股价反应更为复杂:短期内,市场情绪放大了「算力需求消失」的担忧;但长期来看,开源生态的繁荣意味着更多中小企业和研究机构需要租用算力进行微调和私有化部署,云厂商(AWS、Azure、阿里云、腾讯云)的GPU集群需求反而可能扩大——只是英伟达在定价上的谈判筹码会相应减弱。
下游:企业服务的新商业模式
这位创业者押注:专注企业定制模型的公司,长期会比卖闭源API接口的公司更赚钱。逻辑是——放出最好的开源权重来推动企业采用,再向大企业收取7到9位数的费用,帮它们在自己的防火墙内完成定制微调和私有化部署。

开源与闭源在AI领域的商业模式博弈,本质上是两种不同的价值捕获路径之争。 闭源模式(如OpenAI、Anthropic)通过API访问收费,核心竞争力维系于模型能力的持续领先;一旦开源模型在性能上追平,其溢价定价能力便会迅速被侵蚀。开源模式(如Meta的Llama系列、DeepSeek、Kimi K3)则将权重公开发布,放弃直接的模型销售收入,转而通过生态建设、云服务调用和企业私有化部署服务来变现。这一路径与Linux在服务器领域的历史高度相似:操作系统本身免费,但围绕它的企业服务(Red Hat、SUSE)创造了巨大商业价值。Red Hat在被IBM以340亿美元收购前,其年营收超过30亿美元,几乎全部来自企业服务订阅,而非Linux本身——这正是「开放权重+企业服务」模式的历史先例。值得注意的是,Meta选择开源Llama系列也遵循相似逻辑:Meta本身并不直接销售模型API,但通过Llama生态的广泛采用,得以将AI能力内嵌进自身的广告和社交产品,同时让竞争对手的闭源护城河持续受到侵蚀。对于月之暗面而言,开源K3不仅是技术示威,更是一次有意识的生态卡位:通过让开发者和企业形成对K3架构的依赖,为后续的私有化部署服务和云端调用建立护城河。
他也解释了为什么Anthropic难以跟进这条路:你无法既靠卖闭源API盈利,又把模型权重交给企业去微调——这两件事在商业逻辑上天然冲突。Anthropic面临的困境在于,其商业模式高度依赖「永远第一」的技术护城河,而当这一前提被动摇时,其近1000亿美元的估值逻辑便缺乏有力支撑。这也揭示了开源与闭源商业模式之间更深层的结构性张力。
对A股、港股的影响
回到二级市场,尤其是A股和港股,这一轮的逻辑和年初DeepSeek那次高度相似:利空的是美国算力和芯片叙事,利好的是中国相关资产的重估预期。
国产开源模型每往前走一步,国产算力、云计算,以及依托开源模型做应用的公司,想象空间都会被重新定价。消息面上还有一条值得关注:Kimi已通知投资人启动重组,准备赴港上市,乐观情形下6个月内即可挂牌。
这不只是一个模型发布的故事,它把AI算力、云计算、应用这几个板块的估值锚,又向中国这边挪了一点。

当然也要保持清醒:情绪驱动的行情波动剧烈,基准第一不等于收入第一,本文不构成任何投资建议。
更大格局:中美AI竞赛进入胶着阶段
放到更宏观的视角,目前能摸到前沿水平的中国实验室不止Kimi一家:智谱GLM、DeepSeek、阿里通义在语言模型方向持续推进,可灵在视频生成领域同样不可忽视。反观美国,真正处于前沿的主要还是OpenAI和Anthropic这两家。
更关键的是,这些成绩都是在高端芯片受限的条件下取得的。自2022年起,美国商务部通过多轮出口管制,先后将英伟达A100、H100、H800等高端训练芯片列入对华出口限制名单,并持续收紧以「算力等效」为标准的审查门槛——即通过折算不同芯片的总算力来规避单一产品限制,堵住迂回采购的通道。然而,实际结果呈现出一种反常的「倒逼效应」:受限于无法获取最高端算力,中国顶尖研究团队不得不在有限硬件条件下极致压榨每一个FLOP(浮点运算次数)的效用,反而加速了在模型架构、训练方法和推理优化等软性层面的系统性创新。「卡脖子」的外部压力,反而倒逼出了架构设计和工程效率上的创新突破。 具体而言,这体现在三个层面:一是混合精度训练和量化技术的极致应用,以降低对高带宽显存的依赖;二是梯度检查点(Gradient Checkpointing)等内存优化技术的深度定制,通过在前向传播时丢弃中间激活值、在反向传播时重新计算来换取显存空间;三是从模型架构根源处减少计算冗余,MLA和Delta Attention均属此类。DeepSeek的多头潜在注意力(MLA)、K3的Delta Attention和稀疏MoE路由优化,均是这一压力下的产物。这一现象在科技史上并不罕见:外部封锁往往能激发被封锁方在替代路径上的非线性突破,苏联航天、以色列国防科技均有类似案例。
那位创业者还提到一点:中国顶尖AI研究员与OpenAI、Anthropic的核心团队,本就出自相同的顶级高校,其中许多还有华人背景。人才同源、架构创新提速,中美这场AI竞赛现在才真正进入胶着阶段。接下来值得持续关注的,是DeepSeek的下一次重大更新。
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。