Kimi K3发布:2.8万亿参数全球最大开放权重模型

全球最大开放权重模型登场
月之暗面(Moonshot AI)正式发布新一代大模型 Kimi K3,刷新了开源大模型的规模纪录。Kimi K3 拥有 2.8 万亿参数,成为目前全球规模最大的开放权重(open-weight)大模型。
这一数字背后的意义不容小觑。在当前主流开源模型仍徘徊在数百亿至数千亿参数级别的情况下,2.8 万亿参数意味着 Kimi K3 在模型容量上已与顶级闭源商业模型处于同一梯队。更关键的是,月之暗面选择以「开放权重」形式发布,为整个开源社区提供了追赶前沿闭源模型的重要基础设施。
值得注意的是,2.8 万亿的总参数规模几乎可以确定 Kimi K3 采用了混合专家(Mixture of Experts,MoE)架构——这也是当前唯一可在合理算力预算内训练万亿级模型的主流方案。MoE 的核心思想是将模型划分为大量「专家」子网络,每次前向传播时由门控网络(gating network)动态选择少数几个专家激活,使实际参与计算的「激活参数量」远小于总参数量。GPT-4、Mixtral 和 DeepSeek-V3 均采用此架构。以 DeepSeek-V3 为例,其总参数 671B,但每 Token 激活参数仅约 37B。2.8 万亿总参数配合 MoE 稀疏激活,实际推理成本可能与数千亿稠密模型相当,这也是其定价能够对标 Claude Sonnet 的底层逻辑所在。
MoE 架构的历史可追溯至 1991 年 Jacobs 等人提出的「专家混合」思想,但真正在大语言模型中爆发是在 2022 年前后,以 Google 发布的 Switch Transformer(拥有 1.6 万亿参数)和 Mixtral 8×7B 的广泛落地为标志性节点。其核心突破在于:通过稀疏激活,模型可以拥有远超稠密模型的「知识容量」,却无需在每次推理时激活全部参数。以 2.8 万亿参数的 Kimi K3 为例,若其激活比例约为 2%,则每个 Token 实际参与计算的参数量约为 560 亿——与当前主流稠密模型规模相当,推理延迟和显存占用因此得以控制在可接受范围内。
这一架构的关键工程挑战在于**「专家负载均衡」**:若门控网络反复选择同一批专家(即所谓的「专家坍塌」问题),其他专家会退化为无效参数,导致整体模型容量被严重浪费,甚至引发训练崩溃。早期解决方案通常在损失函数中添加辅助平衡损失(auxiliary loss),强制门控网络均匀分配流量,但这会与主任务目标产生干扰,影响最终性能。DeepSeek-V3 的一项关键创新正是引入无辅助损失的负载均衡策略(auxiliary-loss-free load balancing),通过动态调整每位专家的偏置项来实现负载均衡,在不损害主任务优化的前提下解决了专家坍塌问题。月之暗面的工程团队在万亿参数规模上必然也对这一方向进行了深入探索,其解决方案的具体细节值得社区在权重与技术报告开放后深入研究。
你可能没注意到,「开放权重」并不完全等同于「完全开源」。以 Meta 的 LLaMA 系列为代表,许多大型模型选择公开训练好的权重文件,但保留训练数据集、完整训练代码及超参数配置等核心资产。这与传统软件开源(如 Apache、MIT 许可证)有本质区别——传统开源软件要求公开全部源代码,任何人均可自由审查、修改和再发布。
值得一提的是,开源倡议组织(OSI,Open Source Initiative)在 2024 年发布的开源 AI 定义草案中明确指出,仅公开权重文件而不披露训练数据和训练代码的模型,不应被认定为真正意义上的开源软件。这一定义在社区内引发广泛争议:支持者认为训练数据的完整披露是可复现性和透明度的基础;反对者则指出,鉴于顶级模型训练数据集的规模往往达到数十万亿 Token,完整披露在实践中几乎不可行,且涉及复杂的版权问题,若以此标准划线,业界将难以出现真正意义上的「开源大模型」。
从法律角度看,开放权重模型通常附带定制化许可证——如 Meta 的 LLaMA 许可证规定月活超过 7 亿用户的平台不得免费使用,月之暗面 Kimi K3 的具体许可条款也值得开发者在商业落地前仔细研读。开放权重的商业价值在于:研究者可进行微调(fine-tuning)和推理部署,企业可基于其构建私有化产品,但无法完整复现训练过程。即便如此,能够获取如此规模的模型权重,对研究者和开发者而言已极具价值——社区仍可通过模型解释性分析(mechanistic interpretability)、激活观察和参数空间探索等手段,对模型内部机制形成深入理解,这也是近年来「模型解剖学」这一研究方向快速兴起的重要背景。
百万上下文与原生多模态能力
Kimi K3 支持高达 100 万 Token 的超长上下文窗口,延续了月之暗面在长文本处理上的传统优势。Token 是大语言模型处理文本的基本单位,大致对应 0.75 个英文单词或约 1.5 个中文字符。百万 Token 约相当于 75 万英文单词,可容纳整部《战争与和平》数遍、数万行代码库或数小时的视频字幕,极大拓展了实际应用场景。
实现 100 万 Token 级上下文窗口,是当前大模型工程中公认的「硬骨头」,涉及多个层面的系统性挑战。
在内存管理层面,KV Cache(键值缓存)是注意力机制在推理时必须维护的中间状态——模型在生成每个新 Token 时,需要「回顾」序列中所有历史 Token 的键(Key)和值(Value)向量,将其缓存下来避免重复计算。KV Cache 的显存占用与序列长度成线性关系:100 万 Token 在 FP16 精度下,仅 KV Cache 一项即可消耗数百 GB 显存,远超单张 A100/H100 的 80GB 容量上限,必须依赖分布式推理(将 KV Cache 分散存储于多张 GPU)或 KV Cache 卸载技术(将不活跃的缓存卸载至 CPU 内存乃至 SSD)。
在位置编码层面,主流的 RoPE(旋转位置编码,Rotary Position Embedding)在超出训练长度时存在明显的外推衰减,因为旋转角频率是在固定长度下标定的,超出范围后位置信息会失去区分度。研究者先后提出了 YaRN(Yet another RoPE extensioN method)、LongRoPE、LongLoRA 等外推增强方案,本质上均是通过调整旋转频率基底(base frequency)来延伸位置编码的有效范围,或通过插值(interpolation)将训练长度内的位置编码「压缩」映射至更长的序列空间。
在注意力效率层面,FlashAttention 系列算法(由 Tri Dao 等人提出,现已演进至 FlashAttention-3)通过 IO 感知的分块计算(tiling),将注意力矩阵分割成小块在 GPU 的 SRAM(片上高速缓存)中计算,避免了将完整 n×n 注意力矩阵写入 HBM(高带宽显存),将注意力层的显存复杂度从 O(n²) 降至 O(n),同时大幅提升计算吞吐量,是长上下文工程实现中不可或缺的底层算子优化。Kimi K3 的 Kimi Delta Attention 正是在上述多重工程约束下,对效率与精度进行系统性权衡的产物。

除长上下文外,Kimi K3 还具备原生多模态能力,可直接理解图片和视频内容,而非依赖外挂视觉模块。早期多模态模型(如 CLIP+GPT 的组合)采用「外挂」视觉编码器的方式,将图像特征转换为向量后拼接至文本序列,存在模态对齐质量有限、视觉细节丢失等缺陷。「原生多模态」指在预训练阶段即同步处理图文乃至视频数据,使视觉 Token 与文本 Token 在同一注意力机制中交互——Google 的 Gemini 系列是这一路径的代表作,其从预训练起便以图文音视频混合数据进行训练,而非在文本基座模型上后接视觉适配器。这种深度融合理论上能带来更强的跨模态理解表现,但训练复杂度和数据对齐难度也成倍上升,尤其是视频数据的 Token 化(如何将连续帧压缩为有效的视觉 Token 序列)本身就是尚未完全解决的研究课题。
此外,Kimi K3 内置常开的思考模式(always-on thinking mode),模型在生成回答前默认进行推理链条的思考过程,而非仅在特定场景下触发。这一设计契合当前业界对「推理型模型」的探索趋势(以 OpenAI o1/o3、DeepSeek-R1 为代表),有助于提升复杂任务的准确率。区别于按需触发的「慢思考」,常开模式意味着所有请求均默认消耗更多 Token 用于中间推理过程,这对推理成本和延迟控制提出了更高要求。
两项自研架构创新
Kimi K3 的性能提升并非单纯依靠参数堆叠,其底层引入了两项值得关注的自研架构创新。
混合线性注意力(Kimi Delta Attention)
第一项创新是 Kimi Delta Attention,一种混合线性注意力机制。传统自注意力机制在处理超长序列时,计算复杂度随序列长度平方增长(O(n²))——对于 100 万 Token 的序列,这意味着需要处理 10¹² 量级的注意力权重,在现有硬件上几乎不可行。
线性注意力的核心思想是用核函数 φ(q)·φ(k)^T 来近似 softmax(qk^T/√d),从而将注意力矩阵的计算从 O(n²d) 降至 O(nd²)。这一思路由 Katharopoulos 等人在 2020 年的论文《Transformers are RNNs》中系统化,此后衍生出 Performer(随机特征映射)、RetNet(循环与并行双模态)、Mamba(结构化状态空间模型 SSM)等一系列工作。然而,线性注意力的「阿喀琉斯之踵」在于其等效于一个固定容量的循环记忆,对于需要精确检索特定历史 Token 的任务(如 needle-in-a-haystack 测试),表现往往不及标准注意力。这一局限的本质在于:线性注意力将所有历史信息压缩进一个固定大小的「记忆矩阵」,不可避免地造成信息损耗,而标准注意力可直接访问序列中任意位置的原始 Token 表示。
正因如此,混合架构成为工业落地的主流选择:Mistral 的 Jamba、苹果的 OpenELM 以及谷歌的 Gemini 1.5 均采用了「部分层用标准注意力、其余层用线性注意力或 SSM」的混合策略。Kimi Delta Attention 同样采用「混合」策略,在部分层保留标准注意力以平衡效率与精度——这是当前业界探索长上下文的主流工程路径,也是 Kimi K3 实现 100 万上下文的关键技术支撑。

注意力残差(Attention Residuals)
第二项创新是用 Attention Residuals 替代传统的残差连接(residual connection)。残差连接由何恺明等人在 2015 年的 ResNet 论文中提出,核心思想是在层与层之间添加跳跃连接(skip connection),其数学形式极为简洁:H(x) = F(x) + x,即输出等于子层变换加上输入的恒等映射。这一「加法捷径」使梯度在反向传播时可绕过非线性变换直接回传,将可稳定训练的网络深度从数十层推至超过千层,从根本上解决了深层网络训练中的梯度消失问题。ResNet 在图像分类领域的成功,使残差连接迅速成为深度学习的通用范式,被直接移植到 Transformer 架构中。在 Transformer 中,Pre-LN(层归一化前置)配合残差连接已成为训练稳定性的标准配方,几乎所有主流大语言模型均沿用这一设计。
然而,恒等映射残差存在一个内在局限:它假设相邻层的信息应以相同权重叠加,缺乏动态调节能力。Attention Residuals 是对这一结构的重新思考——用注意力机制本身来建模层间的残差关系,让模型自主学习「哪些历史层的信息应以多大权重传递至当前层」,理论上可使深层网络在信息传递时保留更丰富的上下文依赖,而非仅做简单的恒等映射。类似的思路也出现在 Highway Networks(通过门控机制控制信息流量)和 DenseNet(将所有前层输出拼接传入当前层)中,但将注意力机制直接嵌入残差路径,在万亿参数量级上的实证验证目前仍属稀缺。在万亿参数规模上验证这一创新尤为不易,因为任何架构改动都可能在大规模训练中被放大为不稳定因素——训练数万亿 Token 的成本意味着试错空间极为有限。月之暗面能够在此规模上成功落地,说明其团队在基础架构研究上具备扎实的工程实力。
基准测试表现亮眼
在多项权威基准测试中,Kimi K3 展现出强劲竞争力:
- 在 GDeepWall 基准上排名全球第三;
- 在私有的 AI Briefcase 基准上排名全球第二;
- 在前端编程盲测中,表现甚至超越 Fable 5 和 GPT 5.6。

前端编程能力超越顶级闭源模型尤为值得关注。前端 UI 与交互代码的生成,对模型的多模态理解(理解设计稿与视觉规范)、逻辑推理和长上下文能力要求极高,是综合考验模型能力的复合型任务。Kimi K3 能在盲测中胜出,一定程度上验证了其架构创新与规模优势的实际价值。
不过,理解这些跑分成绩时需要具备一定的基准测试素养。主流学术基准如 MMLU(大规模多任务语言理解,涵盖 57 个学科领域)、HumanEval(代码生成)、GSM8K(小学数学推理)等,因其题库公开,已被大量模型在训练数据中「见过」,导致跑分虚高、泛化性存疑——这一现象被研究者称为「基准污染」(benchmark contamination)或「数据泄露」。斯坦福 HELM 项目的研究发现,部分模型在公开基准上的得分与实际用户体验存在显著落差,根本原因正在于此。更隐蔽的问题是「间接污染」:即便训练数据不直接包含基准题目,大量包含相关知识点的网页文本同样可能使模型「过拟合」于特定基准的题型分布。
为应对这一问题,LiveBench(每月更新题目、确保训练截止日期后生成)、LMSYS Chatbot Arena(基于真实用户 A/B 偏好投票的 ELO 排名体系)等动态更新或基于真实用户偏好投票的评测体系逐渐获得社区认可,被视为比静态基准更能反映模型实际能力的评估方式。文中提到的 GDeepWall 和 AI Briefcase 均属私有或较新基准,其题目分布、评分标准和防污染机制尚未经过充分的社区审查。盲测结果仍有待更多第三方复现佐证,读者可保持理性期待。
开放时间与定价策略
Kimi K3 的完整模型权重将于 7 月 27 日对外开放。在定价上,月之暗面选择对标 Claude Sonnet:
- 输入:每百万 Token 3 美元;
- 输出:每百万 Token 15 美元。

以对标 Claude 的定价,同时提供开放权重,月之暗面实际上向市场传递了一个清晰信号:一个既可自托管、又支持 API 调用,且性能追平前沿的大模型正在成为现实。这一定价策略的可行性,恰好与 MoE 架构的稀疏激活特性高度吻合——较低的实际推理算力消耗,为商业上的激进定价提供了支撑空间。值得注意的是,输出 Token 定价(15 美元/百万)是输入定价(3 美元/百万)的五倍,这一比例在业界颇为标准,反映了 LLM 推理的底层经济学:自回归解码阶段(生成 Token)需要逐 Token 串行计算,无法像预填充阶段(处理输入 Token)那样高度并行化,因此单位算力成本显著更高。
开源前沿的新里程碑
Kimi K3 的发布,或许标志着开源大模型正式迈入万亿参数时代,并在多个关键能力维度上逼近乃至超越顶级闭源模型。对开发者社区而言,这意味着更多自主可控的选择;对整个 AI 行业而言,也再次印证了开源力量正在快速缩小与闭源巨头的差距。
当然,2.8 万亿参数模型的实际部署门槛(单模型推理所需的显存与带宽需求极为可观——保守估计,在 FP8 精度下完整加载模型权重本身即需约 2.8TB 显存,这意味着需要数十乃至上百张 H100 协同工作)、推理成本以及各项跑分的可复现性,仍有待社区在权重开放后进一步检验。无论如何,Kimi K3 都值得持续关注。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。