开源大模型T时代:四大厂商集体突破万亿参数

从B到T:一场悄然完成的数量级跃迁
如果说前几年国产开源大模型还在以"数百亿参数"为荣,那么进入2025年,故事的量纲已经彻底改变。从B(十亿级)到T(万亿级),中国开源模型只用了大约18个月,就完成了一次令人瞠目的数量级跳跃。
这轮爆发并非某一家公司的孤军突进,而是月之暗面、阿里、深度求索(DeepSeek)、美团四家几乎同时撞线万亿参数的"集体现象"。这背后传递的信号,远比单纯的数字增长更值得玩味——它意味着万亿级模型的训练能力,正在从"稀缺特权"变成"行业标配"。
值得注意的是,多家公司在相近时间窗口内同步突破同一技术门槛,在AI发展史上并非首次。2017年Transformer架构问世后,谷歌、OpenAI、Meta等机构几乎在同一年内各自完成了基于该架构的大型语言模型预研。Transformer由谷歌团队在论文《Attention Is All You Need》中提出,其核心创新是以自注意力机制(Self-Attention)替代了此前主流的循环神经网络(RNN/LSTM),实现了序列数据的并行处理。自注意力机制的本质是让模型在处理序列中每一个位置时,能够动态地"关注"序列中所有其他位置,并根据相关性加权融合信息——这不仅消除了RNN在处理长序列时因逐步传递信息而产生的梯度消失问题,更关键的是使整个序列的计算可以完全并行化,极大地提升了GPU利用率,为后续千亿乃至万亿参数的规模化训练奠定了工程基础。2023年的"开源LLM元年"中,Meta LLaMA发布后数月内,全球涌现出数十个基于其微调的衍生模型。这种"集体涌现"现象的底层逻辑在于:核心技术突破一旦以论文或技术报告的形式公开,便成为全行业的公共知识。有能力的玩家会在相近的时间完成工程复现与超越。2025年中国四家公司的万亿参数集体爆发,正是这一规律的又一次印证——DeepSeek V3的技术报告与训练方法论的公开,在一定程度上为后来者提供了重要的工程参考。

说个细节,这种增长不是渐进式的"挤牙膏",而是实打实的"跳台阶"。半年前还在600多亿参数量级徘徊的头部选手,转眼就被翻倍甚至翻数倍的新品甩在身后。参数竞赛的节奏,正在以季度为单位刷新。
四家撞线:万亿参数俱乐部的入场顺序
月之暗面:第一个撞线者
月之暗面发布 Kimi K2,参数量达到1T,率先跨入万亿门槛。就在此前半年,国内开源标杆 DeepSeek V3 也不过600多亿参数。Kimi K2 这一脚油门,直接把中国开源模型的参数上限翻了近一倍,极具象征意义。
此后月之暗面并未停步。后续的 Kimi K3 一度冲到2.8T,刷新了当时的最高纪录,稳坐参数量榜首。
阿里千问:MoE架构下的高效扩张
阿里千问三 Max 突破万亿参数,成为第二家跻身T级的厂商。与单纯堆砌参数不同,千问采用 MoE(混合专家)架构,通过更高效的激活参数机制来平衡规模与推理成本。
MoE(Mixture of Experts,混合专家)架构是一种稀疏激活的神经网络设计范式。其核心思想是:模型虽然拥有海量参数,但在处理每一个输入token时,只激活其中一小部分"专家"子网络(通常为总专家数的1/8到1/16),而非让所有参数同时参与计算。这种机制使得模型可以在参数总量极大的同时,将实际推理的计算量(FLOPs)控制在相对合理的范围内。架构中的路由机制(Router)是其核心组件,负责在每个token处理时动态决定激活哪些专家网络——其本质是一个轻量级的分类器,通常以softmax函数输出各专家的激活概率,并取Top-K个专家参与计算。训练MoE模型面临"专家负载均衡"这一独特挑战:若路由机制设计不当,部分专家会被过度使用而其余专家几乎闲置,不仅造成参数浪费,还会因数据分发不均而拖慢分布式训练的整体吞吐量。DeepSeek V3引入了辅助损失函数(Auxiliary Loss)来惩罚负载不均的路由行为,从而缓解这一问题。其671B参数中每次推理实际激活的参数约为37B,正是MoE架构"大模型、小计算"特性的典型体现。阿里千问采用MoE路线,意味着其万亿参数并不等同于万亿参数的全量计算开销,而是在"规模感知"与"推理效率"之间寻求平衡。
一个耐人寻味的细节是:从千问三 Max 的1T到后续版本的2.4T,短期内参数量再次翻倍,而中间的若干迭代版本,阿里压根没有公布参数量。保密本身就是一种信号——不公布,往往说明在憋更大的突破。

在竞争白热化的当下,参数量已经成为品牌叙事和话语权争夺的重要筹码,此次选择公开,大概率是"被抢了风头"。
DeepSeek:从671B到1.6T的三倍跃升
作为国产开源的旗帜性玩家,DeepSeek V3 曾以671亿参数引领行业,新一代产品据称直接推出1.6T规模,翻了近三倍。DeepSeek 的每一次更新都牵动行业神经,大幅扩容也进一步抬高了整个赛道的天花板。
需要指出的是,参数量的飞跃并非自动等同于能力的同步提升。这一问题的理论根源可以追溯到2020年OpenAI提出的"Scaling Law"(规模定律),该研究表明模型性能与参数量、训练数据量、计算量之间存在可预测的幂律关系——简言之,更大的模型在足够数据和算力的支撑下,性能会稳定且可预测地提升。然而2022年DeepMind发布的Chinchilla研究对此进行了重要修正:通过对400余个不同参数量与训练数据量组合的系统性实验,研究者证明在固定算力预算下,将参数量与训练token数保持约1:20的比例才能达到最优效率。具体而言,700亿参数的模型需要约1.4万亿token的训练数据才能充分发挥其容量上限。Chinchilla以仅700亿参数(远小于2800亿参数的Gopher)在多项基准上超越了后者,从根本上动摇了"唯参数论"的行业认知,并催生了此后LLaMA系列"小模型、多数据"的技术路线。因此,从671B到1.6T的参数跃升,其实际能力增益还需配合同步扩大的训练语料与算力投入才能真正兑现。单纯堆砌参数而训练数据不足,会导致模型"大而不强"。
美团:外卖公司的"意外"参战
最出人意料的入局者是美团。这家以外卖著称的公司,其大模型 Longcat 2.0 据称达到1.8T——参数规模甚至超过 DeepSeek 的旗舰产品。

美团的参战说明了一件事:大模型的军备竞赛早已溢出传统AI公司的范畴,任何拥有充足算力、数据和场景需求的巨头,都可能成为万亿参数俱乐部的新成员。事实上,美团拥有覆盖数亿用户的本地生活场景数据,这些高质量的领域数据恰恰是训练具备实用价值的垂直大模型的核心资产,也是其有底气入局万亿参数竞赛的重要基础。
下一波是谁:智谱与MiniMax的追赶
除了已跻身T级俱乐部的四家,下一批候选者同样值得关注。
智谱 GLM:稳扎稳打的"舒适区"打法
智谱的 GLM 系列走了一条与众不同的路。从 GLM4.5 到4.7,在358B这个参数规模上连续打磨三代,稳扎稳打、不急不躁;随后 GLM5 一次性翻倍至754B。

连续多代卡在同一量级,说明700多B是智谱当前的技术"舒适区";而近期迭代速度的加快,则暗示下一代冲击万亿参数的概率极大。综合来看,智谱是最有希望率先补位的"准T级"选手。
MiniMax:小步快跑的追赶者
MiniMax 节奏同样迅猛:M2为229B,M3直接跳至427B,翻了近一倍;期间还通过 M2.1、M2.5、M2.7 等系列小版本快速迭代,再一步跃升至 M3。不过就当前进度而言,冲进T级别的概率仍略逊于智谱。
T时代为何是必然:生态能力的集体成熟
回看这18个月的参数曲线:开源最强不过数百亿参数,突破1T,最新已见2.8T。关键在于,这不是某一家公司的"灵光一现",而是月之暗面、阿里、DeepSeek、美团的"集体涌现"。
这种同步性揭示了一个更深层的事实:万亿参数对中国开源模型而言,已不再依赖天才团队的偶然突破,而是整个生态工程能力全面就位的结果——人才够了、算力够了、数据够了、方法论也成熟了。当这些要素同时到位,T时代就不是一道"选择题",而是历史的"必然"。
冷思考:参数狂欢背后的部署难题
然而,热闹的参数竞赛也需要一盆冷水。模型虽然开源,但真正能部署落地的有几个?
这里有一个常被忽视的"开源鸿沟"问题。在大模型语境下,开源通常指模型权重文件公开可下载,但这与传统软件开源存在本质差异。一个1T参数的模型,以常见的BF16精度存储需要约2TB显存,即便采用INT4量化压缩也需要500GB以上;目前单张高端GPU(如H100 80GB)的显存上限为80GB,这意味着部署一个万亿参数模型至少需要数十张高端GPU组成的推理集群,单次部署成本保守估计在数百万元人民币以上。值得注意的是,推理时还需额外分配KV Cache(键值缓存)用于存储注意力机制的中间状态——其本质是将已计算过的Key和Value矩阵缓存下来,避免在自回归生成时对历史token进行重复计算,以此换取推理速度的大幅提升。然而其代价是显存占用随上下文长度线性增长:对于万亿参数模型而言,处理数万token的长上下文时,KV Cache的显存开销甚至可能超过模型权重本身。当前缓解这一问题的主要技术路径包括:模型量化(将BF16压缩为INT8/INT4,以精度换显存)、张量并行(将模型权重按维度切分至多卡同时计算)、流水线并行(按层切分至多节点顺序处理)、以及推测解码(Speculative Decoding,用小模型草稿+大模型验证的方式提升吞吐量)等。这与"开源=人人可用"的朴素认知之间,存在巨大落差。
万亿参数意味着惊人的推理成本和硬件门槛。对绝大多数中小团队和个人开发者而言,这些"开源"模型在实际落地层面依然遥不可及。云端API服务(如通过阿里云、火山引擎等平台调用)是目前中小团队接触万亿参数模型能力的最现实路径,但这也意味着真正的"本地可控部署"对绝大多数主体仍是奢望。参数量的军备竞赛固然提升了国产大模型的能力上限,但开源的真正价值在于可用性与可及性,而非单纯的数字标签。真正意义上的开源普惠,有赖于模型蒸馏、量化推理、云端API等配套生态的同步成熟。
当行业为"T时代"欢呼时,或许更该冷静追问:算力是否够用?能力是否真的与参数同步提升?普通用户能否从中受益?万亿参数是一个重要里程碑,但绝不是终点——下一阶段的竞争,很可能从"谁更大"转向"谁更好用、更省"。
核心要点
- 数量级跃迁:中国开源大模型在约18个月内从数百亿参数跨越至万亿级,这一速度在全球AI发展史上极为罕见,背后是人才、算力、数据、方法论四大要素的集体成熟。
- 集体涌现规律:月之暗面、阿里、DeepSeek、美团四家几乎同步突破万亿参数,印证了"核心技术方法论公开后,有能力的玩家会在相近时间完成超越"这一历史规律。
- MoE是关键架构:万亿参数竞赛的主角几乎都采用了MoE(混合专家)架构,其稀疏激活特性使得超大规模参数与可接受的推理计算量得以共存,是当前训练超大模型的核心技术路径。
- 参数≠能力:Chinchilla研究早已证明,参数量的增长必须配合充足的训练数据(约1:20比例)才能真正转化为能力提升,单纯的参数竞赛存在"大而不强"的风险。
- 开源鸿沟仍然存在:万亿参数模型的开源与可用之间存在巨大工程鸿沟——部署一个1T参数模型至少需要数百万元的硬件投入,真正的开源普惠有赖于量化、蒸馏、云端API等配套生态的同步成熟。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。