[控场AI]
概念Mixture of Experts / MoE架构 / 稀疏MoE

MoE

混合专家模型(Mixture of Experts,MoE)是一种机器学习架构范式,由多个专门化的子网络(称为"专家")和一个门控路由机制组成。在处理每个输入时,路由机制仅激活其中少数专家,而非全部参数,从而在保持模型整体容量的同时显著降低单次推理的计算量。MoE广泛应用于大规模语言模型和深度学习系统,是提升模型规模与计算效率之间平衡的重要技术路径。

核心事实

时间轴 (近 90 天)

6月3日

DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优

待验证70%
6月3日

智谱AI发布了GLM 4.6,采用混合专家(MoE)架构优化

已验证65%
6月2日

MOE架构只激活部分专家网络,在保持模型容量的同时提高计算效率

待验证60%
6月2日

当前主流大模型架构分为Dense(稠密)架构和MOE(混合专家)架构两种

待验证85%
6月1日

混合专家架构最早由Jacobs等人在1991年提出,但直到2022-2024年才在大语言模型领域大规模应用

待验证85%
6月1日

月之暗面的Kimi-K2.5采用了万亿参数MoE架构

待验证80%
6月1日

Kimi系列模型底层架构采用了混合专家模型(MoE)设计

待验证70%
6月1日

Gemini 2.5 Flash采用了混合专家(Mixture of Experts, MoE)架构,在推理时只激活部分参数

待验证80%
6月1日

V4-Pro采用混合专家(MoE)架构,总参数量达到1.6万亿(1.6T),活跃参数为490亿(49B)

待验证95%
6月1日

多模型协作架构与混合专家模型(MoE)有本质区别:MoE是模型内部架构,多模型协作是系统级的多模型编排

待验证90%

还有 40 条时间轴事件

全部知识事实 (8)

来源文章