MoE
混合专家模型(Mixture of Experts,MoE)是一种机器学习架构范式,由多个专门化的子网络(称为"专家")和一个门控路由机制组成。在处理每个输入时,路由机制仅激活其中少数专家,而非全部参数,从而在保持模型整体容量的同时显著降低单次推理的计算量。MoE广泛应用于大规模语言模型和深度学习系统,是提升模型规模与计算效率之间平衡的重要技术路径。
核心事实
时间轴 (近 90 天)
DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优
智谱AI发布了GLM 4.6,采用混合专家(MoE)架构优化
MOE架构只激活部分专家网络,在保持模型容量的同时提高计算效率
当前主流大模型架构分为Dense(稠密)架构和MOE(混合专家)架构两种
混合专家架构最早由Jacobs等人在1991年提出,但直到2022-2024年才在大语言模型领域大规模应用
月之暗面的Kimi-K2.5采用了万亿参数MoE架构
Kimi系列模型底层架构采用了混合专家模型(MoE)设计
Gemini 2.5 Flash采用了混合专家(Mixture of Experts, MoE)架构,在推理时只激活部分参数
V4-Pro采用混合专家(MoE)架构,总参数量达到1.6万亿(1.6T),活跃参数为490亿(49B)
多模型协作架构与混合专家模型(MoE)有本质区别:MoE是模型内部架构,多模型协作是系统级的多模型编排
还有 40 条时间轴事件
全部知识事实 (8)
DeepSeek V4采用混合专家模型(MoE)架构
90%已验证MOE架构将模型内部划分为多个专家子网络,每次推理时由门控网络动态选择少数专家参与计算,实际激活参数量远小于总参数量
90%已验证DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数
90%已验证DeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数
80%部分验证Gemma 4的26B MOE模型采用混合专家架构,拥有260亿总参数但任意时刻仅约40亿参数处于激活状态
75%待验证DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优
70%已验证Qwen3.6 35B-A3B是混合专家架构(MoE),总参数量35B,每次推理实际激活参数量约3B
65%已验证智谱AI发布了GLM 4.6,采用混合专家(MoE)架构优化
65%