待验证50% 置信事实精确时间
Google 的 Switch Transformer 和 Mixtral 采用了混合专家模型(MoE)思想,通过门控网络将输入路由到不同专家子网络并只激活部分参数
1
来源数
50%
置信度
长期有效
时效性
2026/8/18
首次发现
来源
相关事实
已验证混合专家架构(MoE)由Google Brain于2017年在Transformer框架下规模化应用,核心思想是将模型参数分组为多个专家子网络,每次推理仅激活其中一小部分78% 相似已验证MoE(混合专家)的核心思想可追溯至1991年Jacobs等人提出的早期混合专家框架,谷歌2021年的Switch Transformer将其推入大规模语言模型时代74% 相似已验证以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择73% 相似已验证谷歌2021年发布的Switch Transformer通过将路由简化为Top-1选择并引入专家容量机制缓解负载不均衡问题72% 相似已验证Google在Switch Transformer中大规模验证了Mixture of Experts(MOE)架构70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/766339API
curl https://kongchang.com/api/v1/knowledge/claims/766339MCP
get_claim(id=766339)