[控场AI]
模型

Switch Transformer

Switch Transformer是由Google提出的基于混合专家(Mixture of Experts,MoE)架构的大规模语言模型。其核心设计是将传统Transformer中的前馈网络替换为多个专家网络,并通过路由机制在每次前向传播时动态选择激活少量专家,从而在保持计算效率的同时大幅扩展模型参数规模。该模型验证了MoE架构在自然语言处理领域的有效性,为稀疏激活模型的研究提供了重要参考。

核心事实

时间轴 (近 90 天)

8月25日

Switch Transformer(2021年)每个token只路由到单一专家(top-1 routing)

待验证50%
7月24日

MoE(混合专家)的核心思想可追溯至1991年Jacobs等人提出的早期混合专家框架,谷歌2021年的Switch Transformer将其推入大规模语言模型时代

部分验证65%
7月2日

以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择

待验证50%
6月1日

Google的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表

已验证75%
6月1日

MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流

已验证80%

全部知识事实 (5)

来源文章