待验证50% 置信事实精确时间
谷歌2021年发布的Switch Transformer将MoE大规模应用于Transformer语言模型,将模型容量扩展至万亿参数级别
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
待验证Switch Transformer将专家数量扩展至2048个,2022年谷歌GLaM模型进一步验证了MoE在多任务泛化上的优势83% 相似待验证Switch Transformer 由 William Fedus 等人于2021年提出,首次将 MoE 扩展到万亿参数规模73% 相似待验证Gshard(2020)首次实现了万亿参数MoE模型的分布式训练,Switch Transformer(2022)将每个token的路由选择收敛为单一专家70% 相似待验证Transformer架构于2017年问世后,谷歌、OpenAI、Meta等机构几乎在同一年内各自完成了基于该架构的大型语言模型预研70% 相似待验证Universal Transformer于2018年提出,将同一个Transformer块反复应用于输入序列69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/536153API
curl https://kongchang.com/api/v1/knowledge/claims/536153MCP
get_claim(id=536153)