共 5 篇相关文章

深入解析稠密模型与 MoE 混合专家模型的核心区别:激活参数、总参数、吞吐量各有何差异?结合 NVIDIA Nemotron 3.5 Lightning 案例,给出实用的模型选型建议。

本文解析如何在 JAX 框架中借助 NVIDIA Transformer Engine 加速 Dropless MoE 训练,涵盖 MoE 架构原理、token 丢弃问题、FP8 低精度与分组 GEMM 优化等关键技术。

DeepSeek-V4.1-Flash 正式登陆 Fireworks 平台,这是一款 552B 参数的 MoE 模型,专为编程、网络安全和智能体打造,官方称其在多项基准上以 1/40 成本超越 Opus 5 与 GPT-5.6。
观点碰撞深度解析Scaling Law从Kaplan到Chinchilla再到MoE时代的演进历程,探讨为什么盲目堆参数是误区,以及GLM-5.3如何通过后训练证明扩展存在多个旋钮。
深度解读深度解析微软开源Tutel MoE优化库,支持FP8、NVFP4、MXFP4多精度计算,适配DeepSeek、Kimi-K2、Qwen3等主流MoE模型,解决All-to-All通信瓶颈与显存管理难题。