共 3 篇相关文章

Miles团队联合AMD官方宣布,DeepSeek-V4 Flash强化学习训练完整迁移至AMD Instinct MI355X GPU,基于ROCm平台实现端到端稳定运行,AIME数学推理基准pass@1从0.39提升至0.49,标志着大模型训练算力生态多元化的重要突破。

AMD MI355X在运行GLM5.2大模型时实现单节点2626 tokens/秒吞吐量,总拥有成本仅为英伟达Blackwell的一半。本文深度解析这一性价比优势背后的技术逻辑、ROCm生态进展,以及对AI算力市场格局的深远影响。
行业洞察AMD Instinct MI355X通过SGLang+MoRI全栈优化,在DeepSeek-R1分离式推理中实现TCO比NVIDIA B200低5%,每GPU吞吐量高1.25倍。深度解析MoRI量化通信、KV Cache优化及推测解码等核心技术突破。