已验证65% 置信权衡取舍精确时间
分层加载导致推理速度受限,其根本原因是 PCIe 总线带宽(PCIe 4.0 理论带宽约 32GB/s)远低于 GPU 内部显存带宽
3
来源数
65%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证大模型推理速度往往不受限于算力(FLOPS),而受限于内存带宽;PCIe 4.0 x16理论带宽约32GB/s,GPU显存带宽(GDDR6X约1TB/s)相差30倍以上84% 相似待验证PCIe 4.0 x16带宽约64GB/s,且每次传输需要显式的cudaMemcpy调用,在推理延迟敏感场景中是显著瓶颈83% 相似已验证PCIe 4.0 x16的理论带宽约为32GB/s81% 相似待验证PCIe万兆网卡多需PCIe x4插槽带宽,插在x1槽会限速;选购前确认主板有空闲x4及以上物理槽位与足够lane81% 相似待验证PCIe万兆网卡需要至少PCIe 2.0 x4或3.0 x2带宽,插在x1插槽会被限速无法跑满万兆,安装前确认主板插槽物理与带宽规格79% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/563112API
curl https://kongchang.com/api/v1/knowledge/claims/563112MCP
get_claim(id=563112)