待验证50% 置信基准精确时间
13B-14B级别模型(4-bit量化)在该配置下速度下降到每秒2-5个token
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证4根内存插槽全插会显著降低可达频率(俗称四条掉速),插满4条16G通常只能跑到DDR5-5600左右,追求高频高容量应选2条32G的套装而非4条16G73% 相似待验证8G显存运行27B模型依赖低比特量化与部分参数卸载策略,推理速度可能受限,追求速度的用户建议选择16G及以上显存版本72% 相似待验证在4张B200上运行gpt-oss-120b纯预填充测试中,DWDP4在MNT 32K/ISL 32K配置下相比DEP4达到1.92倍加速,饱和状态下实现506K对329K tok/s(1.54倍)吞吐提升72% 相似待验证在64GB内存下,30B~34B参数模型在Q4量化下可以流畅运行,70B模型在Q4下勉强可行但响应速度明显下降72% 相似待验证140GB的FP16 70B模型经4-bit量化后可压缩至约35-40GB,通信开销降低约75%;2-bit量化可压缩至约18GB但带来精度损失72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/915532API
curl https://kongchang.com/api/v1/knowledge/claims/915532MCP
get_claim(id=915532)