待验证50% 置信基准精确时间
GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证在4张B200上运行gpt-oss-120b纯预填充测试中,DWDP4在MNT 32K/ISL 32K配置下相比DEP4达到1.92倍加速,饱和状态下实现506K对329K tok/s(1.54倍)吞吐提升70% 相似待验证实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒70% 相似待验证在16G显存下部署Qwen3 27B,若部分权重被卸载到内存(offload),速度会从几十T/s骤降到个位数69% 相似待验证GPT-OSS 20B推理仅需16G显存,微调仅需24G显存68% 相似待验证GPT-4级别模型的首Token延迟(TTFT)可达500-2000ms,而Llama 3.1 8B等小模型TTFT可低至100-300ms68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/897566API
curl https://kongchang.com/api/v1/knowledge/claims/897566MCP
get_claim(id=897566)