待验证50% 置信事实精确时间
传统 LLM 推理中因需按最大长度预留显存,KV Cache 的实际利用率通常不到 30%
1
来源数
50%
置信度
长期有效
时效性
2026/8/11
首次发现
来源
相关事实
待验证传统KV Cache分配方案因按最大序列长度预分配连续显存块,导致平均显存利用率仅20%-40%70% 相似待验证LLM新模型的平均评估指标可能优于旧模型,但会在小众关键场景中出现退化68% 相似待验证传统推理框架中每个请求的 KV Cache 需预分配等长连续显存,显存利用率通常仅有 20%-40%,PagedAttention 可将其提升到接近 100%67% 相似待验证如果模型跑BF16训练但DCGM_FI_PROF_PIPE_TENSOR_ACTIVE指标长期低于30%,基本可以断定算力被严重浪费66% 相似待验证Research shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/731311API
curl https://kongchang.com/api/v1/knowledge/claims/731311MCP
get_claim(id=731311)