待验证50% 置信事实精确时间
对于典型 7B 参数模型,每 1K token 的 KV Cache 约需 0.5–1GB 显存
1
来源数
50%
置信度
长期有效
时效性
2026/7/23
首次发现
来源
相关事实
待验证以7B参数模型为例,每增加1K Token 的上下文约消耗 0.5~1 GB 显存83% 相似待验证VRAM 成为本地 LLM 上下文瓶颈的根本原因在于 KV Cache 机制,7B 模型每 1K token 的 KV Cache 约需 0.5–1GB 显存77% 相似待验证对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存76% 相似已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB76% 相似待验证对于拥有32层、32头注意力的典型7B模型,每个token需约0.5MB显存存储KV Cache,生成1000个token则需额外约500MB显存74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/596123API
curl https://kongchang.com/api/v1/knowledge/claims/596123MCP
get_claim(id=596123)