待验证50% 置信事实精确时间
Prompt缓存(KV Cache)在相同系统提示多次使用时可复用缓存的KV矩阵,通常将延迟降低40-60%、成本降低50-90%
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?
bilibiliAI-seeker2026/7/9
相关事实
待验证Prompt Caching通过复用相同前缀的KV Cache跳过重复计算,降低延迟和Token费用80% 相似待验证量化KV Cache(压缩为INT8或INT4)可将缓存内存降低50-75%,但主流推理框架支持成熟度参差不齐77% 相似待验证传统KV缓存实现预先分配最大长度连续显存块,导致平均60%-80%的预分配内存被浪费76% 相似待验证MLA通过将KV矩阵压缩为低维潜在向量缓存,理论上可将KV Cache显存占用降低至标准MHA的5%至13%73% 相似待验证提示词缓存通过在服务器端保存已计算的 KV 矩阵,将重复前缀的处理从 O(n²) 降低至 O(1) 的缓存读取,可实现高达90%的延迟和成本压缩72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/461657API
curl https://kongchang.com/api/v1/knowledge/claims/461657MCP
get_claim(id=461657)