待验证50% 置信事实精确时间
Prompt Caching通过复用相同前缀的KV Cache跳过重复计算,降低延迟和Token费用
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
GPT-5.6发布:编码跑分反超竞品,推理速度提升10倍
bilibili天选嘉鲤敦赵图图2026/7/10
相关事实
待验证Prompt缓存(KV Cache)在相同系统提示多次使用时可复用缓存的KV矩阵,通常将延迟降低40-60%、成本降低50-90%80% 相似待验证上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重72% 相似待验证KV Cache(键值缓存)用于避免自回归生成时对历史 token 的重复计算,但长上下文场景下预填充阶段需占用大量 HBM 显存带宽,拉长首 token 延迟(TTFT)69% 相似待验证量化KV Cache(压缩为INT8或INT4)可将缓存内存降低50-75%,但主流推理框架支持成熟度参差不齐65% 相似待验证路由型推理服务商若将连续请求路由到不同物理节点,之前计算好的KV Cache无法被复用,可通过粘性路由或分布式KV Cache存储解决65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/493636API
curl https://kongchang.com/api/v1/knowledge/claims/493636MCP
get_claim(id=493636)