Prompt Cache
大模型推理中对重复上下文(系统提示、代码库背景、对话历史)进行缓存复用的机制,是KV Cache的服务端延伸,可显著降低成本和首字延迟
时间轴 (近 90 天)
对于系统提示词较长或反复使用相同文档的Agent应用,将高频重复部分稳定出现在请求开头可提高缓存命中率、利用低价档位
当前主流模型的Prompt Cache定价中,缓存写入约为标准价格的1.25倍,缓存读取约为0.1倍
Prompt Cache操作的是Prefill阶段的计算,砍掉重复的前缀计算,但无法省略Decode的生成
Prompt Cache失效的五大原因包括共享前缀不够长、计算身份不一致、缓存已被驱逐、路由未命中、Decode占大头
Agent设计prompt时应按稳定性光谱排列,工具定义和系统规则放最前,知识库快照放中间,对话历史和用户问题放最后,以最大化缓存复用
缓存命中标准是完全相同的token前缀加上完全相同的计算身份,计算身份包括Tokenizer、Chat Template、模型和权重版本、原始多模态输入等
Claude 的缓存读取定价约为标准输入价格的 2.5%
全部知识事实 (7)
对于系统提示词较长或反复使用相同文档的Agent应用,将高频重复部分稳定出现在请求开头可提高缓存命中率、利用低价档位
50%待验证当前主流模型的Prompt Cache定价中,缓存写入约为标准价格的1.25倍,缓存读取约为0.1倍
50%待验证Prompt Cache操作的是Prefill阶段的计算,砍掉重复的前缀计算,但无法省略Decode的生成
50%待验证Prompt Cache失效的五大原因包括共享前缀不够长、计算身份不一致、缓存已被驱逐、路由未命中、Decode占大头
50%待验证Agent设计prompt时应按稳定性光谱排列,工具定义和系统规则放最前,知识库快照放中间,对话历史和用户问题放最后,以最大化缓存复用
50%待验证缓存命中标准是完全相同的token前缀加上完全相同的计算身份,计算身份包括Tokenizer、Chat Template、模型和权重版本、原始多模态输入等
50%待验证Claude 的缓存读取定价约为标准输入价格的 2.5%
50%