KV缓存(Key-Value Cache)是大语言模型推理中的一种优化机制,用于存储注意力计算过程中已生成的键(Key)和值(Value)张量。通过复用历史计算结果,避免对已处理token的重复运算,从而显著降低自回归生成时的计算量,提升推理效率。广泛应用于Transformer架构模型的部署与加速场景。
在有限显存条件下,用户需要在模型大小和可用上下文长度之间做出权衡
KV缓存的大小随上下文长度线性增长,处理更长文本时显存消耗会显著增加
KV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源
推理优化技术包括量化(Quantization)、批处理(Batching)、KV缓存(Key-Value Cache)和推测解码(Speculative Decoding)
KV缓存的大小与上下文长度线性增长,Qwen 2.5 32B 在64K上下文下的KV缓存可能额外占用数GB内存