概念Multi-head Latent Attention
MLA
DeepSeek设计的多头潜在注意力机制架构,DSpark投机解码算法针对该架构特点进行了专项工程优化
时间轴 (近 90 天)
8月26日
DeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍
待验证50%
DeepSeek设计的多头潜在注意力机制架构,DSpark投机解码算法针对该架构特点进行了专项工程优化
DeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍