[控场AI]
概念HiSparse / Sparse MLA / 稀疏MLA

Hybrid HiSparse

vLLM社区提出的长上下文推理优化方案,基于稀疏MLA(Sparse Multi-head Latent Attention)与分级内存调度,将冷KV Cache页面下放至主机内存,在不增加硬件的情况下大幅提升并发能力

来源文章