SGLang
SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。
时间轴 (近 90 天)
推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额
SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码
SGLang引入权重缓存守护进程,为每张GPU保留权重,使重启引擎从缓存而非存储恢复以缩短故障恢复时间
该加载优化通过环境变量SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D开启,默认关闭
GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升
SGLang引入会话引用感知的统一Radix缓存,请求可携带session_id使缓存淘汰识别活跃会话仍引用的前缀,通过/close_session释放引用
在MI355X上通过移除不必要的专家填充,DeepSeek-V4的FP4 MoE模型权重从159.07 GB降至112.36 GB
SGLang推出DWDP(分布式权重数据并行)预填充并行策略,通过NVLink P2P预取对等专家权重并在本地计算,消除EP的全对全token分发开销
还有 31 条时间轴事件
全部知识事实 (20)
推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额
50%待验证SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
50%待验证在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
50%待验证SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码
50%待验证SGLang引入会话引用感知的统一Radix缓存,请求可携带session_id使缓存淘汰识别活跃会话仍引用的前缀,通过/close_session释放引用
50%待验证在MI355X上通过移除不必要的专家填充,DeepSeek-V4的FP4 MoE模型权重从159.07 GB降至112.36 GB
50%待验证该加载优化通过环境变量SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D开启,默认关闭
50%待验证通过在H2D前将CPU权重视图复制到连续存储,完整模型加载时间从约35分钟降至6分20秒,实现5.6倍加速
50%待验证SGLang v0.5.17提供对Kimi K3和MiniMax-H3等前沿模型的零日(day-0)支持
50%待验证SGLang v0.5.17引入原生Rust服务层,包含分词管理器、入口验证、OpenAI兼容API服务器以及PD分离支持,以解决Python GIL瓶颈
50%待验证Kimi K3的SGLang支持已在NVIDIA GB300和AMD MI35x上完成验证
50%待验证GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升
50%待验证SGLang引入权重缓存守护进程,为每张GPU保留权重,使重启引擎从缓存而非存储恢复以缩短故障恢复时间
50%待验证SGLang推出DWDP(分布式权重数据并行)预填充并行策略,通过NVLink P2P预取对等专家权重并在本地计算,消除EP的全对全token分发开销
50%待验证SGLang 项目由 sgl-project 团队维护
50%待验证SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求
50%待验证RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量
50%待验证SGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎
50%待验证SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算
50%待验证SGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架
50%