[控场AI]
产品

SGLang

SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。

时间轴 (近 90 天)

9月12日

推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额

待验证50%
9月11日

SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%

待验证50%
9月11日

在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准

待验证50%
9月11日

SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码

待验证50%
9月11日

SGLang引入权重缓存守护进程,为每张GPU保留权重,使重启引擎从缓存而非存储恢复以缩短故障恢复时间

待验证50%
9月11日

该加载优化通过环境变量SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D开启,默认关闭

待验证50%
9月11日

GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升

待验证50%
9月11日

SGLang引入会话引用感知的统一Radix缓存,请求可携带session_id使缓存淘汰识别活跃会话仍引用的前缀,通过/close_session释放引用

待验证50%
9月11日

在MI355X上通过移除不必要的专家填充,DeepSeek-V4的FP4 MoE模型权重从159.07 GB降至112.36 GB

待验证50%
9月11日

SGLang推出DWDP(分布式权重数据并行)预填充并行策略,通过NVLink P2P预取对等专家权重并在本地计算,消除EP的全对全token分发开销

待验证50%

还有 31 条时间轴事件

全部知识事实 (20)

待验证

推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额

50%
待验证

SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%

50%
待验证

在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准

50%
待验证

SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码

50%
待验证

SGLang引入会话引用感知的统一Radix缓存,请求可携带session_id使缓存淘汰识别活跃会话仍引用的前缀,通过/close_session释放引用

50%
待验证

在MI355X上通过移除不必要的专家填充,DeepSeek-V4的FP4 MoE模型权重从159.07 GB降至112.36 GB

50%
待验证

该加载优化通过环境变量SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D开启,默认关闭

50%
待验证

通过在H2D前将CPU权重视图复制到连续存储,完整模型加载时间从约35分钟降至6分20秒,实现5.6倍加速

50%
待验证

SGLang v0.5.17提供对Kimi K3和MiniMax-H3等前沿模型的零日(day-0)支持

50%
待验证

SGLang v0.5.17引入原生Rust服务层,包含分词管理器、入口验证、OpenAI兼容API服务器以及PD分离支持,以解决Python GIL瓶颈

50%
待验证

Kimi K3的SGLang支持已在NVIDIA GB300和AMD MI35x上完成验证

50%
待验证

GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升

50%
待验证

SGLang引入权重缓存守护进程,为每张GPU保留权重,使重启引擎从缓存而非存储恢复以缩短故障恢复时间

50%
待验证

SGLang推出DWDP(分布式权重数据并行)预填充并行策略,通过NVLink P2P预取对等专家权重并在本地计算,消除EP的全对全token分发开销

50%
待验证

SGLang 项目由 sgl-project 团队维护

50%
待验证

SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求

50%
待验证

RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量

50%
待验证

SGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎

50%
待验证

SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算

50%
待验证

SGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架

50%

来源文章