待验证50% 置信事实精确时间
Model Runner V2 在 vLLM v0.28.0 中获得了 E/P/D 分离(Encode/Prefill/Decode 解耦部署)和权重卸载两项能力
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证vLLM v0.28.0rc2引入了名为DFlash2的投机解码新特性,该特性结合了局部卷积与候选选择器两大技术组件(PR #52816)68% 相似待验证Model Runner V2(MRV2)能力扩展至非生成式工作负载,支持仅编码器注意力、序列池化、BGE-M3 池化及 CPU 上运行多模态66% 相似待验证vLLM v0.27.0 引入简化版容错框架,专为 DP+EP 外部负载均衡器部署场景设计,并提供弹性 EP 扩展的异步准备能力66% 相似待验证vLLM v0.28.0 在推测解码领域引入了 DFlash2 以及 DSpark 置信度调度验证(confidence-scheduled verification)63% 相似待验证vLLM宣布在AMD GPU上支持推测解码(Speculative Decoding)技术60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912417API
curl https://kongchang.com/api/v1/knowledge/claims/912417MCP
get_claim(id=912417)