共 6 篇相关文章

vLLM 社区推出 Hybrid HiSparse,基于稀疏 MLA 与分级内存调度,让长上下文请求在显存不足时持续解码。GLM 5.3 实测显示,8×H200 节点上并发请求数从 5-6 提升至 19-25,将集成于 vLLM v0.30。

NVIDIA 与 Red Hat 联合为 vLLM 增设「最佳应用」赏金,聚焦 33B 以下小型开源模型的真实部署与推理优化。本文解读活动信号、参数上限逻辑及对开发者的实战参考价值。

DeepSeek-V4.1-Flash正式发布,采用552B MoE主干、100万上下文与原生视觉,vLLM从首日起支持并验证NVIDIA与AMD GPU。深度解析Engram记忆架构与压缩KV共享两项核心创新。

vLLM v0.29.0正式发布,Model Runner V2成为所有模型的默认引擎。本次更新汇集277位贡献者的594次提交,涵盖Kimi、DeepSeek模型优化、Mamba前缀缓存、投机解码可观测性及RL权重P2P同步等关键升级。

AMD与EmbeddedLLM发布博客,记录在Instinct MI355X上优化MiniMax M3的vLLM推理服务过程,通过“跟着瓶颈走”的方法实现3-4倍吞吐提升。解析day-0支持与社区调优范式。
教程攻略详解vLLM和SGLang本地部署全流程,对比LM Studio性能差距,通过Docker+AI助手三步完成部署。涵盖SGLang与vLLM选型建议、5090显存优化、Qwen3模型推荐及Cherry Studio接入方法。