共 41 篇相关文章
SGLang集成DSpark:置信度驱动推测解码如何破解高并发失效难题
SGLang正式集成DSpark,通过置信度驱动的变长验证机制解决推测解码在高并发批次下加速失效的核心痛点。支持Qwen3与DeepSeek-V4,B300硬件实测生成速度达383.7 tok/s,全批次范围性能领先MTP与常规推理方案。

SGLang-Diffusion正式支持LingBot-World 2.0,带来分辨率与时序一致性双重跃升。结合实时会话、分块流式传输与相机控制,世界模型首次实现低延迟可控交互体验,开发者可参考官方Cookbook快速落地。

Netpreme将X-Mem™ MPU接入SGLang HiCache分层KV缓存体系,在98%前缀缓存命中率场景下,TTFT最高降低6.7倍,单用户TPS提升33%-50%。本文深度解析高命中率场景下内存带宽瓶颈的成因与专用内存层的技术价值。

SGLang团队将专家经验转化为可执行的智能体技能,实现吞吐量提升71.4%、TTFT从456ms压缩至168ms等实测收益。本文深度解析Agent辅助开发的核心方法论,包括基准测试防作弊机制与人机协同审查闭环。
教程攻略详解如何在AMD GPU上部署PD分离式SGLang推理集群,通过单一配置文件实现Prefill-Decode解耦的多节点部署,提升大模型推理吞吐量与延迟表现,附架构原理与适用场景分析。
科技前沿SGLang v0.5.12.post1稳定性补丁详解,包含12项关键修复,涵盖DeepSeek V4乱码与崩溃问题、NIXL PD分离式推理逻辑修复、Blackwell B300架构适配及冷启动性能优化。
行业洞察SGLang联合Crusoe AI、Cloudflare等举办金融AI推理活动,探讨LLM推理框架在交易、风控、合规等场景的落地应用,解析AI推理基础设施垂直化趋势及金融行业部署前景。
科技前沿Cloudflare向SGLang上游提交decode KV cache offload和Mooncake recovery两项关键修复,解决高并发场景下Kimi K2.6模型乱码输出问题,并实现分布式推理节点自动故障恢复,提升生产环境稳定性。
科技前沿SGLang团队举办Agent Loops主题Office Hour,深入探讨智能体循环调用的推理优化方案,涵盖KV Cache复用、低延迟多轮对话及工具调用等关键技术,助力AI Agent开发者提升推理性能。
教程攻略详解vLLM和SGLang本地部署全流程,对比LM Studio性能差距,通过Docker+AI助手三步完成部署。涵盖SGLang与vLLM选型建议、5090显存优化、Qwen3模型推荐及Cherry Studio接入方法。

仅花费500美元对9B开源模型进行强化学习微调,即可在目录审查任务上超越前沿大模型。本文解析小模型RL微调的适用场景、成本优势及对企业AI落地的实际启示。

D-Flash通过快扩散并行草稿与目标特征KV注入,解决投机解码中自回归Drafter的延迟瓶颈。16个Token仅需6毫秒,HumanEval加速达3.5倍,全面超越EAGLE3和MTP方案。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

DeepSeek开源推测解码工具库DeepSpec,生产环境实测推理速度提升60-85%,吞吐量最高提升661%。集成三大算法、九个预训练Checkpoint与九个评测基准,三步即可上手,MIT协议免费商用。

深度评测Panel AI 1.1.1版本:秒级安装、无公网组网、算力集群批量管理,企业AI私有化部署门槛大幅降低。涵盖应用市场、角色权限、商业授权等核心功能解析,助力中小团队快速落地企业级AI解决方案。

QuantaMind是一款免费开源的本地AI Agent可靠性测试工具,采用pass^k评分与确定性评分机制,支持多步序列测试与故障注入,覆盖Ollama、llama.cpp、vLLM等主流部署方案,帮助团队在上线前发现隐藏的序列级失败风险。

按下回车到屏幕出现第一个字,LLM内部究竟发生了什么?本文系统拆解自回归生成机制、KV缓存加速原理,以及温度、Top-k、Top-p等解码策略,帮助开发者真正理解并掌控大语言模型推理过程。

Miles团队联合AMD官方宣布,DeepSeek-V4 Flash强化学习训练完整迁移至AMD Instinct MI355X GPU,基于ROCm平台实现端到端稳定运行,AIME数学推理基准pass@1从0.39提升至0.49,标志着大模型训练算力生态多元化的重要突破。

深入解析vLLM推理框架的核心原理:从吞吐(tokens/s)的本质含义,到自回归生成的性能瓶颈,再到KV Cache、PagedAttention、连续批处理三大优化技术,帮助算法工程师系统掌握大模型推理优化知识体系。

MosiAI开源MOSS-Transcribe-Diarize-0.9B,一体化实现语音转写与说话人分离,支持128K上下文单次处理90分钟音频,内置热词增强,SGLang Day-0支持,轻量可部署于边缘设备。