#推理框架
共 2 篇相关文章

·7 分钟
Anifer开源推理引擎实测:单卡5090狂飙150 token/s
开源推理引擎 Anifer 用 C++/CUDA 深度优化,单张 RTX 5090 上 Qwen3.8 27B 单并发实测稳定 144~150 token/s,8 并发官方跑分冲到 1147 token/s。本文解析它为何比 vLLM、llama.cpp 更快及实测数据。
阅读全文 →
科技前沿·5 分钟
SGLang举办Agent Loops主题Office Hour,聚焦智能体循环架构优化
SGLang团队举办Agent Loops主题Office Hour,深入探讨智能体循环调用的推理优化方案,涵盖KV Cache复用、低延迟多轮对话及工具调用等关键技术,助力AI Agent开发者提升推理性能。
阅读全文 →