共 29 篇相关文章

Mesh LLM 是一款开源分布式推理框架,通过模型分层拆分,将多台普通设备聚合成「虚拟超级显卡」,让小显存机器也能运行数百GB的超大语言模型。本文详解其工作原理、跨平台安装体验,以及网络带宽这一不可回避的物理瓶颈。
CUDA内核融合:减少显存带宽消耗与启动开销的实战指南
深入解析CUDA内核融合(Kernel Fusion)原理与实践:如何将多个GPU内核合并为一个,减少全局显存读写流量、降低内核启动开销,在AI推理与深度学习算子链中实现显著加速。涵盖典型融合场景、权衡注意事项及自动融合工具选型。

NVIDIA TensorRT正式支持多设备推理,通过流水线并行与张量并行将大模型分布到多张GPU,突破单卡显存墙。本文深入解析其核心机制、媒体生成流水线应用场景及工程落地要点。

深入解析NVFP4量化技术:使用NVIDIA Model Optimizer将Nemotron 3 Ultra压缩为FP4格式检查点,实现显存占用降低75%,提升推理吞吐量。涵盖量化原理、校准流程与Blackwell架构协同优化实践。

DeepSeek联合北京大学推出开源框架DiSpark,通过投机解码、半自回归生成与分级验证技术,在不更换硬件、不重训模型的前提下,让大语言模型推理速度提升60%至85%,同时保持输出质量。

深入解析如何使用NVIDIA Nsight Systems与Nsight Compute优化神经重建管线。从CPU-GPU同步阻塞到内核级性能剖析,掌握自动驾驶仿真场景下GPU密集型AI管线的系统性优化方法。

深入解析NVIDIA GQE(GPU Query Engine)的架构设计理念:从HBM高带宽内存、NVLink互联到内存层级感知的执行模型,探讨GPU加速查询引擎如何突破I/O与带宽瓶颈,推动数据分析与AI工程的端到端加速。

中国智谱GLM开源模型以GPT-5.5 15%的成本逼近顶级闭源模型,HBM内存短缺引发AI通胀,太空数据中心经济账浮出水面。深度解析AI产业竞争的三大新战线:开源模型、HBM供应链与算力基建革命。

Google发布开源扩散式语言模型DiffusionGemma,采用Apache 2.0许可,26B参数MoE架构实测超500 tokens/s。了解扩散式文本生成原理、性能表现及与自回归模型的速度对比。