共 17 篇相关文章

深度解析AMD CDNA5架构的技术方向,包括Chiplet封装升级、HBM内存演进、低精度计算优化等核心看点,分析AMD如何通过下一代Instinct加速器挑战NVIDIA在AI芯片市场的主导地位。

RX 9060 XT与RTX 5060 Ti同为16GB显存,本地AI推理该选谁?从CUDA生态、ROCm兼容性、LLM推理性能到实际使用体验,全面对比两款显卡在本地AI场景中的优劣与适用人群。

Python再次登顶编程语言榜首,但AI团队正悄悄用Rust和Mojo替换其底层。本文剖析Python的速度与GIL之痛、双语言问题,以及Rust工具链和Mojo在GPU领域的崛起。
llmfit:一条命令检测硬件能跑哪些本地大模型
llmfit 是用 Rust 编写的开源命令行工具,无需下载模型即可预判本地硬件能否运行指定 LLM。覆盖数百种模型与 Ollama、llama.cpp 等主流推理后端,帮助开发者在本地部署大模型前快速完成硬件适配评估,避免反复试错。
非NVIDIA硬件运行CUDA的四大替代方案对比
深度解析在AMD、Intel等非NVIDIA硬件上运行CUDA的主流技术路径,涵盖ROCm/HIP、ZLUDA、SYCL/oneAPI、OpenCL四大方案的原理、适用场景与局限性,帮助开发者突破GPU供应商锁定。

Reddit社区曝光苹果M7 Ultra芯片规格,最高1.5TB统一内存或支持本地运行所有主流开源大模型。本文深度解析其技术架构、定价争议、内存带宽瓶颈及苹果生态锁定问题,探讨这款芯片对本地大模型部署的实际意义。

Miles团队联合AMD官方宣布,DeepSeek-V4 Flash强化学习训练完整迁移至AMD Instinct MI355X GPU,基于ROCm平台实现端到端稳定运行,AIME数学推理基准pass@1从0.39提升至0.49,标志着大模型训练算力生态多元化的重要突破。

为什么配备统一内存的迷你PC能跑70B大模型,RTX 4090却束手无策?本文深度解析显存墙与统一内存架构的核心差异,帮助开发者和AI爱好者做出更明智的本地部署硬件选择。

AMD正式发布Ryzen AI Halo本地AI开发套件,售价约4000美元,搭载128GB统一内存,支持本地运行70B大模型。本文深度解析其配置亮点、定价策略及在本地AI算力市场的竞争格局,并梳理Anthropic大模型可解释性研究等科技要闻。

用Ollama+Hermes构建完全私有的本地AI系统:零费用、无速率限制、数据不出本地。本文详解部署步骤、模型选择技巧及私有/云端混合工作流,助你真正"拥有"AI而非"租用"AI。

AMD MI355X在运行GLM5.2大模型时实现单节点2626 tokens/秒吞吐量,总拥有成本仅为英伟达Blackwell的一半。本文深度解析这一性价比优势背后的技术逻辑、ROCm生态进展,以及对AI算力市场格局的深远影响。

AMD Ryzen AI Halo开发套件定价4000美元,搭载128GB统一内存与XDNA 2 NPU,主打本地大模型推理。本文深度解析其架构优势、性能局限、与Mac Studio的对比,以及软件生态挑战,助你判断是否适合你的AI开发需求。

Redis之父用纯C引擎将284B参数DeepSeek模型压缩至76GB,在MacBook Pro上实现每秒26Token的本地推理。本文拆解MoE架构、非对称量化技术原理,直面硬件门槛与质量代价,厘清本地AI推理的真实边界。

AMD显卡用户跑本地大模型屡遭黑屏掉卡?本文复盘Ollama三大致命痛点,详解迁移至LM Studio后token速度从5提升至36的完整方案,含ROCm配置、投机采样开启及GFX版本避坑指南。

AMD股价突破500美元大关,市值再创历史新高。深入分析AMD在AI芯片市场的战略定位、与英伟达的竞争态势、Instinct MI300X的性价比优势,以及股价背后的基本面支撑与潜在风险。
教程攻略详解如何在AMD GPU上部署PD分离式SGLang推理集群,通过单一配置文件实现Prefill-Decode解耦的多节点部署,提升大模型推理吞吐量与延迟表现,附架构原理与适用场景分析。
行业洞察AMD Instinct MI355X通过SGLang+MoRI全栈优化,在DeepSeek-R1分离式推理中实现TCO比NVIDIA B200低5%,每GPU吞吐量高1.25倍。深度解析MoRI量化通信、KV Cache优化及推测解码等核心技术突破。