Cerebras跑Qwen3实现1500 Token/秒:推理速度为何重要

当推理速度突破1500 Token/秒
近日,一则来自Hacker News的讨论引发了技术社区的广泛关注:AI芯片公司Cerebras宣布,在其晶圆级引擎(Wafer-Scale Engine)上运行阿里巴巴的Qwen 3系列27B参数模型,实现了高达1500 tokens/秒的推理吞吐量。这一数字在短短时间内积累了近400个点赞和上百条评论,成为社区热议的焦点。
对于长期关注大模型推理性能的开发者而言,1500 tokens/秒并非一个抽象的数字。相比之下,主流GPU推理方案(如基于NVIDIA H100的部署)在同等规模模型上通常只能达到每秒数十到一两百token的水平。H100虽然拥有强大的计算能力(FP16算力可达近2000 TFLOPS),但其HBM3显存带宽约为3.35 TB/s,在自回归解码这种计算密度低、内存访问密集的任务中,带宽成为实际的性能瓶颈。自回归解码(Autoregressive Decoding)是当前主流大语言模型的核心生成机制——模型每一步只产出一个token,并将其追加到输入序列中作为下一步的上下文,这意味着生成N个token需要执行N次前向传播,每次都要将全部模型权重从内存加载到计算单元。这种场景的"计算强度"(用FLOPS/Byte衡量)往往不到1,远低于GPU设计优化的目标(通常需要100以上才能充分发挥算力),这正是KV Cache优化、投机解码(Speculative Decoding)等技术成为近年研究热点的根本原因。Cerebras这次将推理速度提升了一个数量级,背后既有硬件架构的独特优势,也重新定义了我们对大模型交互体验的期待。

为什么Cerebras能跑这么快
晶圆级引擎的架构优势
Cerebras的核心竞争力在于其独特的晶圆级芯片(Wafer-Scale Engine,WSE)。与传统GPU将多个独立芯片通过高速互联组合不同,Cerebras直接把整块硅晶圆制造成一个巨大的处理器,集成了数十万个计算核心和海量的片上SRAM。以其最新一代WSE-3为例,单颗芯片面积达到约46,225平方毫米(相当于一整块300mm晶圆),集成了90万个AI优化核心和44GB的片上SRAM——这个SRAM容量虽然看起来不大,但其聚合带宽远超传统HBM显存。传统芯片制造中,一块晶圆通常会被切割成数百个独立芯片(die),而Cerebras的做法是将整块晶圆作为单一芯片使用,通过冗余设计来应对晶圆上不可避免的缺陷点,这在半导体工程上是极具挑战性的创新。
大模型推理的瓶颈往往不在于算力,而在于内存带宽。在自回归生成(Autoregressive Generation)过程中,模型每生成一个token,都需要将整个模型的权重参数从内存中读取一遍——对于27B参数的模型,即使使用FP16精度,这意味着每生成一个token就需要读取约54GB的数据。这就是所谓的"内存墙"(Memory Wall)问题:计算单元在等待数据的时间远超实际计算时间,GPU的算力利用率在推理阶段往往不到峰值的10%。GPU受限于HBM显存的带宽(即便是最先进的HBM3e也仅有约4.8 TB/s),而Cerebras将模型权重直接存储在片上SRAM中。从存储层级来看,SRAM(Static Random-Access Memory)使用六晶体管结构存储每一位数据,访问延迟仅为1-2纳秒级别,而HBM虽然通过3D堆叠DRAM芯片和硅中介层连接实现了数TB/s的带宽,其访问延迟仍在数十纳秒量级。Cerebras将44GB SRAM分布式布局在90万个核心附近,聚合内存带宽可达数十PB/s量级——比任何HBM方案高出一到两个数量级。这种架构本质上是用芯片面积换取极致带宽,将存储层级中的瓶颈环节直接消除,使得数据可以在计算核心附近就地读取,几乎消除了数据搬运的开销,从而在单token生成延迟上取得了巨大优势。
对话式AI的临界点
1500 tokens/秒意味着什么?以中文为例,大模型通常使用BPE(Byte Pair Encoding)等分词方法,一个中文汉字大约对应1.5到2个token。BPE最初是一种数据压缩算法,其核心思想是从字符级别开始,反复合并语料库中出现频率最高的相邻符号对,逐步构建更大的子词单元。对于中文,由于每个汉字本身就是独立的语义单元且字符集庞大,BPE通常将常见的单字或双字词组作为独立token,而不常见的字则可能被拆分为UTF-8字节序列——Qwen系列使用了约15万词表大小的tokenizer,相比早期模型能更高效地编码中文文本。因此1500 tokens/秒大致相当于每秒生成750到1000个汉字,已经远远超出了人类的阅读速度(普通人的中文阅读速度约为每分钟300-500字)——生成过程几乎是瞬时完成的。一篇千字文章的生成可以在1-2秒内完成,用户几乎感受不到等待。
这种速度的提升不只是量变。当模型响应从"等待几秒"变为"即刻呈现",交互范式将发生根本改变。在需要多轮推理(Chain-of-Thought,简称CoT)或Agent工作流的场景中,模型往往需要生成大量中间思考步骤,推理速度的提升直接决定了这些复杂任务是否具备实用性。Chain-of-Thought是一种引导大模型进行分步骤推理的技术,模型会先输出详细的思考过程,再给出最终答案,这显著提升了数学推理和逻辑分析的准确性,但代价是生成的token数量可能增加数倍甚至十倍以上。而在Agent工作流中——比如一个AI助手需要先分析用户需求、制定计划、调用多个外部工具(搜索引擎、代码执行器、数据库等)、整合结果后再回复——整个流程可能涉及数千甚至上万个token的生成。如果每个环节都需要等待数秒,总体延迟将累积到令人难以忍受的程度。1500 tokens/秒的速度,使得这类复杂的多步推理任务可以在用户可接受的时间内完成,真正将Agent从概念验证推向生产级应用。
Qwen3模型本身的分量
这次搭载的是阿里巴巴的Qwen 3系列模型。Qwen(通义千问)近年来在开源大模型领域表现亮眼,多个尺寸的模型在各类评测榜单上名列前茅,尤其在中文能力和代码生成方面广受认可。Qwen3系列于2025年发布,涵盖了从0.6B到235B的多种规模,其中较大的模型(如Qwen3-235B)采用了MoE(Mixture of Experts,混合专家)架构。MoE是一种稀疏激活的模型设计理念:其核心组件包括一组并行的前馈网络"专家"(Expert)和一个路由网络(Router/Gate),在Transformer的每一层中,路由网络根据输入token的特征动态选择最相关的K个专家(通常K=2)进行计算,其余专家不参与。这样,模型虽然拥有庞大的总参数量(决定了知识容量),但每次推理只激活其中一部分(例如235B总参数中可能每次只激活约22B),从而在保持强大能力的同时控制推理时的计算量。不过MoE也引入了独特的工程挑战:所有专家的参数仍需存储在内存中,因此内存占用与总参数量成正比;路由决策的负载均衡需要专门的辅助损失函数;分布式部署中的专家分片策略(Expert Parallelism)也会引入额外的通信开销。而此次Cerebras展示所用的27B模型则是一个稠密模型(Dense Model),即所有参数在每次推理时都参与计算,这对硬件的内存带宽要求更高,也更能凸显Cerebras架构的优势。
27B参数规模是一个颇具实用价值的"甜点位"——它比7B级别的小模型有着明显更强的推理和知识能力,又比数百亿甚至千亿参数的旗舰模型更易于部署和加速。在行业中,这一尺寸通常被视为"效率前沿"(Efficiency Frontier)上的优选:根据多项评测,27-32B规模的模型在综合能力上往往能达到上一代70B模型的水平,是在性能与资源消耗之间取得平衡的理想选择。Cerebras选择Qwen3作为展示对象,一方面说明开源模型生态的成熟——Qwen3采用Apache 2.0许可证发布,允许商业使用和二次开发,降低了各类硬件厂商适配的门槛;另一方面也印证了非NVIDIA硬件平台对主流开源模型的良好支持。
社区的讨论与思考
在Hacker News的评论区,开发者们的讨论呈现出理性的一面。除了对速度本身的惊叹,不少人也提出了关键问题:
-
成本因素:晶圆级芯片的制造和采购成本极高。Cerebras的WSE芯片由台积电代工,使用先进工艺制造一整块晶圆级芯片的良品率管理和封装工艺都远比传统芯片复杂,单系统(CS-3)的售价据估算在数百万美元级别。因此Cerebras主要通过云端API提供服务,用户按token计费而非自行采购硬件。对于普通开发者和中小企业而言,能否以合理的价格获得这种速度,是决定其实用性的关键。关键指标不仅是每秒生成多少token,更是每百万token的成本是否具有竞争力。截至2025年,主流API服务商的推理价格已从2023年GPT-4早期定价的每百万输出token约60美元,下降到部分开源模型服务不足1美元的水平,降幅超过98%。在这一价格快速下行的趋势中,Cerebras的高速推理若能同时在成本上具有竞争力,将对整个市场格局产生重大影响。
-
批处理与单请求的权衡:极高的单请求速度固然亮眼,但在实际生产环境中,服务商更关注总体吞吐量(每秒服务的用户数)。这里涉及两个核心指标的区别:**延迟(Latency)衡量的是单个请求从发出到完成的时间,而吞吐量(Throughput)**衡量的是系统在单位时间内能处理的总请求数。GPU方案虽然单请求速度较慢,但通过批处理(Batching)技术——将多个用户的请求合并在一起同时计算——可以大幅提升总体吞吐量,因为GPU的大规模并行计算能力在处理批量请求时能得到更充分的利用。Cerebras架构在高并发场景下的表现如何,目前公开数据相对有限,这也是社区关注的焦点之一。
-
生态兼容性:NVIDIA的CUDA生态依然是行业事实标准。CUDA自2006年推出以来,经过近20年的积累,已经构建了包括cuDNN、TensorRT、Triton Inference Server等在内的完整软件栈,几乎所有主流深度学习框架(PyTorch、TensorFlow、JAX等)都以CUDA作为首选后端。这意味着开发者只要使用NVIDIA GPU,就能无缝获得社区贡献的海量优化代码和工具支持。Cerebras等挑战者需要在软件工具链、框架支持上持续投入,开发自己的编译器、调试工具和模型转换工具,才能真正撼动现有格局。历史上,许多硬件性能优异的AI芯片初创公司(如Graphcore)都曾因软件生态不完善而在市场推广中遭遇困难——Graphcore的IPU在架构上同样具有创新性,但最终因难以建立与CUDA匹敌的开发者生态而逐渐边缘化,这一前车之鉴值得所有挑战者警醒。
推理速度竞赛进入新阶段
Cerebras此次的成绩,是AI推理硬件竞争白热化的一个缩影。除了Cerebras,Groq等专用推理芯片厂商同样以"超高速度"为卖点,不断刷新记录。Groq采用的是LPU(Language Processing Unit)架构,其核心设计理念被称为TSP(Tensor Streaming Processor)——与GPU的SIMT(Single Instruction Multiple Threads)执行模型不同,LPU采用确定性执行模型,每条指令的执行时间在编译时就已完全确定,不存在缓存未命中、分支预测失败等运行时不确定性,这使得编译器可以精确编排数据流动和计算调度,从而最大化硬件利用率。Groq与Cerebras在消除内存带宽瓶颈这一目标上异曲同工,但在具体实现上走了不同的路线:Groq单颗芯片集成约230MB SRAM,通过将数百颗芯片经高速确定性网络互联来扩展总容量;Cerebras则是单一巨型芯片方案。两种哲学各有优劣——Cerebras在芯片内通信延迟上有天然优势,而Groq在可扩展性和制造成本控制上更为灵活。此外,还有SambaNova、Tenstorrent等多家公司从不同技术方向切入这一市场。这场围绕推理速度的军备竞赛,正在推动整个行业重新审视"推理即服务"(Inference as a Service)的商业模式——在这种模式下,AI能力的交付不再依赖于用户自行部署GPU集群,而是通过API调用按需获取,推理成本和速度成为服务商的核心竞争指标。这种模式将AI基础设施的复杂性封装在API背后,用户只需发送HTTP请求即可获得结果,按实际消耗的token数量付费,极大降低了AI应用的部署门槛。
值得注意的是,推理环节在大模型的全生命周期成本中占比正在迅速上升。训练一个大模型虽然耗资巨大,但属于一次性投入;而推理则是持续性的消耗——每一次用户请求、每一次API调用都需要消耗算力。据行业估算,在大模型商业化运营中,推理成本可能占到总计算支出的80%以上。因此,推理效率的提升对于AI应用的商业可行性具有决定性意义。
对于最终用户和应用开发者来说,这无疑是好消息。更快的推理速度意味着:
- 更流畅的实时对话体验,尤其是语音助手等对延迟敏感的场景。在语音交互中,用户期望的响应延迟通常在200-500毫秒以内,超过1秒就会感觉明显不自然。超高速推理使得即使是复杂的长回复也能在这个时间窗口内开始输出;
- 更复杂的Agent系统成为可能,多步推理、工具调用不再受制于漫长的等待。一个需要5轮内部推理、每轮生成500个token的Agent任务,在传统GPU上可能需要30秒以上,而在1500 tokens/秒的速度下可以压缩到不到2秒;
- 推理密集型应用的成本有望下降,速度提升往往伴随着单token成本的优化。更高的硬件利用效率意味着同等投资能服务更多请求,规模效应将推动价格进一步降低。
结语
1500 tokens/秒的Qwen3,既是Cerebras硬件实力的展示,也是开源模型与创新硬件结合的一次成功范例。当推理速度不再是瓶颈,我们或许将看到一批全新形态的AI应用涌现——从实时同声传译、沉浸式角色扮演到复杂的多Agent协作系统。硬件成本、生态兼容性等现实问题仍需时间解决,但大模型推理的"速度天花板"正在被不断打破——而这只是开始。
相关推荐

DynamicLake 2.0:把灵动岛搬上Mac的效率工具
DynamicLake 2.0 把 iPhone 的灵动岛体验搬到 Mac,提供通知汇总、文件拖放暂存、格式转换、AirDrop、计时器等功能,并新增插件系统。本文解析其功能定位与适用人群。

PeekPaste:贴边即用的Mac原生剪贴板管理器
PeekPaste是一款隐私优先的Mac原生剪贴板管理器,鼠标贴边即可滑出面板,支持文本、代码、图片、颜色等多类型管理,内置设备端OCR截图搜索,所有数据留在本地无云端上传。

Proofrr:把创意反馈、审阅与批准整合进一个工作区
Proofrr 是一款面向设计与视频创意团队的协作工具,将客户反馈、版本对比、审阅批准和 AI 辅助审阅整合到一个工作区,解决反馈散落、版本混乱、批准流程不透明的痛点。