Grok 4.5深度实测:编程能力媲美顶级模型,成本仅零头

一款新模型悄然登场,其创造者却抛出了大胆的承诺:在开发工作上,它能与顶级模型比肩,成本却只是零头。这就是 Grok 4.5——由 xAI 训练,并与 Cursor 深度合作的产物。作为一名在过去24小时里不间断使用它的开发者,我想坦诚地聊聊这款模型的好、坏与丑。
一个措手不及的惊喜
有意思的是,我原本对这些宣传是持怀疑态度的。但 Cursor 给了我一个新模型的早期访问权限,我一直以为这是新版 Composer,用起来印象颇深。直到后来我才知道,那个模型其实就是 Grok 4.5。
从 Artificial Analysis 的代码指数来看,Grok 4.5 与 GPT-5.5 几乎旗鼓相当,仅略低于 Fable,同时还击败了 Opus 4.8。虽然我认为这些数字基于我的使用体验可能略显激进,但确实相差不远。

更值得关注的是训练细节。官方透露 Grok 4.5 是在数万块 NVIDIA 最新 GB300 GPU 上训练的。GB300 是 NVIDIA Blackwell Ultra 系列的旗舰数据中心芯片,于2025年正式进入量产交付阶段。要理解这一硬件选择的战略意义,需要了解 Blackwell 架构在 AI 训练领域带来的代际跃升:相较于上一代 Hopper 架构(H100/H200),Blackwell 引入了第二代 Transformer 引擎,支持 FP4 精度混合计算——FP4 是目前数据中心级芯片支持的最低精度浮点格式,能够在几乎不损失模型质量的前提下将矩阵运算吞吐量提升近4倍。更关键的是,GB300 集成了 HBM3e 高带宽内存,单卡容量高达288GB,内存带宽超过10TB/s——这对于训练 Grok 4.5 这样的超大规模 MoE 模型至关重要。更大的 HBM 容量意味着可以在单卡上容纳更多专家参数,大幅减少跨卡通信开销;高带宽则直接决定了专家路由(Expert Routing)过程中激活参数的加载速度,从而影响训练收敛效率。xAI 能够率先大规模部署 GB300,很大程度上得益于其在孟菲斯超级数据中心的早期基础设施布局。能够调动如此规模的算力,标志着 xAI 已真正跻身全球顶级 AI 实验室的算力行列。
值得一提的是,GB300 还搭载了 NVLink 第五代互联技术,单机8卡的卡间带宽达到1.8TB/s,比上一代提升了近两倍。这对 MoE 模型的分布式训练尤为重要——专家并行(Expert Parallelism)模式下,每个前向传播步骤都需要在卡间高频传递"被路由到远端专家"的 token 激活值,NVLink 带宽瓶颈的消除直接转化为训练吞吐量的提升。这也解释了为何即便使用更多参数的 MoE 架构,xAI 仍能在训练效率上保持竞争力。
团队在数据过滤、去重、质量评分和领域筛选上投入巨大。这次它是一个 1.5万亿参数的 MoE 模型,而此前的 Grok 只有5000亿参数——这明确表明这是一次全新的预训练,而非在旧模型上的微调。
什么是 MoE 模型? 混合专家模型(Mixture of Experts)的核心思想最早由 Jacobs 等人于1991年提出,但真正在大语言模型中大放异彩是从 Google 的 Switch Transformer(2021年)和 GLaM 开始的。与传统密集模型(Dense Model)在每次前向传播中激活全部参数不同,MoE 的关键组件是"门控网络"(Gating Network),负责在每个 token 的前向传播中动态选择激活哪些"专家"子网络(Expert Subnetwork),通常采用 Top-K 路由策略(如 Top-2,即每次只激活两个专家)。每个专家本质上是一个独立的前馈网络(FFN),专注于处理不同类型的语义模式。这意味着一个1.5万亿参数的 MoE 模型,实际推理时可能只调用其中约2000-3000亿参数,从而在保持超大模型容量(决定知识广度和复杂推理能力)的同时,将计算成本控制在与中型密集模型相当的水平。MoE 架构还带来了另一个关键优势:不同专家可以分布在不同的 GPU 上并行处理,使模型规模的横向扩展更加高效——这正是 Grok 4.5 得以维持低价的底层技术逻辑之一,也是 Google 在 Gemini 1.5 和 Mixtral 等模型中广泛采用这一架构的根本原因。
进一步理解 MoE 的规模化逻辑:当模型从5000亿参数扩展到1.5万亿参数时,密集模型的推理计算量(FLOPs)会等比例增加,但 MoE 模型的实际推理计算量几乎不变,因为激活的专家数量是固定的(由 Top-K 超参数决定)。这种"参数量与计算量解耦"的特性,是 MoE 架构能够在不显著推高推理成本的前提下持续扩展模型容量的根本原因——也是 Grok 4.5 从5000亿扩展到1.5万亿参数后,仍能维持低廉定价的核心支撑。
Cursor 合作带来的独特优势
Cursor(现已成为 xAI 的一部分)在其官方文章中透露了更多细节。训练包含了数万亿的 Cursor 使用数据,这些数据捕捉了用户与代码库、软件工具的广泛交互,让模型既能从现有软件中学习,也能从"开发者—智能体"的交互中汲取经验。
这种数据与 RL 训练流程的结合,似乎正是 Grok 4.5 基准测试表现优异的关键所在。传统 RLHF(基于人类反馈的强化学习)依赖人工标注者对模型输出进行偏好排序,成本高昂且存在标注偏见——人类标注者往往倾向于奖励看起来"流畅"的输出,而非真正"正确"的代码逻辑。而 Grok 4.5 采用的路径更进一步——将数万亿条真实 Cursor 操作轨迹与 RL 结合,本质上是一种隐式行为克隆(Behavioral Cloning)与在线 RL 的混合训练范式。这些真实记录天然提供了"状态—动作—结果"三元组:状态是当前代码库快照和用户意图,动作是模型的编辑建议,结果是用户是否接受或进一步修改。这套数据天然覆盖了"需求模糊→多轮澄清→代码生成→错误修复→重构"的完整开发闭环,使模型能学到开发者在面对模糊需求、错误修复、多轮迭代时的真实决策模式——而非实验室环境中的理想化行为。这与 DeepMind 在 AlphaCode 2 中采用的思路异曲同工:利用真实竞赛提交记录(包括错误提交和修正过程)作为训练信号,而非仅依赖合成数据。Cursor 日活数百万的用户规模,是其他模型难以复制的核心数据护城河——即便竞争者知道这套方法论,也无法在短期内积累同等规模和质量的真实开发行为数据。
这种数据优势还体现在一个关键维度上:覆盖失败模式的密度。合成训练数据或竞赛数据集通常只包含"成功路径",而真实 Cursor 数据中必然包含大量用户拒绝建议、撤销操作、重复要求修改的记录——这些"负样本轨迹"对于训练模型理解"什么样的输出会被接受,什么样的会被拒绝"至关重要,本质上是一种基于真实用户行为的隐式奖励信号,其信息密度远高于人工构造的偏好对(Preference Pairs)。
团队刻意保持训练数据的广泛性,融入高质量的 STEM 任务、研究论文等知识工作内容,让模型在多个领域都具备扎实的能力。
值得称道的是团队的透明度:他们坦承在 Cursor Bench 上存在优势,因为一份早期的 Cursor 代码库快照被无意中纳入了训练数据,因此他们没有用这个基准对外宣传 Grok 4.5——这种坦诚在当下的 AI 军备竞赛中难能可贵。
定价:真正的核心竞争力
如果说有什么让 Grok 4.5 真正脱颖而出,那一定是它的定价策略。

Grok 4.5 的定价为每百万 token 输入2美元、输出6美元。相比之下,Fable 是输入10美元、输出50美元——成本相差5到10倍。在 Cursor Bench 上,Fable 5 High 每个任务花费8.77美元,而 Grok 4.5 仅需1.51美元,得分还略高一筹。
需要注意的是,这个价格仅适用于20万 token 以下的上下文。超过后价格翻倍,且最高只支持50万 token。这个设计略显别扭——从20万到50万上下文的提升并不算大,却要付出双倍成本。这大概是为了把基础版的输入输出成本压到最低,同时平衡 GPU 转售给 Anthropic、Google 等公司的高额利润。xAI 把自己放在了一个微妙的位置,但整体把握得不错。
从定价结构的经济学逻辑来看,长上下文推理的成本曲线并非线性:当上下文窗口超过某一阈值(通常是模型注意力计算开始出现"二次方复杂度"拐点的区域),每增加一个 token 的计算开销会显著上升,因为标准的全注意力(Full Attention)计算复杂度为 O(n²)。20万 token 的分级定价节点,很可能正是 xAI 在推理效率与边际成本之间找到的平衡点——低于此阈值的请求可以高度批处理(Batch Processing),GPU 利用率接近峰值;超过后则需要为每个长上下文请求保留更多显存,批处理效率下降,边际成本急剧上升。
惊人的 token 使用效率
真正令我震撼的是它的 token 效率。在 Artificial Analysis 的智能指数中,Grok 4.5 得分54,排名第四,紧随 GPT-5.5 之后,领先 Sonnet 5。而每个任务平均成本仅0.31美元,低于 GLM 5.2 的0.37美元和 Kimi K2 的0.35美元,得分却高得多。作为参考,Fable 5 完成同样的工作需要2.75美元。

在代码任务的 token 消耗上,Fable 用了720万 token,Opus 用了920万,而 Grok 4.5 仅用200万 token 就取得了高分。这种效率差异在工程层面意义深远:token 消耗量不仅决定直接成本,还影响响应延迟——在 AI 编程助手的高频使用场景中,更低的 token 消耗意味着更短的等待时间和更快的迭代节奏。从信息论角度理解,token 效率本质上反映了模型的"语义压缩能力":高效模型能够以更短的 token 序列表达同等复杂度的程序逻辑,意味着其内部表示(Internal Representation)对代码语义的编码密度更高。
更重要的是,它说明 Grok 4.5 在信息压缩和指令遵循上的内在效率更高,能以更简洁的输出表达同等质量的结果,而不是靠堆砌冗余推理步骤(如反复重申问题、过度展开中间推导链)凑出答案——这种"verbose reasoning"现象在某些经过过度强化学习训练的模型中尤为明显,会显著推高实际使用成本。从用户体验的角度,冗余 token 还会在 Streaming 输出模式下造成显著的"首字延迟"(Time to First Token)体验恶化,降低实时交互的流畅感。Grok 4.5 在 token 效率上的优势,使其在 AI 编程助手这一对响应速度高度敏感的场景中具备了超越账面定价的实际竞争优势——这让它成为了绝佳的默认代码模型。先让它跑,不满意再用其他模型收尾。
真实使用体验:出乎意料的可靠
基准测试终究无法衡量模型在真实场景中的使用感受。很多 Google 模型跑分亮眼,实际写代码却差强人意。那么 Grok 4.5 的实战表现如何?

坦白说,我很惊艳。我在为自己的云产品 Lakebed 做发布前的全面审计。Grok 4.5 找出了 Fable 和 GPT-5.6 发现的大部分问题,在动手修复时表现出色。我不断加大难度,让它处理复杂的多目标任务:拆分 PR、处理评审意见、根据截图做修改——它全部搞定,而且过程令人愉快。
我甚至故意把提问写得越来越模糊,想看它在哪里会崩溃,结果它始终没有出错。要知道,即便是 GPT-5.5,在这种冗长的多轮对话中也可能会"卡壳",过度纠结于三条消息前的某个细节。这种现象在技术上称为"注意力稀释"(Attention Dilution)——随着上下文长度增加,Transformer 的注意力机制需要在更多 token 之间分配权重,导致早期关键信息的相对注意力权重下降,模型可能"遗忘"或错误地继承前几轮对话中已解决的约束条件。
这一问题在工程实践中有几种常见的缓解策略:一是位置编码层面的改进,如 RoPE(旋转位置编码)和 YaRN(动态 NTK 插值)通过调整位置编码的衰减曲线,使远距离 token 的位置信息保持更好的区分度;二是注意力稀疏化(Sparse Attention),如滑动窗口注意力(Sliding Window Attention)通过限制每个 token 的注意力范围来降低长序列的计算开销;三是显式记忆机制(External Memory),让模型在长对话中主动提取和索引关键约束条件。而 Grok 4.5 在多轮交互体验上完全没有问题,这很可能与其 MoE 架构在长上下文处理上的特性有关:不同专家可以专注于处理对话历史的不同片段,形成隐式的分布式记忆,减少信息"稀释"效应。
意外惊喜:3D 建模能力
更让我意外的是它的 3D 建模能力。我让它把之前的小游戏做成3D版本,它成功创建了完整的3D环境,自行建模了各种生物和场景几何体,效果远超我用过的任何其他模型,包括 Fable 和 GPT-5.6。
虽然模型质量远未达到"可发布"的水准,控制方向甚至搞反了(A 键向右、D 键向左),但这是第一个在 Three.js 等框架中"几乎像样"的3D建模模型。Three.js 是一个基于 WebGL 的 JavaScript 3D 图形库,其技术难度在于:它的 API 抽象层刻意保持轻薄,将大量底层概念直接暴露给开发者——场景图(Scene Graph)定义了物体的层级变换关系,几何体(Geometry)需要手动定义顶点、法线和 UV 坐标,材质(Material)与光照系统(PBR 物理渲染)之间存在复杂的交互,而摄像机的投影矩阵(Projection Matrix)和视图矩阵(View Matrix)则需要开发者理解三维空间的坐标变换链。
对 AI 模型而言,正确处理 Three.js 代码意味着需要同时维护多个三维坐标系的一致性,并理解欧拉角(Euler Angle)、四元数(Quaternion)等空间旋转表示之间的转换关系——这对模型的空间几何推理能力提出了很高要求。控制方向搞反这一具体错误(A/D 键映射颠倒)恰好说明了这一挑战的细粒度:这类错误往往源于模型在处理"摄像机坐标系"与"世界坐标系"之间的手性(Chirality)差异时出现混淆,涉及右手坐标系的符号约定,是 3D 编程中一个经典的"语义陷阱"。即便如此,能够在没有明确3D编程指导的情况下生成结构完整、基本可运行的 Three.js 场景,已经代表了当前 AI 模型在空间推理领域的显著进步。Grok 4.5 能够在这一领域取得突破,很可能与其训练数据中包含了大量真实 Cursor 用户在3D项目上的操作轨迹有关。这一点我完全没有预料到。
遗憾与局限:世代的差距
当然,Grok 4.5 并非完美。在 Skate Bench 上,它因反复推理试图找出技巧而变得昂贵,最终只得了76%,是前沿实验室在最高推理设置下的最低分。它的推理确实偏"重",平均每次响应2100个 token。
更关键的短板在于编排能力(Orchestration)。所谓编排,是指模型作为"主智能体"(Orchestrator Agent)协调多个子智能体、分解复杂任务并管理并发进程的能力——这是当前 AI 工程领域最前沿的能力边界之一。具体而言,编排能力包括:将高层目标分解为有向无环图(DAG)形式的子任务序列,为每个节点分配合适的工具或子智能体,实时监控执行状态并处理异常(子进程超时、工具调用失败、结果不一致),以及在局部失败时触发合理的回滚(Rollback)或重试(Retry)策略。这一能力在软件工程场景中至关重要:大型重构任务通常涉及跨越数十个文件的依赖链修改,并行测试生成需要协调多个代码分析工具的输出,而 CI/CD 流水线优化则要求模型理解构建系统(Build System)的拓扑结构。
从技术层面看,Grok 4.5 在编排上的短板可能与其 MoE 架构的路由机制有关:在需要跨越数十个工具调用步骤的长序列任务中,不同 token 被路由到不同专家,导致任务状态的连贯性维护比密集模型更加困难——不同专家之间缺乏共享的全局工作记忆(Global Working Memory),使得跨步骤的状态追踪更容易出现"语义漂移",即模型在第20步工具调用时已部分遗忘第3步建立的约束条件。这一现象在形式上与认知科学中的"任务切换成本"(Task-Switching Cost)类似:当智能体需要在不同工具调用之间频繁切换上下文时,维护完整任务状态的认知负荷(在模型中体现为注意力和 KV Cache 的管理开销)会随任务深度指数级增加。这也解释了为何它在单次、长上下文对话中表现出色,但在"拆解—分配—汇总"的多智能体场景中却容易卡住。Fable 和 GPT-5.6 代表了新一代模型——它们的训练专门针对"工具调用链"(Tool-Use Chain)和"多步骤规划"(Multi-Step Planning)进行了强化,能调度子智能体、把大任务拆分成小块,从而完成更困难的任务。而 Grok 4.5 在这方面明显不足,我尝试用它拆分子智能体时并不满意,它常常因某个进程挂起而卡住,不知如何善后。
用游戏来打比方:他们刚推出了史上最好的 PS2 游戏,但 PS3 已经上市两个月了。Grok 4.5 更像是用上一代技术做出的极致之作,而非真正跨入新世代。
结语:不能再小看 xAI 了
尽管存在上述局限,xAI 这次的跨越仍令人叹为观止。从几乎被遗忘、只能转售 GPU 的处境,到以更便宜、更高效的模型在自己竞争的层级上击败几乎所有对手,这样的进步幅度,恐怕只有 DeepSeek 能相提并论。
我曾预测 xAI 可能会有一次疯狂的翻身,本以为需要六个月到一年,没想到时间更短。这是 Anthropic 和 OpenAI 很久以来第一个需要真正警惕的竞争者。我希望 Grok 4.5 带来的最终结果是:所有人都能用上更快、更便宜、更聪明的 AI 模型。
恭喜 xAI 追了上来。我原本不觉得你们有这个本事,但显然你们做到了。
核心要点
- Grok 4.5 是一个1.5万亿参数的 MoE 模型,在数万块 GB300 GPU 上完成预训练,算力规模标志着 xAI 正式跻身顶级 AI 实验室行列
- 定价极具竞争力:输入2美元/百万 token,输出6美元,较同级别模型低5-10倍,且 token 效率极高(完成相同任务仅消耗竞争对手1/3至1/4的 token)
- 真实编程体验出色:多轮复杂任务处理流畅,长上下文注意力稳定,在 Three.js 3D 建模等高难度场景展现出超预期的空间推理能力
- 核心短板是多智能体编排:在需要协调子智能体、管理并发工具调用链的复杂任务中表现不足,这与其 MoE 架构缺乏跨专家全局工作记忆有关
- Cursor 数据是核心护城河:数万亿条真实开发行为轨迹构成了难以复制的训练优势,其信息密度和覆盖失败模式的能力远超合成数据或竞赛数据集
- 适合作为默认代码模型:以极低成本完成大多数开发任务,在达到能力边界时再切换更强模型——这一工作流在经济性和实用性上均已得到验证
相关推荐

微型黑洞或正引爆银河系恒星:原初黑洞如何充当恒星杀手
研究提出微型原初黑洞可能高速穿越恒星内部,通过引力扰动触发热核反应引爆恒星。这一假说为部分异常超新星提供新解释,并可能成为破解暗物质之谜的关键线索。

ResearchMaster AI深度评测:可验证的AI市场调研工具
深度解析ResearchMaster AI如何通过证据链接、来源冲突暴露和结构化工作空间,解决AI市场调研的信任危机,为产品经理和创业者提供可验证的决策支持。

AI智能体记忆撤销机制:为什么Agent需要一个「撤回」按钮
探讨AI智能体记忆系统为何需要撤销功能。从错误累积、记忆投毒攻击到隐私合规,分析记忆不可逆性的风险,并介绍版本化记忆、记忆溯源图等技术实现方案。