Grok 4.6实测:性能、定价与Cursor收购深度解析

过去两年,全球AI大模型市场似乎只剩下OpenAI和Anthropic两大玩家。而Grok(xAI)尽管开局声势浩大,却很快归于沉寂,长期停留在第三梯队。但就在最近几天,情况发生了根本性变化——随着xAI完成对Cursor的收购,并发布全新的Grok 4.6模型,这家公司正以惊人的速度追赶头部阵营。本文将结合科技博主Matthew Berman的实测分析,深入解析Grok 4.6的性能表现、定价策略,以及Cursor收购背后的深层逻辑。
Grok 4.6性能解析:从迭代升级到全面提升
Grok 4.6并非全新的训练成果,而是基于Grok 4.5的迭代升级(dot upgrade)。在大模型行业,「dot upgrade」与「全新模型」有本质区别。全新模型意味着从头开始的预训练(pre-training),需要消耗数百万至数十亿美元的算力。而点版本升级则是在已有基础模型之上,通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术,针对特定能力域进行强化——成本更低、迭代更快,但受限于基础模型的「天花板」。
这三种后训练技术各有侧重且常组合使用。SFT是最直接的方式,使用人工标注的高质量问答对让模型学习期望的输出格式和内容风格。RLHF则引入奖励模型(Reward Model),先让人类标注者对模型的多个回答进行排序,训练出一个能打分的奖励模型,再用PPO等强化学习算法优化生成策略——ChatGPT的突破性对话体验正是RLHF的功劳。DPO则是2023年由斯坦福团队提出的RLHF简化替代方案,它跳过奖励模型训练步骤,直接从人类偏好数据中优化策略,数学上等价但实现更简洁、训练更稳定。正是因为这些后训练技术已经相当成熟,xAI才能在收购Cursor后短时间内发布性能显著提升的新版本。
正如xAI在官方博客中所强调的,这是一次「巨大的改进」。其核心焦点非常明确——代码能力与知识工作(knowledge work),而这一切都源自对Cursor的收购。
有意思的是,Grok 4.5此前已成为许多开发者在Cursor中的默认子代理(sub-agent)模型,因其能力强、速度快而备受青睐。而Grok 4.6在此基础上不仅性能全面提升,速度还进一步加快,这对于追求响应速度的用户来说是个不小的惊喜。
基准测试成绩:多项领先,部分仍有差距
从多个权威基准测试来看,Grok 4.6的表现相当亮眼:
- GDPVal(OpenAI推出的知识工作评测):Grok 4.6 High拿下第一名,超越了竞争对手;
- Harvey Lab(法律场景评测):以15.8%的成绩大幅领先,远超对手的2.5%和11.3%;
- Terminal Bench:从上一代的15%跃升至26%;
- Cursor Bench:与Fable 5 Max基本持平,未能夺魁;
- DeepSuite(被认为最贴近真实编程体验的评测):以65.9分位列第三,落后于GPT-5.6 Sol Max(73分)和Fable 5(70%)。

这一点值得警惕:许多模型在跑分上表现优异,但真实编程使用时体验却「不对味」。这背后是AI行业长期存在的「benchmark overfitting(基准过拟合)」问题——模型通过针对性训练刷高特定测试分数,却未必提升真实能力。这种现象的机理类似于学生「刷题」:当训练数据中包含与基准测试高度相似的样本时,模型学会的是模式匹配而非真正的问题解决能力。DeepSuite之所以更具参考价值,在于它模拟的是完整的软件工程任务流:理解需求、拆解问题、生成代码、处理边界情况、调试修复,而非单纯的代码补全或算法题。这类「端到端任务评测」更难被刷分,因为它需要模型在多个维度上同时表现稳定,且任务的组合空间远大于传统基准。Grok 4.6在此仍与顶级模型有一定距离,说明其真实编程场景的综合能力仍有提升空间。
Grok 4.6成本分析:性价比的真实较量
Matthew Berman反复强调一个观点:只看质量分数是不够的,成本同样重要。他推荐使用Artificial Analysis的智能指数(Intelligence Index)作为综合参考。Artificial Analysis是一家独立的AI模型评估机构,其智能指数通过综合多个基准测试的加权得分来衡量模型的整体能力。与单一基准不同,它试图平衡推理、知识、编程、数学等多维度能力,并结合实际API调用时的延迟和成本数据,提供性价比二维散点图。这种评估方式在企业采购决策中越来越受重视,因为它回答的不是「哪个模型最强」,而是「在我的预算约束下,哪个模型最值」。
在这一排名中,Grok 4.6 High从上一代的位置一跃升至第四名,与GPT-5.6 Sol并列——Claude Opus 5位居第一,Fable 5第二。但真正决定价值的是「每任务成本」(cost per task)这一维度。
这里有个重要的分析框架:每任务成本取决于两个因素——模型消耗多少token,以及每个token的价格。大模型的计费以「每百万token」为单位,但仅看单价会产生误导,因为不同模型完成同一任务时消耗的token数量差异显著。尤其是「思维链(Chain-of-Thought)」推理模型,往往生成大量中间推理步骤,消耗远超普通模型的输出token。思维链推理是近年来大模型能力突破的关键技术之一——通过让模型在输出最终答案前「逐步思考」,显著提升了复杂推理任务的准确率,但代价是输出token量可能增加数倍甚至数十倍。Artificial Analysis等第三方机构通过构建标准化任务集、统一测量各模型的token消耗,计算出真实的每任务花费。以Kimi K3 Max为例,虽然其单价只有Sol和Fable的一半,但由于消耗了两倍的token,实际总成本几乎持平。对于高频调用场景,每任务成本的差异会随调用量指数级放大,因此这一指标在生产环境选型中往往比原始性能分数更具决策价值。
从数据来看,Grok 4.5 High的每任务成本约36美分、智能指数约55-56;而Grok 4.6虽然智能指数提升到约60,但成本也上涨到约83美分。相比之下,它比同等智能水平的GPT-5.6 Sol Max更便宜,与Kimi K3价格相当但智能略高。理想的模型应位于「高智能、低成本」的左上角绿色象限,Grok 4.6虽然更贵了,但整体仍具竞争力。
实测对比:Grok 4.6设计能力仍是短板
在一项相同prompt生成「设计感个人资料卡片」的实测中,三大顶级模型表现各异:
- Fable 5:表现糟糕,生成的图像被形容为「最烂的SVG画图作品」;
- GPT-5.6 Sol:设计优美、干净、视觉吸引力强,明显胜出;
- Grok 4.6:不错但不完美,图像尚可,但按钮被裁切、缺少内边距、文字间距略显奇怪。

结论很清晰:在主观性较强的设计任务上,GPT-5.6 Sol依然领先,Grok 4.6处于中游水平。设计类评测虽难以量化,但差距肉眼可见。这类任务对模型的空间推理能力、审美理解和细节把控要求极高,往往是代码生成能力提升最难直接迁移的领域。设计任务本质上要求模型同时具备两种能力:一是对视觉美学的隐性理解(对称性、色彩协调、留白节奏等),二是将这种理解精确转化为像素级代码实现的能力。这两种能力在训练数据中的表征方式截然不同,前者更多依赖于模型在大规模预训练中吸收的视觉-语言关联,后者则依赖于精确的CSS/SVG代码生成能力。这也解释了为什么编程基准测试高分并不能直接预测设计任务的表现。
Grok 4.6定价与产品生态:面向更广阔的市场
Grok 4.6的定价极具竞争力:输入200万token为2美元,输出600万token为6美元。作为对比,GPT-5.6 Sol的价格是其数倍,Fable更贵。这使得Grok 4.6成为一个高效且廉价的「主力(workhorse)」模型。这一定价策略在行业中被称为「渗透定价」——通过低于竞争对手的价格快速抢占市场份额和API调用量。对于xAI而言,其Colossus集群的巨大算力储备使其有能力承受较低的利润率,同时通过规模效应分摊固定成本。
此外,xAI还提供了速度翻倍的Fast变体(价格翻倍),并在首周为Cursor和Grok Build用户提供双倍用量优惠。该模型目前已可通过Cursor、Grok Build、API以及OpenRouter调用。
更值得关注的是全新产品Grok Bot——这是Cursor推出的面向更广泛、非技术用户的产品。它彻底剥离了模型选择功能(用户甚至不知道自己在用哪个模型),也不显示任何代码,只呈现文本和PPT、Word等知识工作产物。每个对话线程都是一个独立的Agent,还配有可爱的小吉祥物。这种产品设计理念体现了AI行业的一个重要趋势——「模型无感化」:当底层技术足够成熟时,最佳用户体验是让用户完全不需要理解或选择技术细节,只关注任务本身。这与早期个人电脑用户需要懂DOS命令、如今只需点击图标的演进路径如出一辙。这标志着xAI正瞄准比开发者更庞大的普通用户市场。
xAI收购Cursor的深层逻辑:数据与算力的完美联姻
要理解xAI今天的定位,必须回顾这段历史。今年4月,xAI收购了Cursor——这家曾彻底改变编程方式的公司。Cursor是基于VS Code深度改造的AI原生代码编辑器,由Anysphere公司推出,迅速成为开发者社区中最具影响力的AI编程工具之一。它的核心创新在于将大语言模型深度嵌入编辑器工作流:不仅提供代码补全,还支持多文件上下文理解、自然语言代码生成、对话式调试,以及「Agent模式」——让AI在用户监督下自主完成复杂的多步骤编程任务。随着Claude Code和Codex的崛起,它逐渐失去了部分开发者的青睐,但其积累的海量真实编程交互数据依然是极为宝贵的战略资产。

这次收购的价值在于互补性:
- Cursor拥有海量宝贵的编程数据,却没有数据中心和GPU来训练自己的模型;
- xAI则在122天内建成了20万块GPU的集群(即「Colossus」集群),速度惊人,但苦于没有好模型,导致大量算力闲置。
Colossus集群是目前已知规模最大的AI训练集群之一,部署了20万块NVIDIA GPU。为了在122天内完成建设,xAI采用了非常规的工程方法——包括使用预制模块化数据中心、大规模并行施工以及简化审批流程。集群规模之所以重要,是因为大模型训练遵循「Scaling Laws」(缩放定律):更多的算力和数据通常意味着更强的模型能力,且这种关系在一定范围内是可预测的幂律关系。然而,拥有硬件只是第一步——如何高效利用这些GPU进行分布式训练、如何优化节点间通信带宽和显存管理,同样是巨大的工程挑战。
在大模型时代,算力与数据是两种最关键的生产要素,且两者缺一不可。编程数据尤为稀缺——公开代码数据(如GitHub上的开源项目)虽然体量巨大,但存在噪声高、质量不均、缺乏自然语言意图标注等问题。真正有价值的编程数据包括三类:一是开发者用自然语言描述需求后AI生成的代码及其后续修改记录(隐含了「好代码」的标准);二是跨文件、跨会话的长上下文编程交互(反映了真实软件工程的复杂性);三是调试过程中的错误-修复对(教会模型识别和纠正错误)。这些数据只能通过大规模用户使用AI编程产品来自然积累,构成了一种独特的「数据护城河」——即便竞争对手拥有同等算力,没有这类数据也难以训练出同等水平的编程模型。Cursor每天处理数百万次真实开发者的编程请求,积累的这类数据集是xAI无法通过爬取互联网获得的。数据 + 算力的结合,催生了强大的新一代编程模型。
这也印证了当前大模型的「制胜公式」——死磕编程场景,以及由此形成的飞轮效应。这一飞轮的结构是:开发者大量使用编程工具产生真实交互数据,数据用于训练更强的编程模型,更强的模型吸引更多开发者,形成闭环。这一飞轮最早由Anthropic系统性构建:开发者使用Claude Code,数据和收入反哺Anthropic,再用编程模型训练下一代模型。OpenAI随后通过收购Windsurf并推出Codex CLI复制了这一模式并追平差距,如今xAI也走上了同样的路径。这一模式的战略意义在于:它将产品收入、用户增长和模型能力提升三者绑定在一起,构建出极高的竞争壁垒——后来者不仅要追赶模型能力,还要同时追赶数据积累。这种「数据-模型-用户」的三角飞轮,本质上是互联网时代「网络效应」在AI领域的新形态。
递归自我改进的信号
xAI在博客中明确提到,他们用Grok 4.5来训练Grok 4.6——利用4.5重新生成SFT轨迹(涵盖推理、Agent框架,以及STEM、软件工程、知识工作等领域)。
「SFT轨迹」特指包含完整推理过程的训练样本——不仅有最终答案,还有逐步的思考链、工具调用序列或Agent行动记录。用上一代模型生成SFT轨迹来训练下一代模型,其技术基础是「知识蒸馏(knowledge distillation)」的变体。知识蒸馏最初由Geoffrey Hinton等人于2015年提出,核心思想是让「学生模型」学习「教师模型」的软标签(即输出概率分布),而非仅学习硬标签(正确答案)。软标签包含教师模型对各选项的「信心」信息,这种「暗知识(dark knowledge)」有助于学生模型获得更好的泛化能力。用上一代模型生成训练数据本质上是一种自蒸馏(self-distillation),但理论上存在一个关键疑问:模型能否通过自我生成的数据突破自身能力上限?目前的实践表明,通过精心设计的筛选机制(如验证器过滤错误轨迹、只保留通过单元测试的代码样本)和多样化采样策略(如高温度采样后过滤),确实可以实现一定程度的能力提升。
这正是「递归自我改进」的雏形——AI能力提升的路径正从「人工数据驱动」向「模型自举(model bootstrapping)」演进。虽然尚未形成完全闭环的自我进化AI——即模型完全自主地持续提升自身能力——但当前各大实验室都在用上一代模型训练下一代模型,这种递归提升是否存在收益递减的天花板,仍是学术界和产业界热议的开放问题。Grok亦不例外,而Cursor积累的真实编程数据在这一过程中充当了关键的「锚定」角色——确保自生成的训练数据不会偏离真实用户需求。
AI竞争格局:xAI的算力筹码与未来展望

一个耐人寻味的细节是:由于Anthropic低估了自身模型的需求,转而向xAI购买算力。这种情况在行业中被称为「算力租赁」——当一家公司自有GPU不足以满足推理需求时,可以向拥有闲置算力的公司购买计算时间。Matthew Berman形象地将此比喻为「向敌人出售武器」——考虑到马斯克此前对Anthropic的诸多负面评价,这笔交易想必让他内心复杂。
但潜在的隐忧在于:一旦Grok 4.6开始吸引大量需求,在与Anthropic的合约到期后,xAI很可能将全部GPU算力转向自家的Cursor和Grok。对Anthropic的Dario而言,这或许是个值得警惕的信号——它凸显了AI公司在算力供应链上的脆弱性,也解释了为什么各大实验室都在加速自建或锁定长期GPU供应。
而xAI的脚步并未停止。马斯克已发推透露,Grok 4.7比4.6显著更强,预计三到四周内就绪,初步训练已完成,接下来将加入大量SpaceX公司数据进行补充训练。SpaceX数据的加入尤为值得关注——这意味着Grok可能获得航天工程、火箭设计、制造流程等高度专业化的领域知识,这些数据在公开语料库中几乎不存在,将赋予模型在特定工程领域的独特优势。
结语:第三大AI实验室的崛起
Grok 4.6的发布标志着美国AI市场正式迎来第三大主要实验室——继OpenAI和Anthropic之后,xAI凭借Cursor收购带来的数据优势和自身庞大的算力储备,正以极快的速度缩小差距。尽管在设计能力和部分真实编程体验上仍与顶尖模型有距离,但其低价、高效、快速的特性,以及面向大众市场的Grok Bot产品策略,都让它成为一个不容忽视的力量。
从更宏观的视角看,AI行业正在从早期的「模型能力竞赛」向「生态系统竞赛」转变。单纯的模型性能已不再是唯一竞争维度——数据飞轮、产品矩阵、算力基础设施和定价策略共同构成了新的竞争格局。xAI通过一次战略性收购,同时补齐了数据和产品两块短板,这种整合速度本身就是其竞争力的体现。
正如Matthew Berman所言:竞争是好事。无论是开源模型还是闭源前沿模型的竞争,最终都意味着更好的模型和更低的价格,这对所有用户都是福音。
核心要点
核心要点
相关推荐

LangGraph入门指南:AI Agent的操作系统全解析
LangGraph 被称为 AI Agent 的操作系统,本文系统梳理其与 LangChain 的关系、状态节点边三大要素、持久化 checkpoint、human-in-the-loop 及子图等核心能力与学习路径。

吴恩达谈Agentic AI:拨开炒作看智能体构建的核心技能
吴恩达 Agentic AI 课程开讲,剖析智能体炒作背后的真实价值。从客户支持、法律文档到医疗诊断的落地场景,揭示评估与错误分析为何是构建智能体工作流的核心技能。

吴恩达谈Agentic AI:构建智能体应用的核心方法论
吴恩达 Agentic AI 课程深度解读:从术语被过度炒作说起,剖析智能体工作流在客户支持、深度研究、法律与医疗诊断中的真实应用,并揭示优秀开发者依靠评估(Evals)与错误分析的纪律化开发流程这一核心方法论。