Grok 4.6深度实测:追平GPT和Claude第一梯队的代价

xAI的加速追赶
自收购Cursor之后,xAI的模型迭代速度肉眼可见地加快了。从过去动辄数月不出重要模型的"沉寂期",到如今Grok 4.5、4.6接连发布,甚至Elon已经预告4.7将在三四周内到来——这家实验室正以惊人的节奏冲向前沿。
xAI收购Cursor(Anysphere公司)是2025年AI行业最重大的并购之一。Cursor不仅是一个代码编辑器,更积累了大量关于开发者如何与AI协作的真实数据——包括哪些代码建议被接受、哪些被拒绝、开发者如何修正AI的错误输出等。这些数据构成了极其珍贵的强化学习信号。Cursor团队在实践中开发了针对代码生成场景的专用奖励模型,能够评判代码的正确性、风格一致性和工程最佳实践遵循程度,这比通用的RLHF反馈精细得多。
据YouTube频道Theo的深度实测,Grok 4.5是第一个让他真正考虑作为日常主力使用的非Anthropic、非OpenAI模型。而这次的Grok 4.6在此基础上进一步聚焦长时任务(long-running agents)和更具野心的交互式、视觉化工作。它快、便宜、可靠,尤其擅长在大量子agent协作中不迷失目标。
这一点至关重要。随着我们构建应用的方式向agent化转变——即AI不再是简单的问答工具,而是能够自主规划任务、调用工具、观察结果并迭代修正的独立执行者——agent能够长时间独立运行、解决难题并带回可用结果的能力,比以往任何时候都更重要。传统的LLM应用是请求-响应模式:用户提问,模型回答。而agentic架构中,AI被赋予工具调用能力(如执行代码、搜索网络、读写文件),并通过ReAct(Reasoning + Acting)等框架实现思考-行动-观察的循环。一个复杂任务可能被分解为多个子agent并行执行,每个子agent负责不同子任务,最终由编排层(orchestrator)汇总结果。在这种架构下,模型需要在数千甚至数万token的上下文中保持目标一致性,协调多个子agent的产出,而不能在中途"迷路"或遗忘初始指令。这对模型的指令遵循稳定性提出了极高要求——在数万token的上下文窗口中,模型必须始终记住最初的目标,不被中间步骤的噪声干扰。
Grok 4.6技术内核:post-training才是关键
用官方的话说,Grok 4.6是在Grok 4.5基础上进行的"全新pre-training + 全新post-training"。而收购Cursor带来的最大红利,恰恰是拿到了Cursor那套疯狂的RL(强化学习)和post-training技术栈。
要理解这一点的意义,需要知道post-training在现代大模型开发中扮演的角色。Pre-training阶段模型从海量文本中学习语言统计规律和世界知识,而post-training阶段——包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)以及各种对齐技术——则让模型学会遵循指令、生成有用回答并在复杂任务中表现出色。近年来业界逐渐认识到,OpenAI的o1系列、Anthropic的Claude 3.5等模型的突破性表现,很大程度上归功于post-training阶段的创新而非单纯增加预训练规模。Cursor团队在代码生成场景中开发的精细强化学习奖励模型和轨迹筛选机制,正是这一领域的前沿成果。
具体来看,4.6经历了比4.5更大规模的补充训练:
- 使用精心筛选的模型生成数据强化推理与高级技术概念
- 高质量工程数据
- 改进的优化器和训练配方
随后,团队用Grok 4.5重新生成SFT轨迹,覆盖不同推理强度、agent框架和STEM、软件工程、知识工作等领域,并通过模型自检过滤掉问题轨迹。所谓SFT轨迹,是指模型在执行任务时产生的完整推理和行动序列——在agentic场景中,一条轨迹可能包含数十个思考-行动-观察的循环。用强模型生成高质量轨迹再用于训练下一代模型,是当前业界流行的"自举"(bootstrapping)策略,类似于AlphaGo中的自我对弈:通过大量生成和筛选来提升数据质量,突破人工标注数据的瓶颈。这种方法的核心洞察在于:即便当前模型整体水平有限,它在某些尝试中仍会产生高质量输出,通过大规模采样和自动验证(如运行代码检查是否通过测试),就能筛选出这些"幸运的好轨迹"作为下一轮训练数据。
这套流程正是让长时任务和agentic工作变得更可靠的核心技术——它通常发生在post-training而非pre-training阶段。
有意思的是,官方还提到Grok 4.6在长轨迹运行中会进行更多自我测试和验证,在推进下一步前先检查自己的工作。这本是Grok系列的老毛病:写完整个方案,有时能跑通有时又崩。
基准测试对比:Grok 4.6真的追上了第一梯队
根据Artificial Analysis的智能指数(Intelligence Index),Grok 4.6拿到了61分,与GPT 5.6 Sol旗鼓相当,紧随Fable 5和Opus 5之后。Artificial Analysis是一个独立的AI模型评测平台,其Intelligence Index综合了多个主流基准测试的结果,为不同模型提供标准化的横向比较,涵盖推理、编程、数学、知识问答等多个维度。

更亮眼的是几个专项跳升:
- Deep Suite:从54%飙升至66%,逼近Sol和Fable,这对一次post-training改进而言是巨大提升
- Cursor Bench:小幅跳升,但已超越5.6 Sol(不过需注意此前有Cursor Bench数据意外混入训练的争议)
- Frontier Code:从56.6提升至61.3,稳居Sol与Fable之间
- GDP Val:出现了作者称"见过最大跳幅之一"的提升
相比一个多月前的4.5,智能指数涨了5分;对比不久前的4.3更是暴涨23分。这个迭代速度确实"疯狂"。
不过Theo也提醒:这些数字并非衡量模型真实智能或实用性的最佳方式。基准测试一直存在"Goodhart定律"的风险——当一个指标成为优化目标时,它就不再是一个好的指标。Goodhart定律最初由英国经济学家Charles Goodhart在1975年提出,原文是关于货币政策的。在AI领域,这一现象表现为:当实验室知道某个基准测试的评分标准后,可能有意或无意地针对该测试进行优化,导致分数提升但实际能力未必同步提升。例如,模型可能在训练数据中接触到与基准测试类似的题目(数据污染),或者post-training过程中过度优化特定任务格式。这就是为什么经验丰富的开发者更信赖自己的实战体验而非公开榜单排名。
Theo举例说Opus 5在各项测试上都很漂亮,第一天用起来也感觉很好,但越用越发现要不断"清理它写的垃圾代码",最终他还是回到了Fable。
Grok 4.6价格分析:藏起来的涨价细节
定价方面,Grok 4.6是每百万输入token 2美元、输出6美元,比Opus 5便宜60%,单任务约0.84美元,与Kimi K3相近但智能略高,在成本-智能的帕累托前沿上占据不错位置。
帕累托前沿(Pareto frontier)是经济学中的概念,指在多目标优化中无法在不牺牲某一目标的情况下改善另一目标的最优解集合。在AI模型市场中,成本和智能构成两个关键维度:理想模型应当既便宜又聪明,但现实中往往需要权衡。位于帕累托前沿的模型意味着在同等价格下没有更聪明的选择,或在同等智能下没有更便宜的选择。在实际的模型选型决策中,帕累托前沿帮助团队快速排除劣势选项——如果模型A在智能和成本两个维度上都不如模型B,那么A就被"支配"了,不值得考虑。但位于前沿的模型之间没有绝对优劣,选择取决于具体场景的权衡偏好。
但Theo敏锐地指出了一个官方"刻意隐藏"的细节:这比Grok 4.5贵了一倍多。
原因在于token效率的倒退。Grok 4.6每次运行的token数量增加了超过30%。即便单价不变,如果模型完成同一任务需要更多token,用户的实际账单就会更高。Token效率是衡量模型经济性的关键但常被忽视的维度——两个模型可能标价相同,但如果模型A用500个token完成任务而模型B需要1500个token,实际成本就差了三倍。Token效率的下降通常源于模型在推理过程中产生更多中间思考步骤(chain-of-thought),或生成更冗长的输出。这是智能提升与成本控制之间的经典权衡:更深入的推理通常需要更多计算步骤,但用户最终为这些额外的token买单。此前Grok 4.5是少数比5.6 Sol更省token的主流模型之一,如今这个优势没了。
"我之前那么兴奋,就是因为Grok 4.5那么高效。看到4.6失去这一点,还挺遗憾的。"
这在实际体验中也能感受到:4.5的测试几乎秒回,快得"有点吓人";而4.6又回到了熟悉的"发出prompt然后去干别的事"的前沿模型节奏。缓存读取价格也从每百万token 3美分涨到5美分。

实战短板:UI设计与3D渲染惨不忍睹
在UI设计测试中,Grok 4.6的表现相当平庸。Theo逐一评价了它的输出:噪点纹理难看、文字过于锐利与模糊背景不协调、卡片太多像老式Tailwind模板、布局老套……"这感觉像老时代的AI垃圾,是GPT 5.0那种感觉。"
作为对比,Fable的设计"好得离谱",即便是常被吐槽的5.6 Sol也明显更强。

更糟的是3D游戏移植测试。Theo有个用Opus做的水族馆克隆游戏"fish slop",他习惯让新模型基于旧代码库重建来考察端到端理解能力。结果:
- 2D版本:元素尺寸全错,鱼太小、饲料太大,交互高亮异常,节奏也不对。连开源模型Kimi K3都做得明显更好。
- 3D版本:直接黑屏失败。这是Theo测过的第一个连3D环境都渲染不出来的新模型——连GPT 5.4都能开出3D场景。给了截图让它修复后,左右方向被诡异地反了,地面物体位置全错,鱼模型"简直是垃圾"。
他直言:"这是我很久以来见过最差的一次3D尝试,像去年的水平。"相比之下,开源的Kimi在3D建模上呈现出"代际差距"般的领先。
这一短板揭示了一个重要现象:post-training的优化方向具有选择性。xAI显然将强化学习资源集中在了代码工程、推理和agent任务上,而非视觉设计或空间推理。在有限的训练预算下,模型能力的提升往往是零和的——在某些维度上的飞跃可能伴随着其他维度的停滞甚至退步。
真实工程任务:Grok 4.6的真正强项
但在真正的工程任务上,Grok 4.6挽回了不少颜面。
在一次安全审计中,它甚至在git历史里找到了之前的审计记录,指出了auth broker、worker隔离、存储控制面等真实问题,并给出了锁定端点、移出URL中的身份token等合理建议。

更有价值的是一个从ACP迁移到Cursor SDK的复杂任务。ACP(Agent Communication Protocol)是AI agent之间通信的标准化协议,定义了agent之间如何发现彼此、交换消息和协调行动的规范,而Cursor SDK则是Cursor编辑器提供的开发者工具包,允许第三方应用与Cursor的AI能力深度集成。从ACP迁移到Cursor SDK意味着从一个通用的agent通信框架转向Cursor生态特有的集成方式,通常涉及事件流处理、bindings重写和API适配等大量工程工作。这类迁移任务是考验AI工程能力的绝佳场景,因为它要求模型同时理解两套API的语义差异、处理向后兼容性问题,并在数千行代码中保持一致的架构决策。
Theo让它审计T3 Chat的Cursor实现方案,它准确识别出了当前bindings的真实痛点。虽然过程中出现了"卡在plan mode"、事件流处理异常等CLI层面的问题,但在最终的实战中,它完成了一个近千行代码的PR,处理了网站的多处功能缺口,还遵守了Theo设定的规则(在PR评论开头标注是哪个模型代表他回复)。
随后Theo让它做更难的事:翻查真实机器上的操作历史,找出事件处理的缺口,并在原PR基础上stack一个新PR。这需要模型协调大量竞争性上下文而不迷失方向——这正是Grok 4.5曾让他惊喜的能力,也是长时agent任务中最关键的能力维度。在实际的软件工程工作流中,"stacking PRs"意味着在一个尚未合并的变更基础上继续开发,模型需要同时追踪基线代码状态、第一个PR的变更、以及当前正在进行的第二个PR的变更,这种多层次的状态管理对上下文理解能力是极大的考验。
值得一提的是,官方的Grok Build CLI本身体验相当出色,图片渲染等细节做得很好。
综合评价:追上了第一梯队,但失去了独特性
Theo用几个维度对比了Grok 4.6、Fable 5和5.6 Sol:
| 维度 | Grok 4.6变化 |
|---|---|
| 成本 | 退步(约6分,token效率下降导致更贵) |
| 智能 | 提升(约6.5分,明显更聪明) |
| 速度 | 明显退步(约5.5分,token变多变慢) |
| 彻底性 | 略有改善(仍会漏东西) |
| 编排能力 | 略强于多数模型(5.5分) |
核心矛盾在于:**Grok以前唯一的领先项——速度和成本,这次都退步了。**它以前的独特价值不在于在某些任务上追平前沿,而在于速度和成本与前沿拉开足够距离,让它"独特地有用"。而4.6在追逐前沿智能的同时,牺牲了这份独特性。
这折射出AI模型竞争中的一个深层张力:当所有实验室都朝着相同的基准分数冲刺时,差异化反而可能来自看似"次要"的维度——速度、成本、特定场景的极致优化。一个在基准测试上排名第四但快三倍的模型,对许多实际工作流的价值可能超过排名第一但慢得让人失去耐心的模型。这种现象在技术产业中并不罕见——正如数据库领域中,SQLite从未试图在TPC基准测试上击败Oracle,却因为零配置、嵌入式部署的独特定位成为全球部署量最大的数据库引擎。AI模型市场最终可能也会演化出类似的生态位分化,而非所有玩家都挤在同一条赛道上。
展望:真正的期待在Grok 4.7
Theo坦言,Grok 4.6不是他的最爱,视频拍完后大概率不会常用。但它让他对Grok 4.7充满期待——这也解释了为什么Elon现在更愿意谈4.7而非4.6。据称4.7初始训练已完成,正在补充"海量SpaceX公司数据"。
用SpaceX数据进行补充训练是一个值得关注的信号。SpaceX拥有全球顶尖的航天工程数据——从火箭发动机设计、轨道力学计算到制造工艺优化,这些数据代表了物理世界中最复杂的工程挑战。如果Grok 4.7能够有效吸收这类高度专业化的工程知识,它可能在物理推理、复杂系统设计等维度上建立独特优势——这正是通用训练数据难以覆盖的领域。
未来的方向已经很清晰:Grok正在极快地追赶。而对整个行业来说,这是好事——我们需要更多竞争、更多好模型、更多人为了把价格打下来而拼命。智能确实在变便宜,只是这一代Grok暂时没能同时守住便宜和快这两张王牌。
核心要点
核心要点
相关推荐

Qwen3 27B深度评测:推理能力强大却过度思考的解决方案
深度评测Qwen3 27B开源模型的推理能力与过度思考问题。分析27B参数规模的性能优势、过度思考的原因与代价,并提供关闭思考模式、分场景配置等实用优化建议。

Gemini 3.7 Flash发布:智能体经济学之争全面打响
Google DeepMind发布Gemini 3.7 Flash,聚焦编程与智能体能力,激进定价抢占市场。OpenAI推出Ultrafast押注延迟,DeepSeek持续施压成本效率,AI行业智能体经济学竞争格局深度解析。

AI算法工程师自学路线:从零基础到拿到Offer的完整规划
详解AI算法工程师自学路线图,涵盖基础阶段、核心算法、CV与NLP方向选择及转行就业策略。帮助零基础和跨专业学习者建立系统学习规划,掌握从需求分析到模型部署的全链路能力。