Grok 4.5深度解析:专为编程与Agent而生的工程大脑

Grok 4.5:马斯克体系的"工程大脑"
7月8日,马斯克在内测反馈"强烈正面"的第二天正式推出了Grok 4.5。官方定义只有一句话:第一个专门为编程和智能体(Agent)训练的模型。这个措辞颇有讲究——它的训练目标不是更会聊天,而是更会"造东西"。
从底层看,Grok 4.5基于全新的V9基础模型,参数达到1.5万亿,是上一代V8的三倍,使用数万张英伟达GB300 GPU训练。值得注意的是,1.5万亿参数属于目前业界最顶级的稠密模型序列——与GPT-4等采用MoE(混合专家)稀疏架构不同,稠密模型每次推理都会激活全部参数,对算力要求更高,但在特定任务上的一致性往往更强。
MoE(Mixture of Experts)架构由Google Brain在2017年提出,核心思想是将神经网络层替换为多个并行"专家"子网络,每次推理由门控网络(Gating Network)动态选择激活少数几个专家,从而在参数总量数倍增长的同时保持计算量基本不变。GPT-4据报道采用8专家MoE、每次激活2个,Mixtral 8x7B则是典型的开源MoE实现。稠密模型的全参数激活特性使其在编程任务上具有天然优势:代码生成要求输出高度一致、逻辑严密,而MoE的专家路由随机性可能导致长序列生成中的风格漂移,稠密模型每个token都经过相同的完整参数处理,行为更可预测。
英伟达GB300是Blackwell Ultra架构的旗舰型号,其核心创新是将两颗B200 GPU芯片与一颗Grace ARM CPU通过NVLink-C2C(Chip-to-Chip)高速互连封装在同一基板上,实现CPU与GPU之间900GB/s的双向带宽,彻底消除传统PCIe总线的瓶颈。单颗GB300的HBM3e显存容量达288GB,总显存带宽超过16TB/s,相比H100的3.35TB/s提升近5倍。第五代NVLink使单节点8卡间带宽达1.8TB/s,大幅缓解万亿参数模型训练中的通信瓶颈。数万张GB300构成的集群(如xAI Memphis超算中心)总算力峰值达数十ExaFLOPS量级,数万张的集群规模意味着超过数十亿美元量级的算力投入。
其数十万任务的强化学习数据集覆盖编码、科学、工程、数学,每秒输出速度80 token,上下文窗口高达50万——这约等于40万个英文单词,足以容纳一个中型软件项目的全部源代码、文档与提交历史,几乎能一次性塞进一个大型项目的完整代码库。
实现50万token超长上下文的核心技术挑战在于注意力机制的计算复杂度:标准Transformer的自注意力计算量随序列长度平方增长,50万token的注意力计算量是4096token的约15000倍,工程上完全不可行。当前的解决路径是多项技术的组合:FlashAttention通过分块计算将注意力操作分解为可放入SRAM的小矩阵乘法,避免将完整注意力矩阵写回HBM显存,实现IO复杂度的大幅降低;RoPE(旋转位置编码)配合YaRN等频率插值技术可将有效上下文从训练长度扩展到数倍;稀疏注意力和滑动窗口注意力则进一步降低部分层的计算量。早期GPT-3的上下文仅4096个token,2024年Gemini 1.5 Pro将上限推至100万token,当前顶级模型的竞争已进入"百万token"量级;超长上下文对于编程Agent的意义在于无需将代码库切片分批处理,避免传统RAG(检索增强生成)切片检索时的语义割裂,大幅降低跨文件理解出错的概率。

马斯克给出的定调翻译过来是:内部评估中Grok 4.5与Claude Opus大致相当,但"快得多"。**能力、速度、成本三者兼顾,才是它真正的竞争力。**他特意强调,这些能力是在"闭环解决现实世界的实用性"中锤炼出来的,而非刷基准测试。
Cursor训练数据:花钱也买不到的护城河
这次训练最值得关注的是Cursor数据的加入。SpaceX斥资约600亿美元收购了这家AI编程公司,其数据的珍贵之处在于——它不是网上扒来的旧代码,而是数百万程序员在真实项目中写代码、AI给出建议、人类接受或打回的完整过程。
每一条数据都自带"对不对"的反馈信号,这种数据用钱根本买不到,SpaceX干脆把整个公司买了下来。 这背后是AI训练范式的核心迁移:传统预训练阶段依赖海量文本的无监督学习,而RLHF(基于人类反馈的强化学习)阶段则引入奖励信号,让模型在交互中持续优化行为。RLHF由OpenAI在InstructGPT论文(2022)中系统化提出,是ChatGPT等对齐语言模型的核心训练范式,标准流程分三步:预训练语言模型、用人工标注偏好数据训练奖励模型、再用PPO等强化学习算法优化策略。RLHF的核心瓶颈在于人工标注的成本与规模限制——每条偏好数据需要专业标注员比较两个输出的质量,难以规模化。
Cursor场景的独特之处在于提供了"隐式人类反馈":程序员接受AI建议即正信号,拒绝并修改即负信号,且每条数据都附着真实代码上下文与功能正确性的客观验证——代码能否运行、测试能否通过,远比纯人工标注偏好更贴近真实使用场景,信息密度也更高。互联网上的静态文本已趋于饱和,动态交互数据才是新的稀缺资产,这也是OpenAI、Google等难以从外部购买复制的竞争壁垒。
更关键的是,Grok的测试环境设在特斯拉和SpaceX内部,工程师围绕火箭、卫星、工厂机器人实际使用,处理大型代码库、跨仓库长任务、复杂Excel建模等硬核工作。
Grok 4.5性能实测:十分之一价格,95%的性能
虽然基准测试不宜盲目迷信,但Grok 4.5的数据仍值得作为参考。在Artificial Analysis智能指数上,它得分54分排名第四,前面是Gemini 3、GPT-5.5和Opus。
但进入编程专项榜,格局就不同了。在Cursor编程实战榜上,Grok 4.5以66.7%排名第三,仅比第一名Gemini 3 Max的70.5%低约3个点。然而在成本上,Gemini完成一个任务需17.32美元,Grok 4.5仅需1.51美元——十分之一的价格换来95%的性能。
在SWE-Bench Pro软件工程榜上,它以64.7%压过了GPT-5.5的最高档。SWE-Bench由普林斯顿大学团队发布,从GitHub上12个真实Python开源项目(包括Django、scikit-learn、pytest等)中抽取近2300个真实Issue,要求模型生成代码补丁并通过原有单元测试套件。与LeetCode式算法题不同,SWE-Bench测试完整的软件工程能力链条:理解自然语言问题描述、在数万行代码库中定位相关文件、生成不破坏既有功能的补丁——模拟的是真实软件工程师处理生产代码库的日常工作,每条样本都要求模型在既有代码约束下进行有边界的修改,而非孤立地实现算法。2024年初顶级模型在此榜通过率仅约4%-5%,至2025年头部模型已突破60%,这年内近15倍的提升直接折射出编程Agent能力的爆发式进步,也直接对应模型在Cursor等真实工具中的可用性。
效率差距同样惊人:同样任务,Grok 4.5平均输出15954个token,而Opus Max需要67020个,话少说4.2倍,省下的全是真金白银。

一位名为Dan的用户实测:同一任务,Grok 4.5用56秒完成且结果有效,而竞品跑了十分钟、烧掉9.3万token。综合智能指数与效率计算,真实任务成本差距可达约17倍。
数据飞轮:外人插不进手
Grok 4.5的真正野心,是成为整个马斯克体系的"工程大脑"。特斯拉AI负责人蔡云达发帖称,管Grok 4.5叫"编程Agent"都是低估了它——他的团队用它排查制造流程中牵一发而动全身的零件固件问题。
这里形成了一个闭环飞轮:**Grok越强,工程越快;工程越快,回流数据越多;数据越多,Grok又更强。**这个循环一旦转起来,外人根本插不进手,也不需要外部数据。马斯克预告下一个两万亿参数版本本月完成训练,8月交付客户,目标是闭环解决特斯拉、SpaceX、Neuralink等真实工程问题。
猎鹰9号:钢铁上的同一套逻辑
看似与AI无关的第二条新闻,其实套路一模一样。SpaceX现役最能干的两枚助推器B1067和B1071,本周合计飞行将达71次。B1067飞第36次打破自己保持的35次纪录,B1071飞第35次追平纪录。
**这两枚火箭单独扛下了猎鹰9全部飞行量的一成多,是人类火箭史上独一份的成绩。**传统火箭每枚飞一次就报废,其他家的复用还在个位数徘徊。

复用火箭的门槛:不在火箭本身,而在闭环
马斯克的逻辑是:火箭第二次飞之后每飞一次都是纯利润,飞36次意味着34次纯利润。真正的门槛不是造一枚结实的火箭,而是一整条闭环——从设计、制造、飞行、回收、检查、翻修,再加上数百次飞行数据的持续喂养。
SpaceX手握海量遥测数据,能提前算出哪个零件该换、哪个能修,就像汽车按公里保养,只是它的"里程表"精确到每台发动机的每次燃烧。这套预测性维护(Predictive Maintenance)体系的底层逻辑与Grok的数据飞轮如出一辙。
预测性维护通过持续采集传感器数据建立设备"健康基线"模型,在故障发生前预判零件寿命,替代传统航天业"过度保守的安全余量"的做法。传统航天机构的策略是为发动机等关键部件设置极保守的安全寿命上限——某型发动机理论寿命500秒,实际仅允许使用200秒,剩余余量作为缓冲抛弃,每次飞行后大量可用零件随火箭本体一同废弃。SpaceX的路径则反其道而行:每枚助推器搭载数千个传感器,每次飞行产生TB级遥测数据,涵盖梅林发动机燃烧室压力、涡轮泵转速、热防护层温度等几百个维度,机器学习模型据此建立"健康特征指纹",在翻修前精确预判每台发动机的实际可用状态。B1067飞行36次意味着它贡献了比竞争对手整个机队总和还多的真实飞行数据——这些数据又反过来进一步提升预测模型精度,形成与Grok数据飞轮同构的正反馈循环,本质是用数据密度替代安全冗余。要复制它,需要同时凑齐巨额投入、快速试错文化和垂直整合能力——地球上目前只此一家。
FSD自动驾驶:让Grok当司机的耳朵
近日,车主克里斯的帖子获得9万多次浏览,痛点很日常:希望FSD能像真人司机一样听懂"左边那栋白房子刚过的SUV"这类自然语言指令。特斯拉AI软件副总裁Ashok只回了三个词:working on it(正在做)。

这个需求戳中的不是FSD会不会开车,而是"人与车的自然沟通"这最后一层。小区私家车道、别人家门口这些最后一公里场景,靠地图和规则永远打不通。解法是让车一边用摄像头看街景,一边听懂你的话,把"白房子"三个字和镜头里的房子对上号。
在技术上,这属于视觉-语言多模态对齐(Vision-Language Alignment)问题:将抽象自然语言描述实时锚定到摄像头图像中的具体像素区域,再转化为导航指令。OpenAI的CLIP(2021)通过对比学习在4亿图文对上训练图像编码器和文本编码器,开创了图文跨模态理解的基础范式,但车载场景的挑战远超静态图像理解:需要在连续视频帧流中实时处理(驾驶安全要求端到端延迟低于200毫秒)、应对光照突变与遮挡,并将"左边白房子刚过的SUV"这类包含时序、空间关系和物体属性的复合描述实时锚定到帧中的具体目标。
现有车载系统通常将视觉感知与语言理解作为独立模块串联,存在语义鸿沟,需要一个能同时处理视觉帧流和语言输入的统一模型。将Grok接入FSD的深层意义在于引入大模型的常识推理能力作为"兜底层",处理传统感知模型无法泛化的长尾指令场景——技术路径可能是"云端大模型负责语义理解+车端轻量模型负责实时感知"的分层架构,在满足延迟要求的同时引入完整的语言理解能力。
马斯克明确表示,自然语言控制FSD将通过Grok实现。**这条线让Grok坐进车里当司机的耳朵,与工厂里的编程Agent是同一盘棋的两个子。**这也是为Robotaxi铺路——乘客不会报经纬度,只会说"到我家白房子门口停",而每次乘客纠正都是带着人类意图的高质量训练数据。
其他值得关注的动态
- 星舰第13飞:日期暂定7月15日下午5:45(美中时间),但B20还需完成33台猛禽发动机的全量静态点火测试。
- 日本iSpace购买星舰运力:官宣用星舰做低成本月球货运,买下500公斤登月运力,最早2030年落月。生意模式从"国家项目包整枚火箭"变成"按公斤零售",iSpace做月球最后一公里的中间商。
- 特斯拉Semi进港口:物流商Pharos Mobility将部署20辆Semi重卡进入洛杉矶港口群,选择路线固定的短驳场景,绕开电动重卡最怕的长途续航难题。
- 新泽西法案A3968:要求Robotaxi在摄像头外加装激光雷达等传感器,若按字面执行,特斯拉纯视觉方案将被挡在门外。
结语:方向找对了,就会一路狂奔
当xAI所有联合创始人离开时,市场普遍唱衰马斯克在大模型上的前景。但仅用两三个月,Grok就取得了如此成绩。更重要的信号是:Grok已从"追求前沿研究"转向"SpaceX式的实用主义"——方向找对了。
无论是Grok的"一美元买多少智力",还是猎鹰9的"一枚火箭飞多少次",本质都是同一套逻辑:省在软件上或省在钢铁上,靠的都是数据闭环与极致效率。以马斯克体系的执行力度和算力储备,很难想象它在未来一两年内追不上顶尖模型。未来可期。
核心要点
相关推荐

Spring AI 2.0实战:Agent开发核心能力与代码生成助手项目
深入解析Spring AI 2.0核心更新,重点讲解Agent自主思考、工具调用、循环迭代等新增能力,并通过类Claude Code代码生成助手实战项目,覆盖ChatClient、Streaming、Memory、Tools、MCP等关键技术栈。

Continue开源AI编程助手:免费平替Copilot完整配置教程
详解Continue开源VS Code扩展的安装配置与实测体验,支持自由接入Gemini、Claude等模型,实现零成本AI编程辅助。含Gemini免费API配置流程、内联编辑演示及与Copilot对比分析。

法院驳回合理使用抗辩,令YouTube揭露动漫解说频道身份
法院驳回YouTube动漫解说频道的合理使用抗辩,并下令平台揭露匿名运营者身份。本文解析合理使用四要素为何难以适用于影视解说内容,以及该裁决对二创生态和内容创作者的深远影响。