Cursor三连发实测:Grokbot、Origin与Grok 4.6值得用吗?

博主实测Grokbot、Origin与Grok 4.6,Grok正从第三方势力变成真正的竞争者。
本文是一位AI工具博主对xAI/Cursor阵营三款新产品的深度实测报告。Grokbot以「单连接器绑定多账号」为核心差异点,解决了Codex、Claude未能打通的多账号痛点,但过于封闭、不可魔改的设计让偏好深度定制的用户难以满足。Origin定位为agent-native的GitHub替代品,理念清晰,但当前实质仍是GitHub API的包装层,尚不足以说服深度依赖GitHub生态的用户迁移。Grok 4.6则是最大亮点,在博主自制的Claire加权评测指数(70%个人口味+30%LLM评判)中超越Sonnet 5和Opus 5,设计输出风格新鲜、不落俗套。综合来看,博主认为Grok已成为真正值得认真对待的竞争者,或许现在正是所有人都该「入坑」Grok一点的时候。
OpenAI 与 Anthropic 之间的对决,似乎正在被一股新势力搅动。这位 How I AI 博主直言:她认识的很多人正在悄悄成为「Grok boy」。在她看来,自 Cursor 被 SpaceX 收购(视频中提到金额约为 600 亿美元)之后,来自 Cursor / xAI 阵营的一系列新产品开始密集释放,而围绕 Grok 模型在编程领域的正面评价也越来越多。
这篇实测覆盖了三款产品:多智能体助手 Grokbot、对标 GitHub 的代码托管平台 Origin,以及模型 Grok 4.6。博主基于近一周的深度使用给出了褒贬分明的判断。
Grokbot:简单到「让人无从下手」的多智能体助手
Grokbot 是一款桌面端和移动端都可用的聊天式智能体应用,定位类似「托管版 OpenClaw广告」,但更简单、更易上手。它的界面明显借鉴了 iMessage 的对话气泡风格,左右气泡来回聊天。
博主对 Grokbot 的核心理念非常认同——多智能体分工。她不希望「一个智能体统治一切」,而是希望每个 agent 都有名字、有明确职责。她在自己账号里设置了多个 Grokbot:对接 ChatPRD 的产品经理机器人「Proddy McProd」、追缴发票和销售的「moneymaker bot」、做案例研究的「case study buddy」,以及监控数据趋势的分析机器人。

杀手级功能:多账号连接器
如果只让博主点出 Grokbot 的一个「魔法」,那就是插件(plugins)体系。她一直认为 Cursor 是最好的 MCP 客户端,而 Grokbot 把这套优秀的连接器体验完整继承了下来。
真正的差异化在于:同一个连接器可以绑定多个账号。有两个 Gmail 就连两个,身处七个不同的 Slack 就全部接入。她坦言自己有「大约一百万个」邮箱和 Slack 账号,而 Codex、Claude 至今都没解决这个痛点。她已经把四个邮箱接入了 Grokbot,能在一个界面里横跨所有账号操作,被她称为「巨大、巨大、巨大」的优势。

此外,每个 Grokbot 都自带一台虚拟机,可以使用 Chrome、终端并访问文件,相当于一个轻量版的 open-claw。创建流程也极其简单:建一个 bot、启动机器、告诉它要做什么即可。
MCP(Model Context Protocol)是 Anthropic 于2024年底提出的开放协议,旨在为大语言模型提供统一的外部工具与数据源接入标准,类似于「AI 版的 USB 接口」。MCP 客户端负责管理这些连接器(插件),调度模型在需要时调用外部服务——如邮件、日历、代码仓库等。Cursor 因其对 MCP 的深度支持和良好的连接器管理体验,被不少开发者视为目前最成熟的 MCP 客户端之一。Grokbot 继承了这套连接体系,并在此基础上实现了「同一连接器绑定多账号」的扩展,填补了当前主流 AI 助手普遍存在的多账号管理盲区。
优点即缺点:太简单、不可魔改
博主对 Grokbot 的不满,恰恰源于它的简单。她无法像玩弄自己的 OpenClaw 那样去「黑」它——那些混乱、技术化、难以驾驭的 agent 反而带给她掌控与创造的乐趣。而 Grokbot 开箱即用、几乎不需要维护,也就少了那份「捏泥人」般的亲手雕琢感。
更实际的两个短板是:你无法自选模型,也缺乏类似 soul.md 那样对 agent 配置、人格的深度控制;而且它运行在第三方系统上,不在本地、不受你掌控。她还吐槽模型的「vibes」不太对,带着典型的「AI slop」味道——那种「not this, not that」的套话和别扭命名,不是她想要的聊天对象。
结论很明确:如果你要的是高度可调、可魔改、透明的 agent 搭建体验,Grokbot 不是;OpenClaw、Hermes 更合适。但对想给员工配一个开箱即用全能助手的 Cursor 企业客户来说,Grokbot 极具吸引力。
Origin:Cursor 的 GitHub 替代品,愿景清晰但为时尚早
Origin 是 Cursor 在其年度大会上宣布、近日才进入 early access beta 的代码托管产品,被定位为应用内的「code base」。Cursor 的赌注不是简单复刻 GitHub,而是打造一个 agent-native(智能体原生)的 GitHub 替代品。

它保留了 Git 的全部基本要素——代码、diff、Pull Request,但界面与交互是为智能体协作而设计的,尤其是与 Cursor 云端 agent、桌面端和 CLI 深度打通。Agent 可以回复评论、被指派为 reviewer,还有一小批 CI/CD 扩展(例如在 Vercel 上构建预览分支)。
现阶段:更像 GitHub API 的一层包装
博主的实测体验并不惊艳。她(略带戏谑地)指出,Origin 偏巧在 GitHub 发生重大宕机的当天发布,导入仓库时就遇到了麻烦。更关键的是,当前的 GitHub 集成「看起来就是套在 GitHub API 上的一层壳」——虽然做了重新设计,bug bot 反馈和 Cursor 建议的呈现方式有一些亮点,但本质上仍是同步过来的 GitHub,甚至运行还更慢一些。
对于已经深度投资 GitHub 生态的用户(几乎所有人)——自动化、Actions、Code Owners 全都在那里——她认为目前 Origin 给出的理由还不够。「我需要看到某个让我惊叹的东西,才愿意点开那把锁。」
不过她也承认 Cursor 正在打地基:让你的仓库先迁进来,让 bug bot 和 Cursor 成为仓库里的一等公民。她判断,这是「一段非常非常漫长迁移的最最早期阶段」,值得持续关注——毕竟当下没人对 GitHub 满意,稳定性糟糕,又迟迟没给出真正 AI 原生的重构体验。
「Agent-native」(智能体原生)是近期 AI 工具领域频繁出现的设计理念,指产品在架构层面就将 AI agent 视为一等公民——而非事后叠加。传统代码托管平台(如 GitHub)的工作流以人类开发者为中心:提交、审查、合并均预设由人操作。Agent-native 的替代品则试图重新设计这些原语:agent 可以被指派为代码审查者、自动响应 PR 评论、触发 CI 任务,整个协作流程对机器与人类同等友好。这一方向的挑战在于,GitHub 多年积累的 Actions、Webhooks、Code Owners 等生态已形成强大的网络效应,新平台需要提供远超「重新设计界面」的差异化价值,才能撬动迁移意愿。
Grok 4.6:出乎意料的设计能力
第三款是让博主身边人纷纷发消息说「我好像有点喜欢 Grok 了」的模型 Grok 4.6。她注意到 Cursor 已经把部分默认模型切到了 Grok,这也推动更多人去尝试。
她抛开各家自选的 benchmark,采用自己的「How I AI」评测法:盲测 PRD、原型、设计线框和技术改动,其中设计评测让模型自主决定如何重构页面,并新增了一个交互复杂的理赔裁定线框任务。最终的 Claire 加权指数由 70% 她的口味 + 30% LLM 评判 构成。

结果颇有意思:Grok 4.6 紧跟她的最爱 GPT-5.6,在 Claire 指数上超过了 Sonnet 5 和 Opus 5。她本人依然把 GPT-5.6 作为默认,尤其在 PRD 写作、复杂密集 UI 上偏爱它;Opus 5 被 LLM 评为技术 bug triage 的最佳实现者;Sonnet 5 则在 OpenClaw 式 agent 的聊天来回中稳居第一。
为什么她会喜欢 Grok 的设计?
博主给出一个有趣的解释:她能一眼认出 GPT 和 Claude 的「slop」——GPT-5.6 偏爱森林绿,Claude 钟情棕/褐/橙的组合。而 Grok 4.6 带来了一股「新鲜空气」,既非森林绿也非那套配色。它做的咖啡店点单交互系统「相当可爱」,技术事故 triage 应用和编辑页面也完成得不错。
值得注意的一个反差是:如果把她的个人口味剔除、只看 LLM 评判(她用较为严苛的 GPT-5.5 打分,并非 Anthropic 模型),那么 LLM「讨厌 Grok、偏爱 Claude Opus 和 Sonnet、不喜欢 GPT-5.6」。也就是说,模型倾向 Claude,而她本人倾向 GPT-5.6 与 Grok 4.6 的设计。
她强调这只是纯输出评测,不含与模型对话的体感。但结论是:Grok 是一个真正的竞争者,没有哪项表现是糟糕的,很多结果都优于开箱默认模型。
「AI slop」是 AI 内容讨论中流行的俚语,用来形容模型生成的高度同质化、套路化输出——无论是视觉设计上反复出现的同款配色方案,还是文字中充斥的「Certainly!」「It's important to note that」等模板化表达。由于大型模型在训练数据上存在重叠,不同厂商的模型往往会收敛到相似的「安全审美」,例如文章中提到的 GPT 偏爱森林绿、Claude 偏爱棕橙系配色。这种可识别的风格趋同对于专业设计评测而言是一个干扰项,因为评测者的偏好本身会受到「刺激新鲜感」的影响——Grok 4.6 在设计任务中的得分优势,部分可能正是来自于它尚未建立起被广泛识别的视觉惯性。
总结:也许我们都该「入坑」Grok 一点
综合三款产品,博主的态度是「喜欢 Grokbot,暂未被 Origin 说服」,而 Grok 4.6 让她愿意重新多用一点 Cursor 来写代码。
结合 Cursor 的 harness、对连接器体验的打磨,以及对设计、代码托管等新范式的投入,她给出的判断是:也许现在是所有人都该某种程度上成为「Grok boy」的时候了。当然她也保持透明——目前大量时间仍在 Codex 和 GPT-5.6 系列模型上,但 Grok 的表现足以让她重新评估。
相关推荐

统计推断基础详解:样本方差的三种收敛性证明
本文详细讲解统计推断基础中样本方差估计量的三种收敛性证明:依概率收敛、几乎必然收敛及渐近正态性,涵盖强大数定律、中心极限定理、Slutsky定理等核心工具的应用条件与推导技巧。

面向家庭的AI助手CC:一次新的产品方向探索
一款面向家庭的AI Agent产品CC引发关注。本文分析家庭AI助手这一差异化方向的价值、机会与在隐私、多用户协作、用户留存等方面的核心挑战。

月产2000个PR的秘密:Lauren的AI Agent信任工作流
SpaceX AI工程师Lauren分享如何月产2000个PR的AI Agent工作流:核心不是提示词,而是通过验证技能、Agent友好代码库、静态分析和Dune框架构建对Agent的信任,打造个人"米其林厨房"式软件工厂。