[控场AI]
· 8 分钟阅读· 4,153 字

GPT-6发布:AGI临界点已至,工具边界正在消失

GPT-6发布:AGI临界点已至,工具边界正在消失

GPT-6凭借自主学习工具的能力模糊软件边界,被视为AGI到来前最后一个临界里程碑。

OpenAI发布的GPT-6(实为GPT-5.6级别的自训练模型)以「看一遍就会用陌生软件」的工具理解能力为核心突破,彻底绕开了软件公司不愿开放MCP接口的商业壁垒。在未知规则游戏测试中,GPT-6拿下99分,远超人类最高的30余分,证明其已具备类人的快速归纳与元认知能力。官方将此次发布定义为「AGI时刻」——不是宣告AGI已经到达,而是意味着AGI只剩时间问题,且后续版本迭代速度将远超人类节奏。当前最大制约是算力成本,但作者预测国产廉价平替可能在数月内追平。对白领知识工作者而言,这次发布标志着一个真实倒计时的开始。

一场被称为「划时代」的模型发布

OpenAI这次直接跳过了扭捏的版本命名传统,破天荒地推出了GPT-6(据传实为GPT-5.6级别的自训练模型)。回顾GPT系列的历史,每一次版本迭代都远慢于预告:GPT-5比传闻的发布时间晚了整整一年。而这一次的5到6,来得又快又猛。

更值得一提的是发布策略。由于采用灰度发布,部分用户能用、部分用户用不到,OpenAI给出了一个有意思的承诺——如果你用不到新模型,每天补偿一张重置卡。这种「傲胜」(Alpha Strike)式的补贴力度,让不少长期用户直呼GPT在日常使用场景下的性价比反而是最高的。作者坦言,以Pro档(约100美元/月)折算下来,日常使用成本甚至比DeepSeek广告、智谱等国产性价比模型还低。

模糊工具边界:GPT-6最核心的突破

GPT-6最颠覆性的特点,是它把软件与工具之间的边界做得极其模糊。在官方发布会的宣传片中,用户不需要任何键盘,纯靠对话就能操纵多个软件、在软件间跳转,甚至打通家里的3D打印机,从「我想做一个火箭」到最终生成火箭模型,全程无需编码、无需跳出GPT。

完全没有任何的键盘

要理解这一步为何重要,得先看模型操控工具的技术路径。早期模型依赖MCP(Model Context Protocol)——本质上是软件官方开放一个受限接口,模型只能调用软件公司允许的功能。比如Figma虽然开放了部分MCP让Codex绘图,但真正的全局能力被死死锁在需要单独付费的Figma Make里。原因很现实:如果所有操作都能绕过软件本身,软件公司靠什么赚钱?

所以过去的困局是:软件公司不开放MCP,模型就永远无法真正操作软件。而模型自主理解软件又极难——它无法像人一样读取文字层级,只能靠视觉模型「一帧一帧截屏、识别文字、操作鼠标、再截屏」的笨办法。绝大多数软件没有为盲人做无障碍适配,模块无法被光标直接切换,模型学一套复杂软件的成本高到不切实际。

MCP(Model Context Protocol)由Anthropic于2024年底提出并推动普及,是一种标准化协议,允许AI模型通过统一接口与外部工具、数据库和软件服务交互。其核心思路类似于USB接口的标准化:软件开发者只需按照协议规范暴露特定功能,模型便可调用,而无需为每款软件单独开发适配层。然而MCP的根本局限在于它是「许可制」的——软件公司只开放他们愿意开放的功能,商业敏感或核心变现功能几乎不会纳入其中。这使得MCP路线下的AI操控能力天然受制于软件生态的商业意愿,而非模型自身的技术上限。与MCP并行的另一条路线是计算机视觉驱动的GUI操作(即截屏-识别-点击循环),代表项目有Anthropic的Computer Use和各类开源RPA框架,但其准确率与效率长期无法满足复杂工作流需求。GPT-6的突破,正是在这两条传统路线之外开辟了第三条路:靠模型自身的快速学习与泛化能力,直接理解任意界面的操作逻辑。

达到99分的工具理解能力

GPT-6打破了这个僵局。它展现出匪夷所思的工具学习能力——「看一遍就知道怎么用」。据B站UP主「神凡老狗」的评测,在制作马里奥游戏的测试中,只有GPT-6在无人要求的情况下主动去GitHub找了原始素材,像真人一样思考「网上有现成的,我为什么要自己重做」。它做出的马里奥音效、材质、动画都跟真的一样,甚至自己做出了第二关。

他们都已经到了99分

博主「杨博士说AI」则揭示了另一个维度:传统的SWE-bench、模型竞技场等测试已经被打穿,很多领域逼近满分,于是新的测试赛道被开辟出来。在一个专为模型设计的「未知规则小游戏」测试中——玩家需要在短时间内自行猜出游戏规则并通关——GPT-6拿到了99分接近满分,而人类最高分只有30多分,其他模型也仅在40分左右。

这个成绩的意义在于:它证明GPT-6能像人一样,在没有说明书的情况下快速理解并使用陌生工具。这恰恰绕开了「软件公司不开放接口」的根本障碍。

SWE-bench是由普林斯顿大学研究团队于2023年发布的软件工程评测基准,要求模型在真实的GitHub代码仓库中定位并修复实际存在的Bug,被业界视为衡量AI编程能力的黄金标准之一。该测试的特殊价值在于它考察的是「在复杂、真实、无明确提示」的环境中解决问题的能力,而非封闭题库中的知识检索。随着顶尖模型在SWE-bench上的得分逼近乃至突破60%,其区分度迅速下降,推动研究者开发出更难的SWE-bench Verified及针对多步推理的新型基准。文中提到的「未知规则小游戏」测试代表了新一代评测思路的转向:从考察知识积累转向考察元认知与快速归纳能力——即模型能否在完全陌生的规则体系中,像人类婴儿学习语言一样,仅凭观察与试错快速建立内部模型。GPT-6在此类测试中与人类的巨大分差,揭示的不只是编程或知识层面的领先,而是认知架构层面的质变。

为什么说这是AGI的临界点

OpenAI产品负责人对外宣称这是「AGI时刻」。作者对AGI标准的变迁有清醒认识——按图灵测试的老标准早就达到了,但物理世界理解、上下文八卦信息等复杂能力仍有欠缺。他认同的AGI定义是:基本能替代人类几乎所有工作内容。

它所说的AGI时刻到来

更深层的逻辑是:AI实现自我迭代的最大阻碍,除了算法与算力,就是人类浩如烟海的工具与知识沉淀无法被直接调用。过去需要工程师把这些知识翻译成模型能理解的语言,效率极低。而GPT-6能自主使用工具、从网上找素材、甚至调用3D打印机等硬件——这意味着模型开始具备自我迭代、自我优化的基础条件。

作者强调:GPT-6并不代表今天就到了AGI,而是它的发布意味着「AGI剩下的只是时间问题」,且这个时间不能再按人类的迭代速度来算。从GPT-6到GPT-7、GPT-8的跃迁,可能远快于想象。

AGI(Artificial General Intelligence,通用人工智能)至今没有被学术界普遍接受的严格定义,不同机构使用的标准差异悬殊。图灵测试(1950年提出)以「能否在对话中欺骗人类评委」为标准,现代大模型早已超越。OpenAI内部曾使用「能在大多数经济价值任务上达到人类水平」作为操作性定义,并将其分为五个层级:聊天机器人、推理者、智能体、创新者、组织级AI。DeepMind则提出以「性能」与「通用性」两个维度构成的矩阵来评估AGI进度。作者在文中采用的定义——「基本能替代人类几乎所有工作内容」——更接近经济学与劳动市场视角,与技术研究者偏重认知能力的视角有所不同。这一定义之所以值得关注,是因为它将AGI的判定从抽象的智能测试锚定到了可观测的社会影响上:当足够多的白领岗位出现系统性替代迹象,「AGI时刻」就不再只是实验室里的里程碑,而会成为经济结构层面的现实事件。

唯一的短板:成本与算力

GPT-6目前最大的问题是贵。发布仅三天,就已经出现算力紧张,部分用户的模型被迫自动降级到5.6。作者自述每月在各类模型上的订阅已逼近700美元甚至更多——JR、Claude、GPT、DeepSeek、豆包全都在买。消费观念被彻底打破:过去觉得Photoshop一年1600元很贵,如今一个月一千多反倒觉得正常。

比如有水液啊

实际使用中,很多任务明知GPT-6能做得更好,却因为token太贵而不敢放手交给它。作者判断,真正的爆发要等国产平替模型追上GPT-6、把价格打下来。参考OPUS 2月发布、Kimi K3在7月就追平的节奏(比预期缩短了一个月),他大胆预测:如果按5个月周期,廉价版的全平台、全工具操作国产AI可能在今年农历年前就会出现。

从科学突破到白领工作的倒计时

GPT-6还开辟了法律、金融、科学、数学等垂直专业领域的测试模块,不再局限于通用智能。据近期新闻,数学家陶哲轩用GPT-6在数天内推进了人类此前需要多年才能解决的数学难题,连他本人都表示「无语了」。

作者对此有复杂的感受:当AI能触碰数学这样人类最后的智慧殿堂,人永远停留在底层去仰望上层,人的智慧确实面临被颠覆的冲击。

他分享了一段极具冲击力的亲身经历。作为教了十几年的线下设计讲师,他有一个基础薄弱、问题频出的学生,按传统教学理念需要经历漫长而苛刻的训练才能突破。但在GPT-6更新后的三天里,这名学生用AI做出的作品集,直接达到了他当年带天才学生的最高等级。翻看自己硬盘里历年最得意的学生作品,他发现如今的学生「完全不需要会,就能复刻出来,甚至做得更好」。

那些图层、通道、曲线、滤镜、饱和度——所有为人类过渡而存在的技术步骤,在未来可能会像从未存在过一样消失。用户只需要对着一个文本框说出想要的结果。这种「道心破碎」的感受,正如当年AlphaGo让所有围棋棋圣倒在棋盘前的那一刻。白领工作,尤其是往期的知识型岗位,或许真的进入了倒计时。

陶哲轩(Terence Tao)是澳大利亚华裔数学家,2006年菲尔兹奖得主,被公认为当代最顶尖的数学家之一,研究领域横跨调和分析、偏微分方程与数论。他长期以来积极公开评论AI在数学领域的进展,其态度从早期的审慎怀疑逐步转向认真对待。数学被许多研究者视为测试AI真实推理能力的「试金石」,原因在于数学证明要求严格的逻辑链条,无法靠模式匹配或统计关联蒙混过关,任何一步的错误都会导致整个证明失效。过去两年间,AI在数学竞赛(如IMO)和定理证明(如Lean形式化验证)上的进步速度已让专业数学家感到警惕。如果AI能在开放性数学研究——而非封闭题库——上真正加速人类专家的工作,意味着它已开始触及「创造新知识」而非仅「检索已有知识」的边界,这在认知科学和哲学层面具有远超工程应用的深远意义。

分享:

相关推荐