AI一小时破解50年数学难题:GPT-5.6攻克圈双覆盖猜想全解析

一个震动数学界的历史性时刻
OpenAI扔出了一枚重磅炸弹:他们的新一代AI模型仅用不到一个小时,就自动生成了一份针对**圈双覆盖猜想(Cycle Double Cover Conjecture)**的完整数学证明。
这个对比足够刺激——人类顶尖数学家苦苦挣扎了整整50年,AI却在不到一小时内交出了答卷。OpenAI总裁格雷格·布洛克曼(Greg Brockman)为此感叹:能力的极限正越来越取决于你的野心和想象力。
这不仅仅是又一次刷榜单、做已知测试题的胜利。它标志着AI可能正在生成连人类都还不知道的全新科学知识。不过在被这一叙事冲昏头脑之前,我们更需要冷静拆解:这份证明到底可靠吗?它是怎么被造出来的?以及它对人类数学家意味着什么。
圈双覆盖猜想:卡了半个世纪的骨灰级难题
圈双覆盖猜想由威廉·塔特(William Tutte)和保罗·西摩(Paul Seymour)等人在上世纪70年代独立提出。通俗地说,它断言:每一个无桥图中都存在一个圈的集合,使得图里的每一条边都恰好被包含在两个圈中。
要理解这个命题的深度,需要一些背景。圈双覆盖猜想属于图论中拓扑图论与结构图论的交叉地带。所谓「无桥图」,是指不存在任何一条边被删除后会使图变得不连通的图;「圈」则指图中首尾相连的路径。该猜想的重要性在于:若成立,则意味着任何无桥图都可以被嵌入某个可定向曲面,是四色定理之后图论领域最具分量的开放问题之一。正因为它牵一发而动全身,对于结构图论而言,这个猜想不是普通难题,而是整个领域的基石。
拦路虎:斯纳克图
过去50年,人类数学家主要卡在一种叫做**斯纳克(Snark)**的图结构上。斯纳克得名于刘易斯·卡罗尔的诗歌,由马丁·加德纳于1976年命名。其核心特征是:三次(每个顶点恰好连接三条边)、连通、无桥,且边色数为4而非3——即无法用三种颜色对所有边着色使得共享顶点的边颜色不同。彼得森图是最经典的斯纳克图。正因为斯纳克无法被三边着色,它天然地与圈双覆盖问题的反例候选紧密相连:若猜想存在反例,必然藏在斯纳克的某个变体中。结构极其复杂的斯纳克,是最有可能构成反例的一类图,也是这个猜想最难啃的骨头。人类的智慧,基本就在这堵墙前停滞了半个世纪。
GPT-5.6的三层架构:不再是单打独斗
这一次OpenAI搭建的是一个三层生态系统,而非单一模型:
- Soul(顶层):智力天花板,充当总指挥,处理最复杂的多步推理;
- Terra(中层):能力均衡,负责独立审查和中间任务;
- Luna(底层):轻量高速,负责海量基础执行。

真正让旗舰模型Soul起飞的,是「最大推理 + Ultra Mode」的组合拳。最大推理会分配大量额外算力,让模型进行长时间深度思考;Ultra模式则把模型变成一个超级协调员,能瞬间分身出多个并行子代理,从不同角度同时围剿一个长线任务。
此时的GPT-5.6,早已不是孤立的计算器,而更像一支配合默契的顶级科研团队。
多代理协同:一场64个子代理的「围剿战」
这套系统借助 Multi-Agent V2 工作流,将解题过程拆成四步:
- 总指挥Soul跨越不同数学路径分配任务;
- 64个子代理同时并行运行「思维树搜索」;
- 系统内藏一群对抗性审计员,像最挑剔的审稿人一样逐一检查候选证明的逻辑漏洞;
- Soul综合所有发现,若卡壳则立即启动新一轮搜索。
其中「思维树搜索」(Tree of Thoughts, ToT)是2023年由普林斯顿大学与Google DeepMind研究人员提出的推理框架,是对链式思维(Chain-of-Thought)提示技术的重大升级。传统链式思维是线性的,而思维树将推理过程建模为一棵树:每个节点代表一个中间推理步骤,AI可以在多个分支上并行探索,并通过启发式评估函数对每条路径打分,从而选择最有前途的方向深挖或剪枝回溯。这种结构与人类数学家在草稿纸上反复尝试不同证明路径的认知过程高度相似,特别适合需要长程规划的复杂数学推理任务。
被曝光的「死磕」提示词策略
更值得关注的是底层提示词的设计思路,堪称激进:
「假设存在一个完整的肯定证明;在考虑放弃之前至少死磕八个小时;绝对不要在网上搜答案。」
这实际上是强制AI代理进入一种孤注一掷的持续探索状态。同时,系统还设定了如「检查重叠多重性」这样的严格约束,目的是防止AI产生看似合理实则错误的幻觉捷径。

大力出奇迹是要烧钱的。OpenAI估算,按标准API计费,这轮暴力并行算力消耗最高可达约500美元。500美金买一个困扰人类50年的答案,看起来极其划算,但也侧面说明这类突破背后需要多么庞大的原始算力支撑。
三页纸的证明与尚未落定的评审
烧掉这500美元,最终产出令人意外——生成的证明极其简短,仅用了三页纸。
AI非常巧妙地把代数群、线性对偶性与相关定理融合在一起,在圈覆盖与阿贝尔群之间搭起一座桥梁,将复杂的图论问题精妙地转化为有限域上的线性方程组。这种「代数化方法」在现代组合数学中极具威力:有限域(也称伽罗瓦域)是元素个数有限的代数结构,最简单的如GF(2)即模2整数域,只有0和1两个元素。将「每条边被覆盖恰好两次」这一约束编码为有限域上的线性方程组后,便可借助成熟的线性代数工具验证解的存在性。阿贝尔群(满足交换律的群)在此充当连接图结构与代数结构的桥梁——这种跨领域的精妙融合,正是数学界称其「太优雅了」的根本原因。
但请保持谨慎
必须客观指出:目前的进展并未百分之百敲定。截至消息公布后数周内,这份证明仍只能算是一个待验证的声明,而非盖棺定论的突破。
人类专家正拿着放大镜逐行审查这三页纸,核心担忧是深层幻觉——例如AI是否在图结构里悄悄假设了某种根本不存在的自然对称性。在彻底核实之前,科学界仍需保持严谨。
人类数学家的未来:创造者还是质检员?
无论这三页纸最终能否站得住脚,这件事本身已让数学界产生强烈震动。

菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)爵士抛出了一个发人深省的观点。值得一提的是,菲尔兹奖创立于1936年,每四年在国际数学家大会上颁发,授予年龄不超过40岁的杰出数学家,被公认为数学界的最高荣誉。高尔斯于1998年因在泛函分析与组合数学领域的突破性贡献获奖,此后还发起了「多元纸面合作」(Polymath Project)——让数百位数学家在线协作攻克难题的实验,可视为人类版本的「多代理协同」。因此他的观察尤具代表性:人类数学家那种从零开始手写证明的时代,可能真的要结束了。未来最核心的创造性工作,或将变成**「证明消化」**——人类去理解、验证、并挖掘AI生成证明背后的深层逻辑。换言之,角色可能从「破冰的创造者」转变为「机器逻辑的翻译官与质检员」。
严厉的反对声音
另一方面,「莱顿宣言」的学者们发出了严厉警告。莱顿宣言(Leiden Manifesto)最初发表于2015年的《自然》杂志,由学术界人士联合起草,核心立场是:量化工具应辅助人类判断,而非取代之。其精神在AI辅助科研的今天被重新援引:绝不能把主动权全部交出去。必须捍卫证明作为确定性基础的地位,确保清晰的人类责任归属。
试想,若科学发现全靠我们看不懂的黑盒式自动化推理,那科学的透明度与完整性将岌岌可危——尤其是当AI编造出一套看似无比合理却全盘错误的论证时,那才是真正的灾难。
正因如此,在费城国际数学家大会上,「数学与希望」成为核心主题。所有人都在辩论同一个问题:如何在坚守人类传统严谨性的同时,安全地接纳这股充满不确定性的AI算力浪潮?
结语:架构师时代的人类命题
当机器不再只是我们手中的算盘或计算器,而是进化为搭建知识大厦的「架构师」,一个根本性问题浮出水面:
在这个新世界里,究竟还有哪些谜团,是专属于人类、等待我们亲自去揭开的?
这或许才是GPT-5.6三页纸证明留给我们最值得深思的遗产。
核心要点
相关推荐

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。

零基础入门AI Agent:开发者与应用者两条学习路径全解析
零基础如何学习AI Agent?本文梳理两条清晰的学习路线:开发者路线从Python到大模型再到开源框架源码研究,应用者路线通过Claude Code等工具快速上手。找对定位,少走弯路。

传统产品经理转型AI PM必备的三大硬核能力
传统产品经理如何转型AI产品经理?本文解析AI PM与传统PM的本质差异,详解转型必备的三大硬核能力:AI产品认知、高阶Prompt技巧、大模型技术逻辑,帮你避开常见误区,找到高效转型路径。