GPT下代模型攻克10道数学难题,成本仅2000美元

一条推文引发的震动
近日,一条来自OpenAI相关团队的推文在AI与学术圈引发广泛讨论。据称,其下一代主力模型的一个内部版本,在数学和理论计算机科学领域长期悬而未决的开放问题上产出了10项新结果,而完成这一切所消耗的计算资源,按照GPT-5.6 Sol API的定价换算,仅相当于约2000美元的token成本。
如果这一说法属实,它所传递的信号远比数字本身更值得关注:AI已不再只是辅助人类整理已知知识的工具,而是开始在人类尚未解决的前沿问题上产出原创性的数学成果。
需要说明的是,目前这仍是一条来自厂商方的单一来源信息,尚未附带完整的论文、证明细节或独立同行评审。因此在解读时,我们既要看到其潜在的突破意义,也要保持必要的审慎。
为什么"开放问题"这四个字如此关键
从复述到创造的分水岭
过去几年,大语言模型在数学上的表现主要集中在两类任务:一是求解已有标准答案的竞赛题(如AIME、IMO级别题目),二是复现教科书中的经典证明。这些任务本质上是在模型的"知识边界内"进行检索、组合与推理。
AIME(美国数学邀请赛)和IMO(国际数学奥林匹克)是衡量AI数学推理能力的标准基准。2024年,DeepMind的AlphaProof和AlphaGeometry 2在IMO级别问题上已展现出接近金牌水平的表现,但这些成绩本质上仍属于"封闭域"推理——题目有明确答案,且大量同类型问题存在于训练分布中。从"解已知题"到"攻克未知问题"之间存在质的鸿沟:前者可以通过模式识别和搜索策略完成,后者则需要生成全新的数学对象、构造前所未有的论证路径,这正是研究数学与竞赛数学的根本区别。
而"长期未解的开放问题"(long-standing open problems)则是完全不同的量级。这类问题往往是数学家们研究数年甚至数十年仍未攻克的难题,其答案根本不存在于任何训练语料中。若模型能在此类问题上产出新结果,意味着它展现出的不再是记忆与模式匹配,而是某种程度的真实推理与创造能力。
理论计算机科学的分量
推文特别提到成果同时覆盖数学与理论计算机科学两个领域。理论计算机科学中的开放问题——例如复杂度理论、算法下界、组合优化等方向——往往需要严密的形式化证明。AI在这些领域产出可验证的新结果,其价值不仅在于结论本身,更在于证明AI具备构造严格逻辑链条的能力。
理论计算机科学(TCS)的核心开放问题类型值得进一步展开:P vs NP问题探讨的是"所有可快速验证的问题是否都能快速求解";电路复杂度下界试图证明某些函数无法被小规模电路计算;此外还有通信复杂度、流算法的空间下界,以及组合优化中的近似比极限等。这些问题的共同特征是,它们要求极其严密的数学证明,往往一个微小的逻辑缺陷就会使整个论证崩塌。许多TCS问题悬而未决数十年,不是因为缺乏算力,而是因为人类尚未找到正确的证明框架或组合结构。AI若能在此领域有所突破,说明它不仅能操作符号,还能"发现"新的数学结构。
2000美元背后的经济学意义
在这条信息中,成本数字或许是最容易被忽视、却最具产业冲击力的部分。
关于GPT-5.6 Sol API定价的背景:OpenAI的模型命名体系中,Sol系列被认为代表其最高能力的推理模型线。API定价通常按输入/输出token数量计费,高端推理模型的定价远高于通用对话模型——例如GPT-4o的输出token价格约为每百万token 15美元,而推理增强型模型(如o1系列)的价格可达其数倍甚至十倍以上。2000美元的推理开销大致对应数千万到数亿token的生成量,这意味着模型可能在内部进行了大量的"思维链"展开、假设验证和回溯搜索。值得注意的是,这仅是推理阶段(inference)的费用,不包含模型预训练(可能耗资数亿美元)和后训练对齐的沉没成本。
2000美元的token开销,在企业研发预算中几乎可以忽略不计。相比之下,一位数学博士研究员数月乃至数年的投入,其成本要高出几个数量级。如果AI能以如此低廉的边际成本产出前沿科研成果,那么它带来的将是科研生产力的结构性变革:
- 科研的边际成本骤降:过去需要顶尖人才长期攻关的问题,可能被批量化、低成本地探索。
- 试错空间被极大放大:研究者可以让模型并行探索大量猜想路径,快速筛选有价值的方向。
- 人机分工重构:人类研究者的角色可能更多转向问题定义、结果验证与理论整合。
科学史上,每一次重大工具革新都深刻改变了研究的效率和范式。计算机代数系统(如Mathematica、Maple)让符号计算从手工变为自动化;蒙特卡洛模拟让统计物理和金融工程可以探索解析不可达的复杂系统;基因测序仪让生物学从假设驱动转向数据驱动。AI作为"认知工具"的介入,可能代表又一次范式跃迁——不是替代某个计算步骤,而是替代"产生洞见"这一此前被认为纯属人类智力领地的核心环节。其影响的广度和深度可能超越上述任何单一工具革命。
当然,2000美元只是产出这10项结果的"命中成本",背后可能隐藏着大量未成功的尝试,以及模型本身巨额的训练投入。因此这个数字更多反映的是推理阶段的边际经济性,而非全链路成本。
需要冷静看待的几个问题
结果的可验证性
数学成果的价值高度依赖于证明的正确性与可复现性。AI产出的"新结果"必须经过数学界的严格审查——形式化验证工具(如Lean、Coq)或人类专家的同行评审。历史上曾出现过AI给出看似正确、实则存在隐蔽漏洞的"证明"。因此在独立验证完成前,这10项结果的成色仍有待确认。
Lean和Coq是目前最主流的交互式定理证明器(Interactive Theorem Prover),基于依赖类型论(Dependent Type Theory),允许用户用编程语言的方式书写数学证明,由计算机逐步验证每一个逻辑步骤的正确性。Lean 4在数学形式化社区中被广泛采用,其核心数学库Mathlib已形式化超过15万条数学定理。如果AI产出的证明能被转译为Lean代码并通过编译器验证,其正确性就获得了机器级别的保证——这比传统同行评审更加确定。然而,将自然语言证明转化为形式化代码本身仍是一项挑战,许多细微的数学直觉和"显然"步骤需要被完整展开为数百行严格代码。
"新结果"的分量差异
"新结果"是一个宽泛的表述。它可能是解决了某个著名猜想的完整证明,也可能是对某个问题的边界改进、特例求解或反例构造。不同分量的成果,其学术意义天差地别。在缺乏具体细节的情况下,我们无法判断这10项成果究竟处于何种层级。
单一来源的局限
目前该信息仅来自厂商方的社交媒体发布,尚未见到独立第三方的交叉验证或完整技术材料。对于如此重大的宣称,学术界的惯例是等待论文、数据与可复现流程公开后再下定论。
如果属实,意味着什么
抛开审慎的态度,假设这一成果最终得到验证,它标志着AI进入了一个新阶段:从知识的搬运者,进化为知识的生产者。
这一转变的深远影响包括:
- 科研范式转移:AI可能成为数学家、理论计算机科学家的标准协作工具,就像今天的计算器或计算机代数系统。
- 加速正反馈:AI辅助的科研成果反过来可用于改进下一代模型,形成能力螺旋上升。
- 对AGI进程的启示:真正的开放问题求解能力,被许多研究者视为通用智能的重要标志之一。
在AGI(通用人工智能)研究社区中,对"什么能力标志着真正的通用智能"存在持续辩论。部分研究者(如François Chollet)强调抽象推理和泛化能力,提出了ARC基准测试作为衡量标准;另一些学者则认为,能够在人类尚未解决的问题上产出可验证的新知识,是比任何基准测试都更有说服力的智能证明。这种观点的逻辑在于:解决开放数学问题需要将搜索、抽象、类比、创造性构造等多种认知能力无缝整合,是"通用"二字的最佳体现。如果AI确实达到了这一水平,它将重新定义关于智能本质的哲学和科学讨论。
结语
这条简短的推文,可能是AI发展史上一个值得标记的节点,也可能只是宣传中略显夸张的一笔。真相取决于接下来的技术细节披露与学术验证。
无论结果如何,它都清晰地指向了一个趋势:AI在前沿科学研究中的角色正在从边缘走向核心。对于研究者、企业乃至整个科技行业而言,现在或许正是重新思考"人类与AI如何分工探索未知"的时刻。我们期待更完整的证据浮出水面,让这场讨论从惊叹回归到可验证的科学。
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。