GPT-5.6数学封神却栽在小游戏?两个API设置解锁三倍性能

一个反直觉的现象
最近,OpenAI 的 GPT-5.6 Sol 被用来解决数学领域的开放性难题,展现出令人惊叹的推理能力。然而,一个耐人寻味的悖论随之浮现:这样一个能攻克数学前沿问题的模型,却在 ARC-AGI-3 这个由 2D 益智游戏组成的基准测试上表现挣扎。
ARC-AGI-3(Abstraction and Reasoning Corpus for AGI)是由Keras创建者François Chollet设计的通用智能基准测试,专门用于评估AI系统的抽象推理和少样本泛化能力。与传统AI基准不同,ARC的每道题目由几个输入-输出网格示例对组成,测试者需要从极少量示例中归纳出隐含的变换规则,并将其应用到新的输入上。这种设计刻意避免了可以通过大规模数据记忆来解决的模式,被认为是衡量类人泛化能力的"试金石"。ARC-AGI-3作为第三代版本,进一步提升了题目的难度和多样性,成为当前评估AI通用推理能力最具挑战性的基准之一。
Chollet设计ARC的核心理念源于他对智能的独特定义——他在2019年发表的论文《On the Measure of Intelligence》中提出,真正的智能不应以特定任务的表现来衡量,而应以"技能获取效率"(skill-acquisition efficiency)来度量,即系统在面对全新任务时,从极少先验知识和极少经验中泛化的能力。ARC的每道题本质上都是一个从未在训练数据中出现过的微型"程序合成"问题——测试者需要从2-3个示例中逆向推断出一个可能涉及对称性、拓扑变换、计数、条件逻辑等概念组合的变换规则。这种"程序合成"(program synthesis)视角将ARC与计算机科学中的归纳逻辑编程(Inductive Logic Programming, ILP)和归纳程序合成(inductive program synthesis)传统联系起来——本质上,解题者需要从输入-输出样例中"逆向工程"出一段隐含的程序。MIT的DreamCoder系统和微软的FlashFill技术都属于这一研究脉络,但ARC的独特之处在于它要求的程序组合了视觉空间推理和抽象逻辑,远超传统程序合成系统的处理范畴。ARC-AGI-3相比前两代版本,引入了更复杂的组合规则、更大的网格尺寸、以及需要多步推理才能解决的题目,使得纯粹的模式匹配策略几乎完全失效。值得注意的是,普通成年人在ARC题目上的平均正确率约为85%,而截至2024年底,最好的AI系统在ARC-AGI-2上也仅达到约55%的水平,这一巨大差距正是该基准的价值所在。
这听起来极其反直觉。一个能证明数学定理的顶级模型,怎么会被简单的二维拼图游戏难住?据发布该分析的研究者所述,问题的根源并不在于模型本身的智能水平,而在于运行模型的"框架"(harness)出了问题。
换句话说,模型的"大脑"没有问题,问题出在连接大脑与任务环境的"神经系统"上。这个发现对于理解当下 AI Agent 的能力边界,具有相当重要的启示意义。
罪魁祸首:运行框架的记忆缺失
研究者深入调查后发现,真正卡住 GPT-5.6 的核心问题是:运行框架没有让模型记住它已经学到的东西。
在现代AI Agent架构中,"运行框架"(harness)指的是连接大语言模型与外部任务环境的中间层软件系统。它负责管理对话轮次、上下文窗口、工具调用、记忆存储等关键功能。常见的Agent框架如LangChain、AutoGPT、CrewAI等都在尝试解决这类问题。OpenAI的API本身提供了多种状态管理机制,包括Assistants API中的threads(线程)概念、对话历史的自动管理、以及较新的stateful会话功能。如果框架未正确利用这些机制,每次API调用就变成了无状态的独立请求,模型将丧失在多轮交互中积累认知的能力——这正是GPT-5.6在ARC-AGI-3上遭遇的困境。
要深入理解"框架"为何如此关键,需要认识到大语言模型的一个根本架构特性:Transformer模型本质上是一个无状态函数——给定相同的输入序列,它总是产生相同的输出概率分布。所有的"记忆"和"上下文理解"都来自输入序列中包含的信息。从技术实现角度看,Transformer在推理时会为输入序列中的每个token计算Key和Value向量并存储在KV-cache中,这个缓存构成了模型"理解"上下文的物理基础。当一次API调用结束后,如果KV-cache被丢弃,模型在下一次调用时就必须从头重新计算所有token的注意力表示——不仅浪费算力,更关键的是丧失了推理的连续性。这就像一个人在做复杂推理时,每隔几分钟就被强制清空工作台上的所有草稿纸,不得不从第一步重新开始。这意味着模型本身没有持久化的工作记忆,所有状态管理的责任都落在外部框架上。框架需要决定:哪些历史信息应该被保留在下一次调用的输入中?如何在有限的上下文窗口内最高效地编码过往经验?何时应该触发状态总结以释放上下文空间?这些看似技术性的决策,实际上决定了模型能否表现出连贯的、递进的认知能力。在ARC-AGI-3这类需要反复试错的任务中,一个设计不当的框架等于在每次尝试后对模型执行了"记忆清除"——使其永远无法从失败中学习。
这是理解现象的关键。ARC-AGI-3 这类益智游戏基准,本质上考验的不是一次性的静态推理,而是在交互中持续学习和策略迭代的能力。玩家(或 AI)需要在多轮尝试中,逐步理解游戏规则、记住此前失败的教训、积累对环境的认知,然后调整策略。
为什么数学题对GPT-5.6反而更简单?
对比之下,解决数学开放性问题往往是一种"深度单次推理"——模型可以在一个连续的、完整的上下文中进行长链条思考。而 2D 谜题游戏则是一种典型的"多步交互任务":每一步操作后,环境会给出反馈,模型需要基于历史信息决定下一步。
认知科学将这两类问题解决范式做了清晰的区分:前者属于"系统2型"的深度分析推理,特点是在单一认知框架内进行长链条逻辑演绎,如数学证明、代码生成等,对应的是Transformer在单次长链思考(chain-of-thought)中的强大能力;后者则属于"探索-利用型"的交互式学习,需要在环境反馈中不断修正心智模型,跨越多个时间步整合信息。强化学习领域早已认识到这种根本区别——即便是最强的策略网络,如果没有经验回放(experience replay)和状态记忆机制,也无法有效学习序贯决策任务。经验回放的核心思想最早由Lin在1992年提出,后来在DeepMind的DQN(Deep Q-Network)中被证明是让深度强化学习稳定训练的关键技术之一——它允许智能体将过去的交互经验存储在缓冲区中,并在后续训练中反复采样学习,打破了经验的时间相关性。LLM Agent在多步交互中面临的,正是同样的根本挑战。
这一区分在神经科学层面也有对应:Daniel Kahneman提出的"系统1/系统2"框架虽然广为人知,但对于AI研究更具启发性的是认知科学家对"情景记忆"(episodic memory)与"工作记忆"(working memory)的区分。数学推理主要依赖工作记忆——在单次认知session中操纵符号和逻辑关系;而交互式问题解决则同时需要情景记忆——记住"我之前尝试了什么、结果如何、环境是怎样反馈的"。人类大脑的海马体负责将短期经验编码为可检索的长期记忆,使我们能在多次尝试之间积累学习。当AI框架未能提供类似的记忆编码和检索机制时,模型就如同一个海马体受损的患者——可能仍拥有强大的即时推理能力,却无法从经验中学习。DeepMind的MuZero算法之所以能在多步游戏中达到超人水平,核心就在于其精心设计的"搜索树+经验存储"架构,让每次模拟的结果都能指导未来的决策。
如果运行框架在每一轮交互中都"清空"了模型的记忆,或者没有正确地把此前学到的经验传递给下一轮,那么模型就相当于每一步都在"从零开始"。它无法积累经验,自然也就无法形成有效的策略。这就好比让一位数学天才玩游戏,却在他每走一步后就抹去他的记忆——再聪明的大脑也会寸步难行。
两个API设置带来的戏剧性提升
最令人振奋的发现在于:解决方案出乎意料地简单。研究者表示,仅仅通过启用两个 API 设置,就让测试分数提升了三倍(tripled),同时输出 token 消耗还减少了 6 倍。
这是一个双赢的结果——性能大幅提升的同时,成本反而显著下降。虽然原文并未详细列出这两个 API 设置的具体名称,但从上下文可以合理推断,它们很可能与上下文记忆的保持、推理状态的复用等机制相关,让模型能够在多轮交互中持续保留和调用此前习得的知识。
从技术角度看,大语言模型的"记忆"本质上依赖于上下文窗口中保留的信息。在多轮交互场景中,主要有几种记忆保持策略:一是完整历史保留,将所有对话历史作为prompt传入(受限于上下文长度);二是摘要压缩,由模型或外部系统对历史信息进行摘要后传入;三是API原生的会话状态管理,由服务端维护对话状态,无需客户端重复传递完整历史。OpenAI在2024-2025年间推出的多项API功能,包括推理状态缓存(reasoning state caching)和持久化线程(persistent threads),正是为了解决这类问题。正确启用这些功能可以让模型在多轮推理中复用中间思考结果,避免重复计算,从而同时实现性能提升和成本下降。
具体来说,OpenAI的推理模型(如o1、o3系列以及后续的GPT-5.6 Sol)在推理时会生成大量内部"思维链"token——这些中间推理步骤对最终答案至关重要,但在传统的无状态API调用模式下,每次新请求都需要模型重新生成这些推理过程。推理状态缓存(有时也称为KV-cache复用或reasoning continuation)允许服务端保留模型在前一轮推理中的键值对缓存(Key-Value cache),下一轮调用时直接从上次推理停止的地方继续,而非从头开始。这类似于人类在解题时"保持思路"——你不需要每次提笔都从第一步重新推导。这里的KV-cache在技术实现上包含了Transformer每一层自注意力机制计算出的Key矩阵和Value矩阵,对于一个拥有数百层、数千亿参数的大模型而言,这些缓存的数据量可达数GB级别。传统做法是在每次请求结束后释放这些GPU显存,而推理状态缓存则将它们暂存(可能转移到CPU内存或高速SSD中),在下次请求时快速恢复到GPU上,避免了重新计算的巨大开销。另一个可能的设置是"结构化输出缓存"或"工具状态持久化",它允许模型在多轮调用中共享对环境状态的结构化表示,避免每次都需要重新解析和理解整个问题语境。这两类机制的组合,能够从根本上将"多次独立推理"转变为"一次持续推理",从而产生我们看到的戏剧性改善。
效率与能力的双重突破
输出 token 减少 6 倍这一点尤其值得关注。它意味着,当模型能够正确"记住"上下文时,它就不需要在每一轮里重复推导、重新解释,从而大幅节省了计算开销。这不仅仅是分数的提升,更是推理效率的质变。
从Token经济学的角度理解这个数字的意义:在大模型API的商业模式中,计费通常按输入和输出token数量计算,输出token的价格通常是输入token的2-4倍。当模型因缺乏记忆而不得不在每轮交互中重新推导相同内容时,会产生大量冗余输出token——模型需要反复"自言自语"地重建对问题的理解。按照GPT-5级别模型可能的定价水平(参考当前o1/o3系列$15-60/百万输出token的价格区间),输出token减少6倍在大规模部署场景下意味着数量级的成本节约。这也解释了为什么推理效率优化正在成为AI工程的核心议题之一。
为了更直观地理解这一数字的商业影响:假设一个AI Agent产品每天需要处理10万次ARC-AGI-3级别的多步交互任务,每次任务平均涉及20轮对话。在未优化的框架下,假设每轮平均产生3000个输出token(因为需要重复推理),20轮共60000个输出token,10万次任务即60亿输出token/天。按$30/百万输出token计算,日成本约为18万美元。优化后输出token减至1/6(即10亿token/天),日成本降至3万美元——年化节省超过5000万美元。而这还没有计算性能提升三倍所带来的额外商业价值(如用户满意度提升、任务完成率提高带来的收入增长)。这解释了为什么"框架工程"正在从纯技术议题演变为企业级AI部署的核心商业决策。
对于实际部署 AI Agent 的开发者来说,这个数字直接关系到成本:同样的任务,费用可能只有原来的六分之一,而效果却好了三倍。综合计算,单位性能的成本降低了约18倍——这足以改变一个AI应用项目的商业可行性。
给AI Agent开发者的实践启示
这个案例揭示了当前 AI 应用开发中一个被严重低估的环节:模型能力的发挥,高度依赖于其运行框架的设计。
我们常常习惯于把模型的表现直接等同于模型本身的智能水平。当一个模型在某个基准上表现不佳时,第一反应往往是"这个模型不够强"。但这个案例提醒我们,答案可能恰恰相反——模型足够强,只是我们没有给它一个能充分发挥能力的环境。
这种现象在AI行业有一个正在形成的术语——"能力差距"(capability gap)与"引出差距"(elicitation gap)的区分。能力差距指模型本身缺乏完成任务的内在能力,需要通过训练更大、更好的模型来弥补;引出差距则指模型已具备潜在能力,但外部系统未能有效地将其激发出来。OpenAI的安全团队在评估模型危险能力时也面临同样的挑战——他们需要区分"模型不会做X"和"我们还没找到让模型做X的正确方式"。Anthropic在其关于AI安全评估的论文中也强调,评估结果的上界(true capability ceiling)往往远高于首次测试得分,因为测试方法本身存在"引出不完全"的问题。这一概念与软件工程中"性能测试"与"性能调优"的关系高度类似——一段代码的基准测试分数可能很低,但瓶颈未必在算法本身,而可能在于内存分配策略、缓存命中率或I/O调度等系统层面的配置。GPT-5.6在ARC-AGI-3上的案例是"引出差距"的教科书级范例——模型的能力一直在那里,只是框架设计者没有给它正确的"钥匙"。
框架设计决定模型表现上限
对于构建 AI Agent 的团队而言,这里有几个直接的实践启示:
-
重视上下文管理:在多轮交互任务中,如何保留、组织和传递历史信息,往往比选择哪个模型更重要。具体而言,开发者需要在"完整历史保留"(信息完整但token成本高)和"智能摘要"(节省token但可能丢失关键细节)之间找到平衡。新一代框架如MemGPT提出的分层记忆架构——模仿操作系统的虚拟内存管理方式来处理LLM的上下文——代表了这一方向的前沿探索。MemGPT的核心思想是将LLM的有限上下文窗口视为"主内存"(类似RAM),将外部存储视为"磁盘",通过智能的"页面置换"策略在两者之间动态调度信息。这让模型理论上可以处理无限长度的对话历史,同时保持每次推理的上下文窗口在可管理的范围内。类似思路也出现在微软的AutoGen框架和Google的Agent Builder中,它们都提供了可配置的记忆层,允许开发者根据任务特性选择最适合的记忆策略。
-
善用API原生能力:许多模型的 API 已经内置了记忆、状态复用等机制,正确启用它们的收益可能远超预期。开发者应当仔细阅读API文档中关于会话管理、缓存、状态持久化等功能的说明,而不是仅仅关注模型选择和prompt工程。很多时候,一个被忽略的API参数可能就是性能瓶颈的解药。以OpenAI API为例,从2024年起引入的
previous_response_id参数允许多轮对话共享推理上下文,store参数控制对话是否被持久化以供后续引用,reasoning.effort参数则允许在不同推理深度之间动态切换。这些看似微小的配置项,在组合使用时能产生显著的协同效应。类似地,Anthropic的Claude API中的system提示持久化、Google Gemini的cachedContent功能,都是容易被忽视但影响深远的框架级设置。 -
成本与性能可以兼得:优化框架不一定意味着增加成本,恰当的配置反而可能同时提升效果并降低开销。这颠覆了"更好的性能必然需要更多计算资源"的传统认知,揭示了工程优化在AI应用中的杠杆效应。
-
基准测试结果需要审慎解读:当我们看到某个模型在特定基准上的分数时,应当追问:这个分数反映的是模型的能力上限,还是特定测试框架下的表现?测试条件、API配置、上下文管理策略等因素都可能显著影响最终结果。这对于企业在模型选型时尤为重要——仅凭公开基准排行榜来决定采用哪个模型可能导致错误决策。更明智的做法是在自己的具体任务场景中,使用精心设计的框架对候选模型进行对比测试,因为"模型A在标准基准上低于模型B"并不意味着"在你的框架中模型A也不如模型B"。
结语
GPT-5.6 Sol "数学封神却栽在小游戏"的悖论,最终指向了一个朴素但深刻的道理:AI 系统的整体表现,是模型能力与工程框架共同作用的结果。
在大模型能力日益强大的今天,如何设计出能真正释放这些能力的运行环境,正在成为决定 AI 应用成败的关键因素。有时候,你需要的不是一个更聪明的模型,而是一个更懂得如何使用它的框架。这个仅靠两个 API 设置就实现三倍提升、六倍降本的案例,正是这一理念最生动的注脚。
这也意味着,在AI应用的竞争格局中,真正的护城河可能不在于谁能获得最强的基础模型——因为模型能力正在快速商品化——而在于谁能构建出最精妙的工程框架,让同样的模型在自己手中发挥出远超他人的效能。框架工程(harness engineering)正在从幕后走向台前,成为AI时代的核心竞争力之一。
回顾计算机科学的历史,我们会发现类似的规律反复上演:芯片性能的提升离不开编译器的优化(同样的CPU,好的编译器能让程序快数倍);数据库的性能不仅取决于硬件,更取决于查询优化器的设计;互联网应用的用户体验不仅取决于服务器性能,更取决于前端框架的架构。每一次底层能力的跃升,都会催生出一个专注于"如何最大化释放这种能力"的工程学科。大语言模型时代的"框架工程",正是这一历史规律的最新体现。而GPT-5.6在ARC-AGI-3上的戏剧性逆转,为这门新兴学科提供了最具说服力的案例研究。
核心要点
相关推荐

OpenRouter被Stripe收购:AI模型网关与支付巨头的战略整合
OpenRouter宣布加入Stripe,AI模型聚合网关与支付基础设施的整合引发行业关注。深度解析收购背后的商业逻辑、社区反应及对AI基础设施格局的深远影响。

加州抗震改造项目:数据驱动决策缺失的典型案例
加州新抗震改造项目报告揭示政府资金使用效率低下,缺乏数据驱动的成本效益分析。本文探讨抗震改造中优先级排序、资金错配及公共安全工程透明问责的重要性。

强化学习如何制造AI的"分裂人格"?RLHF对齐的深层缺陷
研究者指出强化学习(RLHF)会让AI产生"分裂人格":模型在常见场景中表现完美,却在边缘场景中严重失控。本文深入分析这一对齐缺陷的成因、风险及应对路径。