LLM为何无法跳跃?大模型推理的本质局限与未来突破

引言:一个耐人寻味的论断
一篇题为《Position: LLMs Can't Jump》的立场论文近期在 Hacker News 引发热议。标题中的"跳跃"(Jump)并非字面意义上的物理动作,而是一个精心选择的隐喻,用以描述大语言模型(LLM)在推理能力上的根本性局限:它们难以进行真正意义上的"逻辑跳跃"——即从已知前提中推导出全新的、非显性存在于训练数据中的结论。
这一论断触及了当前 AI 讨论中最核心的争议之一:LLM 究竟是在"推理",还是仅仅在进行高度复杂的"模式匹配"?本文将结合该立场论文的核心观点,深入探讨大模型推理能力的边界所在。

"跳跃"究竟意味着什么
从连续插值到离散外推
要理解"LLM 不能跳跃"这一论断,首先需要理解 LLM 擅长什么。基于 Transformer 架构的语言模型,本质上是在海量文本上学习词元(token)之间的概率分布。Transformer 架构由 Google 在 2017 年的论文《Attention Is All You Need》中提出,其核心创新是自注意力机制(Self-Attention),允许模型在处理序列时同时关注输入中的所有位置,而非像此前的 RNN/LSTM 那样逐步处理。LLM 通过在海量语料上进行下一个词元预测(next-token prediction)训练,学习到的本质上是一个条件概率分布 P(next_token | context)。这种训练目标使模型成为极其强大的分布拟合器,但也意味着其"知识"以统计关联的形式存储在数十亿参数中,而非以可解释的逻辑规则形式存在。
正因如此,LLM 极其擅长在训练数据的分布范围内进行插值(interpolation)——即在已见过的知识点之间平滑过渡,生成连贯、流畅且往往正确的内容。
然而,"跳跃"要求的是外推(extrapolation)能力。在机器学习中,插值指模型在训练数据密集覆盖的区域内进行预测,而外推则指模型需要在训练分布之外的区域做出判断。一个直观类比是:给模型看过 1+1=2 和 2+2=4 后,回答 1.5+1.5=3 是插值(在已知点之间);但回答"如果加法规则改为模 7 运算,那么 5+4 等于几"则需要外推到新的规则系统。神经网络作为连续函数逼近器,天然擅长插值但在外推上脆弱,因为远离训练分布的区域缺乏梯度信号的约束。
当一个问题的解答路径需要模型跳出训练数据所覆盖的分布,进行一次结构性的、非连续的逻辑创造时,模型往往会失败。它可能生成看似合理、语法完美,但逻辑上站不住脚的答案——这正是"幻觉"(hallucination)现象的深层来源之一。
组合泛化:LLM推理的核心难题
这一局限在"组合泛化"(compositional generalization)任务上表现得尤为明显。组合泛化是语言学家 Noam Chomsky 所强调的人类语言能力的核心特征——人类可以用有限的词汇和语法规则生成和理解无限多的句子。在 AI 研究中,经典的 SCAN 基准测试和 COGS 数据集专门用来检测模型的组合泛化能力,例如模型学会了"walk twice"和"jump"后,能否正确理解"jump twice"。研究反复表明,标准神经网络在系统性组合(systematic compositionality)上表现不佳,它们倾向于记忆整体模式而非学习可组合的原子规则。
人类能够将已知的基本规则以全新的方式组合,解决从未见过的问题。而 LLM 在面对需要多步骤、深层组合推理的任务时,性能会随着推理链条的加长而显著衰减。这暗示着模型并非在执行真正的符号推理,而是在依赖训练中习得的表层统计关联。
为什么这个观点对AI发展至关重要
对"涌现能力"的冷思考
近年来,随着模型规模的扩大,业界热议 LLM 的"涌现能力"(emergent abilities)——即模型在达到某个规模阈值后突然展现出的新技能。涌现能力概念由 Google 研究团队在 2022 年系统化提出,许多人将此视为通往通用人工智能(AGI)的证据。
然而,2023 年斯坦福的一项研究《Are Emergent Abilities of Large Language Models a Mirage?》指出,所谓的涌现可能是评测指标选择造成的统计假象——当使用非线性的离散指标(如精确匹配)时会观察到突变,但换用连续指标(如对数概率)后,性能提升实际上是平滑渐进的。这一发现动摇了"规模即智能"的叙事基础。
"LLMs Can't Jump"这一立场提供了一个必要的反思视角:所谓的涌现,很多时候可能只是模型对更大规模训练数据的更精细插值,而非真正获得了跨越分布边界的推理能力。规模的扩大让模型能够覆盖更多的"已知区域",从而看起来无所不能,但这并不改变其在面对真正未知问题时的脆弱性。
评测基准的失真问题
Hacker News 上的讨论也延伸到了评测方法的可靠性问题。数据污染(Data Contamination)指评测基准的题目或答案出现在模型的训练数据中,导致评测结果虚高。由于现代 LLM 的训练语料通常包含整个互联网的爬取数据(如 Common Crawl),而学术基准测试的题目广泛存在于网络论坛、论文和教程中,污染几乎不可避免。
2024 年多项研究发现,GPT-4 等模型在 GSM8K 数学基准上的部分高分表现,可能受益于训练数据中存在的相似题目。这使得区分"模型真正学会了解题方法"和"模型记住了答案模板"变得极其困难。真正检验模型能否"跳跃"的,应当是那些设计上确保与训练分布无关的全新问题——例如使用程序化生成的、具有可控难度梯度的合成任务。
社区争议与正反观点
说个细节,作为一篇"立场论文"(Position Paper),其观点本身就是为激发辩论而生的,社区反应也呈现出明显的分歧。
支持方:架构存在系统性缺陷
支持者认为,这一论断切中要害。无论模型规模如何增长,Transformer 架构在处理需要精确、多步骤符号操作的任务时始终存在系统性缺陷。这解释了为何顶尖模型仍会在简单的算术、逻辑谜题或长链条推导上犯低级错误。从理论角度看,标准 Transformer 的计算深度受限于层数,对于需要 O(n) 步串行推理的问题,固定深度的模型在理论上就存在表达力瓶颈。
质疑方:概念边界模糊且技术在进步
质疑者则指出,"跳跃"这一概念本身缺乏严格的、可操作的定义。如果无法明确界定什么是"真正的推理跳跃",那么"LLM 不能跳跃"就有可能成为一个无法被证伪的论断——任何模型做对的题都会被归为"插值",任何做错的题都被归为"无法跳跃"。
此外,链式思维(Chain-of-Thought, CoT)等提示技术已在一定程度上帮助模型突破了纯粹的分布内限制。CoT 由 Google Brain 团队在 2022 年提出,通过在提示中要求模型"逐步思考"来显著提升推理任务表现。其原理可能在于:将复杂推理分解为多个简单步骤后,每一步都更接近模型训练分布内的简单变换,从而将一次大的"跳跃"化解为多次小的"步行"。然而,CoT 的局限也很明显:模型可能生成看起来合理但实际上逻辑断裂的推理链;且当问题本质上需要全局性的创造性洞察(而非可分解的线性步骤)时,CoT 也无济于事。工具调用、代码执行等外部增强手段同样在拓展模型的能力边界,但这是否算作模型本身在"跳跃",仍是一个哲学层面的争议。
对AI未来发展的关键启示
神经符号混合架构的必要性
如果 LLM 在纯神经网络范式下确实难以实现可靠的逻辑跳跃,那么未来的发展方向或许在于"神经符号"(neuro-symbolic)混合系统——将 LLM 的语言理解与生成能力,同外部的符号推理引擎、验证器或工具相结合。让模型负责"理解与调度",让确定性的符号系统负责"精确推理"。
神经符号 AI 试图结合连接主义(神经网络的学习能力和鲁棒性)与符号主义(形式逻辑的精确性和可解释性)的优势。这一思路可追溯至 1990 年代,但近年来因 LLM 的推理缺陷而重获关注。典型实践包括:让 LLM 生成形式化代码后由解释器执行(如 PAL、Program-of-Thought 方法);让 LLM 调用定理证明器进行数学验证;或在 LLM 外部挂载知识图谱进行事实校验。DeepMind 的 AlphaGeometry 系统就是一个成功案例——它将神经语言模型与符号几何引擎结合,达到了国际数学奥林匹克银牌水平,证明了混合架构在复杂推理任务上的巨大潜力。
重新审视通往AGI的技术路径
更宏观地看,这一讨论提醒我们对通往 AGI 的技术路径保持清醒。仅靠扩大参数规模和数据量的"暴力美学"(Scaling Laws 驱动的范式),可能不足以跨越从"高级模式匹配"到"真正推理"的鸿沟。OpenAI 研究员 Ilya Sutskever 曾指出,压缩即智能——更好的压缩意味着更好的预测和理解。但批评者认为,即使压缩能力无限提升,统计学习和演绎推理之间仍可能存在不可逾越的范式鸿沟。理解并承认当前架构的局限,恰恰是推动下一代 AI 系统突破的前提。
结语
"LLMs Can't Jump"是一个刻意鲜明、旨在引发思辨的立场。它未必是最终定论,但提出了一个至关重要的问题:我们对大模型能力的评估,是否被其流畅的表象所迷惑?
在赞叹 LLM 惊人表现的同时,认清其"能插值、难跳跃"的本质局限,对于研究者、开发者乃至整个行业理性看待 AI 的现状与未来,都具有不可忽视的价值。
相关推荐

AI网络攻防能力逼近临界点:模型研发该踩刹车吗
AI模型的网络攻防能力正逼近关键阈值,能自主发现漏洞、编写exploit甚至执行完整攻击链。本文深入分析放慢研发与加速防御两派观点,探讨能力封锁的博弈困境及系统性治理路径。
fx:极简开源原生编码智能体深度解析
fx:极简开源原生编码智能体深度解析
深度解析fx开源编码智能体,探讨其Tiny、Open、Native三大核心理念,分析极简AI编程工具在可控性、隐私保护和模型无关性方面的独特价值与局限。

ROS成立Physical AI特别兴趣小组,开源机器人生态拥抱具身智能
开源机器人联盟OSRA正式成立Physical AI SIG,推动ROS生态系统整合物理AI能力。本文解析Physical AI特别兴趣小组的目标、路线图及其对机器人开发者的深远影响。