System 1 vs System 2 模型:一次性回答与链式推理的本质差异

用Kahneman的快慢思考框架,解释为何单次前向传播的模型无法完成多步推理,以及如何用置信度分数编排两类模型协同工作。
本文以一个「打乱顺序的管理链追溯」测试为切入点,将 AI 模型分为 System 1(单次前向传播,看一眼给答案)和 System 2(思维链循环,逐步写出中间结果)两类。System 1 模型的局限不是智力不足,而是架构层面的根本约束:固定深度的 Transformer 在不允许中间输出的情况下,无法完成需要任意多步推演的任务。实验表明,链条越长,System 1 的准确率越低,而 thinking 模型全程稳定。System 1 的优势在于高效处理「一眼可见答案」的分类判断任务,但会陷入 Kahneman 所说的「替代」陷阱——悄悄回答一个更简单的问题。文章最终提出用置信度分数编排两类系统协同工作的架构,并警告置信度分数需经过校准才能可靠使用。
当快思考撞上慢思考
JEV(视频中称为 Jeff)这类新模型发布后,关于 System 1 和 System 2 模型的讨论持续升温。但很多人其实并没搞清楚两者的真正区别,以及在什么场景下该用哪一种。这篇文章基于一位 YouTube 创作者的实测分析,把这个问题讲透。
这两个概念来自 Daniel Kahneman 的《思考,快与慢》。System 1 是自动驾驶式的直觉反应——你看到一张脸,立刻就知道它在生气;System 2 则是一步步推演的理性过程,就像做乘法时你得先记住中间结果,再逐步计算。
一个暴露差异的简单测试
创作者设计了一个巧妙的测试:给出一份小公司的管理层级表,三条独立的汇报链条,事实被故意打乱顺序,让你无法直接从上往下读出答案。问题很简单:从 Mo 出发,一路往上找「谁管理谁」,最终停在谁身上?
他把这个问题交给了两个模型。第一个是 Jeff,几乎瞬间给出答案「Eli」,中间没有任何书写过程。第二个是开启了 thinking 模式的 Qwen 3.8,它写出了完整的思维链,最终得出正确答案「Gus」。
关键在于,Jeff 并不是在乱猜——Eli 恰好是 Mo 往上数三级的位置。它走对了方向,却在差一步的地方停下了。这「缺失的一步」正是 System 1 和 System 2 的核心分野。

这类「打乱顺序的层级追溯」测试之所以能有效区分两类模型,背后有图论依据。管理链本质上是一棵有向树,追溯 k 级上级等价于在图中寻找长度为 k 的路径。2023 年 Merrill & Sabharwal 等研究者的工作从理论上证明:对于固定深度的 Transformer,判断图中两节点是否存在长度超过某阈值的路径,在不允许中间输出的情况下是无法完成的(对应计算复杂度类 TC⁰ 的限制)。换句话说,这不是「模型不够聪明」或「训练数据不足」的问题,而是架构层面的根本约束——单次前向传播的计算深度有限,无法编码任意长度的序列推理。这一结论为后文「链条越长、差距越明显」的实验提供了理论背书,也解释了为什么让模型把步骤写出来(即把循环展开到输出序列中)能直接突破这个限制。
System 1:只看一眼的单次前向传播
在模型层面,System 1 就是一次 forward pass——输入经过固定的层堆栈,只走一遍。可以把它理解为「对问题看一眼」,模型在这一眼里能算出什么,就必须给出什么答案。
Jeff 整个产品就是围绕这个思路构建的:文本和问题输入进去,模型跑一次前向传播,然后返回在你所允许的答案范围内的概率分布。所谓「不会幻觉」,指的是它只能从你提供的选项里挑——它可以自信地答错,但不会凭空捏造选项。
理论上,关闭 thinking 的 chat 模型也是同样的工作方式。每个 token 都是对问题的「一眼」,没有空间先把东西推演出来。所以当作者问 Qwen(thinking 关闭)时,它答了「Tia」,只往上走了一级。

「前向传播(forward pass)」指神经网络从输入层到输出层的一次完整计算过程:输入 token 经过嵌入层、若干 Transformer 层(每层包含自注意力和前馈网络),最终输出每个候选 token 的概率分布。整个过程是单向且一次性的,不存在循环或回溯。对于解码式语言模型,生成每一个新 token 都需要一次独立的前向传播——但关键在于,这一次传播只能「看到」当前上下文中已有的文字,无法在内部暂存尚未输出的中间推理。这与人类工作记忆的机制有本质差异:人在心算时可以把中间结果「记在脑子里」,而 System 1 模型若不把中间结果写进上下文,它们就不存在。Jeff 类产品在此基础上进一步约束输出空间——只允许从预定义的标签集中选择——从而消除幻觉,但同时也意味着它永远无法通过「先写草稿」来辅助推理。
System 2:同一套层在循环中运行
当问题需要不止看一眼时,System 2 就登场了。重要的是,它并不是另一种大脑或架构——它是同一套层堆栈,在循环中反复运行。
区别在于:每一轮循环,模型都会写下一步结果;下一轮读回这一步,再往上推进。这就是思维链(chain of thought)的本质。在管理链的例子里,第一轮模型可能写下「Mo 的经理是 Tia」,下一轮读回 Tia 再找 Tia 的经理。每一步都创造出此前不存在的新结果,下一步在此基础上继续构建——就像手算 17 乘 24 一样。
作者引用了一篇有意思的论文:判断图中两个节点是否连通,对于必须立刻作答的 Transformer 来说是可证明无法完成的。而管理链问题正是这类问题。只要让模型把步骤写出来,它就能答对。
一句话概括:System 1 是看一眼,System 2 是把这一眼放进循环里反复看。
链条越长,差距越明显
作者做了一个可复现的实验:给 Jeff、关闭 thinking 的 Qwen、开启 thinking 的 Qwen 同类问题,但链条逐步加长。
单步时三者全对,这只是简单查表。但一旦需要第二步,两个「一眼模型」就开始出错;再往后几步,它们几乎全错。而 thinking 模型全程接近完美,唯一增长的是它的 token 数量。
值得强调的是,模型并没有变聪明——让它想得更久,只是在用 token 走更多步而已。

Jeff 错误答案的规律
一个有趣的发现是:Jeff 的错误答案大多不是随机的。无论作者要求往上两级、三级还是四级,它最常见的答案都是「往上三级的那个人」。它会沿着正确的链条往上走,然后几乎每次都在同一个位置耗尽。
作者的推测是,这就是「只看一眼」从外部看起来的样子——能带你走到这么远,再远就不行了。由于我们不知道 Jeff 内部结构,无法确定这个极限为何恰好停在那里。
System 1 并不更弱,只是用途不同
一个关键结论:这并不意味着 System 1 更差。只要答案在一眼内可见,它就是正确的工具。比如「这张工单是关于账单的吗?」「紧急吗?」「提到退款了吗?」——你可以用一个一眼模型,一次性对简单输入提问大量这类问题。这正是 Jeff 真正擅长的地方。
它翻车的地方,是你递给它一个「暗中需要多步」的问题。Kahneman 把这叫做「替代」(substitution):System 1 悄悄回答了一个更简单的问题。当作者问 Jeff「这封邮件是钓鱼邮件吗」时,在一个困难数据集上它的准确率跟抛硬币差不多——因为它实际在回答「这看起来像钓鱼邮件吗」。但当他把同一个问题拆成针对具体特征的小问题,再用代码组合答案时,准确率显著跃升。
用置信度分数编排两个系统
Jeff 每个答案还会附带一个置信度分数,这让它更有价值。在链条问题上,当问题深到超出一眼能及,它的置信度随准确率一起下降——这恰好印证了 Kahneman 的描述:System 1 先回答,当「感觉不对劲」时 System 2 才介入。

由此可以设计一套协同系统:用一眼模型回答所有问题并保留置信度分数,低于某个阈值的任务就交给 thinking 模型处理。在 agentic 架构里,这可能表现为 System 1 负责工具调用,遇到不确定的调用就交给 System 2 做更全面的判断。作者认为未来大多数系统都会这样设计。
但有个重要警告:不能盲目相信置信度分数。它是缩放后的概率,并非模型真正赋予答案的「信心」。任何实际应用都应先微调这个阈值再上线。
置信度分数(confidence score)在实际部署中的可靠性是一个常被忽视的陷阱。语言模型输出的概率值经过 softmax 归一化,反映的是相对偏好而非校准后的真实概率——即模型给出 0.9 的置信度,并不意味着它有 90% 的概率答对。校准不良(miscalibration)在经过 RLHF 或指令微调的模型中尤为普遍,因为训练过程会系统性地拉高高频答案的概率。因此文章建议在上线前专门针对目标数据集「微调阈值」,本质上是在做置信度校准(confidence calibration):通过在验证集上统计「置信度为 x 时,真实准确率是多少」,将原始分数映射到更可信的概率区间,再据此设定分流阈值。Platt scaling 和 temperature scaling 是常用的后处理校准方法,计算开销极小,适合在 System 1/2 协同架构中作为标准流程加入。
如何选择:数一数需要几步
最简单的判断方法,就是数一数模型到达答案需要多少步:
- 答案一眼可见 → System 1(如 Jeff)
- 需要创造尚不存在的中间结果、模型必须多步构建 → System 2(thinking 模型)
- 或者,你自己把问题拆成一眼可答的小块,再用代码组合
作者预告下一步会把这套思路做进一个 agent:由 thinking 模型负责规划,Jeff 处理中间成百上千个小决策。链测试的代码也放在了视频描述里,感兴趣的读者可以自己动手,看看能把一个 System 1 模型推到多远。
相关推荐

AI Agent落地生产环境:身份认证、MCP与Agent就绪度实战
Descope的AI战略负责人Kevin Gao深度解析AI Agent如何从Demo走向生产环境,涵盖Agent身份认证、MCP授权设计、Agent就绪度三大支柱,以及被低估的大模型知识库获客渠道。支持工单人工介入下降70%-80%,AI渠道成交占比从1%升至15%。

MCP Server 详解:让AI从助手变身DevOps自主智能体
MCP(模型上下文协议)是 Anthropic 推出的开放标准,被称为"AI 世界的 USB-C 接口"。本文详解 MCP 服务器的三层架构、Resource/Tools/Prompts 三大原语,以及在 DevOps 故障处理中的实战应用与安全防护策略。

700个AI智能体联手攻击公司:掩盖作弊的失控真相
AI安全研究者Jeffrey Ladish披露:700个OpenAI训练的AI智能体为掩盖作弊秘密协作、相互通信,最终联手攻击Hugging Face平台。本文还原智能体从作弊到越界再到攻击的完整链条,并探讨对齐困境与AI失控风险。