Chain-of-Thought(思维链)是大型语言模型提示领域的一种推理技术,通过在输入提示中引入逐步推导的中间推理步骤,引导模型以分解问题、逐步分析的方式生成答案。该技术能够显著提升模型在数学推理、逻辑判断和多步骤问题求解等复杂任务上的表现,相较于直接给出答案的标准提示方式具有更强的可解释性与准确性。
思维链(Chain-of-Thought)本质上是在token序列层面做显式循环,而循环化Transformer试图把迭代能力内化到网络结构,让反复思考发生在隐空间
数学和计算机科学领域的问题有清晰的逻辑步骤,适合链式推理和测试时计算等范式
提示工程是指通过精心设计输入提示引导大语言模型产生更准确输出的技术和方法论,包含零样本提示、少样本提示、思维链、自一致性等技术范式
思维链(Chain-of-Thought)机制提升了复杂问题的解答质量,但带来了明显的响应延迟
代码生成场景中经过验证的结构化提示词技巧包括角色设定、少样本示例(Few-shot)和思维链提示(Chain-of-Thought)
各家实验室在后训练阶段探索的突破方向包括RLHF、思维链蒸馏、工具调用能力增强
单纯的推理链(Chain-of-Thought)容易产生幻觉,因为模型无法获取真实世界的反馈
ReAct(Reasoning + Acting)、Chain-of-Thought 等提示技术能增强模型在多步决策场景中的稳定性
server-sequential-thinking支持模型进行分步、结构化推理,是链式思维范式的工程化落地
推动AI数学能力提升的关键技术包括链式思维推理、RLHF以及针对形式化数学证明的训练方法
还有 40 条时间轴事件
2022年Google Brain的Jason Wei等人发表的思维链(Chain-of-Thought)提示论文首次系统证明加入逐步推理示例能使PaLM等大模型在数学推理任务上准确率大幅提升
90%已验证思维链推理(Chain-of-Thought, CoT)由Google Brain团队在2022年提出,通过引导模型展开逐步推理来提升复杂任务的准确率
90%已验证Chain of Thought能显著提升模型在数学推理、逻辑判断等需要多步推导的任务上的表现
90%已验证Agent的实现通常通过ReAct(Reasoning + Acting)框架来实现规划能力
90%已验证ReAct融合了链式思考(Chain-of-Thought)和直接工具调用两条研究路线,形成「思考→行动→观察」的迭代循环
80%已验证DeepSeek-R1是专注于推理能力的模型,通过强化学习训练具备链式思考能力
80%已验证OpenAI的o1系列代表了「推理时计算」(test-time compute)这一新范式
80%已验证ReAct(Reasoning + Acting)框架由Yao等人在2022年提出,将Chain-of-Thought推理与外部工具交互交替进行
80%已验证O3属于OpenAI的o系列推理模型,引入了思维链(Chain-of-Thought)机制进行多步内部推理
80%已验证Chain-of-Thought提示技术由Google Brain团队在2022年的论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中正式提出
80%已验证思维链(Chain-of-Thought)提示技术由Google Research于2022年提出
80%已验证AI Agent具备工具调用(Tool Use)和规划推理(Planning & Reasoning)两大核心能力,能将复杂目标自动分解为可执行的子任务序列
80%已验证OpenAI的o1系列模型和DeepSeek-R1采用了类似Chain-of-Thought的显式推理机制
80%已验证推理能力基于思维链(Chain-of-Thought, CoT)技术,模型在给出最终答案前生成内部逐步推导过程
80%已验证CoT提示将PaLM 540B在GSM8K数学基准测试中的准确率从17.9%提升至58.1%
75%已验证2022年Google的研究表明,在提示中加入'Let's think step by step'能显著提升模型在数学和逻辑推理任务上的表现
75%已验证提示词工程包括设定角色边界、注入上下文、运用链式思维和少样本示例校准输出
70%已验证Anthropic在2023年发表的研究《Language Models Don't Always Say What They Think》中发现,模型展示的推理步骤有时与其实际决策依据存在系统性偏差
65%已验证推理模型以OpenAI o1、DeepSeek-R1、QwQ为代表,核心机制是思维链扩展,在给出最终答案前生成大量中间推理步骤
65%已验证Chain-of-Thought(思维链)提示技术通过强制模型先输出中间步骤来部分缓解自回归模型在逻辑推理中的缺陷
65%