GLM-5.3 Flash思考过程太冗长?推理模型Token成本问题引热议

GLM-5.3 Flash引发社区热议
近日,Reddit社区中一则关于智谱(Zhipu AI)新模型 GLM-5.3 Flash 的帖子引起了广泛讨论。发帖者用「Wait what??!!」表达自己的惊讶,直指推理模型(reasoning model)的一个普遍痛点:思考过程为何如此冗长,如此「能说会道」?

这位用户的核心吐槽相当犀利——「Here goes where we spend the tokens here...(我们的token就这么花掉了)」。这句话道出了 Chain-of-Thought(思维链)类模型的一个结构性问题:为了提升推理任务的准确率,模型会生成大量中间思考文本,而这些文本实实在在地消耗着用户的token预算。
Chain-of-Thought(CoT)是2022年由Google研究团队的Jason Wei等人在论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中系统提出的一种提示策略,核心思想是让大语言模型在给出最终答案之前,逐步展示中间推理过程。这一方法的灵感来源于人类解决复杂问题时的思维方式——我们通常不会直接跳到答案,而是通过分步推导来降低认知负荷。CoT在数学应用题、多步逻辑推理、代码调试等场景中表现尤为突出,有时能将模型的准确率提升数十个百分点。
值得注意的是,CoT技术自提出以来已经历了多轮迭代演进。最初的CoT需要在提示中提供包含推理步骤的示例(few-shot CoT),随后Kojima等人发现仅添加「Let's think step by step」这一简单指令就能激活模型的推理能力(zero-shot CoT)。此后,研究者们进一步发展出了Tree-of-Thought(ToT)——让模型同时探索多条推理路径并选择最优解,以及Graph-of-Thought(GoT)——允许推理步骤之间形成更复杂的依赖关系。一个重要的发现是,CoT能力具有明显的「涌现」特性:只有当模型参数规模超过一定阈值(通常认为在60B-100B参数以上)时,CoT才能稳定地带来性能提升;在较小的模型上,CoT甚至可能导致性能下降。这也是为什么推理模型通常需要较大的参数规模作为基础,也解释了模型蒸馏在推理能力迁移中的重要性——通过蒸馏技术,研究者可以将大模型的推理能力「压缩」到参数量更小的模型中,使其在较低计算成本下也能展现出色的推理表现。近期DeepSeek-R1的蒸馏版本(如R1-Distill-Qwen-32B)就是这一路线的成功案例,它在仅32B参数的规模下就展现出了接近完整R1模型的推理能力。
然而,CoT的代价也很明显:每一步推理都需要生成额外的文本token,而在大模型的计费体系中,token数量直接关联使用成本。这就形成了一个经典的工程权衡——推理质量与资源消耗之间的拉锯。
思考模型为何生成大量冗余文本
推理能力与Token成本之间的矛盾
自 OpenAI o1、DeepSeek-R1 等推理模型走红以来,「先思考、后回答」几乎成了高性能模型的标配范式。这类模型在输出最终答案前,会展开一段(有时相当漫长的)内部推理过程。理论上,更充分的思考意味着更可靠的答案,尤其在数学、代码、逻辑推理等复杂任务上优势明显。
OpenAI o1是2024年9月发布的推理模型,它在内部通过强化学习训练出一种「慢思考」能力——在面对复杂问题时,模型会在隐藏的思考空间中进行多步推理,然后才输出最终答案。这一范式在数学竞赛、博士级科学问题等高难度基准测试上取得了突破性表现。DeepSeek-R1则是中国AI公司深度求索在2025年初推出的开源推理模型,它通过大规模强化学习(特别是GRPO算法)让模型自主习得了推理能力,且训练成本远低于同类模型。
这里值得深入解释一下推理模型背后的强化学习训练范式。传统的大语言模型主要通过监督微调(SFT)来学习遵循指令,而推理模型则更多依赖强化学习(RL)来激发深层推理能力。DeepSeek-R1采用的GRPO(Group Relative Policy Optimization)算法是PPO(Proximal Policy Optimization)的一种改进变体,它无需训练额外的价值网络(value model),而是通过在同一问题上采样一组回答,以组内相对表现作为基准来计算奖励信号,从而大幅降低了训练成本。PPO本身是OpenAI在2017年提出的强化学习算法,它通过限制策略更新的幅度来保证训练稳定性,在RLHF(基于人类反馈的强化学习)中被广泛使用。GRPO的创新之处在于,它用一种更简洁的「组内排名」机制替代了PPO中需要单独训练的价值网络——给定一个问题,模型生成一批候选回答,然后根据这些回答的相对质量来分配奖励,质量高于组内平均水平的回答获得正向奖励,反之获得负向奖励。这种设计不仅减少了训练所需的模型数量,还避免了价值网络估计不准确带来的训练不稳定问题。
在奖励设计上,业界正从基于最终结果的奖励(outcome-based reward,即只看答案对不对)逐步转向基于过程的奖励(process-based reward,即评估每一个推理步骤的质量)。OpenAI在2023年发表的PRM800K论文中就展示了过程奖励模型(Process Reward Model)的潜力——它不仅能提升最终答案的准确率,还能让模型的推理过程更加可靠和可解释。然而,过程奖励模型的训练需要大量人工标注的逐步推理数据,这在实践中仍然是一个显著的瓶颈。近期的研究正在探索自动化生成过程奖励标注的方法,包括利用蒙特卡洛树搜索(MCTS)来评估每一步推理的贡献度,以及通过模型自身的一致性检验来识别推理过程中的关键步骤和错误步骤。
这两款模型的成功迅速带动了整个行业的「推理模型热潮」,几乎所有主流厂商都在跟进发布自己的thinking model版本,使得「先思考后回答」成为2025年大模型的主流范式。
然而,这种设计也带来了不容忽视的副作用:
-
Token消耗成倍增长:同样一个问题,推理模型可能要多花数倍甚至十几倍的输出token,直接推高API调用成本。在大语言模型的商业化服务中,token是最基本的计费单位。一个token大约对应英文中的4个字符或中文中的1-2个汉字。API服务通常分别对输入token和输出token计费,且输出token的单价往往是输入token的2-4倍。以推理模型为例,一个原本只需200个输出token就能回答的问题,如果模型先生成了2000个token的思考过程,那么用户实际支付的费用可能是非推理模型的5-10倍。
从「Token经济学」的角度来看,推理模型的出现对大模型商业化的成本结构产生了深远影响。在推理模型出现之前,业界已经建立了一套相对稳定的定价体系——输入token和输出token分别定价,开发者可以相对准确地预估API调用成本。但推理模型引入了第三种token类型:推理token(reasoning tokens或thinking tokens)。不同厂商对推理token的计费策略差异巨大:有的厂商将推理token按输出token同价计费,有的提供折扣价,还有的(如某些开源模型的自部署方案)虽然不直接收费但会占用GPU算力和推理时间。例如,OpenAI的o1系列模型在定价中将推理token按输出token价格计算,这使得一个看似简单的查询的实际账单可能令开发者大吃一惊。对于高频调用的生产环境,比如客服系统或批量数据处理,这种成本放大效应会迅速累积为显著的财务负担。据行业估算,在某些场景下,从传统模型切换到推理模型后,月度API账单可能膨胀3-8倍。这一现实也催生了一系列成本优化策略:智能路由(根据问题复杂度自动选择推理模型或普通模型)、推理缓存(对相似问题复用已有的推理结果)、以及分层推理(先用轻量模型尝试回答,只有在置信度不足时才调用推理模型)。
-
响应延迟增加:冗长的思考链意味着更长的生成时间,对交互式应用的体验影响很大。大语言模型的文本生成是自回归式的(autoregressive),即一个token一个token地顺序生成,因此输出token数量与响应时间几乎成正比。当推理模型在思考阶段生成数千个token时,用户可能需要等待数十秒才能看到最终答案——这对于聊天机器人、实时翻译、代码补全等对延迟敏感的应用场景来说是难以接受的。值得一提的是,一些厂商(如OpenAI和Anthropic)选择在流式输出中隐藏思考过程,用户只能看到最终答案的逐步呈现,但底层的生成延迟依然存在。这种「隐藏延迟」虽然改善了用户感知,却也引发了关于透明度的讨论:用户是否应该知道自己在为看不见的推理过程等待和付费?
-
信息冗余严重:许多思考步骤对最终答案并无实质贡献,属于「为了思考而思考」。研究者观察到,推理模型在训练过程中可能学会了一些「推理习惯」,比如反复验证已经确定的结论、过度展开简单的逻辑步骤、或者在不同表述之间来回切换。这种现象有时被称为「overthinking」(过度思考),它不仅浪费token,在某些情况下甚至可能导致模型「想太多」而改变原本正确的答案。学术界对这一现象已有系统研究,一项针对多个推理模型的分析发现,在某些数学推理任务中,模型生成的思考链中有30%-50%的内容可以被移除而不影响最终答案的正确性。更有趣的是,某些模型会在思考过程中表现出「自我怀疑」的行为模式——先得出正确答案,然后反复质疑自己,最终反而改成了错误答案。这种「过度纠正」现象与人类在考试中的类似行为如出一辙,暗示着推理模型可能不自觉地模仿了训练数据中人类的思维缺陷。
发帖者所质疑的「why does the thinking model even needs to be this expressive?(为什么思考模型需要这么能说?)」,正是开发者对这种冗余表达的直接不满。
GLM-5.3 Flash的定位与现实落差
「Flash」这一命名通常意味着快速、轻量、低成本——类似 Gemini Flash 系列的产品思路。Google的Gemini Flash系列(如Gemini 1.5 Flash、Gemini 2.0 Flash)是业界「轻量高效模型」的代表性产品线。Flash系列的设计哲学是在保持足够能力的前提下,大幅降低延迟和成本——通常通过模型蒸馏、架构优化和较小的参数规模来实现。例如Gemini 2.0 Flash的API价格仅为Pro版本的数分之一,但在大多数日常任务上能达到接近的表现。这种「够用就好」的产品定位深受开发者欢迎,尤其适合需要高吞吐量、低成本的应用场景。
在这一背景下,有必要了解智谱AI及其GLM系列模型的整体技术演进。智谱AI(Zhipu AI)成立于2019年,脱胎于清华大学计算机系知识工程实验室(KEG),由唐杰教授团队创立。GLM(General Language Model)系列采用了独特的自回归填空(Autoregressive Blank Infilling)预训练范式,这与GPT的单向自回归和BERT的双向掩码语言模型都有所不同——GLM通过随机遮盖文本中的连续片段,然后以自回归方式生成被遮盖的内容,这种设计使模型同时具备了理解和生成的双重能力。从早期的GLM-130B(2022年发布的1300亿参数开源模型,是当时国内最大的开源模型之一),到GLM-4系列(2024年推出,在多项基准上达到国际一流水平),再到如今的GLM-5系列,智谱一直在推进模型能力的快速迭代。GLM-5系列被定位为智谱的新一代旗舰模型,而Flash版本则是面向开发者的高性价比选项。智谱在国产大模型生态中扮演着重要角色——它既是清华系AI技术商业化的代表,也是推动中国大模型开源生态发展的关键力量,其开源的ChatGLM系列在国内开发者社区中有着广泛的用户基础。值得一提的是,智谱在模型架构上的持续创新也受到国际关注——GLM系列独特的预训练范式在某些下游任务上展现出了与纯自回归模型不同的优势特性,这也为其在推理效率优化上提供了独特的技术空间。
因此,用户的惊讶恰恰来自于预期与实际的落差:一个主打「快」和「省」的模型,在思考环节却表现出超出预期的冗长输出,这种反差让人尤其难以接受。
这暴露了推理模型设计中的一个深层矛盾:如何在保留推理能力的同时,有效控制思考过程的token开销? 如果连Flash级别的轻量模型都无法压缩思考链长度,那么在成本敏感的生产环境中,这将成为一个棘手的工程问题。这也引出了一个更根本的技术问题:Flash级模型是否应该采用与旗舰模型完全相同的推理范式?或许对于轻量模型而言,更合适的路径是在训练阶段就针对推理简洁性进行专门优化,而非简单地将旗舰模型的推理机制等比缩放。
行业如何破解「思考效率」难题
可控推理长度成为研发重点
这场讨论并非个例,而是整个AI行业正在面对的共性挑战。目前,多家模型厂商已经在探索可控推理长度的解决方案:
-
思考预算参数:提供 thinking budget 参数,允许用户设定推理token的上限,从而控制成本。具体而言,用户可以在API请求中设置一个max_thinking_tokens参数,限定模型在推理阶段最多使用多少token。例如,Anthropic的Claude模型允许设置thinking budget,Google的Gemini 2.5系列也支持类似的推理预算控制。当模型的思考过程达到设定上限时,它会被迫在已有的推理基础上给出最终答案,而不是继续无限展开。这种机制让开发者能够在精度和成本之间做出精细化的权衡——对于简单查询设置较低预算,对于复杂推理任务则放宽限制。不过,思考预算机制也面临技术挑战:如果模型在推理进行到一半时被强制截断,可能导致不完整的推理链和质量骤降的输出。理想的实现需要模型能够「感知」剩余预算,并在接近上限时优雅地收束推理过程,而非生硬地中断。
-
自适应思考机制:让模型根据问题难度动态决定思考深度——简单问题直接作答,复杂问题才展开完整推理。这一方向与近年来学术界关于「推理时计算最优分配」(compute-optimal inference)的研究密切相关。2024-2025年间,多篇重要论文探讨了如何在推理阶段动态分配计算资源的问题。核心思想是:不同的问题需要不同量级的计算投入,一个理想的系统应该能够在接收到问题后快速评估其难度,然后相应地调整思考深度。实现这一目标的技术路径包括:训练一个轻量级的「难度评估器」对问题进行分类,使用模型自身的初始token生成速度和困惑度(perplexity)作为难度信号,或者通过元学习让模型内化这种难度感知能力。困惑度是衡量语言模型对下一个token预测不确定性的指标——困惑度越高,说明模型对当前生成内容越「不确定」,这可以作为问题难度的一个代理信号。一些前沿研究还探索了「混合推理」策略——对同一个问题同时运行快速路径和慢速路径,如果快速路径的置信度足够高就直接输出,否则等待慢速路径的结果。这种思路与Daniel Kahneman在《思考,快与慢》中提出的双系统理论(System 1的快速直觉判断与System 2的慢速深度推理)有着深刻的理论呼应,可以说推理模型正在尝试在工程层面复现人类认知的这种双模式架构。
-
强化学习优化推理效率:通过训练手段让模型学会用更少的推理步骤达到同样的正确率。这一方向的核心思路是在训练阶段引入「简洁性奖励」——不仅奖励模型给出正确答案,还额外奖励它用更少的推理步骤达到正确结果。例如,DeepSeek团队在训练R1模型时就观察到,模型在RL训练过程中会自发学习调整推理长度,对简单问题逐渐缩短思考过程。另一种方法是「推理蒸馏」,即用一个长思考的大模型生成正确答案和精简后的推理路径,再用这些数据训练一个更小、更高效的模型。此外,还有研究者探索「early exit」机制,让模型在推理过程中动态判断是否已经有足够信心得出答案,从而提前终止思考。在奖励函数的设计上,一个关键的工程细节是如何平衡「正确性奖励」和「简洁性奖励」的权重——如果过分强调简洁性,模型可能会走捷径、跳过关键推理步骤,导致准确率下降;如果简洁性权重太低,则优化效果不明显。目前业界通常采用多目标优化或课程学习(curriculum learning)的方式来逐步引入简洁性约束。
除了上述方向,还有一些前沿的工程优化手段正在被探索。Speculative decoding(投机解码) 是其中一种颇具前景的技术——它使用一个小型「草稿模型」快速生成候选token序列,然后由大模型并行验证,从而在不牺牲输出质量的前提下显著提升生成速度。这一技术的理论基础是:小模型虽然质量较低,但在很多情况下其生成的token与大模型的选择是一致的,通过并行验证可以一次性「接受」多个连续正确的token,将原本逐一生成的串行过程部分转化为并行操作。实验表明,speculative decoding在不改变输出分布的前提下,可以将推理速度提升2-3倍。虽然speculative decoding主要优化的是延迟而非token数量,但它与推理效率优化形成了互补:即便模型仍然需要生成较长的思考链,生成速度的提升也能部分缓解用户体验上的痛点。另一个值得关注的方向是思考过程的压缩与摘要——让模型在完成完整推理后,自动将冗长的思考链压缩为关键推理步骤的摘要,从而在保留可解释性的同时减少向用户展示(和计费)的token数量。更激进的方案则是探索「潜空间推理」(latent space reasoning),即让模型在隐藏层的向量空间中完成推理,而非将每一步都映射为自然语言文本——这可以从根本上消除冗余的文本生成,但目前这一方向仍处于早期研究阶段。
开发者的真实诉求:不只要准,还要划算
从这条Reddit帖子可以看出,开发者和用户对模型的期待正变得更加务实。他们关心的不再只是「模型能不能答对」,而是「答对的成本是否合理」。
对于绝大多数日常应用场景,用户并不需要查看模型完整的思考过程,更不希望为那些看不见的中间推理步骤额外付费。这给模型厂商提出了明确的产品要求:思考能力应该是一种可按需调用的功能,而不是无差别地强加给每一次请求。 从产品设计角度来看,这意味着API需要提供更细粒度的控制选项——比如是否启用思考模式、思考内容是否返回给用户、以及思考token是否单独计费等。只有当用户拥有充分的选择权,推理模型的商业化才能真正走向成熟。
这种诉求的背后还有一个更深层的行业趋势:大模型的竞争正在从「能力维度」拓展到「效率维度」。2024年以来,业界越来越多地使用「每百万token成本下的性能表现」这一复合指标来评估模型——它不仅考虑模型在基准测试上的得分,还将达到该得分所需的token成本纳入考量。在这一框架下,一个推理更精简但准确率略低的模型,可能比一个推理冗长但准确率稍高的模型在实际部署中更具价值。Chatbot Arena等主流评测平台也开始在其评估体系中纳入效率相关的维度,部分第三方基准测试已经开始发布「性价比排行榜」,将模型的API价格与其在各项任务上的得分进行综合排名。这一趋势正在深刻改变模型厂商的研发优先级——仅仅追求在MMLU、HumanEval等传统基准上刷高分已经不够,如何在维持高得分的同时降低每次推理的token消耗,成为新的竞争焦点。
推理模型的未来:平衡思考价值与使用成本
GLM-5.3 Flash 引发的这场讨论虽然篇幅不长,却精准戳中了推理模型时代的核心议题:思考的价值与成本如何平衡。
随着越来越多模型采用「先思考后回答」的范式,token效率、推理长度控制、思考过程的透明度和可选性,都将成为衡量一款模型是否真正好用的关键指标。对于追求性价比的开发者来说,一个能聪明地判断「何时该深思、何时该速答」的模型,远比一个「无脑长思考」的模型更有吸引力。
从更宏观的视角来看,这场关于推理效率的讨论实际上反映了AI行业正在经历的一次重要转型——从单纯追求模型能力的「性能竞赛」,逐步转向关注实际部署效果的「效率竞赛」。正如芯片行业曾经从单纯追求主频转向注重能效比一样,大模型行业也在走向一个更成熟的阶段:最好的模型不是思考最多的模型,而是恰到好处地思考的模型。这一转变的历史类比颇具启发性——在半导体行业,2000年代中期Intel放弃了「频率至上」的Pentium 4路线,转而追求「每瓦特性能」的Core架构,这一战略转向被证明具有深远影响。当时Intel的Pentium 4处理器虽然在主频上不断刷新纪录(最高达到3.8GHz),但由于微架构设计上的深度流水线策略,其实际每周期执行指令数(IPC)反而不如竞争对手,同时功耗和发热问题日益严重。最终,Intel的工程师们认识到,盲目追求单一指标(主频)的道路已经走到了物理极限,转而回归更平衡的设计理念,推出了以能效比著称的Core微架构。大模型行业或许正站在类似的拐点上:当模型能力的绝对值不再是唯一卖点时,如何用最少的计算资源提供最大的用户价值,将成为下一阶段竞争的核心命题。
未来,我们很可能看到更多模型在产品层面明确区分「快速模式」与「深度思考模式」,把选择权真正交还给用户。实际上,这种分层设计已经初见端倪——Anthropic的Claude 3.5 Sonnet推出了可选的extended thinking模式,Google的Gemini 2.5系列支持thinking budget控制,而多家中国AI厂商也在其模型API中加入了类似的可控推理选项。随着这些机制的逐步成熟和标准化,我们有理由期待推理模型将在不远的未来找到「思考价值」与「使用成本」之间的最优平衡点。智谱GLM系列作为国产大模型的重要代表,其在推理效率优化上的后续迭代也值得持续关注。
注:本文基于Reddit社区讨论撰写,关于GLM-5.3 Flash的具体性能数据和技术规格,建议以智谱官方发布信息为准。
相关推荐

Gemini学生免费一年能否开发App?实测对比Claude和ChatGPT
谷歌向学生提供一年免费Gemini Advanced,它的编程能力能否胜任App开发并上架App Store?本文对比Gemini、Claude、ChatGPT的代码生成能力,给出初学者实用建议。

Anthropic被诉:Claude Max 20倍套餐实际仅6倍用量?
一份针对Anthropic的诉讼文件指控Claude Max套餐存在虚假宣传:20倍套餐实际仅提供约6倍用量,5倍套餐也只有3.5倍。本文梳理诉讼细节、社区质疑与AI订阅透明度困境。

Cursor新手实战:六步工作流搞懂改动、回退与验收
零基础用Cursor做项目总翻车?本文拆解六步开发工作流,涵盖Cursor Rules设规矩、Plan模式审计划、Diff查改动、Checkpoint回退等核心技能,帮新手从碰运气变成做工程。