口语化采样登顶ICML:提示工程配得上顶会吗?

一篇引发争议的ICML论文
近日,一篇名为《Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity》(口语化采样:如何缓解模式坍缩并释放大模型多样性)的论文被今年的ICML接收。ICML(International Conference on Machine Learning,国际机器学习大会)是机器学习领域公认的顶级学术会议之一,创办于1980年,是历史最悠久的机器学习专业会议,由国际机器学习学会(IMLS)主办。与NeurIPS(神经信息处理系统大会,创办于1987年)和ICLR(国际学习表征大会,创办于2013年)共同构成业界公认的「三大顶会」,谷歌、OpenAI、DeepMind等顶级机构的研究人员以在这些会议发表论文为重要学术成果指标。
值得一提的是,三大顶会均采用双盲评审制度(Double-blind Review)——作者不知道审稿人身份,审稿人也不知道作者身份,初衷是减少偏见与「光环效应」。这一制度起源于20世纪中期的学术期刊出版领域,最初是为了对抗「马太效应」(Matthew Effect)——即知名机构的论文因作者声誉而获得不公平的优待,确保评审结果尽量基于研究内容本身的质量。然而这一制度的实际效果在大模型时代受到严重挑战:arXiv预印本平台(2023年AI类论文提交量超过5万篇)使得绝大多数投稿在正式评审前已公开流传,有研究者发现,知名机构的论文即使匿名提交,其写作风格、引用网络和研究方向仍能被有经验的审稿人识别,导致「弱双盲」现象普遍存在。计算机科学家Yann LeCun等人曾公开撰文,指出在arXiv时代双盲评审的实际去匿名化率已接近50%,双盲保护形同虚设。
这一制度困境有其深层的结构性根源。arXiv于1991年由物理学家Paul Ginsparg创立,最初是物理学界的预印本共享平台,2000年代逐步扩展至计算机科学领域。预印本文化的兴起原本是为了加速知识传播、降低发表壁垒,却与双盲评审的去匿名化目标产生了内在张力。更值得关注的是,随着大模型研究热潮涌现,近年三大顶会的投稿量急剧攀升——ICML 2023收到超过6000篇投稿,NeurIPS 2023则突破13000篇,ICML 2024更突破9000篇大关,录用率约27%。为消化庞大的投稿量,会议不得不大量扩招评审员,形成了一个颇为吊诡的循环:投稿量增长催生了更多初级评审员席位,而这些评审员本身往往也是大模型研究的活跃投稿者,在专业判断上存在系统性的同质化风险。审稿质量和接收标准的讨论本身已成为社区长期关注的话题,而这也为「一篇提示词论文能否进顶会」的争议提供了更复杂的制度背景。
争议的核心并不在于论文结论是否正确,而在于其方法论的「技术含量」。这篇论文的核心思想出人意料地简单:通过改变提示词(Prompt)的表述方式,就能让大语言模型产生更加多样化的输出。换言之,它本质上是一个纯粹的提示工程(Prompt Engineering)技巧。
一位Reddit用户直言:「即使它真的有效,我也不确定这种提示工程是否配得上顶级机器学习会议。有人称这类工作为『现代机器学习』,但我认为它应该被归入技术含量较低的会议场合。是我太死板了吗?」
正是因为ICML的权威地位,当一篇以「提示词技巧」为核心贡献的论文被接收时,才会在社区中引发如此强烈的身份认同讨论——人们对「什么样的工作配得上顶级会议」有着根深蒂固的期待。
什么是「模式坍缩」与「口语化采样」
要理解这场争论,首先需要明白论文试图解决的问题。
模式坍缩:大模型的「无聊」困境
「模式坍缩」(Mode Collapse)是生成模型领域的经典难题,最早在GAN(生成对抗网络)领域被系统性描述。GAN由Ian Goodfellow等人于2014年提出,其训练框架包含生成器(Generator)和判别器(Discriminator)两个相互博弈的神经网络。理论上,训练收敛后生成器应能覆盖真实数据的完整概率分布;但实践中,生成器常常发现「欺骗」判别器的捷径——只需持续生成少数几类高质量样本,就能获得较高评分,从而陷入局部最优,无法覆盖真实数据分布的多样性。这一现象在图像生成任务中表现得尤为明显,例如模型可能只会生成某几种特定姿势的人脸。研究者为此提出了系列技术方案:Wasserstein GAN(WGAN)通过引入Wasserstein距离替代传统的JS散度,提供了更稳定、更有意义的梯度信号,从根本上缓解了训练早期的梯度消失问题;谱归一化(Spectral Normalization)通过约束判别器权重矩阵的谱范数来满足Lipschitz条件,使训练更加稳定;小批量判别(Minibatch Discrimination)则允许判别器在批次层面检测多样性缺失,从而对模式单一的生成结果施加惩罚。
值得注意的是,大语言模型中的模式坍缩与GAN中的模式坍缩虽然共享同一术语,但机制存在重要差异。GAN的模式坍缩根植于生成器与判别器博弈动力学的失衡——判别器一旦在某类样本上快速收敛,生成器便会将全部「精力」集中于攻克这一漏洞,导致生成分布坍缩至单一模式。其工程解决方案因此聚焦于训练动力学的稳定性(如梯度惩罚、谱归一化);而LLM的模式坍缩则主要由自回归生成机制与RLHF优化的组合效应驱动,可从解码策略、训练目标和提示设计三个维度分别入手——这也是为什么「口语化采样」这类纯提示方法能够作为独立研究方向出现,它针对的是一个完全无需触碰模型权重的优化空间。自回归语言模型在生成时,每个token的选择都会影响后续的条件概率分布,贪婪解码(Greedy Decoding)倾向于逐步强化高概率路径,形成「概率放大效应」——即使初始分布相对均匀,多步生成后输出也会高度集中于少数几条文本路径,表现为输出缺乏多样性。两者根本成因(优化目标导致输出分布退化)高度相似,因此沿用了同一术语。当你反复向大语言模型提出同一个开放性问题时,它往往会给出高度雷同的答案,缺乏多样性。比如让模型「写一个笑话」或「起一个名字」,它可能翻来覆去只给出几种套路化的回答。
这一现象源于训练机制的内在规律。RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)由OpenAI于2022年在InstructGPT论文中被大规模验证,随后成为ChatGPT、Claude、Gemini等主流大模型「对齐」的核心技术。其完整流程分为三个阶段:首先用指令数据对基础语言模型进行监督微调(SFT);然后收集人类标注员对多个模型输出的偏好排序数据,训练一个奖励模型(Reward Model)来模拟人类判断;最后使用近端策略优化(PPO)等强化学习算法,以奖励模型的评分为信号优化语言模型策略。这一过程虽然显著提升了模型的安全性和有用性,却带来一个关键副作用——人类标注员在评分时具有系统性偏见,倾向于给措辞流畅、结构清晰、长度适中的「看起来正确」的答案打高分,而非真正富有创意或多样性的回答。
这种系统性偏见在标注员群体的构成上有其社会学根源:大多数RLHF标注任务依赖众包平台(如Scale AI、Surge AI)招募的标注员,他们并非领域专家,对「创意多样性」的感知天然弱于对「流畅准确」的判断,其偏好聚合后形成的奖励模型自然倾向于奖励「安全的主流表达」。「对齐税」(Alignment Tax)的存在已有系统性量化研究支撑:斯坦福CRFM团队的HELM基准测试发现,经过RLHF对齐的模型在创意写作任务上的词汇多样性指标(如Type-Token Ratio,即文本中不同词汇数量与总词汇数量的比值,是衡量词汇丰富度的经典指标)普遍低于对应的基础预训练模型;Anthropic研究人员在2023年的「Constitution AI」论文中也记录了安全对齐与输出多样性之间的可测量权衡曲线,表明这一张力并非主观感受,而是系统性现象。模型在反复优化后,分布自然向「安全区间」收缩,输出分布变得尖锐,从而牺牲了创造性与多样性——这对于头脑风暴、创意写作、数据增强等应用场景来说是明显的短板。
口语化采样:让模型主动「报出概率」
传统应对多样性不足的方法是调整「温度」(Temperature)和Top-p等采样参数。语言模型在生成每个词(Token)时,本质上是在对词表中所有候选词进行概率打分,形成一个概率分布,再从中采样。「温度」参数T通过将Logits(模型原始分数)除以T来缩放这个分布:T<1时分布变得更尖锐,高概率词被进一步强化,输出更确定但缺乏变化;T>1时分布趋于均匀,低概率词获得更多被选中的机会,输出更随机但质量可能下降;当T趋向0时,模型退化为完全确定性的贪婪解码,每次必然输出概率最高的词。「Top-p采样」(核采样,Nucleus Sampling)由Holtzman等人在2020年的论文《The Curious Case of Neural Text Degeneration》中提出,该论文通过分析「令人惊讶度」(Surprisal)曲线,发现高质量人类文本的概率分布特征与模型退化输出存在系统性差异,进而提出按概率从高到低累加、一旦累积概率达到阈值p(如0.9)就只从这个最小词集中采样的动态截断策略,能比固定Top-k采样更灵活地适应分布形状的变化。
然而,这两种参数调整有一个更深层的局限:它们作用于词级别(token-level)的局部决策,而语义层面的多样性需要在更长的文本跨度上体现。研究者发现,即使将温度提升至1.5甚至更高,模型仍倾向于在宏观结构上重复相同的叙事框架(如「首先…其次…最后…」),因为RLHF训练已将这类结构深度内化为高奖励模式。这说明多样性不足是一个多尺度问题——token级别的随机性增加并不能有效传导至句子乃至篇章层面的结构多样性,两者之间存在一道由训练目标设定的「隐形天花板」。单一的解码参数调整难以从根本上解决这一跨尺度问题。此外,在API调用场景下,这些参数全局作用于整个生成过程,无法针对特定语义位置进行精细控制,用户通常也无法直接干预模型底层的解码机制。
「口语化采样」正是在这一背景下提供了替代路径:直接在提示词中要求模型生成一组候选答案,并让模型显式地「说出」每个答案对应的概率分布。这一方法与「思维链」(Chain-of-Thought)提示存在深层的技术关联——两者都属于「元认知提示」(Metacognitive Prompting)的范畴,即通过提示词引导模型对自身推理或生成过程进行显式表达。从Transformer架构的视角来看,当提示中明确要求枚举多样性选项时,模型的注意力分布会发生系统性改变,激活训练数据中与「多样性枚举」「概率估计」相关的语义模式,从而迫使模型探索概率分布的更多区域,而不是每次都收敛到分布的峰值附近。值得注意的是,这一机制与大型语言模型中「隐式知识的显式化」现象密切相关:模型在预训练阶段已经通过大量文本内化了对不确定性的表达方式,而口语化采样本质上是通过提示词「解锁」这部分能力,使其从隐式的概率权重转化为显式的文本输出。通过将采样过程「口语化」地嵌入提示中,这种方法无需修改模型权重,无需重新训练,仅凭提示词的巧妙设计就能显著提升输出多样性。
争议的本质:提示工程算不算「真研究」
这场讨论真正有价值的地方,在于它触及了当下AI研究领域一个深层的身份认同焦虑。
质疑方:缺乏理论深度
反对者的观点相当鲜明。首先,这类工作难以提供严格的理论分析——你很难用数学证明「换一种说法提示模型」为什么奏效,其有效性更多依赖实验观察。其次,从技术复杂度看,它既没有新的模型架构,也没有新的训练算法,本质上是一种「使用技巧」。
在传统机器学习研究者眼中,顶级会议应该发表那些具有坚实理论基础、可复现、可推广的技术创新。一个提示词技巧,无论效果多好,都更像工程经验的总结,而非科学发现。这一立场背后有其深厚的历史渊源:深度学习兴起之前,机器学习社区以支持向量机(SVM)、核方法(Kernel Methods)、概率图模型等具有严密数学基础的方法为主流,这些方法不仅有完整的理论框架,更有泛化界(Generalization Bounds)——即对模型在未见数据上表现的理论上界估计——作为评价研究质量的隐性标尺。PAC(Probably Approximately Correct)学习理论为算法样本复杂度提供了严格的数学保证,这一学术文化积淀使得「无理论支撑的经验方法」天然处于弱势地位,也深刻影响了现在仍活跃在顶会评审席位上的一代研究者的价值判断。
这种价值判断的形成有其历史合理性:在小模型时代,一个方法若缺乏理论支撑,其有效性往往难以跨数据集、跨任务迁移,经验结论的脆弱性是真实的学术风险。但大模型时代的规模效应在某种程度上重新分配了这一风险——在足够多样的基准测试上通过大量实验验证的方法,其泛化性反而往往强于许多「有理论证明」却在大模型上失效的传统方法,这是促使评价标准被迫重塑的实际动力。
支持方:这就是「现代机器学习」
另一派观点则认为,这恰恰代表了机器学习研究范式的转变。提示工程(Prompt Engineering)在大模型兴起初期常被视为「调参玩具」,但这一判断正在被修正。2022年Google Brain的Jason Wei等人发表的「思维链」(Chain-of-Thought, CoT)提示论文是关键转折点——该论文首次系统证明,在提示中加入「逐步推理示例」能使PaLM等大模型在数学推理任务上的准确率大幅提升,甚至在某些任务上超越了专门微调的小模型。CoT论文发表后两年内引用量突破万次,成为NLP领域引用速度最快的论文之一,催生了一个完整的研究生态:从「最少到最多提示」(Least-to-Most Prompting,通过将复杂问题分解为子问题序列来提升推理能力)到「思维图」(Graph of Thoughts,将推理路径从线性链式结构扩展为图结构,允许合并和拆分推理节点),再到「Skeleton-of-Thought」(骨架思维,先生成答案大纲再并行填充细节以提升生成速度),这些工作均以提示设计为核心贡献,却相继被NeurIPS、ICML、ICLR等顶会接收,从制度层面为「口语化采样」此类工作的录用提供了重要的参照依据和路径验证。
同年,「零样本思维链」(Zero-Shot CoT)论文进一步发现,仅在提示末尾加上「Let's think step by step」这一句话,就能触发类似效果,将提示词的作用从「格式约束」提升到「激活模型潜在推理能力」的高度。这一发现在认知科学意义上颇为深刻:它暗示预训练语言模型已经内化了「逐步推理」的知识结构,提示词的作用更像是「开关」而非「注入」,这与传统微调范式中「外部注入新知识」的逻辑形成了根本性的范式对比。此后,「自洽性采样」(Self-Consistency,通过对同一问题多次采样并取多数答案来提升推理准确性)、「思维树」(Tree of Thoughts,将推理过程建模为树状搜索空间并引入启发式评估)等工作相继在顶级会议发表,各类「系统提示」研究也表明学术界已逐步承认提示设计是研究大模型行为规律的合法科学手段。从认知科学角度看,提示词如何影响模型输出,本质上是在探究「语言形式如何激活神经网络的不同计算路径」,具有真正的科学价值。
更关键的是,如果一个简单的方法能够解决模式坍缩这个长期困扰业界的实际问题,且效果经得起大量实验验证,那么它的实用价值本身就足以支撑其学术地位。评价一项研究,「新颖性」与「影响力」同样重要,缺一不可。
更深层的思考:评价标准正在被重塑
这场争论没有绝对的对错,它折射出AI领域正在经历的深刻变革。
在深度学习兴起之前,机器学习是一门高度数学化的学科,理论证明是硬通货。但大模型时代的到来,让许多重要发现来自「实验先行」——先观察到现象,再尝试解释。大模型的「涌现能力」(Emergent Abilities)是最典型的例证:由谷歌研究团队在2022年发表于《机器学习研究汇刊》(TMLR)的论文《Emergent Abilities of Large Language Models》中首次系统记录了超过137种在小模型中完全不存在、但随着模型参数规模突破某一阈值后突然具备的能力,包括多位数算术、词语类比推理等,而非随规模线性增长。这种不连续性使得涌现能力既难以被理论预测,也难以被工程设计刻意追求,只能通过大规模实验观察事后记录。
然而这一现象至今没有完整的理论能够预测哪些能力会在何种规模下涌现。Schaeffer等人2023年在ICML发表的论文《Are Emergent Abilities of Large Language Models a Mirage?》直接以对话式标题挑战了这一现象的真实性,指出部分「涌现」现象可能是评估指标的非线性选择造成的假象——当使用精确匹配(Exact Match)这类「全有或全无」的指标时,模型能力的渐进式提升会在某个阈值处突然转化为可见的性能跳跃,制造出「突然涌现」的假象;而切换为连续性指标(如BLEU分数)后,同样的模型往往展现出平滑的线性增长曲线,而非真实突变。这一研究揭示了一个更深层的方法论问题:在大模型评估中,指标的选择本身就是一种理论预设,不同的评估框架可能导出截然相反的科学结论,这使得「实验先行」的研究范式比传统机器学习时代面临更高的方法论风险。这篇以「分析和重新框架化已有现象」为核心贡献的论文本身同样被顶会接收,从侧面说明「解析已有观察结论」在当前学术环境中是被认可的贡献类型,也与「口语化采样」面临的处境形成有趣的镜像。类似的还有「上下文学习」(In-Context Learning)——模型仅凭提示中的少量示例就能泛化到新任务,其机制至今众说纷纭,有研究者认为这是隐式贝叶斯推断,有研究者认为这是梯度下降的近似(即模型在前向传播中执行了某种形式的「隐式梯度更新」),也有研究者认为这本质上是一种精妙的模式匹配,三种解释至今共存而无定论。这些现象共同说明:「观察到可重复的现象并加以利用」本身就具有科学价值,即便理论解释尚不完备——与「口语化采样」有效但机制不明的处境如出一辙。
从这个角度看,提出质疑的Reddit用户并非「太死板」,他坚守的是学术严谨性的传统底线,这种坚持有其价值。但同时,将提示工程一概斥为「不够技术」也可能是一种傲慢——毕竟,一个能被大量后续工作引用、能真正改善模型表现的方法,其贡献不应被方法的「简单」所掩盖。
真正健康的态度或许是:既欢迎这类务实的经验性创新进入顶会,推动实际应用;也保持对理论深度的追求,鼓励研究者去解释「为什么有效」。简单不等于肤浅,复杂也不等于深刻。ICML接收这样一篇论文,或许正是学术共同体在用行动作答——在大模型时代,解决真问题的实用方法,同样值得被看见。
结语
「Verbalized Sampling」的争议,本质上是一场关于AI研究价值观的讨论。当技术发展速度远超理论解释能力时,评价体系必然面临调整。对于从业者而言,与其纠结于「这算不算真研究」,不如关注一个更实际的问题:这个方法能否真正帮到你的应用场景?如果答案是肯定的,那它的价值就已经得到了证明。
核心要点
核心要点
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。