Normalizing Trajectory Models:让少步生成重拾精确似然框架

NTM用条件归一化流重建扩散模型每一步,在少步生成中重拾精确似然训练能力。
扩散模型依赖大量微小高斯去噪步骤,当采样步数被大幅压缩时,高斯近似失效,生成质量下降。现有的少步加速方案(蒸馏、一致性训练、对抗目标)虽能提速,却普遍放弃了似然框架,使模型失去精确概率密度建模能力。Normalizing Trajectory Models(NTM)提出将反向过程的每一步建模为富有表达力的条件归一化流,利用可逆变换精确追踪概率密度变化,从而在少步生成的同时支持精确似然训练。架构上,NTM结合步骤内的浅层可逆块与深层并行结构,兼顾可逆性约束与表达力。这一方向为少步生成与概率密度建模的长期矛盾提供了新的解题思路,但其在高维图像任务上的扩展性与实际效果仍有待验证。
少步扩散生成的根本矛盾
扩散模型(Diffusion Models)之所以能生成高质量样本,依赖于一个核心假设:将采样过程拆解为大量微小的高斯去噪步骤。每一步的扰动足够小,才能保证高斯分布的近似成立。然而当我们追求更快的生成速度、把整个采样过程压缩到寥寥几个粗粒度的转移步骤时,这一假设便开始失效。
问题在于,粗粒度转移意味着单步需要跨越更大的分布变化,此时简单的高斯去噪已无法准确刻画真实的反向过程。这正是当前少步生成(few-step generation)研究面临的核心张力——速度与保真度之间的权衡。

现有少步方法的代价
为了解决少步生成的难题,学界已经探索出几条主流路径,但它们都付出了相应的代价:
- 蒸馏(Distillation):用一个预训练的多步教师模型指导少步学生模型。这种方法效果不错,但依赖教师模型,训练链条变长。
- 一致性训练(Consistency Training):强制模型在轨迹上保持自洽,从而实现少步甚至单步采样。
- 对抗目标(Adversarial Objectives):引入对抗训练来提升生成质量。
这些方法有一个共同的遗憾:它们在压缩步数的过程中,牺牲了似然框架(likelihood framework)。扩散模型原本具备的可计算、可优化的概率密度特性被放弃,使得模型失去了精确的似然评估能力,也让生成过程的理论可解释性有所折损。
蒸馏(Distillation)在少步扩散模型中有多种具体形态,其中**渐进蒸馏(Progressive Distillation)和一致性蒸馏(Consistency Distillation)**是两条代表性路线。渐进蒸馏通过迭代地将教师模型的两步压缩为学生模型的一步,逐步将采样步数减半。一致性模型则定义了一个"一致性函数",要求模型将同一去噪轨迹上的任意点映射到相同的初始状态,从而实现单步或少步采样。这些方法的共同问题在于:训练目标本质上是回归(匹配教师输出或轨迹上的特定点),而非最大化数据的对数似然,因此生成过程不再对应任何可解释的概率模型。这使得模型难以用于密度估计、不确定性量化等需要显式概率的任务,也削弱了对生成过程的理论分析能力。
NTM:用归一化流重建每一步
针对上述困境,研究者提出了 Normalizing Trajectory Models(NTM,归一化轨迹模型)。它的核心思路是重新设计反向过程中的每一个步骤。
把每一步建模为条件归一化流
NTM 不再把反向步骤简单假设为高斯去噪,而是将每一步建模为一个富有表达力的条件归一化流(conditional normalizing flow)。归一化流的关键优势在于其可逆性与精确似然计算能力——通过一系列可逆变换,模型可以精确地追踪概率密度的变化。
这意味着即使生成被压缩到少数几个粗粒度的转移,每一步内部仍然拥有足够的表达能力去刻画复杂的分布变化,而不必依赖高斯近似。更重要的是,整个模型可以在**精确似然训练(exact likelihood training)**下进行优化,这正是现有少步方法所放弃的宝贵特性。
归一化流(Normalizing Flows)是生成模型的一个重要分支,其核心思想是通过一系列可逆且可微的变换,将简单的已知分布(如标准高斯分布)映射到复杂的数据分布。由于每一步变换都是可逆的,模型可以利用变量替换公式(change-of-variables formula)精确计算数据点的对数似然:$\log p(x) = \log p(z) + \sum_i \log |\det J_i|$,其中 $J_i$ 是每步变换的雅可比矩阵。这与VAE(需要变分下界近似)和GAN(无法计算似然)形成鲜明对比。归一化流的主要挑战在于:为保证可逆性,网络架构受到较强约束(如RealNVP的仿射耦合层、Glow的1×1可逆卷积),这往往限制了单个变换的表达能力,并使参数量和计算量显著上升。NTM正是在这一背景下,通过将流的使用限制在"浅层"且仅作用于单个扩散步骤内部,来规避归一化流在全局高维建模时的扩展性瓶颈。
浅层可逆块与深层并行结构的组合
在架构设计上,NTM 采用了一种分层策略:在每个步骤内部使用浅层可逆块(shallow invertible blocks),同时结合一个深层并行结构。
这种设计的巧妙之处在于平衡了两个需求:浅层可逆块保证了单步变换的可逆性与似然的精确可计算性;而深层并行部分则提供了足够的建模容量来捕捉数据的复杂特征。换言之,NTM 把"可逆性约束"限制在较轻量的局部结构中,又用深层网络承担主要的表征学习任务,从而兼顾了理论严谨性与实际表达力。

这项工作的意义与局限
NTM 的价值在于,它尝试在"少步生成"与"精确似然"这两个长期难以兼得的目标之间架起桥梁。相比蒸馏、一致性训练和对抗训练,NTM 保留了概率密度建模的完整性,这对于需要密度估计、异常检测、或下游概率推断的应用场景具有明确意义。
不过,从目前公开的信息来看,这仍是一项处于早期阶段的研究成果。归一化流本身在高维数据上的扩展性、训练稳定性,以及可逆架构带来的计算开销,都是归一化流类方法长期面临的挑战。NTM 能否在图像等高维生成任务上达到与主流扩散模型相当的样本质量,仍有待更完整的实验数据验证。
对于关注生成模型前沿的研究者而言,NTM 提供了一个值得关注的新方向:与其在压缩步数时放弃似然框架,不如从根本上重新设计每一步的建模方式。这种"回归似然"的思路,或许会为未来的高效生成模型研究提供新的参照。
相关推荐

谷歌AMIE临床研究登上《柳叶刀》:AI问诊首次真实诊所验证
谷歌与BIDMC合作的AMIE对话式诊断AI研究登上《柳叶刀》主刊,首次在真实诊所前瞻性验证。鉴别诊断与医生吻合率达90%,75%病例帮助医生准备问诊,开创患者端AI问诊临床落地新路径。

自然语言 vs SQL:AI 驱动数据可视化的变革
探讨 AI 驱动的数据分析如何用自然语言替代传统 SQL 进行数据可视化,分析两种方式的优势、局限与融合趋势,以及对企业数据团队角色的影响。

NVIDIA Megatron Core实现位级确定性预训练解析
NVIDIA Megatron Core引入位级确定性预训练能力,让大规模模型训练在调试、验证与恢复中实现逐位可复现。本文解析位级确定性的原理、技术挑战及其对AI工程实践的意义。