[控场AI]
概念变分自编码器 / Variational Autoencoder

VAE

一种生成模型,训练目标为ELBO(证据下界),基于变分推断框架,将编码器输出建模为概率分布

核心事实

时间轴 (近 90 天)

8月27日

Stable Diffusion通过预训练的VAE将512×512×3的图像编码为64×64×4的潜在张量,计算量降低约48倍

待验证50%
8月27日

Stable Diffusion将扩散过程从像素空间搬到潜在空间,通过VAE编码器将图像压缩为低维表示再去噪,降低计算开销

待验证50%
8月27日

KL散度在变分推断(VAE的ELBO目标)、知识蒸馏和模型压缩中扮演核心角色

待验证50%
8月27日

VAE的编码器将图像压缩到低维潜空间,通常将空间分辨率缩小8倍(1024×1024变为128×128)

待验证50%
8月26日

VAE(变分自编码器)负责潜在空间与像素空间之间的编解码,不同的VAE会影响画面的色彩饱和度和细节表现

待验证50%
8月26日

Checkpoint是预训练的扩散模型权重文件通常2-7GB,VAE负责像素空间和潜空间之间转换图像,CFG Scale控制生成图像对文本提示词的遵循程度

待验证50%
8月26日

VAE(变分自编码器)在扩散模型管线中承担图像压缩与解码角色,将潜空间表示还原为像素级图像

待验证50%
7月20日

概率论中的贝叶斯推断是生成模型(VAE、扩散模型)的理论根基

待验证50%
7月6日

扩散模型在生成图像时本质上是在高维潜空间(Latent Space)中进行去噪采样,缺乏多角度约束时同一角色在不同帧中的特征易产生语义漂移

已验证65%

全部知识事实 (9)

来源文章