VAE
一种生成模型,训练目标为ELBO(证据下界),基于变分推断框架,将编码器输出建模为概率分布
核心事实
时间轴 (近 90 天)
Stable Diffusion通过预训练的VAE将512×512×3的图像编码为64×64×4的潜在张量,计算量降低约48倍
Stable Diffusion将扩散过程从像素空间搬到潜在空间,通过VAE编码器将图像压缩为低维表示再去噪,降低计算开销
KL散度在变分推断(VAE的ELBO目标)、知识蒸馏和模型压缩中扮演核心角色
VAE的编码器将图像压缩到低维潜空间,通常将空间分辨率缩小8倍(1024×1024变为128×128)
VAE(变分自编码器)负责潜在空间与像素空间之间的编解码,不同的VAE会影响画面的色彩饱和度和细节表现
Checkpoint是预训练的扩散模型权重文件通常2-7GB,VAE负责像素空间和潜空间之间转换图像,CFG Scale控制生成图像对文本提示词的遵循程度
VAE(变分自编码器)在扩散模型管线中承担图像压缩与解码角色,将潜空间表示还原为像素级图像
概率论中的贝叶斯推断是生成模型(VAE、扩散模型)的理论根基
扩散模型在生成图像时本质上是在高维潜空间(Latent Space)中进行去噪采样,缺乏多角度约束时同一角色在不同帧中的特征易产生语义漂移
全部知识事实 (9)
扩散模型在生成图像时本质上是在高维潜空间(Latent Space)中进行去噪采样,缺乏多角度约束时同一角色在不同帧中的特征易产生语义漂移
65%待验证Stable Diffusion通过预训练的VAE将512×512×3的图像编码为64×64×4的潜在张量,计算量降低约48倍
50%待验证Stable Diffusion将扩散过程从像素空间搬到潜在空间,通过VAE编码器将图像压缩为低维表示再去噪,降低计算开销
50%待验证KL散度在变分推断(VAE的ELBO目标)、知识蒸馏和模型压缩中扮演核心角色
50%待验证VAE的编码器将图像压缩到低维潜空间,通常将空间分辨率缩小8倍(1024×1024变为128×128)
50%待验证VAE(变分自编码器)负责潜在空间与像素空间之间的编解码,不同的VAE会影响画面的色彩饱和度和细节表现
50%待验证Checkpoint是预训练的扩散模型权重文件通常2-7GB,VAE负责像素空间和潜空间之间转换图像,CFG Scale控制生成图像对文本提示词的遵循程度
50%待验证VAE(变分自编码器)在扩散模型管线中承担图像压缩与解码角色,将潜空间表示还原为像素级图像
50%待验证概率论中的贝叶斯推断是生成模型(VAE、扩散模型)的理论根基
50%