扩散模型原理:从加噪到去噪的生成革命

什么是扩散模型

扩散模型(Diffusion Models)是一类受非平衡热力学启发的隐变量生成模型。其核心思想是把「生成」拆解为两个阶段:先在前向过程里逐步往数据上加高斯噪声,直到数据变成纯噪声;再在反向过程里训练一个神经网络,从噪声中一步步「去噪」,重建出真实样本。相比 GAN 依赖对抗训练、自回归模型逐像素建模,扩散模型以稳定的似然训练换取了更高的样本质量与更可控的生成过程。

前向与反向过程

前向过程是一个固定的马尔可夫链,共 T 步,每步按方差计划 beta_t 添加少量高斯噪声:

q(x_t | x_{t-1}) = N(x_t; sqrt(1-beta_t) * x_{t-1}, beta_t * I)

利用高斯性质可一步采样任意时刻:x_t = sqrt(alpha_bar_t) * x_0 + sqrt(1 - alpha_bar_t) * epsilon,其中 epsilon ~ N(0, I)。反向过程则学习 p_theta(x_{t-1} | x_t),由网络 epsilon_theta 预测所加噪声:

训练目标(简化):L_simple = E[ || epsilon - epsilon_theta(x_t, t) ||^2 ]

采样时从 x_T ~ N(0, I) 出发,反复估计并减去噪声,迭代 T 步得到 x_0。

DDPM 与 DDIM

DDPM(Denoising Diffusion Probabilistic Models,arXiv:2006.11239,Jonathan Ho 等,2020)首次用加权变分下界把扩散模型与去噪分数匹配联系起来,在 CIFAR-10 上取得 FID 3.17、Inception Score 9.46,质量媲美 ProgressiveGAN。但其反向采样需模拟上千步马尔可夫链,速度极慢。

DDIM(Denoising Diffusion Implicit Models,arXiv:2010.02502,Jiaming Song 等,2020)保持与 DDPM 相同的训练目标,但构造非马尔可夫扩散过程,使反向过程可用常微分方程(ODE)描述,从而用远少步数采样。论文指出 DDIM 可比 DDPM 快 10 至 50 倍(按墙钟时间),且支持隐空间语义插值。

# DDIM 采样(伪代码,步数可远小于 T)
x = torch.randn_like(x_T)
for t in reversed(subset_of_timesteps):
    eps = model(x, t)
    x = sqrt(alpha_bar[t]) * (x - sqrt(1 - alpha_bar[t]) * eps) \
        / sqrt(alpha_bar[t]) + sqrt(1 - alpha_bar[t]) * eps  # 简化示意

潜在扩散与稳定扩散

Latent Diffusion(arXiv:2112.10752,Rombach 等,CVPR 2022)指出:直接在像素空间训练扩散模型需消耗数百 GPU 日,推理也因串行评估而昂贵。其方案是先把图像编码进预训练自编码器的低维潜空间,再在该空间做扩散。这样既大幅降低算力需求,又通过交叉注意力(cross-attention)把文本、边界框等条件接入,使模型成为通用条件生成器。该工作即 Stable Diffusion 的技术基础,在图像修复、超分、语义合成等任务上取得 SOTA 或极具竞争力的表现,代码见 CompVis/latent-diffusion。

与 GAN、自回归模型对比

  • GAN:对抗训练、单步生成、速度快,但训练不稳定、模式崩溃、可控性差;扩散模型训练稳定、样本多样性更好,但采样慢。
  • 自回归模型(如 PixelCNN、GPT 类):按序建模、似然清晰,但生成是串行的逐 token/像素,难以并行;扩散在反向过程也串行,但 DPM 类可大幅提速。
  • 工程取舍:追求极致速度与交互用 GAN;追求质量、可控编辑与文本条件生成,扩散模型(尤其潜在扩散)已成为主流。

适用场景

扩散模型适合高保真图像/音频/视频生成、文生图(Stable Diffusion 系)、图像修复与超分、分子与材料生成,以及需要精确条件控制或可解释编辑的任务。对实时性要求极高的场景,可借助 DDIM 或蒸馏后的少步扩散来平衡速度与质量。

小结

扩散模型以「前向加噪、反向去噪」的简洁框架,绕开了 GAN 的对抗不稳定,凭借 DDPM 奠定质量、DDIM 解决采样慢、潜在扩散把成本压到可用,已成为当今生成式 AI 的核心范式之一。理解其马尔可夫前向、噪声预测训练目标与隐空间加速,是掌握文生图与可控生成的基础。

参考与延伸阅读

本文累计阅读