Skip to content

扩散模型与生成式 AI

本页速览 扩散模型以"逐步加噪再逐步去噪"绕过了 VAE 的模糊与 GAN 的不稳定,成为文生图、视频、音频等生成式 AI 的主流引擎。本文拆解 DDPM 原理、DDIM 加速采样、Classifier-Free Guidance 引导、Stable Diffusion 三件套与 LoRA/ControlNet,并讨论评估与局限。

扩散模型与生成式 AI

一句话定义:扩散模型(Diffusion Model)通过"前向逐步加噪、反向逐步去噪"的马尔可夫链来学习数据分布——先教模型把纯噪声一步步"雕刻"成图片,再用这个能力从随机噪声生成新样本——它兼具VAE 与 GAN双方优点(稳定训练、高质量、好覆盖),成为 2022 年以来文生图、视频、音频、3D 生成的主流通用引擎。

一、为什么是扩散

生成式建模的根本问题是"如何学一个可采样、且逼真的数据分布"。回顾两条旧路线各自的伤疤:VAE 的重建损失把样本推向"平均",图是糊的;GAN 的对抗博弈样本锐利但训练不稳、易模式坍缩(详见生成式模型)。扩散模型的破局思路是**"温水煮青蛙"式学习**:不一次性预测整张图,而是预测"上一步的微小去噪"——每一步都是简单任务,网络只需学"这张带噪图如何去一点噪"。整体效果是:训练稳定得像回归,生成锐利得像对抗

二、DDPM 原理

DDPM(Denoising Diffusion Probabilistic Models,Ho 等 2020)定义两条链:

  • 前向过程(加噪):按固定噪声表 $q(x_t | x_{t-1})$ 逐步给干净图 $x_0$ 加高斯噪声,$T=1000$ 步后接近纯噪声。用重参数化可一步算出任意时刻 $x_t = \sqrt{\bar\alpha_t},x_0 + \sqrt{1-\bar\alpha_t},\varepsilon$;
  • 反向过程(去噪):训练神经网络 $\epsilon_\theta(x_t, t)$ 预测"混入的噪声 $\varepsilon$"。训练损失极其简洁——就是预测噪声的均方误差: $$ \mathcal{L} = \mathbb{E}{t, x_0, \varepsilon}\left[|\varepsilon - \epsilon\theta(x_t, t)|^2\right] $$
  • 采样:从纯噪声出发,按 $\epsilon_\theta$ 迭代去噪 $T$ 步得到图像。

直觉类比:把"生成一张图"拆成 1000 步"擦掉一点点污渍"。每一步的条件分布都接近高斯、好学,链条组合起来却能刻画复杂的真实分布。这一"由简到繁分解任务"的思想,与CNN 与计算机视觉中"由粗到细的特征金字塔"异曲同工。

训练要点

DDPM 的训练目标其实和"去噪自编码器(denoising autoencoder)"同宗——预测噪声等价于预测被污染的信息。用熟悉的反向传播与自动微分即可端到端训练,无需 GAN 式的双网络博弈。

三、采样加速:DDIM 与 DPM-Solver

DDPM 采样要 1000 步,太慢。两大加速流派:

  • DDIM(2021):把反向链改成确定性(去噪不加随机项),步数可压到 20~50 步且保持质量;同时支持"跳步",还意外得到"隐空间插值"能力(两条样本间的中间结果可平滑过渡);
  • DPM-Solver(2022):把采样视为 ODE 初值问题,用高阶数值求解器把步数压到 10~20 步,Stable Diffusion 的默认采样器多基于此。

注意采样加速的代价:步数过少会损失细节与多样性,适合速度敏感场景(如 Web 端实时出图)。

四、引导:从"随机生成"到"指哪打哪"

无条件扩散只能随机出图,引导让它按条件(文本、类别、图像)生成:

  • Classifier Guidance(2021):用额外的分类器梯度把采样推向"更像某类"——质量好但必须另训分类器、且采样要经过梯度步,慢;
  • Classifier-Free Guidance (CFG)(2022):同一网络同时学"有条件 $\epsilon_\theta(x_t, c)$"与"无条件 $\epsilon_\theta(x_t, \varnothing)$",采样时外推 $\tilde\epsilon = \epsilon_\theta(x_t,\varnothing) + s[\epsilon_\theta(x_t,c) - \epsilon_\theta(x_t,\varnothing)]$。训练时按概率(如 10%)把条件置空即可,实现简单、效果优异——CFG 成了文生图的标配。引导强度 s 越大越贴文本、但可能牺牲多样性(过强会出现伪影)。

五、Stable Diffusion 三件套

Stable Diffusion(2022,Stability AI 等,基于 Rombach 等的 LDM)把扩散从"像素空间"搬到"潜空间",让普通人用消费级显卡就能文生图。三个组件:

  1. VAE 编码器/解码器:把 512×512 图像压缩成 64×64×4 的潜表征,扩散只在潜空间进行(省算力、保留细节)——这正是 VAE 与 GAN 一节提到的"VAE 借尸还魂";
  2. UNet(扩散主干):带残差与跳跃连接的 U 型网络,内部用交叉注意力把文本条件注入(UNet 的骨架思想源自图像分割,见"CNN 与计算机视觉"一文);
  3. CLIP 文本编码器:把提示词编码为文本条件向量(CLIP 本身是对比学习预训练的图文对齐模型,见多模态模型)。

LoRA 微调(2021):冻结 UNet 主权重,只训练低秩分解的小矩阵(秩 r=8~64,参数量减少千倍),用几十张图即可微调出"某个角色/画风",可叠加多个 LoRA——它是社区生态的核心工具,也是表征学习与预训练中"高效微调"的典型。

ControlNet(2023):在 UNet 旁挂一份"可训练副本",把边缘、姿态、深度图等条件结构注入生成,实现"骨架可控"——解决了纯文本提示对空间结构控制力弱的问题,是可控生成的里程碑。

六、应用版图

  • 文生图/图生图:Midjourney、Stable Diffusion 生态;图生图、局部重绘(inpainting)、扩图(outpainting)都是成熟功能;
  • 文生视频:Sora(2024,OpenAI)把视频 token 化 + 时空注意力做大规模扩散,是"生成时长与一致性"的突破;开源侧有 Video Diffusion 系列、CogVideoX 等;
  • 音频:AudioLDM、Stable Audio 等做音乐与音效生成,扩散 TTS 也进入语音合成(见语音与音频);
  • 3D:DreamFusion(2023)用分数蒸馏让 2D 扩散指导 3D 表示生成(NeRF/3DGS);
  • 分子/材料:扩散模型生成分子构象与晶体结构,是科学生成的代表方向。

七、评估与局限

  • 评估指标:FID(生成分布与真实分布的特征统计距离,2017)与 CLIP score(生成图与文本语义一致度)是文生图的两大指标,IS(Inception Score)早年常用。指标≠感知质量:FID 对"分布的覆盖与锐度"敏感但对单一错漏不敏感,视觉评估方法论见深度学习评估与实验
  • 局限:采样慢(比 GAN 贵一个量级)、文本对齐偶发失败(手指数不对等)、幻觉细节、计算与显存开销大、训练数据版权与伦理争议;
  • 趋势:蒸馏(一步生成,如 SD-Turbo/LCM)、DiT(用 Transformer 替代 UNet,Sora、SD3 均属此类)——"扩散+Transformer"正在成为新一代基线,技术地图见前沿进展

评估警惕

一个模型"看起来图漂亮"不等于"理解语义"。CLIP score 高也不代表逻辑正确。做生成项目务必同时看定量指标、多样性与失败案例分析,并建立人工评测集——工程化评估见评估实践

八、权衡与取舍

  • 扩散 vs GAN vs VAE:质量与多样性优先选扩散,实时交互/端侧算力吃紧时 GAN 或蒸馏扩散仍有价值;
  • 像素空间 vs 潜空间:潜空间(LDM)省算力但分辨率上受 VAE 瓶颈限制;像素级(如部分高分辨率微调)保真但贵;
  • 速度 vs 质量:采样步数、CFG 强度、模型尺寸都是滑块,没有免费午餐;
  • 可控 vs 自然:ControlNet/LoRA 越强控制越稳,但可能"过拟合提示词"、牺牲生成多样性——把取舍当作产品参数而不是技术正确性问题。

延伸阅读

参考资料