外观
扩散模型与生成式 AI
一句话定义:扩散模型(Diffusion Model)通过"前向逐步加噪、反向逐步去噪"的马尔可夫链来学习数据分布——先教模型把纯噪声一步步"雕刻"成图片,再用这个能力从随机噪声生成新样本——它兼具VAE 与 GAN双方优点(稳定训练、高质量、好覆盖),成为 2022 年以来文生图、视频、音频、3D 生成的主流通用引擎。
一、为什么是扩散
生成式建模的根本问题是"如何学一个可采样、且逼真的数据分布"。回顾两条旧路线各自的伤疤:VAE 的重建损失把样本推向"平均",图是糊的;GAN 的对抗博弈样本锐利但训练不稳、易模式坍缩(详见生成式模型)。扩散模型的破局思路是**"温水煮青蛙"式学习**:不一次性预测整张图,而是预测"上一步的微小去噪"——每一步都是简单任务,网络只需学"这张带噪图如何去一点噪"。整体效果是:训练稳定得像回归,生成锐利得像对抗。
二、DDPM 原理
DDPM(Denoising Diffusion Probabilistic Models,Ho 等 2020)定义两条链:
- 前向过程(加噪):按固定噪声表 $q(x_t | x_{t-1})$ 逐步给干净图 $x_0$ 加高斯噪声,$T=1000$ 步后接近纯噪声。用重参数化可一步算出任意时刻 $x_t = \sqrt{\bar\alpha_t},x_0 + \sqrt{1-\bar\alpha_t},\varepsilon$;
- 反向过程(去噪):训练神经网络 $\epsilon_\theta(x_t, t)$ 预测"混入的噪声 $\varepsilon$"。训练损失极其简洁——就是预测噪声的均方误差: $$ \mathcal{L} = \mathbb{E}{t, x_0, \varepsilon}\left[|\varepsilon - \epsilon\theta(x_t, t)|^2\right] $$
- 采样:从纯噪声出发,按 $\epsilon_\theta$ 迭代去噪 $T$ 步得到图像。
直觉类比:把"生成一张图"拆成 1000 步"擦掉一点点污渍"。每一步的条件分布都接近高斯、好学,链条组合起来却能刻画复杂的真实分布。这一"由简到繁分解任务"的思想,与CNN 与计算机视觉中"由粗到细的特征金字塔"异曲同工。
训练要点
DDPM 的训练目标其实和"去噪自编码器(denoising autoencoder)"同宗——预测噪声等价于预测被污染的信息。用熟悉的反向传播与自动微分即可端到端训练,无需 GAN 式的双网络博弈。
三、采样加速:DDIM 与 DPM-Solver
DDPM 采样要 1000 步,太慢。两大加速流派:
- DDIM(2021):把反向链改成确定性(去噪不加随机项),步数可压到 20~50 步且保持质量;同时支持"跳步",还意外得到"隐空间插值"能力(两条样本间的中间结果可平滑过渡);
- DPM-Solver(2022):把采样视为 ODE 初值问题,用高阶数值求解器把步数压到 10~20 步,Stable Diffusion 的默认采样器多基于此。
注意采样加速的代价:步数过少会损失细节与多样性,适合速度敏感场景(如 Web 端实时出图)。
四、引导:从"随机生成"到"指哪打哪"
无条件扩散只能随机出图,引导让它按条件(文本、类别、图像)生成:
- Classifier Guidance(2021):用额外的分类器梯度把采样推向"更像某类"——质量好但必须另训分类器、且采样要经过梯度步,慢;
- Classifier-Free Guidance (CFG)(2022):同一网络同时学"有条件 $\epsilon_\theta(x_t, c)$"与"无条件 $\epsilon_\theta(x_t, \varnothing)$",采样时外推 $\tilde\epsilon = \epsilon_\theta(x_t,\varnothing) + s[\epsilon_\theta(x_t,c) - \epsilon_\theta(x_t,\varnothing)]$。训练时按概率(如 10%)把条件置空即可,实现简单、效果优异——CFG 成了文生图的标配。引导强度 s 越大越贴文本、但可能牺牲多样性(过强会出现伪影)。
五、Stable Diffusion 三件套
Stable Diffusion(2022,Stability AI 等,基于 Rombach 等的 LDM)把扩散从"像素空间"搬到"潜空间",让普通人用消费级显卡就能文生图。三个组件:
- VAE 编码器/解码器:把 512×512 图像压缩成 64×64×4 的潜表征,扩散只在潜空间进行(省算力、保留细节)——这正是 VAE 与 GAN 一节提到的"VAE 借尸还魂";
- UNet(扩散主干):带残差与跳跃连接的 U 型网络,内部用交叉注意力把文本条件注入(UNet 的骨架思想源自图像分割,见"CNN 与计算机视觉"一文);
- CLIP 文本编码器:把提示词编码为文本条件向量(CLIP 本身是对比学习预训练的图文对齐模型,见多模态模型)。
LoRA 微调(2021):冻结 UNet 主权重,只训练低秩分解的小矩阵(秩 r=8~64,参数量减少千倍),用几十张图即可微调出"某个角色/画风",可叠加多个 LoRA——它是社区生态的核心工具,也是表征学习与预训练中"高效微调"的典型。
ControlNet(2023):在 UNet 旁挂一份"可训练副本",把边缘、姿态、深度图等条件结构注入生成,实现"骨架可控"——解决了纯文本提示对空间结构控制力弱的问题,是可控生成的里程碑。
六、应用版图
- 文生图/图生图:Midjourney、Stable Diffusion 生态;图生图、局部重绘(inpainting)、扩图(outpainting)都是成熟功能;
- 文生视频:Sora(2024,OpenAI)把视频 token 化 + 时空注意力做大规模扩散,是"生成时长与一致性"的突破;开源侧有 Video Diffusion 系列、CogVideoX 等;
- 音频:AudioLDM、Stable Audio 等做音乐与音效生成,扩散 TTS 也进入语音合成(见语音与音频);
- 3D:DreamFusion(2023)用分数蒸馏让 2D 扩散指导 3D 表示生成(NeRF/3DGS);
- 分子/材料:扩散模型生成分子构象与晶体结构,是科学生成的代表方向。
七、评估与局限
- 评估指标:FID(生成分布与真实分布的特征统计距离,2017)与 CLIP score(生成图与文本语义一致度)是文生图的两大指标,IS(Inception Score)早年常用。指标≠感知质量:FID 对"分布的覆盖与锐度"敏感但对单一错漏不敏感,视觉评估方法论见深度学习评估与实验;
- 局限:采样慢(比 GAN 贵一个量级)、文本对齐偶发失败(手指数不对等)、幻觉细节、计算与显存开销大、训练数据版权与伦理争议;
- 趋势:蒸馏(一步生成,如 SD-Turbo/LCM)、DiT(用 Transformer 替代 UNet,Sora、SD3 均属此类)——"扩散+Transformer"正在成为新一代基线,技术地图见前沿进展。
评估警惕
一个模型"看起来图漂亮"不等于"理解语义"。CLIP score 高也不代表逻辑正确。做生成项目务必同时看定量指标、多样性与失败案例分析,并建立人工评测集——工程化评估见评估实践。
八、权衡与取舍
- 扩散 vs GAN vs VAE:质量与多样性优先选扩散,实时交互/端侧算力吃紧时 GAN 或蒸馏扩散仍有价值;
- 像素空间 vs 潜空间:潜空间(LDM)省算力但分辨率上受 VAE 瓶颈限制;像素级(如部分高分辨率微调)保真但贵;
- 速度 vs 质量:采样步数、CFG 强度、模型尺寸都是滑块,没有免费午餐;
- 可控 vs 自然:ControlNet/LoRA 越强控制越稳,但可能"过拟合提示词"、牺牲生成多样性——把取舍当作产品参数而不是技术正确性问题。
延伸阅读
- VAE 与 GAN——扩散模型的两大前任与组件供应商
- 生成式模型——概率建模的统一视角
- 多模态模型——CLIP 文本编码器与图文对齐
- CNN 与计算机视觉——UNet 的视觉骨架
- Transformer 架构——DiT 时代的扩散主干
- 训练配方与调参——扩散训练的实操经验
参考资料
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models (DDPM) (NeurIPS 2020)
- Song, Meng, Ermon. Denoising Diffusion Implicit Models (DDIM) (ICLR 2021)
- Dhariwal, Nichol. Diffusion Models Beat GANs on Image Synthesis (Classifier Guidance) (NeurIPS 2021)
- Ho, Salimans. Classifier-Free Diffusion Guidance (NeurIPS 2022 Workshop)
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models (LDM/Stable Diffusion) (CVPR 2022)
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models (ICLR 2022)
- Zhang, Rao, Agrawala. Adding Conditional Control to Text-to-Image Diffusion Models (ControlNet) (ICCV 2023)
- Heusel et al. GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium (FID) (NeurIPS 2017)