跳到主要内容

VAE 写密度、GAN 搞博弈,都试图「一步」造出样本; 扩散模型换了个朴素到近乎笨拙的思路:一步太难,就分成一千步—— 先把真样本一步步弄成噪声(这一步不需要学,是设计好的), 再让网络学把噪声一步步擦回去。末尾的流匹配干脆不绕弯: 直接学一条从噪声到数据的直线。

深度生成模型(二):扩散模型与流匹配

1. 这一章讲什么

两件事: 两套「不一步生成」的方案——扩散模型(先加噪再去噪, 前向固定、反向学习)与流匹配(直接学一条从噪声到数据的直线速度场); 末尾把四条生成路线放在一起收账。

它在全书链条里的位置: 第 26 章「密度估计是生成模型的入口」与 第 37 章「紧凑隐空间」两个伏笔都在本章兑现;第 14 章的转置卷积、 第 22 章的条件注入在这里回归。

需要第 37 章(ELBO 与 JS 散度)。

2. 顶层全景

前向:xt = √ᾱt·x0 + √(1−ᾱt)·ε —— 有闭式,不必真加一千次(§4)
反向:网络学逐步去噪;四种预测目标(x0/ε/分数/v)可互转(§5)
采样:DDPM 随机逐步 / DDIM 确定性少步——训练目标不唯一决定路径(§6)
条件:时间步编码 + 拼接/调制/交叉注意力三入口(§7)
引导:无分类器引导 = 把条件似然抬到 1+w 次方(§8)
提效:隐空间扩散——先压缩,再扩散,最后解码(§9)
不绕弯:流匹配——直线插值路径,恒定速度,梯度与边际一致(§10-§12)
采样加速与路径优化(§11)
收束:四条路线各有效,评估盲点各不同(§14)

3. 一步生成太难,就分成一千步

扩散模型由两部分组成:前向过程是人为设计的马尔可夫链,把样本 逐步加高斯噪声,加到 T 步后接近纯高斯;反向过程是神经网络学的, 从纯噪声出发一步步恢复数据1。书点破这套设计的两个直接好处: 前向有解析形式,训练时能直接在任意噪声水平上构造样本; 反向每一步只解决「稍微去噪一点」的局部问题,比一次性生成高维 复杂样本容易得多2。书还给了它的家谱:扩散模型可以看作一种 特殊的层级变分自编码器——前向分布人为固定,反向由网络学习3

4. 前向加噪可以一步到位

前向每一步:q(xt|xt−1)=N(√(1−βt)·xt−1, βt I),βt 是第 t 步的 噪声强度;一串 βt 合称噪声调度(线性、余弦等,前期保结构、 后期加噪声)4。令 αt=1−βt、ᾱt=∏αs,可以推出闭式: 任意时刻的带噪样本不必真加一千次,一步构造

xt = √ᾱt · x0 + √(1−ᾱt) · ε, ε ~ N(0, I) (式 16.63)

书给这条式子加了边注级的重要评语:它意味着训练时不必真的把噪声 一步一步加到第 t 步,而是可以直接从 x0 构造任意时刻的带噪样本5。 直观读法:√ᾱt 是「信号还剩多少」的音量旋钮,√(1−ᾱt) 是「噪声灌了多少」; 前者随 t 衰减、后者增强。信噪比 SNR(t)=ᾱt/(1−ᾱt) 把这层此消彼长 压成一个数6

主走查:同一组数,看两种生成路径

取 ᾱt=0.36、原始样本 x0=1.0、噪声 ε=0.5(全部为演示编的数值)。

扩散:xt = √0.36×1.0 + √0.64×0.5 = 0.6 + 0.4 = 0.9
SNR = 0.36/0.64 = 0.5625 (信号比噪声还少一点)

**训练一步:**网络(输入 xt=0.9 和时刻 t)预测出 ε̂=0.45(演示):

反推干净样本:x̂0 = (xt − √(1−ᾱt)·ε̂)/√ᾱt = (0.9 − 0.36)/0.6 = 0.9
这一步的损失:‖ε − ε̂‖² = (0.5 − 0.45)² = 0.0025

**流匹配同一组数:**线性插值路径 xt=(1−t)·x_noise+t·x_data, 取噪声端 0.5、数据端 1.0、t=0.4:

位置 = 0.6×0.5 + 0.4×1.0 = 0.7
目标速度 = 数据端 − 噪声端 = 0.5 (全程恒定——直线!)

对比读法:同样「走到一半」,扩散路径的位置 (0.9) 被信号项和噪声项 按非均匀的权重混合,权重随调度漂移;流匹配的位置 (0.7) 就是噪声端 到数据端直线上的 40% 处,目标速度恒定。路径更直,是流匹配 后续一切好性质的源头(第 12 节)。

5. 反向该学什么:四种等价的参数化

反向过程建模为 pθ(xt−1|xt)=N(μθ(xt,t), σt²I);方差常预先给定, 要学的核心是均值 μθ。真实后验有闭式(式 16.71),但书解释了为什么 不直接回归它:μ̃t 只是 xt 与 x0 的线性组合,直接预测会让网络 「同时复现已知项并恢复未知项」——目标不聚焦7

于是有四种「预测目标」,数学上可以互相转换8:

参数化网络输出数值性格
预测 x̂0原始样本t 大时几乎从强噪声恢复原图,数值波动大
预测 ε̂加进去的噪声t 大时容易;t 小时噪声弱、信号弱
预测分数 ∇log p去噪方向与 ε 只差一个随 t 的尺度因子;贴近连续时间视角
预测 v√ᾱε−√(1−ᾱ)x0把两者对称结合,整个时间轴数值更平衡

最常用的简化训练目标就是预测噪声的均方误差(式 16.78): 「这个目标看似简单,却非常有效——如果网络能准确预测噪声, 它就能恢复 x̂0,进而构造近似最优的反向均值」9。 书同时诚实标注:低内在维数数据上,不同参数化的表现可能差异显著, 甚至有分析认为直接预测 x0 可能最优10

6. 采样是在解一个方程:DDPM 与 DDIM

DDPM:按反向马尔可夫链逐步走,每步在预测的均值上加一点随机噪声 (祖先采样);同一个初始噪声可以对应多种生成路径;代价是 「数百步甚至上千步的网络评估」11

DDIM:关键发现是**「训练目标并不唯一决定采样路径」——同一个 去噪网络可以配不同的反向离散化。DDIM 更新公式里有个随机性旋钮 η: η=0 时完全确定性**,而且可以大幅少步仍保质量12。书把两者统一到 连续时间视角:DDPM 接近随机 SDE 的逐步模拟,DDIM 对应确定性的近似路径13

7. 网络怎么知道现在是第几步

去噪网络必须知道「现在噪声多重」:同一输入,t 小时只需修细节, t 大时要靠全局统计恢复结构——不告诉它时间步,「轻度去噪」和 「重度去噪」就会混在一起,学习目标变含糊。做法:把 t 编成正弦余弦 向量注入各层(作用类似位置编码,编码的是噪声水平)14

条件信息进入网络的三种方式15:

方式适合的条件
直接拼接或加和分割图、边缘图等空间对齐的局部条件
特征调制(缩放+平移)全局条件,轻量注入各层
交叉注意力文本、标签等语义条件——文生图的主流

注入位置也有讲究:只在输入层注入,条件信号到深层会衰减; 在多个尺度上重复注入才能贯穿整个去噪过程16。 骨干网络常用 U-Net(编码-解码+跳跃连接,兼顾全局语义与局部细节), 更大规模时换 DiT(把隐变量切块交给 Transformer)17

8. 让它更听话:引导

条件输进去了,遵从程度可能还不够。无分类器引导(CFG)的做法: 训练时以一定概率随机丢弃条件,让同一个网络同时学会「有条件预测」和 「无条件预测」;采样时把两者做线性外推

ε̂(xt, c) = (1+w)·ε(xt, c, t) − w·ε(xt, ∅, t)

概率视角的解释书给得很透:CFG 实际在从一个修正分布采样, 相当于把条件似然抬到 1+w 次方;w=0 退化为贝叶斯后验, w>0 越来越集中在「条件匹配度最大」的区域。代价同样明码: 多样性下降,过大的 w 导致过饱和、细节失真、不自然伪影—— 条件一致性与样本自然性之间要权衡18。(更早的分类器引导需要 额外训一个噪声条件分类器,工程代价高,已较少用。)

9. 别在像素上扩散:隐空间扩散

高分辨率图像的像素维度太高,每步去噪都要处理巨大特征图。 **隐空间扩散模型(LDM)**的答案:先用自动编码器把图像压缩到更紧凑的 隐空间,再在隐空间里跑扩散,最后解码回像素——「先压缩,再扩散, 最后解码」(Stable Diffusion 的路线)19。训练目标与像素版形式几乎 一致,变的只是去噪对象从 xt 换成 zt——LDM 不是新方法,是老框架 搬到更紧凑、更偏语义的表示空间20

收益三条:维度低、算得省;自动编码器已压掉局部冗余,扩散模型可以把 建模能力集中在结构与语义上;条件经交叉注意力注入更高效21。 代价书同样直说:生成质量被自动编码器的重建能力卡住—— 隐空间太粗糙,扩散在隐空间里「语义正确」,解码回像素也可能纹理缺失、 细节模糊;更深层的问题是隐空间由重建目标决定、并非为生成量身设计, 重建更好不等于生成更好,两个目标存在固有张力22。 ——第 37 章第 8 节说的「隐变量被压到紧凑空间」是这一节的前提,债在这里兑现。

10. 不绕这个弯行不行:流匹配

扩散的路是「先加噪、再去噪」绕出来的。流匹配问:能不能直接学一个 从噪声到数据的变换?答案是把生成想成粒子在速度场里流动: 学会速度场 vθ(x,t),生成就是解一个常微分方程(ODE)23。 它的数学地基是连续标准化流。老流模型绕不开的那笔账,正是第 01 章 埋下的「行列式的另一面」:可逆映射把空间局部拉伸 k 倍,那里的概率 密度就要缩小 k 倍(概率总量守恒),雅可比行列式就是那个 k—— 想算生成样本的似然,就得沿整条流把这笔账积出来,于是每层变换都要 为「好算雅可比行列式」牺牲结构。流匹配换思路:训练只回归速度场, 把似然和散度计算整个绕开24

条件流匹配(CFM)是训练法的核心洞察:整体「噪声怎么变数据」 难描述,但固定一个数据点当终点,从噪声到它的路径就是一条直线—— 书打的比方:城市里几百万辆车的整体车流难描述,但每辆车自己的 路径很容易描述;知道每辆车的路径,平均就得到整体车流25。 数学结论:对条件速度场回归与对边际速度场回归的梯度一致, 所以只需处理简单的条件目标26:

路径:xt = (1−t)·x0 + t·x1 目标速度:x1 − x0 (匀速直线)
损失:‖vθ(xt, t) − (x1 − x0)‖²

主走查第三段算的就是它。采样=从噪声出发对 vθ 数值积分到 t=1; 路径平直,通常 20~50 步即可得到高质量样本27

11. 采样加速与路径优化

加速三条线,书各给了名字:更好的求解器(DPM-Solver,高阶 ODE 求解器,原论文 1020 次函数评估可得高质量样本,相对加速 416 倍); 蒸馏路线(一致性模型:学「ODE 轨迹上任意两点映到同一起点」, 可单步生成)28;以及把路径本身变直——

独立配对的线性插值有一个隐患:路径交叉——两条条件路径中途经过 同一位置却指向不同目标,网络在该处收到相互矛盾的梯度信号, 方差增大、学出的速度场变弯29。两条改路子的方案:最优传输耦合 (OT-CFM,小批量内先给噪声和数据「就近配对」再训练,减少交叉)、 矫正流(迭代式:用训好的模型生成新配对再重训,新配对已有 ODE 对应关系,路径更直;可迭代多次)30。书末尾提醒: 流匹配与扩散的边界并不绝对——条件控制、无分类器引导、隐空间建模 这些核心技术可以高度共享31

12. 四条路线放在一起看

书用一张表(表 16.1)收束全章,四条路线(+自回归)各有性格, 评估时的盲点各不相同32:

路线概率与采样视角评估盲点
VAE/隐变量最大化 ELBO,近似后验辅助重构好≠样本自然;KL 过强致后验坍塌
GAN/隐式直接学噪声→样本映射,不写密度只看少量样本质量,忽略多样性与坍塌
扩散/分数学多噪声水平下的去噪采样成本高;视觉好≠语义对、条件忠
流匹配/连续流学速度场,用 ODE 采样路径选择与少步质量要单独检查

本章回收第 37 章的承诺:四种思想(隐变量建模、对抗训练、多步去噪、 连续流变换)不是互相取代——VAE 的隐空间成了扩散的跑马场, GAN 的判别器可以辅助扩散训练,流匹配与扩散共享全部条件控制技术33。 书的收尾提醒同样属于本章:评估不能只依赖单一指标,保真度、多样性、 条件一致性、下游效用、校准与安全边界要一起查;带条件的生成 还要特别检查「模型是否真正使用了条件信息」34

13. 作者的判断与证据

书里给了完整推导的: 闭式加噪与信噪比46;真实后验与四种 参数化的互转78;CFG 等价于抬升条件似然18;流匹配梯度一致 的结论26

书里给了坦白的: 四种参数化「表达能力无本质差别」,差别在数值性质 与适配8;DDPM 需要数百至上千步11;LDM 的重建-生成固有张力22; 低内在维数下预测 x0 可能更优10

书里给了路线判断的: 「训练目标不唯一决定采样路径」12; 流匹配与扩散「边界并不绝对」31;GAN 并非被替代(第 37 章); 生成模型评估的多指标立场34

14. 边界与局限

采样步数与质量的定量关系未给:书说了 DDPM 慢、DDIM/流匹配快、 DPM-Solver 有加速倍数,但「给定质量要求最少几步」这类曲线不存在于书内。

离散数据(文本)的扩散只在总结表里点到:自回归仍是文本的主宰, 书没有展开离散扩散。

条件注入与引导的超参(丢条件的概率、w 的取值)只有机制没有准则, 实践要靠验证集调。

理论视角(SDE/ODE)以数学小知识呈现:反向 SDE 的推导、分数匹配的 一般理论都只给结论,读者要出门补。

15. 可带走的

  1. 扩散 = 固定的前向加噪 + 学习的反向去噪;千步难事拆成千个易事;
  2. 闭式加噪 xt=√ᾱt·x0+√(1−ᾱt)·ε:训练不必真加一千次;
  3. SNR=ᾱ/(1−ᾱ):一个数读出「还剩多少信号」;
  4. 四种预测目标(x0/ε/分数/v)数学等价,差别在数值性质与适配;
  5. 简化目标 ‖ε−ε̂‖² 看似朴素,却是全套机器的发动机;
  6. 训练目标不唯一决定采样路径:DDPM 随机、DDIM 可确定性且少步;
  7. 时间步要编码注入;条件三入口:拼接、特征调制、交叉注意力;
  8. CFG = 把条件似然抬到 1+w 次方;w 大了一致、死板;
  9. LDM「先压缩,再扩散,最后解码」——质量被自动编码器的重建卡住;
  10. 流匹配:直线路径+恒定速度,梯度与边际目标一致;OT 耦合与矫正流 把路径修得更直、步数更少。

16. 原文地图

主题原书章原文位置
扩散基本思想与两好处第16章 深度生成模型text/17-ch16.txt:901(搜「扩散模型是一类重要的」) · text/17-ch16.txt:937(搜「两个直接好处」)
层级 VAE 视角第16章 深度生成模型text/17-ch16.txt:925(搜「层级变」)
前向与噪声调度第16章 深度生成模型text/17-ch16.txt:950(搜「(16.60)」) · text/17-ch16.txt:956(搜「噪声调度(Noise Schedule」)
闭式加噪第16章 深度生成模型text/17-ch16.txt:968(搜「(16.62)」) · text/17-ch16.txt:972(搜「(16.63)」) · text/17-ch16.txt:320(搜「闭式」)
信噪比第16章 深度生成模型text/17-ch16.txt:976(搜「信噪比(Signal-to-Noise」) · text/17-ch16.txt:983(搜「信噪比越大」)
反向过程第16章 深度生成模型text/17-ch16.txt:1010(搜「(16.66)」) · text/17-ch16.txt:1012(搜「待学习的函数」)
VLB 与局部去噪第16章 深度生成模型text/17-ch16.txt:1030(搜「ℒVLB」) · text/17-ch16.txt:1000(搜「局部去噪」)
为什么不直接回归均值第16章 深度生成模型text/17-ch16.txt:1065(搜「解析表达」) · text/17-ch16.txt:1071(搜「复现」)
预测 x0 / ε第16章 深度生成模型text/17-ch16.txt:1089(搜「训练目标写成」) · text/17-ch16.txt:1106(搜「(16.75)」) · text/17-ch16.txt:1127(搜「(16.78)」) · text/17-ch16.txt:1129(搜「看似简单」)
预测分数与速度第16章 深度生成模型text/17-ch16.txt:1133(搜「分数函数(Score Function」) · text/17-ch16.txt:1154(搜「尺度因子」) · text/17-ch16.txt:1186(搜「速度参数化」) · text/17-ch16.txt:1188(搜「(16.84)」)
四种参数化关系第16章 深度生成模型text/17-ch16.txt:1117(搜「同一个反向去噪过程」) · text/17-ch16.txt:1207(搜「表达能力」) · text/17-ch16.txt:1221(搜「显著差异」)
DDPM 采样第16章 深度生成模型text/17-ch16.txt:1252(搜「DDPM 采样」) · text/17-ch16.txt:1267(搜「(16.89)」) · text/17-ch16.txt:1273(搜「上千步」) · text/17-ch16.txt:1276(搜「随机扰动」)
DDIM第16章 深度生成模型text/17-ch16.txt:1280(搜「DDIM 采样」) · text/17-ch16.txt:1285(搜「(16.90)」) · text/17-ch16.txt:1299(搜「不唯一决定采样路径」)
时间步编码第16章 深度生成模型text/17-ch16.txt:1316(搜「时间步编码与噪声水平」) · text/17-ch16.txt:1317(搜「哪一个噪声水平」) · text/17-ch16.txt:1320(搜「混在一起」)
条件注入三方式第16章 深度生成模型text/17-ch16.txt:1350(搜「大致可以分为三类」) · text/17-ch16.txt:1351(搜「直接拼接或加和」) · text/17-ch16.txt:1354(搜「特征调制」) · text/17-ch16.txt:1356(搜「交叉注意力」) · text/17-ch16.txt:1362(搜「多个尺度上重复注入」)
无分类器引导第16章 深度生成模型text/17-ch16.txt:1379(搜「无分类器引导」) · text/17-ch16.txt:1385(搜「线性组合」) · text/17-ch16.txt:1402(搜「(16.98)」) · text/17-ch16.txt:1407(搜「多样性」)
U-Net 与 DiT第16章 深度生成模型text/17-ch16.txt:1418(搜「U 形网络(U-Net」) · text/17-ch16.txt:1431(搜「跳跃连接」) · text/17-ch16.txt:1463(搜「DiT(Diffusion Transformer」)
隐空间扩散第16章 深度生成模型text/17-ch16.txt:1478(搜「隐空间扩散模型(Latent」) · text/17-ch16.txt:1492(搜「两个阶段」) · text/17-ch16.txt:1510(搜「形式上几乎完全一致」) · text/17-ch16.txt:1544(搜「依赖自动编码器的压缩」) · text/17-ch16.txt:1556(搜「固有的张力」) · text/17-ch16.txt:1563(搜「Stable Diffusion」)
流匹配第16章 深度生成模型text/17-ch16.txt:1576(搜「流匹配」) · text/17-ch16.txt:1580(搜「Flow Matching」) · text/17-ch16.txt:1583(搜「常微分方程」)
条件流匹配第16章 深度生成模型text/17-ch16.txt:1730(搜「关键洞察」) · text/17-ch16.txt:1735(搜「每一辆车自己的行驶路径」) · text/17-ch16.txt:1748(搜「梯度是一致」) · text/17-ch16.txt:1756(搜「匀速直线运动」) · text/17-ch16.txt:1777(搜「数值积分」)
连续时间视角第16章 深度生成模型text/17-ch16.txt:1805(搜「概率流 ODE」) · text/17-ch16.txt:1824(搜「传输路径的形状」) · text/17-ch16.txt:1733(搜「直线」)
加速与一致性第16章 深度生成模型text/17-ch16.txt:1845(搜「DPM-」) · text/17-ch16.txt:1850(搜「一致性模型」) · text/17-ch16.txt:1861(搜「一致性蒸馏」)
OT 与矫正流第16章 深度生成模型text/17-ch16.txt:1879(搜「相互矛盾」) · text/17-ch16.txt:1887(搜「最优传输条件流匹配」) · text/17-ch16.txt:1893(搜「小批量最优传输」) · text/17-ch16.txt:1898(搜「矫正流」) · text/17-ch16.txt:1908(搜「更直、交叉更少」)
四路线总结第16章 深度生成模型text/17-ch16.txt:1929(搜「四种典型思路」) · text/17-ch16.txt:1955(搜「统一视角与评估重点」) · text/17-ch16.txt:1981(搜「不能只依赖单一指标」) · text/17-ch16.txt:1987(搜「是否真正使用了条件信息」)

Footnotes

  1. 出处:「第16章 深度生成模型」第 900 至 922 段(text/17-ch16.txt:902,搜「先定义一个固定的前向」; text/17-ch16.txt:910,搜「(16.57)」;text/17-ch16.txt:919,搜「两部分」)。

  2. 出处:「第16章 深度生成模型」第 937 至 940 段(text/17-ch16.txt:938,搜「解析形式」; text/17-ch16.txt:939,搜「稍微去噪一点」)。

  3. 出处:「第16章 深度生成模型」第 924 至 930 段(text/17-ch16.txt:925,搜「层级变」)。

  4. 出处:「第16章 深度生成模型」第 942 至 960 段(text/17-ch16.txt:950,搜「(16.60)」; text/17-ch16.txt:956,搜「噪声调度(Noise Schedule」),式(16.59)-(16.60)。 2

  5. 出处:「第16章 深度生成模型」第 961 至 982 段(text/17-ch16.txt:968,搜「(16.62)」; text/17-ch16.txt:320,搜「闭式」;text/17-ch16.txt:980,搜「构造任意时刻」), 式(16.61)-(16.63)。

  6. 出处:「第16章 深度生成模型」第 976 至 983 段(text/17-ch16.txt:976,搜「信噪比(Signal-to-Noise」), 式(16.64)。 2

  7. 出处:「第16章 深度生成模型」第 1017 至 1078 段(text/17-ch16.txt:1038,搜「线性高斯模型」; text/17-ch16.txt:1068,搜「最自然的参数化」;text/17-ch16.txt:1071,搜「复现」),式(16.69)-(16.72)。 2

  8. 出处:「第16章 深度生成模型」第 1082 至 1229 段(text/17-ch16.txt:1098,搜「更常见的做法」; text/17-ch16.txt:1154,搜「尺度因子」;text/17-ch16.txt:1206,搜「相互转换」; text/17-ch16.txt:1221,搜「显著差异」),式(16.73)-(16.86)。 2 3

  9. 出处:「第16章 深度生成模型」第 1124 至 1130 段(text/17-ch16.txt:1127,搜「(16.78)」; text/17-ch16.txt:1129,搜「看似简单」)。

  10. 出处:「第16章 深度生成模型」第 1220 至 1233 段(text/17-ch16.txt:1221,搜「可能存在显著差异」; text/17-ch16.txt:1070,搜「直接预测」)。 2

  11. 出处:「第16章 深度生成模型」第 1252 至 1278 段(text/17-ch16.txt:1271,搜「不再额外加入随机噪声」; text/17-ch16.txt:1273,搜「上千步」;text/17-ch16.txt:1276,搜「随机扰动」),式(16.87)-(16.89)。 2

  12. 出处:「第16章 深度生成模型」第 1280 至 1306 段(text/17-ch16.txt:1296,搜「确定性的」; text/17-ch16.txt:1299,搜「不唯一决定采样路径」;text/17-ch16.txt:1303,搜「加速采样」), 式(16.90)-(16.91)。 2

  13. 出处:「第16章 深度生成模型」第 1304 至 1306 段(text/17-ch16.txt:1241,搜「离散化方式」); 连续时间视角见第 1781 至 1814 段(text/17-ch16.txt:1805,搜「概率流 ODE」)。

  14. 出处:「第16章 深度生成模型」第 1316 至 1339 段(text/17-ch16.txt:1317,搜「哪一个噪声水平」; text/17-ch16.txt:1320,搜「混在一起」;text/17-ch16.txt:1323,搜「位置编码」)。

  15. 出处:「第16章 深度生成模型」第 1350 至 1359 段(text/17-ch16.txt:1351,搜「直接拼接或加和」; text/17-ch16.txt:1354,搜「特征调制」;text/17-ch16.txt:1356,搜「交叉注意力」)。

  16. 出处:「第16章 深度生成模型」第 1360 至 1363 段(text/17-ch16.txt:1362,搜「多个尺度上重复注入」)。

  17. 出处:「第16章 深度生成模型」第 1417 至 1445 段(text/17-ch16.txt:1419,搜「跳跃连」; text/17-ch16.txt:1433,搜「容易缺乏全」);DiT 见第 1462 至 1470 段 (text/17-ch16.txt:1464,搜「图块(patch」)。

  18. 出处:「第16章 深度生成模型」第 1379 至 1410 段(text/17-ch16.txt:1385,搜「线性组合」; text/17-ch16.txt:1399,搜「修正后的目标分布」;text/17-ch16.txt:1387,搜「1 + 𝑤」; text/17-ch16.txt:1407,搜「多样性」),式(16.95)-(16.98)[Ho et al., 2022]。 2

  19. 出处:「第16章 深度生成模型」第 1472 至 1489 段(text/17-ch16.txt:1478,搜「隐空间扩散模型(Latent」; text/17-ch16.txt:1479,搜「更紧凑的隐空间」);Stable Diffusion 见第 1563 至 1565 段 (text/17-ch16.txt:1564,搜「先压缩,再扩散」)[Rombach et al., 2022]。

  20. 出处:「第16章 深度生成模型」第 1505 至 1513 段(text/17-ch16.txt:1510,搜「形式上几乎完全一致」; text/17-ch16.txt:1511,搜「隐变量」亦可按「对隐变量 𝒛𝑡 去噪」定位)。

  21. 出处:「第16章 深度生成模型」第 1536 至 1542 段(text/17-ch16.txt:1538,搜「局部冗余」; text/17-ch16.txt:1540,搜「交叉注意力」亦可按「文本到图像」定位)。

  22. 出处:「第16章 深度生成模型」第 1543 至 1556 段(text/17-ch16.txt:1544,搜「依赖自动编码器的压缩」; text/17-ch16.txt:1556,搜「固有的张力」)。 2

  23. 出处:「第16章 深度生成模型」第 1576 至 1593 段(text/17-ch16.txt:1580,搜「Flow Matching」; text/17-ch16.txt:1583,搜「常微分方程」)[Lipman et al., 2023]。

  24. 出处:「第16章 深度生成模型」第 1628 至 1670 段(text/17-ch16.txt:1635,搜「雅可比行列式」; text/17-ch16.txt:1670,搜「受到较大限制」);绕开似然见第 1713 至 1718 段 (text/17-ch16.txt:1717,搜「回归目标」)。

  25. 出处:「第16章 深度生成模型」第 1729 至 1736 段(text/17-ch16.txt:1730,搜「关键洞察」; text/17-ch16.txt:1735,搜「每一辆车自己的行驶路径」)。

  26. 出处:「第16章 深度生成模型」第 1747 至 1765 段(text/17-ch16.txt:1748,搜「梯度是一致」; text/17-ch16.txt:1751,搜「线性插值路径」;text/17-ch16.txt:1756,搜「匀速直线运动」), 式(16.108)-(16.111)。 2

  27. 出处:「第16章 深度生成模型」第 1777 至 1779 段(text/17-ch16.txt:1778,搜「平直」; text/17-ch16.txt:1779,搜「20∼50 步」)。

  28. 出处:「第16章 深度生成模型」第 1830 至 1868 段(text/17-ch16.txt:1845,搜「DPM-」; text/17-ch16.txt:1856,搜「4 ∼ 16 倍」;text/17-ch16.txt:1850,搜「一致性模型」; text/17-ch16.txt:1859,搜「自一致」)[Song et al., 2023]。

  29. 出处:「第16章 深度生成模型」第 1871 至 1880 段(text/17-ch16.txt:1873,搜「路径交叉」; text/17-ch16.txt:1879,搜「相互矛盾」)。

  30. 出处:「第16章 深度生成模型」第 1887 至 1910 段(text/17-ch16.txt:1893,搜「小批量最优传输」; text/17-ch16.txt:1898,搜「矫正流」;text/17-ch16.txt:1908,搜「更直、交叉更少」) [Tong et al., 2024; Liu et al., 2023]。

  31. 出处:「第16章 深度生成模型」第 1919 至 1922 段(text/17-ch16.txt:1919,搜「边界并不绝对」; text/17-ch16.txt:1922,搜「速度场回归」)。 2

  32. 出处:「第16章 深度生成模型」第 1951 至 1979 段(text/17-ch16.txt:1955,搜「统一视角与评估重点」; text/17-ch16.txt:1960,搜「重构好不等于」),表 16.1。

  33. 出处:「第16章 深度生成模型」第 1943 至 1950 段(text/17-ch16.txt:1943,搜「共同思想」; text/17-ch16.txt:1919,搜「边界并不绝对」);GAN 判别器辅助扩散见第 896 至 898 段 (text/17-ch16.txt:897,搜「判别器辅助」)。

  34. 出处:「第16章 深度生成模型」第 1981 至 1988 段(text/17-ch16.txt:1981,搜「不能只依赖单一指标」; text/17-ch16.txt:1987,搜「是否真正使用了条件信息」)。 2