跳到主要内容

白捡的质量:UNet 里那两条路各在干什么(FreeU)

这一章讲三件事: 那个负责去噪的网络内部长什么样、两条路各自在干什么; 为什么「训练时有用的东西,推理时可能有害」; 以及只调两个数怎么就能提质量。 它在全书链条里的位置: 第 15 章把去噪那个网络当黑箱用,这一章把它拆开。 这也是全书「先做减法、先看清楚再动手」这条线的最纯粹一例—— 它没有加任何东西,只是重新配了个比例。

⚠️ 一句先摆在前面的话:这一章不训练、不加一个可训练参数、不加显存、不加采样时间。 书里的原话就是「不花任何代价」。

1. 顶层全景:先看清楚,再动两个旋钮

第一步:先看去噪过程本身在变什么
把每一步的中间结果拆成低频和高频看
✓ 发现一:**低频几乎不动,高频剧烈变化**
理由:低频是整体结构和颜色(动了就不是这张图了);
高频是边缘和纹理,**而噪声本身就表现为随机的高频**

第二步:再看那个网络里的两条路各在干什么
给两条路各乘一个数做对照
✓ 发现二:**放大主干那条 → 图明显更干净;放大跳连那条 → 几乎没反应**
再看频谱:主干的因子越大,生成图里的高频被压得越狠
→ **主干干的活就是去噪**;而跳连往解码端灌的**主要是高频**

第三步:据此下判断
跳连的高频在**训练**时有用(帮网络更快重建输入)
但在**推理**时有害(它削弱了主干的去噪)
—— **因为训练目标是重建输入,推理目标是从纯噪声生成,两者要的不是一回事**

第四步:于是只做两件事(全在推理时,几行代码)
① 放大主干特征,**但按结构自适应地放,而且只放一半通道**
② 把跳连特征的低频压下去,治第 ① 步带来的过平滑

美学评分 5.675 → 5.994;FID 43.82 → 40.79

图说:注意前三步都是「看」,第四步才是「做」。
**这一章真正的方法只有第四步那两行,而它全部的价值在前三步。**

这一章的主走查:同一句提示语「一只戴墨镜的猫」,在同一个已经训好的模型上跑五次, 每次只改那两个数,看图变成什么样。

主干因子 b / 跳连因子 s出来的图长什么样
b = 0.6一堆噪点,画面明显脏
b = 1.0(原样)正常水平
b = 1.4明显更干净、更清晰
b = 1.8过平滑——太干净了,细节纹理被一起磨掉
b 只作用在一半通道 + 跳连低频乘一个小于 1 的数既干净又保住纹理
量出来美学评分 5.675 → 5.994;FID 43.82 → 40.79

b = 0.6 / 1.4 / 1.8 这三档和那两个分数都是书里的真数; 「一只戴墨镜的猫」这句提示语是我们为了串起来设的,书里用的是别的例子1

2. 先拆开那个网络:两条路

这一节回答:第 15 章说的「那个预测噪声的模型」,内部是什么?

它的名字和形状

输入(当前这一步的半成品)

编码器:一层层把图缩小,同时抽出越来越抽象的特征
├─────────────────────┐
│ ↓ │ 跳连:把编码器某一层的特征
├───────────┐ │ **直接横着送到解码器对应的那一层**
│ ↓ │ │
└─→ 最窄处 ←┘ │
│ ↑ │
解码器:一层层放大回原尺寸 ←┘

输出(这一步预测的噪声)

图说:这个「先缩小再放大、中间横着连几条线」的形状画出来像个字母 U,
所以它叫 **UNet**——你在任何一份讲图像生成或图像分割的材料里都会撞见这个名字。
两条路的叫法也要记住:**中间那条一路走到底的叫主干,横着连过去的叫跳连。**

这一章要问的就是:这两条路各自在干什么?

为什么值得问

书里在开头点了一句很实在的话2:

现有工作基本都是拿一个训好的 UNet 去做下游应用, 而这个网络内部的性质几乎没有被研究过。

这就是这一章存在的全部理由:它填的是一个「没人回头看」的空白。

3. 发现一:去噪过程里,低频几乎不动,高频剧烈变化

这一节是主走查之前的准备,也是理解后面一切的前提。

先讲高频和低频是什么

这是这一章唯一需要新学的概念,而它有一个日常的入口:

你把一张照片压缩得很厉害,先糊掉的是什么?
—— 头发丝、织物纹理、树叶边缘。
而整体的构图、大块的颜色,几乎还在。

被先糊掉的那部分叫**高频**:像素值在很短距离内剧烈变化的部分 —— 边缘和纹理。
留下来的那部分叫**低频**:大范围内缓慢变化的部分 —— 整体结构、大块颜色。

想把一张图拆成这两部分,用的工具叫**傅里叶变换**
(**傅里叶变换**:换一个角度看同一张图 —— 不再问「每个位置是什么颜色」,
而是问「各种快慢的变化各占多少」。它是可逆的,换过去还能换回来,不丢信息)。

图说:这一章从头到尾就在这两个东西之间做文章。

观察到的现象

把去噪过程里每一步的中间结果拆成高低频画出来看3:

低频缓慢变化,高频剧烈变化——而且高频的量在整个去噪过程里急剧下降。

作者给的解释

书里给了两条,合起来就是这一章的物理图景3:

  1. 低频承载图的本质(整体布局、平滑的颜色)。 在去噪过程里剧烈改动它是不合理的——那等于把这张图换成另一张图;
  2. 高频承载细节(边缘、纹理),而它对噪声最敏感—— 往图里加噪声,加进去的东西正是以随机高频的形式出现的。

所以去噪这件事的本质是:压掉噪声那部分高频,同时保住细节那部分高频。 这两者混在同一个频段里,这就是全章所有取舍的来源。

4. 发现二:两条路分工完全不同

这一节是全章的立论,做法极其朴素:各乘一个数,看会怎样。

对照实验

在两条路的特征拼起来之前,各给它乘一个缩放因子——主干乘 b,跳连乘 s4:

动什么结果
把 b 调大(放大主干)图像质量明显变好
把 s 调大(放大跳连)对质量几乎没有影响

这个不对称本身就是一个发现:两条路显然不是对称的两半。

追问一层:b 调大为什么会变好

接着看频谱5:

b 越大,生成图里的高频被压得越狠。

再对上第 3 节那句「加噪声就是加随机高频」:

b = 0.6 → 高频压得不够 → 图上一堆噪点
b = 1.4 → 高频压得恰好 → 图很干净

图说:所以书里的结论是一句很干脆的话——
**UNet 主干的主要职责就是滤掉高频噪声。**
放大主干特征,等于加强了它的去噪能力。

另一条路在干什么

看跳连传过去的东西的频谱:它主要是高频6

于是有了这一章最值得记住的一句判断。

5. 关键判断:训练时有用的东西,推理时可能有害

这一节是全章唯一一处「作者的推断」,而且它是整个方法的地基。

书里的原话措辞是「我们推测」6:

训练时:目标是**重建输入**
跳连把编码器那边的高频直接送过去
→ 网络更容易还原出输入
→ **收敛更快**(**收敛**:训练时误差一路下降、最后稳定在一个低位;
收敛更快 = 用更少的训练步数就达到同样的水平)
✓ 有用

推理时:目标是**从纯噪声生成一张新图**
跳连仍然在灌高频
→ 而主干正在拼命压高频
→ **两者互相抵消,去噪能力被削弱**
✗ 有害

图说:一句话——**训练目标和推理目标要的不是同一件事。**
这条跳连是为训练服务的,没人回头检查过它在推理时还合不合适。

判断(我们的,不是书里的): 这一章真正的方法论贡献是这个提问方式, 而不是那两个因子。 「一个部件是为训练加的,推理时它还该原样保留吗」—— 这个问题可以问在任何一个训练与推理目标不一致的地方, 而深度模型里这种地方非常多。 如果错,会错在: 书里没有做「训练时去掉跳连会怎样」的实验, 所以「跳连的作用是加速收敛」这一条只是推测。 如果跳连的真实作用是别的(比如稳定梯度),那这条推理的落点就要改。

6. 做法:两个动作,都在推理时

这一节是主走查第 ⑤ 步。方法本身很短。

动作一:放大主干,但要按结构放、而且只放一半

最朴素的做法是给整个主干特征乘一个常数。书里说这行得通,但有副作用7:

用一个固定的常数因子,质量确实明显提升, 但会带来明显的纹理过平滑和颜色过饱和。

所以改成按每个样本的结构来放:

① 把这一层主干特征沿通道方向求平均,得到一张平均特征图
—— 书里说这张图**天然带着结构信息**(物体在哪儿、轮廓在哪儿)
② 由它生成一张「因子图」:哪里该多放大、哪里该少放大
③ 拿这张因子图去放大主干特征

图说:关键差别是**「每个位置放大多少」不再是同一个数**,而是跟着这张图的结构走。

还有一条限制,书里做了实验才定下来8:

不能放大全部通道——全放会把纹理磨平。只放一半。 而且取前一半、后一半还是均匀隔一个取一个,差别很小—— 重要的是「只放一半」这件事本身。

动作二:把跳连的低频压下去

上一个动作会带来过平滑(去噪太狠,把细节高频也削了)。这一步是解药9:

① 把跳连特征做一次傅里叶变换,换到「各种快慢的变化各占多少」那个视角
② 用一张掩码把**变化最慢的那一小块**(半径小于某个阈值,书里取 1)乘上一个小于 1 的数
③ 再逆变换回来

图说:注意方向是反的 —— 主干那边是**放大**(加强去噪),
跳连这边是**压低频**(让高频的相对分量回来一点)。
**两个动作一推一拉,合起来才是「既干净又有纹理」。**

代价

书里说得很干脆:实现这两个因子只需要几行代码,不需要任何针对任务的训练或微调10

7. 效果:提升不大但处处能加,而且在快模型上最明显

画质与美学分

先把三个底座的名字交代了,因为你出门就会撞见它们: 书里测的是同一族开源画图模型的三代——最早那一代(SD 1.4)、 它的下一代(SD 2.1)、以及更大的那一代(SD-XL)。 「SD」是这一族的通称,你在任何一个画图工具的模型选单里都会看到这几个名字。

模型美学评分之一美学评分之二
最早那一代(SD 1.4)5.2315.365
+ 本章的两个因子5.5635.532
它的下一代(SD 2.1)5.4325.503
+ 本章的两个因子5.6865.612
更大的那一代(SD-XL)5.6755.538
+ 本章的两个因子5.9945.776

三代模型上都涨了 0.2 到 0.3511

FID 与文字一致性

模型FID(越低越好)文字一致性(越高越好)
那个更大的一代(SD-XL)43.820.31
+ 本章的两个因子40.790.33
一个「几步就出图」的蒸馏版模型(LCM)62.030.30
+ 本章的两个因子50.880.32

注意最后两行:提升幅度是 11.15,比上面那对(3.03)大三倍多11

判断(我们的,不是书里的): 这个对比很有意思,而书里只是把数摆着、没有解释。 蒸馏版模型是「把几十步压缩成几步」的模型,它每一步要干的活重得多, 去噪压力更大——所以「加强主干的去噪」这件事在它身上收益更高。 如果错,会错在: 也可能纯粹因为它的起点更差(62.03 对 43.82), 分数低的地方本来就更容易涨。书里没有做能区分这两种解释的实验。

它能挂在哪儿

书里列了一长串已经训好的模型和框架,全部只在推理时挂上去就行12, 其中一个组合值得单提:和一个「让模型输出超出训练分辨率」的免训练方法配合,能出 4096×4096 的图。

视频模型上也有效:一个文生视频模型的两项美学分从 4.115 / 4.469 涨到 4.338 / 4.60213

8. 两个数怎么选,以及它们各自的副作用

这一节把「调这两个数」变成可操作的建议。

因子调大会怎样调小会怎样书里的警告
主干因子 b图更干净图上噪点变多b = 1.8 就过平滑了——去噪太强会连细节高频一起削掉14
跳连因子 s(原样)背景细节更多、过平滑被缓解它是用来治 b 的副作用的,不是独立的提升手段15

这张表里最要紧的一条是 b 有上限。 它不是「越大越好」的旋钮——1.4 好、1.8 反而坏。 而这个上限的成因第 3 节已经讲过:噪声高频和细节高频混在同一个频段里, 压得太狠就会误伤。

9. 作者的判断与证据

书里给了证据的:

说法证据
低频缓慢、高频剧烈逐步拆频的可视化 + 频谱曲线
主干管去噪、跳连灌高频两个因子的对照实验 + 频谱对照
只放一半通道全放 / 前一半 / 后一半 / 均匀一半 四组对照
结构自适应优于常数因子定性对比:常数因子会过平滑 + 颜色过饱和
b 有上限b = 1.8 时过平滑
压跳连低频能治过平滑加与不加的定性对比
三代模型 + 视频模型上都有效四组美学分 + 两组 FID
在少步蒸馏模型上提升最大11.15 对 3.03

属于作者的推断:

  • 「跳连的高频在训练时加速收敛、在推理时削弱去噪」—— 书里用的措辞是「我们推测」,没有做去掉跳连重训的对照;
  • 「平均特征图天然带着结构信息」——由可视化支持,但没有量化。

10. 边界与局限

① 提升幅度不大。 美学分涨 0.2–0.35,FID 涨 3—— 这是「白捡」的量级,不是「换代」的量级。 值不值,取决于它确实一分钱不要。

② 那两个数怎么选,书里没有给通用配方。 只给了方向(b 大一点好、s 小一点好)和一个反例(b = 1.8 不行), 不同模型上的最优值要自己试。

③ 核心判断是推测。 见第 5 节。

④ 只在推理时改,不改训练。 如果作者的推断是对的,那更彻底的做法应该是改训练目标或改跳连的设计—— 书里没有往这个方向走。(这一条是我们提的。)

⑤ 评的是画质与美学,不是正确性。 美学评分和 FID 都不衡量「有没有画出你要的东西」; 文字一致性那一列涨了 0.02,书里没有讨论这个幅度算不算显著。

11. 可带走的

  1. 那个负责去噪的网络叫 UNet:先缩小再放大,中间横着连几条线;
  2. 两条路要分开叫:一路走到底的是主干,横着连过去的是跳连;
  3. 高频 = 边缘和纹理,低频 = 整体结构和颜色;拆开它们的工具是傅里叶变换;
  4. 去噪过程里低频几乎不动、高频剧烈下降——因为噪声本身就表现为随机高频;
  5. 去噪的本质矛盾:噪声高频和细节高频混在同一个频段里,压狠了会误伤;
  6. 两条路分工不同:放大主干图明显变干净,放大跳连几乎没反应;
  7. 主干干的活就是压高频——b 越大,生成图的高频被压得越狠;
  8. 跳连往解码端灌的主要是高频;
  9. 全章最值钱的一句判断:训练目标是重建输入,推理目标是从噪声生成,两者要的不是一回事—— 所以训练时有用的部件,推理时可能有害;
  10. 做法只有两个动作:按结构自适应地放大主干(只放一半通道,全放会磨平纹理)、 把跳连的低频压下去(治过平滑);
  11. b 不是越大越好:1.4 好,1.8 过平滑;
  12. 代价是零:不训练、不加参数、不加显存、不加采样时间,几行代码;
  13. 在「几步就出图」的蒸馏模型上收益最大(FID 降 11.15,而普通模型只降 3.03)。

12. 原文地图

主题原书章原文位置
没人研究过 UNet 内部14. Boosting Diffusion U-Net with Free Lunchtext/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:37(搜「remain largely under-explored」)
不花任何代价同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:45(搜「no additional learnable parameter introduced」)
低频缓慢、高频剧烈,以及两条解释同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:81(搜「low-frequency components inherently embody the global structure」)
两个因子的对照实验同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:89(搜「two multiplicative scaling factors」)
b 越大高频被压得越狠;主干是去噪的同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:95(搜「filter out high-frequency noise」)
跳连传的主要是高频,以及那条推测同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:101(搜「Our conjecture」)
结构自适应缩放与「只放一半通道」同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:111(搜「structure-aware scaling」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:119(搜「confine the scaling operation to the half channels」)
压跳连低频的三步与阈值同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:131(搜「spectral modulation」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:147(搜「threshold frequency」)
几行代码、不需要任何训练同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:151(搜「requiring only a few lines of code」)
美学分与 FID 两张表同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:205(搜「5.994」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:225(搜「40.79」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:237(搜「50.88」)
能挂在哪一串模型上 · 4K 图同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:157(搜「ScaleCrafter」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:241(搜「4K」)
视频模型上的两项分同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:275(搜「4.338」)
常数因子 vs 结构自适应同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:295(搜「color oversaturation」)
b 的上限(1.8 过平滑)与 s 的作用同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:303(搜「b=1.8」) · text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:309(搜「more detailed backgrounds」)
通道选择的四组对照同上text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:317(搜「uniformly selected half of the channels」)

Footnotes

  1. 出处:「14. Boosting Diffusion U-Net with Free Lunch for Enhanced Generation」第 95 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:95,搜「b=1.4」)、第 303 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:303,搜「b=1.8」)与表 14.1、14.2(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:205,搜「5.994」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:225,搜「40.79」)。主走查那句「一只戴墨镜的猫」是我们设的提示语,书里的定性对比图用的是别的例子;b 的三档取值与两个分数都是书里的真数。

  2. 出处:同上第 37 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:37,搜「remain largely under-explored」)。原文:现有工作主要聚焦于把预训练的扩散 UNet 用在下游应用上,而这个网络内部的性质在很大程度上仍未被探索。同一段也交代了 UNet 在扩散里的角色:在每一个去噪步上反复预测该被移除的噪声。

  3. 出处:同上第 81 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:81,搜「low-frequency components inherently embody the global structure」)与图 14.4 的说明(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:83,搜「drop drastically」)。原文两条解释:低频承载图像的全局结构与特征(整体布局、平滑的颜色),剧烈改动它会从根本上重塑这张图的本质,与去噪的目标不符;高频包含边缘、纹理这类快速变化,对噪声格外敏感——往图里加噪声时,噪声常常正是以随机高频的形式出现。频谱图显示高频分量在去噪过程中急剧下降。 2

  4. 出处:同上第 89 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:89,搜「two multiplicative scaling factors」)。原文:为评估主干与横向跳连在去噪中的作用,做了一个受控实验——在两者的特征图拼接之前各乘一个缩放因子;提高主干因子 b 明显提升生成质量,而改变跳连因子 s 对质量的影响有限。

  5. 出处:同上第 95 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:95,搜「filter out high-frequency noise」)。原文:b 增大相应地压制了生成图中的高频分量;b=0.6 时图里有大量噪声,b=1.4 时生成的图非常清晰;这说明 UNet 主干的主要作用是滤掉高频噪声,增强主干特征等于提升它的去噪能力。

  6. 出处:同上第 101 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:101,搜「Our conjecture」)。原文:跳连把编码器早期层的特征直接送到解码器,而这些特征主要由高频信息构成;作者的推测是,训练时这些高频会加速向噪声预测目标的收敛、让重建输入变得更容易,但副作用是削弱了主干固有的去噪能力;而推理的目标与训练不同——推理是要从高斯噪声生成数据,所以推理时必须加强 UNet 的去噪能力。原文明确写作「我们的推测(Our conjecture)」。 2

  7. 出处:同上第 111 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:111,搜「structure-aware scaling」)与第 295 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:295,搜「color oversaturation」)。原文:结构感知缩放按每个样本自身特征的特点自适应地调整缩放,而不是对所有样本、同一通道内所有位置施加固定倍数;做法是先沿通道维求平均特征图,这张平均图天然含有有价值的结构信息,再据此生成放大用的因子图。对照实验显示:用常数因子也能明显提升质量,但会带来明显的纹理过平滑与颜色过饱和。

  8. 出处:同上第 119 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:119,搜「confine the scaling operation to the half channels」)与第 317 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:317,搜「uniformly selected half of the channels」)。原文:无差别地放大所有通道会让合成图的纹理过平滑,原因是 UNet 过强的去噪能力会在去噪时损坏图像的高频细节,所以把缩放限制在一半通道上;通道选择的消融比较了「全部 / 前一半 / 后一半 / 均匀选一半」四种,后三种都能改善。

  9. 出处:同上第 131 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:131,搜「spectral modulation」)与第 147 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:147,搜「threshold frequency」)。原文:为进一步缓解因增强去噪而来的纹理过平滑,在傅里叶域做频谱调制,有选择地削弱跳连特征的低频分量;具体是做傅里叶变换、乘一张掩码、再逆变换回来;掩码的规则是「半径小于阈值的部分乘上一个因子,其余保持 1」,实验里阈值取 1

  10. 出处:同上第 151 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:151,搜「requiring only a few lines of code」)。原文:这套框架不需要针对任务的训练或微调,实现那两个缩放因子很直接,只需要几行代码。

  11. 出处:同上表 14.1(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:175,搜「5.231」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:205,搜「5.994」)与表 14.2(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:219,搜「43.82」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:225,搜「40.79」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:231,搜「62.03」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:237,搜「50.88」)。两项美学分用的是两个现成的图像质量与美学预测器,评测协议沿用一个视频生成基准。三个底座的名字在同一段正文里写明:SD1.4、SD2.1、SD-XL(第 165 段,text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:165,搜「comparing FreeU with SD1.4」);表 14.2 里那个「几步就出图」的蒸馏模型叫 LCM(第 229 段,text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:229,搜「LCM」),书里对它的说法是「一种高效的单阶段引导蒸馏方法,让已经训好的模型能几步甚至一步出图」。「11.15 对 3.03」这两个差值是我们做的减法,书里只把数摆在表里、没有比过。 2

  12. 出处:同上第 157 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:157,搜「ScaleCrafter」)与第 241 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:241,搜「4K」)。原文列了八个可以挂上去的已有模型与框架(两代开源文生图模型、一个文生视频模型、两个个性化方法、一个视频重渲染方法、一个高分辨率外推方法、一个动画方法、一个条件控制方法);其中与那个高分辨率外推方法配合时,组合起来能生成 4096×4096 的图

  13. 出处:同上表 14.3(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:269,搜「4.115」;text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:275,搜「4.338」)。一个文生视频模型的两项美学分从 4.115 / 4.469 提到 4.338 / 4.602。

  14. 出处:同上第 303 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:303,搜「b=1.8」)。原文:随着主干因子增大生成质量明显提升,但过大的取值(例如 b=1.8)会带来过平滑问题——因为增大 b 增强了 UNet 的去噪能力,而过强的去噪会损害高频细节的保留。

  15. 出处:同上第 309 段(text/44-ch14-14-boosting-diffusion-u-net-with-free-lunch-for-.txt:309,搜「more detailed backgrounds」)。原文:跳连因子用来有选择地削弱跳连特征的低频分量;随着它变小,生成图的背景细节更丰富、过平滑被缓解,这说明削弱跳连的低频确实能治主干因子带来的过平滑。