跳到主要内容

加噪一千步再学着走回来 — 一句话为什么能变成一张不存在的图

这一章讲三件事: 扩散模型这个「先毁掉再倒带」的思路为什么反而更好用——它把生成拆成了一千个简单的小问题; 从文字到图的三条传送带:文字怎么进来、提示词怎么「加力」、计算怎么省下一个量级; 以及它离开画布之后的版图——视频、分子、蛋白质、声音,和「眼见不再为实」的新麻烦。

它在全书链条里的位置: 第 12 章埋过一句「这条路线第 21 章会全部展开」,就是本章。 它也是第 24 章机器人动作生成的前置:同一套「从噪声逐步去噪」,后面要用来生成动作。

1. 一句话变一张图

2022 年 8 月,Stable Diffusion 公开发布。这件事的冲击不在于「模型会画画」, 而在于权重和代码被放到了普通人够得着的地方——几天之内,互联网上多出一群不会画画、 但会对着机器念咒语的新手「召唤师」1。同期的商业产品则把门槛降到一句话: 「戴眼镜、穿毛衣、在电脑前打字的柴犬」,十几秒后屏幕上真出现这样一只煞有介事的柴犬2

各种产品背后是同一个技术核心——扩散模型——和同一个问题: 怎样从随机噪声中,一步步长出有结构的结果?3 注意这个问法,它不是「怎样画一张图」;本章全部机关都藏在「一步步」三个字里。

2. 三代生成模型:糊、崩、慢

在它之前,「凭空造一张逼真的新图」试过两代人4:

世代思路成绩死穴
VAE(2013)压进隐空间再解码,隐向量带随机性所以能采样新图稳定、数学优雅偏糊:像素级误差偏爱「最平均的样子」,生成的脸像不清晰的草图
GAN(2014)造假网络与鉴伪网络互相逼清晰,一度主流训练不稳定、模式塌陷(只画最容易骗过对手的几种)
扩散(2020 起)逐步加噪,再学着逐步去噪又稳又清采样要很多步,慢

GAN 的困境书里有个传神的比方:两个人在跷跷板上跳舞,一个人稍微用力过猛,另一个就飞出去5。 扩散模型为什么能同时拿到「稳」和「清」?书里给了三层答案6: 其一,训练目标简单到近乎朴素——实践中就是一个「预测噪声」的回归任务,没有对抗博弈,也就没有崩溃和塌陷; 其二,把大问题拆成小问题——一次从噪声直接变清晰图极难,每次只去一点点噪声、做一千次,每一步都不难学; 其三,天然支持条件生成——加文字条件就是文生图,加草图条件就是图生图,加姿势条件就能控制人物动作。 代价只有一个:采样慢。这是接下来几节的主线。

3. 加噪:把一张图慢慢毁掉

主走查的输入在这里登场:一张 512 × 512 的彩色猫图。 先把它的量感钉住:512 × 512 × 3 个通道,接近八十万个数值——记住这个数,第 10 节要用它7

前向过程像往照片上撒沙:撒一层,略模糊;再撒一层,更模糊;反复几百上千次, 照片彻底变成杂乱无章的噪声,和随机雪花屏无法区分。这一步叫加噪,术语叫前向过程8

前向过程有一个反直觉的性质:它完全是写死的,一个参数都不用学。 每一步的新图等于「旧图保留多一点」加「一点高斯噪声」(高斯噪声即正态分布的随机数, 概率上两头少中间多,自然界噪声普遍长这样),系数经过设计让图像的整体幅度既不爆炸也不衰减; 总步数 T 通常取 1000 左右9。 还有一个白送的数学便利:由于每步都是独立噪声,想直接拿到「第 t 步的半毁图」, 可以一步公式算出,不必真迭代(一步步重复)t 次——训练因此非常高效10

4. 去噪:唯一要学的是「哪些像素像噪声」

把方向反过来问:从纯粹的雪花屏出发,能不能一步步「拂去」噪声,长出一张清晰图? 听起来像魔术,但如果有一个网络学会了「每一步如何去掉一点噪声」,答案就是能11

先拆掉一个最容易误读的地方:模型并不是从噪声里找回原来那张猫图——生成时,那张图根本不存在。 它真正学到的是:在每一种模糊程度下,真实图像大概该往哪个方向变更清楚。 书里的比方是雕塑家:不是把石头里早就藏好的大卫挖出来,而是凭经验一刀刀判断 「这里该削一点,那里该保留一点」;每一步都很小,几百步连起来,雪花屏里就显出一张新图12

而「学会去噪」在数学上有一个漂亮的简化:不必直接学「怎么变清晰」, 只需要让模型回答一个更小的问题——当前这张半糊的图里,哪些部分像是后撒上去的噪声? 知道了噪声,把它减掉一小部分,就得到稍微干净一点的前一步。 书里把这个问法转换写得极其直白:不是问「请你凭空画一只猫」, 而是问「这张半糊的图里,哪些部分像是噪声?」——后一个问题小得多、稳定得多; 把它练到炉火纯青,再重复很多次,大问题就被拆开解决了13

5. 训练目标简单到反直觉

于是训练流程只有五行14:

① 从训练集取一张干净图
② 随机选一个时间步 t(1 到 1000 之间)
③ 随机采一份噪声,按公式撒到图上,得到半糊图
④ 让神经网络看着半糊图,预测刚才撒进去的那份噪声
⑤ 用均方误差(第 03 章的老朋友)算「预测的噪声」和「真噪声」差多远,更新参数

这张图看的是扩散模型全部的训练:没有判别器、没有对手、没有博弈, 就是一个「预测噪声」的回归。 书里把这份简单称为扩散成功的关键之一—— 不是训练不要钱,而是目标本身朴素:预测噪声、算误差、更新参数; 对比 GAN 那种要小心翼翼维持两方平衡的做法,它几乎不可能突然崩掉, 也更适合随数据和算力扩大规模15

顺带把「谁去执行预测」交代掉,因为第 13 节要用到16: 去噪网络早期多用 U-Net(一种先压缩再放大、中间有捷径直连的卷积网络,天然适合图像、效率高, 但每个位置主要看局部);后来的高端模型越来越多改用 DiT——把图像切成小块当词元、 用 Transformer 处理,和大语言模型共享同一套底层,规模化更顺。 Sora、Stable Diffusion 3 都在这条线上;轻量和编辑场景里 U-Net 仍在服役。

6. 采样:一步一步走回来

生成一张图,就是把训练反过来跑17:

① 从纯高斯噪声出发 —— 一张随机雪花屏
② 让模型预测其中的噪声,减掉一部分,得到「稍微干净一点」的图
③ 重复一千步(原始设定),雪花屏里长出一张清晰的猫

注意代价:每一步都是一次完整的网络前向计算,一张图要把网络跑一千次—— 这正是扩散模型生成慢的主因17

7. 从一千步降到几十步

加速的思路一句话:原始扩散迈小碎步,后来的采样器学会了跨大步18。 书里给了一条完整的降步数时间线:2020 年的 DDIM 重新推导采样公式,每步跨更大区间, 约 50 步逼近 1000 步的质量;随后把去噪过程看成一条连续曲线、借用经典数值方法求解, 步数再降;2022 年专门设计的 DPM-Solver 压到 15–20 步;最激进的一致性模型 (2023)干脆训练一个「从任意模糊程度一步跳到干净图」的网络——质量略低于多步采样, 但对实时视频这类场景价值巨大19。 这些工作合起来,把生成从「几分钟一张」变成「几秒一张」—— 消费级产品的大门就是这么打开的19

8. 文字怎么进来

到目前为止模型只会「从噪声变图」,还不会「听话」。让文字进场只需要两步20

第一步,把文字变成向量。最常用的编码器是 CLIP——第 12 章讲过, 它的独特价值是把文字和图像映射(各自编码后对应着摆放)进了同一个空间: 「戴眼镜的柴犬」这句话的向量,天然就挨着这样一张图的向量, 这种「文图同义」让条件生成事半功倍21

第二步,把文字向量挂进去噪网络的每一步。用的是第 09 章讲过的交叉注意力: 图像的每个位置当查询,文字当键和值——画面的每一小块都去「查」一遍提示词, 看哪些词和自己相关,再去噪时就朝描述的方向靠。书里的比方: 模型每去掉一点噪声,都参考一遍文字说明,像画师一边画一边偷看甲方需求22

9. 无分类器引导:给提示加力

挂上文字还不够,实际发现模型并不总听话:你要「戴墨镜的柴犬」, 它可能画一只普通柴犬——墨镜去哪了?23

解法叫无分类器引导(CFG),思路分两半24: 训练时随机把文字条件扔掉,让模型学会两种模式——有文字时照着画,没文字时随便画一张真实的图; 推断时把两个预测做一次「外推」:沿着「有条件减去无条件」的那根向量,再往前推一段。 推得越用力,图越听话,但越容易僵硬、套路化;推得轻,图更自然,却可能跑题。 你在一个文生图工具里看到的 CFG 数值滑块,拧的就是这股力道——常用值 7.5 左右25

10. 隐空间扩散:把昂贵的活搬到小房间做

还剩最后一道成本关,也就是走查开头那八十万维的欠账:直接在像素空间做一千步去噪, 算力难以承受26

Stable Diffusion 的关键一步叫隐空间扩散:先用一个预训练的自编码器 (第 12 章的老朋友)把图像压进一个小得多的隐空间——64 × 64 × 4, 数据量小几十倍;全部一千步的加噪去噪都在这个小房间里完成; 最后解码器一次性还原回像素27。 书里的搬家比方:原始像素扩散像在几十万维的空间里搬家,隐空间扩散是先把家具打包压缩, 再在小得多的空间里移动;昂贵的迭代被搬进小房间,普通人的显卡才有机会参与28。 质量几乎不打折,速度提升一个量级——这也是「开放权重会改变创新发生的位置」的又一座实证: 发布后几个月里,社区把它改造成了动漫画、游戏资产、照片修复、风格迁移的一整套工作流29

至此走查收尾:一张八十万维的猫图 → 压进一万六量级的小房间(64 × 64 × 4 ≈ 1.6 万,对照八十万维,行李缩了约五十倍)→ 一千步内学会认噪声 → 从雪花屏反着走一千步(或跨大步的五十步)长回来。一句话到一张图的完整链路,一步不缺。

11. 图生图、局部重绘、向外扩展

这套机器不止会从零画。图生图不从纯噪声起步,而从「加了部分噪声的原图」起步: 噪声加得多,输出离原图远;加得少,输出贴着原图——噪声强度成了一个连续旋钮, 平衡「保留原图」和「按文字重画」30局部重绘是每一步都把「不想改的部分」替换回原图的值:被圈出的区域正常去噪, 其余区域上锁;向外扩展反过来,让模型补出画面外的区域,竖图变横图31

12. 精细控制与个性化

文字终究说不清「左手抬到肩膀高度、身体右转十五度」这样的指令。 两个工具补上这块32:

  • ControlNet:外挂一个控制网络,接受姿势骨架图、边缘线稿图、深度图、分割图当条件, 模型按图生成——「画一个草图,让 AI 填色」从此字面成立。它把扩散从随机创作工具升级成精准设计工具;
  • LoRA:想让模型学会你的角色或画风,不必重训整个模型——只在注意力层注入一个低秩的小模块, 几十张图就能教会一个新概念,产物只有几 MB(完整模型以 GB 计),方便分享。 Stable Diffusion 社区里成千上万个可下载的 LoRA,是开源生态繁荣的关键33

细心的读者会认出来:LoRA 就是第 16 章微调大模型的那条「低秩旁路」—— 同一个数学技巧,在语言模型里叫省钱微调,在画图模型里叫风格挂件。

13. 从图像到视频、分子与蛋白质

扩散的版图远不止画布,因为它的胃口是「高维连续数据」——凡是能用一大片连续数值表示的东西都算34

视频是「时间上多出一维的图像」。难点不在画好每一帧,在时间一致性: 要记住上一帧里那张脸、那件衣服,以及杯子到底在桌上还是突然瞬移到了天花板—— 书里的例子:一只狗在第 3 秒长出第五条腿,整段视频就废了35。 2024 年初的 Sora 把整段视频切成时空「词元」用 Transformer 处理(第 5 节的 DiT 路线), 画质与镜头连贯性震动影视行业;更新的系统进一步追求音画一致——嘴型对语音、动作对节拍, 错半拍观众立刻出戏36

科学与声音是两块意外的阵地。AlphaFold 3 在这一架构上换用了扩散模型来生成原子坐标—— 扩散天然适合连续的三维坐标,还能顺带建模蛋白质与小分子、核酸的相互作用, 这对药物设计的价值远超单看一个蛋白;分子生成、新材料筛选同理37。 音乐与语音那边,一段文字生成整首歌、一小段样本克隆相当像本人声音的能力,都已经商用—— 便利与深度伪造的隐忧一起到货,这一笔账记到第 14 节和第 26 章38

14. 画出来的东西,和画画的人

生成能力把几个老问题变成了现实问题,书里没有回避39深度伪造已经在制造真实伤害:仿声诈骗、伪造政要发言、名人换脸;检测技术(水印、模型指纹) 在发展,但攻防永远互相升级,长期看社会性手段(法规、平台责任、媒介素养)比技术更重要。 版权之争已经进了法院:模型学了受版权保护的作品、还能模仿其风格,算不算侵权, 各国监管正在分头演化。偏见原样复刻:早期文生图模型生成「CEO」, 出来的几乎全是白人男性——因为训练数据里的 CEO 长这样40

哲学层面,书里选的判例是 2022 年那幅拿了一等奖的《太空歌剧院》: 作者不是画家,用 Midjourney 迭代了 900 多个版本、累计约 80 小时, 再手工修饰细节——愤怒者说「这就像在马拉松赛场上骑了辆摩托车」, 辩护者说近百小时有方向感的引导难道不算创作41。 书里的立场不站队,只给了一个更精细的刻度:创造力不是二元的是非题,而是一条光谱—— 从记忆重现,到新颖组合,到开辟全新的可能空间;AI 已经稳稳站上前两档, 第三档仍是开放问题42。对创作者的判断则给了历史类比: 摄影没有让画家失业,而是把「精确记录」的责任拿走,逼出了印象派—— AI 拿走的会是技艺的门槛,留下来的价值在思想43

15. 作者的判断与证据

有证据的部分。 三代模型的优缺点对比、训练五步与采样三步的流程、各加速路线的步数、 隐空间的维度对比、《太空歌剧院》的 900 版本与 80 小时,均有公开出处或书内成文。

要分开看的四处:

  1. 「一步到位算任意时刻的噪声图」依赖前向各步独立这一数学性质,是书内给出的, 但只给了结论没有推导;我们如实转述,不装作推导过。
  2. 「扩散天然适合连续数据」是强的方向判断,弱的排他判断。 书里自己补充: 「可以考虑」不等于「最适合」,自回归、流匹配、传统模拟各有地盘34
  3. Sora 的具体架构书里只有一句公开说明的转述(时空词元 + Transformer 式结构), 未宣称更多细节。
  4. 版权与偏见的段落是快照。 诉讼进展、监管路径都在演化中,本章只保证「问题真实存在」, 不保证任何一方的现状描述到今天仍然准确。

判断(我们的,不是书里的):扩散模型真正的贡献,是把「生成」从天赋变成了工期。 它证明了一件事:看起来最需要灵感的活动——凭空造出从未存在的东西—— 可以被拆成一千个「认噪声」这种可批量训练的小任务。这一拆, 把创造力的一部分从「少数会画的手」转移到了「会提要求、会迭代、会挑选的人」手里。 900 个版本、80 小时,这个数字组合本身就是新工作方式的工时表。 如果错,会错在: 「认噪声」的五步训练之所以成立,依赖海量真实图像的存在; 若某个领域没有足量的「成品」可供加噪(比如极端稀缺的科学数据), 这套拆法就搬不过去——工期论的适用边界,恰是数据密度。

判断(我们的,不是书里的):CFG 滑块是全书最小而最好的「权衡教具」。 一根滑杆同时暴露了条件生成的根本张力:忠实与自然不可兼得, 每个使用者都在亲手调它。我们在第 13 章见过奖励设计的「稀疏与稠密」、 本章见过「听话与僵硬」——同一形状的权衡换了三次马甲。 认出同一形状,比记住每一个马甲重要。 如果错,会错在: 若未来的条件生成机制能在不牺牲多样性的情况下逼近提示词 (例如更好的对齐训练),张力会被压窄——但它作为教学案例的价值不受影响。

16. 边界与局限

  • 数学只到直觉层。 前向公式给了形状,变分推导书里明说「与变分界有关」但一路带过15; 这符合通识版的口径,想要推导请移步教科书全本。
  • 流匹配、一致性模型只有半节。 两者都在快速演化,书里只交代了「更简洁、更快」与 「一步生成、质量略低」两个定位44
  • 版图章节的列举密度高、深度浅。 3D 资产、气象、机器人动作各只有几句话; 机器人动作那条线,第 24 章才真正展开。
  • 中文语音生态、中文语料上的偏见,书里没有专门讨论。
  • 物理建模与扩散的融合只给了分子构象、流体、气象三个方向名,没有一个深入45

17. 可带走的

  1. 扩散 = 先毁一千步,再学倒带。 「一步步」三个字是全部机关。
  2. 三代对垒一句话:VAE 稳而糊,GAN 清而崩,扩散稳清兼得但慢。
  3. 前向过程是写死的,一个参数都不学;真正学的只有一件事:指出这张半糊图里哪些像素像噪声。
  4. 它不是找回原图——生成时那张图不存在。 雕塑家不是挖出藏好的大卫,是凭经验落刀。
  5. 训练目标只是一个回归:预测噪声,算均方误差。 简单,所以稳;稳,所以敢放大。
  6. 采样慢是唯一代价,降步数是十年主线:1000 → 50 → 15–20 → 1。
  7. 文字进场靠两步:CLIP 把话和图放进同一个空间,交叉注意力让画面每一步都「查」一遍提示词。
  8. CFG 滑块 = 忠实与自然的权衡杆,常用值 7.5 左右;拧得太狠会僵。
  9. 隐空间扩散把八十万维的活搬进几万维的小房间——消费级显卡由此入场。
  10. 图生图 = 从半毁的原图起步;重绘 = 圈内重画、圈外上锁。
  11. ControlNet 给的是「骨架」,LoRA 给的是「画风」;LoRA 就是第 16 章那条低秩旁路。
  12. 视频难在时间一致性:狗在第 3 秒长出第五条腿,整段就废了。
  13. 眼见不再为实是已送达的现实: 伪造、版权、偏见三笔账都已进入法庭和招聘流程。

18. 原文地图

主题原书章原文位置
Stable Diffusion 发布第11章 从噪声中创造:扩散模型text/12-ch11.txt:7(搜「2022 年 8 月 22 日」)· :11(搜「念咒语」)
柴犬与一句话第11章 从噪声中创造:扩散模型text/12-ch11.txt:13(搜「柴犬」)· :15(搜「你给它一句话」)
同一个核心问题第11章 从噪声中创造:扩散模型text/12-ch11.txt:25(搜「一步步长出」)· :29(搜「扩散模型」)
2015 冷门源头第11章 从噪声中创造:扩散模型text/12-ch11.txt:38(搜「Sohl-Dickstein」)· :43(搜「沉睡了整整五年」)
DDPM 的简化第11章 从噪声中创造:扩散模型text/12-ch11.txt:46(搜「漂亮的简化」)· :48(搜「MSE 回归」)· :52(搜「醒了过来」)
隐空间扩散登场第11章 从噪声中创造:扩散模型text/12-ch11.txt:54(搜「隐空间扩散」)· :57(搜「消费级」)
Stable Diffusion 引爆第11章 从噪声中创造:扩散模型text/12-ch11.txt:7(搜「Stable Diffusion」)· :74(搜「演示视频里」)
Sora 与时空词元第11章 从噪声中创造:扩散模型text/12-ch11.txt:79(搜「东京夜雨」)· :82(搜「时空」)· :84(搜「统一」)
AlphaFold 3 换扩散第11章 从噪声中创造:扩散模型text/12-ch11.txt:90(搜「接近实验精度」)· :93(搜「原子坐标」)· :96(搜「走进了生命科学」)
生成 vs 判别第11章 从噪声中创造:扩散模型text/12-ch11.txt:112(搜「造数据」)
VAE 稳而糊第11章 从噪声中创造:扩散模型text/12-ch11.txt:121(搜「变分推断」)· :126(搜「偏糊」)· :128(搜「平均」)
GAN 对抗与跷跷板第11章 从噪声中创造:扩散模型text/12-ch11.txt:132(搜「Generator」)· :140(搜「模式塌陷」)· :145(搜「跷跷板」)
三层「稳清」答案第11章 从噪声中创造:扩散模型text/12-ch11.txt:152(搜「训练目标简单」)· :155(搜「分而治之」的位置以检索为准)· :158(搜「条件生成」)
撒沙类比第11章 从噪声中创造:扩散模型text/12-ch11.txt:179(搜「撒一点细沙」)· :181(搜「加噪」)
雪花屏长出新图第11章 从噪声中创造:扩散模型text/12-ch11.txt:184(搜「拂去」)· :187(搜「长出」)
雕塑家与大卫第11章 从噪声中创造:扩散模型text/12-ch11.txt:190(搜「找回原来那张图」)· :192(搜「雕塑家」)
前向固定与步数第11章 从噪声中创造:扩散模型text/12-ch11.txt:211(搜「1000」)· :215(搜「固定的」)
一步到位的便利第11章 从噪声中创造:扩散模型text/12-ch11.txt:218(搜「一步到位」)
预测噪声的简化第11章 从噪声中创造:扩散模型text/12-ch11.txt:225(搜「去噪过程」)· :230(搜「监督学习问题」)· :231(搜「半糊的图里」)
五步训练第11章 从噪声中创造:扩散模型text/12-ch11.txt:237(搜「异常简洁」)· :246(搜「回归任务」)
朴素为何是关键第11章 从噪声中创造:扩散模型text/12-ch11.txt:249(搜「关键之一」)· :251(搜「鲜明对比」)
U-Net 与 DiT第11章 从噪声中创造:扩散模型text/12-ch11.txt:259(搜「U 型」)· :264(搜「DiT」)· :270(搜「一统江湖」)
采样三步第11章 从噪声中创造:扩散模型text/12-ch11.txt:275(搜「白噪声」)· :279(搜「主因」)· :280(搜「1000 步采样」)
加速时间线第11章 从噪声中创造:扩散模型text/12-ch11.txt:284(搜「跨更大区间」)· :286(搜「DPM-Solver」)· :287(搜「一致性模型」)· :290(搜「几秒一张」)
CLIP 文图同空间第11章 从噪声中创造:扩散模型text/12-ch11.txt:300(搜「CLIP」)· :302(搜「文图同义」)
交叉注意力注入第11章 从噪声中创造:扩散模型text/12-ch11.txt:303(搜「交叉注意力」)· :307(搜「偷看甲方需求」)
墨镜去哪了第11章 从噪声中创造:扩散模型text/12-ch11.txt:326(搜「并不总是」)· :327(搜「墨镜去哪了」)
CFG 两半思路第11章 从噪声中创造:扩散模型text/12-ch11.txt:328(搜「无分类器引导」)· :334(搜「再推一把」)· :336(搜「7.5」)
八十万维的账第11章 从噪声中创造:扩散模型text/12-ch11.txt:358(搜「八十万维」)
隐空间三步第11章 从噪声中创造:扩散模型text/12-ch11.txt:360(搜「Latent Diffusion」)· :361(搜「64 × 64」)
搬家打包比方第11章 从噪声中创造:扩散模型text/12-ch11.txt:378(搜「不打折」)· :381(搜「打包压缩」)
开放改变创新位置第11章 从噪声中创造:扩散模型text/12-ch11.txt:384(搜「开放权重」)· :387(搜「创新发生的位置」)
图生图旋钮第11章 从噪声中创造:扩散模型text/12-ch11.txt:394(搜「加了部分噪声」)· :396(搜「旋钮」)
局部重绘与外扩第11章 从噪声中创造:扩散模型text/12-ch11.txt:401(搜「锁住」)· :404(搜「Outpainting」)
ControlNet第11章 从噪声中创造:扩散模型text/12-ch11.txt:408(搜「ControlNet」)· :410(搜「骨架图」)· :418(搜「精准设计工具」)
LoRA第11章 从噪声中创造:扩散模型text/12-ch11.txt:424(搜「Low-Rank Adaptation」)· :426(搜「几 MB」)· :428(搜「生态是开源扩散模型繁荣」)
视频的一致性第11章 从噪声中创造:扩散模型text/12-ch11.txt:78(搜「第五条腿」)· :444(搜「记住上一帧」)· :448(搜「穿帮」)
音画一致第11章 从噪声中创造:扩散模型text/12-ch11.txt:450(搜「音画一致」)· :451(搜「慢半拍」)
分子与材料第11章 从噪声中创造:扩散模型text/12-ch11.txt:462(搜「新药候选」)· :469(搜「新材料」)
音乐与语音第11章 从噪声中创造:扩散模型text/12-ch11.txt:475(搜「Suno」)· :477(搜「ElevenLabs」)· :479(搜「隐忧」)
深度伪造与版权第11章 从噪声中创造:扩散模型text/12-ch11.txt:479(搜「诈骗」)· :545(搜「仿声诈骗」)· :553(搜「诉讼」)
CEO 偏见第11章 从噪声中创造:扩散模型text/12-ch11.txt:560(搜「CEO」)
太空歌剧院判例第11章 从噪声中创造:扩散模型text/12-ch11.txt:586(搜「数字艺术家竞赛」)· :591(搜「900 多个版本」)· :594(搜「马拉松」)
创造力光谱第11章 从噪声中创造:扩散模型text/12-ch11.txt:607(搜「光谱」)· :609(搜「开放问题」)
理解与生成第11章 从噪声中创造:扩散模型text/12-ch11.txt:620(搜「有限但真实」)· :622(搜「不理解艺术」)
摄影类比第11章 从噪声中创造:扩散模型text/12-ch11.txt:642(搜「摄影的发明」)
核心启示第11章 从噪声中创造:扩散模型text/12-ch11.txt:649(搜「许多稳定的小步骤」)· :652(搜「逆推」)

Footnotes

  1. 出处:「第11章 从噪声中创造:扩散模型」第 7 至 11 段 (text/12-ch11.txt:7,搜「Stability AI」;:11,搜「念咒语」)。

  2. 出处:「第11章 从噪声中创造:扩散模型」第 12 至 15 段 (text/12-ch11.txt:13,搜「柴犬」;:15,搜「一句话」)。

  3. 出处:「第11章 从噪声中创造:扩散模型」第 25 与 29 段 (text/12-ch11.txt:25,搜「一步步长出」;:29,搜「技术核心」)。

  4. 出处:「第11章 从噪声中创造:扩散模型」第 116 至 128 段 (text/12-ch11.txt:117,搜「Variational Autoencoder」;:126,搜「偏糊」;:140,搜「模式塌陷」)。

  5. 出处:「第11章 从噪声中创造:扩散模型」第 145 至 146 段 (text/12-ch11.txt:145,搜「跷跷板」)。

  6. 出处:「第11章 从噪声中创造:扩散模型」第 151 至 159 段 (text/12-ch11.txt:152,搜「训练目标简单」;:156,搜「1000 次」;:158,搜「条件生成」)。

  7. 出处:「第11章 从噪声中创造:扩散模型」第 358 段 (text/12-ch11.txt:358,搜「八十万维」)。

  8. 出处:「第11章 从噪声中创造:扩散模型」第 178 至 181 段 (text/12-ch11.txt:179,搜「细沙」;:181,搜「反向过程叫去噪」)。

  9. 出处:「第11章 从噪声中创造:扩散模型」第 209 至 214 段 (text/12-ch11.txt:211,搜「噪声强度」;:214,搜「方差保持稳定」)。 高斯噪声的通俗解释是补充(不在书里,来自通用知识)

  10. 出处:「第11章 从噪声中创造:扩散模型」第 218 至 222 段 (text/12-ch11.txt:218,搜「一步到位」;:222,搜「非常高效」)。

  11. 出处:「第11章 从噪声中创造:扩散模型」第 184 至 187 段 (text/12-ch11.txt:184,搜「拂去」;:187,搜「长出一张」)。

  12. 出处:「第11章 从噪声中创造:扩散模型」第 190 至 194 段 (text/12-ch11.txt:190,搜「并不」;:192,搜「雕塑家」;:193,搜「显出一张新图」)。

  13. 出处:「第11章 从噪声中创造:扩散模型」第 225 至 232 段 (text/12-ch11.txt:230,搜「监督学习问题」;:231,搜「半糊的图里」;:232,搜「炉火纯青」)。

  14. 出处:「第11章 从噪声中创造:扩散模型」第 236 至 244 段 (text/12-ch11.txt:237,搜「异常简洁」;:242,搜「MSE 损失」)。

  15. 出处:「第11章 从噪声中创造:扩散模型」第 246 至 251 段 (text/12-ch11.txt:247,搜「崩掉」;:249,搜「关键之一」)。 2

  16. 出处:「第11章 从噪声中创造:扩散模型」第 254 至 270 段 (text/12-ch11.txt:255,搜「U-Net」;:264,搜「Diffusion Transformer」;:267,搜「规模化」)。

  17. 出处:「第11章 从噪声中创造:扩散模型」第 273 至 281 段 (text/12-ch11.txt:275,搜「白噪声」;:279,搜「前向传播」;:280,搜「1000 步」)。 2

  18. 出处:「第11章 从噪声中创造:扩散模型」第 282 至 283 段 (text/12-ch11.txt:282,搜「跨大步」)。

  19. 出处:「第11章 从噪声中创造:扩散模型」第 284 至 290 段 (text/12-ch11.txt:284,搜「DDIM」;:286,搜「DPM-Solver」;:288,搜「一步跳到」;:290,搜「几秒一张」)。 2

  20. 出处:「第11章 从噪声中创造:扩散模型」第 292 至 299 段 (text/12-ch11.txt:293,搜「条件生成」;:298,搜「编码成向量」)。

  21. 出处:「第11章 从噪声中创造:扩散模型」第 300 至 302 段 (text/12-ch11.txt:301,搜「同一个空间」;:302,搜「文图同义」)。

  22. 出处:「第11章 从噪声中创造:扩散模型」第 303 至 307 段 (text/12-ch11.txt:303,搜「Cross-Attention」;:305,搜「查询」;:307,搜「甲方需求」)。

  23. 出处:「第11章 从噪声中创造:扩散模型」第 326 至 327 段 (text/12-ch11.txt:327,搜「墨镜去哪了」)。

  24. 出处:「第11章 从噪声中创造:扩散模型」第 328 至 334 段 (text/12-ch11.txt:328,搜「无分类器引导」;:334,搜「外推」)。

  25. 出处:「第11章 从噪声中创造:扩散模型」第 335 至 340 段 (text/12-ch11.txt:335,搜「CFG Scale」;:336,搜「7.5」;:339,搜「几何意义」)。

  26. 出处:「第11章 从噪声中创造:扩散模型」第 357 至 359 段 (text/12-ch11.txt:358,搜「极其昂贵」)。

  27. 出处:「第11章 从噪声中创造:扩散模型」第 360 至 366 段 (text/12-ch11.txt:361,搜「64 × 64」;:365,搜「一次解码」)。

  28. 出处:「第11章 从噪声中创造:扩散模型」第 378 至 383 段 (text/12-ch11.txt:378,搜「不打折」;:382,搜「小房间」)。

  29. 出处:「第11章 从噪声中创造:扩散模型」第 384 至 387 段 (text/12-ch11.txt:385,搜「衍生应用」;:387,搜「创新发生的位置」)。

  30. 出处:「第11章 从噪声中创造:扩散模型」第 392 至 397 段 (text/12-ch11.txt:394,搜「部分噪声的原图」;:395,搜「偏离原图」)。

  31. 出处:「第11章 从噪声中创造:扩散模型」第 398 至 407 段 (text/12-ch11.txt:401,搜「锁住」;:404,搜「Outpainting」)。

  32. 出处:「第11章 从噪声中创造:扩散模型」第 408 至 421 段 (text/12-ch11.txt:408,搜「ControlNet」;:410,搜「骨架图」;:418,搜「精准设计工具」)。

  33. 出处:「第11章 从噪声中创造:扩散模型」第 422 至 428 段 (text/12-ch11.txt:424,搜「Low-Rank」;:426,搜「几 MB」;:428,搜「成千上万」)。

  34. 出处:「第11章 从噪声中创造:扩散模型」第 455 至 458 与 485 至 487 段 (text/12-ch11.txt:462,搜「分子生成」;:486,搜「连续向量」)。 2

  35. 出处:「第11章 从噪声中创造:扩散模型」第 76 至 78 与 444 至 449 段 (text/12-ch11.txt:78,搜「第五条腿」;:447,搜「时间一致性」;:448,搜「累积」)。

  36. 出处:「第11章 从噪声中创造:扩散模型」第 82 至 84 与 450 至 452 段 (text/12-ch11.txt:83,搜「词元」;:451,搜「慢半拍」)。

  37. 出处:「第11章 从噪声中创造:扩散模型」第 93 至 96 与 465 至 469 段 (text/12-ch11.txt:94,搜「3D 坐标」;:466,搜「AlphaFold 3」)。

  38. 出处:「第11章 从噪声中创造:扩散模型」第 475 至 479 段 (text/12-ch11.txt:477,搜「声音克隆」;:479,搜「深度伪造」)。

  39. 出处:「第11章 从噪声中创造:扩散模型」第 542 至 549 段 (text/12-ch11.txt:542,搜「滥用风险」;:547,搜「水印」;:549,搜「媒介素养」)。

  40. 出处:「第11章 从噪声中创造:扩散模型」第 553 至 565 段 (text/12-ch11.txt:554,搜「演化」;:561,搜「白人男性」;:564,搜「影子」)。

  41. 出处:「第11章 从噪声中创造:扩散模型」第 586 至 596 段 (text/12-ch11.txt:591,搜「900 多个版本」;:594,搜「马拉松」;:596,搜「奖项归属」)。

  42. 出处:「第11章 从噪声中创造:扩散模型」第 607 至 610 段 (text/12-ch11.txt:607,搜「光谱」;:610,搜「开放问题」)。

  43. 出处:「第11章 从噪声中创造:扩散模型」第 636 至 643 段 (text/12-ch11.txt:639,搜「思想」;:642,搜「摄影的发明」)。

  44. 出处:「第11章 从噪声中创造:扩散模型」第 494 至 503 段 (text/12-ch11.txt:495,搜「流场」;:502,搜「一次网络前向传播」)。

  45. 出处:「第11章 从噪声中创造:扩散模型」第 509 至 515 段 (text/12-ch11.txt:509,搜「布朗运动」;:513,搜「不确定性」)。