跳到主要内容

把物理弄回扩散里

1. 这一章讲什么

三件事: 第 13 章那两个成品缺了什么(答案是反馈回路); 书为什么裁定物理约束该加在使用的时候、而不是训练的时候; 以及这么做在一个真实的天体物理任务上打赢了最好的经典求解器——又准又快。

它在全书链条里的位置:这是全书两条主线的会合处。 第 08 到 10 章那把「把求解器搬进来」的刀,和第 11 到 13 章那把「学一整个分布」的刀, 在这一章第一次落在同一个任务上。 书自己也说:这么弄进来的方式,基本上和讲可微物理那一部分是一回事。

2. 顶层全景

第 13 章训好的流匹配网络

│ 它会生成一整个分布,但训练时
│ 网络 ←╳→ 观测 ←╳→ 仿真器 (没有任何反馈回路)

于是精度卡在「模型能力给定的那个水平」上,加步数也压不下去

┌────────────── 书的裁决:在推理时把物理接进来 ──────────────┐
│ │
│ 朴素做法(DPS) 正确做法(控制网络) │
│ 每步之后按仿真误差 加第二个网络,参数只有一成 │
│ 的梯度推一把 主网络冻结,不必反传穿过它 │
│ │ │ │
│ ▼ ▼ │
│ 会扭曲分布采样 三个技术要点: │
│ 最坏把不同的点 ① 先一步预测擦干净再问仿真器│
│ 全拉向同一支 ② 信号可梯度、也可学 │
│ ③ 只在 t ≥ 0.8 才启用 │
└──────────────────────────────────────────────────────────┘


强引力透镜:χ² 1.48 对经典最好的 1.74,快约 35 倍

另一条路(SMDP):干脆把扩散时间和物理时间合并
= 一个近似的反向物理仿真器 + 一个修正网络

这张图在讲什么: 上半是缺口,中间是两种补法的对比,下半是成绩。 注意左右两块补法的输入完全一样,差别只在「梯度怎么被用」。

3. 扩散缺什么:没有反馈回路

结论先行:第 13 章那两个成品有一个结构性的空缺,而不是精度不够。

书的原话1:

尽管扩散和流的方法在生成建模上能力强大,网络、观测和样本之间 在训练时没有直接的反馈回路。这意味着没有直接的机制去纳入 PDE 先验这样的 基于物理的约束。后果是:光靠学习很难产生高度精确的样本—— 而对科学应用,我们常常要确保误差能降到任何选定的阈值以下。

把这句话和第 09 章对照着读,缺口就清楚了: 那一章的整套论证是「网络必须在训练时看到自己的动作造成了什么」, 而第 13 章那两个成品,训练时压根没有仿真器在场。

「误差能降到任何选定的阈值以下」这一条是科学应用的硬要求,不是奢求。 做结构分析、做天体测量,你得能说出「这个结果的误差不超过多少」—— 一个只会「大概生成得很像」的网络给不出这句话。

4. 书的裁决:加在训练时,还是加在使用时

结论先行:直觉说「当然加在训练时」,书说反了。

加在训练时的希望是:改进训练完的那个网络本身。 书直接判了:「几乎没有希望大幅改进学到的分布的精度」2理由是这套训练本来就能产出很有能力的网络, 它们的精度限制通常来自网络规模和训练数据规模——那不是这个阶段能撬动的。

加在使用时的理由,是全章最值钱的一段。它是三步2:

第一步:经典仿真手里握着一个「精度旋钮」。 拿解线性方程组的迭代求解器举例——你可以规定它迭代多少次, 也可以规定「残差(方程两边的差)小到多少就停」; 嫌结果不够准,把那个阈值往小里调,它就还你一个更准的输出。

第二步:神经网络手里没有这么一个旋钮。 去噪的迭代次数、速度积分的步数看着像旋钮,可它们在最终精度上是有上界的。 书这一句的措辞值得原样留着2:

「更多的步数通常降低噪声、也降低误差, 但会在『训练好的模型的能力所给定的那个精度水平』上拍平。」

第三步:所以物理求解器的梯度才有位置。 它是一个外部的过程——它不受「模型能力」那堵墙管, 反而能反过来引导、改进扩散给出的输出;而它自己就带着第一步那个能一直拧下去的旋钮2

「拍平」这个词是这一段的关键:它说的是加步数会遇到一堵墙。 第 13 章那张表已经露出这堵墙了——20 步和 100 步的标准差场都「很好」, 再往上加步数不会更好。

所以这一章要找的不是「更多步」,是一个能继续往下压的外部东西。 而经典求解器恰好就是那个东西:它自己带着一个可以拧到底的精度旋钮。

5. 最朴素的做法,以及它的两个毛病

最直接的想法:在每一步去噪之后,额外沿着「仿真结果离观测多远」的梯度推一把。 这个做法有名字,叫扩散后验采样(DPS)3

书说它管用,但有两个挑战:

毛病好不好办
当前的样本通常是有噪的好办,用一个外推的小动作解决(第 7 节)
那个梯度步会扭曲去噪过程的分布采样难办

第二个毛病书讲得很具体,而且它是这一章设计的全部动机3:

沿仿真误差梯度走的下降步,类似于反问题的经典优化,可能强烈扭曲扩散的输出。 最坏的情况下,它们可能把后验分布里不同的点,全都拉向仿真器偏爱的那一个解。

读这句话要联到第 01 章: 我们花了三章才把「两支都拿到」这件事做出来, 而一个粗暴的梯度步会把它按回去——因为优化天生就是奔着一个最优解去的。 这一章后面所有的复杂度,都是为了不把这件事毁掉。

6. 正确的做法:加第二个网络

结论先行:不改主网络,不直接把梯度加到样本上,而是加一个专门接收反馈的小网络。

做法分两个阶段4:

① 先正常预训练一个条件流网络,完全不带控制信号
目的:先把「纯靠学习能达到的最好性能」拿到手


② 引入一个控制网络。它接收两样东西:
· 预训练那个网络给出的速度
· 一个「控制信号」(离目标多远、往哪走)
主网络的参数可以冻结 ⟹ 不必反传穿过它,省训练时间和算力


③ 推理时积分的是控制网络给出的速度
每一步先求主网络的速度,再算控制信号,再送进控制网络

规模:控制网络只有主网络约一成的参数4

「冻结」在这里的意思很具体:主网络的参数在第二阶段一个都不动。 所以第二阶段的反向传播只穿过那个小网络,不穿过大的那个—— 这就是「省训练时间和算力」的来源。

和第 5 节那个朴素做法的差别,一句话说得清:

梯度去了哪儿
朴素做法直接加到样本上——等于在生成过程里插了一步优化
这一章的做法进了一个网络的输入——由网络决定怎么用它

7. 技术要点一:先把样本擦干净,再去问仿真器

问题:生成过程走到一半时,手上那个样本还很噪,尤其是开头几步。 书的话很直白5:

大多数仿真器真的很不喜欢很噪的输入,在此之上还想算梯度显然是个很糟的主意。

解法叫一步预测: 不拿当前那个带噪的样本去问仿真器, 而是先用网络给出的速度,朝终点直接外推一步,得到「网络认为的干净样本」, 再拿这个去算仿真误差5

为什么这一步在流匹配上特别好使,书给了理由5: 线性条件传输路径的流,经验上被证明轨迹的曲率比去噪那一类更小。 曲率小意味着「朝终点直着外推一步」这个动作更准—— 这正是第 13 章那条直线路径顺带带来的好处。

8. 技术要点二:控制信号可以是梯度,也可以是学出来的

控制信号要回答两件事:离目标多远、以及往哪走。 书按仿真器可不可微分成两种6:

类型信号里装什么什么时候用
梯度式代价的值(离目标多远)+ 它的梯度(往哪走)仿真器可微时
学习式一个可学的编码器(一个把复杂输入压成少数几个数的小网络),把「仿真结果和观测像不像」压成一个信号仿真器不可微时

学习式那一种有一个关键细节:梯度反传在仿真器输出处被截断6读法:仿真器只负责算出结果,不参与求导; 编码器学的是「怎么把这个结果和观测的差别说成一句网络听得懂的话」。

这一条的实际意义:它把这套方法的适用面从「可微仿真器」扩到了「任何仿真器」—— 只是可微的那种能给出更直接的信号。

9. 技术要点三:什么时候才开始控制

结论先行:开头不控制,只在快到终点时才控制。

理由是一条链7: 如果那个「一步预测」估得差、代价很高,梯度和控制信号就不可靠; 而一步预测在流匹配过程的较晚时刻更可靠(因为那时样本已经接近成品)。

书给的阈值是:t ≥ 0.8。 只在这个区间训练控制网络;t < 0.8 时直接输出预训练那个网络的速度。

参照物:整个流匹配过程的时间轴是 0 到 1,所以控制只在最后两成的行程里起作用。 前面八成完全是第 13 章那套原味流匹配。

这也顺带解释了为什么这套东西不贵:仿真器只在最后两成的步里被调用。

10. 为什么这样理论上还站得住

书特意强调了一个优点,而它是这套设计和「朴素引导」的根本区别8:

在这个表述里,那个近似的一步预测只影响控制信号,而控制信号是受控流网络的输入。 对确定性的仿真器,这让控制信号成为当前样本的一个函数。 受控流网络用的是和原味流匹配一样的损失。这带来一个好性质:理论性质被保住了。 这与「基于似然的引导」形成对比——后者在推理时拿一个近似当引导项, 而那不在原始流匹配理论的覆盖范围内。

摊开讲这句话为什么重要: 近似出现在输入里,和近似出现在损失里,是两件完全不同的事。 输入怎么算的不影响「这个训练目标在优化什么」; 而把近似塞进损失或者塞进采样步,就等于在优化另一个东西了。

这是这一章最容易被略过、却最值钱的一处工程判断。

11. 主走查:强引力透镜的反问题

主走查第 1 步(任务): 强引力透镜。 一个星系的引力把它背后另一个星系的光掰弯,于是我们在望远镜里 看到同一个源的好几个像9要解的是反问题:从看到的这几个像,反推那个挡在中间的星系的引力分布长什么样。

主走查第 2 步(为什么这个任务值得做): 书说传统的计算方法建模单个透镜系统 需要几分钟到几小时,甚至几天9所以这里存在一个真实的、迫切的加速需求,而不是造出来的比赛。

主走查第 3 步(要量什么): 指标是 χ²(卡方)—— 一个衡量「模型给出的像和望远镜实际拍到的像差多远」的标准量,越小越好。 ⚠️ 但它有一个下限:观测本身带噪声,所以哪怕模型完美,χ² 也降不到 0。 这个场景下的理论最好可能值是 1.1710

主走查第 4 步(生成一个样本时发生了什么): ① 从一份随机噪声出发 → ② 前八成行程直接按预训练的流走 → ③ 进入 t ≥ 0.8 之后,每一步先用一步预测外推出「网络认为的干净结果」→ ④ 把这个结果送进可微的透镜仿真器,和真实观测比,得到代价和梯度 → ⑤ 这两样打包成控制信号,连同主网络的速度一起送进那个只有一成参数的控制网络 → ⑥ 用它给出的速度积分下一步。

主走查第 5 步(结果,三个数放一起才有意义)10:

方法平均 χ²建模一个系统要多久
理论最好可能值(受观测噪声限制)1.17
流匹配 + 可微仿真器1.4819 秒
纯流匹配(没有仿真器)只和经典求解器持平10 秒
AIES(最好的经典基线)1.74比上面那个慢 50 倍以上
DPS(第 5 节那个朴素做法)跟不上经典求解器的精度

书的结论:加了仿真器的那一版不只是明显更准,还比最好的经典基线快约 35 倍。

这张表怎么读,三句话:

第一,加仿真器的收益是实的。 纯流匹配只和经典方法持平,加了仿真器才超过去—— 这就是第 4 节那个「拍平」的墙被推开的证据。

第二,代价小得出奇。 仿真器让推理从 10 秒涨到 19 秒,不到两倍; 而经典基线要五十倍以上的时间。

第三,朴素做法真的会输。 DPS 跟不上经典求解器—— 第 5 节那个「会扭曲分布采样」的担心不是纸上谈兵。

12. 这条路的账

书自己列的11:

✅ 好处❌ 代价
比纯靠学的做法精度更高需要一个可微的物理过程
给出对残差精度的控制(那个旋钮回来了)计算资源增加
比传统反问题求解器运行时更短

中间那一条是这一章真正的产出: 第 4 节说经典仿真有精度旋钮而网络没有,这一条就是「旋钮装回来了」。

13. 另一条路:把扩散时间和物理时间合并

结论先行:前面所有章节都把扩散时间当成一根和物理无关的虚拟轴。这一节反过来。

书的说法是:把扩散过程当成物理系统固有的一部分12这条路的名字叫 SMDP。

它的结构只有两个零件12:

概率流 = 一个近似的反向物理仿真器 + 一个修正网络
(把时间倒着推一步) (纠正近似误差,
并消解随机强迫带来的不确定性)

训练要网络满足的关系一句话: 「上一时刻的状态 ≈ 当前状态 + Δt ×(反向物理这一步 + 网络的修正)」12这和第 09 章那个「求解器推一步、网络给一个修正」是同一个形状——只是时间在倒着走。

书自己点出这项工作的中心发现,它把两条主线缝在了一起12:

用单步损失训练学到的修正项,等价于一个分数匹配目标; 而训练时递归地预测轨迹的更长一段,则关联到对应概率流的最大似然训练。

(「递归地预测更长一段」就是把网络自己的输出接回它自己的输入,一步接一步往下走—— 也就是第 09 章那个展开。)

读法:第 09 章那个「展开」和第 12 章那个「学分数」,在这里被证明是同一件事的两面。 单步 = 分数匹配;多步展开 = 最大似然。

推理时积分一个随机微分方程(带随机项的微分方程, 在这里就是「按物理和修正走一步,再撒一点噪声」); 把那个系数设成 1、并去掉噪声项,就得到概率流 ODE:一个唯一的、确定性的解13

⚠️ 关键的一句:这两种走法用的是同一组参数。 换句话说,训一次,推理时可以选择要不要随机。

14. 另起一处的走查(一):随机热方程上两个指标打架

另起一处的走查(和主走查那个引力透镜不是同一个任务): 随机热方程——热扩散,再叠一份时空白噪声。 扩散系数固定为 1,分辨率 32 × 32,初始条件从高斯随机场里抽, 从 t = 0 仿真到 t = 0.2,噪声强度固定为 0.114要解的:给一个末状态,恢复一个可能的初始状态。

一个很聪明的实现细节:反向物理那一步直接把正向步取负就当它用14为什么不能直接拿正向求解器倒着推:噪声带来的高频会被放大, 得到物理上不合理的解。

结果——两个指标打架15:

推理方式重建误差谱误差
确定性那一种(去掉噪声项)最好——解太平滑,缺了必要的小尺度结构
随机那一种(带噪声项)略差很好,视觉上令人信服

「谱误差」得当场讲清,它是这一节的要害: 把一个场按「粗结构」和「细结构」分开看,统计各个尺度上分别有多少能量, 这条曲线叫功率谱;拿它和真值比,差多少就是谱误差。 重建误差问的是「整体像不像」,谱误差问的是「细节该有多少有没有多少」。

书给的解释是这一节最该带走的一句15:

这凸显了噪声在扩散推理过程中作为熵源的角色—— 它对合成小尺度结构是必需的。

(「熵」在这里就是「随机性的量」;「熵源」就是随机性的来源。)

「熵源」在这里的意思很具体:细节不可能从一个确定的计算里凭空长出来。 真值里那些小涡、小波纹,在末状态里已经被抹掉了,信息不在了; 要把它们摆回去,只能靠一个随机源去「生成一份合理的」。 去掉随机项,你得到的就是所有可能细节的平均——也就是没有细节。

⚠️ 这正是第 01 章那盆冷水在另一个层面上的样子: 平均掉多个合法答案,得到一个过于平滑、现实里不存在的东西。

书还补了一句:那两个指标之间存在天然的权衡,而两种走法用的是同一组参数15所以这不是「哪个方法更好」,是「你要哪一头」。

15. 另起一处的走查(二):玩具实现里的两处诚实观察

另起一处的走查(第二处,和上面那个随机热方程不是同一个系统): 一个二次衰减的玩具轨迹。 轨迹从 +1 或 −1 出发(两者等概率), 随时间趋近 0;控制它的方程带两个系数,7 和 0.0316这个玩具的好处:真值只有两支,一眼能看出网络有没有把两支都抓住。

训练分两段17: ① 单步损失(窗口大小 2),2500 轮,学习率 1e-3,10 分 23 秒,损失 0.0232; ② 学习率降到 1e-4、不再抽稀训练数据,再 1000 步,20 分 41 秒,损失 0.0160

第一处诚实观察,书自己写的17:

有些部分,尤其是靠近结束时刻的地方,会出现符号翻转、内容基本随机。 这是因为网络主要是在它在训练数据里见过的样本附近被训练的。 离得远的地方,它「没学过」怎么把样本正确地变成可接受的样本。

这一条值得记:学出来的场只在数据附近可信,远处是无人区。 这和第 05 章那条「你总拿 0 到 1 之间的输入训练它,就别指望它在 27 到 39 上还能用」是同一条规律。

第二处观察是两种推理的对照18:

推理方式轨迹长什么样
反向随机微分方程初期有噪声运动,然后可靠地收敛到 +1 和 −1
概率流 ODE基本是水平的运动,在两个端点处分岔

书还说了一句实用的:如果降低精度或者缩短训练, 那个学到的场会含有错误区域,粒子会在到达终点之前飞出去18

16. 展开长度是怎么调上去的

这是全书唯一一处讲「怎么把展开步数加长」的地方,而它藏在代码参数里19

做法叫滑动窗口:沿着训练轨迹滑一个固定大小的窗口,重建当前这个窗口里的那一段; 梯度在窗口内所有预测步上累积、一起反传。

关键在于窗口大小不是定死的:

从 4 步起步,每隔若干轮加 2 步,一共加 18 次。 算出来:最终的窗口是 4 + 2 × 18 = 40 步。

这个数为什么重要:第 15 章会给出一条分水岭——展开 4 步以内一致地拿不到稳定的结果, 8 步以上才够。而「怎么从 4 步走到 8 步以上」的答案就在这里:渐进地加,不是一上来就设大。

⚠️ 但这一章的玩具例子实际跑的时候把「加 18 次」关掉了(设成 0), 书说打开它并配合更多迭代会看到进一步的改善,但没有给那次运行的数19

17. 全章的经验法则

书在这一部分收尾时给了一条二选一的判据,值得原样记住20:

只有当解是一个「用均值表示不好」的分布时,才该用扩散那一套。 如果均值可以接受,「常规」的神经网络在训练和推理的复杂度上有实质优势。

书还给了一句定位,它把这一章接回了全书前半20:

这种把物理纳进来的方式,基本上和讲可微物理那一部分是一回事—— 物理求解器的梯度是中心量,而展开这样的概念也起着重要作用。

所以这一章不是新东西,是第 08 到 10 章那把刀被拿到了新场地上。 变的只有一件事:梯度被用在推理时,而不是训练时。

18. 主走查合起来看

发生了什么具体的数
1任务强引力透镜的反问题:从多重像反推中间星系的引力分布
2为什么值得传统方法建模一个系统要几分钟到几天
3指标χ²,越小越好;理论下限 1.17(观测噪声决定)
4前八成行程直接用预训练的流,不控制
5t ≥ 0.8 之后每一步一步预测擦干净 → 送进仿真器 → 拿代价和梯度当控制信号
6控制网络只有主网络约一成参数;主网络冻结
7结果流匹配+仿真器 χ² 1.48;经典最好 1.74;纯流匹配只持平
8推理耗时10 秒 → 19 秒(加仿真器不到两倍);经典基线慢 50 倍以上
9综合既更准,又快约 35 倍
10朴素做法DPS 跟不上经典求解器的精度

每个数都是书里给的(逐条见脚注); 「不到两倍」这个比较是我们算的。

19. 作者的判断与证据

书里给了证据的:

说法证据
加仿真器比纯学的更准χ² 1.48 对 1.74 对下限 1.17,外加纯流匹配「只是持平」10
比经典基线快19 秒 对「50 倍以上」,综合约 35 倍10
朴素做法不够DPS 跟不上经典求解器的精度10
噪声是合成细节的必需品随机热方程上两个指标的反向表现,同一组参数15
学到的场在数据之外不可信玩具例子末端的符号翻转17

作者的判断:

说法为什么算判断
「在训练时加物理先验几乎没有希望大幅改进精度」没有做这个对照实验,是一条论证2
「t ≥ 0.8 是一个好阈值」没有给阈值的扫描,只说「实践中」7
「理论性质被保住了」一段结构性论证,没有证明8
「这种纳入方式基本和可微物理那一部分是一回事」一句定位,不是实验结论20
书里所有被打败的对照,包括这套方法本身,都出自同一个组这一条全书通用,总纲第 1 节已经点明

判断(我们的,不是书里的): 这一章最该被带走的不是那个 1.48, 是第 4 节那个「拍平」的诊断。 它给了一条可以拿去用的判据:当你发现「加更多推理步数不再让结果更好」时, 你撞到的是模型能力的天花板,而不是采样不够—— 这时候唯一能继续往下压的,是一个模型之外的、自带精度旋钮的过程。 如果错,会错在: 如果那个平台其实是采样算法或者积分器造成的 (比如步长策略太粗),那么换积分方法就能继续下降,不必请外部过程进来。 判据是:换一种更精细的积分方式,那条曲线还是平的吗? 书没有做这个排除。

20. 边界与局限

  • 主走查那个引力透镜,书没有给任何实现细节。 网络规模、训练数据量、 仿真器是什么,全书都没写;书自己说源码「不久之后会放出来」10;
  • t ≥ 0.8 这个阈值没有扫描过。 0.6 或者 0.9 会怎样,没有数据;
  • 控制网络「约一成参数」也只有这一个数,没有讨论一成是不是最优;
  • 学习式那种控制信号(仿真器不可微时)全书没有跑过例子,只有定义;
  • SMDP 那条路只在两个很小的系统上跑过(32×32 的热方程、一维玩具), 书提到还有一个反向 Navier-Stokes 的案例,但没有放进正文15;
  • 滑动窗口那个「加 18 次」在书跑的那次里被关掉了, 所以「渐进加长展开」这件事在这一章没有对照数据19;
  • 两个指标打架那件事书没有给一个综合判据。 什么时候该选确定性、 什么时候该选随机,只有「看你要哪一头」;
  • 整章没有讨论控制信号本身的误差。 仿真器自己也有离散化误差, 它进入控制信号之后会怎样,书没有分析。

21. 可带走的

  1. 第 13 章那两个成品缺的不是精度,是反馈回路: 训练时网络、观测和仿真器之间没有连线;
  2. 科学应用要的是「误差能压到指定阈值以下」,而纯靠学的网络给不出这句话;
  3. 书的裁决反直觉:物理约束加在使用时,不是训练时。 因为训练阶段的精度限制来自网络规模和数据规模,那不是能撬动的;
  4. 「拍平」是这一章的核心诊断: 加步数只降到「模型能力给定的那个精度」就不动了, 要继续往下压只能靠一个外部过程;
  5. 经典仿真自带精度旋钮,网络没有。 这就是把仿真器请回来的理由;
  6. 最朴素的做法会扭曲分布采样,最坏把后验里不同的点全拉向仿真器偏爱的那一支 ——那等于把第 01 章那盆冷水又倒了一遍;
  7. 正确的做法是加第二个网络接收反馈,参数只有一成,主网络可以冻结;
  8. 先擦干净再问仿真器: 用一步预测外推出「网络认为的干净样本」, 别拿带噪的样本去算仿真梯度;
  9. 控制只在最后两成行程里启用(t ≥ 0.8),前面八成是原味流匹配;
  10. 近似出现在输入里,和出现在损失里,是两件事。 前者保住了原来的理论性质,后者没有;
  11. 成绩:χ² 1.48 对经典最好的 1.74(理论下限 1.17),而且快约 35 倍; 加仿真器让推理从 10 秒到 19 秒,不到两倍;
  12. 另一条路是把扩散时间和物理时间合并: 一个近似的反向物理仿真器 + 一个修正网络; 单步损失等价于分数匹配,多步展开关联到最大似然;
  13. 噪声是熵源,不是脏东西。 去掉它重建误差最好,但解太平滑、缺小尺度结构;
  14. 展开长度可以渐进地加(从 4 步起、每隔若干轮 +2),这是全书唯一一处讲怎么加;
  15. 经验法则:只有当解是一个「用均值表示不好」的分布时,才该用扩散那一套。

22. 原文地图

主题原书章原文位置
没有反馈回路、要压到任意阈值27 Incorporating Physical Constraintstext/14-p261-280.txt:324(搜「no direct feedback loop」)
训练时用 vs 推理时用、「拍平」27.1text/14-p261-280.txt:351(搜「limited in terms of their accuracy by model and training data」) · text/14-p261-280.txt:358(搜「plateau at a level of accuracy」)
朴素做法与两个挑战27.1 同上text/14-p261-280.txt:366(搜「diffusion posterior sampling」) · text/14-p261-280.txt:372(搜「pull the different points of the posterior」)
两阶段与控制网络的规模27.2 Physics-Guided Flow Matchingtext/14-p261-280.txt:394(搜「control network」) · text/14-p261-280.txt:398(搜「10% of the weights」)
一步预测、仿真器不喜欢噪输入27.2 同上text/14-p261-280.txt:413(搜「really don」) · text/14-p261-280.txt:429(搜「less curvature」)
两种控制信号27.2.1 Physics-based Controlstext/14-p261-280.txt:437(搜「gradient-based control」) · text/14-p261-280.txt:454(搜「learnable encoder network」)
t ≥ 0.8 这个阈值27.2 同上text/14-p261-280.txt:475(搜「is a good threshold」)
理论性质被保住27.2 同上text/14-p261-280.txt:481(搜「theoretical properties」)
强引力透镜是什么、传统方法要多久27.2.3text/14-p261-280.txt:488(搜「strong gravitational lensing」) · text/14-p261-280.txt:491(搜「several minutes to many hours」)
χ² 1.48 / 1.74 / 1.17、耗时、DPS27.2.3 同上text/14-p261-280.txt:500(搜「AIES with an average」) · text/14-p261-280.txt:503(搜「10s」) · text/14-p261-280.txt:505(搜「problems of 」)
这条路的账27.2.3 同上text/14-p261-280.txt:518(搜「Improved accuracy over purely learned」)
SMDP:合并两个时间、中心发现27.3 Score Matching with Differentiable Physicstext/14-p261-280.txt:529(搜「merging the」) · text/14-p261-280.txt:535(搜「single-step loss is equivalent to a」)
结构、滑动窗口、推理的 SDE 与 ODE27.3.1text/14-p261-280.txt:547(搜「approximate reverse physics simulator」) · text/14-p261-280.txt:567(搜「Euler-Maruyama」)
随机热方程的设置与反向物理怎么实现27.3.2 SMDP in Actiontext/14-p261-280.txt:577(搜「stochastic heat equation」) · text/14-p261-280.txt:582(搜「high frequencies due to noise are amplified」)
两个指标打架、噪声是熵源27.3.2 同上text/14-p261-280.txt:603(搜「ODE inference performs best」) · text/14-p261-280.txt:607(搜「source of entropy」)
经验法则、和可微物理是一回事27.4 Summarytext/14-p261-280.txt:617(搜「largely in line with」) · text/14-p261-280.txt:622(搜「rule of thumb」)
玩具问题的设置28.1 Toy Problem setuptext/14-p261-280.txt:647(搜「quadratically decaying trajectories」) · text/14-p261-280.txt:656(搜「categorical distribution」)
滑动窗口的三个参数28.6 Training and Sliding Window Methodtext/15-p281-300.txt:310(搜「ROLLOUT_start」) · text/15-p281-300.txt:317(搜「ROLLOUT_add = 2」)
两段训练的日志28.6.1text/15-p281-300.txt:423(搜「loss: 0.02322」) · text/15-p281-300.txt:456(搜「loss: 0.01599」)
末端符号翻转那处观察28.6.1 同上text/15-p281-300.txt:429(搜「sign changes and mostly random content」)
加长展开被关掉了28.6.1 同上text/15-p281-300.txt:459(搜「ROLLOUT_increases=0」)
两种推理的轨迹对照28.7 Sampling SDE and ODE trajectoriestext/15-p281-300.txt:546(搜「noisy motions during the initial phase」) · text/15-p281-300.txt:618(搜「bifurcation towards the two end points」)

Footnotes

  1. 出处:第 27 章开头(p.257)第 324 段 (text/14-p261-280.txt:324,搜「no direct feedback loop」)。 原文接着说,这意味着没有直接的机制去纳入 PDE 先验这样的基于物理的约束。

  2. 出处:第 27.1 节(p.258–259)第 351 段 (text/14-p261-280.txt:351,搜「limited in terms of their accuracy by model and training data」) 与第 358 段(text/14-p261-280.txt:358,搜「plateau at a level of accuracy」)。 「精度旋钮」那一段的原文用的词是 control knobs (text/14-p261-280.txt:354,搜「control knobs」)。 2 3 4 5

  3. 出处:第 27.1 节(p.259)第 366 段 (text/14-p261-280.txt:366,搜「diffusion posterior sampling」) 与第 372 段(text/14-p261-280.txt:372,搜「pull the different points of the posterior」)。 书给这个做法的引文编号是 [CKM+23]。 2

  4. 出处:第 27.2 节 Physics-Guided Flow Matching(p.260)第 394 段 (text/14-p261-280.txt:394,搜「control network」) 与第 398 段(text/14-p261-280.txt:398,搜「10% of the weights」)。 书给这条路线的引文编号是 [HT23]。 2

  5. 出处:第 27.2 节(p.261)第 413 段(text/14-p261-280.txt:413,搜「really don」) 与第 429 段(text/14-p261-280.txt:429,搜「less curvature」)。 一步预测的式子是「当前样本 + (1 − t) × 当前速度」 (text/14-p261-280.txt:415,搜「extrapolating」)。 2 3

  6. 出处:第 27.2.1 节 Physics-based Controls(p.261–262)第 437 段 (text/14-p261-280.txt:437,搜「gradient-based control」) 与第 454 段(text/14-p261-280.txt:454,搜「learnable encoder network」)。 原文明说学习式那一种里,梯度反传在仿真器输出处被截断。 2

  7. 出处:第 27.2 节(p.262)第 475 段(text/14-p261-280.txt:475,搜「is a good threshold」)。 原文:只在这个区间训练控制网络;t < 0.8 时直接输出预训练的流。 2

  8. 出处:第 27.2 节(p.262)第 481 段(text/14-p261-280.txt:481,搜「theoretical properties」)。 书拿来对照的是「基于似然的引导」——那种做法在推理时用一个近似当引导项, 不在原始流匹配理论的覆盖范围内。 2

  9. 出处:第 27.2.3 节(p.263)第 488 段 (text/14-p261-280.txt:488,搜「strong gravitational lensing」) 与第 491 段(text/14-p261-280.txt:491,搜「several minutes to many hours」)。 2

  10. 出处:第 27.2.3 节(p.263)第 500 段(text/14-p261-280.txt:500,搜「AIES with an average」)、 第 503 段(text/14-p261-280.txt:503,搜「10s」) 与第 505 段(text/14-p261-280.txt:505,搜「problems of 」)。 原文说这些经典基线属于马尔可夫链蒙特卡洛那一类 (text/14-p261-280.txt:494,搜「MCMC-based methods」); χ² 是「模型给出的像和实际观测差多远」的标准量、下限由观测噪声决定, 这个解释是我们补的(补充,不在书里,来自通用知识)。 ⚠️ 书说这套做法的源码「不久之后」会放出来,正文里没有给任何实现细节。 2 3 4 5 6

  11. 出处:第 27.2.3 节(p.263–264)第 518 段 (text/14-p261-280.txt:518,搜「Improved accuracy over purely learned」)。

  12. 出处:第 27.3 节 Score Matching with Differentiable Physics(p.264)第 529 段 (text/14-p261-280.txt:529,搜「merging the」)、 第 535 段(text/14-p261-280.txt:535,搜「single-step loss is equivalent to a」) 与第 27.3.1 节(p.265)第 547 段 (text/14-p261-280.txt:547,搜「approximate reverse physics simulator」)。 书给这条路线的引文编号是 [HVT23],方法名是 SMDP。 2 3 4

  13. 出处:第 27.3.1 节(p.265)第 567 段(text/14-p261-280.txt:567,搜「Euler-Maruyama」) 与第 570 段(text/14-p261-280.txt:570,搜「probability flow ODE」)。 「随机微分方程就是带随机项的微分方程」这个解释是我们补的 (补充,不在书里,来自通用知识)。

  14. 出处:第 27.3.2 节 SMDP in Action(p.265)第 577 段 (text/14-p261-280.txt:577,搜「stochastic heat equation」) 与第 582 段(text/14-p261-280.txt:582,搜「high frequencies due to noise are amplified」)。 反向物理那一步直接把正向步取负,见同段之后一行 (text/14-p261-280.txt:583,搜「reverse physics step」)。 2

  15. 出处:第 27.3.2 节(p.266)第 603 段 (text/14-p261-280.txt:603,搜「ODE inference performs best」) 与第 607 段(text/14-p261-280.txt:607,搜「source of entropy」)。 原文明说两种走法用的是同一组权重,而且两个指标之间存在天然的权衡; 同一段末尾提到 SMDP 的代码仓里还有一个反向 Navier-Stokes 的案例,正文没有展开。 「谱误差 = 拿功率谱和真值比」这个解释是我们补的 (补充,不在书里,来自通用知识);书给的是「power spectral density」这个名字。 2 3 4 5

  16. 出处:第 28.1 节 Toy Problem setup(p.269)第 647 段 (text/14-p261-280.txt:647,搜「quadratically decaying trajectories」) 与第 656 段(text/14-p261-280.txt:656,搜「categorical distribution」)。 两个系数在书里写作 λ₁ = 7、λ₂ = 0.03。

  17. 出处:第 28.6.1 节(p.278–280)第 423 段 (text/15-p281-300.txt:423,搜「loss: 0.02322」)、 第 429 段(text/15-p281-300.txt:429,搜「sign changes and mostly random content」) 与第 456 段(text/15-p281-300.txt:456,搜「loss: 0.01599」)。 第二段训练把学习率降到 1e-4、并取消了对训练数据的抽稀。 2 3

  18. 出处:第 28.7 节(p.283)第 546 段 (text/15-p281-300.txt:546,搜「noisy motions during the initial phase」) 与第 28.7.2 节(p.285)第 618 段 (text/15-p281-300.txt:618,搜「bifurcation towards the two end points」)。 2

  19. 出处:第 28.6 节 Training and Sliding Window Method(p.277)第 310 段 (text/15-p281-300.txt:310,搜「ROLLOUT_start」) 与第 317 段(text/15-p281-300.txt:317,搜「ROLLOUT_add = 2」)。 默认参数是起始窗口 4、每次加 2、加 18 次; ⚠️ 书跑的那一次把加长关掉了(text/15-p281-300.txt:459,搜「ROLLOUT_increases=0」), 并说打开它会看到进一步的改善,但没有给数。 「4 + 2 × 18 = 40」是我们算的。 2 3

  20. 出处:第 27.4 节 Summary of Physics-based Diffusion Models(p.267)第 617 段 (text/14-p261-280.txt:617,搜「largely in line with」) 与第 622 段(text/14-p261-280.txt:622,搜「rule of thumb」)。 原文那条经验法则是:只有当解是一个用均值表示不好的分布时才该用扩散那一套; 均值可以接受的话,常规网络在训练和推理的复杂度上有实质优势。 2 3