跳到主要内容

书没走的两条老路,以及它最后想说的话

1. 这一章讲什么

三件事: 两条书自己没走完的老路(在压缩空间里做仿真,以及不用网格的仿真); 一个被扩散取代、但仍然值得懂的做法(对抗生成)——因为它是扩散之前唯一能躲开平均的办法; 以及书最后想说的那句话。

它在全书链条里的位置:这是收尾,而它读起来会和前面十九章不一样。

⚠️ 先说清楚为什么不一样:这三个主题在原书里本来就只有散文、没有可执行的代码。 书自己说明:接下来几节会对这些主题做「较短的介绍」, 它们(目前)不配可执行的代码本,但仍会指向已有的开源实现1所以这一章的重点是判据(什么时候该用、什么时候不该),不是数字。

2. 顶层全景

三条书没走完的路,各自解决一个前面留下的具体麻烦

① 三维含时问题的规模: 空间 O(n³) × 时间 → O(n⁴),n 一大就爆


降阶模型:压到低维,在压缩空间里推进时间,再解回来
独有的那一条:编码器和解码器之间绝不能有连接
(和 U-Net 的 skip 恰恰相反)

② 材料在动、连接关系很快过时(比如泼出去的水)


无网格方法:不画网格,只看「半径 R 以内的邻居」
连续卷积:把单位球映到单位立方体 → 卷积核可以用一个简单网格表示
再加一个径向权重 → 影响平滑地降到零

③ 一张低分辨率的图,对应无穷多张合法的高分辨率图


对抗生成:不问「像不像那一张」,只问「像不像真的」
⟵ 这正是第 01 章那条抛物线在图像上的样子

这张图在讲什么: 三条路各自对着一个具体的麻烦,而第三条把全书的起点接回来了。

3. 降阶模型(一):它要解决的那个规模

结论先行:先看那个把人逼到墙角的数。

书给的账只有两步2: 一个三维问题,沿每个轴切 n 份,空间上就有 n³ 个采样点; 含时的现象还要沿时间切,而时间的切分通常和空间同步—— 合起来是 n 的四次方量级。

「n 一大就爆」这句话在这里是字面意思:n 翻一倍,工作量是十六倍。 而书说,对所有实际的高保真应用,我们都希望 n 尽可能大。

降阶模型的主意:别在那个大空间里推进时间,压到一个小得多的空间里推2:

一整个场(n³ 个数)──编码器──▶ 几十个数

在这个小空间里推进时间

一整个场(下一时刻)◀──解码器── 几十个数(下一时刻)

书自己列了这条路成立的两个条件2:

条件具体是什么
压缩后的维度要够大大到能捕捉解流形里所有重要的结构
在小空间里推进时间要够快快到能抵消掉多出来的编码和解码两步

第 16 章已经讲过压缩这件事怎么做(自编码器),也讲过那个小空间叫潜空间。 这一节不重复,只补降阶模型独有的那一条——在下一节。

4. 降阶模型(二):编解码之间绝不能有捷径

结论先行:这是这一节唯一的新东西,而它和你在第 04 章学的那条经验恰好相反。

第 04 章讲 U-Net 时有一条:加一条 skip 连接,把编码那一侧的细节直接搭到解码那一侧, 免得细节在瓶颈处被挤没。那是好设计。

在降阶模型里,这条恰恰是禁令。书的话3:

所有自编码器架构的一个关键性质是:编码器和解码器之间不能存在任何连接。 网络必须对编解码可分离。 这很自然——任何共享的连接或信息,都会阻止单独使用编码器或者解码器。 比如说,解码器必须能够纯粹从潜空间里的一个点,解出一个完整的状态。

为什么这条禁令在这里是命门:因为降阶模型的整个用法就是「拆开用」。 编码器只在开头用一次,解码器只在末尾用一次,中间那一长串时间推进 根本不知道编码器长什么样。 只要有一条捷径,那一串推进就少了一半信息,解不出完整的状态。

判断(我们的,不是书里的): 这一条给了一条可以直接拿去用的判据—— 「要不要加 skip 连接」不取决于精度,取决于这两半将来会不会被分开用。 一次前向就出结果的任务(第 05 章那个翼型),加; 两半要在不同时间、不同地方各自被调用的任务,不能加。 如果错,会错在: 如果你的架构能把 skip 上传的那份信息也压进潜空间里 (比如让 skip 只搭在编码器内部),那么「有 skip」和「可分离」就不矛盾了。 判据是:解码器运行的时候,它需要的每一个数都在那几十个数里吗?

书顺带提了一个变体:在潜空间上再加一个损失项,把它塑造成一个已知的分布, 这样就能直接在潜空间里抽样4但书对它在仿真里的价值给了一个明确的判断: 这对构造人脸这类自然图像的生成模型非常有用,在仿真设定里没那么关键—— 这里我们要的是一个便于时间预测的潜空间,而不是便于抽样的。

5. 降阶模型(三):在潜空间里预测时间,老问题又回来了

结论先行:第 09 章那条规矩在这里原样再出现一次。

目标只有一句话:给一个(或几个)之前的潜空间状态,算出下一个5

但书立刻点出这天然是一个递归的任务:第 i 步是把那个预测网络求值 i 次的结果。 于是那句熟悉的话又来了5:

因为每次求值有固有的误差,通常必须为多于一步的过程训练, 好让预测网络「看见」它在潜空间状态上随时间产生的漂移。

这就是第 09 章那个展开,换了个舞台。 书还说:理想情况下,端到端训练时还要沿时间展开来稳住演化; 训练会显著更贵(要一次训更多权重、处理多得多的中间状态), 但增加的成本通常能靠降低的整体推断误差回本6

还有一条很实际的限制,它决定了潜空间该多大5:

潜空间向量没有空间结构,通常只是一堆看似随机的值。 所以这些预测网络总是用全连接层——而全连接层的参数量增长很快, 因此需要一个相对小的潜空间维度。

读法:第 04 章那把「一个点的变化会牵动多远」的尺子,在潜空间里失效了。 因为潜空间里的相邻两个数之间没有「相邻」这回事,卷积的前提不成立。

6. 无网格方法:材料在动的时候,网格是负担

结论先行:换表示法的理由不是精度,是「连接关系会过时」。

书先把三类离散表示排开7:

类型特点深度学习支持得怎样
结构化网格采样点规则排列,谁和谁相邻是隐含的目前支持最好(和图像数据相似)
非结构网格排列和连接可以任意灵活,但计算成本更高
无网格 / 粒子采样点任意排列,连接靠「谁离我近」现算——

书给的选型判据一句话7: 结构化网格因为像图像所以最省事; 但对「光滑区域和复杂区域不均匀混合」的目标函数,另外两类更好。

而无网格那一类的适用场景,书说得非常具体8:

在动态的情形下——比如运动材料的拉格朗日表示,连接关系很快就过时—— 依赖灵活的、重新计算的连接关系的方法是好选择。

「拉格朗日表示」得当场讲清,它是这一节的前提: 前面十九章的做法都是「格子固定在空间里,看物质从格子上流过去」; 拉格朗日反过来——采样点跟着物质一起走。 水泼出去,采样点就跟着水飞出去。 这时候「谁和谁相邻」每一步都在变,画一张网格再维护它,代价高得离谱。

书还顺带解释了为什么这里不选图网络9: 非结构网格和图网络有许多共同性质,但图网络通常给实现带来相当多的额外复杂度—— 任意的连接关系要求在节点之间传消息,而消息传递通常用全连接层实现,不是卷积。

7. 连续卷积:怎么在「一堆点」上做卷积

结论先行:两个零件,各解决一个具体的麻烦。

问题:卷积本来是在规则网格上定义的——核里的每个位置对着一个格子。 一堆位置任意的点上,「核里的第几个位置」根本对不上。

做法是把卷积改成「在半径 R 的球形邻域里求值」10但这样一来,核里的未知量该怎么存?

零件一:一个把单位球映到单位立方体的映射。 书说这个映射「起着中心作用」—— 它让我们能用一个简单的网格来表示卷积核里的未知量, 大大简化了卷积核的构造和处理10

读法:球里的一个方向,被这个映射搬到立方体里的一个位置; 而立方体可以照常切成规则的小格子。 于是「核里的未知量」又变回了一个规则的小数组——和普通卷积一样存、一样训。

零件二:一个径向的权重函数11它按「离中心多远」给每个邻居一个权重,越远越小,到半径 R 处正好降到零。 书给的理由一句话:这确保学到的影响对每个卷积都平滑地降到零。

为什么需要它:粒子在动,一个邻居随时可能跨出或跨进那个半径。 没有这个权重,它一跨出去贡献就从「有」跳到「无」,结果会抖。

还有一个为了精简架构的小设计11: 给每个卷积额外配一个小的全连接层,专门处理目标粒子自身的内容; 这使得能用相对小的偶数尺寸核,比如 4×4×4。

效果书给了定性的对照12: 用一个基于粒子的 Navier-Stokes 求解器的随机参考数据训练, 得到的网络用一个非常小而高效的模型就有好精度; 和基于图网络的做法相比,连续卷积需要的权重显著更少,求值也更快。

8. 主走查:一容器晃动的液体最终静止下来

⚠️ 这个贯穿场景是我们的编排——书没有把这几节串在同一个例子上; 但那个失败案例本身是书里的。

主走查第 1 步(场景): 一个容器里的液体被晃了一下,来回泼,最终应该静止下来。

主走查第 2 步(用降阶模型怎么做):编码器把每一帧那一整个场压成几十个数; ② 在这几十个数上推进时间——用一个只吃这几十个数的全连接网络; ③ 解码器把结果还原成一整个场。 ⚠️ 第 ② 步必须为多于一步训练(否则漂移会累积); 而第 ①③ 两步之间不能有任何连接,否则第 ② 步跑不动。

主走查第 3 步(用无网格粒子法怎么做): ① 每个采样点跟着液体一起走; ② 每一步现算「半径 R 以内有哪些邻居」; ③ 对这些邻居做一次连续卷积:先用那个球到立方体的映射查到核里对应的位置, 再按径向权重加权,得到这个点的新的潜空间内容; ④ 反复几层,最后输出比如一个加速度; ⑤ 按这个加速度把每个点挪一挪,进入下一步。

主走查第 4 步(它为什么恰恰是最容易失败的 case): 书自己点名说,这是一个「特别难」的情形,理由有两条**13: ① 训练数据里这类样本少——除非专门去造; ② 一次仿真通常要很多步才静止,远多于训练时展开的步数。 所以网络根本没有被显式训练去再现这种行为。

这一条的分量:它是全书那条「展开步数是分水岭」的规矩在反面的一次现身。 第 15 章说展开 8 步就够稳,那是对周期性的流动; 而「静止」是一个要走上千步才到达的终态,展开多少步都覆盖不到。

主走查第 5 步(一个意外的好处): 书说,有一个训练好的网络来做这样的液体仿真,本身就构造性地提供了一个可微求解器14于是可以拿它去做优化——比如反过来求「黏性该是多少」。 读法:第 08 章要费很大劲才拿到的那件东西(一个能交出梯度的仿真器), 在这里是白送的——因为网络天生可微。

9. 对抗生成:它到底是为了解决什么

结论先行:这一节不是历史回顾,它是第 01 章那条抛物线的另一张脸。

书对这个做法的定位15: 虽然它在研究中已经被扩散那一套大量取代,但它用的是一个非常有意思的做法。

先讲那个做法。它的结构只有两个网络16:

网络干什么
生成器接收一个随机向量,产生想要的输出(结构上通常像自编码器的后半截)
判别器做一个分类任务:把生成的样本和「真」样本区分开

关键的一步是:不直接训练生成器,而是拿第二个网络当生成器的损失。

训练怎么走16: 通常交替进行——先给判别器走一步,再给生成器走一步。 给生成器走的时候判别器保持不变,由它提供梯度, 「引导」生成器朝着「产生和真样本无法区分的东西」的方向走。 书补了一句关键的:因为判别器本身也是神经网络,它构造上可微,能提供所需的梯度。

然后是这一节真正的题眼,书自己用一整节讲的17:

对抗生成的主要优势之一,是它能防止对有歧义的数据做出不理想的平均。

书举的例子是超分辨率: 一张低分辨率的图当输入,通常有无穷多张合法的高分辨率图能对上它。

接下来那句和第 01 章一字不差地对应17:

如果数据集里包含多个这样的情形,而我们用监督训练,网络会可靠地学到那个均值。 这个平均出来的解通常明显是不想要的,而且和它由之算出来的任何一个单独的解都不像。 这就是多模态问题。

⚠️ 书自己在这里回指了开篇那个例子:它说对流体来说,这种情况在分岔时就会发生。

判别器为什么能躲开这件事,一句话说得清: 它不问「像不像那一张标准答案」,它只问「像不像真的」。 于是网络挑其中任何一支都能得满分——它就没有理由去输出中间值了。

这正是第 01 章那个「换损失」的思路在图像上的样子: 第 01 章把输出送回物理过程去检验,这里把输出送给另一个网络去检验。 两者的共同点是:检验的对象不是「那一个标准答案」。

10. 为什么难训,以及书对它的最终判断

难训的原因书讲得很直白18:

由于耦合的、交替的训练,对抗生成的训练在实践中以难伺候著称。 我们现在不再是一个单一的非线性优化问题,而是两个耦合的问题, 我们需要为它们找到一个脆弱的平衡。 否则我们会遇到可怕的模态坍缩问题: 一旦两个网络之一「坍缩」到一个平凡解,耦合的训练就崩了。

书给的缓解办法有两条18: 给生成器加一个系数很小的、相对参考数据的正则项; 以及先用监督的方式预训练生成器,让它从一个稳定的状态出发。 (⚠️ 书补了一句:那样的话判别器通常也需要一定量的预训练来保持平衡。)

然后是书对它的最终判断。它分四层,一层一层来19:

第一层是替对抗生成说的一句公道话:判别器说到底只是一个「学出来的损失函数」。 生成器训完之后,推理时可以把判别器整个丢掉—— 所以它训练时吃掉多少资源,其实都不太要紧。

第二层是裁决。这一句是书自己的措辞,原样留着19:

「以目前的水平来看,当我们手上有一个像样的 PDE 模型时, 用对抗生成是否说得通是可疑的。」

第三层是理由:能把方程离散化、用可微物理把它包进训练里的话, 多半比「让判别器去近似那个 PDE 模型」更好。 因为可微物理给的是同一份好处——防止样本之间被平均掉(第 01 章那条抛物线)—— 而且它是直接从离散化的仿真器拿局部梯度,不用去近似任何东西。

第四层是书顺手堵掉的一条路:那两者叠加也不会比各自单用更好。 它留的口子只有一个 —— 求解器是个黑箱、根本给不出梯度、 因此可微物理压根做不了的时候,对抗生成仍然可能有吸引力19

这一段的结构值得学:它先承认对手的长处,再指出这个长处自己也有、而且拿得更直接, 最后留出对手仍然有效的那个场合。 而那个场合和第 17 章强化学习的适用场合是同一个:仿真器不可微的时候。

11. 结语:书最后想说的话

书的收尾有三句话,第一句它自己说得最紧,原样留着20:

「深度学习并不取代传统数值方法,而是增强它们。」

第二句是它认为最深刻、而全书自己没能触及的那一面: 做这一切的终极目标是加深人类对世界的理解; 而「神经网络是不可穿透的黑箱」这个说法,书判它已经过时了—— 它主张把网络当成又一件数值工具看, 一件只要用对了、就和传统仿真一样能讲清道理的工具20

第三句是它点名的那个最兴奋的挑战:把训好的网络分析透。 从网络学到的那些模式和结构里,提炼出人能读懂的洞见—— 书说可微仿真的未来不只是预测得更准,而是让物理世界里那些没被看见的秩序显出来20

三个被点名的具体方向21:

方向书给的理由
化学反应 PDE多物种相互作用导致复杂行为。特别令人兴奋的路子是:训练能快速预测实验或工业过程、并动态调整控制参数使之稳定的模型,以实现实时的智能控制
等离子体仿真和基于涡量的流体表述相似,但因电磁相互作用更复杂。对聚变实验和能源发生器,可微物理可能是改变游戏规则的
天气与气候建模人类最关键的科学挑战之一。高度复杂的多尺度系统。不只是为了更准的预报,而是为了解锁对我们星球动力学的更深洞见

12. 主走查合起来看

发生了什么具体的做法或判据
1场景一容器晃动的液体,最终应该静止下来
2降阶模型怎么做编码 → 在几十个数上推进时间 → 解码
3降阶模型的禁令编解码之间绝不能有连接(和 U-Net 的 skip 恰恰相反)
4降阶模型的老问题预测天然递归 → 照样必须为多于一步训练
5潜空间为什么必须小潜空间向量没有空间结构,只能用全连接层,参数量涨得快
6无网格怎么做采样点跟着液体走;每步现算「半径 R 内的邻居」
7连续卷积的两个零件单位球 → 单位立方体的映射(核可以用简单网格表示)+ 径向权重(影响平滑降到零)
8为什么这个场景最难训练数据里这类样本少;真正静止要走的步数远多于训练时展开的步数
9一个白送的好处训好的网络构造性地就是一个可微求解器,可以拿去优化黏性这类参数
10对抗生成在这里问什么不问「像不像那一桶水」,只问「像不像真的

⚠️ 这一章书没有给任何数值结果,所以这条走查上没有数字,只有做法和判据。

13. 作者的判断与证据

书里给了证据的:

说法证据
三维含时问题的规模是 n 的四次方量级一段直接的计数2
连续卷积比图网络省一句定性的对照——权重显著更少、求值更快12
「液体静止」这个 case 特别难两条具体的归因:样本少、需要的步数远超训练时的展开13
判别器能躲开平均一组超分辨率的对照图(输入 / 监督结果 / 对抗结果 / 高分辨率参考)17

作者的判断:

说法为什么算判断
「有可微物理时,它多半比用判别器近似 PDE 更好」没有做这个对照实验;而且书自己加了「以目前的水平来看」19
「两者的组合也注定不会更好」一个推断,不是实验结论19
变分那一版「在仿真设定里没那么关键」一句定位,没有对照4
「增加的训练成本通常能靠降低的推断误差回本」一句「通常」,没有给任何一次的账6
「神经网络是黑箱这个观念已经过时」立场,书没有给可解释性的具体方法20

判断(我们的,不是书里的): 这一章最该被带走的不是那三条老路本身, 是第 4 节那条禁令背后的通用判据:一个架构该不该加捷径,取决于它将来会不会被拆开用。 全书的架构讨论一直在问「精度够不够」,而这里第一次出现了另一个维度—— 可分离性。它和精度经常是冲突的。 如果错,会错在: 如果你的两半永远是一起被调用的 (比如一次前向就出结果),那这条判据不适用,该加就加。 判据是:这两半会在不同的时间点、被不同的代码调用吗?

14. 边界与局限

  • 整章没有一个数值结果。 书自己说明了这三个主题「不配可执行代码本」;
  • 降阶模型的潜空间维度该取多大,书只说「要够大又要够小」,没有给判据;
  • 连续卷积那个「球到立方体」的映射书没有给具体形式,只说它起中心作用;
  • 径向权重函数给了一个具体式子,但没有说为什么是这个形状,也没有对照;
  • 「比图网络省」只有定性说法,没有权重数、没有耗时;
  • 「液体静止」那个失败案例没有量化,也没有给尝试过的补救办法;
  • 对抗生成那一节的判断全部是定性的,而它被拿来和可微物理比的那个结论没有实验;
  • 结语里那句「和传统仿真同样可解释」,全书没有给任何可解释性的方法或例子—— 它是一个立场,不是一个结果;
  • 三个未来方向都只有一段话,没有已有工作的评述。

15. 可带走的

  1. 这一章的三个主题在原书里只有散文、没有代码,所以它给的是判据不是数字;
  2. 三维含时问题的规模是 n 的四次方量级:n 翻一倍,工作量十六倍;
  3. 降阶模型 = 压到低维 → 在低维里推进时间 → 解回来; 成立的两个条件是「压缩后够表达」和「低维推进够快」;
  4. 它独有的那一条禁令:编码器和解码器之间绝不能有任何连接—— 否则两半就没法拆开单独用,而「能单独用」正是它的全部意义;
  5. 这条禁令和 U-Net 的 skip 恰恰相反。 该不该加捷径,取决于两半会不会被分开用;
  6. 潜空间里的时间预测天然是递归的,所以照样必须为多于一步的过程训练;
  7. 潜空间向量没有空间结构,只能用全连接层——所以潜空间维度必须小;
  8. 换成无网格表示的理由不是精度,是「连接关系会过时」: 采样点跟着材料走的时候,谁和谁相邻每一步都在变;
  9. 连续卷积的两个零件: 一个把单位球映到单位立方体的映射(让核的未知量能用简单网格存), 一个径向权重(让影响在半径处平滑地降到零);
  10. 它比图网络省:权重显著更少,求值也更快;
  11. 「让水静止下来」恰恰是最容易失败的 case—— 训练数据里少,而且真正静止要走的步数远多于训练时展开的步数;
  12. 训好的粒子仿真网络本身就是一个可微求解器,可以反过来优化黏性这类输入参数;
  13. 判别器是一个学出来的损失:它不问「像不像那一张」,只问「像不像真的」;
  14. 这正是第 01 章那条抛物线在图像上的样子—— 一张低分辨率图对应无穷多张合法的高分辨率图,按平方误差训练必然学到均值;
  15. 它难训是因为两个耦合的优化问题要维持脆弱平衡,一旦一方坍缩就完了;
  16. 书的判断:有可微物理时,可微物理多半更好,两者组合也不会更好; 但黑箱求解器给不出梯度时,它仍然有吸引力;
  17. 结语:深度学习不取代传统数值方法而是增强它们; 「神经网络是不可穿透的黑箱」这个观念已经过时。

16. 原文地图

主题原书章原文位置
这几节只有散文、没有代码本43 Additional Topicstext/22-p421-440.txt:637(搜「shorter introduction」)
n 的四次方、两个条件44 Model Reduction and Time Seriestext/22-p421-440.txt:654(搜「large dimensionality」) · text/22-p421-440.txt:663(搜「captures all important structures」)
主成分分析构造上是线性的44.1 Reduced order modelstext/22-p421-440.txt:680(搜「principal」)
自编码器的定义与那条禁令44.1 同上text/22-p421-440.txt:685(搜「canonical NN for reduced models」) · text/22-p421-440.txt:699(搜「no connection between encoder and decoder」)
变分那一版在仿真里没那么关键44.1.1 Autoencoder variantstext/22-p421-440.txt:706(搜「variational autoencoders」) · text/22-p421-440.txt:713(搜「less crucial」)
时间预测天然递归、必须多步训练44.2 Time seriestext/22-p421-440.txt:726(搜「recurrent task」)
潜空间没有空间结构、只能全连接44.2 同上text/23-p441-460.txt:15(搜「do not exhibit any spatial structure」)
端到端训练更贵但能回本44.3 End-to-end trainingtext/23-p441-460.txt:32(搜「significantly more expensive」)
三类计算网格与选型判据45.1 Types of computational meshestext/23-p441-460.txt:64(搜「structured meshes」) · text/23-p441-460.txt:70(搜「well supported within DL algorithms」)
为什么不选图网络45.2 Unstructured meshes and graph neural networkstext/23-p441-460.txt:85(搜「additional complexity」)
连接关系会过时、无网格的适用场景45.3 Meshless and particle-based methodstext/23-p441-460.txt:94(搜「connectivity quickly becomes obsolete」)
球到立方体的映射45.4 Continuous convolutionstext/23-p441-460.txt:125(搜「unit ball to the unit cube」)
径向权重与那个小全连接层45.4 同上text/23-p441-460.txt:131(搜「radial weighting function」) · text/23-p441-460.txt:147(搜「lean architecture」)
比图网络省、液体静止那个失败案例45.5 Learning the dynamics of liquidstext/23-p441-460.txt:154(搜「significantly fewer weights」) · text/23-p441-460.txt:155(搜「container of liquid that should come to rest」)
训好的网络本身就是可微求解器45.5 同上text/23-p441-460.txt:159(搜「by construction provides a」)
「已被扩散取代,但做法很有意思」46 Generative Adversarial Networkstext/23-p441-460.txt:183(搜「replaced」)
生成器与判别器、交替训练46.2 Adversarial trainingtext/23-p441-460.txt:215(搜「second network that serves as loss」) · text/23-p441-460.txt:229(搜「this training is alternated」)
难训与模态坍缩、两条缓解办法46.3 Regularizationtext/23-p441-460.txt:235(搜「finicky in practice」) · text/23-p441-460.txt:239(搜「regularization is often crucial」)
它到底解决什么:躲开平均46.5 Ambiguous solutionstext/23-p441-460.txt:256(搜「prevent an undesirable averaging」) · text/23-p441-460.txt:259(搜「the network will reliably learn the mean」)
判别器只是学出来的损失、最终判断46.8 Discussiontext/23-p441-460.txt:295(搜「just」) · text/23-p441-460.txt:298(搜「questionable whether GANs make」) · text/23-p441-460.txt:306(搜「black-box solvers」)
结语47 Outlooktext/23-p441-460.txt:329(搜「doesn」) · text/23-p441-460.txt:332(搜「impenetrable」) · text/23-p441-460.txt:334(搜「analyze learned networks」)
三个具体方向47.1 Some specific directionstext/23-p441-460.txt:344(搜「Chemical Reaction PDEs」) · text/23-p441-460.txt:347(搜「Plasma Simulations」) · text/23-p441-460.txt:350(搜「Weather and Climate Modeling」)

Footnotes

  1. 出处:第 43 章 Additional Topics(p.427)第 637 段 (text/22-p421-440.txt:637,搜「shorter introduction」)。 原文列了这一部分要看的三件事:模型降阶与时间序列、生成式模型、 以及无网格方法与非结构网格。

  2. 出处:第 44 章开头(p.429)第 654 段 (text/22-p421-440.txt:654,搜「large dimensionality」) 与第 663 段(text/22-p421-440.txt:663,搜「captures all important structures」)。 「n 翻一倍工作量十六倍」是我们算的;书给的是那个量级本身。 2 3 4

  3. 出处:第 44.1 节 Reduced order models(p.429–430)第 699 段 (text/22-p421-440.txt:699,搜「no connection between encoder and decoder」)。 原文明说解码器必须能纯粹从潜空间里的一个点解出一个完整的状态。 ⚠️ 这一条和第 04 章那个 U-Net 的 skip 连接恰恰相反,书没有点这个对比,是我们加的。

  4. 出处:第 44.1.1 节 Autoencoder variants(p.430)第 706 段 (text/22-p421-440.txt:706,搜「variational autoencoders」) 与第 713 段(text/22-p421-440.txt:713,搜「less crucial」)。 原文:这对构造人脸这类自然图像的生成模型非常有用,但在仿真设定里没那么关键。 2

  5. 出处:第 44.2 节 Time series(p.430)第 726 段 (text/22-p421-440.txt:726,搜「recurrent task」) 与第 431 页第 15 段(text/23-p441-460.txt:15,搜「do not exhibit any spatial structure」)。 书还提了几种带记忆的网络家族的名字,以及一个来自经典动力系统文献的视角 (text/23-p441-460.txt:1,搜「Koopman operator」)—— 那一段我们不展开,因为它在这一章不承重。 2 3

  6. 出处:第 44.3 节 End-to-end training(p.431)第 32 段 (text/23-p441-460.txt:32,搜「significantly more expensive」)。 原文明说理想情况下这一步还要沿时间展开来稳住演化。 2

  7. 出处:第 45.1 节 Types of computational meshes(p.433)第 64 段 (text/23-p441-460.txt:64,搜「structured meshes」) 与第 70 段(text/23-p441-460.txt:70,搜「well supported within DL algorithms」)。 2

  8. 出处:第 45.3 节 Meshless and particle-based methods(p.433)第 94 段 (text/23-p441-460.txt:94,搜「connectivity quickly becomes obsolete」)。 「拉格朗日表示 = 采样点跟着物质走」这个解释是我们补的 (补充,不在书里,来自通用知识);书直接用了这个词。

  9. 出处:第 45.2 节(p.433)第 85 段 (text/23-p441-460.txt:85,搜「additional complexity」)。 原文明说消息传递通常用全连接层实现,而不是卷积。

  10. 出处:第 45.4 节 Continuous convolutions(p.434)第 118 段 (text/23-p441-460.txt:118,搜「radial neighborhood」) 与第 125 段(text/23-p441-460.txt:125,搜「unit ball to the unit cube」)。 ⚠️ 书没有给这个映射的具体形式,只说它「起着中心作用」。 2

  11. 出处:第 45.4 节(p.434)第 131 段 (text/23-p441-460.txt:131,搜「radial weighting function」) 与第 147 段(text/23-p441-460.txt:147,搜「lean architecture」)。 书给了那个权重函数的一个具体式子,但没有解释为什么是这个形状。 「没有这个权重,邻居一跨出半径贡献就从有跳到无」这个说明是我们补的 (补充,不在书里,来自通用知识)。 2

  12. 出处:第 45.5 节 Learning the dynamics of liquids(p.434–435)第 154 段 (text/23-p441-460.txt:154,搜「significantly fewer weights」)。 ⚠️ 这是一句定性的对照,书没有给权重数或耗时。 2

  13. 出处:第 45.5 节(p.435)第 155 段 (text/23-p441-460.txt:155,搜「container of liquid that should come to rest」)。 原文的两条归因是:训练数据里这类样本少; 而且一次仿真通常要很多步才静止,远多于训练时展开的步数。 2

  14. 出处:第 45.5 节(p.435)第 159 段 (text/23-p441-460.txt:159,搜「by construction provides a」)。 原文举的优化对象正是黏性这类输入参数。

  15. 出处:第 46 章开头(p.437)第 183 段(text/23-p441-460.txt:183,搜「replaced」)。

  16. 出处:第 46.2 节 Adversarial training(p.437–438)第 215 段 (text/23-p441-460.txt:215,搜「second network that serves as loss」) 与第 229 段(text/23-p441-460.txt:229,搜「this training is alternated」)。 书还把判别器的分类目标写成了一个标准的二分类交叉熵。 2

  17. 出处:第 46.5 节 Ambiguous solutions(p.438–439)第 256 段 (text/23-p441-460.txt:256,搜「prevent an undesirable averaging」) 与第 259 段(text/23-p441-460.txt:259,搜「the network will reliably learn the mean」)。 ⚠️ 书在这一段自己回指了开篇那个例子,说对流体来说这在分岔时就会发生。 配图是一组四联:输入 / 监督结果 / 对抗结果 / 高分辨率参考。 2 3

  18. 出处:第 46.3 节 Regularization(p.438)第 235 段 (text/23-p441-460.txt:235,搜「finicky in practice」) 与第 239 段(text/23-p441-460.txt:239,搜「regularization is often crucial」)。 2

  19. 出处:第 46.8 节 Discussion(p.440)第 295 段 (text/23-p441-460.txt:295,搜「just」)、 第 298 段(text/23-p441-460.txt:298,搜「questionable whether GANs make」) 与第 306 段(text/23-p441-460.txt:306,搜「black-box solvers」)。 原文那句判断带着「given the current state-of-the-art」这个限定,我们照实传达了。 2 3 4 5

  20. 出处:第 47 章 Outlook(p.445)第 329 段(text/23-p441-460.txt:329,搜「doesn」)、 第 332 段(text/23-p441-460.txt:332,搜「impenetrable」) 与第 334 段(text/23-p441-460.txt:334,搜「analyze learned networks」)。 2 3 4

  21. 出处:第 47.1 节 Some specific directions(p.445–446)第 344 段 (text/23-p441-460.txt:344,搜「Chemical Reaction PDEs」)、 第 347 段(text/23-p441-460.txt:347,搜「Plasma Simulations」) 与第 350 段(text/23-p441-460.txt:350,搜「Weather and Climate Modeling」)。 书自己的收尾是:这些只是几个例子,而未来几十年「肯定不会无聊」。