跳到主要内容

PINN 的账

1. 这一章讲什么

三件事: 第二档最有名的那一支到底是什么(它和前面所有网络都不一样, 它的输入是一个坐标,而网络本身就是那个解); 它在一个真实任务上跑出来什么(数字都在,而且不好看); 以及书为什么对它下了全书最重的一句判断——以及我们必须替读者补的那一句。

它在全书链条里的位置:这是第二档的另一半,也是全书的反面教材。 第 06 章走的是变体一(在事先定好的格子上算导数),这一章走变体二。 书用这一章为「必须把求解器整个搬进训练」这个结论清场。

这一章和第 08 章共用同一个任务。 这是书自己的对照实验,拆开讲会失去对比。

2. 顶层全景

前面所有的网络(第 04–06 章) 这一章的做法

输入: 一整个场(一张图) 输入: 一个坐标 (x, t) —— 两个数
│ │
▼ ▼
┌──────────┐ ┌──────────┐
│ 网络 │ │ 网络 │ 8 层 × 20 单元
└──────────┘ └──────────┘ 3021 个参数
│ │
▼ ▼
输出: 一整个场 输出: 那一个点上的解值(一个数)

网络是「从输入算输出的映射」 **网络本身就是那个解**

这张图在讲什么: 差别不在架构,在网络扮演的角色。 前面的网络是一台机器(给它一个场,还你一个场);这里的网络是一份答案—— 你想知道某个时刻某个位置的值,就去问它。

这一章的所有数字都是书里那次真实运行的输出。

3. 这个做法叫什么:PINN

结论先行:名字里的每一个字都指向一件具体的事。

先看它怎么工作。 你有一条方程和一些零散的观测,想求出整个时空区域上的解。 做法是:训一个全连接网络,让它接收一个时空坐标,吐出那一点的解值。 训练时随机撒一大把点,在每个点上算残差(第 06 章那个「代回方程看还成不成立」), 把残差压小1

训完之后,这个网络就是那个解。 想知道 t = 0.3、x = 0.7 处的值? 把这两个数喂进去,它给你一个数。你甚至可以问格子之间的位置—— 因为它是个连续函数,不是一张表2

这类做法叫 physics-informed(物理知情),训出来的网络叫 PINN (physics-informed neural network)。这个名字由 Raissi 等人在 2019 年推广开来1这三个字母你出门一定会撞见,所以必须留名。

它属于一个更大的家族:神经场(neural field)—— 用一个网络本身去表示一个空间上的量同族里还有两个你可能听过的名字:NeRF(用网络表示一个三维场景的样子), 以及学到的符号距离函数(用网络表示一个形状的边界在哪)3

现在给出那句书里最重的判断,它出现在第 5.2 节:

「PINN 经过多年研究仍然解决不了真实世界的问题,这指向了这条路线的根本性问题。」4

这是作者的判断,不是领域共识——这一点我们在第 10 节会展开,现在先把它原样放在这里。 书紧接着的建议是:考虑换成一种利用了离散化这种先验知识的做法, 这通常会显著提高推断精度、改善收敛4

书自己也划了 PINN 的适用范围,而且划得很死: 因为这个优化与学习问题的病态性(输入的微小变化会引起解的巨大变化, 或者解压根不唯一),加上重建成本很高,这类做法的解流形不该太复杂; 捕捉时间依赖、或者一大片解,通常非常困难——书直接举例说, 第 05 章那个翼型任务用这条路就做不了5

4. 导数从哪儿来:自动微分

先看一个绕不过去的问题。 要算残差,你得算解的导数—— 「这一点随时间变多快」「随位置变多快」「变化率本身又变多快」。

第 06 章那个变体一是怎么算的? 在格子上算:拿邻居的值做差(第 04 章那个 [1, −2, 1])。 可这一章根本没有格子。 网络是一个连续函数,你在哪儿都能问它, 那导数怎么办?

答案:直接对网络本身求导。

深度学习框架本来就有这个能力,而且它是训练能成立的前提。 第 01 章说过,训练要算「每个参数增加一丁点,损失会变多少」; 框架靠的是顺着网络的计算过程一步步累积导数,这套机制叫自动微分(auto-diff)。

关键在于:同一套机制,既能算「输出对参数的导数」,也能算「输出对输入的导数」。 而这里的输入正是坐标 (x, t)——所以「解对空间的导数」直接就是「网络输出对输入 x 的导数」6要二阶导?对一阶导的结果再来一次就行。

这是 PINN 最漂亮的一点:导数是精确的,不是差分近似出来的。

但它有代价,而且书说得很直白:每算一次导数,都要过一遍完整的网络反传。 高阶导数上这会非常贵7

摊开算一下就明白: 这个例子要三个导数(时间一阶、空间一阶、空间二阶), 其中二阶是在一阶的基础上再反传一遍; 所以每评估一次残差,网络的反向过程要跑好几遍——而这只是为了给一个采样点打一次分。

5. 走查:一个 Burgers 反问题

任务: 一维的 Burgers 方程(第 02 章那条,平流 + 扩散,会撞出激波), 时间区间 t 从 0 到 1。已知的只有两样:

  1. t = 0.5 时刻的一串观测;
  2. 两端 x = ±1 处的解恒为零(这类「直接规定边界上取什么值」的条件叫狄利克雷边界)。

要求出整个时空区域上的解1

注意这是个反问题: 你不是从初始状态往前推,而是从中间一个时刻的观测, 往前往后同时把整段解撑起来

设置8:

网络8 个全连接层,每层 20 个单元,tanh 激活,共 3021 个参数
边界项在边界上撒 100 个点
残差项在内部时空区域随机撒 1000 个点
采样分辨率空间 128 个点、时间 33 个时刻(只是为了和前面的正向仿真作对比)

3021 这个数要有参照物:第 06 章那个网络有 83,521 个参数,这个小 28 倍; 第 05 章那个翼型网络有 585,027 个,这个小 194 倍。 它小得下去,是因为它只要表示一个解,不是一族解。

训练时撒的那些点有个名字:配点(collocation point)—— 你在这些点上要求方程成立,方程在别处成不成立,没人管。

主走查第 1 步(每一次迭代): 从内部区域随机取 1000 个坐标 (x, t) → 把每个坐标喂进那个 3021 参数的网络,得到 1000 个解值 → 对每个点用自动微分算出三个导数 → 组合成残差 u_t + u·u_x − (0.01/π)·u_xx9 → 再加上边界上 100 个点的「离 0 差多远」→ 两项相加就是这一次的损失。

主走查第 2 步(训练): 10,000 次迭代,总共 101 秒。 损失从第 0 步的 0.100037 降到第 10000 步的 0.02943410

这个降幅值得停下来看一眼。 第 06 章那个变体一,损失从 390.22 降到 0.679, 降了约 570 倍,只用了 16 秒; 这里降到原来的 29%,花了 101 秒。 书自己的评语是:尽管方程很简单,收敛「通常非常慢」—— 迭代本身跑得快,但这个设置需要大量的迭代10

6. 结果好在哪

先说对的部分,不然对它不公平。

在 t = 0.5 那个有观测的时刻,两侧的区域「还不错」,边界条件也满足了11整段解的大致形状被撑起来了——而输入只有一个时刻的观测加两条边界。

这件事本身是有分量的: 没有任何人告诉网络 t = 0 或者 t = 1 该长什么样, 那些时刻的解完全是被残差项「逼」出来的。 这正是第 06 章那个想法在起作用。

7. 结果差在哪

书这一段一点不留情面,而且它指出的每一处都指向同一个方向。

第一,中心那个激波没被很好地表示11。 第 02、03 章说过,Burgers 会在中心撞出一个几乎垂直的陡坎; 而网络给出的是一个圆滑的过渡。

为什么是这里出问题:那个网络是一堆 tanh 函数叠出来的,天生是平滑的。 要表示一个近乎不连续的跳变,它得把很多个 tanh 挤在极窄的区间里——代价极高。

第二,也是最要命的一处:t = 0 的初始状态精度「其实不太好」。 而书紧接着点出了它为什么要命:那恰恰是这个问题里最有意思、最难的部分—— 因为给了第一个状态,其余基本上就由方程和边界条件推出来了12

换句话说:它在最没价值的地方表现最好,在最有价值的地方表现最差。

第三,连约束本身都没被满足。 书说 x = ±1/2 处的极值差得很远, 而 x = ±1 处的边界条件没被满足——解并不在零上13

第三条是第 06 章那个「软约束」最刺眼的一次现形。 边界条件是被写进损失的一项,而优化只是尽量满足它; 结果就是一个本该恒为零的地方,它不为零。

主走查第 3 步(量化): 拿网络给出的 t = 0 状态, 交给真正的求解器往前跑 16 步,再和真值的演化比—— 平均绝对误差 0.0113614。 书的评语是:这个误差**「相对于仿真的取值范围来说是显著的」**。

这个数怎么读:那个仿真的解在 −1 到 +1 之间,所以 0.01136 大约是量程的 1%。

⚠️ 这里有一处书内自相矛盾,照实说: 书的散文写「会算出大约 1.5 × 10⁻² 的平均绝对误差」, 而代码的实际输出是 0.01136,约 1.14 × 10⁻²14我们以代码输出为准。

8. 泛化在这里失去了意义

这是第 12 章那个很锋利的观察,而且它不是抱怨,是一个结构性的事实。

先看现象。 机器学习里,训练集、验证集、测试集是三样不同的东西, 第 05 章还专门讲过测试集必须换分布。 可在这里,你去看看那三样分别是什么?

我们测试和约束解的那些位置,就是我们最终关心的那些位置。 所以从经典机器学习的角度看,训练、验证、测试之间没有真正的区别15

书给了一个更准确的定位:这更像经典优化,而不是机器学习—— 而反问题本来就出自经典优化那个传统。

对比一下变体一就看得很清楚:

变体一(第 06 章)变体二(这一章)
训出来的是什么一个能处理新输入的东西(那个压力网络接进了没见过的障碍物)一个解,在一个已知给定的时空区域里
换一道题怎么办直接用从头重新训练

「想要另一个解,就得从头开始重新训练」——这是书的原话15

9. 与经典数值方法基本不兼容

这一条是书对第三档下决心的直接理由,而且它很具体。

书举了一个具体的技术:共轭梯度法。 那是一类经典的迭代求解器——给它一个粗略的解,它能一步步把这个解精细化, 是几十年来解大型线性方程组的主力之一(第 03 章那个泊松方程常用的就是这一类)。

书的话是:学到的这个表示,不适合用共轭梯度这类经典迭代求解器去细化。 这意味着过去几十年发展出来的许多强力技术,在这里用不上16

为什么用不上,顺着第 3 节的定义就能想明白: 经典迭代求解器操作的是一堆格子上的数——它可以把某一格调高一点、某一格调低一点。 而 PINN 的解不是一堆数,是 3021 个参数的一个函数。 你没法「把某一格调高一点」,你只能重新训练。

书还给了另一条同源的代价:PINN 那个「不需要离散化」的自由, 是把离散化的构造交给了非线性优化, 所以你从外部很难控制它——网络有能力自己去细化解, 但当它没有把注意力放在正确的区域上时,就需要各种技巧17

10. 书的裁决,以及我们必须补的一句

书自己列的账16:

✅ 好处❌ 代价
用上了物理模型收敛有问题
导数可以方便地由反向传播算出(反向传播就是第 4 节那个自动微分在网络上的名字)物理约束只是软约束
与经典数值方法基本不兼容
导数有没有用,取决于学到的表示

然后是书对整个第二档的结账,这句话是全书结构上的转折点:

相比第 05 章那种神经代理 / 神经算子,「我们在某种意义上退了一步」。 把这些数值方法带回来,是接下来几节的中心目标。18

现在补我们必须补的那一句。

判断(我们的,不是书里的): 书对 PINN 那句「多年研究仍然解决不了真实世界的问题」 是作者的判断,不是这个领域已有定论的事。理由有两条,都是结构性的: ① 全书只测了一个例子(这个 Burgers 反问题), 而且用的是最朴素的配置(8 层 × 20 单元、10000 次迭代、损失两项直接相加); ② 书完全没有评估近年为 PINN 提出的一大批修补—— 自适应地调两项损失的权重、把区域切开分块训、按时间顺序逐段收敛、 把边界条件写成硬性满足的形式,等等。 如果错,会错在: 如果那些修补经检验都只是在玩具问题上有效、 换到真实工业问题上照样不行,那书的判断就不只是「带立场」,而是正确的。 判据是:有没有一个用 PINN 做出来、被工业界实际采用的求解器? 这个判据 2025 年时书的答案是「没有」,而这一点我们无法在这里独立核实。

同时必须说清:书的具体批评每一条都是硬的,不受上面那条判断影响。 收敛慢、软约束、换题重训、和经典求解器不兼容——这四条是机制上的,不是配置问题。

11. 主走查合起来看

发生了什么具体的数
1任务Burgers 方程,t ∈ [0,1];已知 t = 0.5 的观测 + 两端 u = 0
2网络8 层 × 20 单元,tanh,3021 个参数(比第 06 章那个小 28 倍)
3每次迭代内部撒 1000 个配点、边界 100 个
4算残差自动微分给出三个导数,组成 u_t + u·u_x − (0.01/π)·u_xx
5训练10,000 次迭代,101 秒;损失 0.100037 → 0.029434
6t = 0.5 处两侧还不错,边界满足;中心的激波没被表示
7t = 0 处精度最差——而这是最有价值的部分;x = ±1/2 的极值差得很远
8边界x = ±1 处没被满足,解不在零上
9重模拟 16 步平均绝对误差 0.01136(约为量程的 1%)

每个数都是书里那次运行的输出(逐条见脚注); 「小 28 倍」「量程的 1%」这两个比值是我们算的。

12. 作者的判断与证据

书里给了证据的:

说法证据
收敛慢10000 次迭代、101 秒,损失只降到 29%10
激波没被表示t = 0.5 的对比图11
t = 0 精度最差t = 0 的对比图,以及 x = ±1 边界不为零1213
重模拟误差 0.01136真实打印输出14
泛化没有意义、换题重训这是一个逻辑论证,不是实验15
和共轭梯度不兼容书直接陈述,没有给失败案例16

作者的判断:

说法为什么算判断
「多年研究仍解决不了真实世界的问题」见上一节我们的判断块4
「PINN 的解流形不该太复杂」一句经验性的界定,书没有给出「复杂到什么程度就不行」的量5
「相比第一档我们退了一步」这是书自己的结账立场18

13. 边界与局限

  • 这一章只测了一个任务,而且是一维的。 书用它下了很重的结论, 这是这本书在方法论上最薄的一处;
  • 网络配置是最朴素的一档:8 层 × 20 单元、两项损失直接相加、没有任何权重调度。 书没有做「换更好的配置会怎样」的对照;
  • 10000 次迭代是书为了控制运行时间定的,它自己说增大这个数结果会更好10;
  • 书没有评估近年的改进(见第 10 节);
  • 和第 08 章那个对照实验的公平性,书没有讨论—— 两边的「参数量」「迭代次数」「墙钟时间」都不一样,只有任务相同;
  • 「神经场」这个更大的家族书只提了名字,NeRF 和符号距离函数一句没展开。

14. 可带走的

  1. PINN 的输入是坐标,不是场;网络本身就是那个解。 这是它和前面所有做法最根本的区别;
  2. 它属于神经场家族——同族的还有 NeRF 和学到的符号距离函数;
  3. 导数靠自动微分直接对网络求,所以是精确的、不是差分近似的。 代价是每算一次导数都要过一遍完整的网络反传,高阶导上非常贵;
  4. 配点 = 你要求方程在那儿成立的那些采样点。 方程在别处成不成立,没人管;
  5. 它擅长的和它需要的正好错位: t = 0 的初始状态是最有价值的部分, 而它在那儿精度最差;
  6. 软约束会让「本该恒为零的边界」不为零。 这不是 bug,这是软约束的定义;
  7. PINN 里没有泛化这回事。 训练、验证、测试是同一批位置; 换一道题就得从头训;
  8. 它和经典数值方法基本不兼容。 你没法拿共轭梯度这类迭代求解器去细化它的解, 因为它的解不是一堆格子上的数,是一个函数的参数;
  9. 书对它的整体评价是「退了一步」——而这句话直接指向第三档的动机;
  10. 书那句最重的判断是作者的判断。 具体批评(收敛、软约束、重训、不兼容)是硬的; 「这条路线有根本性问题」这个总结是立场,书没有系统评估近年的修补。

15. 原文地图

主题原书章原文位置
那句最重的判断、以及「换成有离散化的做法」的建议5.2 No spatially arranged inputstext/04-p61-80.txt:35(搜「physics-informed neural networks」) · text/04-p61-80.txt:38(搜「real-world problems despite」)
变体二的定义、PINN 这个名字、神经场家族8.3 Variant 2text/05-p81-100.txt:203(搜「popularized by Raissi」)
对输入求导就是空间导数8.3 同上text/05-p81-100.txt:212(搜「spatial derivatives such as」)
PINN 的适用边界(解流形不该太复杂)8.4 Summary so fartext/05-p81-100.txt:240(搜「shouldn't be overly complex」)
任务设定:t=0.5 的观测 + 两端 u=011 Burgers Optimization with a PINNtext/06-p101-120.txt:119(搜「series of observations at time」)
网络:8 层 × 20 单元、3021 个参数11.2 Preliminariestext/06-p101-120.txt:172(搜「3021 parameters」)
残差怎么组出来的11.2 同上text/06-p101-120.txt:277(搜「Physics-based loss function with Burgers」)
100 个边界点、1000 个内部点11.3 Loss function and trainingtext/06-p101-120.txt:343(搜「N_SAMPLE_POINTS_BND」) · text/06-p101-120.txt:355(搜「N_SAMPLE_POINTS_INNER」)
收敛「通常非常慢」11.3 同上text/06-p101-120.txt:373(搜「convergence is typically very slow」)
10000 次迭代、101 秒、损失曲线11.3 同上text/06-p101-120.txt:396(搜「Step 0, loss」) · text/06-p101-120.txt:409(搜「Runtime」)
中心激波没被表示11.4text/06-p101-120.txt:440(搜「shock in the center」)
t=0 精度不好、而那是最有价值的部分11.4 同上text/06-p101-120.txt:442(搜「most interesting, and toughest part」)
x=±1/2 极值差得远、x=±1 边界没满足11.4 同上text/06-p101-120.txt:462(搜「are not fulfilled」)
重模拟 16 步的平均绝对误差11.5text/06-p101-120.txt:546(搜「Mean absolute error for re-simulation」) · text/06-p101-120.txt:551(搜「significant for the value range」)
泛化在这里没有意义、换题重训12.1 Generalization?text/06-p101-120.txt:602(搜「no real distinction between」) · text/06-p101-120.txt:613(搜「start training the NN from scratch」)
每个导数都要过一遍完整反传12 Discussion of Physical Lossestext/06-p101-120.txt:594(搜「each derivative requires backpropagation」)
与共轭梯度不兼容、「退了一步」12.2 Summarytext/06-p101-120.txt:619(搜「a step backwards」) · text/06-p101-120.txt:620(搜「conjugate gradient」)
书自己列的优缺点清单12.2 同上text/06-p101-120.txt:627(搜「Problematic convergence」)

Footnotes

  1. 出处:第 8.3 节 Variant 2(p.78)第 203 段(text/05-p81-100.txt:203,搜「popularized by Raissi」) 与第 11.1 节 Formulation(p.97)第 117 段(text/06-p101-120.txt:117,搜「physics-informed」)。 原文:「using derivatives of a neural network to compute a PDE residual – is typically called a physics-informed approach, yielding a physics-informed neural network (PINN) [RPK19]」。 任务设定见第 11 章开头(text/06-p101-120.txt:119,搜「series of observations at time」)。 2 3

  2. 出处:第 11 章开篇(p.97)第 123 段(text/06-p101-120.txt:123,搜「sample points in between」)。 原文说,虽然仍然用 128 个点采样解,但离散化是通过网络做的, 所以可以在点之间采样,而不必显式选一个插值基函数; 代价是「we have no direct control over the reconstruction」——网络内部自己决定怎么用它的自由度。

  3. 出处:第 8.3 节(p.78)第 204 段(text/05-p81-100.txt:204,搜「Neural field representations」)。 原文把 PINN 归入神经场表示,并说同族还包括 NeRF 和学到的符号距离函数。 NeRF 和符号距离函数各自是什么,是我们补的一句(补充,不在书里,来自通用知识)。

  4. 出处:第 5.2 节 No spatially arranged inputs(p.52)第 38 段 (text/04-p61-80.txt:38,搜「real-world problems despite」)。 原文全句:「That PINNs can't solve real-world problems despite many years of research points to the fundamental problems of this approach.」 前一句是建议改用「an approach that employs prior knowledge in the form of a discretization」, 并说这通常显著提高推断精度、改善收敛(text/04-p61-80.txt:37,搜「substantially improves」)。 2 3

  5. 出处:第 8.4 节 Summary so far(p.79–80)第 240 段 (text/05-p81-100.txt:240,搜「shouldn't be overly complex」)。 原文:「Because of the ill-posedness of the optimization and learning problem, and the high cost of the reconstruction …, the solution manifold shouldn't be overly complex for these PINN approaches. E.g., it is typically very difficult to capture time dependence or a wide range of solutions, such as with the previous supervised airfoil example.」 「病态」这个词的解释是我们补的(补充,不在书里,来自通用知识)。 2

  6. 出处:第 8.3 节(p.78)第 212 段(text/05-p81-100.txt:212,搜「spatial derivatives such as」)。 原文:同一套工具既可以算 ∂f/∂θ(训练用的),也可以算空间导数 ∂u/∂x = ∂f/∂x; 对时间的导数只需把 t 也当成输入。

  7. 出处:第 12 章 Discussion of Physical Losses(p.109)第 594 段 (text/06-p101-120.txt:594,搜「each derivative requires backpropagation」)。 原文:「each derivative requires backpropagation through the full network. This can be very expensive, especially for higher-order derivatives.」

  8. 出处:第 11.2 节 Preliminaries(p.98)第 172 段(text/06-p101-120.txt:172,搜「3021 parameters」); 采样点数见第 11.3 节第 343 段(text/06-p101-120.txt:343,搜「N_SAMPLE_POINTS_BND」) 与第 355 段(text/06-p101-120.txt:355,搜「N_SAMPLE_POINTS_INNER」)。 「配点」这个术语是我们补的(补充,不在书里,来自通用知识); 书只说「sampling points」,但读者出门会撞见 collocation point 这个叫法。

  9. 出处:第 11.2 节(p.99)第 277 段(text/06-p101-120.txt:277,搜「Physics-based loss function with Burgers」)。 书里那段代码是 u_t = gradients(u, t)u_x = gradients(u, x)u_xx = gradients(u_x, x), 再返回 u_t + u*u_x - (0.01 / np.pi) * u_xx注意 u_xx 是对 u_x 再求一次导。

  10. 出处:第 11.3 节 Loss function and training(p.101)第 396 段 (text/06-p101-120.txt:396,搜「Step 0, loss」)与第 409 段(text/06-p101-120.txt:409,搜「Runtime」)。 打印输出:Step 0 是 0.100037,Step 10000 是 0.029434,运行时间 101.02 秒。 「收敛通常非常慢」见第 373 段(text/06-p101-120.txt:373,搜「convergence is typically very slow」), 原文接着说 10000 次迭代是为了把运行时间控制在合理范围才定的,「You can increase this value to get better results」。 ⚠️ 同一页的散文写「the error should go down significantly (roughly from around 0.2 to ca. 0.03)」, 而日志的起点是 0.100037 而不是 0.2 —— 我们按日志写。 2 3 4

  11. 出处:第 11.4 节(p.104)第 440 段(text/06-p101-120.txt:440,搜「shock in the center」)。 原文:「Not too bad at the sides of the domain (the Dirichlet boundary conditions u = 0 are fulfilled), but the shock in the center (at x = 0) is not well represented.」 注意这句里的「边界条件满足了」说的是 t = 0.5 那一时刻;t = 0 那一时刻不满足,见下一条。 「tanh 叠出来的函数天生平滑、所以表示不了陡坎」这个解释是我们补的 (补充,不在书里,来自通用知识)。 2 3

  12. 出处:第 11.4 节(p.104)第 442 段(text/06-p101-120.txt:442,搜「most interesting, and toughest part」)。 原文:t = 0 是「the most interesting, and toughest part of the problem (the rest basically follows from the model equation and boundary conditions, given the first state)」, 而「the accuracy of the initial state is actually not that good」。 2

  13. 出处:第 11.4 节(p.105)第 462 段(text/06-p101-120.txt:462,搜「are not fulfilled」)。 原文:「Especially the maximum / minimum at x = ±1/2 are far off, and the boundaries at x = ±1 are not fulfilled: the solution is not at zero.」 2

  14. 出处:第 11.5 节(p.107)第 546 段 (text/06-p101-120.txt:546,搜「Mean absolute error for re-simulation」) 与第 551 段(text/06-p101-120.txt:551,搜「significant for the value range」)。 ⚠️ 打印输出是 0.01136,而紧跟着的散文写「will compute a mean absolute error of ca. 1.5 · 10⁻²」—— 两个数对不上,我们以代码输出为准。 2 3

  15. 出处:第 12.1 节 Generalization?(p.109)第 602 段 (text/06-p101-120.txt:602,搜「no real distinction between」) 与第 613 段(text/06-p101-120.txt:613,搜「start training the NN from scratch」)。 原文还特意对比:「The v1 version, using a prescribed discretization actually had this property, and could generalized to new inputs.」 2 3

  16. 出处:第 12.2 节 Summary(p.110)第 620 段(text/06-p101-120.txt:620,搜「conjugate gradient」) 与第 627 段(text/06-p101-120.txt:627,搜「Problematic convergence」)。 「共轭梯度是什么」是我们补的一句(补充,不在书里,来自通用知识): 它是一类经典迭代求解器,给一个粗略解能一步步细化,常用于解大型线性方程组。 2 3

  17. 出处:第 12 章(p.109)第 596 段(text/06-p101-120.txt:596,搜「difficult to control」)。 原文:「the setup is relatively simple, it is generally difficult to control. The NN has flexibility to refine the solution by itself, but at the same time, tricks are necessary when it doesn't focus on the right regions of the solution.」

  18. 出处:第 12.2 节(p.110)第 619 段(text/06-p101-120.txt:619,搜「a step backwards」)。 原文:「In comparison to the Neural surrogates/operators from Supervised Training we've made a step backwards in some way … Bringing these numerical methods back into the picture will be one of the central goals of the next sections.」 2