跳到主要内容

让网络懂物理 — 物理信息网络与新架构

这一章讲三件事: 物理信息网络(PiNN)怎么把「遵守方程」写进损失函数; Transformer 靠什么让整段输入一次看全(替代逐字读的循环网络); 图(关系连成的网)怎么把「关系」本身变成网络的一等公民。 读完你应能回答:数据不够时,还有什么可以当训练信号——答案是 人已经写下来的定律,和数据的结构本身。

1. 这一章讲什么

原书第 6 章是前沿杂货铺(物理网络、Transformer、生成式 AI、可解释、图网络、 二值化、RLHF、量子)。我们按「给学习加约束」这条线拣出四个: 物理定律是一种约束(§3.1–3.2),数据结构是另一种(§3.3–3.4), 最后一小节给「算不起」的问题(§3.5)。

出发点是书里给的一句话诊断:监督网络是通用函数近似器,但严重受限于外推—— 想预测训练数据范围之外的输入,它不行;而当问题本身又缺数据时,这就是瓶颈1。 解药的思路朴素:世界不是任意的,定律早已写好,别浪费。

2. 顶层全景:把「约束」放进训练的不同深度

对「已知物理」的用法,书里分四档(由浅入深 [^2]):

PgNN 物理引导:训练后用物理校验数据 —— 物理当质检员
PiNN 物理信息:方程残差写进损失 —— 物理当陪练(本章主走查)
PeNN 物理编码:定律直接编进架构 —— 物理当骨架
NO 神经算子:学「方程到解」的算子 —— 学会解一大类问题,换边界条件不用重训

图说:四档的区别是「物理在训练流程里的位置」;
越深,对数据的依赖越少,对架构的要求越高。

主走查:PiNN 的物理损失——第 3 节第 1 小节,拿一个衰减方程算成具体数字。

3. 核心原理

3.1 PiNN:残差当损失(主走查)

书里的设定:系统由非线性偏微分方程(PDE,含未知函数对时空的导数的方程)描述; PiNN 用两个网络:一个监督网络拿少量稀疏(东一点西一点、覆盖不全)的数据拟合解。

另一个前馈(信息只朝一个方向流、不绕圈)网络在配点(人为选定的时空点)上干活:把方程左端 f = uₜ + N(u) 算出来。

方程左右两边没对上多少,书里把这道差叫残差:把它平方平均,就得到物理那一项损失;总损失 = 数据的均方误差 + 残差的均方误差,残差对时空坐标的导数靠自动微分(对网络输出求导的算法化实现)精确拿到2

拿一个最简单的「定律」走一遍:某量按 uₜ = −2u 衰减(方程与全部数值 为演示编的;真实场景是把热传导、流体方程整段写进来):

数据侧:只有 2 个带标签的点 (t=0, u=1.0) 和 (t=0.5, u=0.5)
MSE_u = [ (0.9−1.0)² + (0.8−0.5)² ] / 2 = (0.01 + 0.09)/2 = 0.05
└ 网络当前在这两点预测 0.9 与 0.8(演示)

物理侧:在 3 个配点 t = 0.1, 0.2, 0.3 上,
网络给 u = 0.9, 0.85, 0.7;自动微分给 uₜ = 0.8, 0.9, 0.5(演示)
残差 f = uₜ + 2u = [0.8+1.8, 0.9+1.7, 0.5+1.4] = [2.6, 2.6, 1.9]
MSE_f = (6.76 + 6.76 + 3.61)/3 ≈ 5.71

总损失 = MSE_u + MSE_f = 0.05 + 5.71 ≈ 5.76

读这个数:残差项压倒数据项(5.71 对 0.05)——梯度的主要部分在把网络 往「遵守衰减定律」上推。这正是 PiNN 的主张:数据不足时,定律兜底; 书里的说法是残差项「把数学模型整合进网络、限制可接受解的空间」3。 书里也给了机制上最硬的一句:残差对输入的导数不是数值近似,是自动微分 精确算出来的——这是 PiNN 区别于「拿差分凑导数」的老办法的地方2

3.2 四档各的病(书里列得很诚实)

书里对四档的局限毫不讳言,挑承重的说4:

  • PgNN: 训练纯靠统计,预测可能违反物理;数据稀疏时不稳健、不能外推; 分辨率变了不能直接用;
  • PiNN: 三维问题训练慢到不可行;对非线性 PDE 没有收敛性证明; 损失里好几项的相对权重没有选法指南、各项还会互相打架;低频偏差—— 高频、多尺度结构学不好;换一组参数就要重训一个新网络;
  • PeNN: 把定律编进架构后,架构复杂、训练难;
  • NO(神经算子): 反方向补齐——学的是函数空间之间的算子(DeepONet、 傅里叶神经算子、图神经算子三种代表),一个分辨率上训练、任何分辨率上推断 (分辨率不变),换边界条件不必重训,实时推断特别稳5。 一句话定位:PiNN 学「一个问题的解」,NO 学「一族问题的解法」

书里还给了物理与 RL 的接合点 PiRL,三步:现行策略与环境交互采数据 → 学环境模型(两条路:普通深度网络直接预测下一状态,或从系统的拉格朗日量 推出运动方程)→ 在模型的「想象轨迹」上反传更新策略6—— 第 03 章「有模型智能体在脑内排练」的现代化版本。

3.3 Transformer:序列不再逐字读

书里的定位:Transformer 与循环网络做同样的事——读进一串、吐出一串;但它一次处理整条序列(一串有先后次序的东西),不像循环网络那样一个字一个字往后挪7。三种形态:原始的编码器-解码器;只留编码器的 BERT(只管读懂、不负责生成的那个变体)。

只留解码器的 GPT(负责接着往下写的那个变体)则是 ChatGPT 这一族的骨架7

核心机制是注意力(给重要的部分多看两眼、次要的少看):每个位置的『查询』去和所有位置的『键』算相似度,softmax 归一成权重,再按权重把各位置的『内容』加权取回。规模口径照书:每个位置用 512 个数表示,打分用的『键』取 64 维;位置次序另用一组 sin/cos 波形记住8:

文本 ──tokenizer 切成标记── 每个标记 ──嵌入层── 一个 512 维向量
──加上位置编码(sin/cos,给「第几个」编号)── 进入注意力层

注意力一步:每个位置的「查询 Q」去和所有位置的「键 K」算相似度,
softmax 归一成权重,再按权重把各位置的「值 V」加权取回:
Attention(Q,K,V) = softmax( Q·Kᵀ / √dₖ ) · V

走查(3 个标记,分数为演示):Q·Kᵀ 算出相关分 [4, 1, 0]
→ softmax ≈ [0.86, 0.12, 0.02] → 新表示 = 86% 的第 1 个位置
+ 12% 的第 2 个 + 2% 的第 3 个
多头 = 几组 Q/K/V 并行,各看一种关系,结果拼回 512 维

机制细讲(打分怎么打、键与值怎么分,以及自注意力——查询也取自同一句话的变体)在我们书架有整章拆解9

对本章要紧的是书里的两句判断:多头并行是 LSTM/循环网络给不了的(记忆不够)10;GPT 的生成靠自回归(把联合分布拆成「一个条件接一个」的链,由前文预测下一个)11

3.4 图神经网络:关系当一等公民

图(节点+边:人、地点、物,边是关系)住在非欧空间里,常规全连接(相邻两层两两全接)或卷积网络吃不动;图神经网络(GNN)沿边传消息,书里列了四种主要型:图卷积 GCN、 图自编码器、循环图网络、门控图网络12

与 DRL 的接合书里给了实例:把 Q 函数建模在 GNN 上——智能体收到的状态 就是图结构(网络拓扑),GNN 沿链路的隐藏状态做消息传递、汇出一个全局状态, 经深度网络输出各动作的 Q 值,挑最大执行13。书里注明这仍是活跃研究领域。 对 DRL 的意义与第 11 章的 4 通道张量同构:表示对齐结构,成熟机制白拿

3.5 算不起怎么办:二值化网络

一段很短但实用的:常规网络要 GPU(显卡里那块专管大量乘加的芯片),训练和推断都很费时费电。

更省的路线是二值化网络(BNN):权重的精度先经量化(把精确数四舍五入到粗格点)也还有 int8;BNN 直接把权重压成 1 和 −1(1 比特),把乘加运算换成位运算——计算量与内存大降,适合装进小型设备与单片机14。 对 RL 的意义直白:智能体要跑在设备上,而不是机房里(第 14 章机器人一节的 现实约束)。

4. 作者的判断与证据

  • 书里给证据的: 四档物理网络的划分与各自局限、PiNN 双网络与总损失、 Transformer 的加工流程与尺寸口径、GNN 当 Q 函数的实例、BNN 的位运算, 均为书中明列内容2481314
  • 书里的判断句: 「PiNN 对非线性 PDE 无收敛证明」4—— 前沿章节里少见的自我设限,保留;「GNN+DRL 仍是活跃研究」13同样是坦白。
  • 书里给来源的: 表 6.2 生成式与 RL 的结合引自 Franceschelli 与 Musolesi 2024 年的 arXiv 综述15 (该书第 13 章还会引用)。
  • 书里给算法地图的: 第 6 章开篇的算法总表把 Double DQN、Rainbow、 分层 RL 等变体一张表收拢16——我们把它当「第 06–09 章的查找表」用, 不再复述。

5. 边界与局限

  • 「前沿」已是快照。 书成于 2025 年,未收Mamba 等序列模型的后续演进、 扩散模型的生成路线;Transformer 一节没有提任何 2017 年之后的架构变体 (通用补充)。
  • PiNN 之病书里列了,药没给。 权重怎么配、收敛怎么证,书里承认没有指南4; 读完能建直觉,不能照做。
  • Transformer 一节没有数学外的内容: 没有训练成本、没有规模法则—— 「模型越大越好,大到什么程度喂多少数据」这层现代语境(书架拆解里有) 本章不覆盖,读时注意。
  • BNN 只有一段,没有精度损失的数据——书里自己就没展开,照实标注。

6. 可带走的

  1. 数据不够时,定律可以兜底:PiNN 把方程残差写进损失,主走查里残差项 5.71 压过数据项 0.05——梯度主要在学「守规矩」;
  2. 四档记忆法:物理当质检员(PgNN)/陪练(PiNN)/骨架(PeNN)/ 学会解一类题(NO);
  3. PiNN 的硬底是自动微分:残差对时空的导数是精确的,不是数值凑的;
  4. PiNN 学一个解,NO 学一族解;分辨率不变是 NO 的招牌;
  5. PiRL 三步(交互、学模型、想象轨迹上反传)= 有模型智能体的现代形态;
  6. 注意力一行式:softmax(Q·Kᵀ/√dₖ)·V——查询对所有键打分、按分加权取值; 多头并行看多种关系;GPT 的自回归=链式拆分联合分布;
  7. 表示对齐结构,机制白拿:图像用卷积(第 11 章)、序列用注意力、 关系图用 GNN(可把 Q 函数直接建在 GNN 上);
  8. 端侧(装在设备上、不进机房)部署的省法:权重压到 1 比特、乘加换位运算

7. 原文地图

主题原书章原文位置
外推瓶颈、物理救场Recent Developments in DRL(§6.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:192(搜「extrapolate」)
四档物理网络Recent Developments in DRL(§6.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:204(搜「four distinct」)
PiNN 双网络、总损失、自动微分Recent Developments in DRL(§6.1.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:294(搜「collocation」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:250(搜「automatic differentiation」)
PiNN 局限清单Recent Developments in DRL(§6.1.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:333(搜「prohibitively slow」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:338(搜「no theoretical proof」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:345(搜「no guidelines」)
NO 三代表与分辨率不变Recent Developments in DRL(§6.1.4)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:400(搜「resolution invariant」)
PiRL 三步、拉格朗日Recent Developments in DRL(§6.1.5)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:413(搜「three steps」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:433(搜「Lagrangian」)
Transformer 一次整序列、三形态Recent Developments in DRL(§6.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:455(搜「entire sequence」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:469(搜「Encoder-Decoder」)
维度口径(dₘ=512、dₖ=64)Recent Developments in DRL(§6.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:498(搜「512」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:556(搜「64」)
注意力式与 Q/K/V 分工Recent Developments in DRL(§6.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:568(搜「Attention」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:560(搜「current element」)
多头、LSTM 记忆不足Recent Developments in DRL(§6.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:585(搜「multi-head」)
自回归分解Recent Developments in DRL(§6.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:604(搜「factorized」)
GNN 四型Recent Developments in DRL(§6.5)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:947(搜「Graph Convolutional」)
GNN 当 Q 函数、消息传递Recent Developments in DRL(§6.5.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:974(搜「Q-function is modeled by a GNN」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:978(搜「message-passing」)
BNN 二值权重、位运算Recent Developments in DRL(§6.6)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:987(搜「binary values」)
算法总表(Double/Rainbow 等)Recent Developments in DRL(表 6.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:24(搜「Table 6.1」)

Footnotes

  1. 出处:「Recent Developments in DRL」§6.1 第 192 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:192,搜「extrapolate」)。监督网络外推受限;数据难采时成瓶颈;物理启发的网络在纯物理描述与纯数据驱动之间。

  2. 出处:「Recent Developments in DRL」§6.1.2 第 242–294 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:238,搜「Physics-Informed」)。PiNN 在服从物理定律下做监督学习;损失含方程残差与边界约束;自动微分对时空坐标求导(第 250 段);双网络与总损失=MSEu+MSEf、配点见第 287–294 段。四档划分见第 204 段(搜「four distinct」)。 2 3

  3. 出处:「Recent Developments in DRL」§6.1.2 第 294 段之后的效果清单(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:305,搜「Integrates the mathematical model」):把附加的物理损失约束纳入、把数学模型整合进网络、用 PDE 残差强化损失、作为惩罚项限制可接受解空间。

  4. 出处:「Recent Developments in DRL」§6.1.2 第 327–350 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:333,搜「prohibitively slow」)。三维慢、无收敛证明(第 338 段)、权重无指南且各项竞争(第 345 段)、低频偏差与换参数重训(第 350 段)。PgNN 之病见第 223 段(搜「physics-agnostic」)。 2 3 4

  5. 出处:「Recent Developments in DRL」§6.1.4 第 376–400 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:400,搜「resolution invariant」)。NO 学函数空间之间的线性/非线性算子;DeepONet/FNO/GNO 三代表;一个分辨率训练、任意分辨率推断;实时推断稳。

  6. 出处:「Recent Developments in DRL」§6.1.5 第 409–446 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:413,搜「three steps」)。交互、学模型(直接预测或拉格朗日推运动方程,第 433 段)、想象轨迹上反传。

  7. 出处:「Recent Developments in DRL」§6.2 第 455–483 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:455,搜「entire sequence」)。与循环网络的差别;EDT/BERT/GPT 三形态(第 469–479 段)。 2

  8. 出处:「Recent Developments in DRL」§6.2 第 492–583 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:498,搜「512」)。tokenizer、嵌入维度 dₘ=512、位置编码 sin/cos 与 N=10000(第 507–510 段)、Q/K/V 三个矩阵与 dₖ=64(第 527–556 段)、注意力式 softmax(QKᵀ/√dₖ)V(第 568 段)、多头并行与拼接(第 585 段)。 2

  9. 注意力机制的完整拆解(打分函数、键值分离、自注意力),补充(不在书里,依据我们的 ai-book-reference 书架)。依据: shelf=ai-book-reference/nndl-2e#20-attention.md @未提交(工作区) 事实=该章把「打分再加权」拆到可手算,自注意力使任意两位置一步可达。

  10. 出处:「Recent Developments in DRL」§6.2 第 585 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:585,搜「lack sufficient memory」)。多头输出拼接;LSTM/RNN 因记忆不足不适用于此(语言翻译等复杂任务)。

  11. 出处:「Recent Developments in DRL」§6.2 第 604–611 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:604,搜「factorized」)。自回归:联合分布拆成条件分布的乘积;与循环网络的差别在「用过去时间步作输入」。

  12. 出处:「Recent Developments in DRL」§6.5 第 933–962 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:947,搜「Graph Convolutional」)。图数据、非欧空间;GCN(空间/谱)、图自编码器(编码-解码-瓶颈)、循环图网络(多关系)、门控图网络(长程依赖)。

  13. 出处:「Recent Developments in DRL」§6.5.1 第 970–978 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:974,搜「Q-function is modeled by a GNN」)。GNN 建模 Q 函数、动作施加在网络拓扑上;消息传递输出全局隐藏状态,再由深度网络给 Q;书注:仍是活跃研究领域(第 978 段)。 2 3

  14. 出处:「Recent Developments in DRL」§6.6 第 987 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:987,搜「binary values」)。1 比特量化(1 与 −1);位逻辑运算替代乘加;适合嵌入式与微控制器。 2

  15. 出处:「Recent Developments in DRL」表 6.2 的来源注(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:762,搜「Franceschelli」)。引自 Reinforcement Learning for Generative AI(arXiv:2308.00031),2024-02-08 v4。

  16. 出处:「Recent Developments in DRL」表 6.1(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:24,搜「Table 6.1」)。值/策略/模型/分层四族变体总表。