让网络懂物理 — 物理信息网络与新架构
这一章讲三件事: 物理信息网络(PiNN)怎么把「遵守方程」写进损失函数; Transformer 靠什么让整段输入一次看全(替代逐字读的循环网络); 图(关系连成的网)怎么把「关系」本身变成网络的一等公民。 读完你应能回答:数据不够时,还有什么可以当训练信号——答案是 人已经写下来的定律,和数据的结构本身。
1. 这一章讲什么
原书第 6 章是前沿杂货铺(物理网络、Transformer、生成式 AI、可解释 、图网络、 二值化、RLHF、量子)。我们按「给学习加约束」这条线拣出四个: 物理定律是一种约束(§3.1–3.2),数据结构是另一种(§3.3–3.4), 最后一小节给「算不起」的问题(§3.5)。
出发点是书里给的一句话诊断:监督网络是通用函数近似器,但严重受限于外推—— 想预测训练数据范围之外的输入,它不行;而当问题本身又缺数据时,这就是瓶颈1。 解药的思路朴素:世界不是任意的,定律早已写好,别浪费。
2. 顶层全景:把「约束」放进训练的不同深度
对「已知物理」的用法,书里分四档(由浅入深 [^2]):
PgNN 物理引导:训练后用物理校验数据 —— 物理当质检员
PiNN 物理信息:方程残差写进损失 —— 物理当陪练(本章主走查)
PeNN 物理编码:定律直接编进架构 —— 物理当骨架
NO 神经算子:学「方程到解」的算子 —— 学会解一大类问题,换边界条件不用重训
图说:四档的区别是「物理在训练流程里的位置」;
越深,对数据的依赖越少,对架构的要求越高。
主走查:PiNN 的物理损失——第 3 节第 1 小节,拿一个衰减方程算成具体数字。
3. 核心原理
3.1 PiNN:残差当损失(主走查)
书里的设定:系统由非线性偏微分方程(PDE,含未知函数对时空的导数的方程)描述; PiNN 用两个网络:一个监督网络拿少量稀疏(东一点西一点、覆盖不全)的数据拟合解。
另一个前馈(信息只朝一个方向流、不绕圈)网络在配点(人为选定的时空点)上干活:把方程左端 f = uₜ + N(u) 算出来。
方程左右两边没对上多少,书里把这道差叫残差:把它平方平均,就得到物理那一项损失;总损失 = 数据的均方误差 + 残差的均方误差,残差对时空坐标的导数靠自动微分(对网络输出求导的算法化实现)精确拿到2。
拿一个最简单的「定律」走一遍:某量按 uₜ = −2u 衰减(方程与全部数值 为演示编的;真实场景是把热传导、流体方程整段写进来):
数据侧:只有 2 个带标签的点 (t=0, u=1.0) 和 (t=0.5, u=0.5)
MSE_u = [ (0.9−1.0)² + (0.8−0.5)² ] / 2 = (0.01 + 0.09)/2 = 0.05
└ 网络当前在这两点预测 0.9 与 0.8(演示)
物理侧:在 3 个配点 t = 0.1, 0.2, 0.3 上,
网络给 u = 0.9, 0.85, 0.7;自动微分给 uₜ = 0.8, 0.9, 0.5(演示)
残差 f = uₜ + 2u = [0.8+1.8, 0.9+1.7, 0.5+1.4] = [2.6, 2.6, 1.9]
MSE_f = (6.76 + 6.76 + 3.61)/3 ≈ 5.71
总损失 = MSE_u + MSE_f = 0.05 + 5.71 ≈ 5.76
读这个数:残差项压倒数据项(5.71 对 0.05)——梯度的主要部分在把网络 往「遵守衰减定律」上推。这正是 PiNN 的主张:数据不足时,定律兜底; 书里的说法是残差项「把数学模型整合进网络、限制可接受解的空间」3。 书里也给了机制上最硬的一句:残差对输入的导数不是数值近似,是自动微分 精确算出来的——这是 PiNN 区别于「拿差分凑导数」的老办法的地方2。
3.2 四档各的病(书里列得很诚实)
书里对四档的局限毫不讳言,挑承重的说4:
- PgNN: 训练纯靠统计,预测可能违反物理;数据稀疏时不稳健、不能外推; 分辨率变了不能直接用;
- PiNN: 三维问题训练慢到不可行;对非线性 PDE 没有收敛性证明; 损失里好几项的相对权重没有选法指南、各项还会互相打架;低频偏差—— 高频、多尺度结构学不好;换一组参数就要重训一个新网络;
- PeNN: 把定律编进架构后,架构复杂、训练难;
- NO(神经算子): 反方向补齐——学的是函数空间之间的算子(DeepONet、 傅里叶神经算子、图神经算子三种代表),一个分辨率上训练、任何分辨率上推断 (分辨率不变),换边界条件不必重训,实时推断特别稳5。 一句话定位:PiNN 学「一个问题的解」,NO 学「一族问题的解法」。
书里还给了物理与 RL 的接合点 PiRL,三步:现行策略与环境交互采数据 → 学环境模型(两条路:普通深度网络直接预测下一状态,或从系统的拉格朗日量 推出运动方程)→ 在模型的「想象轨迹」上反传更新策略6—— 第 03 章「有模型智能体在脑内排练」的现代化版本。
3.3 Transformer:序列不再逐字读
书里的定位:Transformer 与循环网络做同样的事——读进一串、吐出一串;但它一次处理整条序列(一串有先后次序的东西),不像循环网络那样一个字一个字往后挪7。三种形态:原始的编码器-解码器;只留编码器的 BERT(只管读懂、不负责生成的那个变体)。
只留解码器的 GPT(负责接着往下写的那个变体)则是 ChatGPT 这一族的骨架7。
核心机制是注意力(给重要的部分多看两眼、次要的少看):每个位置的『查询』去和所有位置的『键』算相似度,softmax 归一成权重,再按权重把各位置的『内容』加权取回。规模口径照书:每个位置用 512 个数表示,打分用的『键』取 64 维;位置次序另用一组 sin/cos 波形记住8:
文本 ──tokenizer 切成标记── 每个标记 ──嵌入层── 一个 512 维向量
──加上位置编码(sin/cos,给「第几个」编号)── 进入注意力层
注意力一步:每个位置的「查询 Q」去和所有位置的「键 K」算相似度,
softmax 归一成权重,再按权重把各位置的「值 V」加权取回:
Attention(Q,K,V) = softmax( Q·Kᵀ / √dₖ ) · V
走查(3 个标记,分数为演示):Q·Kᵀ 算出相关分 [4, 1, 0]
→ softmax ≈ [0.86, 0.12, 0.02] → 新表示 = 86% 的第 1 个位置
+ 12% 的第 2 个 + 2% 的第 3 个
多头 = 几组 Q/K/V 并行,各看一种关系,结果拼回 512 维
机制细讲(打分怎么打、键与值怎么分,以及自注意力——查询也取自同一句话的变体)在我们书架有整章拆解9。
对本章要紧的是书里的两句判断:多头并行是 LSTM/循环网络给不了的(记忆不够)10;GPT 的生成靠自回归(把联合分布拆成「一个 条件接一个」的链,由前文预测下一个)11。
3.4 图神经网络:关系当一等公民
图(节点+边:人、地点、物,边是关系)住在非欧空间里,常规全连接(相邻两层两两全接)或卷积网络吃不动;图神经网络(GNN)沿边传消息,书里列了四种主要型:图卷积 GCN、 图自编码器、循环图网络、门控图网络12。
与 DRL 的接合书里给了实例:把 Q 函数建模在 GNN 上——智能体收到的状态 就是图结构(网络拓扑),GNN 沿链路的隐藏状态做消息传递、汇出一个全局状态, 经深度网络输出各动作的 Q 值,挑最大执行13。书里注明这仍是活跃研究领域。 对 DRL 的意义与第 11 章的 4 通道张量同构:表示对齐结构,成熟机制白拿。
3.5 算不起怎么办:二值化网络
一段很短但实用的:常规网 络要 GPU(显卡里那块专管大量乘加的芯片),训练和推断都很费时费电。
更省的路线是二值化网络(BNN):权重的精度先经量化(把精确数四舍五入到粗格点)也还有 int8;BNN 直接把权重压成 1 和 −1(1 比特),把乘加运算换成位运算——计算量与内存大降,适合装进小型设备与单片机14。 对 RL 的意义直白:智能体要跑在设备上,而不是机房里(第 14 章机器人一节的 现实约束)。
4. 作者的判断与证据
- 书里给证据的: 四档物理网络的划分与各自局限、PiNN 双网络与总损失、 Transformer 的加工流程与尺寸口径、GNN 当 Q 函数的实例、BNN 的位运算, 均为书中明列内容2481314。
- 书里的判断句: 「PiNN 对非线性 PDE 无收敛证明」4—— 前沿章节里少见的自我设限,保留;「GNN+DRL 仍是活跃研究」13同样是坦白。
- 书里给来源的: 表 6.2 生成式与 RL 的结合引自 Franceschelli 与 Musolesi 2024 年的 arXiv 综述15 (该书第 13 章还会引用)。
- 书里给算法地图的: 第 6 章开篇的算法总表把 Double DQN、Rainbow、 分层 RL 等变体一张表收拢16——我们把它当「第 06–09 章的查找表」用, 不再复述。
5. 边界与局限
- 「前沿」已是快照。 书成于 2025 年,未收Mamba 等序列模型的后续演进、 扩散模型的生成路线;Transformer 一节没有提任何 2017 年之后的架构变体 (通用补充)。
- PiNN 之病书里列了,药没给。 权重怎么配、收敛怎么证,书里承认没有指南4; 读完能建直觉,不能照做。
- Transformer 一节没有数学外的内容: 没有训练成本、没有规模法则—— 「模型越大越好,大到什么程度喂多少数据」这层现代语境(书架拆解里有) 本章不覆盖,读时注意。
- BNN 只有一段,没有精度损失的数据——书里自己就没展开,照实标注。
6. 可带走的
- 数据不够时,定律可以兜底:PiNN 把方程残差写进损失,主走查里残差项 5.71 压过数据项 0.05——梯度主要在学「守规矩」;
- 四档记忆法:物理当质检员(PgNN)/陪练(PiNN)/骨架(PeNN)/ 学会解一类题(NO);
- PiNN 的硬底是自动微分:残差对时空的导数是精确的,不是数值凑的;
- PiNN 学一个解,NO 学一族解;分辨率不变是 NO 的招牌;
- PiRL 三步(交互、学模型、想象轨迹上反传)= 有模型智能体的现代形态;
- 注意力一行式:softmax(Q·Kᵀ/√dₖ)·V——查询对所有键打分、按分加权取值; 多头并行看多种关系;GPT 的自回归=链式拆分联合分布;
- 表示对齐结构,机制白拿:图像用卷积(第 11 章)、序列用注意力、 关系图用 GNN(可把 Q 函数直接建在 GNN 上);
- 端侧(装在设备上、不进机房)部署的省法:权重压到 1 比特、乘加换位运算。