跳到主要内容

这一章回答「卷积怎么搬到图上」——答案不是类比,是定理:换到频率基下, 卷积就是逐点乘。把这条定理一路化简(特征分解→多项式→一阶),终点是那句 只有一行的 GCN 公式;而化简路上被丢弃的东西,和四个模型各自补回的东西, 正是本章真正的骨架。

经典图神经网络:从卷积定理到 GCN,以及三道坎

1. 这一章讲什么

两件事: 四个经典模型(GCN、GraphSAGE、GAT、GIN)各自补回了什么; 以及所有消息传递模型共同的三道坎(过度平滑、过压缩、大图可扩展)。

它在全书链条里的位置: 第 23 章给了公共骨架(消息传递)和地基(拉普拉斯); 这一章把地基修到顶:谱方法路线从卷积定理推到 GCN 的传播公式, 然后是三个「不满足于 GCN」的方向——可扩展、可分轻重、可分辨结构。 第 16 章那笔「层数决定看多远」的账,也在三道坎一节算清。

需要第 23 章;第 01 章的特征值/特征向量在 5.2 节承重。

2. 顶层全景

卷积定理: 卷积 = 换基 → 逐点乘 → 换回 (基 = 频率基)

▼ 图上的基是什么?
拉普拉斯特征向量 = 频率基;特征值 = 频率(小→平滑,大→振荡)


谱图卷积: y = U g_θ(Λ) Uᵀ x ← 贵(特征分解)且不局部
│ 多项式近似:g_θ(L)=Σα_k L^k,K 阶=K 跳
▼ ChebNet → 取 K=1 → 加自环 → 对称归一化
GCN: H ← σ(D̃^{-1/2} Ã D̃^{-1/2} H W) 一行写完,聚合一阶邻域

四模型补课: GraphSAGE=采样+归纳 | GAT=学邻居轻重 | GIN=求和保判别力
三道坎: 过度平滑(层深趋同) | 过压缩(瓶颈挤丢) | 大图(邻域爆炸)

一句话链条: 想在图上卷积 → 先找到图上的「频率」→ 它是拉普拉斯的特征值 → 谱卷积代价太高 → 多项式近似把「谱」折回「局部」→ 一阶化简出 GCN → GCN 的三个短板(全图训练、权重固定、判别力上限)分别被 SAGE、GAT、GIN 补上 → 而加深与放大的三道坎,是谁都得过的关卡。

3. 卷积定理:换个基,卷积就是逐点乘

普通卷积有两个基本特征:局部连接与参数共享——一维卷积 yᵢ=Σ w_δ x_{i+δ} 只看局部窗口,同一组参数全位置复用1。 图卷积要保住这两条,但图上没有「位置 i+δ」可滑,得先从数学上认清卷积是什么。

卷积定理:时域中的卷积,等价于频域中的逐点乘法—— ℱ{f∗g} = ℱ{f}⊙ℱ{g},也就是「变换 → 逐点乘 → 变换回来」2。 傅里叶变换在这里的角色只是提供了频率基:一组用来展开信号的基函数, 低频描述缓慢变化的总趋势,高频描述快速变化的细节3。 定理真正说的是:卷积不依赖某种积分形式,只依赖「有没有一组合适的基」

于是把卷积搬到图上,问题变成一句话:图上的频率基应该怎么定义?

4. 图上的频率:拉普拉斯的特征向量

先看连续空间的答案。拉普拉斯算子 Δ 描述函数的局部变化程度; 满足 −Δφ=λφ 的函数 φ 是它的特征函数——在算子作用下方向不变、只变尺度。 经典傅里叶分析里,复指数 e^{iωt} 恰好是拉普拉斯算子的特征函数 (−Δe^{iωt}=ω²e^{iωt})——传统傅里叶变换,本质上就是在拉普拉斯算子的特征函数基下展开信号4

图没有正弦余弦,但有第 23 章的拉普拉斯矩阵。把归一化拉普拉斯 L=I−D^{−1/2}AD^{−1/2} 做特征分解 L=UΛUᵀ: 特征向量就是图上的频率基,特征值 λ 就是图上的「频率」—— 小特征值对应平滑模式(相邻节点取值接近),大特征值对应剧烈振荡5。 图傅里叶变换因此就是 x̂=Uᵀx,逆变换 x=Ux̂6

谱图卷积照抄卷积定理:先换到图频域、乘一个可学习的频域滤波器、再换回来:

g_θ ∗_G x = U g_θ(Λ) Uᵀ x

(名字里的「谱」就来自这里:卷积的定义依赖拉普拉斯的谱分解)7

但直接用有两个致命伤8:其一,显式特征分解代价太高,大图用不起; 其二,频域滤波器对应的节点域算子不天然局部——而卷积的先验恰恰是局部。 两条病,一副药:多项式近似

5. 从谱到局部:一路化简到 GCN

第一步,多项式滤波器。 把滤波器写成拉普拉斯矩阵的多项式 g_θ(L)=Σₖ αₖLᵏ。妙处在于 Lᵏx 只依赖至多 k 跳邻域—— K 阶多项式天然就是一个 K 跳局部算子,局部性回来了, 而且完全不再需要特征分解9。 ChebNet 用 Chebyshev 多项式做这件事,把复杂度从 O(N³) 降到 O(KE)10

第二步,一阶化简(Kipf)。 取 K=1、近似 λ_max≈2、两个参数共享一个 θ, 得到 θ(I + D^{−1/2}AD^{−1/2})x;再加重规范化技巧——给每个节点加自环 (Ã=A+I,度也重算),让节点更新时保留自身信息:

GCN 一层:H⁽ˡ⁺¹⁾ = σ( D̃^{-1/2} Ã D̃^{-1/2} H⁽ˡ⁾ W⁽ˡ⁾ )

11

节点级视角(两式等价,只是观察角度不同)12:

h_v ← σ( Σ_{u∈N(v)∪{v}} W·h_u / √(d̃_u·d̃_v) )

拆开是三个动作:自环保留自身;对称归一化 1/√(d̃_u d̃_v) 平衡度差异 (3000 邻居的节点不再一手遮天);共享变换 W + 非线性。 「图卷积」三个字至此落到实处:每层只聚合自身与一阶邻居,全图共享同一组 W—— 第 13 章那两条卷积先验,在图上的对应物。

主走查:三节点链上跑一层 GCN

**本章的主走查就在这一段:**把 §5 的化简链用一张最小的图走完一遍。

图:三条节点 u—v—w 连成一条链(演示设定;权重 W = 1、激活取恒等, 特征只有一维)。 邻接矩阵加自环:Ã = A + I;带自环的度 d̃_u = 2、d̃_v = 3、d̃_w = 2。特征向量 X = (1, 0, 0)ᵀ——只有 u 带信息。

第一步:对称归一化矩阵 Â = D̃^(-1/2) Ã D̃^(-1/2),每个元素除以 √(d̃_行 × d̃_列):

Â(u,u) = 1/2 Â(u,v) = 1/√6 ≈ 0.408 Â(u,w) = 0
Â(v,v) = 1/3 Â(v,w) = 0.408 Â(w,w) = 1/2

第二步:一层传播 H = σ(Â X W)(恒等激活下就是矩阵乘向量):

u′ = 0.5×1 = 0.5
v′ = 0.408×1 ≈ 0.408
w′ = 0.408×1 ≈ 0.408

三步读数,对应本章三件事:

读数说明
u 的信号一跳就到达 v 和 w「层数 = L 跳」的数字版:一层只覆盖一跳邻域
v、w 相等(都是 0.408)它们的输入完全对称——一层 GCN 区分不了,这就是 §9 过度平滑与对称性的坑
每个数都是「自己+邻居」的加权平均归一化系数 1/√(d̃_u d̃_v) 压住了度大的边(v 的连边没有被放大)

(全部数值按式 (9.40) 实算;W、X、激活方式为演示设定。)

6. GraphSAGE:把采样写进计算图

GCN 的标准形态是全图训练:每层传播要碰整张图。GraphSAGE 的答案: 执行消息传递之前,先为每个节点随机采样一部分邻居(每层最多 S 个), 只对采样邻居聚合——多层展开的计算规模被钉在常数上, 从而支持小批量训练13

它还带来一个学习范式的区分:归纳学习——训练完成后能推广到 训练时没见过的新节点甚至新图;对照的转导学习只在固定图、 已见节点上预测。采样后的计算图不再依赖全图结构, 新节点来了照采照聚——归纳式场景因此更自然14。 聚合函数给了三种:平均、LSTM、池化(max)—— 书特别提醒:LSTM 对输入顺序敏感,而邻居是集合,需要随机打乱顺序来近似15。 更新公式是熟悉的形状:h_v ← σ(W[h_v ⊕ h_N(S(v))]),再做 ℓ2 归一化16

7. GAT:邻居有轻重

GCN 的聚合权重由度矩阵决定,是固定的;GraphSAGE 的平均也是一视同仁。 图注意力网络(GAT) 说:不同邻居对中心节点的重要性并不相同, 权重应该由模型按特征关系自适应地学出来17

做法与第 20 章同源:先算未归一化注意力系数 e_vu = LeakyReLU(aᵀ[Wh_v⊕Wh_u]),在邻域内 softmax 归一化成权重 α_vu (注意:自身也纳入归一化,等价于保留自环),再加权聚合18; 多头并行,中间层拼接、输出层平均19。 但有一条边界要划清:GAT 的注意力仍局限在局部邻域内, 不是 Transformer 那种全节点自注意力——它仍是消息传递式模型, 只是把固定权重换成了可学习权重20。 (后续的 GATv2 调换线性变换与非线性的顺序,缓解了原版静态注意力的表达限制21。)

8. GIN:聚合函数决定能分辨什么

图级任务有一层别的任务没有的追问:两个不同的图,模型分得出来吗? 先立定义——节点编号不同、连接关系完全相同的两个图是同构的(同一个图)22; 判定不同构的经典工具是 Weisfeiler-Lehman 测试(1-WL,颜色细化): 反复把「自身标签 + 邻居标签的多重集合」映射成新标签; 某轮之后标签分布不同,两图一定不同构;迭代到稳定仍相同, 只能说明 WL 未能区分,不能断定同构23。 (多重集合与普通集合不同,它关心每个元素出现几次——能区分 {a,a,b} 与 {a,b}24。)

图同构网络(GIN) 从 WL 测试拿到设计准则:聚合函数要能区分不同的邻域多重集合。 它的更新只有一行:

h_v ← MLP( (1+ε)·h_v + Σ_{u∈N(v)} h_u )

25

求和聚合是多重集合的充分统计量(加多少次都记得住),配上 MLP 的非线性, GIN 的判别能力与 1-WL 相当。反例当场可见:取两个邻居多重集 {a} 与 {a,a}—— 平均聚合算出都是 a,两个结构被压成同一个表示;求和得到 a 与 2a,分得清清楚楚。 书由此给出那句纲领:聚合函数的设计并不是实现细节, 而是直接决定模型能够区分哪些结构差异25

四家并排放好(表 9.1 的口径)26:

模型聚合训练一句话定位
GCN固定权重平均(归一化)全图简洁入门;依赖同质性,深层易过度平滑
GraphSAGE平均/LSTM/池化,先采样小批量大图与归纳式;采样有近似误差
GAT邻域内注意力常配多头区分邻居轻重;开销高于 GCN
GIN求和 + MLP常用于图分类判别力上限最高;不管大图与长程

9. 三道坎:层深与图大的共同代价

第一道:过度平滑。 一层消息传递是一次「邻居混合」,层层堆叠就是反复混合—— 节点表示逐渐趋同,最终整张图的节点都差不多,节点分类的判别力随之崩塌27。 测量工具有现成的:Dirichlet 能量 E(H)=½Σ A_vu‖h_v−h_u‖²—— 正是第 23 章 xᵀLx 的矩阵版;层数加深它单调走低,趋零即「全部长得一样」28。 缓解:残差连接保留初始特征、随机删边(DropEdge)引入扰动、规范化与能量约束29

第二道:过压缩。 大量远距离信息被强行挤过少数边、低维表示才能到达目标节点, 通道太窄,信息在半路就丢了。树状扩张、瓶颈结构上尤其明显30。 它和过度平滑是两种病:平滑是「越来越像」,压缩是「理论上可达、 路上挤丢了」;书给了一句准确的诊断:消息传递式 GNN 的局限不只来自层太深, 也来自长距离依赖必须经过狭窄结构传播31。 缓解:加长程边或重连、残差/全局注意力、更强的读出与记忆机制。 (这也回应第 23 章的「层数=L 跳」:跳数够得着,不等于信息过得去。)

第三道:大图可扩展。 层数加深,参与计算的节点数指数增长(邻域爆炸), 存储与全图访问都贵32。三条对策按粒度排:邻居采样(GraphSAGE, 围绕目标节点建局部计算图)、子图采样(GraphSAINT,直接采子图训练)、 图划分分块(Cluster-GCN,先分簇再训练)33—— 在精度、采样偏差、计算效率之间做权衡,没有唯一答案34

10. 作者的判断与证据

书里给了推导链的: 卷积定理到谱图卷积再到多项式近似的完整路线, 「K 阶多项式天然 K 跳局部」的论证259; GCN 化简的每一步(K=1、λ_max≈2、自环、对称归一化)11

书里给了定理级结论的: GIN 与 1-WL 判别力对应[Xu et al., 2019]; WL 测试「分布不同→一定不同构;稳定相同→未能否证」的不对称性23

书里给了严谨交代的: GAT 仍是局部消息传递、不是全连接注意力20; LSTM 聚合对顺序敏感需打乱15;采样带来近似误差(表 9.1)26; 1-WL 不能解决所有同构问题23

书里给了三道坎的机理与对策的: Dirichlet 能量量化过度平滑28; 过压缩与平滑的病名区分及「狭窄结构」诊断31;三种采样粒度的取舍33

11. 边界与局限

谱方法的推导全部建立在无向图与归一化拉普拉斯上,有向图、动态图的谱定义未覆盖; GCN 依赖同质性(第 23 章伏笔),异配图上朴素邻域聚合会失效——书在表 9.1 点了一句26

四个模型都是消息传递的填空题:图 Transformer、图自监督、图生成、 时空图与异质图被列为后续线索而未展开35; 「图上要不要位置编码」(Transformer 一章的刚需)本章完全没有出现。

三道坎的缓解都只有方向名单:DropEdge 怎么删、重连边怎么选、 能量约束怎么进损失,机制细节都在引文里,正文不展开2931

WL 框架的天花板书里说了但没给例子:存在 1-WL 区分不了的不同构图, 哪一类、为什么,需查原文23

12. 可带走的

  1. 卷积 = 换基→逐点乘→换回;图上的频率基 = 拉普拉斯特征向量,特征值 = 频率;
  2. 谱图卷积 U g_θ(Λ) Uᵀx 的两宗罪:特征分解贵、不天然局部;
  3. 多项式滤波器一步治两病:K 阶多项式 = K 跳局部算子,且不用特征分解;
  4. GCN = 谱卷积的一阶简化:自环保自身、对称归一化平度差、共享 W;
  5. GraphSAGE 的贡献是范式:邻居采样写进计算图,换来小批量训练与归纳能力;
  6. GAT 只在邻域内做注意力——权重可学,但没跳出消息传递;
  7. 聚合函数不是实现细节:求和保多重集合信息(GIN≈1-WL),平均会把 {a} 和 {a,a} 压成一个;
  8. 过度平滑用 Dirichlet 能量(=xᵀLx 的推广)度量,层深趋同;
  9. 过压缩是通道病不是层数病:长距离信息挤过窄边就丢;
  10. 大图三对策按粒度排:邻居采样 → 子图采样 → 图划分,精度-偏差-效率三选二。

13. 原文地图

主题原书章原文位置
卷积两特征与推广第9章 图神经网络text/10-ch09.txt:502(搜「局部连接与参数共享」) · text/10-ch09.txt:514(搜「邻域聚合」)
卷积定理第9章 图神经网络text/10-ch09.txt:565(搜「卷积定理:时域中的卷积」
频率基第9章 图神经网络text/10-ch09.txt:575(搜「频率基(Frequency Basis」) · text/10-ch09.txt:578(搜「变化缓慢的成分对应低频」)
特征函数视角第9章 图神经网络text/10-ch09.txt:594(搜「特征函数(Eigenfunction」) · text/10-ch09.txt:603(搜「在拉普拉斯算子的特征函数基下展」)
图傅里叶与频率第9章 图神经网络text/10-ch09.txt:617(搜「图傅里叶变换(Graph Fourier Transform」) · text/10-ch09.txt:625(搜「较大的特征值对应更剧烈」)
谱图卷积第9章 图神经网络text/10-ch09.txt:639(搜「谱图卷积(Spectral Graph Convolution」) · text/10-ch09.txt:644(搜「谱分解」)
两局限第9章 图神经网络text/10-ch09.txt:648(搜「特征分解代价较」)
多项式与 ChebNet第9章 图神经网络text/10-ch09.txt:670(搜「𝐾 阶多项式滤波器天然对应一个」) · text/10-ch09.txt:672(搜「Chebyshev 多项式对谱域滤波器」)
GCN 化简链第9章 图神经网络text/10-ch09.txt:701(搜「重规范化技巧」) · text/10-ch09.txt:712(搜「谱图卷积最终可近似为」) · text/10-ch09.txt:733(搜「式(9.40)给出了图卷积网络的一层矩阵传播形式」)
节点级展开第9章 图神经网络text/10-ch09.txt:743(搜「带对称归一化的邻域聚合」)
三节点链图例第9章 图神经网络text/10-ch09.txt:760(搜「三节点链图」) · text/10-ch09.txt:775(搜「并不是简单地对邻居特征做平均」)
GraphSAGE第9章 图神经网络text/10-ch09.txt:782(搜「邻居采样和归纳学习」) · text/10-ch09.txt:784(搜「归纳学习(Inductive Learning」) · text/10-ch09.txt:794(搜「采样一部分邻居」)
LSTM 聚合顺序第9章 图神经网络text/10-ch09.txt:827(搜「对输入顺序敏感」)
GAT第9章 图神经网络text/10-ch09.txt:858(搜「图注意力网络(Graph Attention Network」) · text/10-ch09.txt:863(搜「仍然局限在局部邻域内」) · text/10-ch09.txt:880(搜「将节点自身也纳入归一化范围」) · text/10-ch09.txt:911(搜「GATv2 调整了线性变换与非」)
图同构与 WL第9章 图神经网络text/10-ch09.txt:922(搜「图同构(Graph Isomorphism」) · text/10-ch09.txt:934(搜「Weisfeiler-Lehman 同构测试」) · text/10-ch09.txt:937(搜「多重集合与 普 通 集 合」) · text/10-ch09.txt:966(搜「未能区分这两个图」)
GIN第9章 图神经网络text/10-ch09.txt:1002(搜「求和聚合并配合 MLP」) · text/10-ch09.txt:1006(搜「并不是实现细节」)
四模型比较第9章 图神经网络text/10-ch09.txt:1021(搜「几类经典图神经网络的比较」) · text/10-ch09.txt:1016(搜「GCN 关注如何做归一化」)
过度平滑第9章 图神经网络text/10-ch09.txt:1053(搜「过度平滑(Oversmoothing」) · text/10-ch09.txt:1060(搜「Dirichlet 能量(Dirichlet Energy」) · text/10-ch09.txt:1076(搜「随机删除边」)
过压缩第9章 图神经网络text/10-ch09.txt:1083(搜「过压缩(Oversquashing」) · text/10-ch09.txt:1100(搜「必须经过狭窄结构传播」)
可扩展性第9章 图神经网络text/10-ch09.txt:1106(搜「可扩展性(Scalability」) · text/10-ch09.txt:1112(搜「邻域爆炸」) · text/10-ch09.txt:1124(搜「GraphSAINT 就是这一思路」) · text/10-ch09.txt:1128(搜「Cluster-GCN 就是这一路线」)

Footnotes

  1. 出处:「第9章 图神经网络」第 502 至 506 段(text/10-ch09.txt:502,搜「局部连接与参数共享」),式(9.18)。

  2. 出处:「第9章 图神经网络」第 565 至 570 段(text/10-ch09.txt:565,搜「卷积定理:时域中的卷积」), 定理 9.1,式(9.22)-(9.23)。 2

  3. 出处:「第9章 图神经网络」第 575 至 578 段(text/10-ch09.txt:575,搜「频率基(Frequency Basis」)。

  4. 出处:「第9章 图神经网络」第 596 至 606 段(text/10-ch09.txt:603,搜「在拉普拉斯算子的特征函数基下展」), 式(9.24)-(9.25)。

  5. 出处:「第9章 图神经网络」第 610 至 620 段(text/10-ch09.txt:617,搜「图傅里叶变换(Graph Fourier Transform」; text/10-ch09.txt:625,搜「较大的特征值对应更剧烈」),式(9.26)-(9.29)。 2

  6. 出处:「第9章 图神经网络」第 614 至 618 段,式(9.28)-(9.29)。

  7. 出处:「第9章 图神经网络」第 642 至 646 段(text/10-ch09.txt:639,搜「谱图卷积(Spectral Graph Convolution」, 式(9.30)-(9.31);「谱」的得名是右侧边注(搜「谱分解」)。

  8. 出处:「第9章 图神经网络」第 648 至 656 段(text/10-ch09.txt:648,搜「特征分解代价较」)。

  9. 出处:「第9章 图神经网络」第 660 至 668 段(text/10-ch09.txt:670,搜「𝐾 阶多项式滤波器天然对应一个」, 式(9.32)-(9.33)。 2

  10. 出处:「第9章 图神经网络」第 682 至 694 段(text/10-ch09.txt:672,搜「Chebyshev 多项式对谱域滤波器」), 复杂度 O(N³)→O(KE) 见「数学小知识」框,式(9.34)[Defferrard et al., 2016]。

  11. 出处:「第9章 图神经网络」第 700 至 732 段(text/10-ch09.txt:701,搜「重规范化技巧」; text/10-ch09.txt:712,搜「谱图卷积最终可近似为」,式(9.35)-(9.40)[Kipf et al., 2017]。 2

  12. 出处:「第9章 图神经网络」第 736 至 746 段(text/10-ch09.txt:743,搜「带对称归一化的邻域聚合」, 节点级展开式(9.41);「矩阵形式强调整图并行传播,节点形式强调单点汇聚」在其后。

  13. 出处:「第9章 图神经网络」第 794 至 800 段(text/10-ch09.txt:794,搜「采样一部分邻居」)[Hamilton et al., 2017]。

  14. 出处:「第9章 图神经网络」第 786 至 790 段(text/10-ch09.txt:784,搜「归纳学习(Inductive Learning」)。

  15. 出处:「第9章 图神经网络」第 827 段(text/10-ch09.txt:827,搜「对输入顺序敏感」,式(9.43)-(9.45)。 2

  16. 出处:「第9章 图神经网络」第 840 至 852 段(搜「节点自身特征与聚合后的邻」定位),式(9.46)-(9.47)。

  17. 出处:「第9章 图神经网络」第 858 至 862 段(text/10-ch09.txt:858,搜「图注意力网络(Graph Attention Network」), 「不同邻居对中心节点的重要性并不相同」为该节首句 [Velickovic et al., 2018]。

  18. 出处:「第9章 图神经网络」第 870 至 892 段(text/10-ch09.txt:880,搜「将节点自身也纳入归一化范围」, 式(9.48)-(9.50)。

  19. 出处:「第9章 图神经网络」第 894 至 900 段(搜「中间层常用拼接」定位),式(9.51)-(9.52)。

  20. 出处:「第9章 图神经网络」第 863 段(text/10-ch09.txt:863,搜「仍然局限在局部邻域内」。 2

  21. 出处:「第9章 图神经网络」第 902 至 906 段(text/10-ch09.txt:911,搜「GATv2 调整了线性变换与非」[Brody et al., 2022]。

  22. 出处:「第9章 图神经网络」第 918 至 922 段(text/10-ch09.txt:922,搜「图同构(Graph Isomorphism」,式(9.53)。

  23. 出处:「第9章 图神经网络」第 932 至 968 段(text/10-ch09.txt:934,搜「Weisfeiler-Lehman 同构测试」; text/10-ch09.txt:966,搜「未能区分这两个图」,式(9.54)-(9.55)。 2 3 4

  24. 出处:「第9章 图神经网络」第 937 段(text/10-ch09.txt:937,搜「多重集合与 普 通 集 合」。 这是原书边注(排版跨行),说明多重集合关心出现次数、能区分 {a,a,b} 与 {a,b}。

  25. 出处:「第9章 图神经网络」第 996 至 1006 段(text/10-ch09.txt:1002,搜「求和聚合并配合 MLP」; text/10-ch09.txt:1006,搜「并不是实现细节」,式(9.56)[Xu et al., 2019]。 2

  26. 出处:「第9章 图神经网络」第 1012 至 1018 段(text/10-ch09.txt:1021,搜「几类经典图神经网络的比较」,表 9.1; 发展脉络三分类在第 1020 至 1022 段。 2 3

  27. 出处:「第9章 图神经网络」第 1055 至 1060 段(text/10-ch09.txt:1053,搜「过度平滑(Oversmoothing」。

  28. 出处:「第9章 图神经网络」第 1062 至 1070 段(text/10-ch09.txt:1060,搜「Dirichlet 能量(Dirichlet Energy」, 式(9.57)[Zhou et al., 2021]。 2

  29. 出处:「第9章 图神经网络」第 1072 至 1080 段(text/10-ch09.txt:1076,搜「随机删除边」, 三条缓解(残差/随机扰动/规范化与能量约束)为原文列举。 2

  30. 出处:「第9章 图神经网络」第 1086 至 1098 段(text/10-ch09.txt:1083,搜「过压缩(Oversquashing」。

  31. 出处:「第9章 图神经网络」第 1100 至 1102 段(text/10-ch09.txt:1100,搜「必须经过狭窄结构传播」。 2 3

  32. 出处:「第9章 图神经网络」第 1108 至 1120 段(text/10-ch09.txt:1112,搜「邻域爆炸」。

  33. 出处:「第9章 图神经网络」第 1122 至 1136 段(text/10-ch09.txt:1124,搜「GraphSAINT 就是这一思路」; text/10-ch09.txt:1128,搜「Cluster-GCN 就是这一路线」[Zeng et al., 2020; Chiang et al., 2019]。 2

  34. 出处:「第9章 图神经网络」第 1138 段(搜「没有唯一答案」定位)。

  35. 出处:「第9章 图神经网络」第 1168 至 1176 段(搜「图 Transformer」定位)[Ying et al., 2021; Hu et al., 2020]。