跳到主要内容

这一章讲一个省钱的结构:不把「图片长什么样」的先验教给模型,而是把它焊死在连线方式里——焊完之后,参数量(可学旋钮的总数)缩小了几个数量级,效果反而更好。

卷积:局部连接与权重共享

1. 这一章讲什么

三件事: 全连接网络处理图片亏在哪(两个具体问题); 卷积凭什么同时把这两个问题解决掉(局部连接 + 权重共享); 以及卷积层、汇聚层各自怎么算、反向传播在它们上面怎么走。

它在全书链条里的位置: 这是「结构就是先验」这一主题的第一章。 第 07 章说选择归纳偏置是模型设计的全部艺术, 这一章给出历史上最成功的那个归纳偏置——第 07 章原话: 卷积网络假设数据具有局部性和平移不变性。 第 14 章讲它在二十年里的演化,第 24 章会把它搬到图上再拆一次。

需要第 10、11 章。

2. 顶层全景

全连接:每个神经元连所有输入 卷积层:两个改动
100×100×3 = 30000 个输入 ① 局部连接:只看 K×K 的窗口
× 256 个神经元 = 768 万参数 ──▶ ② 权重共享:全图共用同一个核
参数 = 核大小 × 通道数,与图片大小无关

一个卷积层在算什么:
输入特征图组(D 个通道)──▶ 每个输出通道:一组核分别卷各输入通道再相加
─▶ 加偏置、过激活 ─▶ 输出特征图组(P 个通道)

汇聚层:每个 2×2 小区域只留一个数(最大或平均)
──▶ 分辨率减半,感受野变大,小的位置扰动不再影响结果

一句话链条: 图片的两条先验(局部相关、模式可出现在任何位置)→ 把先验焊进连线方式 → 参数量与图片大小脱钩 → 分辨率靠汇聚层逐层压下来 → 第 14 章的全部演化都建立在这两个改动上。

3. 全连接处理图片,有多亏

先把账算清楚,才知道卷积省的是什么。

书里给了一组数:一张 100 × 100 × 3(高、宽、颜色通道)的图片, 摊平就是 30000 个数。全连接网络里,第一个隐藏层的每个神经元 都要连全部 30000 个输入——哪怕隐藏层只有 256 个神经元, 参数量就已经达到约 768 万1。层数一加,参数规模急剧膨胀, 训练效率低,还更容易过拟合1

比参数更要命的是第二个问题:这套连法对图片一无所知2。 自然图像里,相邻的像素通常强相关;而且同一种局部模式 (一道边、一个角)可能出现在图片的任何位置。 全连接对每个位置单独学一套权重——同一个花纹出现在左上角和右下角, 它要当成两件事从头学两遍。这两条「局部相关」「位置无关」, 就是卷积要焊进结构里的先验。

卷积的生物学原型叫感受野:视觉皮层里的一个神经元, 只对视网膜上某个特定区域内的刺激有反应3—— 「只看局部」这件事,眼睛早就这么干了。

4. 卷积:滑动窗口内的加权求和

先看一维,它最初的用途和图片无关。

信号处理里有个经典场景:此刻收到的信号,是此刻新到的信息 加上过去几个时刻的延迟叠加——越久远的时刻,衰减得越狠4。 写成式子:y_t = 1·x_t + ½·x_{t−1} + ¼·x_{t−2}。 那串衰减系数 [1, ½, ¼] 叫滤波器,也叫卷积核5

这就是卷积的全部本质:局部加权求和5。 长度为 K 的滤波器,在一个窗口一个窗口地滑过序列, 每个位置算一次「窗口内 K 个数 × K 个权重,求和」。

换一组权重,就换一种「看什么」。 书里给了两组对照6:

w = [1/3, 1/3, 1/3] 窗口内取平均 ──▶ 平滑,留下缓变的趋势(低频)
w = [1, −2, 1] 两边减中间的两倍 ──▶ 突出剧烈变化(高频),近似二阶微分

传统信号处理里,这些滤波器是人工设计的; 卷积神经网络的全部不同,就是把这些权重变成可学习参数, 让任务自己决定该看什么6

翻到二维,公式一个样: 滤波器变成 K×K 的小方块, 在图片上逐位置滑动,每次算一次「小方块对应位置相乘再求和」7。 卷完得到的那张新图,叫特征图8—— 可以把它读作「原图在这种模式上的得分图」: 哪块区域像这个核要找的花纹,哪块得分就高。

一个名词上的坦白: 严格的数学卷积要求先把卷积核翻转 180 度再滑窗, 而深度学习里实际上滑的是不翻转的版本,它的学名叫互相关9。 书里和几乎所有框架都直接用互相关,理由是: 卷积核是可学习的,翻不翻转在表示能力上完全等价9—— 所以本书后面说「卷积」都指互相关,知道这件小事, 以后读文献见到「翻转」两个字不会慌。

5. 步长与零填充:输出到底多大

两个旋钮,决定输出特征图的尺寸。

步长:卷积核每次滑动几格10。步长 2 等于跳着看,输出尺寸直接减半—— 所以它同时是一种下采样手段。 零填充:在输入的边缘外面补几圈 010。 不补的话,边缘像素被窗口覆盖的次数天然少于中间像素,输出还会缩水。

输出长度有确定公式:输入 M、核 K、步长 S、两端各补 P 个零, 输出长度 = ⌊(M − K + 2P)/S⌋ + 111。 三个常用配置各有名字12:

名字步长补零输出长度用途
窄卷积10M − K + 1输出缩小
宽卷积1K − 1M + K − 1输出变大(反向传播用)
等宽卷积1(K−1)/2M层与层之间尺寸不变

等宽卷积是工程上的默认选择:尺寸不变,几十层叠起来不用天天算尺寸。

6. 卷积层:从一张图到一组特征图

现在把第 4 节的零件装成网络的一层。两个结构特性,是参数缩水的全部原因13:

局部连接 每个神经元只和前一层一个 K×K 窗口相连
── 连接数从 M_l × M_{l−1} 降到 M_l × K

权重共享 同一个卷积核在所有空间位置上复用
── 一个核在全图上寻找同一种局部模式
── 想找几种模式,就用几个核

「同一种局部模式可能出现在不同位置」这条先验, 就这样被显式编码进了网络结构14:参数只剩一个 K 维的核加一个偏置, 参数个数和神经元数量无关14

真实的卷积层是三维的:输入、输出、核都有「深度」(通道)。 彩色图进来是 3 个通道(RGB 三张特征图); 要输出 P 个特征图,就配 P 组核。每个输出特征图的算法是: 这组里的 D 个核,分别去卷 D 个输入通道,把 D 张结果相加, 再加一个偏置、过一道激活15

参数量的公式值得背下来:P 个输出通道 × D 个输入通道 × (U × V 的核) + P 个偏置16注意这个公式里没有图片的高和宽—— 图片从 32×32 换成 1024×1024,这一层的参数量一个数都不变16。 第 3 节那 768 万,就是这样塌下来的。

核的退化情形意外有用:1×1 卷积。 窗口缩到一个点,空间上什么也不看, 但它对每个位置的 D 个通道做一次线性组合—— 所以它是「在通道维上升降维、重组特征」的专用工具17, 第 14 章的 Inception 和瓶颈结构全靠它。

7. 汇聚层:把分辨率降下来

先看问题: 卷积层减少了连接数,但神经元的个数并没有显著减少18—— 特征图还是那么大,后面接分类器,输入维数依然高得容易过拟合。

汇聚层(更多地方叫它池化——把相邻格子并成一个数)的做法: 把每个特征图划成小区域(典型是 2×2 不重叠), 每个区域只留一个数——留最大的叫最大汇聚,取平均的叫平均汇聚19。 2×2 一划,分辨率减半。

这一半换来三样东西18:计算量跟着降; 后续单元的感受野变大(看得更远了); 对局部平移的鲁棒(挪几个像素照样认得出)——花纹挪了一个像素, 2×2 区域里的最大值多半还是那个值。

把这件事推到头,就是全局平均汇聚(GAP): 每个通道的所有空间位置取平均,一整组特征图压成一个 D 维向量20它常用于替掉顶部那一大块全连接层—— 经典结构顶部全连接层有多少参数、GAP 怎么把它整个替掉,第 14 章用真数字走。

书里也给了一句边界:汇聚区域开太大, 会急剧减少神经元数量,造成过多的信息损失21

最后把一个容易混的概念对整齐: 卷积本身带来的是平移等变性—— 图片平移,特征图跟着平移(效果「传递」到输出); 而分类要的平移不变性——猫在左上角还是右下角,答案都一样—— 来自汇聚、步长、全局平均汇聚和数据增强等机制的共同作用22。 两个字差一笔,说的是两件事。

8. 反向传播在卷积上怎么走

第 11 章的三步一步不变,只是两条对应规则要换。

先看汇聚层:它没有参数,只要把误差传回去。 反向就是下采样的逆操作——上采样23: 最大汇聚时,误差只传给前向时那个最大值所在的位置,其余位置补 0; 平均汇聚时,误差平均分给区域里每个位置23

再看卷积层,两条规则书里给了推导24:

参数梯度 = 上游梯度 ⊗ 输入
── 一次互相关(与全连接的 δ·aᵀ 对应)

输入梯度 = rot180(卷积核) ⊗̃ 上游梯度
── 翻转 180 度的核,做一次宽卷积
── 与全连接的 Wᵀδ 对应

第二条的「翻转 + 宽卷积」和第 5 节的表格对上了: 反向用的正是宽卷积。书里还点了一句: 这和全连接层「前向乘 W、反向乘 Wᵀ」的转置关系完全类比24—— 第 14 章的转置卷积,就是从这个转置关系里长出来的。

还有权重共享带来的一笔账: 同一个核在全图所有位置复用, 它的梯度要累加所有空间位置对它的贡献25—— 共享不是白得的,反向时每个位置都要向这个核「汇报」。

9. 主走查:一张 4×4 的图,从头算到尾

输入: 习题 5-1 那组数(原书给的):4×4 的棋盘格输入, 2×2 的卷积核 [[1,0],[0,1]]。池化区域的划法是我们为演示选的。

输入 X = [ 1 0 1 0 ] 核 W = [ 1 0 ]
[ 0 1 0 1 ] [ 0 1 ]
[ 1 0 1 0 ]
[ 0 1 0 1 ]

第一步:窄卷积(步长 1、不补零)。 核的意思是「主对角线两个数相加」,输出 3×3:

y₁₁ = 1+1 = 2 y₁₂ = 0+0 = 0 y₁₃ = 1+1 = 2
y₂₁ = 0+0 = 0 y₂₂ = 1+1 = 2 y₂₃ = 0+0 = 0
y₃₁ = 1+1 = 2 y₃₂ = 0+0 = 0 y₃₃ = 1+1 = 2

特征图 = [ 2 0 2 ]
[ 0 2 0 ]
[ 2 0 2 ]

棋盘格配「主对角线核」,特征图把原图的斜向纹理原样照了出来—— 「核决定看什么」,在这一步是肉眼可见的。

第二步:2×2 最大汇聚(步长 1,演示用)。 四个 2×2 区域的最大值都是 2,输出 [[2,2],[2,2]]。 注意左上区域 {2,0,0,2} 里那两个 0 被直接丢掉了—— 「只留最强的响应」,信息就是这么压缩的。

第三步:算参数量和连接数。

卷积层参数:1 个核 × (2×2) + 1 个偏置 = 5 个
── 输入从 4×4 换成 400×400,这 5 个一个都不变

连接数:9 个输出位置 × 每位置 4 条连接(共享同一组权重) = 36

对照(同输入全连接到 9 个神经元):16 × 9 + 9 = 153 个参数

5 对 153,三十倍的差距——而且输入越大,全连接那边线性涨,卷积这边不动。 再回想第 3 节:100×100×3 的图,全连接到 256 个神经元是 768 万; 换成 256 个 3×3×3 的卷积核,参数是 256×27+256 = 7168——千分之一。

10. 作者的判断与证据

书里给了机制解释的: 全连接处理图像的两个问题(参数量、先验缺失)12; 局部连接与权重共享如何对应那两条先验1314; 汇聚层三样收益(降分辨率、扩感受野、局部平移鲁棒)18

书里给了精确交代的: 卷积与互相关的区别、以及「可学习核下两者等价」9; 「深度学习工具中的卷积,其实现实际上都是互相关」9; 等变性与不变性不是一回事,不变性来自多种机制的共同作用22—— 这一条把很多人含糊带过的说法点破了。

书里给了推导的: 卷积上的两条反向规则 (参数梯度 = 互相关,输入梯度 = 翻转核宽卷积)24, 以及它与全连接转置关系的类比24

书里坦白的: 汇聚区域过大「会造成过多的信息损失」21; 转置卷积叫「反卷积」「并不太恰当,它不是指卷积的逆运算」26—— 名词上的讹传,书里逐个做了纠正。

11. 边界与局限

卷积的先验是「局部 + 平移」,仅此而已。 长距离的依赖(图片最左和最右的关系)它一层看不到,要靠层数堆; 尺度、旋转的鲁棒性,书里明说「往往需要借助数据增强或专门的结构设计」27—— 结构本身不管。

和注意力的分工,书里在总结节给了冷静的对照: 卷积参数效率高、数据效率好;注意力擅长全局交互和长距离依赖; 现代视觉模型不是「卷积被替代」,而是两者的重新组合28

卷积的数学性质(交换性等)只讲了反向要用的部分。 傅里叶视角下的卷积定理,第 24 章讲图上的谱方法时会真正用到。

12. 可带走的

  1. 全连接处理图片:第一层 768 万参数,还对图片的两条先验一无所知;
  2. 卷积 = 滑动窗口内的加权求和,核决定看什么,输出叫特征图;
  3. 深度学习里的「卷积」其实是不翻转的互相关——核可学习,两者等价;
  4. 局部连接 + 权重共享,把两条先验焊进结构:参数量与图片大小从此无关;
  5. 输出尺寸 = ⌊(M − K + 2P)/S⌋ + 1,窄/宽/等宽只是三组配置;
  6. 多通道:每个输出通道 = 一组核分别卷各输入通道再相加;
  7. 1×1 卷积不看空间,专管通道维的升降与重组;
  8. 汇聚层(池化)降分辨率、扩感受野、给一点平移鲁棒;GAP 把一整组压成一个向量;
  9. 等变是「跟着移」,不变是「移了也一样」——卷积给前者,汇聚等机制给后者;
  10. 卷积的反向:参数梯度 = 输入与上游梯度的互相关,输入梯度 = 翻转核宽卷积。

13. 原文地图

主题原书章原文位置
全连接的两个问题第5章 卷积神经网络text/06-ch05.txt:14(搜「7.68 百万」) · text/06-ch05.txt:18(搜「同一种局部模式也可能出现在图像的不同位置」)
感受野第5章 卷积神经网络text/06-ch05.txt:22(搜「感受野」)
一维卷积与滤波器第5章 卷积神经网络text/06-ch05.txt:57(搜「延迟累积」) · text/06-ch05.txt:69(搜「局部加权求和运算」)
人工设计与可学习第5章 卷积神经网络text/06-ch05.txt:91(搜「由人工设计」) · text/06-ch05.txt:145(搜「通过任务驱动的训练自动学习」)
二维卷积与特征图第5章 卷积神经网络text/06-ch05.txt:144(搜「称为特征图」)
互相关第5章 卷积神经网络text/06-ch05.txt:192(搜「不翻转卷积」) · text/06-ch05.txt:205(搜「特别是当卷积核是可学习的参数时」) · text/06-ch05.txt:208(搜「其实现实际上都是互相」)
步长与零填充第5章 卷积神经网络text/06-ch05.txt:216(搜「滑动时的时间间隔」) · text/06-ch05.txt:220(搜「在输入向量两端进行补零」)
三类卷积第5章 卷积神经网络text/06-ch05.txt:248(搜「窄卷积」) · text/06-ch05.txt:252(搜「宽卷积」) · text/06-ch05.txt:258(搜「等宽卷积」)
局部连接与权重共享第5章 卷积神经网络text/06-ch05.txt:369(搜「局部窗口内的神经元相连」) · text/06-ch05.txt:375(搜「寻找同一种局部模式」) · text/06-ch05.txt:383(搜「参数个数和神经元数量无关」)
多通道卷积层第5章 卷积神经网络text/06-ch05.txt:428(搜「然后将卷积结果相加」) · text/06-ch05.txt:471(搜「和输入特征图的空间大小」)
1×1 卷积第5章 卷积神经网络text/06-ch05.txt:473(搜「在通道维度上进行线性变换」)
汇聚层第5章 卷积神经网络text/06-ch05.txt:480(搜「降低空间分辨率、减少计算量」) · text/06-ch05.txt:518(搜「小的局部形态变化」) · text/06-ch05.txt:547(搜「过多的信息损失」)
全局平均汇聚第5章 卷积神经网络text/06-ch05.txt:549(搜「压缩为一个 𝐷 维向量」)
等变性与不变性第5章 卷积神经网络text/06-ch05.txt:33(搜「平移的等变性」) · text/06-ch05.txt:42(搜「具有等变性」)
卷积上的反向传播第5章 卷积神经网络text/06-ch05.txt:319(搜「参数梯度等于上游梯度与输入的互相关操作」) · text/06-ch05.txt:346(搜「这与全连接层中前向/反向对应矩阵转置的关系完全类比」) · text/06-ch05.txt:601(搜「累加所有空间位置对它的贡献」)
汇聚层的反向第5章 卷积神经网络text/06-ch05.txt:661(搜「最大值所对应的神经元」)
卷积与注意力的分工第5章 卷积神经网络text/06-ch05.txt:1236(搜「卷积被替代」)

Footnotes

  1. 出处:「第5章 卷积神经网络」第 14 段(text/06-ch05.txt:14,搜「7.68 百万」)。 原文:「如果输入图像大小为 100 × 100 × 3……在全连接前馈网络中, 第一个隐藏层的每个神经元到输入层都有 30000 个互相独立的连接…… 假设隐藏层仅有 256 个神经元,参数量就已达到约 7.68 百万, 随着隐藏层数和神经元数量的增多,参数规模会急剧增加。 这会导致网络训练效率较低,也更容易出现过拟合。」 2 3

  2. 出处:「第5章 卷积神经网络」第 18 段(text/06-ch05.txt:18,搜「同一种局部模式也可能出现在图像的不同位置」)。 原文:「自然图像中的像素通常具有较强的局部相关性,同一种局部模式也可能出现在 图像的不同位置。全连接前馈网络没有显式利用这种空间局部结构和平移先验, 因此统计效率较低。」 2

  3. 出处:「第5章 卷积神经网络」第 22 段(text/06-ch05.txt:22,搜「感受野」)。 原文:「卷积神经网络是受生物学上感受野机制的启发而提出的…… 一个神经元的感受野是指视网膜上的特定区域, 只有这个区域内的刺激才能够激活该神经元。」

  4. 出处:「第5章 卷积神经网络」第 57 段(text/06-ch05.txt:57,搜「延迟累积」)。 原文:「一维卷积经常用在信号处理中,用于计算信号的延迟累积。」

  5. 出处:「第5章 卷积神经网络」第 68 段(text/06-ch05.txt:68,搜「称为滤波器」) 与第 69 段(text/06-ch05.txt:69,搜「局部加权求和运算」)。 原文:「我们把 w₁, w₂, ⋯ 称为滤波器或卷积核。 卷积本质上可以看作一种局部加权求和运算。」 2

  6. 出处:「第5章 卷积神经网络」第 84 段(text/06-ch05.txt:84,搜「二阶微分」) 与第 91 段(text/06-ch05.txt:91,搜「由人工设计」)。 原文:「当令滤波器 w = [1/K, ⋯, 1/K] 时,卷积相当于信号序列的简单移动平均; 当令滤波器 w = [1, −2, 1] 时,可以近似实现对信号序列的二阶微分…… 在传统信号处理或图像处理中,这些滤波器往往由人工设计; 而在卷积神经网络中,卷积核通常作为可学习参数从数据中自动学习得到。」 2

  7. 出处:「第5章 卷积神经网络」第 116 段(text/06-ch05.txt:116,搜「𝑦𝑖𝑗 = ∑ ∑ 𝑤𝑢𝑣」)。 二维卷积定义见公式(5.7)。

  8. 出处:「第5章 卷积神经网络」第 144 段(text/06-ch05.txt:144,搜「称为特征图」)。 原文:「在图像处理中,卷积经常作为特征提取的有效方法。 一幅图像在经过卷积操作后得到结果称为特征图。」

  9. 出处:「第5章 卷积神经网络」第 192 段(text/06-ch05.txt:192,搜「不翻转卷积」)、 第 205 段(text/06-ch05.txt:205,搜「特别是当卷积核是可学习的参数时」) 与第 208 段(text/06-ch05.txt:208,搜「其实现实际上都是互相」)。 原文:「互相关和卷积的区别仅仅在于卷积核是否进行翻转。因此互相关也可以称为 不翻转卷积……特别是当卷积核是可学习的参数时,卷积和互相关在表示能力上是等价的…… 事实上,很多深度学习工具中的『卷积』操作,其实现实际上都是互相关。」 2 3 4

  10. 出处:「第5章 卷积神经网络」第 216 段(text/06-ch05.txt:216,搜「滑动时的时间间隔」) 与第 220 段(text/06-ch05.txt:220,搜「在输入向量两端进行补零」)。 2

  11. 出处:「第5章 卷积神经网络」第 237 段(text/06-ch05.txt:237,搜「𝑀′ = ⌊」)。 输出长度公式见公式(5.12),二维版见公式(5.13)。

  12. 出处:「第5章 卷积神经网络」第 248 段(text/06-ch05.txt:248,搜「窄卷积」)、 第 252 段(text/06-ch05.txt:252,搜「宽卷积」)与第 258 段(text/06-ch05.txt:258,搜「等宽卷积」)。

  13. 出处:「第5章 卷积神经网络」第 369 段(text/06-ch05.txt:369,搜「局部窗口内的神经元相连」)。 原文:「在卷积层中的每一个神经元都只和前一层中某个局部窗口内的神经元相连, 构成一个局部连接网络……由原来的 M_l × M_{l−1} 个连接变为 M_l × K 个连接…… 除了减少参数量,更重要的是它显式利用了输入数据中的局部结构先验。」 2

  14. 出处:「第5章 卷积神经网络」第 375 段(text/06-ch05.txt:375,搜「寻找同一种局部模式」) 与第 383 段(text/06-ch05.txt:383,搜「参数个数和神经元数量无关」)。 原文:「权重共享可以理解为一个卷积核在整个输入空间上寻找同一种局部模式, 因此如果要提取多种特征,就需要使用多个不同的卷积核…… 卷积层的参数只有一个 K 维的权重和 1 维的偏置,共 K + 1 个参数。 参数个数和神经元数量无关……也把『同一种局部模式可能出现在不同位置』 这一先验显式编码进了网络结构中。」 2 3

  15. 出处:「第5章 卷积神经网络」第 428 段(text/06-ch05.txt:428,搜「然后将卷积结果相加」)。 原文:「为了计算输出特征图 Y⁽ᵖ⁾,用卷积核 W⁽ᵖʼ¹⁾, ⋯, W⁽ᵖʼᴰ⁾ 分别对 输入特征图 X⁽¹⁾, ⋯, X⁽ᴰ⁾ 进行卷积,然后将卷积结果相加,并加上一个标量偏置 得到卷积层的净输入,再经过非线性激活函数后得到输出特征图。」

  16. 出处:「第5章 卷积神经网络」第 469 段(text/06-ch05.txt:469,搜「𝑃 × 𝐷 × (𝑈 × 𝑉 ) + 𝑃」) 与第 471 段(text/06-ch05.txt:471,搜「和输入特征图的空间大小」)。 原文:「注意参数量和输入特征图的空间大小 M × N 无关, 只与卷积核大小、输入通道数和输出通道数有关。」 2

  17. 出处:「第5章 卷积神经网络」第 473 段(text/06-ch05.txt:473,搜「在通道维度上进行线性变换」)。 原文:「当卷积核大小为 1 × 1 时,卷积主要在通道维度上进行线性变换, 因此常用于通道数的升维、降维或不同通道特征的重组。」

  18. 出处:「第5章 卷积神经网络」第 480 段(text/06-ch05.txt:480,搜「降低空间分辨率、减少计算量」) 与第 518 段(text/06-ch05.txt:518,搜「小的局部形态变化」)。 原文:「汇聚层也叫子采样层,其主要作用是对局部区域进行汇总和下采样, 从而降低空间分辨率、减少计算量、扩大后续单元的感受野, 并在一定程度上提升模型对局部平移扰动的鲁棒性。」 2 3

  19. 出处:「第5章 卷积神经网络」第 496 段(text/06-ch05.txt:496,搜「最大汇聚」) 与第 506 段(text/06-ch05.txt:506,搜「平均汇聚」)。 典型配置见第 544 段:「将每个特征图划分为 2 × 2 大小的不重叠区域, 然后使用最大汇聚方式进行下采样。」

  20. 出处:「第5章 卷积神经网络」第 549 段(text/06-ch05.txt:549,搜「压缩为一个 𝐷 维向量」)。 原文:「全局平均汇聚(GAP)将每个通道上的所有空间位置取平均, 从而把一个 M × N × D 的特征图组压缩为一个 D 维向量。 GAP 常用于替代大规模全连接层,以减少参数量并降低过拟合风险。」

  21. 出处:「第5章 卷积神经网络」第 547 段(text/06-ch05.txt:547,搜「过多的信息损失」)。 2

  22. 出处:「第5章 卷积神经网络」第 33 段(text/06-ch05.txt:33,搜「平移的等变性」) 与第 42 段(text/06-ch05.txt:42,搜「具有等变性」)。 数学小知识:「若 f(T(x)) = T(f(x)),即变换作用在输入上的效果会『传递』到输出上, 则称 f 对 T 具有等变性……若 f(T(x)) = f(x),即变换不改变输出, 则称 f 对 T 具有不变性……卷积运算本身具有平移等变性, 而分类任务所需的平移不变性通常来自汇聚操作、数据增强、全局汇聚等多种机制的共同作用。」 2

  23. 出处:「第5章 卷积神经网络」第 661 段(text/06-ch05.txt:661,搜「最大值所对应的神经元」)。 原文:「如果下采样是最大汇聚,误差项中每个值会直接传递到前一层对应区域中的 最大值所对应的神经元,该区域中其他神经元的误差项都设为 0。 如果下采样是平均汇聚,误差项会被平均分配到前一层对应区域中的所有神经元上。」 2

  24. 出处:「第5章 卷积神经网络」第 319 段(text/06-ch05.txt:319,搜「参数梯度等于上游梯度与输入的互相关操作」) 与第 346 段(text/06-ch05.txt:346,搜「这与全连接层中前向/反向对应矩阵转置的关系完全类比」)。 原文:「即参数梯度等于上游梯度与输入的互相关操作。」 「即输入梯度等于将卷积核翻转 180 度后与上游梯度做宽卷积, 这与全连接层中前向/反向对应矩阵转置的关系完全类比。」 2 3 4

  25. 出处:「第5章 卷积神经网络」第 601 段(text/06-ch05.txt:601,搜「累加所有空间位置对它的贡献」)。 原文:「卷积核参数在不同空间位置上是共享的, 因此一个卷积核参数的梯度需要累加所有空间位置对它的贡献。」

  26. 出处:「第5章 卷积神经网络」第 1041 段(text/06-ch05.txt:1041,搜「不是指卷积的逆」)。 边注:「将转置卷积称为反卷积并不太恰当,它不是指卷积的逆运算。」

  27. 出处:「第5章 卷积神经网络」第 35 段(text/06-ch05.txt:35,搜「对于尺度和旋转变化的鲁棒性」)。 原文:「对于尺度和旋转变化的鲁棒性,则往往需要借助数据增强或专门的结构设计。」

  28. 出处:「第5章 卷积神经网络」第 1236 段(text/06-ch05.txt:1236,搜「卷积被替代」)。 原文:「卷积通过局部连接和权重共享强调局部模式的平移等变性,参数效率高、 数据效率好,适合端侧推断、视频处理和计算受限场景;注意力机制更擅长全局交互和 长距离依赖,在大规模数据和算力支持下表现突出……现代视觉模型的发展不是简单的 『卷积被替代』,而是在局部结构先验、全局建模能力、训练策略和计算效率之间重新组合。」