跳到主要内容

这一章讲二十年里卷积网络的六次结构改动。每一次都只改一件事,而且每一次都要付一笔账—— 这一章的读法是:先看它改的是哪件事,再算它省了多少、赔了什么。

卷积网络的演化:每一次改动改的是哪一件事

1. 这一章讲什么

三件事: 卷积网络二十年里的五个代表结构(LeNet-5——1998 年的手写数字网络、AlexNet、VGG、Inception、ResNet) 各自把上一代改了哪一件事;两种把「尺寸变大」的操作(转置卷积); 三种把「参数变少」的操作(空洞、分组、深度可分离)。

它在全书链条里的位置: 第 13 章给了卷积这台机器的两个零件——局部连接和权重共享。 这一章给出机器的全部演化史,并回答一个问题:当「表达能力够不够」不再是瓶颈之后, 结构设计的主战场移到了哪里(信息和梯度能不能稳定传播,以及「省不省」)。

需要第 13 章。 反向传播本身本章基本不再碰,只在残差一节用它的直觉。

2. 顶层全景

1998 2012 2014 2014 2015
LeNet-5 ──▶ AlexNet ──▶ VGG ─┐ Inception ─┐▶ ResNet ──▶ 高效化
│ │ │ │ │ │ │
定范式 堆工程配方 拆大核 一层看多尺度 改梯度路径 空洞/分组/深度可分离
参数 6万 深度学习引爆 3×3堆层 1×1 降维 直连边 参数 ≈1/9

每一步改的事:
LeNet-5 → 范式定型 AlexNet → 工程手段齐备
VGG → 核的大小取舍 Inception → 尺度要不要二选一
ResNet → 信息/梯度怎么传 转置卷积 → 分辨率怎么还原
其余三种 → 参数和计算怎么省

一句话链条: 结构先定了型 → 大规模数据逼出工程配方 → 表达能力够了以后, 战场从「能不能表示」转移到「能不能训得动」「省不省」 → 残差连接解决了传播, 高效卷积解决了开销,转置卷积补上了「从压缩特征还原空间尺寸」这最后一块。

3. 第一个能上生产的:LeNet-5

它不是历史标本——它是第一个装进银行生产系统的卷积网络。 基于它的手写数字识别系统在 20 世纪 90 年代被美国很多银行用来识别支票上的手写数字1

7 层,输入 32×32,输出 10 类。 书里把每一层的账都算了一遍2:

干什么关键数
C1 卷积6 个 5×5 核输出 6 组 28×28;参数 6×25+6 = 156
S2 汇聚2×2 平均汇聚参数 12(带非线性)
C3 卷积16 组 10×10 特征图用连接表只用 60 个核,不是全连的 96 个;参数 1516
S4 汇聚2×2 平均汇聚参数 32
C5 卷积120 个 5×5 核每个 1×1,相当于全连接;参数 48120
F6 全连接84 个神经元参数 10164
输出径向基函数(RBF)现代由 Softmax 分类器替代

总计约 6 万参数、34 万连接3——记住这两个数,第 10 节走查还会用它做参照物。

两个细节值得停留:

一是连接表。 第 13 章说过,一个输出通道通常依赖全部输入通道; LeNet-5 已经发现这不必须——定义一张表 T,T[p,d]=1 才连, 参数从 P×D 组核降到 K×U×V + P(K 是表里非零项个数)4。 C3 那 16 个输出特征图,有的只依赖输入特征图的每 3 个连续子集,只有最后一个看全部。 「通道间不全连」这个念头,第一个成功模型里就有了。

二是输出的收尾方式带着时代特征: RBF 输出层如今被 Softmax 替代, 因为后者更易于优化、也更自然地给出概率解释5。 书里的边注说得很公道:平均汇聚、连接表、RBF 这些具体设计都过时了, 但「卷积提局部特征、下采样降分辨率、逐层形成高层表示」的思想影响深远6

4. 一次靠工程堆出来的突破:AlexNet

2012 年 ImageNet 图像分类竞赛冠军7。它的重要意义不在结构本身, 而在它系统地结合了一批后来成为标配的训练技术:在 GPU(图形处理器,即显卡)上摊开训练、ReLU 激活、 暂退法防过拟合、数据增强提高准确率8

这几样各自的机制,这里都不展开: ReLU 为什么能救深网络,第 12 章(激活函数)讲; 暂退法和数据增强怎么做,名字和机制都在第 19 章(正则化)讲。 AlexNet 的贡献是把它们第一次配齐在一个模型里。

结构上只需要记三笔:

5 个卷积层 + 3 个汇聚层 + 3 个全连接层(末层 Softmax,1000 类)
输入 224×224×3;首层 11×11 大核、步长 4 —— 之后核迅速变小到 3×3
网络超出单卡显存 → 拆成两半放两块 GPU,只在个别层通信

第三笔埋了一个种子:因为两块 GPU 各算各的, 通道实际上被劈成了两组各连各组——这正是后面分组卷积的雏形9

还有一样东西书里特意标了有效期:前两个汇聚层之后的局部响应规范化(LRN)。 边注原话:LRN 在今天已经不是主流组件,更多具有历史意义; 现代卷积网络倾向批量规范化来稳训练——批量规范化在第 18 章正位细讲10

5. 小核堆深:VGG

问题:核该多大? 直觉说大核看得远。VGG 的回答:用多个连续的小核替代一个大核, 再靠加深网络提升表示能力11

它能成立靠一笔几何账:两层 3×3 卷积,第一层的每个输出位置已经「看过」5×5 的范围, 第二层在这之上再看 3×3——等效感受野就是 5×5。但参数是 2×3²=18, 不到一层 5×5(25)的四分之三12

这不只是省。 两层小核中间还夹着两次非线性——同样大的视野,多拐了两道弯, 表达能力反而更强。VGG 还把整网做得非常规整:若干卷积块 + 汇聚交替堆叠, 这种统一性让后来的结构很容易加宽加深。

短板也明确:顶部全连接层参数多,整体计算与存储开销大13

这笔账可以当场算出来(数值按书内的尺寸和全连接参数公式现算): AlexNet 卷积部分到最后是两个 6×6×128 的特征图组,摊平是 9216 个数; 接 4096 个神经元的全连接层,参数量 = 4096×(9216+1) ≈ 3775 万—— 比整个 LeNet-5 的约 6 万参数多出六百倍。 顶部的冗余有一个零参数的替代做法:全局平均汇聚把每个通道的空间位置取一次平均, 一组特征图直接压成一个向量——这就是第 13 章预告的「替掉顶上那一大块」的真数字。

6. 同一层看多个尺度:Inception

问题出在 VGG 答案的对立面:为什么核大小只能二选一? 近处的花纹要小核,远处的物体要大核,层层加深才能两者兼顾——太慢了。

Inception 的做法很直接:同一层里并排放多种核—— v1 版本是 1×1、3×3、5×5 三种卷积加上 3×3 最大汇聚四路并行(同时各算各的), 输出的特征图在深度方向拼接起来作为模块输出(各路卷积都用等宽配置,保证高宽对得上)14

四路并行立刻带来一个新问题:拼起来太厚了。 解法就是第 13 章埋过的伏笔——1×1 卷积: 在进行 3×3、5×5 卷积之前、以及 3×3 最大汇聚之后,都先过一次 1×1 卷积压掉一部分深度; 所以 1×1 卷积在这里干两件事:跨通道信息融合,以及承担降维15

两个代表性版本: v1 就是 GoogLeNet(拼写刻意区别于 GoogleNet,向 LeNet 致敬), 2014 年 ImageNet 冠军;9 个 Inception 模块、总共 22 层, 中间层挂了两个辅助分类器加强监督、缓解深层训练的梯度消失16v3 把大核继续往小拆:两层 3×3 替换 5×5;连续的 K×1 和 1×K 替换 K×K; 同时引入标签平滑和批量规范化等训练技巧(这两样的机制同样留给第 19、18 章)17

7. 让梯度有路可走:残差网络

前面的演化都是在改「怎么看」。ResNet 改的是另一件事:「信息与梯度怎么传」。

先把要逼近的目标拆开写:

h(x) = x + (h(x) − x)
↑ ↑
恒等函数 残差函数

这是一个恒等变形:目标 h(x) 变成了「直接抄输入 + 学一个修正量」。 神经网络构成的单元按通用近似定理两者都有能力逼近, 但实际优化中,学后者通常更容易18——尤其当最优映射本来就接近恒等时, 让它学「零修正」比学「完整复制自己」容易得多。

更重要的是第二条收益:给反向传播修了一条高速路。 误差回传时,直连边上什么都不用乘——对比第 13 章那条规则 (反向要乘翻转的核),这条边上的数原样通过。 书里的说法:残差连接有助于缓解深层网络中的梯度传播困难19, 而且这件事不限于卷积网络,后来成了现代深度神经网络设计的基础模块20

典型的残差单元:两三个级联的等宽卷积 + 一条跨层直连边,汇合后过 ReLU21。 两个工程要点:

要点做法
维度不一致怎么办直连边换成 1×1 卷积或带步长的投影分支匹配维度22
更深时的省法1×1–3×3–1×1 的瓶颈结构:先用 1×1 压通道、3×3 做空间活、再 1×1 放回来,控制计算量的同时继续加深23

同类的还有 Highway Network。串起很多个残差单元,就能构成此前训不动的超深网络。

8. 把分辨率还原回去:转置卷积

卷积一路只会把尺寸变小。 可有一类任务要反过来:分割要还原到原图大小, 生成要从一张压缩的特征图「放大」成图片。需要一个还是「卷积形状」、但把维度变多的算子。

仿射视角下答案现成的。 高维到低维的映射可以写成 z = Wx(x 是 d 维、z 是 p 维,p<d), 那低维到高维就转置一下:x = Wᵀz。注意这不是逆运算,两个方向只是形式上的转置关系24。 卷积恰好可以写成稀疏矩阵 C 乘向量(z = Cx),于是低维到高维就用 Cᵀz25—— 这就是转置卷积。它常被叫作「反卷积」,书里专门纠了这个名: 将转置卷积称为反卷积并不太恰当,它不是指卷积的逆运算26 (这句第 13 章引用过,这里给它安家)。

具体怎么摆: 一维情形,大小 K 的核、M 维输入的普通窄卷积,对应转置卷积 = 两端补零 P=K−1 后做普通卷积,得到 M+K−1 维——正是第 13 章那张表里的宽卷积27。 如果原卷积步长 S>1(下采样了 S 倍),对应的转置要在输入元素之间插 S−1 个 0 再做普通卷积,等效于「分数步长」,因此也叫微步卷积28;实现时没人真把步长设成小于 1, 插零再卷就行。

代价有一条,而且有名字:棋盘状伪影——上采样结果出现规律性网格纹理, 所以有的任务干脆换成「先插值上采样,再普通卷积」29

9. 三种省钱的卷积

空洞卷积:不加参数,扩大感受野

扩大感受野本来只有三条路:加大核、加深层数、先做汇聚。前两条涨参数,第三条丢信息30空洞卷积给第四条:在卷积核的每两个元素之间插入 D−1 个「空洞」, 核被撑开成有效大小 K′ = K + (K−1)(D−1),D 叫膨胀率,D=1 时退化为普通卷积31。 看的范围变大,但核里实际非零的权重一个没多。 它特别适合既要大感受野又要保持高分辨率的任务,比如语义(画面内容的含义)分割(逐像素判类别)。

分组卷积:切断跨组连接

标准卷积里每个输出通道依赖所有输入通道。分组卷积把输入通道划成若干组, 每组只与对应的一部分输出通道相连,显著减参数减计算32。 它的来历就是第 4 节那颗种子:AlexNet 因两块 GPU 分开计算,实际上已包含分组卷积的思想33

深度可分离卷积:把两件事拆开

标准卷积一个核同时在干两件事:空间上找模式 + 通道之间混合信息。 深度可分离卷积把这两件事解耦成先后两步34:

第一步 逐通道卷积:每个输入通道各用一个 K×K 核做空间卷积(D 个核)
── 只管空间,不管通道
第二步 逐点卷积:P 个 1×1 核线性组合 D 个中间特征图
── 只管混合通道

省多少? 标准卷积参数 K²DP,分解后 K²D + DP, 比值 = 1/P + 1/K²。书给的口径:K=3 且 P 较大时,参数和计算量约为标准卷积的 1/9 到 1/835。准确的数留在第 10 节主走查算。

代价也要写明: 第一步没有任何跨通道交互, 表示能力通常弱于同规模的标准卷积,适合对效率要求高的轻量级场景; 资源(计算与显存)充足追求精度时,标准卷积仍然常用36。MobileNet、EfficientNet 这条轻量线用的就是它37

10. 主走查:同一层卷积的两种花法

设定来自原书习题 5-2:输入特征图组 32×32×3,64 个 3×3 卷积核,步长 1,零填充 1。 下面的数全部按第 13 章给出的公式现算。

第一步:普通卷积层的输出尺寸。 套公式 ⌊(M−K+2P)/S⌋+1 = ⌊(32−3+2)/1⌋+1 = 31+1 = 32——零填充选 (K−1)/2, 这就是等宽卷积,尺寸不动。输出特征图组 = 32×32×64

第二步:这一层的参数量。 套公式 P×D×(U×V)+P = 64×3×9+64 = 1728+64 = 1792 个。 对照第 3 节:整个 LeNet-5 七层才约 6 万参数,而单个「中等规模」卷积层就有近两千; 真正吃参数的不是空间,是通道相乘(64×3 那一项)。

第三步:接一个 2×2、步长 2 的最大汇聚。 输出 = 16×16×64。分辨率砍半,深度原样保留——「汇聚只管高宽、不管通道」这一句在第 13 章说过,这里是它的数字版。

第四步:同一层换成深度可分离卷积。 逐通道步:D 个 3×3 核 → 3×9 = 27 个参数; 逐点步:P 个 1×1 核接 D 个通道 → 1×3×64 = 192 个参数;合计 219 个

标准:1792 深度可分离:219 比值 ≈ 0.122 ≈ 1/8.2

和公式比对:理论比值 1/P + 1/K² = 1/64 + 1/9 ≈ 0.126,落点一致(差别来自偏置计不计入)。 「两件事拆开」省掉的那部分,正是四路并行里反复出现的通道相乘。 代价参照第 9 节:第一步没有跨通道交互,表示能力弱一截——219 个参数买不到 1792 个参数的表达力。

11. 作者的判断与证据

书里给了判断并有文献支撑的: 学残差比学完整映射更容易 [He et al., 2016]18; 小核堆深的两个优点(保感受野减参数、多层非线性增强表达)12; 转置卷积只是形式转置而非逆运算24

书里给机制解释的: 1×1 卷积在 Inception 中承担降维15; 残差连接缓解梯度传播困难19;空洞卷积不加参数扩感受野的原理31; 深度可分离省参的来源(比值公式)35

书里划定有效期的: LRN 已不是主流组件,现代倾向批量规范化10; RBF 输出层已被 Softmax 替代5;棋盘伪影用插值替代方案规避29

书里给出的组织框架(总结节): 三个原则之外的演化观—— Inception 改变多尺度建模方式,ResNet 改变信息与梯度的传播路径, 深度可分离改变卷积的参数化方式,但都没脱离局部性、层次性、参数共享、模块化四条基本原则; 卷积网络的演化本质是在表示能力、可训练性、计算效率三者之间不断找平衡38

12. 边界与局限

这本书的结构史停在它的取舍框架里。 具体模型的能力数字(ImageNet 错误率曲线、 参数量沿革)大多只点名论文不给数,读者要把「演进」理解成思想脉络而不是排行榜(竞赛名次); ViT 与 ConvNeXt 只是作为「卷积与注意力重组而非替代」的证据点到为止39, 细讲要等第 20~22 章的注意力部分。

三种省钱卷积各有隐含前提,书里交代得克制: 深度可分离弱表示需要轻量场景兜底36; 空洞卷积的膨胀率叠加策略(不同层怎么搭配 D)没有展开;分组卷积的组数怎么定也没给准则。 这几处属于「知道有什么」级别,选型还是要回到原文实验。

转置卷积的伪影问题给了出路但没给机理: 只说了现象和替代方案29, 为什么会周期性叠加没有推导。

13. 可带走的

  1. LeNet-5 定型「卷积—下采样—分类器」:7 层、6 万参数,连接表是「通道不全连」的第一个实例;
  2. AlexNet 的贡献是一套配方:GPU 并行、ReLU、暂退法、数据增强第一次配齐;
  3. VGG:两层 3×3 等效一层 5×5 的感受野,参数 18 对 25,还多两道非线性;
  4. Inception 回答「为什么核大小要二选一」:四路并排放、拼深度,1×1 卷积负责压厚度;
  5. ResNet:h(x)=x+(h(x)−x),学修正量比学全映射容易;直连边是梯度的高速路;
  6. 转置卷积 = 形式上的转置,不是逆运算;宽卷积和插零实现上采样,代价可能是棋盘伪影;
  7. 空洞卷积:插洞撑大核,K′=K+(K−1)(D−1),参数一个不多;
  8. 分组卷积切断跨组连接;深度可分离把空间和通道拆开两步走,参数约 1/8~1/9,表示力打折;
  9. 结构演化的主线只有一个:表示能力、可训练性、计算效率三者找平衡;
  10. 判断下一代改进改的是哪件事,比记住结构图有用——看它动的是「怎么看」还是「怎么传」还是「怎么省」

14. 原文地图

主题原书章原文位置
LeNet-5 与经典范式第5章 卷积神经网络text/06-ch05.txt:710(搜「下采样–分类器」) · text/06-ch05.txt:724(搜「共有 7 层」) · text/06-ch05.txt:753(搜「参数量总计」)
连接表第5章 卷积神经网络text/06-ch05.txt:757(搜「每一个输出特征图都依赖于所有输」) · text/06-ch05.txt:760(搜「Link Table」) · text/06-ch05.txt:785(搜「那么共需要」)
RBF→Softmax第5章 卷积神经网络text/06-ch05.txt:756(搜「Softmax 分类器替代」) · text/06-ch05.txt:789(搜「时代特征」)
AlexNet 的配方第5章 卷积神经网络text/06-ch05.txt:793(搜「2012 年 ImageNet」) · text/06-ch05.txt:796(搜「系统地结合了很多」) · text/06-ch05.txt:802(搜「拆为两半」)
LRN 有效期第5章 卷积神经网络text/06-ch05.txt:845(搜「局部响应规范化」)
VGG 小核堆深第5章 卷积神经网络text/06-ch05.txt:854(搜「连续的小卷积核」) · text/06-ch05.txt:858(搜「感受野相当于一层 5 × 5」) · text/06-ch05.txt:863(搜「顶部全连接层参数较多」)
Inception 多尺度第5章 卷积神经网络text/06-ch05.txt:869(搜「称为Inception 模块」) · text/06-ch05.txt:874(搜「在深度方向上拼接」) · text/06-ch05.txt:883(搜「承担降维的作用」) · text/06-ch05.txt:899(搜「GoogLeNet 赢得了」) · text/06-ch05.txt:904(搜「辅助分类器」)
Inception v3第5章 卷积神经网络text/06-ch05.txt:919(搜「Inception v3 网络」)
残差网络第5章 卷积神经网络text/06-ch05.txt:929(搜「也称为残差连接」) · text/06-ch05.txt:933(搜「Identity Function」) · text/06-ch05.txt:943(搜「更容易学习」) · text/06-ch05.txt:946(搜「有助于缓解深层网络」) · text/06-ch05.txt:949(搜「残差单元由多个级联」)
维度匹配与瓶颈第5章 卷积神经网络text/06-ch05.txt:965(搜「匹配维度」) · text/06-ch05.txt:968(搜「bottleneck」)
不限于卷积网第5章 卷积神经网络text/06-ch05.txt:970(搜「很多个残差单元串联」) · text/06-ch05.txt:972(搜「基础模块,并不限于」)
转置卷积第5章 卷积神经网络text/06-ch05.txt:995(搜「并不是逆运算」) · text/06-ch05.txt:1039(搜「Transposed」) · text/06-ch05.txt:1047(搜「两端补零」) · text/06-ch05.txt:1052(搜「微步卷积」) · text/06-ch05.txt:1076(搜「棋盘状伪影」)
空洞卷积第5章 卷积神经网络text/06-ch05.txt:1082(搜「三种方式」) · text/06-ch05.txt:1086(搜「不增加参数数量」) · text/06-ch05.txt:1097(搜「Dilation」)
分组卷积第5章 卷积神经网络text/06-ch05.txt:1111(搜「一部分输出通道相连」) · text/06-ch05.txt:1115(搜「两块 GPU 分开计算」)
深度可分离卷积第5章 卷积神经网络text/06-ch05.txt:1136(搜「两类操作解耦」) · text/06-ch05.txt:1164(搜「第一步负责空间特征提取」) · text/06-ch05.txt:1172(搜「1/9 到 1/8」) · text/06-ch05.txt:1174(搜「弱于同规模的标准卷积」)
轻量网络第5章 卷积神经网络text/06-ch05.txt:1241(搜「MobileNet」)
总结:原则与平衡第5章 卷积神经网络text/06-ch05.txt:1197(搜「几条相互关联的设计原则」)
卷积 vs 注意力第5章 卷积神经网络text/06-ch05.txt:1233(搜「端侧推断」)

Footnotes

  1. 出处:「第5章 卷积神经网络」第 708 段(text/06-ch05.txt:708,搜「手写数字识别系统」)。 基于 LeNet-5 的系统在 20 世纪 90 年代被美国很多银行用于识别支票上的手写数字。

  2. 出处:「第5章 卷积神经网络」第 726 至 751 段(text/06-ch05.txt:726,搜「(1) C1 层是卷积层」; text/06-ch05.txt:746,搜「120 × 16 = 1 920」;text/06-ch05.txt:751,搜「径向基函数」)。 原文逐层列出神经元数、可训练参数数量、连接数三本账。

  3. 出处:「第5章 卷积神经网络」第 753 段(text/06-ch05.txt:753,搜「参数量总计约 6 万」)。

  4. 出处:「第5章 卷积神经网络」第 760 段(text/06-ch05.txt:760,搜「连接表(Link Table」) 与第 785 段(text/06-ch05.txt:785,搜「那么共需要」)。原文:「假设连接表 T 的非零个数为 K, 每个卷积核的大小为 U×V,那么共需要 K×U×V+P 个参数。」若不用连接表则需要 96 个核(第 737 段)。

  5. 出处:「第5章 卷积神经网络」第 756 段(text/06-ch05.txt:756,搜「Softmax 分类器替代」)。 2

  6. 出处:「第5章 卷积神经网络」第 789 段(text/06-ch05.txt:789,搜「时代特征」)。 这是原书边注。

  7. 出处:「第5章 卷积神经网络」第 793 段(text/06-ch05.txt:793,搜「2012 年 ImageNet」)。

  8. 出处:「第5章 卷积神经网络」第 796 段(text/06-ch05.txt:796,搜「系统地结合了很多」)。

  9. 出处:「第5章 卷积神经网络」第 1115 段(text/06-ch05.txt:1115,搜「两块 GPU 分开计算」)。

  10. 出处:「第5章 卷积神经网络」第 845 段(text/06-ch05.txt:845,搜「局部响应规范化」) 与边注(text/06-ch05.txt:846,搜「LRN 在」)。 2

  11. 出处:「第5章 卷积神经网络」第 854 段(text/06-ch05.txt:854,搜「连续的小卷积核」)。

  12. 出处:「第5章 卷积神经网络」第 858 段(text/06-ch05.txt:858,搜「感受野相当于一层 5 × 5」)。 原文给出两层 3×3 与一层 5×5 的参数对比。 2

  13. 出处:「第5章 卷积神经网络」第 863 段(text/06-ch05.txt:863,搜「顶部全连接层参数较多」)。

  14. 出处:「第5章 卷积神经网络」第 869 段(text/06-ch05.txt:869,搜「称为Inception 模块」) 与第 874 段(text/06-ch05.txt:874,搜「在深度方向上拼接」);等宽边注见第 877 段 (text/06-ch05.txt:877,搜「通常都」)。

  15. 出处:「第5章 卷积神经网络」第 882 段(text/06-ch05.txt:882,搜「减少特征图的深度」) 与第 883 段(text/06-ch05.txt:883,搜「承担降维的作用」)。 2

  16. 出处:「第5章 卷积神经网络」第 899 段(text/06-ch05.txt:899,搜「GoogLeNet 赢得了」) 与第 904 段(text/06-ch05.txt:904,搜「辅助分类器」)。

  17. 出处:「第5章 卷积神经网络」第 919 段(text/06-ch05.txt:919,搜「Inception v3 网络」) 与第 923 段(text/06-ch05.txt:923,搜「标签平滑和批量规范化」)。

  18. 出处:「第5章 卷积神经网络」第 943 段(text/06-ch05.txt:943,搜「更容易学习」), 引 [He et al., 2016]。 2

  19. 出处:「第5章 卷积神经网络」第 946 段(text/06-ch05.txt:946,搜「有助于缓解深层网络」)。 2

  20. 出处:「第5章 卷积神经网络」第 972 段(text/06-ch05.txt:972,搜「基础模块,并不限于」)。

  21. 出处:「第5章 卷积神经网络」第 949 段(text/06-ch05.txt:949,搜「残差单元由多个级联」)。

  22. 出处:「第5章 卷积神经网络」第 965 段(text/06-ch05.txt:965,搜「匹配维度」)。

  23. 出处:「第5章 卷积神经网络」第 968 段(text/06-ch05.txt:968,搜「bottleneck」)。

  24. 出处:「第5章 卷积神经网络」第 995 段(text/06-ch05.txt:995,搜「并不是逆运算」)。 2

  25. 出处:「第5章 卷积神经网络」第 1039 段(text/06-ch05.txt:1039,搜「Transposed」), 推导涉及式(5.47)-(5.52)。

  26. 出处:「第5章 卷积神经网络」第 995 段(text/06-ch05.txt:995,搜「并不是逆运算」) 与第 1039 段(text/06-ch05.txt:1039,搜「Transposed」)。 原文边注同时点出:将转置卷积称为反卷积并不太恰当。

  27. 出处:「第5章 卷积神经网络」第 1047 段(text/06-ch05.txt:1047,搜「两端补零」), 对应式(5.45)、(5.46)的上下文。

  28. 出处:「第5章 卷积神经网络」第 1052 段(text/06-ch05.txt:1052,搜「微步卷积」) 与第 1066 段(text/06-ch05.txt:1066,搜「插入 𝐷 个 0」)。

  29. 出处:「第5章 卷积神经网络」第 1076 段(text/06-ch05.txt:1076,搜「棋盘状伪影」)。 2 3

  30. 出处:「第5章 卷积神经网络」第 1082 段(text/06-ch05.txt:1082,搜「一般可以通过三种方式」) 与第 1085 段(text/06-ch05.txt:1085,搜「丢失一些信息」)。

  31. 出处:「第5章 卷积神经网络」第 1092 段(text/06-ch05.txt:1092,搜「变相地增加其大小」) 与第 1097 段(text/06-ch05.txt:1097,搜「膨胀率」),对应式(5.53)。 2

  32. 出处:「第5章 卷积神经网络」第 1111 段(text/06-ch05.txt:1111,搜「一部分输出通道相连」)。

  33. 出处:「第5章 卷积神经网络」第 1115 段(text/06-ch05.txt:1115,搜「包含了分组卷积的思想」)。

  34. 出处:「第5章 卷积神经网络」第 1136 段(text/06-ch05.txt:1136,搜「两类操作解耦」) 与第 1139、1143 段(text/06-ch05.txt:1139,搜「逐通道卷积(depthwise」; text/06-ch05.txt:1143,搜「逐点卷积(pointwise」)。

  35. 出处:「第5章 卷积神经网络」第 1172 段(text/06-ch05.txt:1172,搜「1/9 到 1/8」)。 比值推导(K²D+DP 对 K²DP)见上一段。 2

  36. 出处:「第5章 卷积神经网络」第 1174 段(text/06-ch05.txt:1174,搜「弱于同规模的标准卷积」)。 2

  37. 出处:「第5章 卷积神经网络」第 1241 段(text/06-ch05.txt:1241,搜「MobileNet」)。

  38. 出处:「第5章 卷积神经网络」第 1197 段(text/06-ch05.txt:1197,搜「几条相互关联的设计原则」)。

  39. 出处:「第5章 卷积神经网络」第 1233 段(text/06-ch05.txt:1233,搜「端侧推断」) 与第 1236 段(text/06-ch05.txt:1236,搜「卷积被替代」)。