跳到主要内容

局部连接与权重共享 — 5×5 的图配 3×3 的模板,一乘一加得到 3

这一章讲三件事: 全连接网络处理图像到底亏在哪(不只是慢); 卷积用哪两个想法把这个亏补回来;以及从 1989 到 2020 年, 视觉这条路是怎么一步步走到今天的。

它在全书链条里的位置: 第 05 章给了你通用的墙(前馈网络), 这一章给第一种按数据结构砌的墙。第 04 章那句「结构本身就是一种先验」, 在这里第一次变成具体的数。

1. 全连接处理图像,先算一笔账

上一章的全连接网络,原则上什么都能处理。拿它处理图像,先算一笔账。

一张 224 × 224 的彩色照片,展平之后是 224 × 224 × 3 ≈ 15 万个数 (长 × 宽 × 红绿蓝三个通道)。如果第一层放 1000 个神经元, 每个神经元都要连全部 15 万个输入——光这一层就需要 1.5 亿个参数1

1.5 亿是什么概念?上一章那个能把手写数字认到 98% 的两层网络, 全部参数加起来不过几十万。这一张图的第一层,就是那整个网络的几百倍, 而它甚至还没开始「看」。

参数多还只是第一笔亏。第二笔更要命:全连接网络把每个像素当成一个独立的数, 完全不考虑谁挨着谁。而图像的信息恰恰藏在「谁挨着谁」里—— 相邻的像素多半属于同一个物体,隔得远的像素多半没关系。 它拿着一副天生有结构的牌,却当成一把散牌在打。

2. 猫挪到左上角,它就不认识了

第二笔亏有一个具体的样子,书里讲得很形象。

假设训练集里所有的猫都出现在图像正中央。全连接网络学完之后, 它学会的其实是「中心位置出现某种像素模式 = 猫」。 测试时猫出现在左上角,它立刻傻眼—— 它看到的特征出现在了「陌生位置」2

这台机器根本没有「位置」这个概念。 第 784 号输入线上出现一个图案, 和第 12 号输入线上出现同一个图案,对它来说是两件毫不相干的事, 要从零各学一遍。

把需求列出来,我们要的网络得有三个本事:参数少、 能利用「相邻像素更相关」这个事实、对位置变化稳定。 卷积神经网络就是照这三条需求造出来的3。 它的全部设计来自对图像的两个观察:

  1. 图像里有意义的特征(边缘、纹理、形状)都是局部的;
  2. 同一种特征(比如一只眼睛)可能出现在图像的任何位置

这两个观察各自对应一个改造,下面两节各讲一个。

3. 局部连接:每个单元只看一小块

第一个改造:别让每个神经元看整张图,只看一小块。

一个神经元只连接图像的一小块区域,比如 3 × 3 或 5 × 5 个像素, 不再和全图相连4。理由很直白:要判断「这里有没有一条边缘」, 你只需要看邻近的几个像素——一条边缘不会在相隔 100 个像素的两端之间凭空成立。

参数账立刻变了:原来一个神经元要接 15 万个输入, 现在只看 3 × 3 × 3 = 27 个输入5从 15 万到 27,砍掉的是四个数量级。

「看得少」会不会漏掉大图案?会,所以单个这一层不够—— 但把这样的层叠起来,每一层在前一层的结果上再各看一小块, 看得就一层比一层宽。这是第 6 节的事,先把第二个改造讲完。

4. 权重共享:同一个模板,全图滑一遍

第二个改造:既然同一种特征可能出现在任何位置,那就别在每个位置各配一套权重。

用同一组权重在整张图像上滑动,每个位置都用这同一组数做加权求和。 这组权重有个名字,叫卷积核(也叫滤波器,一个几乘几的小数表, 比如 3 × 3 的九个数)。直觉上,卷积核就是一个模板: 图像的某处如果和模板匹配,那个位置的输出就很大6

同一个 3×3 模板
┌───┐
│模板│ → 滑到左上,算一个数
└───┘ → 滑到旁边,再算一个数 → …… → 滑完全图
每个位置都问同一个问题:「这里像不像我?」

这张图看的是权重共享:不是 100 个位置各配一个检测器,而是一个检测器问 100 次。

权重共享当然也省参数,但书里强调:它首先带来的不是省参数, 而是「换个位置也认得」7。猫的眼睛出现在左上角还是右下角, 都会被同一个卷积核检测到——只是检测结果出现在输出的不同位置上。 这个性质叫平移等变性(输入平移,输出跟着平移)。

注意这个词说的是「等变」不是「不变」:卷积本身不是「完全不管位置」, 而是「位置变了,响应也跟着变」。要变成「猫在哪里都是猫」, 还差一步,那是第 7 节的事。

5. 走查:5×5 的图配 3×3 的模板,一乘一加得到 3

这一章的主走查,直接走书里那张图的数。 输入是一张 5 × 5 的小图, 上两行全 0(暗),下三行全 1(亮),中间横着一条明暗交界。 卷积核是一个 3 × 3 的模板:上一行 −1,中间一行 0,下一行 +1—— 它的意思是「我偏爱上面暗、下面亮的地方」8

输入(5×5) 卷积核(3×3) 输出(3×3)

0 0 0 0 0 -1 -1 -1 3 3 3
0 0 0 0 0 ∗ 0 0 0 = 3 3 3
1 1 1 1 1 1 1 1 0 0 0
1 1 1 1 1
1 1 1 1 1

这张图看的是整个卷积:模板在输入上滑一遍,每个位置留下一个数,这些数拼成一张新图。

把这个计算亲手做一遍。把模板盖在输入的左上角, 盖住一个 3 × 3 的小块,然后对应位置相乘、九个数加起来:

盖住的输入块 模板
0 0 0 -1 -1 -1
0 0 0 × 0 0 0
1 1 1 1 1 1

逐位相乘再相加:
第一行:0×(−1) + 0×(−1) + 0×(−1) = 0
第二行:0×0 + 0×0 + 0×0 = 0
第三行:1×1 + 1×1 + 1×1 = 3
合计:0 + 0 + 3 = 3

输出左上角那个数就是 39。3 这个数本身不大不小, 它的意思是「这个位置上面暗、下面亮,和模板很像」。

模板往右挪一格,再算一次,还是 3。第一行三个位置全是 3。 滑到第二行(盖住输入的第 2 到 4 行),同样横在明暗交界上,又是三个 3。 滑到最下面一行,盖住的 3 × 3 块全是 1: 第一行 −1 × 1 三个,第三行 +1 × 1 三个,正好抵消,得 0—— 这里一片亮,没有边缘,模板说「我不像这里」。

滑完所有位置,得到一张 3 × 3 的新图:上两行是 3,最下一行是 0。 这张新图叫特征图(一个卷积核滑完全图留下的那张「哪里像、哪里不像」的地图)。 它做的事用一句话说:把「原图哪里有水平边缘」标了出来—— 原图的明暗交界在中部,特征图的中部就是一片 3。

卷积的本质就是这件事:拿一个局部模式检测器,在图像上滑动一遍10。 一层通常放多个卷积核,一个检测水平边缘,一个检测垂直边缘, 一个检测某种颜色斑点,各滑一遍,各产一张特征图,叠起来就是这一层的输出。

6. 感受野:越往上,看得越宽

第 3 节留了个问题:一个神经元只看 3 × 3,大图案怎么办?

答案是叠层之后自然解决。第一层的神经元看输入图的 3 × 3; 第二层的神经元看第一层特征图的 3 × 3,而特征图里的每一个数, 本身已经浓缩了原图 3 × 3 的信息——所以第二层一个神经元, 间接看到了原图大约 5 × 5 的一块。再叠一层,这块就更大。

一个神经元最终能看到输入图像的多大一块区域,这件事叫感受野11。 书里的比方是拿着放大镜看桌面:第一层只看得见桌面上的一小块, 叠几层之后,深层神经元能间接看到整张桌子。

这条链同时解释了第 02 章说的层次抽象在视觉里长什么样: 浅层卷积核通常检测简单的低级特征(边缘、颜色块), 深层的检测复杂的高级特征(眼睛、轮子、面孔)12。 从「一条边」慢慢看出「一只猫」,靠的就是感受野一层层变宽。

7. 汇聚:主动把分辨率降下来

卷积之后,通常会接一个没有任何可学参数的操作:汇聚

最常用的一种是最大汇聚:把特征图划成 2 × 2 的小块,每块只留最大的那个数, 特征图的长宽各缩一半13。它做两件事:

  1. 降分辨率。 从 224 × 224 到 112 × 112,后续层的计算量大幅下降;
  2. 换来「挪一点也不影响」。 猫的眼睛偏左一个像素还是偏右一个像素, 取过最大值之后结果几乎一样14

第二条正是第 4 节欠的那半步。卷积给的是「等变」——位置变了,响应跟着变; 汇聚把邻近几个位置的响应压成一个,小幅度的位置变化就这么被吸收掉了。 两件事合起来,网络才近似拿到「猫在哪里都是猫」。

它没有旋钮,就是一个写死的「下采样」操作。 也有研究让步长大于 1 的卷积顺带完成这件事,更灵活可学, 但经典架构里汇聚一直是标准件15

8. 一条典型流水线

把零件拼起来,一条典型的卷积网络长这样16:

输入图像 → 卷积 → ReLU → 汇聚 → 卷积 → ReLU → 汇聚 → ⋯ → 全连接 → Softmax
└─── 这一段反复堆 ───┘ 收尾和第 05 章一样

这张图看的是骨架:就是「卷积 + 激活 + 汇聚」反复堆,最后接回你已经认识的前馈网络。

堆的过程中有一个固定的此消彼长:每过一段,特征图的长宽变小, 但特征图的张数(每个卷积核一张,这个数叫通道数)增加17空间维度下降、特征维度上升,对应着「由具体到抽象」: 浅层每个通道对应一种简单模式(边缘、纹理), 深层每个通道对应一种复杂模式(眼睛、轮子、动物的头)。

9. 从 LeNet 到 ResNet:六个里程碑

这条流水线从 1989 年走到今天,书里给了一串里程碑18。 值得记住的不是年份,是每一步各自证明了什么:

里程碑它证明了什么
LeNet(1989/1998)卷积网络能干活:认手写邮政编码、银行支票。两层卷积加三层全连接,约 6 万参数
AlexNet(2012)第 01 章那个分水岭:错误率从第二名约 26.2% 降到约 15.3%。八层,约 6000 万参数——比 LeNet 大了一千倍,靠 ReLU、暂退法、数据增强、双显卡一起到位
VGG(2014)全部用 3 × 3 小卷积核堆到 16、19 层:设计合适时,加深比加宽更划算
GoogLeNet(2014)同一层里并行用好几种尺寸的卷积核,一次提取多种尺度的特征,错误率 6.7%
ResNet(2015)靠下一节那个加号训出 152 层,错误率 3.6%,低于当时常被引用的人类基线(约 5%)
视觉 Transformer(2020)把图像切成小块当词元(模型眼里的最小文字块)交给第 10 章那块积木,大规模数据上超过最强的卷积网络

这张表看的是同一条流水线被改了六次:每次只改一两个地方,没有一次是推倒重来。

书里给这条线的评语很短:深度学习的进步很少是一次性的,它是无数小改进的累积19

10. 残差(在原信号旁边并联一条捷径的连接):一个加号,把 152 层变成日常

这一节讲全书第二次「小改动、大影响」。 第一次是第 05 章换激活函数, 这一次只是加了一个加号。

2015 年之前的经验是:网络堆到几十层,成绩不但不涨反而掉。 不是第 03 章的过拟合——训练集上的成绩也在掉,是根本就训不动了。 原因你在第 03 章已经见过:梯度要一层一层往回传,每过一层打一个折扣, 层数一多,传到前面就所剩无几。

ResNet 的改动是:原本每一层「读输入、算输出」, 现在改成「读输入、算一个修正量,然后把输入原样加回去20

原来: 输出 = f(输入) 每一层必须凭空算出完整答案

现在: 输出 = 输入 + f(输入) 每一层只算「在输入上要改多少」
└── 这条原样照抄的近路,叫残差连接

这张图看的是那个加号:信息多了一条不用经过任何变换的直通路。

这个加号一手解决了两件事。第一,往回传的梯度可以顺着这条近路一路走到底, 不再层层打折。第二,每一层的任务从「凭空学出一个完整变换」 降级为「在已有结果上学一个小修正」——学一个小修正,比学一个完整答案容易得多21

效果是:152 层的网络第一次被稳稳训出来,成绩还超过了人类基线。 而今天,从 Transformer 到扩散模型,几乎所有深度网络都带着这个加号22。 它在第 08 章会作为「残差流」再讲一次,在第 10 章会变成你亲眼看到的两行代码。

11. 猫的视觉皮层,和第一层卷积核

这一节是全书最漂亮的巧合之一,而且不是巧合。

1959 年,两位生理学家把电极插进麻醉猫的初级视觉皮层, 发现某些神经元只对特定方向的亮暗条纹产生强烈响应—— 有的只对竖边兴奋,有的只对斜边兴奋。 他们因此拿了 1981 年的诺贝尔生理学或医学奖23

半个多世纪后,人们把训练好的卷积网络第一层卷积核画出来, 发现它们自发学出的东西,常常就是一堆不同方向的条纹检测器, 和猫脑里那些神经元的「口味」几乎一样24

两个相隔半个世纪的发现,指向同一件事:自然图像里有用的底层线索, 本来就集中在方向性的边缘上。 大脑和卷积网络都在解「从像素到语义」这同一道题, 解出的第一步相近,不是谁模仿谁,是题目本身把答案限制成了这样。

12. 视觉里今天用什么

第 9 节那张表的最后一行可能会让你以为:卷积已经被淘汰了。书里的说法更细。

在大规模数据上,把图像切块当词元的视觉 Transformer 确实占了上风。 但书里给的经验规律是:大规模数据下视觉 Transformer 更好, 中小规模下卷积网络更好——如果你只有几万张图,卷积往往更稳25

理由回到第 04 章那张归纳偏置表。卷积把「相邻像素更相关」 「同一模式随处出现」两条信念硬编码(不经学习、直接写死在结构里)进了连接方式—— 数据少的时候,这些白送的信念能大大降低学习难度。 视觉 Transformer 放弃了这些信念,什么都要从数据里现学, 所以它需要大得多的数据才能追平,然后反超。

结构不是被淘汰了,是变成了一道选择题:你手里有多少数据, 就决定了你该白拿多少先验。

13. 作者的判断与证据

有证据的部分。 1.5 亿那笔账是直算;5×5 配 3×3 的走查是书里的图, 数可以亲手核;AlexNet、ResNet 的错误率是公开比赛成绩; 猫视觉皮层实验是诺贝尔奖级别的史实。

要分开看的三处:

  1. 「浅层学边缘、深层学物体」。 这是大量可视化实验的经验观察, 不是每一层都分得这么干净。真实训练出来的网络,深浅层的分工比这句话模糊。
  2. 「中小数据卷积更稳」。 书里用的词是「经验规律」,没有给「中小」的界限。 几万张图这个量级是书里的说法,具体到你的任务,两条路线都值得试。
  3. 里程碑那张表只讲了分类错误率。 卷积网络在人脸识别、目标检测、 医学影像上的铺开,书里只给了一句清单,没有各自的证据26

判断(我们的,不是书里的):这一章最值得记住的不是卷积,是第 2 节那只挪到左上角的猫。 「全连接网络没有位置概念」——一句话说清了为什么结构必须跟着数据走。 后面第 07 章的循环、第 09 章的注意力,每次都是这句话换个数据类型再讲一遍。 如果错,会错在: 数据足够大时,全连接网络理论上也能学会「同一个图案在不同位置是同一回事」, 只是代价大到不现实。我们把「不现实」写成了「不能」,严格说是夸大了一个量级上的差别。

14. 边界与局限

  • 书里只讲了单通道的走查。 彩色图有三个通道、一层有多个卷积核, 真实计算是每张特征图都把全部输入通道一起卷。书里用一张灰度图演示,我们照走。
  • 卷积核里的数从哪来,书里没展开。 走查里那个 −1/0/+1 的模板是人设计的例子; 真实网络里这些数全是梯度下降学出来的,初始是随机数。
  • 六个里程碑只给了错误率一条线。 每个架构内部的模块长什么样,这一版不展开。
  • 目标检测、语义分割这些应用只给了名字。 它们在 2015–2020 年间相继成熟, 但各自怎么从分类改出来,书里没有讲26
  • 「为什么自然图像的底层线索集中在边缘上」没有解释。 书只指出大脑和网络解出了相近的答案, 更深的「题目为什么长这样」没有答案。

15. 可带走的

  1. 全连接处理图像,第一层就要 1.5 亿个参数,而且它根本没有位置概念。 猫挪个位置就不认识。
  2. 卷积 = 局部连接 + 权重共享。 前者对应「相邻像素更相关」,后者对应「同一模式随处出现」。
  3. 权重共享首先带来的是「换个位置也认得」,省参数是顺手的。
  4. 卷积就是一个模板在图上滑一遍,每个位置留一个「像不像我」的数。 5×5 配 3×3 那九个一乘一加,亲手算过一次就永远会了。
  5. 卷积给「等变」,汇聚给「不变」。 两个性质不是一回事,合起来才是「猫在哪里都是猫」。
  6. 感受野一层比一层宽,所以网络能从一条边慢慢看出一只猫。
  7. 典型骨架就是「卷积 + 激活 + 汇聚」反复堆,空间变小、通道变多。
  8. 残差连接只是一个加号,但它让每层只学小修正、让梯度走近路。 152 层因此从不可能变成日常。
  9. 进步是无数小改进的累积,不是一次天才设计。 六个里程碑每个只改一两处。
  10. 中小数据上卷积仍然更稳。 结构白送的先验,数据越少越值钱。

16. 原文地图

主题原书章原文位置
全连接的 1.5 亿参数第3章 从神经元到深度网络text/04-ch03.txt:177(搜「1.5 亿个」)
猫挪到左上角第3章 从神经元到深度网络text/04-ch03.txt:184(搜「陌生位置」)
两个核心想法第3章 从神经元到深度网络text/04-ch03.txt:190(搜「局部连接和权重共享」)
局部连接 27 个输入第3章 从神经元到深度网络text/04-ch03.txt:198(搜「27 个输入」)
权重共享与平移等变性第3章 从神经元到深度网络text/04-ch03.txt:202(搜「平移等变性」)
5×5 配 3×3 的走查第3章 从神经元到深度网络text/04-ch03.txt:208(搜「红框圈出的输入块」) · :221(搜「(0+0+0)」)
多卷积核与特征图第3章 从神经元到深度网络text/04-ch03.txt:231(搜「特征图」)
感受野第3章 从神经元到深度网络text/04-ch03.txt:233(搜「感受野」)
浅层边缘深层物体第3章 从神经元到深度网络text/04-ch03.txt:239(搜「浅层卷积核通常检测简单」)
猫视觉皮层实验第3章 从神经元到深度网络text/04-ch03.txt:242(搜「大卫·休伯尔」)
汇聚的两个作用第3章 从神经元到深度网络text/04-ch03.txt:255(搜「降低分辨率」)
典型架构第3章 从神经元到深度网络text/04-ch03.txt:262(搜「反复堆叠」)
AlexNet 分水岭第3章 从神经元到深度网络text/04-ch03.txt:277(搜「top-5 错误率」)
里程碑六架构第3章 从神经元到深度网络text/04-ch03.txt:299(搜「LeNet」) · :303(搜「AlexNet(2012)」) · :306(搜「VGG(2014)」) · :309(搜「GoogLeNet(2014)」) · :312(搜「ResNet(2015)」) · :320(搜「Vision Transformer(2020)」)
无数小改进的累积第3章 从神经元到深度网络text/04-ch03.txt:324(搜「无数小改进的累积」)
残差连接第3章 从神经元到深度网络text/04-ch03.txt:288(搜「相当于加一个捷径」)
中小数据卷积更稳第3章 从神经元到深度网络text/04-ch03.txt:461(搜「几万张图」)

Footnotes

  1. 出处:「第3章 从神经元到深度网络」第 177 段(text/04-ch03.txt:177,搜「1.5 亿个」)。 原文:展平后有 224 × 224 × 3 ≈ 15 万个数值,第一层 1000 个神经元,光这一层就需要 1.5 亿个参数。

  2. 出处:「第3章 从神经元到深度网络」第 184 段(text/04-ch03.txt:184,搜「陌生位置」)。 原文接着说:「这就是前馈网络最让人头疼的问题之一,缺少对位置变化的稳定性」。

  3. 出处:「第3章 从神经元到深度网络」第 187 段(text/04-ch03.txt:187,搜「正是为此而生」) 与第 190 段(text/04-ch03.txt:190,搜「局部连接和权重共享」)。 原文把两个核心创新分别对应两条观察:特征是局部的;同一特征可能出现在任何位置。

  4. 出处:「第3章 从神经元到深度网络」第 195 段(text/04-ch03.txt:195,搜「只关注图像的一小块区域」)。

  5. 出处:「第3章 从神经元到深度网络」第 198 段(text/04-ch03.txt:198,搜「27 个输入」)。 原文说这一改造「直接把参数数量砍了几个量级」。

  6. 出处:「第3章 从神经元到深度网络」第 199 段(text/04-ch03.txt:199,搜「卷积核」)。 原文的直觉:「卷积核就像一个模板,图像的某处如果与模板匹配,该位置的输出就很大」。

  7. 出处:「第3章 从神经元到深度网络」第 202 段(text/04-ch03.txt:202,搜「平移等变性」)。 原文的准确表述:「它首先带来平移等变性……卷积本身不是『完全不管位置』, 而是『位置变了,响应也跟着变』」。

  8. 出处:「第3章 从神经元到深度网络」第 207 段(text/04-ch03.txt:207,搜「输入是一张 5 × 5 的图像」)。 「我偏爱上面暗、下面亮」是我们对 −1/0/+1 三行权重的读法,书里称它为「水平边缘检测器」。

  9. 出处:「第3章 从神经元到深度网络」第 221 段(text/04-ch03.txt:221,搜「(0+0+0)」)。 原图高亮框的运算就是 (0+0+0)+(0+0+0)+(1+1+1)=3,与正文走查同一份数。

  10. 出处:「第3章 从神经元到深度网络」第 210 段(text/04-ch03.txt:210,搜「把一个局部模式检测器」)。

  11. 出处:「第3章 从神经元到深度网络」第 233 段(text/04-ch03.txt:233,搜「感受野」)。 原文的比方:「像拿着放大镜看桌面上的一小块;堆叠几层之后, 后面的神经元能间接看到越来越大的区域,最后甚至能综合整张图的信息」。

  12. 出处:「第3章 从神经元到深度网络」第 239 段(text/04-ch03.txt:239,搜「浅层卷积核通常检测简单」)。

  13. 出处:「第3章 从神经元到深度网络」第 252 段(text/04-ch03.txt:252,搜「最大汇聚」)。 书里还列了平均汇聚和全局平均汇聚两种。

  14. 出处:「第3章 从神经元到深度网络」第 255 段(text/04-ch03.txt:255,搜「降低分辨率」) 与第 256 段(text/04-ch03.txt:256,搜「平移不变性」)。

  15. 出处:「第3章 从神经元到深度网络」第 259 段(text/04-ch03.txt:259,搜「下采样」)。

  16. 出处:「第3章 从神经元到深度网络」第 262 段(text/04-ch03.txt:262,搜「反复堆叠」)。

  17. 出处:「第3章 从神经元到深度网络」第 268 段(text/04-ch03.txt:268,搜「通道数」)。 原文:「空间维度下降、特征维度上升」对应「由具体到抽象」。

  18. 出处:「第3章 从神经元到深度网络」第 299 段(text/04-ch03.txt:299,搜「LeNet」)、 第 303 段(text/04-ch03.txt:303,搜「AlexNet(2012)」)、 第 306 段(text/04-ch03.txt:306,搜「VGG(2014)」)、 第 309 段(text/04-ch03.txt:309,搜「GoogLeNet(2014)」)、 第 313 段(text/04-ch03.txt:313,搜「152 层」)、 第 320 段(text/04-ch03.txt:320,搜「Vision Transformer(2020)」)。 表里「它证明了什么」那一列是我们的概括;DenseNet 和 EfficientNet 两行 书里也有,我们并进了 VGG/GoogLeNet 之间的叙述而没单独列,因为它们证明的事 与相邻行重复(参数更省、按比例同步放大)。

  19. 出处:「第3章 从神经元到深度网络」第 324 段(text/04-ch03.txt:324,搜「无数小改进的累积」)。

  20. 出处:「第3章 从神经元到深度网络」第 284 段(text/04-ch03.txt:284,搜「残差连接(Residual Connection)」)。 原文的表述:让每一层学「输入需要如何修正」(残差)而不是「输出是什么」。

  21. 出处:「第3章 从神经元到深度网络」第 288 段(text/04-ch03.txt:288,搜「相当于加一个捷径」)。 原文:「这个加号让梯度可以通过捷径直接回传,极大缓解了梯度消失, 同时也让每一层只需要学『小的修正』」。

  22. 出处:「第3章 从神经元到深度网络」第 289 段(text/04-ch03.txt:289,搜「小的修正」)。 原文点名了 Transformer 和扩散模型。

  23. 出处:「第3章 从神经元到深度网络」第 242 段(text/04-ch03.txt:242,搜「大卫·休伯尔」)。 两位是休伯尔和维泽尔,1959 年做猫的实验,1981 年获诺贝尔生理学或医学奖。

  24. 出处:「第3章 从神经元到深度网络」第 246 段(text/04-ch03.txt:246,搜「Gabor 样式」)。 原文:「CNN 经过训练后第一层卷积核自发学出来的东西,常常很像这种 Gabor 样式的条纹」。

  25. 出处:「第3章 从神经元到深度网络」第 461 段(text/04-ch03.txt:461,搜「几万张图」)。 原文:「经验规律是大规模数据下 ViT 更好,中小规模下 CNN 更好, 如果你只有几万张图,CNN 往往更稳」。

  26. 出处:「第3章 从神经元到深度网络」第 291 段(text/04-ch03.txt:291,搜「人脸识别」)。 原文点名了 FaceNet、Faster R-CNN、U-Net 等,并说这些应用在 2015–2020 年间相继成熟。 2