跳到主要内容

深度学习是什么、为什么偏偏是现在火

这一章讲三件事: 「人工智能」「机器学习」「深度学习」这三个词到底各指什么; 机器是怎么「学」的(答案是搜表示,不是变聪明);以及这件事为什么在 2012 年突然成了。 这是全书的第一章,后面十三章都建立在这一章的三个名词和一张训练循环图上。

1. 顶层全景

先用一张图把三个名词的位置摆好,全书都在最里面那个圈里打转:

┌─ 人工智能(1956 年起):让机器做人的认知工作的所有尝试
│ ┌─ 机器学习:不手写规则,让机器从数据里自己找出规则
│ │ ┌─ 深度学习:用「很多层连续的表示变换」来做机器学习
│ │ │ ← 这本书全部内容都在这一层
│ │ └─ 其他:决策树、支持向量机、逻辑回归……(本章第 4 节会逐个讲)
│ └─ 其他:符号主义 AI、专家系统(两次 AI 冬天的主角)
└─

图说:三个圈是包含关系,不是并列关系。说「用 AI 做图像分类」不算错,
但准确的说法是「用深度学习做图像分类」。

本章的主走查是书里的坐标变换例子: 平面上撒着 3 个白点和 3 个黑点,要找一种「挪动整张平面的方法」,让挪完之后白点都在一边、黑点都在另一边。这个例子会先后用三次:用它讲清「表示」,用它讲清「学习就是自动搜变换」,再用它讲清深度学习「深」在哪。每一次都带着具体的数(分对了几个、损失是几、两层权重各是多少)——这些数是我们为演示编的,书里只画了图、没给数

2. 三个名词:各指什么

2.1 人工智能:最外面的圈

人工智能这个词 1956 年就出现了——那年夏天达特茅斯学院的一场研讨会上,John McCarthy 等人写下的提案里说,只要「精确描述学习的每个方面或智能的任何其他特征」,机器就能模拟它1

照着这个信念,从 50 年代到 80 年代末,主流做法是符号主义人工智能:人把规则一条条写好,机器照着执行。它适合定义明确的逻辑问题(下国际象棋),但搞不定模糊的问题——比如「看图认猫」,你没法写出「猫的规则」2。这条路线的顶点叫专家系统,80 年代各家公司每年为它花掉的钱超过 10 亿美元,然后崩了3

这段历史值得记住的原因在第 4 节:这个行业已经完整经历过两轮「以为成了→失望」,现在是第三轮。

2.2 机器学习:让机器自己找规则

符号主义卡壳的地方,逼出了一个反转的问题:既然人写不出规则,能不能让机器看着数据,自己把规则找出来?

书里给机器学习下的定义,值得一个字一个字读4:

在预先定义的可能性空间中,利用反馈信号的指引,在输入数据中寻找有用的表示和规则。

这个定义里有三个零件,每一个都要讲清楚:

第一个零件是「表示」。 同一堆数据,可以有很多种看法。彩色照片可以编码成 RGB(红绿蓝三个数),也可以编码成 HSV(色相、饱和度、明度)——同一张照片,两种写法;想「选中所有红色像素」,RGB 写法更方便,想「降低饱和度」,HSV 写法更方便5表示就是「把数据写成什么样子」,换个写法,同一件事的难度天差地别。

第二个零件是「可能性空间」。 机器不是漫无边际地找,而是在一个事先圈定的范围里找。这个圈定的范围叫假设空间——「我们打算试的,只有这一类变换」。范围划在哪,是人事先定的;在范围里挑哪一个,是机器学的6

第三个零件是「反馈信号」。 机器每挑一个变换,都要有个办法知道「这个好不好」。反馈信号就是打分,好就继续往这个方向走。

2.3 回到那堆黑白点:主走查第 ① 步

现在把三个零件装到坐标变换例子上。为了能把每一步的状态写出来,我们把它缩到平面上 6 个点:3 个白的、3 个黑的。目标是挪动整张平面(旋转一下、再平移一下),让挪完之后白点全在竖线左边、黑点全在右边7

下面这一路的具体数字是我们为演示编的,不是书里的——书里只画了「挪之前」和「挪之后」两张图,中间没有给数。编它们的理由是:不把中间状态写出来,这条走查就只剩起点和终点。

第一步先看起手。机器还不知道该怎么挪,就随便挑一个变换试:

起手(随便挑的一个变换) 竖线左边 竖线右边
○ ○ ● ● ○ ●
○ ● │ ● ○ 2白2黑 1白1黑
○ ● │ ●○
分对的:左边那 2 个白 + 右边那 1 个黑 = 3 个
反馈信号 = 3/6

图说:○ 是白点、● 是黑点,竖线是我们要它分开的那条界线。
「分对了几个」就是这一步拿到的反馈信号。

把机器学习定义的三个零件对上号——每个零件都对上了这一步的一个具体的数:

定义的零件在这个例子里是起手这一步的具体值
表示变换后 6 个点各自的新坐标6 对新坐标(左边 4 个点、右边 2 个点)
假设空间「所有可能的坐标变换」这个集合——平移、旋转、缩放,随便组合机器只在这个集合里挑,不会挑到「把点涂个色」这种事
反馈信号变换后,黑白两边分对了多少个点3/6

接着就是「学习」:换一个变换再试,看反馈信号有没有变好。

① 起手的随机变换 左 2白2黑 / 右 1白1黑 反馈信号 3/6
② 把平面转 30 度 左 2白1黑 / 右 1白2黑 反馈信号 4/6 ← 变好了,朝这个方向继续
③ 转完再往左平移一段 左 3白0黑 / 右 0白3黑 反馈信号 6/6 ← 全分对,可以收工

图说:点和点的相对位置从头到尾没变,变的只是坐标系。
变换选对了,「哪边是白点」从「说不清的弯弯绕」变成「看一眼横坐标就知道」。

人来做,看一眼图就能直接画出第 ③ 步那个变换;机器来做,就是从第 ① 步那种随便挑的变换开始,一个一个试过去,拿反馈信号打分,留下分最高的那个8这就是「学习」这个词的全部内容:在一个划好的可能性空间里,靠反馈信号搜出一个好用的表示。 没有顿悟,没有变聪明。

3. 深度学习的「深」是什么

3.1 一层不够,就叠很多层

黑白点那个例子,一种变换就解决了。但真实问题(比如看照片认猫)里,没有哪种单一变换能把「一堆像素」变成「这是猫」。办法是把变换拆成很多层,一层做一点点,层层叠起来完成整个转变9

这就是「深度」的确切含义:连续的表示变换的层数。 书里特意泼了一盆冷水——「深度」指的并不是「更深层次的理解」,它没有这个意思,就只是层数多10。今天的模型动辄几十上百层;只叠一两层的做法,叫浅层学习。

每一层内部长什么样?书里的说法是:每一层是一个几何变换,层的具体行为由它内部的一组数值决定,这组数值叫权重——层里可以调的数,变换做成什么样,全看这堆数调成了什么样11权重也叫参数,两个名字指同一堆数,本书两个词都用。

至于「神经网络」这个名字,书里同样先泼了冷水:它是从神经生物学借来的,但深度学习模型并不是大脑模型,没有证据表明大脑的学习机制与之一样——这个名字主要是个历史遗留12

3.2 三张图:训练循环

一堆层叠起来、每层装着一堆权重,接下来的问题是:权重怎么调对?书里用三张图回答,这是全书最重要的一张流程13:

① 输入数据 → [一层层变换] → 预测结果
② 预测结果 与 真实答案 比较 → 损失函数算出一个数,这个数叫「损失」
③ 优化器根据损失,反向传播,把每层权重往「损失更小」的方向微调

└─► 回到 ①,换下一批数据

图说:这就是训练循环。重复足够多次之后,权重被调到了
「预测和答案差不多」的位置。

损失函数就是第 ② 步那个打分:它把「预测离真实答案有多远」算成一个数——这个数就叫损失,数越大,错得越离谱。全书只用「损失」这一个叫法;你在别处会看到「误差」「代价」「距离」,指的是同一个量,书里还给这个函数本身列了两个别名——目标函数、代价函数14

优化器是第 ③ 步的执行者:它根据损失决定每个权重该往哪边调、调多少,调整的办法叫反向传播——从最后的损失出发,一层层往回把「这层该负多少责任」算出来。它是怎么算的,要用到微积分的链式法则,第 03 章会拿具体数字从头走一遍,这一章只需要记住它的角色:反向传播是把损失翻译成「每个权重的调法」的机制15

整个训练循环,书里概括成一句话:一开始权重是随机值,模型做出近乎随机的预测;之后每处理一批数据,权重都往正确方向微调一点,损失值相应减小——把这个循环转上几千几万次,模型就「学会」了16

3.3 回到黑白点:主走查第 ② 步

现在可以把黑白点例子讲完整了。第 2 节里,人是看一眼图就画出变换;换成深度学习的样子,那个变换被拆成两层,而且没有人去挑——是训练循环一轮一轮调出来的。

假设空间定为「两层变换」:第一层负责转,第二层负责推。两层内部各是一组权重,起步时是随机数。损失函数就取最朴素的那个:6 个点里分错了几个。同样用上一节那 6 个点,同样是我们编的数:

轮次第一层的权重(转多少度)第二层的权重(往左推多远)分开的结果损失(分错几个)
第 1 轮(随机起步)0.1左 2白2黑 / 右 1白1黑3
第 40 轮12°0.4左 2白1黑 / 右 1白2黑2
第 300 轮30°1.0左 3白0黑 / 右 0白3黑0

每一轮里发生的事,就是第 3.2 节那张训练循环图:①算出这一轮的分法 → ②损失函数报出「错了 3 个」 → ③优化器反向传播,把「3°」和「0.1」各往「错得少一点」的方向挪一丁点 → 回到 ①。挪了三百次之后,两个数停在 30° 和 1.0 上,损失归零。

注意第 40 轮那一行:两层都还没调对,但已经比随机起步好了一点。 这就是这套办法能成的关键——它不需要一步到位,只需要每一步比上一步好一点点。

和单层相比,多层的区别是:每一层只需要学会「比上一层好一点点」的简单变换,简单变换的组合能完成单层做不到的复杂转变。这就是「深」换来的东西。

4. 2012 年发生了什么,为什么偏偏是现在

4.1 在深度学习之前(一):算概率的那一派

深度学习不是机器学习的全部。在它成为主角之前,这个领域的主角换过好几轮。先看最老的两个,它们都比计算机本身还老17

朴素贝叶斯。 它的做法是:对一封邮件,分别算「假如它是垃圾邮件,会长成这样的可能性有多大」和「假如它是正常邮件,会长成这样的可能性有多大」,哪边大就判哪边。算这两个可能性靠的是一条 18 世纪就有的公式,叫贝叶斯定理。它还额外加了一条很强的假设:输入数据的各个特征之间互不相干——邮件里出现「免费」和出现「点击」被当成两件毫不相关的事。这条假设显然不真,所以它叫「朴素」。

逻辑回归。 书里叫它「现代机器学习的 Hello World」,意思是拿到一个分类任务,数据科学家通常先拿它跑一遍,好摸清这个任务的底细。别被名字骗了:它叫回归,干的却是分类——它做的事是给每个样本算出一个 0 到 1 之间的分数(「这封是垃圾邮件的可能性」),再按这个分数划线归类。它既简单又通用,所以至今还很有用。

4.2 在深度学习之前(二):支持向量机与核技巧

支持向量机(SVM) 是 90 年代的主角。两类点之间可以画很多条分界线,它专挑「离两边的点都最远」的那一条。碰上一条直线怎么画都分不开的情况,它有一招叫核技巧:先把点搬进一个更高维的空间(在那里它们就能被一个平面分开),而且不真的去算新坐标,只算点与点之间的距离——省掉了绝大部分计算。

4.3 在深度学习之前(三):一堆流程图

2000 年代之后接棒的是另一派,它们的零件全是「如果……就……」。

决策树就是一张流程图:第一个问题问「金额是不是大于 500」,是就往左走再问下一个问题,不是就往右走,一路问到底,末端挂着答案。它的好处是画得出来、也解释得清——每一次判断都摆在明面上。

随机森林是把决策树成批地用:先造出很多棵各有偏好的决策树,再把它们的判断汇总起来投票,少数服从多数。这个办法稳、好用,书里给了它一句很有名的评价——对于任何浅层的机器学习任务,它几乎总是第二好的算法

梯度提升机是同一批零件的另一种用法,而且更狠:它也是一堆决策树,但后一棵树专门去补前面那些树答错的地方,一棵一棵接力往上补。2014 年起它取代随机森林,成了 Kaggle 上最常用的技术之一——Kaggle 是一个办机器学习竞赛的网站,2010 年上线,大家在上面用同一批数据比赛谁的模型分高,所以它上面流行什么,基本就代表当时业界在用什么。

4.4 这一整代方法共同的门槛:特征工程

上面这五种方法有一个共同的门槛:喂给它们的数据,得先由人加工成「好嚼」的形式。 拿支持向量机认手写数字,你不能把原始像素直接倒给它,得先由人设计好「圆圈个数、笔画方向」这类描述——这一步叫特征工程。它难、不稳定、工程量巨大,而且每换一个任务就要重来一遍18

记住这个门槛,因为下一节那个拐点,拆掉的正是它。

4.5 拐点:ImageNet 2012

2012 年的 ImageNet 大规模视觉识别挑战赛(ILSVRC),是这本书认定的历史性拐点。这项比赛要求对 140 万张高分辨率彩色照片分 1000 个类别。前三年的成绩是一条突然折弯的线19:

  • 2011 年,获胜成绩是 74.3%,用的是经典计算机视觉方法;
  • 2012 年,Alex Krizhevsky 带队、Geoffrey Hinton 指导的小组,用深度卷积神经网络拿到 83.6%——一年之内把错误率砍掉了将近四成;
  • 2015 年,获胜成绩达到 96.4%,这项比赛的分类任务被认为「已完全解决」。

这三个数用的是同一把尺子,叫 top-5 精度:每张照片模型给出 5 个猜测,只要正确答案在这 5 个里面就算它答对,答对的照片占多少比例就是这个数。之所以给 5 次机会,是因为这项比赛有 1000 个类别,而且不少类别彼此很像(狗就分了一百多个品种)20

这里的卷积神经网络是一种专门为图像设计的神经网络:它不按整张图学,而是按一个个小窗口扫着图学——第 08 章会用两章的篇幅把它讲透,这里只需要知道,2012 年赢的就是它。

4.6 深度学习到底不同在哪

书里总结了两点,这两点是理解后面所有章节的钥匙21:

第一,特征工程被完全自动化了。 旧流程里最难、最不稳定的那一步(人手工设计数据表示),现在由模型自己从数据里学出来——上一节的黑白点变换就是缩影:人只圈定假设空间,表示本身是搜出来的。

第二,所有层是共同学习的,不是一层一层分别学的。 每一层的调整都要同时配合它上面和下面的所有层——特征的变化环环相扣,像由变化组成的齿轮组。

4.7 第一股东风(上):算力是游戏市场买的单

为什么偏偏是 2012 年?不是某一项发明,而是三件事同时到位22。第一件是算得动了。

普通 CPU(电脑里那颗什么都干的主芯片)在 1990 到 2010 年间快了约 5000 倍。但对图像识别这种活,这还差着好几个数量级。真正救场的是另一种芯片:**为了让游戏画面更逼真,NVIDIA 和 AMD 花了几十亿美元开发专门画三维画面的并行芯片。这种芯片叫图形处理器,英文缩写 GPU——就是你天天听见的那三个字母,装在电脑里的那块板子,俗称「显卡」。三个叫法,一件东西。**它擅长的事是「同时做几万个小乘法」,而神经网络恰好就是一大堆小矩阵乘法,于是被直接借用了过来23

4.8 第一股东风(下):teraFLOPS 是一把什么尺子

一块芯片有多快,业界用 teraFLOPS 来讲——FLOPS 是「每秒能做多少次浮点运算」,tera 是万亿,所以 1 teraFLOPS 就是每秒一万亿次。2019 年一块 NVIDIA Titan RTX 游戏显卡(约 2500 美元)峰值 16 teraFLOPS;作为参照,1990 年全世界最快的超级计算机只有它的约 1/500。谷歌后来自己造了专供深度学习的芯片 TPU,单卡推到 420 teraFLOPS23

一句话记住这一节:这一轮人工智能的算力,是电子游戏玩家先掏钱养起来的。

4.9 第二股东风:数据,互联网的副产物

第二件是有东西可喂了。ImageNet 那 140 万张图片,每一张都由人看过、写上它属于哪一类——这个动作叫标注,标注过的数据才能拿来训练(模型要对答案,得先有答案)。

这种规模的标注数据集,在互联网之前根本不可能收集:图片本身来自网民上传,标注则靠把任务拆成几百万个小活分发给全世界的人。没有消费者互联网,就没有 ImageNet24

4.10 第三股东风:算法,六个不起眼的改进

第三件最不起眼,也最关键。2009 年之前,神经网络叠不深——层一多,反馈信号往回传的路上就一路衰减,传到前几层已经几乎没有了,前几层等于没在学。所以当时的网络只有一两层,打不过支持向量机和随机森林25

先单独交代六个改进里的第一个,因为下一章整章都靠它:激活函数——就是加在每一层算完之后的那道额外工序,把结果掰弯一下(比如「负数一律归零」)。不掰这一下,叠多少层都等于一层,第 02 章会把这件事证明给你看。

2009–2016 年间,一串改进逐个到位,每一个都在治这条路上的一种病:

改进它治的是什么病
更好的激活函数换一种「掰弯」的形状,让反馈信号别在这一道工序上被压没(第 02 章的顶梁柱)
更好的权重初始化开局那堆随机数别取得太大或太小,免得信号一层层放大到爆或缩到没
更好的优化器(RMSprop、Adam)每一步该挪多少,让它自己按情况调,不再全靠人拧一个固定的步长
批量规范化每层算完把输出的分布拉回一个正常的范围,后面的层才好接着算
残差连接给反馈信号修一条直通的近道,让它能穿过几十层传回最前面
深度可分离卷积把一次卷积拆成两步做,参数少一大截,同样的算力能训更大的模型

正是这六样让「几十层深」从「训不动」变成「训得动」。这里只交代它们各治什么病;激活函数在第 02 章展开,后三个在第 09 章各占一节25

资本跟着涌进来:全球 AI 风险投资从 2011 年不到 10 亿美元,涨到 2017 年的 160 亿美元;从业者从几百人变成几万人26

5. 作者的判断与证据

这一章里作者下了好几个判断,证据成色不一样,分开看:

有证据的: 2012 拐点(比赛成绩白纸黑字);三股东风(硬件倍数、投资数字可查);特征工程自动化(本书后续每一章都是证据)。

作者的个人判断: 「我们可能正在见证人工智能炒作与让人失望的第三次循环」——他明确承认存在炒作,但论证这次不同:前两次(60 年代符号主义、80 年代专家系统)的技术没有产生实际经济价值,而深度学习已经在语音识别、图像分类、机器翻译上产生了真金白银的价值27。他的结论是那句金句28:

不要相信短期炒作,但一定要相信长期愿景。

他还记录了自己的一次成功预测:本书第 1 版(2017 年)就预测 2017–2018 年 Transformer 架构会崛起,成为自然语言处理(缩写 NLP——就是让机器处理人写的文字这一支,从翻译、分类到今天的聊天机器人都归它)的主流,事后应验了29。这个缩写后面每一章都会用到。

判断(我们的,不是书里的): 这一章对「深度学习有何不同」的回答,其实只回答了「和上一代机器学习比有何不同」,没有回答「和下一代比是不是终极形态」。作者自己在第 14 章会亲手拆掉这个光环——深度学习只是「局部泛化」的机器。所以读这本书时,本章的乐观和第 14 章的冷静要当成一对来读。 如果错,会错在: 如果读者只读前几章不读第 14 章,会把作者的立场误判为「深度学习原教旨主义」;但全书结构本身是「先教会手艺,再讲清边界」,不是前后矛盾。

6. 边界与局限

  • 这一章是「地图章」,所有机制都只给了名字和角色:反向传播怎么算(第 03 章)、卷积怎么扫(第 08 章)、批量规范化和残差连接是什么(第 09 章),这一章都没有展开。
  • 2012 年之后的具体数字(精度、投资额、GPU 型号)反映的是 2021 年成书时的世界;今天引用时,机制有效,数字要打折。
  • 作者对「深度学习会让 AI 普及」的论证,建立在「现有算法部署到所有适用问题」的假设上——这个假设是否成立,书里第 14 章自己会给出更克制的讨论。

7. 可带走的

  1. 人工智能 ⊃ 机器学习 ⊃ 深度学习,三个圈不是并列关系;
  2. 机器学习 = 在预先定义的可能性空间(假设空间)里,靠反馈信号搜有用的表示——没有顿悟;
  3. 表示决定难度:同一份数据,RGB 和 HSV 两种写法下,同一任务难度天差地别;
  4. 「深度」只是层数,不是「更深的理解」;「神经网络」也只是个历史名字,与大脑无关;
  5. 训练循环三件套:权重(层里可调的数)→ 损失函数(预测离答案多远)→ 优化器(反向传播调权重);
  6. 深度学习与旧方法的两点不同:特征工程自动化 + 所有层共同学习;
  7. 2012 拐点是硬件、数据、算法三股东风同时到位,不是单项发明——算力那一股是电子游戏市场先掏钱养起来的(显卡 = GPU = 图形处理器,同一件东西三个叫法);
  8. 那次拐点的成绩用的尺子叫 top-5 精度:模型给 5 个猜测,正确答案在里面就算对;2011 年 74.3% → 2012 年 83.6%;
  9. 这个行业已经历两轮「以为成了→失望」;作者的立场:别信短期炒作,但要信长期愿景。

8. 原文地图

主题原书章原文位置
AI 的诞生与 1956 提案什么是深度学习text/08-ch01.txt:33(搜「最终在 1956 年」)
符号主义与专家系统兴衰什么是深度学习text/08-ch01.txt:50(搜「符号主义人工智能」) · text/08-ch01.txt:324(搜「10 亿美元」)
机器学习定义、假设空间什么是深度学习text/08-ch01.txt:167(搜「预先定义的可能性空间」) · text/08-ch01.txt:165(搜「假设空间」)
表示的例子(RGB/HSV、坐标变换)什么是深度学习text/08-ch01.txt:121(搜「HSV」) · text/08-ch01.txt:134(搜「坐标变换」)
深度=层数、不是大脑模型什么是深度学习text/08-ch01.txt:175(搜「更深层次的理解」) · text/08-ch01.txt:185(搜「并不是大脑模型」)
训练循环三张图什么是深度学习text/08-ch01.txt:273(搜「训练循环」)
两次 AI 冬天、Minsky 预言什么是深度学习text/08-ch01.txt:314(搜「一代人的时间」) · text/08-ch01.txt:326(搜「第三次循环」)
老方法谱系(朴素贝叶斯/逻辑回归/SVM)什么是深度学习text/08-ch01.txt:370(搜「朴素贝叶斯是一类机器学习分类器」) · text/08-ch01.txt:376(搜「Hello World」) · text/08-ch01.txt:412(搜「核技巧」)
树模型三兄弟与 Kaggle什么是深度学习text/08-ch01.txt:428(搜「类似于流程图的结构」) · text/08-ch01.txt:431(搜「构建许多」) · text/08-ch01.txt:433(搜「第二好的算法」) · text/08-ch01.txt:441(搜「弥补原有模型的弱点」)
ImageNet 拐点数字与 top-5 定义什么是深度学习text/08-ch01.txt:466(搜「74.3%」) · text/08-ch01.txt:467(搜「83.6%」) · text/08-ch01.txt:468(搜「96.4%」) · text/08-ch01.txt:475(搜「模型前 5 个结果」)
深度学习两点不同什么是深度学习text/08-ch01.txt:483(搜「特征工程完全自动化」) · text/08-ch01.txt:502(搜「两个基本特征」)
硬件/数据/算法三股东风什么是深度学习text/08-ch01.txt:601(搜「5000 倍」) · text/08-ch01.txt:605(搜「图形处理器」) · text/08-ch01.txt:613(搜「teraFLOPS」) · text/08-ch01.txt:464(搜「140 万张」) · text/08-ch01.txt:647(搜「梯度传播」) · text/08-ch01.txt:655(搜「RMSprop」)
投资额与长期愿景什么是深度学习text/08-ch01.txt:699(搜「不到 10 亿美元」) · text/08-ch01.txt:352(搜「长期愿景」)

Footnotes

  1. 出处:「什么是深度学习」第 33 段(text/08-ch01.txt:33,搜「最终在 1956 年」)。1956 年夏,John McCarthy 在达特茅斯学院的研讨会上提出人工智能研究提案,AI 由此成为一个研究领域。

  2. 出处:「什么是深度学习」第 50 段(text/08-ch01.txt:50,搜「符号主义人工智能」)与第 53 段(text/08-ch01.txt:53,搜「定义明确的逻辑问题」)。

  3. 出处:「什么是深度学习」第 324 段(text/08-ch01.txt:324,搜「10 亿美元」)。1985 年前后,各公司每年在专家系统上的花费超过 10 亿美元;到 90 年代初,维护贵、难扩展的问题暴露,热潮退去。

  4. 出处:「什么是深度学习」第 167 段(text/08-ch01.txt:167,搜「预先定义的可能性空间」)。

  5. 出处:「什么是深度学习」第 121 段(text/08-ch01.txt:121,搜「HSV」)与第 123 段(text/08-ch01.txt:123,搜「选择图像中所有红色像素」)。

  6. 出处:「什么是深度学习」第 165 段(text/08-ch01.txt:165,搜「假设空间」)。原文举例:「所有可能的坐标变换组成的空间就是上述二维坐标分类示例的假设空间」。

  7. 出处:「什么是深度学习」第 134 段(text/08-ch01.txt:134,搜「坐标变换」)与图 1-3、图 1-4。书中用二维平面上的黑白点分类来演示「好的表示」长什么样。

  8. 出处:「什么是深度学习」第 148 段(text/08-ch01.txt:148,搜「我们手动定义了坐标变换」)。书中点明:这个例子是人手动选变换,而机器学习要把它变成自动搜索。

  9. 出处:「什么是深度学习」第 175 段(text/08-ch01.txt:175,搜「连续的表示层」)。

  10. 出处:「什么是深度学习」第 175 段(text/08-ch01.txt:175,搜「更深层次的理解」)。原文:「『深度』并不是说这种方法能够获取更深层次的理解,而是指一系列连续的表示层」。

  11. 出处:「什么是深度学习」第 222 段(text/08-ch01.txt:222,搜「权重」)。书中图 1-7:神经网络中每一层由一组权重来参数化。

  12. 出处:「什么是深度学习」第 185 段(text/08-ch01.txt:185,搜「并不是大脑模型」)。原文:「深度学习模型并不是大脑模型。没有证据表明大脑的学习机制与现代深度学习模型的学习机制相同。」

  13. 出处:「什么是深度学习」第 244 段(text/08-ch01.txt:244,搜「损失函数」)、第 249 段(text/08-ch01.txt:249,搜「优化器」)与第 271–276 段(训练循环的完整描述)。

  14. 出处:「什么是深度学习」第 244 段(text/08-ch01.txt:244,搜「损失函数」)。原文给出别名:目标函数、代价函数。

  15. 出处:「什么是深度学习」第 249 段(text/08-ch01.txt:249,搜「反向传播」)。第 03 章会给出带具体数字的完整走查。

  16. 出处:「什么是深度学习」第 271 段(text/08-ch01.txt:271,搜「随机赋值」)与第 273 段(text/08-ch01.txt:273,搜「训练循环」)。

  17. 出处:朴素贝叶斯与「朴素」的由来见「什么是深度学习」第 370 段(text/08-ch01.txt:370,搜「朴素贝叶斯是一类机器学习分类器」);逻辑回归见第 375 段(text/08-ch01.txt:375,搜「logistic 回归」)与第 376 段(text/08-ch01.txt:376,搜「Hello World」);支持向量机与核技巧见第 396 段(text/08-ch01.txt:396,搜「支持向量机」)与第 412 段(text/08-ch01.txt:412,搜「核技巧」);决策树见第 428 段(text/08-ch01.txt:428,搜「类似于流程图的结构」);随机森林与 Kaggle 见第 431 段(text/08-ch01.txt:431,搜「构建许多」)与第 433 段(text/08-ch01.txt:433,搜「第二好的算法」);梯度提升机见第 434 段(text/08-ch01.txt:434,搜「梯度提升机」)与第 441 段(text/08-ch01.txt:441,搜「弥补原有模型的弱点」)。垃圾邮件、金额大于 500 这两个例子是我们编的,书里没有举例。

  18. 出处:「什么是深度学习」第 423 段(text/08-ch01.txt:423,搜「特征工程」)与第 488 段(text/08-ch01.txt:488,搜「feature engineering」)。

  19. 出处:「什么是深度学习」第 464 段(text/08-ch01.txt:464,搜「140 万张」)、第 466 段(text/08-ch01.txt:466,搜「74.3%」)、第 467 段(text/08-ch01.txt:467,搜「83.6%」)与第 468 段(text/08-ch01.txt:468,搜「96.4%」)。

  20. 出处:「什么是深度学习」第 475 段(text/08-ch01.txt:475,搜「模型前 5 个结果」)。原书这条脚注写着:「『top-5 精度』衡量的是,模型前 5 个结果中包含正确答案的频率(对于 ImageNet 来说,共有 1000 种可能的结果)」。「狗分了一百多个品种」属于通用知识,不在书里。

  21. 出处:「什么是深度学习」第 483 段(text/08-ch01.txt:483,搜「特征工程完全自动化」)、第 496 段(text/08-ch01.txt:496,搜「共同学习」)与第 502 段(text/08-ch01.txt:502,搜「两个基本特征」)。

  22. 出处:「什么是深度学习」第 595 段(text/08-ch01.txt:595,搜「为什么是现在」)。

  23. 出处:「什么是深度学习」第 601 段(text/08-ch01.txt:601,搜「5000 倍」)、第 605 段(text/08-ch01.txt:605,搜「图形处理器」——原文正是在这里把「图形处理器」和「GPU」两个叫法绑在一起,并说明这些芯片本是为视频游戏开发的)、第 613 段(text/08-ch01.txt:613,搜「teraFLOPS」)与第 620 段(text/08-ch01.txt:620,搜「420 teraFLOPS」)。「1 teraFLOPS = 每秒一万亿次浮点运算」是原文自己的换算(第 613 段:「即每秒进行 16 万亿次 float32 运算」);「显卡」这个俗称属于通用知识,不在书里。 2

  24. 出处:「什么是深度学习」第 464 段(text/08-ch01.txt:464,搜「140 万张」)。

  25. 出处:「什么是深度学习」第 647 段(text/08-ch01.txt:647,搜「梯度传播」——原文说明层数一多反馈信号就逐渐消失,这是当年叠不深的原因)、第 651 段(text/08-ch01.txt:651,搜「激活函数」)、第 652 段(text/08-ch01.txt:652,搜「权重初始化」)、第 655 段(text/08-ch01.txt:655,搜「RMSprop」)与第 657 段(text/08-ch01.txt:657,搜「批量规范化」)。表格里「它治什么病」那一列,除梯度传播这条外都是我们照后续章节的内容概括的,原书在这里只列了名字。 2

  26. 出处:「什么是深度学习」第 699 段(text/08-ch01.txt:699,搜「不到 10 亿美元」)、第 701 段(text/08-ch01.txt:701,搜「160 亿美元」)与第 708 段(text/08-ch01.txt:708,搜「几百人」)。

  27. 出处:「什么是深度学习」第 326 段(text/08-ch01.txt:326,搜「第三次循环」)。

  28. 出处:「什么是深度学习」第 352 段(text/08-ch01.txt:352,搜「长期愿景」)。

  29. 出处:「什么是深度学习」第 744 段(text/08-ch01.txt:744,搜「Transformer」)。作者自述第 1 版的预测:「2017—2018 年……Transformer 会崛起」,并说这一预测已被验证。