跳到主要内容

全书落点 — 作者亲手把它拆开,告诉你它不理解任何事

这一章讲三件事: 前二十一章造出来的那台机器,本质上到底是什么; 有哪两个实验能证明它不理解任何事; 以及承认这一点之后,你带走的东西还剩多少。 它在全书链条里的位置: 这是落点,不是附录。 前二十一章教你造一台机器,这一章告诉你这台机器是什么。 只读前面不读这一章,你拿到的是一本工具手册,而不是一本讲深度学习是什么的书。

1. 先把三个名字的关系摆正

书开头做了一件很有必要的事:把三个常被混着用的词分层1

┌─────────────────── 人工智能 ───────────────────┐
│ 定义:任何尝试把「认知过程」自动化的行为 │
│ 小到自动处理一张表格,大到会走会说话的人形机器人 │
│ │
│ ┌──────────── 机器学习 ────────────┐ │
│ │ 目标:只靠对训练数据的学习, │ │
│ │ 自动开发出一个叫模型的程序 │ │
│ │ (历史几十年,90 年代才真正实用) │ │
│ │ │ │
│ │ ┌──── 深度学习 ────┐ │ │
│ │ │ 模型由很多步转换 │ │ │
│ │ │ 一个接一个组成 │ │ │
│ │ │ ——「深度」由此而来 │ │ │
│ │ └──────────────────┘ │ │
│ └──────────────────────────────────┘ │
└────────────────────────────────────────────────┘

图说:书对「学习」下的定义值得抄下来 ——
**把数据转换成一个程序(也就是模型),这个过程就叫学习。**

书还顺手把「层」和「权重」再定义了一遍: 那些转换被封装在叫的模块里; 层里那些帮它把输入变成输出、并且在训练中不断被更新的数,叫权重。 模型在训练中学到的「知识」全部保存在权重里1

2. 承重节:那台机器到底是什么

这一节是整本书的收口。

书给的答案

**在深度学习中,一切都可以表示为数字序列 —— 也就是向量。**
**而一个向量可以看成几何空间里的一个点。**

输入(表格、图像、文本)→ 先被向量化 → 变成**输入空间里的一堆点**
目标(标签) → 也被向量化 → 变成**目标空间里的一堆点**

中间那些层做什么?**每一层对流经它的数据做一次简单的几何转换。**

一层接一层串起来 → **一个由很多简单几何转换组合成的复杂几何转换。**

它想干的事只有一件:**把输入空间里的点,搬到目标空间里对应的位置上。**

而各层的权重,**就是这套搬运方案的全部内容**[^2]。

上面那两个「空间」有个正式名字:向量空间—— 它就是「把每个东西写成一串数、再把这串数当成一个点」之后,这些点所在的那个地方。

这句话是第 01 章那条线的终点

第 01 章讲过一个例子:一堆黑点白点撒在纸上,横着切竖着切都分不开; 换成「离中心多远、在什么角度上」,一刀就分明了——数据没变,说法变了,难题就没了。

这一章把那句话推到了底:

整台机器从头到尾做的,就是这件事,做几十次。 不是「理解」,是「换坐标」。

书还补了一个约束条件:这一整串转换必须是可微的2「可微」的意思是:每一步都能算出「输入挪一点,输出会跟着挪多少」—— 这正是第 02 章那套训练方法能成立的全部前提。整台机器的结构,是被训练方法反过来限定的。

费曼那句话

书在这一节引了一句评语,而它是这一章最该背下来的一句3:

「它并不复杂,只是量大罢了。」

这句话原本是费曼在 1972 年一次电视采访里评论宇宙的,书借它来说深度学习。

紧挨着的那句同样重要: 深度学习最惊人的一点是它的简单—— 这是相对而言的。 在它之前的机器学习技巧要复杂得多,取得的成果却不如它。 十年前,没人能预知仅靠梯度下降训练出的参数化模型,能在机器感知问题上取得这样的成果3

3. 两个实验,证明它不理解

这一节是本章的证据部分。书先给出了那个误解的名字。

误解叫拟人化

书说,人们对深度学习最大的一个误解,是把它当成对人的感知与认知的模仿4

人看一张照片时:不只看亮度和色彩,还会从这些看似随机的模式里
**提取出更深的含义** —— 图里有个小女孩、有把牙刷、两者有什么关系。

深度神经网络的工作方式**和人脑完全不同。**

图说:书举了图像标注模型的失败案例作为佐证 ——
**一个能把图像映射成文字的模型,不代表它像人一样理解了这张图。**

实验一:大熊猫和长臂猿

这个实验是全书最漂亮的一条暗线的收尾。

① 拿一张大熊猫照片,模型说:大熊猫。✓

② 算一层扰动加上去。**这层扰动人眼看不出来。**

③ 同一个模型再看一次,笃定地说:**长臂猿。**

图说:这种专门用来骗模型、诱导它犯错的样例,叫**对抗样例**。

关键在于那层扰动是怎么算出来的,而这一点书自己点破了5:

它用的动作,和第 10 章那个「让模型指出它在看哪儿」是同一个。

第 10 章:对输入求梯度,让某个部件的响应最大 —— **用来解释模型**
这一章: 对输入求梯度,让「长臂猿」这个类别的概率最大 —— **用来欺骗模型**

**同一个 `tf.grad`,同一个动作,两种用途。**

图说:这是全书埋得最深的一条线,而书是在最后一章才把它接上的。
**一个能被这样骗过去的东西,显然没有在「看」内容。**

实验二:8 个样例,人画一个圈,它画一堆碎边界

这个实验回答的是另一个问题:样例很少的时候,人和它的差别在哪6

任务:在一个二维平面上给 8 个已标好的点,画出这一类数据的边界。

人会怎么画:很快意识到**边界应该是平滑的、这一类应该连成一片**
→ **围着所有样例画一个封闭的圈**

神经网络怎么画:**一堆紧贴着那 8 个样例的、不规则的碎边界**
→ 换个稍微远一点的新点,它就判错了

书给这两种能力起了名字:
神经网络的叫**局部泛化** —— 只在见过的样例附近成立
人的那种叫**极限泛化** —— 从很少的例子推到很远的地方

图说:**书给的原因是它「欠缺抽象思维」** —— 它没有任何先验知识,
所以只能靠海量的标注数据去把那片区域一点点糊满[^6]。

⚠ 书在脚注里留了一个开口: 有研究在尝试让同一个网络做很多看似不相关的任务, 以此增强跨领域的知识共享;但书说这类多任务模型还没有被广泛使用6

4. 但这不是贬低:它解决了「感知」

书在讲局限之前先讲了成就,而且这个措辞很精确7:

深度学习已经很大程度上「解决了感知问题」——尽管这里说的是狭义的感知问题。

「感知型任务」指的是:从图像、音频、视频这类感知数据里,
**以足够高的准确率提取出有用的信息。**

书的说法是:**只要有足够多的有标签训练数据,
任何人类能识别的信息都能被提取出来,有时准确率还超过人类。**

图说:这是一句很大的话,但它划了两道边界 ——
**「狭义的」和「有足够多的有标签数据」。这两个限定词都是承重的。**

书还给了一个态度鲜明的乐观判断:即使未来十年没有任何理论突破, 仅仅把现有技术用到各个适用的实际问题上,就已经能给很多行业带来革命性变化8

它是怎么成的:四个因素

书说这不是一蹴而就的,而是四股力合起来的结果9:

因素书的说法
算法上的逐步革新前二十年是零星发生的;2012 年起投入变多,才开始高速发展
大量有标签的数据它们是消费互联网崛起的副产品;移动设备普及和存储进步进一步加速
又快又便宜的并行硬件包括原本是给电子游戏用的显卡,以及后来专为深度学习设计的芯片
一系列开源软件它们把底层的巨大复杂度藏起来了——深度学习从专家独享的工具,变成每个程序员都能用的工具

第二条最值得停一下: 支撑这场革命的数据,不是谁专门为它准备的,是别的东西的副产品。

5. 合上书之后,你手上有什么

这一节是这一章最实用的部分,而且它兑现了两笔债。

债一:三大网络怎么按输入数据挑

书把全书的网络归成三类,并给了一张挑选表10:

你的输入数据是什么用哪种
向量数据(没有时间顺序也没有空间顺序)密集层堆起来的网络(MLP)
图像(黑白 / 灰度 / 彩色)二维卷积
音频画成的时频谱二维卷积,或循环网络
文本一维卷积,或循环网络
时间序列一维卷积,或循环网络
立体数据(比如三维的医学影像)三维卷积
视频(图像序列)三维卷积;或者二维卷积逐帧提特征 + 循环网络或一维卷积处理这串特征

书给这张表配了一个很好的说法:网络的架构会对输入数据的结构做出一些假设, 从而划出一个假设空间;训练要做的,是在这个空间里找一个好模型10

所以选错网络类型不是「效率低一点」,是「你划的搜索范围里根本没有答案」。

书还打了个比方:这些层就像负责处理可微数据的乐高积木,可以拼成更复杂的组合10⚠ 按第 01 章的规矩,比方到此为止,后面还是叫「层」。

债二:输出层配方表的完整版

第 05 章给过这张表,当时缺一行。这里是完整版11:

任务最后一层单元数损失函数
二分类sigmoid1二元交叉熵
单标签多分类(每个样例只属于一类)softmax类别数分类交叉熵(标签是整数编号时用它的稀疏版)
多标签多分类(每个样例可以属于好几类)sigmoid类别数二元交叉熵
回归不加(线性)要预测几个数就几个均方误差

第三行就是第 05 章欠下的那一行。注意它和第二行的差别只在一处: 多标签用 sigmoid 而不是 softmax。 原因很实在:softmax 强制所有类别的概率加起来等于 1, 而多标签任务里一个样例可以同时属于好几类,加起来不该是 1。

债三:卷积那一层可以换掉

第 01 章列过一个名字叫深度可分离卷积,一直没讲。书在这里给了它的定位12:

一般的卷积很可能会被它大范围甚至完全取代,因为作用等效、更快、更高效如果你要从头构建一个网络,强烈建议用它;它可以直接替换掉普通的卷积层。

⚠ 书只给了这个结论和用法,没有讲它内部怎么做到「等效但更省」。这是全书最后一个没讲透的机制。

债四:循环网络该选哪个

书的建议只有两句13:

三种循环层里,**绝大部分场景优先用 GRU 或 LSTM**(第 12 章讲过为什么)。
两者之间:**LSTM 更强但更费算力;GRU 是它简单又便宜的备选。**

什么时候该用循环网络而不是一维卷积?
**当数据的模式不具备时间不变性时** —— 比如「离现在越近的数据越重要」。

要堆叠的话:**除了最后一层,前面每一层都要配置成返回整个序列。**

一份装上就能用的现成模型清单

这一节是这本书相对 Python 版最独特的资产之一,而且它按「能干什么」组织14:

你想干什么有现成的
认出图里是什么一个轻量的图像分类模型,输出 1000 个类别各自的概率
框出图里的东西在哪一个能检测 90 种目标的检测模型,多个目标重叠也能分开框
认人脸支持实时人脸跟踪和五官关键点检测
认手实时跟踪手的位置
认人体姿势从图里实时定位人体骨骼的关键点
认语音口令实时检测 18 个英语单词,直接调浏览器的音频接口取数据
判断发言是否有毒从威胁、辱骂、淫秽几个维度判断一段文字文明不文明
把句子变成一串数一个通用的句子编码器,上面那个毒性判断就建在它上面
生成音乐自动谱写钢琴曲;另有把音频转成乐谱的模型
风格迁移把一张图的风格迁到新画作上

书指出了怎么分辨第一方和第三方:包名以 @tensorflow-models/ 开头的, 由 TensorFlow.js 团队维护;其余的来自第三方开发者。14 ⚠ 这些包名和数字是 2019 年的,今天要重新核。

书还提醒了一件事:上面有些模型不只能直接用来推断,还能当第 07 章那种迁移学习的基模型, 或者给下游模型供输入15

通用流程,最终版十一步

第 11 章那条流程当时只有八步,书说后面会加两步。现在补齐16:

做什么哪一章讲的
1先问该不该用机器学习第 11 章
2定义问题:有什么数据、要解决什么第 11 章
3确保数据量充足(不够就去收集、去雇人标注)这一步是新加的
4定一个能可靠反映成败的指标第 11 章
5设计评估方案:三份数据,分布一致互不重叠第 03、11 章
6向量化并预处理第 03 章
7做出一个能超过常识基准的模型第 03、12 章
8刻意做到过拟合,找到容量的临界点第 11 章
9调超参数,当心验证集被训脏第 11 章
10校验并评估:分数据切片看,查有没有不公平的表现和有害的偏见新加的,第 20 章
11优化并部署新加的,第 20、21 章

书还说了一句对期待很有用的话:整个流程里最难、最耗时的部分, 通常在设计和训练模型之前——而这些事,任何软件库都替你做不了17

6. 主走查:一张大熊猫照片

这一章的每个承重机制在这条走查上各占一步。 ⚠ 书对这个实验只有定性描述,没有印任何百分比。下面凡是没有数的地方,都是书本来就没给。

发生了什么具体的状态
1一张大熊猫照片先被向量化——变成输入空间里的一个点
2过第一层做一次简单的几何转换,点被搬到另一个位置
3过后面每一层同样的动作,一层接一层;合起来是一个复杂的几何转换
4到达输出落在目标空间里,离「大熊猫」那个位置最近 → 模型答:大熊猫。✓
5现在开始骗它挑一个别的类别:长臂猿
6算一层扰动对输入求梯度,方向朝「让长臂猿这个类别的概率最大」——和第 10 章解释模型时是同一个动作
7把这层扰动加到原图上人眼看不出任何差别
8再喂给同一个模型它笃定地说:长臂猿。
9诊断它看的从来就不是「内容」,是那串数落在哪个区域里;把点推过边界,答案就变了
10换第二个实验二维平面上给 8 个标好的点,让人和它各画一条边界
11人画的一个把 8 个点都圈进去的封闭的圈——他知道边界该是平滑的、该连成一片
12它画的一堆紧贴着那 8 个点的不规则碎边界;稍远一点的新点就判错
13诊断它是局部泛化,人是极限泛化;根源是它没有抽象能力、没有先验知识
14所以它靠什么补海量的标注数据——把那片区域一点点糊满
15收口第 01 章那句「学的是换一种说法」在这里落地:它换的是坐标,不是理解
16但别走过头解决了感知问题(狭义的),而这已经足够革命

7. 作者押的六个方向,2026 年回头看

书在 2019 年押了六个方向。我们逐条对照今天。 ⚠ 每一条的「2026 年」那一栏都不是书里的内容,来源已逐条标明。

先把第一条里的两个词说清楚:「无监督」是完全不用人给答案,「半监督」是只给一小部分。

再把最后一条里那个词说清楚:「边缘设备」指离用户最近的那些小东西——手机、单片机、摄像头。

书押的方向(2019)2026 年怎么样了
① 无监督和半监督学习会有重大发展——理由是有标签数据罕见又贵,无标签数据到处都是18押中了,而且中得最狠。 今天所有大模型的主要训练方式正是「拿海量无标签文本自己给自己出题」19
② 硬件会不断变强,出现更强的神经网络加速器18押中了。 专用加速芯片已成基础设施 (补充:不在书里,来自通用知识)
③ 架构设计和调参会越来越自动化18押中了一半。 自动搜索架构这条路没有成为主流;但「怎么用一个已经训好的模型」确实变成了一门有方法论的工程学科20
④ 模型的共享和复用会更上一层楼,迁移学习会更强18押得最准的一条。 今天的常规做法正是「拿别人训好的通用底座往上盖」,这种底座 2021 年起有了统一的名字20
⑤ 会找到新的应用领域(农业、金融、教育、交通、医疗、时尚、体育、娱乐)18押中了,但方式和作者想的不同——不是每个领域各训一个专用模型,而是同一个通用底座被各行各业调用 (补充:不在书里,来自通用知识)
⑥ 会更关注边缘设备,出现更轻更省电的架构18押中了。 低位数量化 + 面向普通设备的推理已经很成熟:今天有把 2~8 位量化和多种硬件后端做成体系的开源实现,让大模型在普通笔记本上跑起来21

判断(我们的,不是书里的): 六条里最值得玩味的是第 ③ 条。 作者押的是「让机器替你设计模型」,而实际发生的是「不用你设计模型了」—— 因为大家都改成用同一批现成的底座。方向对了,路径完全不同。 如果错,会错在: 如果自动架构搜索在某个我们没看到的垂直领域已经成了主流做法 (比如芯片上的专用小模型),那这一条就该判成「押中了,只是不在通用领域」。

8. 今天读这本书,还有两处要修正

第一处在第 14 章已经交代完整了(注意力后来吃掉了整个架构)。第二处在这里:

补充(不在书里):这本书讲的浏览器端加速靠的是网页图形接口(WebGL)。 后来出现了一套专为通用计算设计的新接口(WebGPU), TensorFlow.js 为它做了一个独立的后端。 但要说清现状:这个后端的官方说明把自己定位成「持续快速改进中」而不是已经成熟, 而且明确写着当前重点在推断上、训练支持还不确定(缺少求梯度需要的一些运算)。22

所以这一处的正确读法是:
**书里说「浏览器靠 WebGL」——这句话今天不完整,但也没有被推翻。**
**换成新接口是一条已经铺开的路,不是一个已经完成的替换。**

图说:这是全书两处时代缺口里,唯一一处**至今仍在移动**的。

9. 往下走的三条路

书在最后给了三条,而且理由都很实在23:

书的理由
去打比赛真正学会机器学习的唯一方法是自己动手构建模型并调优。 那些平台上的数据集大多不挑语言,用 JavaScript 一样能做;而且超参数调优和「别对验证集过拟合」这两件事,只有真做过才有体会
跟论文这个领域的研究完全公开:论文定稿后免费可得,软件大多开源。代价是每天新论文太多、而且很多没经过同行评审,所以要靠工具帮你筛和追踪
跟生态文档、教程、开源项目一直在长

书还给了一句关于「什么会过时、什么不会」的话,值得当作读这份拆解的结语24:

书里介绍的很多内容可能不久之后就会过时; 但真正重要的是核心思想——从数据中学习、减少人工特征工程、一层接一层地转换表示—— 它们很可能会留存很长一段时间。

10. 作者的判断与证据

书里给了证据的:

  • 对抗样例存在,而且算它用的是「对输入求梯度」。 书给了图、给了机制、 并且自己点明了这和第 7 章(我们的第 10 章)是同一个动作5
  • 8 个样例的边界实验。 书给了图和两种画法的对比6
  • 深度学习成功的四个因素。 每条都举了具体的例子和论文9
  • 三大网络的挑选表、输出层配方表、预训练模型清单。 都是可以直接照着用的表101114

属于作者判断、书里没给证据的:

  • 「解决了感知问题」。 书自己加了「很大程度上」和「狭义的」两个限定, 并把局限留到本章后面才讲7
  • 「即使十年没有理论突破也够革命」。 这是一个乐观的判断8
  • 六个方向的预测。 书自己说这是「合理猜想」18
  • 「深度可分离卷积很可能取代一般卷积」。 一个技术趋势判断,书没有给对比数据12
  • 「LSTM 更强但更费算力」。 经验说法,没有实测13

书自己坦白的:

  • 多任务模型还没有被广泛使用——那是它自己给「局部泛化」这条局限留的开口6
  • 机器学习的公平性是一个新的研究领域25

判断(我们的,不是书里的): 这一章最容易被误读成「泼冷水」,而它其实是在换尺子。 前二十一章用的尺子是「它能不能做到」,这一章换成了**「它是靠什么做到的」**—— 一换尺子,那些漂亮的准确率就显出了自己的边界: 它们全部成立在「训练数据附近」这个前提上,而这个前提在前二十一章里从未被明说。 对抗样例和 8 个样例那两个实验,量的正是「离开训练数据之后还剩多少」——答案是几乎不剩。 如果错,会错在: 如果你的应用场景本来就永远只面对和训练数据同分布的输入 (比如一条固定产线上的质检),那这一章的两个实验对你不构成风险, 你该关心的仍然是第 09 章那种数据偏斜。

11. 边界与局限

  • 对抗样例只给了定性描述,没有任何数字。 扰动有多大、成功率多高,书一个百分比都没印
  • 没有讲怎么防。 对抗样例的防御手段整章不涉及,只推给了一篇外部文章5
  • 「局部泛化」没有量化。 8 个样例那个实验是示意图,不是实验数据
  • 深度可分离卷积只有结论和用法,没有机制。 这是全书最后一个欠着的解释12
  • 批标准化的机制,到全书结束仍然没有讲。 第 01 章列过名字、第 11 章列过接口、 第 17 和 19 章的代码里用过、第 20 章拿它举了折叠运算的例子——中间始终没有交代它在算什么。
  • 公平性只讲了「要查」,没讲「怎么查」。 书说这是一个新的研究领域,推给了外部文章25
  • 我们舍弃了原书 13.2.4 那一节(可能性空间)。 那是一张按输入输出类型排列的清单 (向量→向量、图像→文本、文本→文本……),它把前面各章的任务重新排了一遍, 不给读者带来新的判断;而 13.2.2、13.2.3 那两张表是能带走的工具,所以保留。 书自己也说,那张清单里「很大一部分可能超出了当前深度学习的最高水平」26

12. 可带走的

  1. 三个词的层级:人工智能 ⊃ 机器学习 ⊃ 深度学习。 「学习」的定义是把数据转换成一个程序;学到的知识全部存在权重里;
  2. 那台机器的真身:一长串可微的几何转换,把一个向量空间里的点搬到另一个空间里去。 不是理解,是换坐标——第 01 章那句「学的是换一种说法」在这里收口;
  3. 「可微」不是装饰:整台机器的结构,是被「必须能求梯度」这个训练前提反过来限定的;
  4. 费曼那句话:「它并不复杂,只是量大罢了。」
  5. 最大的误解叫拟人化。 它的工作方式和人脑完全不同;
  6. 证据一:对抗样例。 大熊猫照片加一层人眼看不出的扰动,它就说是长臂猿; 而算这层扰动的动作,和第 10 章解释模型用的是同一个——同一个动作,一次解释一次欺骗;
  7. 证据二:8 个样例画边界。 人画一个圈(极限泛化), 它画一堆紧贴样例的碎边界(局部泛化);根源是它没有抽象能力、没有先验知识;
  8. 但别走过头:它解决了感知问题——狭义的,而且要有足够多的有标签数据。这已经足够革命;
  9. 它成功靠四件事:算法革新、大量有标签数据(消费互联网的副产品)、 便宜的并行硬件(原本给游戏用的)、以及把复杂度藏起来的开源软件;
  10. 按输入数据挑网络: 无序向量 → 密集层;图像和时频谱 → 二维卷积; 文本和时间序列 → 一维卷积或循环网络;立体数据 → 三维卷积; 视频 → 三维卷积,或二维卷积逐帧提特征再交给序列模型;
  11. 选错网络不是效率问题——架构划定的是搜索范围,选错了范围里就没有答案;
  12. 输出层配方完整版: 二分类 sigmoid + 1 单元 + 二元交叉熵; 单标签多分类 softmax + 类别数 + 分类交叉熵; 多标签多分类 sigmoid + 类别数 + 二元交叉熵(因为多标签的概率不该加起来等于 1); 回归不加激活 + 均方误差;
  13. 从头搭卷积网络,直接用深度可分离卷积——作用等效、更快、更省;
  14. 循环层优先 GRU 或 LSTM,LSTM 更强但更费算力;堆叠时除最后一层外都要返回整个序列;
  15. 一份装上就能用的清单: 认物体、框位置、认脸、认手、认姿势、认口令、 判毒性发言、把句子变成向量、生成音乐、风格迁移。包名 @tensorflow-models/ 开头的是第一方的;
  16. 通用流程最终十一步,新加的三步是:确保数据量充足、校验评估(查偏见)、优化并部署;
  17. 最难最耗时的部分在设计模型之前,而这部分任何软件库都替你做不了;
  18. 作者 2019 年押的六条,今天回看基本都押中了; 最值得玩味的是「自动化建模」那条:方向对了,但实际走的是「不用你建模了」这条完全不同的路;
  19. 什么会过时、什么不会: 书里的数字、接口、模型规模都会过时; 「从数据中学习、减少人工特征工程、一层接一层地转换表示」这三条不会。

13. 原文地图

主题原书章原文位置
三个词的层级;「学习」的定义;层与权重第 13 章text/25-ch13.txt:27(搜「自动化认知过程」) · text/25-ch13.txt:29(搜「这一将数据转换为程序」) · text/25-ch13.txt:31(搜「深度」一词的由来)
解决了感知问题(狭义)第 13 章text/25-ch13.txt:37(搜「解决了感知问题」)
第三次 AI 夏天;即使没有理论突破也够革命第 13 章text/25-ch13.txt:39(搜「AI夏天」) · text/25-ch13.txt:41(搜「相当乐观」)
费曼那句话;深度学习的简单第 13 章text/25-ch13.txt:45(搜「只是量大罢了」) · text/25-ch13.txt:47(搜「1972」)
几何转换;一切都是向量;可微第 13 章text/25-ch13.txt:49(搜「几何空间中的一个点」)
成功的四个因素第 13 章text/25-ch13.txt:55(搜「算法革新」) · text/25-ch13.txt:57(搜「消费互联网崛起的副产品」) · text/25-ch13.txt:59(搜「电子游戏」) · text/25-ch13.txt:61(搜「每个程序员都可以使用的工具」)
通用流程十一步第 13 章text/25-ch13.txt:97(搜「机器学习是否是合适的解决方案」) · text/25-ch13.txt:101(搜「确保数据量充足」) · text/25-ch13.txt:115(搜「有害的偏见」) · text/25-ch13.txt:119(搜「优化并部署模型」)
最难的部分在设计模型之前第 13 章text/25-ch13.txt:95(搜「最困难、耗时最久的部分」)
三大网络类型;按输入数据挑;假设空间第 13 章text/25-ch13.txt:125(搜「密集型连接网络」) · text/25-ch13.txt:129(搜「向量数据」) · text/25-ch13.txt:141(搜「视频数据」)
输出层配方:四种任务第 13 章text/25-ch13.txt:151(搜「输出层的激活函数」) · text/25-ch13.txt:165(搜「多标签多分类」) · text/25-ch13.txt:170(搜「线性激活函数」)
深度可分离卷积会取代一般卷积第 13 章text/25-ch13.txt:185(搜「深度可分离卷积」)
循环层怎么选;堆叠时的配置第 13 章text/25-ch13.txt:215(搜「优先使用GRU或LSTM」) · text/25-ch13.txt:217(搜「返回该层输出的整个序列」)
预训练模型清单;第一方与第三方第 13 章text/25-ch13.txt:265(搜「第一方支持」) · text/25-ch13.txt:267(搜「1000个ImageNet类别」) · text/25-ch13.txt:269(搜「90种目标类别」) · text/25-ch13.txt:275(搜「18个英语单词」)
预训练模型还能当基模型第 13 章text/25-ch13.txt:279(搜「迁移学习的基模型」)
拟人化错误;图像标注的失败案例第 13 章text/25-ch13.txt:369(搜「拟人化」)
对抗样例;和第 7 章同一个动作第 13 章text/25-ch13.txt:373(搜「对抗性样例」) · text/25-ch13.txt:375(搜「肉眼不可见」)
局部泛化对极限泛化;8 个样例第 13 章text/25-ch13.txt:377(搜「局部泛化」) · text/25-ch13.txt:381(搜「极限泛化」)
六个预测第 13 章text/25-ch13.txt:387(搜「半监督式学习」) · text/25-ch13.txt:389(搜「神经网络加速器」) · text/25-ch13.txt:391(搜「自动化」) · text/25-ch13.txt:393(搜「共享和可复用性」) · text/25-ch13.txt:395(搜「新的应用领域」) · text/25-ch13.txt:397(搜「边缘设备」)
继续学习的三条路;什么不会过时第 13 章text/25-ch13.txt:413(搜「Kaggle」) · text/25-ch13.txt:419(搜「arXiv」) · text/25-ch13.txt:409(搜「一层接一层的表示转换」)
可能性空间那一节(我们舍弃)第 13 章text/25-ch13.txt:289(搜「超出了当前深度学习的最高水平」)

Footnotes

  1. 出处:「第 13 章 总结与展望」第 27~31 段(text/25-ch13.txt:27,搜「自动化认知过程」;text/25-ch13.txt:29,搜「这一将数据转换为程序」;text/25-ch13.txt:31,搜「深度」一词的由来)。原文对人工智能的定义是「任何尝试自动化认知过程的行为」。 2

  2. 出处:「第 13 章」第 49 段(text/25-ch13.txt:49,搜「几何空间中的一个点」)。原文:「各个神经层环环相扣,共同形成了一个由一系列简单几何转换组合成的复杂几何转换。这种复杂的转换会尝试将输入向量空间中的点映射到目标向量空间。」可微这一条也在同段。

  3. 出处:「第 13 章」第 45 段与第 47 段脚注(text/25-ch13.txt:45,搜「只是量大罢了」;text/25-ch13.txt:47,搜「1972」)。原文注明这句话出自 1972 年约克郡电视台对理查德·费曼的采访,费曼当时评论的是宇宙。 2

  4. 出处:「第 13 章」第 369 段(text/25-ch13.txt:369,搜「拟人化」)。原文举的例子是小女孩的面部图像和牙刷图像,并说人会从中「提取出深层的、更重要的含义」。

  5. 出处:「第 13 章」第 373 段与图 13-3 说明(text/25-ch13.txt:373,搜「对抗性样例」;text/25-ch13.txt:375,搜「肉眼不可见」)。原文自己把这个动作接回第 7 章(我们的第 10 章):「就像在7.2节中寻找能够最大激活convnet过滤器的图像示例所展示的那样,可以通过在输入空间进行梯度上升来最大化convnet过滤器的激活函数输出。这个概念可以进一步扩展到输出的概率值上。」防御手段书没有讲,推给了一篇外部文章。 2 3

  6. 出处:「第 13 章」第 377 段与图 13-4 说明(text/25-ch13.txt:377,搜「局部泛化」;text/25-ch13.txt:381,搜「极限泛化」)。第 379 段脚注提到有研究在尝试让同一个网络做多个不相关的任务,「但这种多任务模型还没有被广泛使用」。 2 3 4

  7. 出处:「第 13 章」第 37 段(text/25-ch13.txt:37,搜「解决了感知问题」)。原文自己加了限定:「尽管这里所说的感知问题是狭义上的感知问题」。 2

  8. 出处:「第 13 章」第 41 段(text/25-ch13.txt:41,搜「相当乐观」)。原文同时也提醒「短期内的预期有点过于乐观。要完全发挥深度学习的全部潜能,可能远不止十年」。 2

  9. 出处:「第 13 章」第 53~65 段(text/25-ch13.txt:55,搜「算法革新」;text/25-ch13.txt:57,搜「消费互联网崛起的副产品」;text/25-ch13.txt:59,搜「电子游戏」;text/25-ch13.txt:61,搜「每个程序员都可以使用的工具」)。第 63、65 段的脚注列出了具体的算法成果。 2

  10. 出处:「第 13 章」第 125~141 段(text/25-ch13.txt:125,搜「密集型连接网络」;text/25-ch13.txt:129,搜「向量数据」;text/25-ch13.txt:141,搜「视频数据」)。原文:「神经网络的架构……会对输入数据的结构做出一些假设,并对其特征进行编码。这形成了一个假设空间。」乐高那个比方在第 127 段。 2 3 4

  11. 出处:「第 13 章」第 151~177 段(text/25-ch13.txt:151,搜「输出层的激活函数」;text/25-ch13.txt:165,搜「多标签多分类」;text/25-ch13.txt:170,搜「线性激活函数」)。原文说明多分类任务里标签用整数编号时,损失函数要换成分类交叉熵的稀疏版。「多标签为什么不能用 softmax」那一句是我们补的解释,书只给了做法。 2

  12. 出处:「第 13 章」第 185 段(text/25-ch13.txt:185,搜「深度可分离卷积」)。原文:「如果你要从头构建一个神经网络,强烈建议你使用深度可分离卷积。」内部机制书没有讲。 2 3

  13. 出处:「第 13 章」第 213~217 段(text/25-ch13.txt:215,搜「优先使用GRU或LSTM」;text/25-ch13.txt:217,搜「返回该层输出的整个序列」)。什么时候该用循环网络而不是一维卷积的判据在第 213 段。 2

  14. 出处:「第 13 章」第 265~281 段(text/25-ch13.txt:265,搜「第一方支持」;text/25-ch13.txt:267,搜「1000个ImageNet类别」;text/25-ch13.txt:269,搜「90种目标类别」;text/25-ch13.txt:275,搜「18个英语单词」)。人脸、手、姿势那三项见第 271 段;毒性判断和句子编码器见第 277 段;音乐和风格迁移见第 281 段。这些包名和数字全部是 2019 年的。 2 3

  15. 出处:「第 13 章」第 279 段(text/25-ch13.txt:279,搜「迁移学习的基模型」)。

  16. 出处:「第 13 章」第 97~119 段(text/25-ch13.txt:97,搜「机器学习是否是合适的解决方案」;text/25-ch13.txt:101,搜「确保数据量充足」;text/25-ch13.txt:115,搜「有害的偏见」;text/25-ch13.txt:119,搜「优化并部署模型」)。第 121 段说明这条流程主要适用于监督式学习,并交代了迁移学习、强化学习、生成式学习各自的差异。

  17. 出处:「第 13 章」第 95 段(text/25-ch13.txt:95,搜「最困难、耗时最久的部分」)。原文:「TensorFlow.js这类软件库不可能替你将这些环节自动化。」

  18. 出处:「第 13 章」第 385~397 段(text/25-ch13.txt:387,搜「半监督式学习」;text/25-ch13.txt:389,搜「神经网络加速器」;text/25-ch13.txt:391,搜「自动化」;text/25-ch13.txt:393,搜「共享和可复用性」;text/25-ch13.txt:395,搜「新的应用领域」;text/25-ch13.txt:397,搜「边缘设备」)。原文自己把这一节定位成「对未来几年中,我们将目睹的深度学习领域的重大突破的合理猜想」;第 405 段说后三条和 JavaScript 深度学习尤其密不可分。 2 3 4 5 6 7

  19. 补充(不在书里,依据我们的 ai-book-reference 书架):作者押的「无监督 / 半监督学习会有重大发展」这条,2026 年回看是押中得最彻底的一条。依据: book=ai-engineering §01-from-lm-to-ai-engineering 事实=该章把「自监督」列为语言模型绕开人工标注瓶颈的关键一步,并说明正是它让「基础模型」这种通用底座成为可能。

  20. 补充(不在书里,依据我们的 ai-book-reference 书架):作者押的「模型复用会更上一层楼」这条不但成真,而且长成了一门独立的工程学科。依据: book=ai-engineering §01-from-lm-to-ai-engineering 事实=该章把「AI 工程」定义为「在基础模型之上构建应用的过程」,并写明「基础模型」这个名字是 2021 年才有的;它给出的路径是拿别人训好的通用底座直接用、或用提示、检索、微调去调它,而不是自己从头设计架构。 2

  21. 补充(不在书里,依据我们的 ai-frontier-reference 书架):作者押的「边缘设备会催生更轻更省电的做法」这条已经兑现。依据: shelf=ai-frontier-reference/llama-cpp#index.md 事实=该拆解写明这套开源实现把「2~8 bit 的分组量化体系」和一整排硬件后端(含 x86 向量指令、ARM NEON、CUDA、Metal、Vulkan、WebGPU)做成了一个体系,目的正是「让大模型在普通笔记本上跑起来」,并已成为本地推理的事实标准。这也印证了我们第 20 章那句「今天更低的位数是常规操作」。

  22. 补充(不在书里):TensorFlow.js 后来为 WebGPU 这套新的浏览器通用计算接口做了一个独立后端,但它把自己定位成仍在快速改进中,当前重点在推断上、训练支持不确定(缺少求梯度所需的部分运算),并注明浏览器侧的支持从 2023 年 5 月起可用。来源:TensorFlow.js WebGPU 后端的官方说明 https://raw.githubusercontent.com/tensorflow/tfjs/master/tfjs-backend-webgpu/README.md (查阅于 2026-08-29)。

  23. 出处:「第 13 章」第 411~425 段(text/25-ch13.txt:413,搜「Kaggle」;text/25-ch13.txt:415,搜「非Python深度学习框架」;text/25-ch13.txt:419,搜「arXiv」;text/25-ch13.txt:421,搜「ArXiv Sanity Preserver」)。

  24. 出处:「第 13 章」第 409 段(text/25-ch13.txt:409,搜「一层接一层的表示转换」)。

  25. 出处:「第 13 章」第 115 段与第 117 段脚注(text/25-ch13.txt:117,搜「机器学习的公平性」)。原文说这是一个新的研究领域,更多内容推给了一篇外部文章。 2

  26. 出处:「第 13 章」第 285~289 段(text/25-ch13.txt:289,搜「超出了当前深度学习的最高水平」)。原文自己承认那张清单里「很大一部分可能超出了当前深度学习的最高水平」。我们据此判断它对读者不产生新的判断,整节舍弃。