跳到主要内容

边界与未来 — 从局部泛化到极端泛化

这一章讲三件事: 全书的一次总回顾(四种架构各管什么数据); 深度学习的边界在哪里、为什么在那里(局部泛化 vs 极端泛化); 以及作者赌的未来(程序合成 + 深度学习的混合系统)。 前十三章回答「深度学习能做什么、怎么做」,这一章回答「它不能做什么」—— 作者的原话:要正确使用工具,你不仅应该知道它能做什么,还应该知道它不能做什么1

1. 顶层全景

这是全书的总结章,结构是一支回旋镖:

回顾(14.1) 四种架构 + 通用工作流程 —— 你已经会什么

边界(14.2) 做不到什么:推理、长期规划、读产品说明写代码
│ 为什么做不到:它只能在流形上插值 = 局部泛化

目标(14.3) 要突破边界,先要换目标:捷径法则 → ARC

未来(14.4-14.5) 两种抽象,深度学习缺一半;
程序合成与混合系统把那一半补上

图说:从「会什么」出发,绕到「不会什么」,再回到「怎么才能会」。

本章的主走查是那只著名的熊猫:一张熊猫照片,加上一点点人眼看不出的 「长臂猿梯度」,就被网络斩钉截铁地认成长臂猿——它是「模型不理解输入」 最硬的一次演示。另起一处短走查是排序:同一个任务,深度网络要海量数据还出错, Python 几行代码就对任意长度的列表成立——它把「缺的那一半」变成了具体对比。

2. 先收个尾:四种架构与一张工作流程卡

原书先用一节回顾全书。最值得带走的是一张架构对照表—— 哪种数据配哪种网络,因为「网络架构编码了关于数据结构的假设」2:

数据形态用什么为什么
向量数据(属性表)Dense 层堆叠特征间没有空间结构,要的是任意两特征的关系
图像Conv2D(可分离卷积更省)局部模式 + 平移不变(第 08 章)
时间序列RNN(GRU/LSTM)模式不具时间平移不变,最近的过去更重要(第 10 章)
离散序列(文本)Transformer长程上下文 + 并行处理(第 11 章)
视频 / 立体数据Conv3D,或 2D 提特征 + 序列模型多出一个维度(时间/深度)

配套的是通用工作流程的一句话版(第 07 章的展开版):定义任务 → 定评估方式 → 搭验证流程 → 数据向量化 → 先超过常识基准 → 调参正则(盯验证集,先过拟合再拉回来) → 部署并持续监控3。书里还列了一长串「可能性空间」—— 把图像映射到文本(图像描述)、把文本映射到图像(条件生成)、把视频和文本映射到文本(视觉问答)…… 但紧接着就打了预防针:这些模型有些无法泛化到训练数据之外,这正是下一节的主题4

回顾里还有一个改名建议值得记住:「神经网络」是个极具误导性的名字—— 它和神经、和网络都没什么关系;更准的名字是分层表示学习深度可微模型。 深度学习真正依赖的核心思想只有一条:意义来源于事物之间的成对关系, 而这些关系可以用距离函数来表示5

3. 深度学习做不到什么

先给一张诚实的负面清单。就算有几十万条产品经理写的功能说明、 配上工程师团队写好的对应源代码,你也训不出一个「读产品说明、输出代码库」的模型。 一般规律是:任何需要推理(比如编程、应用科学方法)、长期规划、 用算法处理数据的事情,投入多少数据都不行。连学习一个简单的排序算法, 对深度网络都非常困难6

为什么?回到第 02 章的几何图像:模型只是一条「把流形 X 连续地映射到流形 Y」的 几何变换链。它可以被看作一种程序,但反过来说不成立——大多数程序 不能表示为这样的连续变换。所以面对一个任务,只有两种结局: 要么根本不存在能解它的(规模合理的)网络,要么存在却学不出来。 加层、加数据只能缓解表面症状,治不了这个根7

4. 拟人化的风险与那只熊猫(主走查)

4.1 我们天生会给东西安上「心」

人类有个底层倾向叫心智理论:总忍不住把意图、信念、知识投射到身边的东西上—— 在石头上画个笑脸,就觉得石头「快乐」了。这个倾向套在模型上,就是灾难的开始: 模型生成了一段像样的图像说明,我们就相信它「理解」了图片; 直到某张图稍微偏出训练数据,它输出一句荒谬绝伦的话,我们才愣住8

4.2 主走查:熊猫 + 长臂猿梯度

最能戳破这层幻觉的是对抗样本(adversarial example): 故意构造的、让模型错误分类的输入9。技术原理你在第 09 章已经学过—— 对输入图做梯度上升,可以最大化某个滤波器的激活(滤波器可视化、DeepDream 都是这套)。 现在把目标换成「让『长臂猿』这一类别的预测值最大化」,对一张熊猫照片做同样的事:

① 取一张熊猫照片,网络以高置信度判为「熊猫」
② 冻结网络权重,对输入图像本身做梯度上升,
目标 = 「长臂猿」类别的输出分数
③ 照片被叠上一层极淡的「长臂猿梯度」——人眼几乎看不出任何变化
④ 同一张(看起来还是熊猫的)照片,网络判为「长臂猿」

图说:变的不是语义,是像素上的一层涟漪;而模型的判决翻了盘。

书里的定性:这既表明了模型的脆弱性,也表明了模型从输入到输出的映射 与人类感知之间的深刻差异10。把话说透就是: 深度学习模型并不理解其输入——我们的理解来自具身的感觉运动体验, 模型没有这些;它只是学到了一个在特定样本上把数据映射到人类概念的变换, 就像镜子中的模糊图像。而且它会利用一切捷径: 在「豹子和沙发」为主的数据集上训练,模型很可能把豹纹沙发认成豹子—— 因为它依赖的是局部纹理,不是对全局的理解11

4.3 从业者的戒律

作者给从业者的话很直白:永远不要相信神经网络「理解」它执行的任务—— 我们希望它学的是任务本身,它实际学的是「把训练输入逐点映射到训练目标」 这个更狭隘的任务。输入一旦偏出训练数据,荒谬结果随时会来12

5. 自动机与智能体:笛卡儿 1637 年的判词

要划清「理解」和「不理解」的界线,书里搬来了一个大尺度的参照系。 大脑是行为程序的容器——「如果发生这种情况,就那样做」, 把感官输入接到运动控制上。它出现在 5 亿多年前; 早期大脑(昆虫、线虫)的程序是 DNA 硬编码的,说它们「智能」, 就像说恒温器「智能」一样。这类系统有个名字:自动机(automaton)—— 静态地执行预设程序,遇到与编程目的不匹配的情况就失败13

1637 年,笛卡儿给自动机下过一段判词——这比第一台机械式计算机还早 (帕斯卡 5 年后才造出它),书里直接引用:

它们的活动所依靠的并不是理解,而只是它们的部件结构。14

这句话之所以被搬出来,是因为书里把「理解」落实成了一个可检验的标准: 理解的证据是能够泛化——能处理前所未见的新情况。 两个学生,一个背下了三年考题,一个真懂了材料,怎么区分?给他们一道全新的题15

6. 局部泛化 vs 极端泛化

6.1 深度网络站在哪一端

按这把尺子,系统分三档16:

  • 死板自动机:完全不能泛化(Python 字典、硬编码 if-then-else);
  • 深度网络:能处理与训练样本足够相似的新输入——这叫局部泛化, 也就是第 06 章说的「在流形上插值」。它只能泛化到已知的未知事物 (开发时预料到的变化:不同角度、不同光照);
  • 人类智能:只凭很少的数据、甚至没有新数据,就能适应从未体验过的情况—— 这叫极端泛化,靠的是抽象、符号模型和推理(中彩票怎么办、 朋友发现钥匙被换会怎么反应——没人经历过,人人都能推演)。

差距用两个思想实验量化:让深度网络学火箭登月的发射参数,要喂上万次 甚至上百万次发射试验,把输入空间密集采样;人类用抽象能力提出物理模型, 一次或几次试验就能得到精确解。让网络学「在城市里安全行走」, 它要在各种场景里「死」上几千次才推断出汽车危险;人类一次都不用死, 还能直接迁移到一座新城17

6.2 智能的目的是应对「不确定」

为什么会有智能?书里的演化论证:环境越动态、越不可预测, 「硬编码行为」越不够用——你的每一天都和祖先经历过的任何一天不同, 进化没法把行为序列预先写进 DNA,只能造一台每天即时生成行为的机器。 所以智能的本质是:有效利用已掌握的信息,在不断变化、不确定的未来面前 做出成功行为;「理解」就是挖掘旧经验、形成可复用的抽象,拿它们去处理新情况18

顺着这个谱系,书里还造了一个比「极端泛化」更工程化的词:广泛泛化—— 在广泛任务领域内处理未知的未知事物(连系统创造者都没想到的情况)。 衡量它的思想实验叫「沃兹智能测试」:随便进一户人家的厨房,煮一杯咖啡。 而按作者的分类,今天的人工智能仅限于「认知自动化」—— 「人工智能」里的「智能」二字是个类别错误,更准的名字是「人工认知」19

7. 捷径法则与新目标 ARC

7.1 优化什么指标,就以什么为代价

要往「更通用」走,先要看清过去七十年为什么没走到。书里给出捷径法则: 专注于优化某个成功指标,你会实现目标——但以指标之外的一切为代价20

三个实例:Netflix 悬赏 100 万美元的电影推荐竞赛,最终没有采用获胜系统—— 它只优化预测精度,代价是推断成本、可维护性、可解释性全垮了; Kaggle 获胜模型几乎无法用于生产,同理。最深的例子是深蓝: 1970 年代 Newell 把「下棋」立为人工智能的宏伟目标,理由是下棋似乎需要感知、 推理、记忆;1997 年深蓝击败卡斯帕罗夫——研究人员却发现, 造一个国际象棋冠军,几乎没有教会他们关于人类智能的任何知识, 因为 Alpha-Beta 算法既不是大脑模型,也不能泛化到棋盘之外21

机制就一句话:固定任务消除了处理不确定性的需求,也就消除了对智能的需求。 技能和泛化能力可以兑换——数据近乎无限时,连一个笨到家的办法都能超人地打游戏。 这个办法叫最近邻搜索:什么都不学,只把见过的局面全存下来; 遇到新局面就去库里翻一遍,找出最像的那个旧局面,照抄当时的做法。 它连「规律」两个字都不沾边。可只要你的库够大——大到任何新局面都能在里面找到一个几乎一样的—— 它照样能把游戏打到超人水平。这就是「技能和泛化能力可以兑换」那句话最刺人的地方: 足够多的数据,能把智能这一项从等式里整个消掉。

反过来说,规则改一点点(把游戏地图左右翻转一下),这种系统就得从头重来, 因为库里所有旧局面一夜之间全都不像了。所以「解决任务 X」这类目标, 100% 会招来非智能的捷径解法22

7.2 ARC:把「泛化能力本身」立为目标

正确的目标应该直接测量智能。作者给的定义:智能是一个效率比—— 你掌握的相关信息量(经验与先验),与你未来能妥善应对的新情况范围, 两者之间的转换效率;越智能的系统,用越少的经验应付越广的新局面23

照这个定义,作者在 2018-2019 年开发了 ARC(抽象和推理语料库)基准—— 注意,这是作者本人的作品,读这一节要戴利益相关的眼镜。 它像智商测试:每个任务给三四个「输入网格 → 输出网格」的例子, 你要对新输入给出输出,只有 3 次机会。两个刻意的设计: 任务逻辑个个不同,无法练习,只能即时理解;只允许使用「核心先验知识」 (人与生俱来的知识系统),不考语言这类后天知识24

结果:包括 GPT-3 在内的深度学习方法完全无法解决 ARC—— 这些任务是非插值的,曲线拟合使不上劲;而普通人不练习就能做。 书里的那句话值得照录:「如果你看到 5 岁的小孩能够自然地完成 现代人工智能技术完全无法完成的任务,那么这是一个明确的信号, 表示我们遗漏了某些东西。」25

8. 两种抽象:深度学习缺的那一半

8.1 万花筒假说与「类比是抽象的引擎」

遗漏的到底是什么?先补作者的正面主张(它出自他 2019 年的论文, 是作者的理论框架,不是学界共识):智能之所以可能, 是因为没有什么事完全没有先例——遇到新事物,我们总拿它和旧经验类比。 世界的丰富表象背后,独特意义单元的数量其实很少,一切都是这些单元的重组—— 几粒种子,无尽的变化,像万花筒里几颗玻璃珠被镜子反射出无穷图案, 这叫万花筒假说。抽象是智能的引擎,类比则是抽象的引擎; 一句话:「智能是对抽象类比的敏感性。」26

8.2 以价值为中心的抽象

比较事物有两种方式,对应两种抽象。第一种是比相似度: 隐含一个光滑连续的距离函数,把相似实例聚成原型 (它不像任何一只具体甲虫,却抓住了一类甲虫的共同特征)—— 这就是以价值为中心的抽象。听着耳熟?它就是全部现代机器学习在做的事。

最干净的例子是聚类——就是「没有答案的分类」:没人告诉你这堆东西该分几类、 哪个属于哪类,你只能按「谁和谁像」自己归堆。

聚类里最经典的做法叫 K 均值:先说定要分成 K 堆,然后反复干两件事—— 把每个样本归到离它最近的那个中心点去,再把每堆的中心点挪到这堆的正中间, 来回几轮就稳定下来。最后每堆留下的那个中心点,就是这一堆的原型: 它不是任何一个真实样本,却代表着这一堆的共同长相。

深度学习学流形也是同一回事;第 09 章的滤波器可视化,画出来的正是「视觉原型」。 这种抽象支撑感知、模式识别和直觉——也是深度学习擅长做局部泛化的原因27

8.3 以程序为中心的抽象

第二种是比结构:不追问「有多像」,只问「有没有完全相同的部分」。 程序员在两个函数里发现重复逻辑、抽出公共函数,用的就是它—— 把两段程序各画成一张图(谁调用谁、谁的输出接谁的输入), 然后在两张图里找出长得一模一样的那一块。这个动作在书里的名字叫子图同构: 「子图」是整张图里的一小块,「同构」是「接法完全相同」——注意是完全相同,不是差不多。 差一条线就不算,这里没有「有多像」这回事。 这就是以程序为中心的抽象:离散、精确、缓慢, 支撑推理、规划和缜密——正好和以价值为中心的抽象 (连续、模糊、即时)互为镜像28

8.4 缺的那一半:排序走查

把两半摆在一起,深度学习的位置就清楚了: 它非常擅长以价值为中心的抽象,却基本无法生成以程序为中心的抽象—— 缺了可以说更重要的一半29。用排序这件事走一遍,差距立刻具体:

任务:给 5 个数字的列表排序
深度网络:架构调对了也能做,但要喂大量训练数据,
遇到新数字还时不时出错
换成 10 个数字:老模型作废,要在更多数据上重新训练

同一个任务,用 Python:几行代码写一个排序算法,
拿几个例子验证一下 → 对任意长度、任意数字的列表都成立

图说:左边是「从数据里插值」,右边是「写下结构」。
右边的泛化强得离谱,可它恰恰是做不了感知的那种办法。

反过来也成立:不用机器学习、纯手写 Python 给 MNIST 数字分类, 你得费劲编「数圆圈、算质心」这类函数,写上上千行,可能才到 90% 精度—— 而第 08 章的卷积网络是 99.1%。感知问题用离散推理是受罪, 结构问题用流形插值是受罪,各吃各的饭30

9. 未来:程序合成、混合系统与终身学习

9.1 模型即程序

把缺的那一半补上,候选技术叫程序合成(program synthesis): 用搜索算法在巨大的程序空间里自动生成满足规格(通常是一组输入-输出对)的程序。 和机器学习的对照非常整齐31:

机器学习程序合成
模型可微的参数化函数编程语言运算符组成的图
引擎梯度下降离散搜索(比如遗传搜索)
数据胃口大量数据几个例子就能跑

在 ARC 上,非常粗糙的程序合成方法已经拿到了非常不错的结果—— 正好补在深度学习全军覆没的地方32

9.2 两条融合路线

程序合成不是替代深度学习,而是和它合体,书里给了两条路33:

  • 混合系统:把深度学习模块和算法模块装进一个系统。今天最强的系统都是混血—— AlphaGo 的智能大半是人类硬编码的蒙特卡罗树搜索, 只有价值网络和策略网络两个子模块从数据里学; 自动驾驶靠工程师硬编码的三维世界模型 + 深度学习感知模块持续更新。 下一步是让连「离散算法部分」也能学出来:给一个网络配上 if 分支、 while 循环、变量、排序运算符这类编程原语,它能表示的程序空间会远大于今天;
  • 用深度学习指导程序搜索:程序合成的死穴是组合式爆炸—— 候选程序数量比指数增长还快。但「所有有用程序的空间」可能长得很像一个连续流形, 那么就可以训一个模型,像老工程师的直觉那样, 告诉搜索「该往哪条路走」。作者预测这个方向在未来 10 到 20 年会热起来。

9.3 终身学习与长期愿景

第三条线是复用:每个任务从头训模型太浪费(任务之间总有信息重叠—— 同一个翻译模型同时学「英译德」和「法译意」,两边都更好)。 今天的预训练权重只是起点;作者的愿景是元学习系统维护一个 可复用子程序的全局库——像软件工程师复用函数和类那样, 系统自动把反复出现的解决模式抽象成子程序存进库里,遇到新任务就搜索组合34

这张蓝图的终点,作者愿意叫它 AGI(通用人工智能)—— 但他立刻补了一句:不要指望奇点式的机器人世界末日,那纯粹是幻想35

9.4 继续学习的三个去处

书末的资源清单:Kaggle 竞赛练实战(获胜者标配 XGBoost 和 Keras, 正好对应第 13 章的调参与集成);arXiv 追最新进展 (论文不经同行评议、每天海量,噪声里找信号越来越难); Keras 生态(截至 2021 年底用户超 100 万,文档与代码示例是最主要的参考)36

10. 作者的判断与证据

这一章的「事实密度」和前十三章完全不同,大部分内容是作者的理论与预测, 书里自己也标了37:

  • 有演示支撑的: 对抗样本(熊猫图)、排序与 MNIST 的两难、多任务学习的效果—— 是可复现的实验或公认事实;
  • 作者的理论框架(要当框架读): 局部/极端/广泛泛化的三分、「智能是效率比」、 万花筒假说、两种抽象——这些出自他 2019 年的论文《On the Measure of Intelligence》, 是一套自洽但远非共识的主张;
  • 利益相关: ARC 是作者本人开发的基准,「GPT-3 完全无法解决 ARC」 既是对对手的批评,也是对自己作品的推介,引述时必须带这个前提;
  • 作者明说的不确定: 「我没有水晶球……很多预测可能无法实现」—— 未来一节他自认是有趣且可实践的猜想,不是路线图37

11. 边界与局限

  • 章内所有「未来」预测写于 2021 年。此后大模型在 ARC 类推理任务上的表现 已有显著变化(通用知识,不在书里)——「深度学习完全无法解决 ARC」 这句要按写作时点读;
  • 「程序合成 10 到 20 年热起来」的预言,与现实(大模型先热起来)存在出入, 但「混合系统」「用学习到的直觉指导搜索」两条思路,以另一种形态延续;
  • 两种抽象的划分是光谱而非二分,书里自己也承认 (可以用离散程序模拟连续距离函数,反之亦然);
  • 「人工认知」改名建议没有被业界接受——今天没人这么叫,了解即可。

12. 可带走的

  1. 四种数据形态配四种架构;架构 = 对数据结构的假设,选错假设空间,再调也白搭;
  2. 做不到清单:推理、长期规划、算法处理数据、读产品说明写代码——加数据没用;
  3. 模型只是「流形 X → 流形 Y」的连续变换;大多数程序不能表示成它;
  4. 别拟人化:模型不理解输入,它学的是「输入逐点映射到目标」这个更窄的任务;
  5. 对抗样本 = 对输入做梯度上升;熊猫 + 长臂猿梯度揭示了模型映射与人类感知的深刻差异;
  6. 理解的证据是泛化;深度网络 = 局部泛化 = 只能处理已知的未知; 人类会极端泛化(抽象 + 推理 + 很少的数据);
  7. 捷径法则:优化什么指标,就以指标外的一切为代价;固定任务消除了对智能的需求—— 选目标比选模型更要紧;
  8. ARC 用「无法练习的任务 + 核心先验知识」直接测量泛化; GPT-3 全军覆没、5 岁小孩轻松通过(记住:ARC 是作者自己的作品);
  9. 两种抽象:以价值为中心(连续、相似度、原型——深度学习会这半) 与以程序为中心(离散、结构匹配、子图同构——深度学习缺这半);
  10. 作者押的未来:程序合成补那一半,混合系统是今天的先例, 终身学习靠子程序全局库;AGI 可能,奇点是幻想。

13. 原文地图

主题原书章原文位置
总结章的结构总结text/21-ch14.txt:6(搜「局限性」)
四架构对照与工作流程总结text/21-ch14.txt:147(搜「密集连接网络(Dense 层)」) · text/21-ch14.txt:117(搜「定义任务」)
意义与改名建议总结text/21-ch14.txt:80(搜「成对关系」) · text/21-ch14.txt:85(搜「极具误导性」)
做不到什么总结text/21-ch14.txt:357(搜「产品说明」) · text/21-ch14.txt:359(搜「简单排序算法」) · text/21-ch14.txt:362(搜「不能表示为深度学习模型」)
心智理论与拟人化总结text/21-ch14.txt:372(搜「心智理论」)
对抗样本总结text/21-ch14.txt:383(搜「对抗样本(adversarial」) · text/21-ch14.txt:387(搜「长臂猿梯度」) · text/21-ch14.txt:389(搜「深刻差异」)
不理解与捷径总结text/21-ch14.txt:401(搜「并不理解其输入」) · text/21-ch14.txt:406(搜「镜子中的模糊图像」) · text/21-ch14.txt:408(搜「豹纹沙发」)
自动机与笛卡儿总结text/21-ch14.txt:432(搜「5 亿多年」) · text/21-ch14.txt:449(搜「自动机(automaton」) · text/21-ch14.txt:463(搜「并不是理解」)
局部/极端泛化总结text/21-ch14.txt:481(搜「很少的数据甚至没有新数据」) · text/21-ch14.txt:489(搜「已知的未知事物」) · text/21-ch14.txt:491(搜「在流形上进行插值」)
火箭与过街总结text/21-ch14.txt:510(搜「发射试验」) · text/21-ch14.txt:508(搜「登陆月球」) · text/21-ch14.txt:513(搜「安全行走」)
智能的目的总结text/21-ch14.txt:534(搜「有效利用你所掌握的信息」)
广泛泛化与人工认知总结text/21-ch14.txt:550(搜「广泛泛化(broad」) · text/21-ch14.txt:552(搜「未知的未知事物」) · text/21-ch14.txt:554(搜「沃兹智能测试」) · text/21-ch14.txt:557(搜「人工认知」)
捷径法则三例总结text/21-ch14.txt:580(搜「捷径法则(shortcut」) · text/21-ch14.txt:583(搜「Netflix」) · text/21-ch14.txt:593(搜「深蓝」) · text/21-ch14.txt:595(搜「几乎没有教会」)
固定任务消除智能总结text/21-ch14.txt:626(搜「消除了对智能的需求」)
效率比与 ARC总结text/21-ch14.txt:637(搜「效率比(efficiency」) · text/21-ch14.txt:645(搜「Abstraction and Reasoning Corpus」) · text/21-ch14.txt:657(搜「无法练习」) · text/21-ch14.txt:661(搜「核心先验知识」)
GPT-3 与 5 岁小孩总结text/21-ch14.txt:664(搜「完全无法解决」) · text/21-ch14.txt:664(搜「非插值」) · text/21-ch14.txt:665(搜「5 岁的小孩」)
万花筒假说总结text/21-ch14.txt:691(搜「万花筒假说」) · text/21-ch14.txt:706(搜「抽象类比的敏感性」)
两种抽象总结text/21-ch14.txt:713(搜「以价值为中心的类比」) · text/21-ch14.txt:719(搜「甲虫」) · text/21-ch14.txt:731(搜「K 均值」) · text/21-ch14.txt:748(搜「子图同构」)
缺的那一半与排序总结text/21-ch14.txt:789(搜「基本上无法生成」) · text/21-ch14.txt:790(搜「更重要的一半」) · text/21-ch14.txt:797(搜「5 个数字」) · text/21-ch14.txt:803(搜「纯 Python」)
程序合成总结text/21-ch14.txt:835(搜「程序合成(program synthesis」) · text/21-ch14.txt:861(搜「非常不错的结果」)
混合系统与指导搜索总结text/21-ch14.txt:872(搜「蒙特卡罗树搜索」) · text/21-ch14.txt:887(搜「if 分支」) · text/21-ch14.txt:914(搜「组合式爆炸」) · text/21-ch14.txt:921(搜「有用程序的空间」)
终身学习与 AGI总结text/21-ch14.txt:938(搜「在每个任务上的效果都更好」) · text/21-ch14.txt:947(搜「子程序(program subroutine」) · text/21-ch14.txt:1003(搜「奇点式」)
学习资源总结text/21-ch14.txt:1020(搜「XGBoost」) · text/21-ch14.txt:1027(搜「预印本」) · text/21-ch14.txt:1037(搜「100 万用户」)

Footnotes

  1. 出处:「总结」第 12-16 段(text/21-ch14.txt:14,搜「不能做什么」)。

  2. 出处:「总结」第 137-153 段(text/21-ch14.txt:142,搜「假设空间」)与第 147-153 段(text/21-ch14.txt:147,搜「密集连接网络(Dense 层)」)。

  3. 出处:「总结」第 110-135 段(text/21-ch14.txt:117,搜「定义任务」)。七步的完整展开见本书第 07 章。

  4. 出处:「总结」第 316-318 段(text/21-ch14.txt:318,搜「无法泛化」)与第 351 段(text/21-ch14.txt:351,搜「并不是一切」)。

  5. 出处:「总结」第 80-81 段(text/21-ch14.txt:80,搜「成对关系」)与第 85-90 段(text/21-ch14.txt:85,搜「极具误导性」)。候选新名字:分层表示学习、深度可微模型、链式几何变换。

  6. 出处:「总结」第 352-359 段(text/21-ch14.txt:355,搜「数十万条」)、第 357 段(text/21-ch14.txt:357,搜「产品说明」)与第 359 段(text/21-ch14.txt:359,搜「简单排序算法」)。

  7. 出处:「总结」第 360-368 段(text/21-ch14.txt:361,搜「数据流形 X」)、第 362 段(text/21-ch14.txt:362,搜「不能表示为深度学习模型」)与第 366 段(text/21-ch14.txt:366,搜「表面上缓解」)。

  8. 出处:「总结」第 370-376 段(text/21-ch14.txt:372,搜「心智理论」)与第 373 段(text/21-ch14.txt:373,搜「笑脸」)。

  9. 出处:「总结」第 383-386 段(text/21-ch14.txt:383,搜「对抗样本(adversarial」)。

  10. 出处:「总结」第 387-389 段(text/21-ch14.txt:387,搜「长臂猿梯度」)与第 389 段(text/21-ch14.txt:389,搜「深刻差异」)。

  11. 出处:「总结」第 401-408 段(text/21-ch14.txt:401,搜「并不理解其输入」)、第 406 段(text/21-ch14.txt:406,搜「镜子中的模糊图像」)与第 407-408 段(text/21-ch14.txt:408,搜「豹纹沙发」)。

  12. 出处:「总结」第 419-423 段(text/21-ch14.txt:420,搜「它并不理解」)。

  13. 出处:「总结」第 425-453 段(text/21-ch14.txt:432,搜「5 亿多年」)、第 433-434 段(text/21-ch14.txt:434,搜「行为程序」)与第 449-452 段(text/21-ch14.txt:449,搜「自动机(automaton」)。

  14. 出处:「总结」第 455-466 段(text/21-ch14.txt:463,搜「并不是理解」)。引文出自笛卡儿《谈谈方法》(1637),中译参考商务印书馆王太庆译本(原书译者注)。

  15. 出处:「总结」第 468-474 段(text/21-ch14.txt:468,搜「理解的证据」)与第 469-470 段(text/21-ch14.txt:470,搜「全新的题目」)。

  16. 出处:「总结」第 480-494 段(text/21-ch14.txt:481,搜「很少的数据甚至没有新数据」)、第 487-490 段(text/21-ch14.txt:489,搜「已知的未知事物」)与第 491-492 段(text/21-ch14.txt:491,搜「在流形上进行插值」)。

  17. 出处:「总结」第 508-516 段(text/21-ch14.txt:510,搜「发射试验」)、第 511-512 段(text/21-ch14.txt:512,搜「登陆月球」)与第 513-514 段(text/21-ch14.txt:513,搜「安全行走」)。

  18. 出处:「总结」第 518-537 段(text/21-ch14.txt:526,搜「都不相同」)与第 534-537 段(text/21-ch14.txt:534,搜「有效利用你所掌握的信息」)。

  19. 出处:「总结」第 550-559 段(text/21-ch14.txt:550,搜「广泛泛化(broad」)、第 552 段(text/21-ch14.txt:552,搜「未知的未知事物」)、第 554 段(text/21-ch14.txt:554,搜「沃兹智能测试」)与第 556-557 段(text/21-ch14.txt:557,搜「人工认知」)。

  20. 出处:「总结」第 577-582 段(text/21-ch14.txt:580,搜「捷径法则(shortcut」)。

  21. 出处:「总结」第 583-587 段(text/21-ch14.txt:583,搜「Netflix」)与第 584 段(text/21-ch14.txt:584,搜「没有采用」);深蓝见第 588-597 段(text/21-ch14.txt:593,搜「深蓝」)与第 595 段(text/21-ch14.txt:595,搜「几乎没有教会」)。

  22. 出处:「总结」第 601-629 段(text/21-ch14.txt:604,搜「添加硬编码知识」)与第 625-627 段(text/21-ch14.txt:626,搜「消除了对智能的需求」)。

  23. 出处:「总结」第 631-644 段(text/21-ch14.txt:637,搜「效率比(efficiency」)。

  24. 出处:「总结」第 645-662 段(text/21-ch14.txt:645,搜「Abstraction and Reasoning Corpus」)、第 649-651 段(text/21-ch14.txt:650,搜「输入网格」)、第 656-658 段(text/21-ch14.txt:657,搜「无法练习」)与第 659-661 段(text/21-ch14.txt:661,搜「核心先验知识」)。

  25. 出处:「总结」第 663-666 段(text/21-ch14.txt:664,搜「完全无法解决」)、第 664 段(text/21-ch14.txt:664,搜「非插值」)与第 665 段(text/21-ch14.txt:665,搜「5 岁的小孩」)。

  26. 出处:「总结」第 675-708 段(text/21-ch14.txt:691,搜「万花筒假说」)、第 692-693 段(text/21-ch14.txt:692,搜「独特意义单元」)与第 706 段(text/21-ch14.txt:706,搜「抽象类比的敏感性」)。理论出处为 Chollet《On the Measure of Intelligence》(2019),原书第 674 段的文献注。

  27. 出处:「总结」第 709-738 段(text/21-ch14.txt:713,搜「以价值为中心的类比」)、第 719-726 段(text/21-ch14.txt:719,搜「甲虫」)、第 731 段(text/21-ch14.txt:731,搜「K 均值」)与第 734 段(text/21-ch14.txt:734,搜「局部泛化」)。

  28. 出处:「总结」第 740-765 段(text/21-ch14.txt:748,搜「子图同构」)与两种抽象对照表(第 770-777 段)。

  29. 出处:「总结」第 787-790 段(text/21-ch14.txt:789,搜「基本上无法生成」)与第 790 段(text/21-ch14.txt:790,搜「更重要的一半」)。

  30. 出处:「总结」第 796-808 段(text/21-ch14.txt:797,搜「5 个数字」)、第 799 段(text/21-ch14.txt:799,搜「更多的数据上重新训练」)、第 799-800 段(text/21-ch14.txt:800,搜「几行代码」)、第 803-806 段(text/21-ch14.txt:803,搜「纯 Python」)与第 806 段(text/21-ch14.txt:806,搜「90% 的测试精度」)。卷积网络 99.1% 的数字见本书第 08 章。

  31. 出处:「总结」第 830-858 段(text/21-ch14.txt:835,搜「程序合成(program synthesis」)与机器学习-程序合成对照表(第 854-858 段)。

  32. 出处:「总结」第 859-861 段(text/21-ch14.txt:861,搜「非常不错的结果」)。

  33. 出处:「总结」第 863-896 段(text/21-ch14.txt:871,搜「AlphaGo」)、第 872 段(text/21-ch14.txt:872,搜「蒙特卡罗树搜索」)、第 885-887 段(text/21-ch14.txt:887,搜「if 分支」);指导搜索见第 911-928 段(text/21-ch14.txt:914,搜「组合式爆炸」)与第 921-922 段(text/21-ch14.txt:921,搜「有用程序的空间」)。

  34. 出处:「总结」第 930-955 段(text/21-ch14.txt:938,搜「在每个任务上的效果都更好」)与第 947 段(text/21-ch14.txt:947,搜「子程序(program subroutine」)。

  35. 出处:「总结」第 979-1004 段(text/21-ch14.txt:1003,搜「AGI」)与第 1003-1004 段(text/21-ch14.txt:1003,搜「奇点式」)。

  36. 出处:「总结」第 1014-1045 段(text/21-ch14.txt:1020,搜「XGBoost」)、第 1025-1034 段(text/21-ch14.txt:1027,搜「预印本」)与第 1037 段(text/21-ch14.txt:1037,搜「100 万用户」)。

  37. 出处:「总结」第 814-817 段(text/21-ch14.txt:815,搜「水晶球」)。原文:「请注意,我没有水晶球,所以我的很多预测可能无法实现。」 2