跳到主要内容

那一柜子还在用的老办法 — 以及「反馈信号从哪来」这道分野

这一章讲三件事: 深度学习之外还有哪些方法今天仍然是默认选项; 学习这件事按「反馈信号从哪来」可以分成哪三类; 以及这一行有哪几条被反复验证、但天天被违反的经验。

它在全书链条里的位置: 这是地基段的最后一章,也是唯一一章告诉你 什么时候不该用后面那些东西。跳过它,你会以为所有问题都该上神经网络。

1. 先说结论:表格数据上,老办法至今常常更强

书里给了一条极其实用的建议,一句话就能用。但要看懂它,先得认三个词——下面三段各给一个。

决策树:一串「是/否」问题,层层把样本分开,最后在末端给出判决(第 3 节展开)。

梯度提升:把很多棵这样的树串起来训,每棵新的专门去修正前面那些犯下的错。

非结构化:图像、文字、语音、视频这类没有天然表格形状的数据。

反过来,能整整齐齐摆成一张表的叫结构化数据:每行一个人,每列一个字段 (表格里的一栏,比如「年龄」「月收入」),像客户信息、财务报表、化验单。

结构化数据优先尝试梯度提升树,非结构化数据用深度学习。1

为什么要在一本讲深度学习的书里花一章讲老办法? 三个理由:

  1. 它们没退休。 银行风控、广告点击预测、比赛榜单上的表格类任务,今天的默认起点仍是它们;
  2. 它们更便宜、更快、更好解释。 一棵决策树能把判断理由念出来,一个大网络不能;
  3. 它们是理解「归纳偏置」这个概念最好的教具——这个概念是第 06、07 两章的钥匙。

2. 支持向量机:把两类之间的空隙撑到最大

这一节讲 1990 年代最成功的那个方法,以及它的一个漂亮扩展。

假设桌上散着一堆红点和蓝点,要画一条线把它们分开。 能分开的线有无数条,该画哪一条?

支持向量机的答案是:画那条让两边空隙最大的2。 它不满足于「分开」,它要让离线最近的那几个点,离线尽可能远。 这个空隙在书里叫间隔,而「间隔大」意味着分界线很清晰,对新样本也更可靠。

○ ○ ○ ○ ○ ○
○ ○ │ ● ● ○ ○ ╱ ● ●
○ │ ● ● ○ ╱ ● ●
─────┴────── ────╱────────
勉强分开 空隙撑到最大
(新点一挪就错) (对新点更稳)

这张图看的是同一堆点的两种分法:左边只求分开,右边求把空隙撑到最大。

但很多情况下,一条直线根本分不开。这时它有一招叫核技巧3: 通过一个数学变换,把点搬到一个更高的空间里去—— 二维平面上无论如何画不开的两组点,升到三维之后可能一个平面就切开了。

支持向量机的优点和缺点一样鲜明。 优点是数学漂亮、理论扎实、中小数据上稳定; 缺点是数据一多就训得慢,而且在图像这类动辄几十万个数的原始数据上力不从心—— 它依赖的仍然是人挑好的特征,这正是第 01 章讲的那道天花板。

3. 决策树、随机森林与梯度提升:一串是非题

这一节讲今天表格数据上最常用的那一支。

上一节给过一句话的决策树,这里展开。它模仿人做判断的过程:通过一连串「是/否」问题,把样本层层划分4。 判断一笔贷款该不该放:「月收入 > 1 万?」是,进下一问;「工作年限 > 3 年?」…… 一路问到底,叶子上给出判决。

它最大的优点是每一步判断都能用文字解释5,对业务人员极其友好。 最大的缺点是容易背题:训练数据里每一条小规律它都会学进去,新数据一来就露馅。

对付这个毛病有两条路,方向正好相反:

第一条是并行投票,叫随机森林。 训练许多棵略有差异的树 (每棵用不同的数据子集和不同的字段子集),最终预测是所有树的多数投票6一群略有偏差的树互相抵消,比任何单棵树都稳。

第二条是串行纠错,叫梯度提升。 不独立训练多棵树, 而是一棵接一棵地训:每棵新树都专门去修正前面那些树犯的错7。 这样层层叠加,得到一个非常强的模型。

梯度提升是今天表格数据上的事实标准。 书里点名的几个实现在数据科学竞赛里主导了相当长的时间; 在结构化数据上,它通常比深度学习更好8

随机森林: 树1 树2 树3 … 树100 → 一起投票
(各训各的,互不相干)

梯度提升: 树1 → 树2 → 树3 → … → 累加起来
(树2 专治树1 的错,树3 专治前两棵剩下的错)

这张图看的是同样一百棵树的两种组织方式:一种是同时开会,一种是接力纠错。

4. 两个朴素但好用的基线

还有两个方法值得知道,因为它们简单到能当基线用。基线就是那个不动脑子也能达到的成绩, 新做一个任务时用它当比较的起点。

K 近邻的想法最直观:不急着训练,来了一个新样本, 就看它周围最近的 K 个老样本是什么类别,按多数投票决定。 书里的形容很到位:它像「问问邻居怎么判断」9。 缺点也很直接:每次预测都要和大量老样本比一遍,而且维度一高, 「距离」这个概念本身就变得不可靠。

朴素贝叶斯(一种按「各个线索各自提供多少证据」把可能性乘起来的老办法)像一个经验丰富的邮件过滤器:看到「中奖」「免费」「点击」这些词, 就估计这封邮件是垃圾邮件的可能性10。它叫「朴素」是因为它假设各个字段之间大致互不影响—— 这个假设常常不成立,但在文本分类上出奇地有效。

这两个方法的真正用处就在这里。 你做一个新任务,先用它们跑一遍;如果你精心设计的大模型打不过「问问邻居」, 那问题多半不在模型,在数据或者在任务定义。

5. 三大范式:反馈信号从哪来

这一节是全章最承重的一节,它给的分类比「有哪些算法」重要得多。

书里把学习分成三大类,而分类的依据不是技术,是机器从外界拿到什么信号11:

哪一类反馈信号是什么像什么
第一类每道题都附标准答案做习题册,做完对答案
第二类没有答案,只有一堆材料自由阅读,自己找规律
第三类没有答案,只有分数学骑车,摔一次长一分教训

第一类就是第 03 章讲完的监督学习。 下面两类各有一整章,这里先建立形状。

第二类叫无监督学习——它的数据没有标签12,模型必须从数据本身发现结构。 典型任务是把相似的样本自动分成几堆、把很长的一串数压成很短的一串、 或者估计这批数据大致长什么样。

但今天真正的主角是它的一个现代版本。 书里说得很清楚: 不是没有标签,而是从数据本身派生标签13—— 让模型预测一段文本里被挖掉的词、预测一张图片里被遮住的区域、 判断两张经过变换的图是不是来自同一张原图。这些题都不需要人来标注 (一条条把正确答案写到数据上去)。

这些题的答案本来就藏在数据里,不需要任何人工标好答案。 这一支叫自监督 (自己给自己出题、自己对答案),今天几乎所有大模型的第一阶段训练都靠它。 (它怎么运作,第 12 章讲。)

第三类叫强化学习——它的数据既不是预先给定的,也不是单纯的观察, 而是在与环境交互的过程中产生的14。 模型在环境里做一个动作,环境返回一个分数和一个新状态; 它要学的是一套「看到什么就做什么」的规则,让长期累积的分数最大。 (它怎么运作,第 13 章讲。)

两个夹在中间的说法

第一个是半监督:少量有答案的数据, 加上大量没答案的数据,一起拿来训。

第二个是弱监督:用的答案本身不完美——网页标题、用户点击、粗糙的规则, 都能凑合当答案。它们都在解决同一个现实问题:真正干净、人工精标的数据太少、太贵了。

三类不是割裂的。 书里点明:现代大模型的训练往往是三类协同—— 先用自监督做预训练(在海量没有答案的数据上先练一遍,把通用能力打个底), 再用少量高质量的问答对学会遵循指令, 最后用人的反馈调优行为风格15这条三步流水线是第 15、16 两章的主线。

6. 六种任务形状

除了「反馈从哪来」,还有一个划分是「输出长什么样」。 这个划分决定你该拿哪把尺子量它,书里列了六类16:

形状输出是什么例子
分类一个类别这封邮件是不是垃圾
回归一个数明天的气温
排序与推荐一份排好序的名单第一屏给你看什么
结构化预测一个有内部结构的整体翻译(一整段文本)、图像分割(和原图一样大的标签图)
异常检测这个样本正不正常银行打电话问「这笔在境外的消费是您本人吗」
生成建模一个全新的样本从文字画出一张图

后三种要单独说两句。

结构化预测比分类难得多,因为输出空间大到没法穷举: 一句十个词的译文,可能的组合是天文数字17

异常检测的难点是极度不平衡:异常样本通常只占 0.1% 甚至更少, 模型很容易偷懒把所有样本都判成正常。一个常用的巧办法是只学「正常长什么样」—— 用正常样本训一个「压缩再还原」的东西,还原得好就是正常,还原误差一大就报警。

生成建模和前面所有任务都不一样。 前面那些回答的都是「这个输入属于哪一类」, 这种做法在书里叫判别式(只关心怎么把不同的东西分开,不关心它们各自长什么样)。

生成建模反过来,它要回答的是「这种数据本身是怎么分布(各种取值各占多大比例)的」。 比如一万张猫照片里,橘猫占多少、黑猫占多少、侧脸占多少。

知道了比例,就能采样(按这个比例随机抽一个出来)。

抽出来的就是一张全新的、从来没存在过的猫18。这一类做法叫生成式

这也解释了为什么生成式的东西体量都极大: 它要装下的不是一条边界,而是世界本身的统计样貌。

7. 数据为王

这一节讲这一行第一条铁律,也是最常被违反的一条。

工业界有一句名言:好数据 + 简单模型,胜过差数据 + 复杂模型19。 一个工程项目里,花在数据清洗、数据标注(人工一条条把正确答案写上)、数据质检上的时间通常占总时间的 60% 以上, 远超过训模型的时间20

「数据为王」有两层含义:量要够,质要高。 错标、噪声(数据里那些没有意义的随机波动)、 系统性偏差,都会被模型忠实地学进去。

但书里还补了一句更要紧的话,它是第 25、26 两章的伏笔:

数据不是从天上掉下来的纯净矿泉水,而是人类社会活动留下的痕迹。 谁被记录、谁没被记录,哪些错误被保留下来,哪些群体在数据里被低估, 都会影响模型学到什么。

机器学习不是洗衣机,不能把脏数据自动洗干净;更多时候, 它像一面放大镜,把数据里的问题照得更亮21

8. 奥卡姆剃刀与偏差-方差权衡

这两条经验其实是同一件事的两个说法。

十四世纪的哲学家奥卡姆的威廉提出过一条原则:如无必要,勿增实体22。 用到这里就是:在能解决问题的前提下,优先选更简单的模型。 理由很实在——简单模型更不容易背题、更容易解释、更容易调试。 书里给这条原则起了个温馨的别称:不要拿大炮打蚊子23

同一件事换成数学说法,就是偏差-方差权衡24。模型的误差有两个来源:

  • 偏差来自模型本身的局限:太简单的模型天生看不清复杂规律, 用一根直线去拟合一条螺旋形的数据,偏差就很大;
  • 方差来自对训练数据的过度敏感:太复杂的模型会把训练集里的随机波动也当真, 换一批训练数据,学出来的模型就大不一样。

这里的复杂度指的是「模型有多大的自由去迁就数据」——参数越多、形状越灵活,复杂度越高。

误差
│╲ ╱ 方差(越复杂越大)
│ ╲_ ╱
│ ╲_ ╱ ← 测试误差:先降后升
│ 偏差 ╲___(越复杂越小)
└──────┬──────── 模型复杂度
刚刚好

这张图看的是同一批数据、不同复杂度的模型:两条来源一升一降,加起来的那条先降后升。 最低点出现在「刚刚好」,而不是「最复杂」。

盲目加复杂度并不总是好事。

9. 没有免费的午餐,和结构里藏着的信念

有一条定理叫「没有免费午餐」,说的是:没有一种算法能在所有问题上都表现最好25。 在某类任务上优秀的方法,换到另一类可能糟糕。

这条定理的实用启发是:选方法要结合任务特性。 但更深一层的解释, 是这一章最值得带走的一个概念——归纳偏置

所有模型都天生偏爱某一类规律26:

模型它偏爱什么这等于先信了什么
线性模型线性关系「因素之间是按固定比例叠加的」
卷积网络局部的、换个位置仍然成立的模式「相邻的像素更相关」
循环网络按时间顺序展开的依赖「后面的取决于前面的」
图结构上的那类网络沿着连线传播的关系「谁和谁连着,谁就互相影响」

这种「偏爱」不是缺陷,恰恰是让模型能在有限数据上学到东西的关键。 一个没有任何偏爱的模型,面对有限数据时就像闭着眼瞎猜。

但偏爱和问题必须对上。 用卷积网络处理一张没有空间结构的表格,就是纯浪费。 你选哪种结构,等于你先替机器信了世界有哪种结构—— 这句话是第 06、07 两章的钥匙,也是第 10 章讲 Transformer 时那个悖论的伏笔。

深度学习最迷人的一面,是它可以通过足够大的模型和数据,减轻人手工设计这种偏爱的负担。 但书里紧接着补了半句:在数据和算力(能投进去的计算总量,第 18 章有一整章讲它)有限的场景下, 它仍然关键

10. 一个真实项目从头到尾

这一节讲书本知识和实际能力之间那道沟。

书里给的项目全流程有六步,值得完整抄下来27:

问题定义 → 数据准备 → 模型开发 → 迁移学习 → 部署 → 监控与迭代
↑ │
└──────────────── 发现问题就回到这里 ←───────────────┘

这张图看的是一个项目的完整闭环:它不是一条直线,末端要绕回起点。

第一步最容易被跳过,也最致命。 业务方说「想用 AI 提高效率」,这太模糊。 必须把它转成具体的任务:输入是什么、输出是什么、怎么衡量好坏、目标成本多少。 新手最常见的陷阱是跳过这一步直接写代码,结果做出来的东西业务用不上。

第二步最耗时。 经验工程师有 60% 到 80% 的时间花在这个阶段28: 采集、清洗、标注、划分、审查有没有系统性偏差和数据泄漏。

第四步值得单独说,因为它是今天的常态。 很多真实项目不会从零开始训练, 而是站在已有模型的肩膀上——先让模型在数据丰富的任务上学到通用能力, 再把这些能力迁到数据较少的目标任务上,这叫迁移学习29

具体做法叫微调(不从头训,只在一个已经练好的模型上再补一小段训练,把它掰到新任务上)。 早期做图像时,工程师常把在大型图像数据集上训好的网络拿来,换掉最后那一层, 再用少量医学影像微调;今天的做法换成了「拿一个预训练好的大模型,再补一小段」。

它的好处是省数据、省算力、起步快;风险是负迁移—— 源任务和目标任务差得太远时,旧经验不仅帮不上忙,还可能误导30

最后一步是很多人不知道的:模型上线不是终点。 用户行为会变,数据特征会变, 模型效果会慢慢下降,这叫数据分布漂移31。 对策是定期重训。一次性做完 80%,不如持续小步改进。

11. 走查:同一封垃圾邮件,把全章走一遍

这一章的主走查:一封具体的邮件,从「一堆字」走到「拦截 / 放行」的判决, 让本章每个承重概念各占一步。 邮件和各特征值都是为演示编的:

输入:一封新邮件——标题「恭喜您中奖」,正文含 3 个「点击链接」,
发件人地址无历史记录,收件人从未与对方通信。

① 反馈信号从哪来(§5):历史邮件由人工标过「垃圾 / 正常」,
每封都附标准答案 → 这是监督学习,不是无监督,也不是强化学习
② 任务形状(§6):输出一个类别 → 分类;
若改判「这次登录正不正常」,则挪进异常检测那格
③ 先跑基线(§4):朴素贝叶斯先上——看到「中奖」「点击」就按
各线索各自的证据乘起来;它偏爱「各线索互不影响」(§9 的归纳偏置),
而垃圾邮件恰恰常靠词面线索,这个朴素假设在这里出奇地有效
④ 换主力(§1/§3):特征整理成表格(词频、链接数、发件人历史)——
结构化数据,默认起点是梯度提升树:500 棵树串行纠错(棵数为演示编的),
每棵专治前面剩下的错;换回单棵决策树,还能把判断理由念给客服听
⑤ 训练的大头(§7):几千封历史邮件要人工标注、去重、清错标——
书里的账:这类活占项目时间六成到八成
⑥ 选多复杂(§8):朴素贝叶斯偏差大、方差小;五百棵树的提升树
偏差小、方差大;留在「刚刚好」那一档,别为刷训练集再加复杂度
⑦ 上线之后(§10):垃圾发送者换词(「中獎」改繁体、词藏进图片)——
数据分布漂移,模型慢慢变笨,定期重训绕回第 ① 步之前

这张图看的是本章全部承重件各就各位:反馈信号定范式(①)、输出定任务形状(②)、 数据形状定模型(③④)、数据质量定上限(⑤)、复杂度定平衡点(⑥)、漂移定生命周期(⑦)。

支持向量机这一节为什么没出场?它擅长的是中小规模表格上「把空隙撑到最大」; 垃圾邮件是词面特征加大规模数据,它既不是默认起点也无额外优势—— 「没有免费的午餐」定理本身就是答案(§9)。

12. 作者的判断与证据

有证据的部分。 各个老办法的原理与优缺点、三大范式的划分、 偏差方差权衡、没有免费午餐定理,都是这一行的标准内容。

要分开看的三处:

  1. 「结构化数据优先梯度提升树」。 这是一条实践建议,不是定理。 它在中小规模表格数据上非常可靠;但表格数据上的深度学习方法这几年一直在追, 书里没给年份,读的时候当成「默认起点」而不是「最终结论」
  2. 「60% 到 80% 的时间花在数据上」。 这是行业口头相传的数,书里没给来源。 它的量级可信,精确值不必当真。
  3. 「深度学习减轻了手工设计归纳偏置的负担」。 这句成立, 但书里同时补了「在数据和算力有限的场景下它仍然关键」。 两半必须一起读,只读前半会得出「结构不重要了」这个错误结论。

判断(我们的,不是书里的):这一章真正的价值不在那几个老方法,在第 5 节那张三行表。 「反馈信号从哪来」这道分野,比「用了哪个算法」稳定得多—— 算法五年换一批,这三类的分野七十年没变。 你以后判断任何一个 AI 系统,先问它靠什么信号学:有人给答案、 从数据自己派生、还是只有一个分数。答案不同,它的能力上限和失败方式完全不同。 如果错,会错在: 今天的前沿系统常常同时用三种,分野在工程上越来越模糊。 但作为理解框架,它仍然比「按算法分」清楚。

13. 边界与局限

  • 这一章的老办法只讲了直觉,没讲数学。 支持向量机怎么求解、 梯度提升每一步怎么算,这一版一律不展开。
  • 书里没有给这些方法的适用规模。 「数据一多就慢」的「多」是多少,没有数。
  • 归纳偏置这个概念书里只用了一页。 它其实是理解整本书的钥匙, 我们在这里把它提前并写重了。
  • 项目生命周期那一节偏理想。 真实项目里问题定义常常在数据准备之后才被迫重写, 书里画的是顺序流程,没画这种回退。
  • 六种任务形状的划分不是穷举。 比如随时间变化的数据预测、因果推断, 在这个划分里没有位置。

14. 可带走的

  1. 表格数据优先试梯度提升树,图像文字语音用深度学习。 这是一条今天仍然管用的默认规则。
  2. 随机森林是并行投票,梯度提升是串行纠错。 记住这个对照,你就分得清所有「一堆树」的方法。
  3. 先跑一个笨基线。 打不过「问问邻居」,问题不在模型。
  4. 三大范式的分野是「反馈信号从哪来」,不是「用了什么算法」。 这个分野七十年没变。
  5. 自监督不是没有标签,是标签从数据自己派生。 这句话是后面整个大模型故事的起点。
  6. 生成建模要装下的不是一条边界,而是世界的统计样貌。 这解释了它为什么体量都极大。
  7. 机器学习是放大镜,不是洗衣机。 数据里的偏见不会被自动洗掉,只会被照得更亮。
  8. 测试误差先降后升,最低点在「刚刚好」而不是「最复杂」。 这是偏差方差权衡唯一要记的一张图。
  9. 结构本身就是一种信念。 你选哪种网络,等于先替机器信了世界有哪种结构。
  10. 模型上线不是终点。 数据会漂,不定期重训的系统会慢慢变笨。

15. 原文地图

主题原书章原文位置
结构化优先梯度提升树第2章 机器如何自己学习text/03-ch02.txt:461(搜「结构化数据优先尝试梯度提升树」)
支持向量机与核技巧第2章 机器如何自己学习text/03-ch02.txt:416(搜「支持向量机」) · :420(搜「核技巧」)
K 近邻与朴素贝叶斯第2章 机器如何自己学习text/03-ch02.txt:428(搜「问问邻居怎么判断」) · :430(搜「朴素贝叶斯」)
决策树与集成第2章 机器如何自己学习text/03-ch02.txt:438(搜「决策树」) · :443(搜「每一步判断都能用文字解释」) · :446(搜「集成多棵决策树」) · :450(搜「每棵新树都专门去」)
梯度提升在表格上的地位第2章 机器如何自己学习text/03-ch02.txt:453(搜「在结构化数据」)
三大范式第2章 机器如何自己学习text/03-ch02.txt:465(搜「监督学习、无监督学习、强化学习」) · :478(搜「无监督学习的数据没有标签」) · :481(搜「从数据本身派生标签」) · :488(搜「在与环境交互的过程中产生」)
三类协同第2章 机器如何自己学习text/03-ch02.txt:494(搜「三类方法的协同」)
六种任务形状第2章 机器如何自己学习text/03-ch02.txt:578(搜「结构化预测」) · :583(搜「这笔在境外的消费是您本人吗」) · :601(搜「生成建模」) · :602(搜「判别模型」)
数据为王第2章 机器如何自己学习text/03-ch02.txt:505(搜「好数据」) · :507(搜「数据质检」) · :517(搜「放大镜」)
奥卡姆剃刀第2章 机器如何自己学习text/03-ch02.txt:518(搜「奥卡姆的威廉」) · :525(搜「不要拿大炮打蚊子」)
偏差方差权衡第2章 机器如何自己学习text/03-ch02.txt:526(搜「偏差来自模型本身的局限」) · :531(搜「偏差-方差权衡」)
没有免费午餐第2章 机器如何自己学习text/03-ch02.txt:549(搜「没有一种算法能在所有问题上」)
归纳偏置第2章 机器如何自己学习text/03-ch02.txt:615(搜「归纳偏置」) · :616(搜「偏爱局部和平移不变的模式」)
项目生命周期第2章 机器如何自己学习text/03-ch02.txt:643(搜「第一步是问题定义」) · :651(搜「60% 到 80% 的时间」)
迁移学习与负迁移第2章 机器如何自己学习text/03-ch02.txt:656(搜「迁移学习」) · :663(搜「负迁移」)
数据分布漂移第2章 机器如何自己学习text/03-ch02.txt:674(搜「数据分布漂移」)

Footnotes

  1. 出处:「第2章 机器如何自己学习」第 461 段(text/03-ch02.txt:461,搜「结构化数据优先尝试梯度提升树」)。 原文后面还有一句:「不要盲目跟风,用对工具比用新工具重要」。

  2. 出处:「第2章 机器如何自己学习」第 416 段(text/03-ch02.txt:416,搜「支持向量机」)。 原文的表述是「找到一个超平面,把不同类别的样本尽可能分开,而且让最近样本的距离尽可能大」; 「超平面」在二维里就是一条线,三维里是一个面,更高维里没法画但道理一样。

  3. 出处:「第2章 机器如何自己学习」第 420 段(text/03-ch02.txt:420,搜「核技巧」)。 原文举的例子是:二维平面上无法用直线分开的两组点,映射到三维空间后可能就能用一个平面分开。

  4. 出处:「第2章 机器如何自己学习」第 438 段(text/03-ch02.txt:438,搜「决策树」)。

  5. 出处:「第2章 机器如何自己学习」第 443 段(text/03-ch02.txt:443,搜「每一步判断都能用文字解释」)。

  6. 出处:「第2章 机器如何自己学习」第 446 段(text/03-ch02.txt:446,搜「集成多棵决策树」)。

  7. 出处:「第2章 机器如何自己学习」第 450 段(text/03-ch02.txt:450,搜「每棵新树都专门去」)。

  8. 出处:「第2章 机器如何自己学习」第 453 段(text/03-ch02.txt:453,搜「在结构化数据」)。 书里点名的三个实现是 XGBoost、LightGBM、CatBoost。

  9. 出处:「第2章 机器如何自己学习」第 428 段(text/03-ch02.txt:428,搜「问问邻居怎么判断」)。

  10. 出处:「第2章 机器如何自己学习」第 430 段(text/03-ch02.txt:430,搜「朴素贝叶斯」)。

  11. 出处:「第2章 机器如何自己学习」第 465 段(text/03-ch02.txt:465,搜「监督学习、无监督学习、强化学习」)。 原文说这个划分「不仅仅是技术层面的,更对应着『机器从外界获得什么信号』这件事的三种不同假设」。

  12. 出处:「第2章 机器如何自己学习」第 478 段(text/03-ch02.txt:478,搜「无监督学习的数据没有标签」)。

  13. 出处:「第2章 机器如何自己学习」第 481 段(text/03-ch02.txt:481,搜「从数据本身派生标签」)。

  14. 出处:「第2章 机器如何自己学习」第 488 段(text/03-ch02.txt:488,搜「在与环境交互的过程中产生」)。

  15. 出处:「第2章 机器如何自己学习」第 494 段(text/03-ch02.txt:494,搜「三类方法的协同」)。

  16. 出处:「第2章 机器如何自己学习」第 578 段(text/03-ch02.txt:578,搜「结构化预测」)。 书里这一节列的六类是分类与回归、排序与推荐、结构化预测、异常检测、表示学习、生成建模; 本章表里把「表示学习」挪走了,因为第 02 章已经把它讲完。

  17. 出处:「第2章 机器如何自己学习」第 580 段(text/03-ch02.txt:580,搜「输出空间指数级大」)。

  18. 出处:「第2章 机器如何自己学习」第 602 段(text/03-ch02.txt:602,搜「判别模型」)与第 601 段(text/03-ch02.txt:601,搜「生成建模」)。 原文的落点很有力:「它们要装下的,是世界本身的统计样貌」。

  19. 出处:「第2章 机器如何自己学习」第 505 段(text/03-ch02.txt:505,搜「好数据」)。

  20. 出处:「第2章 机器如何自己学习」第 506 段(text/03-ch02.txt:506,搜「数据清洗」)。 这个 60% 书里没给来源,它是行业里口头相传的数;第 10 节那个「60% 到 80%」是同书另一处的说法, 两个数不完全一致,我们照原文各引各的。

  21. 出处:「第2章 机器如何自己学习」第 516 段(text/03-ch02.txt:516,搜「放大镜」)。 前面那段引文出自第 511 段(text/03-ch02.txt:511,搜「纯净矿泉水」)。

  22. 出处:「第2章 机器如何自己学习」第 518 段(text/03-ch02.txt:518,搜「奥卡姆的威廉」)。

  23. 出处:「第2章 机器如何自己学习」第 525 段(text/03-ch02.txt:525,搜「不要拿大炮打蚊子」)。

  24. 出处:「第2章 机器如何自己学习」第 526 段(text/03-ch02.txt:526,搜「偏差来自模型本身的局限」) 与第 531 段(text/03-ch02.txt:531,搜「偏差-方差权衡」)。

  25. 出处:「第2章 机器如何自己学习」第 549 段(text/03-ch02.txt:549,搜「没有一种算法能在所有问题上」)。

  26. 出处:「第2章 机器如何自己学习」第 615 段(text/03-ch02.txt:615,搜「归纳偏置」)与第 616 段(text/03-ch02.txt:616,搜「偏爱局部和平移不变的模式」)。 本章那张表的第四行(图结构上的那类网络)是我们照书里另一处补的—— 书里在第 3 章说它「专门处理图结构数据,比如社交网络、分子结构、知识图谱」, 并明说「本书不会深入讲」(text/04-ch03.txt:626,搜「本书不会深入讲」)。

  27. 出处:「第2章 机器如何自己学习」第 643 段(text/03-ch02.txt:643,搜「第一步是问题定义」)。 六步的顺序照原文;那张闭环图是我们照文字重画的,书里没有图。

  28. 出处:「第2章 机器如何自己学习」第 651 段(text/03-ch02.txt:651,搜「60% 到 80% 的时间」)。

  29. 出处:「第2章 机器如何自己学习」第 656 段(text/03-ch02.txt:656,搜「迁移学习」)。 原文列的三类做法是:冻结特征提取器只训最后一小段、全量微调、只改动很少一部分参数。 第三类在第 16 章会展开,那里有真实代码位置。

  30. 出处:「第2章 机器如何自己学习」第 663 段(text/03-ch02.txt:663,搜「负迁移」)。

  31. 出处:「第2章 机器如何自己学习」第 674 段(text/03-ch02.txt:674,搜「数据分布漂移」)。