跳到主要内容

机器学习听起来像一门技术,其实更像一套流程:五个零件,缺一个都不叫「学」。 这一章把五个零件摆上桌。

机器学习的五个零件

1. 这一章讲什么

三件事: 一次完整的学习由哪五个零件组成;每个零件管什么、缺了会怎样; 以及「让机器学会挑芒果」这件小事,从头到尾长什么样。

它在全书链条里的位置: 这是全书第二块地基。第 04 章说了「为什么只能让机器自己找规律」, 这一章给出「找规律」这件事的标准操作程序——后面每一章,无论模型多复杂, 都是在这五个零件里换掉其中一两个。

需要第 04 章。 用到的只有「特征」「机器学习」这两个词。

2. 顶层全景

书里把机器学习方法拆成五个基本要素1。配上它的完整流程图2,五个零件是这样咬合的:

┌──────────────── 训练阶段 ────────────────┐
│ │
① 数据 ② 模型 ③ 学习准则 ④ 优化算法
训练集 ──────▶ 一族候选函数 ──▶ 把「差多远」 ──▶ 把参数一点点
(调参数用) 里挑一个 写成一个数 往「差一点」挪
│ ▲ │ │
│ │ └──────────────┘
│ │ 循环几千几万次
│ │
验证集 ─────────────┘ 每挪一阵子,在这份数据上看看还要不要继续
(选模型、调设置用)
└──────────────────────────────────────────┘

▼ 学好的模型
┌──────────────── 评价阶段 ────────────────┐
⑤ 评价:测试集(只用一次)──▶ 算出分数,汇报结束
└──────────────────────────────────────────┘

一句话链条: 拿一份带答案的数据 → 在一族候选函数里挑一个 → 挑的标准是「答错得少」→ 用梯度一点点把参数挪到位 → 最后在一份从没碰过的数据上算一次分。

五个零件,本章第 4 到 9 节挨个讲;第 10 节用一筐芒果把它们装成整机。

3. 挑芒果:四个词就是一次买菜经验

先看现象: 书里讲机器学习的基本概念,没用任何技术例子, 用的是到市场上买芒果3

假设你完全不会挑芒果,想学会「什么样的芒果甜」。你能做的只有一件事: 买一些回来,把每个芒果长什么样记下来,再尝一口记下甜不甜。

这一买一尝,机器学习的四个基本词就全齐了3:

在这次买菜里指什么
特征你记下来的「长什么样」:颜色、大小、形状、产地……
标签你关心的那个答案:甜度打分(一个数),或者「好/坏」(一个类别)
样本一个芒果的「特征 + 标签」合在一起,就是一条样本
样本向量把一个样本的各个特征排成的一列数

第四行要多说一句。「颜色」「产地」不是数,机器没法直接算, 得先变成数——比如颜色换算成 0(青)到 1(黄)之间的一个值。 把一个样本的全部特征排成的一列数,这本书里统一叫样本向量4。 (很多文献叫它「特征向量」,但本书把「特征向量」这个名字留给了第 01 章那个 「只被拉长、不被转向」的方向,两个词从此不打架。)

为什么要先立这四个词? 因为机器学习就是一句话: 攒一堆样本,从中找出「样本向量 → 标签」的规律,再去预测没尝过的芒果。

4. 三份数据各干什么

先看现象: 学生备考时,练习题、模拟卷、正式大考是三种不同的东西。 练习题随便做,模拟卷用来调整复习策略,而如果你提前拿到了大考原题, 那这场考试就测不出任何真实水平。

数据也一样。书里要求把数据切成三份,每份有严格的岗位分工5:

哪一份干什么用什么不能用
训练集用来调整模型的参数——
验证集用来选模型、调设置、决定什么时候停不能进训练
测试集只在最后评估一次模型的泛化性能不参与任何模型设计

「测试集只能用一次」这条不是洁癖,是有名字的纪律: 反复拿测试集来调参,会造成数据泄露——测试结果会过于乐观6。 道理和提前拿到大考原题完全一样:模型等于间接「见过」考题, 分数就不再代表它在真实世界的水平。

数据还有一条默认假设要知道:独立同分布。 意思是每条样本都是独立地、从同一个数据分布里抽出来的7—— 就像每次买芒果都在同一个摊、闭着眼睛随机拿。 书里明说这条假设在真实场景不总是成立(时间序列、换了一个市场,分布就变了), 它是后面所有理论分析的地基,也是很多实际翻车的源头。

5. 模型是一族函数,不是一个

问题: 「让机器学习一个模型」,学的到底是什么?

书里的回答:先圈定一族候选函数,再从中挑一个。 这一族候选有个正式名字,叫假设空间8

为什么要强调「一族」?因为真实的规律(芒果的甜度到底怎么由颜色大小决定) 我们永远不知道,能做的只是凭经验圈一个范围,然后让数据在里面挑。

圈多大、圈什么形状,是最关键的设计决定。书里给了最常见的两档9:

线性模型 f(x) = w·x + b 候选是所有直线(平面)
比如「甜度 = 3×颜色 + 2×大小 + 1」

非线性模型 f(x) = w·φ(x) + b 先拿一组非线性基函数 φ 把输入变个形,
再做线性组合

第二档里藏着全书最重要的一个伏笔: 如果那组基函数 φ 本身也可以从数据里学出来,这个模型就等价于神经网络10。 第 04 章说「让机器自己学该看什么」,在数学上就落在这一句。 这条路走到头就是第 10 章。

6. 「学得好不好」得先能算

问题: 候选有一整族,挑的标准是什么?

先得把「答得差多远」变成一个数。这个数由损失函数给出—— 第 03 章已经以交叉熵为例讲过它的来历,这里把书里常用的四种摆齐11:

损失函数怎么算用在哪短板
0-1 损失答错记 1,答对记 0最直观的「错误率」不连续、导数恒为 0,没法用梯度优化12
平方损失预测与真实之差的平方标签是连续数(回归)不适合分类问题13
交叉熵损失−log(模型分给真实类别的概率)分类问题的默认选择——
Hinge 损失max(0, 1 − y·f(x))支持向量机(第 09 章)只对二分类定义

第一行那个矛盾值得停一下:我们最关心的明明是错误率,却不能拿它当训练目标—— 它像一级一级的台阶,处处平坦处处断,梯度无处下脚12。 所以训练时用一个光滑的替身(交叉熵),评价时才回头看错误率。 「训练的目标」和「评价的目标」不是同一个数,这是这一行人人都知道的妥协。

交叉熵在分类问题上的样子,书里给了一个能口算的例子14: 三分类,真实标签是第 3 类,模型给三类的机会是 0.3、0.3、0.4, 损失 = −log(0.4)。它只看模型分给真实类别的那一份,其余两类给多少不进公式。 所以第 03 章那句话在这里兑现:交叉熵损失就是负对数似然15

7. 在有限数据上,到底最小化什么

问题: 损失函数有了,把它在什么数据上最小化?

这里有一个全书最重要的区分。真正想要的,是模型在全世界所有可能数据上的平均损失, 这个量叫期望风险16。可全世界的数据我们拿不到——手上的只有一筐芒果。

于是实际能做的只有一件事:在训练集上算平均损失,把它最小化。 训练集上的平均损失叫经验风险,这个准则叫经验风险最小化17

期望风险和经验风险的差,就是第 07 章的全部内容。 它有一个更常见的名字:泛化误差。第 03 章讲大数定律时已经埋了伏笔—— 样本无穷多时两者相等,但样本永远不是无穷多。

这个差会朝两个方向坏,书里各给了一个名字18:

过拟合 训练集上损失比别人小,放到整个样本空间上反而比别人差
── 把训练集背下来了,包括里面的噪声

欠拟合 连训练集上的错误率都很高
── 模型能力不够,该学的都没学到

书里对过拟合(背下训练集、没学会规律)的定义值得读原文(定义 2.1):它不是「训练误差太低」, 而是「存在另一个候选,训练集上比你差一点,全体数据上比你好」19过拟合永远是相对于另一个候选说的。

怎么防?书里给的总原则是:在经验风险后面再加一项复杂度惩罚, 候选越复杂,税越重——这叫结构风险最小化20。 这个惩罚项怎么写、为什么等价于「给参数加先验」, 第 06 章会在一条直线上把它完整推一遍(那里会给出它的正式名字)。

8. 怎么把参数挪到位

问题: 目标定好了,最小化这件事具体怎么做?

第 02 章已经给了答案:沿着负梯度走,一步一步试。 这里的问题只剩一个:每一步用多少数据来算梯度? 书里给了三档,差别只在(一次喂给模型的那组样本)有多大21:

这组样本有多少条,行话叫批量(每批的条数):

做法一次看几条样本好处代价
批量梯度下降整个训练集梯度准数据大时又慢又占内存22
随机梯度下降一条单步极便宜;噪声还能帮着跳出较差的局部区域23每一步都晃
小批量梯度下降一小把(常见几十条)两者折中,还能把多份计算同时吃满24要多调一个「批量大小」

第三档是现代深度学习的事实标准24。书里还补了一个工程细节: 那一小把的大小一般设成 2 的幂,纯粹是为了让计算机算得顺25

还有一类数,梯度永远调不到:超参数(人工拍板、训练自己不学的数)。

比如学习率、网络层数,以及正则化(防过拟合的约束)系数——这些「定义模型结构或优化策略」的数不在目标函数里,没有梯度可算,只能靠验证集表现去选。怎么系统地搜它们(网格、随机、贝叶斯优化)是第 19 章的前半章。

批大小(一次喂进模型的样本数)也是其中之一:它决定每一步用多少数据,上一节的三种梯度下降正差在这上。

9. 什么时候该停

先看现象: 训练轮次(完整扫过训练集的遍数)增加时,训练集上的损失会一直降—— 模型总能把做过的题做得越来越好。但验证集上的误差常常先下降、后上升26

那条验证集曲线的最低点,就是该停的地方。这个做法叫提前停止26: 不再盯着训练集,而是每训一阵子就在验证集上量一次,验证集不再变好就终止。

它实际上是第 7 节那个「复杂度惩罚」的穷人版: 训练越久,模型对训练集的贴合越深、有效复杂度越高; 在过拟合发生之前拔掉电源,等于白捡一份正则化效果。 它的全部成本只是一份验证集和一条纪律:看的是验证集,不是训练集。

10. 主走查:一筐芒果走完全程

输入: 一筐 5 个芒果。特征、标签、参数初值全是我们为演示编的,不是真实数据。

每个芒果记两个特征:颜色 x₁(0=青,1=黄)、大小 x₂(0=小,1=大); 标签是甜度 y(0 到 10 的一个数)。

编号x₁ 颜色x₂ 大小y 甜度
10.80.68
20.90.79
30.30.54
40.20.43
50.60.56

第一步:切三份(零件①)。 1、3、5 号进训练集,2 号进验证集,4 号进测试集——4 号现在就被锁进抽屉,本章不再出现。

第二步:圈一族候选(零件②)。 线性模型 f(x) = w₁·x₁ + w₂·x₂ + b。三个参数,初值全设 0。 此刻它对任何芒果的预测都是 0。

第三步:定损失(零件③)。 平方损失 L = ½(y − f)²,在训练集上取平均。

初值下的训练损失:三条样本的误差是 8、4、6, 损失 = ½×(64 + 16 + 36) ÷ 3 = 19.3

第四步:走一步小批量梯度下降(零件④)。 批量取全部 3 条训练样本,学习率 α = 0.1。 平方损失对 w₁ 的梯度是 −(y − f)·x₁,对 b 是 −(y − f),批量取平均:

w₁ 的梯度 = −(8×0.8 + 4×0.3 + 6×0.6) / 3 = −3.73
w₂ 的梯度 = −(8×0.6 + 4×0.5 + 6×0.5) / 3 = −3.27
b 的梯度 = −(8 + 4 + 6) / 3 = −6.0

更新(参数 −= 学习率 × 梯度):
w₁ = 0 + 0.1×3.73 = 0.37
w₂ = 0 + 0.1×3.27 = 0.33
b = 0 + 0.1×6.0 = 0.6

第五步:看看这一步有没有用。 新参数下,三条训练样本的预测变成 1.09、0.88、0.99(原来全是 0), 训练损失 = ½×((8−1.09)² + (4−0.88)² + (6−0.99)²) ÷ 3 = 13.8

一步把损失从 19.3 压到 13.8。 这个过程重复几百次,参数就挪到位了。

第六步:用验证集决定动不动、停不停(零件①的另一半 + 提前停止)。 验证集 2 号芒果(颜色 0.9、大小 0.7、甜度 9): 预测 = 0.37×0.9 + 0.33×0.7 + 0.6 = 1.16,离 9 还很远——继续训练。

假设又训了几百轮(几百次完整遍历),训练损失降到 0.5,但验证误差从 1.2 回升到 1.5—— 停。 回到验证误差最低时那组参数。

第七步:评价(零件⑤)。 打开抽屉,拿出 4 号芒果,算一次误差,写进报告。 这个数才是「模型会挑芒果了吗」的唯一诚实回答——它是模型从没见过的数据。

回看整条链: 五个零件一个不缺,而且每个零件的决策(切几份、圈哪族、用哪个损失、 一次看几条、什么时候停)都是人做的。机器自动完成的只有「在圈里把参数挪到位」这一段。

11. 作者的判断与证据

书里给了明确论断的:

  • 五个基本要素的划分:数据、模型、学习准则、优化算法、评价指标(衡量好坏的量)1 —— 这是全书的组织框架,第 2.8 节又把它浓缩成「模型—学习准则—优化算法」统一框架27;
  • 0-1 损失「数学性质不是很好:不连续且导数为 0,难以优化」12 —— 这是「训练用替身损失」的正式理由;
  • 随机梯度下降「在非凸优化中常常更容易跳出较差的局部区域」23 —— 书里引了文献支撑收敛性,这句话是它能当标准的原因之一;
  • 小批量梯度下降「已经成为大规模机器学习和深度学习中的主流优化方式」24

书里坦白或留有余地的:

  • 独立同分布假设「在真实场景中并不总是严格成立」,书里点名了时间序列、 领域迁移、分布漂移三种失效情形7;
  • 平方损失「一般不适用于分类问题」,书里只给了结论和一道习题,原因留给了读者13;
  • 对 0-1 损失,书里的措辞是「能够客观地评价模型的好坏,但其缺点是……」—— 评价归评价,训练归训练,两者分得很开。

我们的补充(不是书里的): 主走查里训练误差和验证误差的数值(19.3、13.8、1.16 等) 是为演示编的,只保证算式自洽(前后无矛盾);真实任务的损失曲线不会这么干净。

12. 边界与局限

机器学习按反馈形式分的好几种类型,这一章只讲了监督学习(给标准答案的训练)的主流程。

书里还依次定义了无监督、强化、半监督(少量标注加大量无标注)、自监督、迁移五种28—— 它们各自的完整内容是第 25~30 章,这里一句带过是刻意的。

超参数只点了名,没给办法。 网格搜索、随机搜索、贝叶斯优化 在这一章只是三个名字29,具体怎么搜在第 19 章。

交叉验证只给了做法。 它为什么能在小数据上给出更稳的估计、K 怎么选, 都放到第 07 章和泛化一起讲。

「模型评价」只走了流程。 准确率那一个数有多会骗人,是第 08 章整章的内容。

13. 可带走的

  1. 一次机器学习 = 数据、模型、学习准则、优化算法、评价,五个零件缺一不可;
  2. 数据切三份是纪律,不是习惯: 训练调参数、验证做选择、测试只用一次;
  3. 反复用测试集调参就是数据泄露,分数会乐观得没有底线;
  4. 模型是一族候选函数,学习是在族里挑一个——圈哪一族比怎么挑更根本;
  5. 0-1 损失最直观却没法优化,所以训练用光滑替身、评价才看错误率;
  6. 交叉熵损失只看「分给真实类别的那一份」,它就是负对数似然;
  7. 想要的是期望风险,能算的只有经验风险,这个差是泛化问题的全部;
  8. 两种相反的坏法: 过拟合——背下训练集;欠拟合——还没学会规律;
  9. 三种梯度下降只差「一次看几条样本」,小批量是现代默认;
  10. 提前停止盯的是验证集——训练集上的损失永远会降,它什么也说明不了。

14. 原文地图

主题原书章原文位置
芒果例子与四个基本词第2章 机器学习概述text/03-ch02.txt:41(搜「到市场上购买芒果」) · text/03-ch02.txt:48(搜「一个同时包含特征和标签」)
样本向量(特征向量)第2章 机器学习概述text/03-ch02.txt:53(搜「称为特征向量」)
五个基本要素第2章 机器学习概述text/03-ch02.txt:105(搜「优化算法和评价指标」)
三份数据的分工第2章 机器学习概述text/03-ch02.txt:114(搜「超参数调整以及提前停止」)
数据泄露第2章 机器学习概述text/03-ch02.txt:115(搜「若测试集被反复用于」)
独立同分布第2章 机器学习概述text/03-ch02.txt:119(搜「独立地从相同的数据分布中抽取」)
假设空间第2章 机器学习概述text/03-ch02.txt:135(搜「称为假设空间」)
线性与非线性模型第2章 机器学习概述text/03-ch02.txt:147(搜「参数化的线性函数族」) · text/03-ch02.txt:164(搜「可学习的基函数」)
四种损失函数第2章 机器学习概述text/03-ch02.txt:195(搜「最直观的损失函数」) · text/03-ch02.txt:209(搜「平方损失函数」) · text/03-ch02.txt:264(搜「Hinge 损失函数」)
交叉熵的例子与负对数似然第2章 机器学习概述text/03-ch02.txt:245(搜「则它们的交叉熵为」) · text/03-ch02.txt:262(搜「交叉熵损失函数也就是负」)
期望风险与经验风险第2章 机器学习概述text/03-ch02.txt:180(搜「期望风险」) · text/03-ch02.txt:288(搜「这就是经验风险最小化」)
过拟合与欠拟合第2章 机器学习概述text/03-ch02.txt:296(搜「过度拟合训练数据」) · text/03-ch02.txt:300(搜「模型能力不足造成」)
结构风险最小化第2章 机器学习概述text/03-ch02.txt:307(搜「从而得到结构风险最小化」)
参数与超参数第2章 机器学习概述text/03-ch02.txt:345(搜「这类参数称为超参数」)
三种梯度下降第2章 机器学习概述text/03-ch02.txt:395(搜「称为批量梯度下降法」) · text/03-ch02.txt:397(搜「视为真实梯度的随机近似」) · text/03-ch02.txt:428(搜「是批量梯度下降和随机梯度下降」)
提前停止第2章 机器学习概述text/03-ch02.txt:375(搜「先下降后上升」)
完整流程图第2章 机器学习概述text/03-ch02.txt:580(搜「训练阶段需要用到训练集」)

Footnotes

  1. 出处:「第2章 机器学习概述」第 105 段(text/03-ch02.txt:105,搜「优化算法和评价指标」)。 原文:「机器学习方法可以从以下几个基本要素来描述:数据、模型、学习准则、优化算法和评价指标。」 2

  2. 出处:「第2章 机器学习概述」第 580 段(text/03-ch02.txt:580,搜「训练阶段需要用到训练集」)。 原书图 2.6 把流程分成模型训练阶段与模型评价阶段,本节顶图按它重画。

  3. 出处:「第2章 机器学习概述」第 41 段(text/03-ch02.txt:41,搜「到市场上购买芒果」)。 样本与标签的定义见同章第 48 段(text/03-ch02.txt:48,搜「一个同时包含特征和标签」)。 边注还说明:特征也可以称为属性。 2

  4. 出处:「第2章 机器学习概述」第 53 段(text/03-ch02.txt:53,搜「称为特征向量」)。 原文记作 x = [x₁, x₂, …, x_D],「其中每一维表示一个特征」。 本书改名为样本向量的理由见正文;这是本书的裁决,不是原书的叫法。

  5. 出处:「第2章 机器学习概述」第 114 段(text/03-ch02.txt:114,搜「超参数调整以及提前停止」)。 原文:「训练集中的样本用于学习模型参数;验证集用于模型选择、超参数调整以及提前停止; 测试集仅用于最终评估模型的泛化性能,不参与模型设计过程。」

  6. 出处:「第2章 机器学习概述」第 115 段(text/03-ch02.txt:115,搜「若测试集被反复用于」)。 原文:「若测试集被反复用于调参,就会造成数据泄露(Data Leakage),从而使测试结果过于乐观。」

  7. 出处:「第2章 机器学习概述」第 119 段(text/03-ch02.txt:119,搜「独立地从相同的数据分布中抽取」)。 原文点名的失效情形:「时间序列、领域迁移以及分布漂移等任务往往需要额外处理。」 2

  8. 出处:「第2章 机器学习概述」第 135 段(text/03-ch02.txt:135,搜「称为假设空间」)。 原文同时说明:假设空间通常为一个参数化的函数族 F = {f(x; θ) | θ ∈ ℝ^D}, 「其中 f(x; θ) 是参数为 θ 的函数,也称为模型」。

  9. 出处:「第2章 机器学习概述」第 147 段(text/03-ch02.txt:147,搜「参数化的线性函数族」) 与第 164 段(text/03-ch02.txt:164,搜「可学习的基函数」)。

  10. 出处:「第2章 机器学习概述」第 169 段(text/03-ch02.txt:169,搜「就等价于神经网络模型」)。 原文给出的形式是 φ_k(x) = h(w_k·φ′(x) + b_k),其中 h 为非线性函数、参数可学习。

  11. 出处:「第2章 机器学习概述」第 193 段(text/03-ch02.txt:193,搜「损失函数是一个非负实数函数」)。 四种损失函数的定义分别见同章第 195、209、217、264 段。

  12. 出处:「第2章 机器学习概述」第 208 段(text/03-ch02.txt:208,搜「不连续且导数为」)。 原文:「虽然 0-1 损失函数能够客观地评价模型的好坏,但其缺点是数学性质不是很好: 不连续且导数为 0,难以优化。因此经常用连续可微的损失函数替代。」 2 3

  13. 出处:「第2章 机器学习概述」第 215 段(text/03-ch02.txt:215,搜「平方损失函数一般不适用于分类问题」)。 原文只有这一句结论,原因指向习题 2-3。 2

  14. 出处:「第2章 机器学习概述」第 245 段(text/03-ch02.txt:245,搜「则它们的交叉熵为」)。 原文例子:标签向量 y = [0, 0, 1],预测分布 f(x; θ) = [0.3, 0.3, 0.4], 交叉熵 = −(0×log 0.3 + 0×log 0.3 + 1×log 0.4) = −log(0.4)。

  15. 出处:「第2章 机器学习概述」第 262 段(text/03-ch02.txt:262,搜「交叉熵损失函数也就是负」)。 原文:「因为 y 为 one-hot 向量……交叉熵损失函数也就是负对数似然函数。」

  16. 出处:「第2章 机器学习概述」第 180 段(text/03-ch02.txt:180,搜「期望风险」)。 边注:期望风险也经常称为期望错误。

  17. 出处:「第2章 机器学习概述」第 288 段(text/03-ch02.txt:288,搜「这就是经验风险最小化」)。

  18. 出处:「第2章 机器学习概述」第 291 段(text/03-ch02.txt:291,搜「也可能在未见样本上性能较差」) 与第 299 段(text/03-ch02.txt:299,搜「和过拟合相反的一个概念是欠拟合」)。

  19. 出处:「第2章 机器学习概述」第 296 段(text/03-ch02.txt:296,搜「过度拟合训练数据」)。 定义 2.1 原文:「给定一个假设空间 F,一个假设 f 属于 F,如果存在其他的假设 f′ 也属于 F, 使得在训练集上 f 的损失比 f′ 的损失小,但在整个样本空间上 f′ 的损失比 f 的损失小, 那么就说假设 f 过度拟合训练数据。」

  20. 出处:「第2章 机器学习概述」第 307 段(text/03-ch02.txt:307,搜「从而得到结构风险最小化」)。 原文同时说明:Ω(θ) 用来衡量模型复杂度,λ ≥ 0 为权衡系数; 从贝叶斯学习的角度,这等价于引入参数的先验分布(见第 317 段,搜「从贝叶斯学习的角度来讲」)。

  21. 出处:「第2章 机器学习概述」第 358 段(text/03-ch02.txt:358,搜「向函数值增大最快的方向」)。

  22. 出处:「第2章 机器学习概述」第 395 段(text/03-ch02.txt:395,搜「称为批量梯度下降法」)。 原文:「当训练集规模很大时,这种做法的时间和空间开销都比较高。」

  23. 出处:「第2章 机器学习概述」第 400 段(text/03-ch02.txt:400,搜「单次迭代代价较低」)。 原文:「单次迭代代价较低,并且在非凸优化中常常更容易跳出较差的局部区域。」 同段说明:经过足够次数迭代,随机梯度下降也可以收敛到局部最优解。 2

  24. 出处:「第2章 机器学习概述」第 428 段(text/03-ch02.txt:428,搜「是批量梯度下降和随机梯度下降」) 与第 442 段(text/03-ch02.txt:442,搜「主流优化方式」)。 2 3

  25. 出处:「第2章 机器学习概述」第 431 段(text/03-ch02.txt:431,搜「通常不会设置很大」)。 边注:「K 通常不会设置很大,一般在 1 ∼ 100 之间。在实际应用中为了提高计算效率, 通常设置为 2 的幂。」

  26. 出处:「第2章 机器学习概述」第 375 段(text/03-ch02.txt:375,搜「先下降后上升」)。 原文:「随着训练轮次增加,模型在训练集上的损失通常会持续下降, 但验证集上的误差可能先下降后上升。因此,在验证集性能不再提升时终止训练, 往往可以获得更好的泛化能力。」 2

  27. 出处:「第2章 机器学习概述」第 1302 段(text/03-ch02.txt:1302,搜「模型决定表达能力」)。 原文:「机器学习虽然方法繁多,但大多数方法都可以放在『模型—学习准则—优化算法』 这一统一框架下理解:模型决定表达能力,学习准则定义优化目标,优化算法负责求解参数。」

  28. 出处:「第2章 机器学习概述」第 978 段(text/03-ch02.txt:978,搜「监督学习」) 与第 995 段(text/03-ch02.txt:995,搜「无监督学习」)、第 1000 段(搜「强化学习」)、 第 1009 段(搜「自监督学习」)、第 1014 段(搜「迁移学习」)。

  29. 出处:「第2章 机器学习概述」第 345 段(text/03-ch02.txt:345,搜「这类参数称为超参数」)。 原文列举的超参数:「正则化系数、学习率、网络层数、聚类类别数等」; 常见选择方法见第 348 段(搜「网格搜索、随机搜索」)。