让机器自己找规律
这一章讲三件事: 「机器学习」这三个字具体指哪三个动作; 那把量「答得有多差」的尺子为什么非得长成那样(书推了三版,每一版都是被上一版逼出来的); 以及 —— 第 05 章那组硬塞进去的权重,真的被学出来是什么样子。 它在全书链条里的位置是第 5 级台阶: 有了会算的单元,现在问它的那些数从哪儿来。 遇到的生词都在当场解释。
1. 顶层全景
一堆已知答案的例子:(x₁,y₁) (x₂,y₂) … (xₙ,yₙ)
│
│ ① 选一类候选答案 「我打算用一条直线来拟合」
▼ —— 定下了候选的范围,还没定是哪一条
一大堆候选函数
│
│ ② 定一把尺子 「离正确答案差多远,给我一个数」
▼
每一条候选都有了一个分数
│
│ ③ 找分数最低的那一条 「蒙着眼往下坡挪,挪到不能再低」
▼
一组具体的参数 —— 学完了
图说:书就是这么分的三步。第 ③ 步书说是「最重要也是最困难的」。
这一章第 3 节讲 ②,第 4 节讲 ③,第 6 节把这三步在一个真例子上跑一遍。
本章主走查: 直道上采到的一批路径中心点 (x, y)。 我们会在同一组点上把三版尺子各量一遍,再用「往下坡挪」走三步, 每一步都写出两个参数和分数的具体数值。 另有一处副走查在第 6 节: 把第 05 章那四个点的权重真的训出来。
2. 「机器学习」到底指哪三个动作
先看现象:它和「写程序」有什么不同
平常写程序,规则是你定的:「电压小于 10 就报警」。 机器学习是反过来的:你给一堆例子,让它自己把规则试出来。
书给的定义是:计算机通过对数据、事实或自身经验的自动分析和综合来获取知识; 基于样本数据建立数学模型,在没有特定算法的情况下做出预测或决策1。
三个动作,一步都不能少
书把它拆成三步,而且每一步都给了一个精确的说法2:
| 步 | 干什么 | 书的原话值得记 |
|---|---|---|
| ① 选模型 | 划定一堆候选答案的范围 | 「模型就是一组函数的集合」 |
| ② 判好坏 | 定一把尺子,量「答得有多差」 | 这把尺子叫损失函数 |
| ③ 找最好的 | 在候选里找那把尺子读数最小的 | 书说这一步「最重要也是最困难的」 |
第 ① 步最容易被误解: 「选模型」不是选一个具体的答案, 是选一整类答案。 说「我用一条直线来拟合」,就是把候选限定在了「所有直线」这个范围里; 到底是哪一条直线,要等 ② 和 ③ 走完才知道。
① 选模型:所有的直线 ② 定尺子:每条线得一个分
y = θ₀ + θ₁x 分低 = 离那些点近
θ₀ 和 θ₁ 还没定 分高 = 离得远
│ │
└──────────┬───────────────────┘
▼
③ 找分最低的那一条:θ₀ = 0.49,θ₁ = 1.88
图说:①划范围,②定标准,③搜索。三步缺一件事都不成立。
这两个数是第 6 节走查的真实结果,不是随手写的。
一个必须提前说清的目标:不 是「答对训练题」
书的定义很明确:机器学习的目标是让学到的函数**「能够很好地适用于新样本, 而非仅仅只是在训练样本上面表现良好」,这种能力叫泛化能力**3。
这句话贯穿全书后面每一章。 第 03 章那个「切一份数据出来不给它看」是为了它; 第 11 章的 Dropout 是为了它;第 13 章那个「训到 400 轮反而更差」的教训, 根子也是它。
3. 给任何任务归位:两个轴
这一节是一张地图。有了它,你能给这本书后面每个任务找到位置。
轴一:按任务类型分
书列了三大常见类型,外加三种4:
| 类型 | 要产出什么 | 例子 |
|---|---|---|
| 回归 | 一个连续的数 | 这张图对应的转角是多少 |
| 分类 | 一个类别 | 这张图里有没有斑马线 |
| 聚类 | 把没有标签的样本自己分成几堆 | 把采到的数据自动分成几种路况 |
| 降维 | 用少几个数表示原来很多个数 | —— |
| 密度估计 | 从样本反推它们的分布 | —— |
| 排序学习 | 学一个打分函数用来排序 | 搜索结果排序 |
轴二:按有没有标签分
| 方式 | 数据长什么样 | 干什么 |
|---|---|---|
| 有监督学习 | 输入和正确答案都给 | 发现两者之间的关系,再拿去预测新数据5 |
| 无监督学习 | 只有输入,没有答案 | 让机器自己发现里面的模式或结构 |
| 半监督学习 | 一部分有答案,大部分没有 | 见下 |
半监督为什么成立,书给了理由,而且这个理由很漂亮: 它建立在一个基本规律上 ——「数据的分布必然不会是完全随机的」; 所以可以用少量有标签数据的局部特征,结合大量无标签数据的整体分布,找出隐藏的规律6。
书还顺带说了它为什么有市场:没有标签的数据量通常远大于有标签的。
这本书两个任务各在哪一格
| 任务 | 哪一格 |
|---|---|
| 自动巡航(吐一个 −1 到 1 的数) | 有监督 + 回归 |
| 目标检测(框出位置 + 说出类别) | 有监督 + 分类,外加定位 |
注意巡航那一格: 它的标签是「开出来的」(第 05 章讲过), 所以它是有监督的 —— 只是标注这件事被「开车」这个动作顺手做掉了。
4. 那把尺子:书推了三版,每一版都是被上一版逼出来的
这是本章第一个承重点,也是全书写得最漂亮的一段推理。