一次试错怎么变成学习 — 强化学习是什么
这一章讲三件事: 机器学习(让程序从数据里自己找规律)的三条路各靠什么信号学习;强化学习(下面简称 RL) 从哪两个源头继承来这套做法;以及「从 RL 到深度强化学习」这一步跨的是什么。 读完你会拿到一个能判断「这个任务该用哪条路」的判据,后面十三章都在这条判据上往下走。 不需要任何基础,遇到的生词都在当场解释。
1. 先看现象:同一间屋子,两种教法
设想一个 2×2 的房间,扫地机器人在左下角,充电桩在右上角,任务是学会走过去充电1。
教法一(监督学习): 你给每个格子预先写上「正确的一步」。左下格标「向右」, 左上格标「向下」……四个格子各标一个动作,机器照着背。 它学到的是你写下的答案,你标错一格,它就错一辈子。
教法二(强化学习): 你什么都不标。只定两条规矩:撞墙 −1 分,到达充电桩 +10 分。 然后放开手让它自己撞。撞几次之后,「向右」这个动作留下的分数比「向上」高, 它自己就知道该往右走。
2×2 房间(这些分数是为演示编的,不是书里的数值)
┌─────────┬─────────┐
│ 左上 │ 右上 ★ │ ★ = 充电桩,到达 +10
│ 「向右」 │ 「到达」 │
├─────────┼─────────┤
│ 起点 ○ │ 右下 │ 撞墙 −1,走一步 −0.1(耗电)
│ 「向右」 │ 「向左」 │
└─────────┴─────────┘
教法一:你要预先填满这张「格子 → 动作」的表。
教法二:你只给 +10 和 −1,表是它自己撞出来的。
这张小房间就是本章的主走查,后面每一节都回到它: 第 2 节用它分清三条学习路线,第 3 节用它看 RL 的两个源头,第 4 节用它看「表格装不下」怎么办。
2. 顶层全景:三条路,一个判据
书里把机器学习(让程序从数据里自己找规律的一类方法)分成三种公认的方法,名字你在任何地方都会撞见2:
| 方法 | 学习信号 | 回到扫地机器人 |
|---|---|---|
| 监督学习 | 有人预先写好答案的「输入 → 正确答案」对 | 四个格子各标一个动作 |
| 无监督学习(连答案都不给) | 没有任何答案,只有数据本身 | 连任务都不给,只让它看一整年的房间布局,自己发现「这个角有插座」 |
| 强化学习 | 没有正确答案,只有事后的分数 | 撞墙 −1,充电 +10 |
判据一句话:「正确答案」这一栏,是有、是没有、还是只有分数?
- 答案有 → 监督(比如识别手写数字:每张图配一个人工标的数字);
- 答案没有 → 无监督(比如把新闻自动分组);
- 只有分数 → 强化(比如下棋:没有「这一步的正确走法」,但输赢看得见)。
扫地机器人这个任务,「正确的一步」其实写得出来(房间就这么大)——所以它用监督也行。 RL 真正的主场是那些「正确答案写不出来、好坏却看得见」的任务:下棋、开车、调仓、 给病人调药量。这也是全书选任务的标准,第 14 章的应用全部符合它。