跳到主要内容

一次试错怎么变成学习 — 强化学习是什么

这一章讲三件事: 机器学习(让程序从数据里自己找规律)的三条路各靠什么信号学习;强化学习(下面简称 RL) 从哪两个源头继承来这套做法;以及「从 RL 到深度强化学习」这一步跨的是什么。 读完你会拿到一个能判断「这个任务该用哪条路」的判据,后面十三章都在这条判据上往下走。 不需要任何基础,遇到的生词都在当场解释。

1. 先看现象:同一间屋子,两种教法

设想一个 2×2 的房间,扫地机器人在左下角,充电桩在右上角,任务是学会走过去充电1

教法一(监督学习): 你给每个格子预先写上「正确的一步」。左下格标「向右」, 左上格标「向下」……四个格子各标一个动作,机器照着背。 它学到的是你写下的答案,你标错一格,它就错一辈子。

教法二(强化学习): 你什么都不标。只定两条规矩:撞墙 −1 分,到达充电桩 +10 分。 然后放开手让它自己撞。撞几次之后,「向右」这个动作留下的分数比「向上」高, 它自己就知道该往右走。

2×2 房间(这些分数是为演示编的,不是书里的数值)

┌─────────┬─────────┐
│ 左上 │ 右上 ★ │ ★ = 充电桩,到达 +10
│ 「向右」 │ 「到达」 │
├─────────┼─────────┤
│ 起点 ○ │ 右下 │ 撞墙 −1,走一步 −0.1(耗电)
│ 「向右」 │ 「向左」 │
└─────────┴─────────┘

教法一:你要预先填满这张「格子 → 动作」的表。
教法二:你只给 +10 和 −1,表是它自己撞出来的。

这张小房间就是本章的主走查,后面每一节都回到它: 第 2 节用它分清三条学习路线,第 3 节用它看 RL 的两个源头,第 4 节用它看「表格装不下」怎么办。

2. 顶层全景:三条路,一个判据

书里把机器学习(让程序从数据里自己找规律的一类方法)分成三种公认的方法,名字你在任何地方都会撞见2:

方法学习信号回到扫地机器人
监督学习有人预先写好答案的「输入 → 正确答案」对四个格子各标一个动作
无监督学习(连答案都不给)没有任何答案,只有数据本身连任务都不给,只让它看一整年的房间布局,自己发现「这个角有插座」
强化学习没有正确答案,只有事后的分数撞墙 −1,充电 +10

判据一句话:「正确答案」这一栏,是有、是没有、还是只有分数?

  • 答案有 → 监督(比如识别手写数字:每张图配一个人工标的数字);
  • 答案没有 → 无监督(比如把新闻自动分组);
  • 只有分数 → 强化(比如下棋:没有「这一步的正确走法」,但输赢看得见)。

扫地机器人这个任务,「正确的一步」其实写得出来(房间就这么大)——所以它用监督也行。 RL 真正的主场是那些「正确答案写不出来、好坏却看得见」的任务:下棋、开车、调仓、 给病人调药量。这也是全书选任务的标准,第 14 章的应用全部符合它。

3. 核心原理:这套做法的两个源头,和一步分界

3.1 源头一:1911 年的效果律——「有好结果的动作会被重复」

RL 的心理学这一半,来自 Thorndike 1911 年基于动物实验提出的「效果律」(Law of Effect): 一个动物会重复带来满意结果的动作,回避带来不适的动作;而且学习靠的是选择—— 先把几种可能的动作都试过,再留下效果好的那种3

1927 年,巴甫洛夫给「强化」下了定义:一个行为模式,因为动物在时间上紧挨着的另一个刺激下 收到了「强化物」,而被巩固下来4

回到扫地机器人:它撞墙(不适)之后减少「向上」,充上电(满意)之后巩固「向右」—— 机器没有继承任何新数学,继承的正是这条 1911 年的原则。

3.2 源头二:最优控制——「别只看这一步,要看整条路」

数学这一半来自 20 世纪的最优控制理论。Richard Bellman 从中推出一个方程(后来叫贝尔曼方程), 它能在动态系统的一串状态上算出一个「最优价值」;他还定义了马尔可夫决策过程—— 最优控制问题的离散随机版本5

这里出现了 RL 与前两条路在时间结构上的根本差别:监督学习的判分是即时的 (这张图是 7,标错了立刻知道);RL 的分数常常隔着很多步才到—— 扫地机器人真正的 +10 要走完两步才拿到,下棋的输赢要下完整盘才知道。 「怎么把终点的大分数,公平地分给路上每一步」,这是全书的中心难题, 第 4 章的贝尔曼方程和第 6 章的时序差分都是为它生的。

3.3 一步分界:奖励表装不下之后

书里给 RL 与「深度」RL 画了一条很干净的分界线,值得原样讲清楚6:

  • 纯 RL: 奖励直接放在一张表里,查表即得。但表可能复杂到没法用, 而且很多「状态-动作」组合根本没被访问过——表上那一格是空的;
  • DRL(深度强化学习):神经网络(把一层层简单的计算单元(收到信号、算一下、再传出去)堆起来、内部带着大量可调数的函数)去隐式地近似这份奖励——于是没见过的局面也能给出估计

回到主走查。房间从 2×2 扩成真实的住宅:格子数几万个,每个格子里机器人还有电量、朝向、 脚下是地毯还是瓷砖……格子-动作表会有几亿行,而且绝大多数行永远不会被走到。 而神经网络学到的不是每一行,是一个「从局面算分数」的函数: 新格子、新房子,它照样能算出一个像样的分数。

这一步跨过去,「深度」两个字才出现:深度学习就是层数更多的神经网络7

书里给它的定义是「在输入的方面多到数不清的空间里近似任意函数的方法」7

3.4 这套做法的战绩:棋盘是一块试验田

书里按时间列了一条战绩线,每一步都在加码同一件事——动作空间更大、答案更写不出来8:

年份加了什么码
1952Samuel 的跳棋程序第一个「自己跟自己下、从输赢里学」的机器
1992Tesauro 的西洋双陆棋网络神经网络 + 自博弈,追平人类顶尖棋手
1997深蓝胜国际象棋世界冠军靠暴力搜索:每秒 2 亿步再挑最好的一步
2016AlphaGo 胜围棋冠军神经网络 + RL,局面数大到暴力搜索失效

注意深蓝和 AlphaGo 的对照:国际象棋每步的候选局面前后差着几十个数量级, 围棋大到「每秒 2 亿步」这条路彻底失效,只能换学习——这正是 RL 从配角转正的时刻。

4. 作者的判断与证据

  • 书里给证据的: RL 与其他范式的差别(无监督者、反馈延迟、时序决策、 反馈受环境不确定性影响)是作者开宗明义的四条要点,第 3 章会逐一数学化9; 「表会太复杂、访问不到的组合上表是空的」这是作者明说的 DRL 动机6
  • 书里的时间线来自英国皇家学会的报告,作者注明了出处8
  • 作者的推测,书里也标明了: 关于大脑与人工网络的差距,他给了一组对照—— 人脑约 860 亿个神经元、100 万亿个突触、功耗不到 20 瓦; 而书里说人工网络的「神经元」数量级在 100 到 1000 之间、功耗约 200 瓦,还发热10。 并由此判断:架构和方法还需要大改进,网络才能和大脑相比。

5. 边界与局限

  • 书里那组「100–1000 个神经元」的对照已经过时。 现代大网络的参数(网络里那些可调的数)以十亿计(书自己的时间线就列到了 2023 年的最新模型),拿它去对照 20 瓦功耗的人脑,差距叙述要重算。补充(不在书里,来自通用知识):「神经元数」和参数量(参数的个数)也不是一回事,一个「神经元」内部就有成百上千个参数,作者在这里把两个口径混着用了。
  • 两处史实错误,照实指出: 书里写 2023 年那台叫 GPT-4 的最新模型「由微软发布」11—— GPT-4 是 OpenAI 的模型,微软是它的主要投资方与合作方,不是发布方; 书里写 AlphaGo 「五局中赢四局,战胜中国围棋大师」12—— 那 4:1 的对手李世石是韩国棋手;对中国的柯洁,AlphaGo 的战绩是 3:0。
  • 这一章(以及原书第 1、2 章)只给「是什么」,不给「怎么算」。 三种方法的机制细节、RL 的数学骨架,分别留给第 02、03 章。
  • 伦理与安全:书里坦白「道德与伦理如何从一开头就编进程序,仍不清楚」13, 并在尾声警告 RL 可被用于害人的用途、防范需要全社会努力14——这是作者的立场声明,没有给出方案。

6. 可带走的

  1. 三条学习路线,判据一条:「正确答案」是有、是没有、还是只有事后分数;
  2. RL = 没人告诉正确动作,只有奖励信号,智能体(英文写作 agent——同一个东西)靠试错最大化累计分数;
  3. RL 的两个源头:效果律(满意的行为被重复,1911)+ 最优控制(整条路径的总分要最大化,Bellman);
  4. RL 区别于监督学习的两条硬特征:反馈延迟(分数隔着很多步才到)和没有监督者(没人告诉下一步该做什么)9;
  5. 「深度」出现的那一步 = 奖励表换神经网络——换来的不是省内存,是对没见过的局面也能给估计;
  6. 棋类战绩线的读法:任务越写不出正确答案,学习越不可替代——深蓝赢棋靠每秒 2 亿步的搜索,围棋这条路走不通了;
  7. 任务选型口诀:答案写得出来用监督,答案写不出来但好坏看得见用强化;
  8. 读这本书要自带校对:史实类细节(GPT-4 出品方、AlphaGo 对手)有错,机制类讲解大体可靠。

7. 原文地图

主题原书章原文位置
RL 三特征、无监督者3.1 A Mathematical Model of DRLtext/07-ch03-01-3-1-a-mathematical-model-of-drl.txt:31(搜「no supervisor」) · text/07-ch03-01-3-1-a-mathematical-model-of-drl.txt:36(搜「delayed」)
三种学习范式1.1 Artificial Intelligence (AI)text/05-ch01-01-1-1-artificial-intelligence-ai.txt:74(搜「Supervised Learning」) · text/05-ch01-01-1-1-artificial-intelligence-ai.txt:84(搜「cumulative reward」)
效果律、巴甫洛夫2.1 Learning from Problemstext/06-ch02-01-2-1-learning-from-problems.txt:776(搜「Law of Effect」) · text/06-ch02-01-2-1-learning-from-problems.txt:784(搜「Pavlov」)
贝尔曼方程与 MDP 的来历2.1 Learning from Problemstext/06-ch02-01-2-1-learning-from-problems.txt:793(搜「Bellman equation」)
奖励表 vs 神经网络近似2.1 Learning from Problemstext/06-ch02-01-2-1-learning-from-problems.txt:827(搜「unable to visit」) · text/06-ch02-01-2-1-learning-from-problems.txt:832(搜「function approximation」)
深度学习的定义2.1 Learning from Problemstext/06-ch02-01-2-1-learning-from-problems.txt:20(搜「high-dimensional feature space」)
棋类时间线1.1 Artificial Intelligence (AI)text/05-ch01-01-1-1-artificial-intelligence-ai.txt:276(搜「checkers」) · text/05-ch01-01-1-1-artificial-intelligence-ai.txt:314(搜「200 million」) · text/05-ch01-01-1-1-artificial-intelligence-ai.txt:333(搜「AlphaGo」)
大脑与 ANN 的对照1.1 Artificial Intelligence (AI)text/05-ch01-01-1-1-artificial-intelligence-ai.txt:375(搜「86 billion」)
GPT-4「微软发布」(有误)1.1 Artificial Intelligence (AI)text/05-ch01-01-1-1-artificial-intelligence-ai.txt:362(搜「Microsoft」)
伦理不清白的坦白1.1 Artificial Intelligence (AI)text/05-ch01-01-1-1-artificial-intelligence-ai.txt:395(搜「moral and ethical」)

Footnotes

  1. 任务场景是我们为演示编的;书里 RL 任务的一般形态见「2.1 Learning from Problems」第 821 段(text/06-ch02-01-2-1-learning-from-problems.txt:821,搜「given a task」):系统有多个状态,每个状态下智能体可以采取多种可能动作,选择使「奖励」最大化的那个。

  2. 出处:「1.1 Artificial Intelligence (AI)」第 68 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:68,搜「most recognized ML methods」)。监督/无监督/半监督/强化四条的定义见第 74–84 段。

  3. 出处:「2.1 Learning from Problems」第 776 段(text/06-ch02-01-2-1-learning-from-problems.txt:776,搜「Law of Effect」)。原文:动物会重复满意的动作、回避不适的动作,学习用「选择」在观察过各选项的效果后定下最终行动。

  4. 出处:「2.1 Learning from Problems」第 784 段(text/06-ch02-01-2-1-learning-from-problems.txt:784,搜「Pavlov」)。原文对「强化」的界定:行为模式因「强化物」在时间依赖关系中被巩固。

  5. 出处:「2.1 Learning from Problems」第 793 段(text/06-ch02-01-2-1-learning-from-problems.txt:793,搜「Markov decision process」)。贝尔曼方程的正式定义与用法在第 03 章展开。

  6. 出处:「2.1 Learning from Problems」第 827–832 段(text/06-ch02-01-2-1-learning-from-problems.txt:827,搜「unable to visit」与第 832 段「function approximation」)。原文:RL 的奖励放在表里;表可能过于复杂,许多状态-动作对智能体无法访问;DRL 用神经网络隐式近似奖励,没遇到过的情形也能用。 2

  7. 出处:「2.1 Learning from Problems」第 20 段(text/06-ch02-01-2-1-learning-from-problems.txt:20,搜「high-dimensional feature space」)。深度学习被定义为在大量独立特征对应的高维空间里用神经网络近似任意函数的方法。 2

  8. 出处:「1.1 Artificial Intelligence (AI)」第 243 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:243,搜「Royal Society」)。跳棋(1952)、深蓝每秒 2 亿步(1997)、AlphaGo(2016)分别见第 276、314、333 段。深蓝与 AlphaGo 的数量级对照是补充(不在书里,来自通用知识):国际象棋分支因子约 35,围棋约 250,合法局面数超过 10 的 170 次方。 2

  9. 出处:「3.1 A Mathematical Model of DRL」第 31–46 段(text/07-ch03-01-3-1-a-mathematical-model-of-drl.txt:31,搜「no supervisor」)。四条:无监督者、反馈延迟(无反馈的即时行动可能酿成事故)、决策时序相连、反馈取决于自身动作与环境不确定性。 2

  10. 出处:「1.1 Artificial Intelligence (AI)」第 375 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:375,搜「86 billion」)。原文给的 ANN 神经元量级是 100–1000,功耗约 200 瓦;参数量与神经元数的口径区分是补充(不在书里,来自通用知识)。

  11. 出处:「1.1 Artificial Intelligence (AI)」第 362 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:362,搜「Microsoft」)。原文:「GPT-4 was released by Microsoft (2023)」。GPT-4 由 OpenAI 发布是补充(不在书里,来自通用知识)。

  12. 出处:「1.1 Artificial Intelligence (AI)」第 333 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:333,搜「AlphaGo」)。原文:「won four out of five games against Chinese master of Go game」。李世石为韩国棋手、对柯洁 3:0,是补充(不在书里,来自通用知识)。

  13. 出处:「1.1 Artificial Intelligence (AI)」第 395 段(text/05-ch01-01-1-1-artificial-intelligence-ai.txt:395,搜「moral and ethical」)。

  14. 出处:「Epilogue」第 17 段(text/26-fm-epilogue.txt:17,搜「unsavory ends」)。