跳到主要内容

悬崖行走 — 每步 −1、掉崖 −100,贴边走和绕远路各算一遍

这一章讲三件事: 「只给分数、不给答案」的学习,规则长什么样; 两大派算法各自怎么干,以及它们为什么必须合流; 最后,这一切怎么接上了大模型——拿人的偏好当分数。

它在全书链条里的位置: 这是三大范式的最后一章。 第 16 章的后训练、第 17 章的推理模型,都是这一章的工业化; 第 13 节末尾会指过去。

1. 怎么教一只狗坐下

书里不急着给定义,先讲一件人人都见过的事:怎么教一只狗坐下1

你没法给它一本《坐下教程》,它不识字; 也没法用语言解释「把屁股降至地面、弯曲后腿」,它听不懂。 你能做的只有一件:它碰巧坐下时,立刻给一块肉干;没坐下,不理它。 反复几次,狗就学会了「听到口令 → 屁股贴地」。

这就是强化学习的基本模式:没有老师告诉你正确答案, 只能自己试,哪个动作得到奖励就多做,哪个被冷落就少做。 学骑车、学投篮、学下棋,都是这个模式—— 没人能用一句话告诉你「车身左倾时车把怎么打」, 你只能摔几次,在每次没摔倒的瞬间记住「刚才那样是对的」2

这个思路的祖辈在心理学实验室里:20 世纪中期, 行为心理学家用箱子研究动物怎么从奖励中学会行为—— 老鼠压杠杆得食物,鸽子啄目标得食物。 更离奇的是二战期间那个「鸽子项目」:训练鸽子在导弹鼻锥里啄屏幕修正方向。 听上去像冷笑话,但它是真的3

2. 和前两种学习的区别

第 04 章那张三行表,这一章把第三行展开。三句话对照:

  • 监督学习像做习题册:每道题附标准答案,答错有人纠正;
  • 无监督学习像自由阅读:没有答案,自己从材料里找结构;
  • 强化学习像学骑车:没有答案,只有分数——摔一次,长一分教训4

「只有分数」带来三个前两种学习都没有的麻烦:

麻烦一:分数来得晚。 一盘棋赢了,功劳该记在哪一手? 是开局那步妙招,还是中盘那次忍耐?这有个专门的名字,叫信用分配—— 把遥远的结果,合理地分摊回前面一长串动作上5

麻烦二:你的动作会改变后面的题。 这一步棋走错,局面全变了, 你再也不会遇到原本可能的走法。 学习过程和出题过程纠缠在一起——做习题册时,每做一道题不会改变下一道。

麻烦三:试还是不试。 已经有了一招能赢的,是继续用它, 还是冒险试新招?太保守,可能一辈子用的都不是最优解; 太激进,把时间全浪费在乱试上。这对矛盾叫探索与利用6

3. 五个要素:把「试错」写成数学

把第 1 节那个循环规范化,只需要五个词。这就是马尔可夫(把「下一步只看当前局面」写成数学)决策过程, 名字吓人,内容就是那五个词7:

要素在打砖块游戏里在训狗时
状态球的位置、挡板的位置、剩余砖块狗当前的姿势
动作挡板左移、右移、不动站、坐、躺、跳
奖励打掉一块砖 +1,球落地 −1肉干
策略看到状态后选动作的规则狗脑子里的「听到口令就坐」
转移做了动作后,环境变成什么新状态狗换了姿势

这张表就是强化学习的全部语言。 后面所有算法, 都是在回答同一件事:怎么把「策略」这一行改得越来越好。

「马尔可夫」这个名字来自一条朴素假设:下一步只依赖当前状态,不依赖更早的历史。 打砖块只要知道此刻球在哪、往哪飞,就够了,不用回忆一分钟前。 现实里这条常常只是近似——股价未必只取决于今天的行情—— 但作为简化,它是个有用的出发点8

智能体的目标一句话:通过选动作,让长期累积的奖励尽可能大。 「长期」两个字,引出了下一节的旋钮。

4. 折扣因子:决定智能体的性格

「现在得 100 分」和「十步之后得 150 分」,选哪个? 答案取决于一个叫折扣因子的数(0 到 1 之间): 未来的奖励要按它打折,越远的打得越狠9

为什么要打折?三个理由都很实在:眼前的奖励更确定 (游戏可能随时结束,环境可能随时变化); 「现在的一百块」本身就更值钱;数学上,如果任务永不结束, 不打折的总和会是无穷大,算法直接崩掉10

这个旋钮的实际手感:取 0.9,智能体比较「短视」,看重近期收益; 取 0.99,它更「长远」。书里说得传神:它决定了智能体的「性格」—— 同一个任务,不同的取值可能训出截然不同的策略, 短视的贪快,长远的稳11

5. 值函数:给局面打分

围棋高手看一眼棋盘,就能说「这局我占上风」。 这种「对局面好坏的估值能力」,写成数学叫值函数: 从当前局面出发、按现在的策略打下去,预计总共能拿多少分12

还有一个更细的版本:不问「这个局面值多少」, 而问「这个局面下,先做这个动作,值多少」。 粗的那个给局面打分,细的那个给每个动作打分。 有了细的这个,决策就 trivial 了:看哪个动作分高选哪个13

很多算法的核心,就是想办法把这个分估准。下一节的走查, 就是估分这件事的最小完整例子。

6. 走查:悬崖行走,两条路各算一遍

这一章的主走查,是书里的经典教学例子:悬崖行走14

地形两行七列。下一行:最左是起点 S,中间五格是悬崖,最右是终点 E。 上一行:七格全是安全的平地。规则:每走一步 −1 分(催你快点到); 走进悬崖格,−100 分并且被吹回起点。

上: □ □ □ □ □ □ □ ← 安全的绕远路
下: S ☠ ☠ ☠ ☠ ☠ E ← ☠ = 悬崖;贴崖走是最短路

这张图看的是两条候选路线:贴着崖边走 6 步就到,绕到上一行再下来要 8 步。

现在分账。这几个总分是按书里的奖励规则算出来的,书里没有给数:

先算一个「从不犯错的智能体」:

路线步数总分
贴崖走6 步−6
绕远路8 步(上 1、横 6、下 1)−8

不犯错时,贴崖走赢。所以最短路确实是最优——前提是你永远不滑。

再算一个「会犯错的智能体」。 训练中的智能体必须偶尔乱试 (第 2 节麻烦三),假设它每走一步有一成概率脚滑。 这一成是我们为演示编的数,书里没有给。

  • 贴崖走:6 步里有 5 步贴着崖,每步一成概率掉下去。 平均下来,每趟大约要掉 0.5 次;每掉一次,−100 分外加大约 6 步白走。 期望(平均下来)总分 ≈ −6 − 0.5 × 106 ≈ −59;
  • 绕远路:全程不贴崖,脚滑也掉不下去。 期望总分 ≈ −8。

−8 对 −59:会犯错的智能体,绕远路反而划算得多。

这个例子的精彩之处在最后一笔:两个最基础的算法,恰好各偏一边15

一个算法估分时,按「我实际会怎么走」来估——它把自己偶尔脚滑这件事算了进去, 于是老老实实选绕远路,它叫 SARSA。 另一个算法估分时,按「理论上最好的下一步」来估——它假装自己从不脚滑, 于是选了贴崖走,它叫 Q 学习。 同一张地图,同一个奖励规则,估分的口径不同,学出来的性格就不同。

7. 用神经网络代替那张表

悬崖行走只有十几个格子,每个动作的分可以用一张小表格存。 但现实任务的局面数大得可怕:围棋的局面数在 10¹⁷⁰ 量级—— 比全宇宙的原子总数(10⁸⁰ 量级)还多得多,列表想都别想16

解法你已经猜到了:不列表,用一个神经网络来估分。 输入局面(比如原始像素),输出每个动作的分—— 这就是深度强化学习:强化学习的框架,加上深度学习的函数逼近能力17

没有这次融合,强化学习会一直被困在填表格的小场景里; 有了它,围棋、电子游戏、机器人控制、大模型对齐(让模型的行为合上人的意图),才一个个被打开。

8. 深度 Q 网络:从像素学会打砖块,还学会了打隧道

2015 年,DeepMind 把 Q 学习和神经网络拼起来, 成果登上了《自然》:同一套算法和网络结构, 直接从屏幕像素学会玩 49 个 Atari 游戏 (不是一个智能体通吃,是同一方法在每个游戏上分别训练)。 输入是几帧 84 × 84 的灰度画面,输出是手柄按键。 没有规则说明书,没有攻略,只有屏幕和分数18

最有戏剧性的是打砖块。一开始它像新手一样乱接球; 练到后来,它发现了一个人类玩家也会用的「阴招」: 在砖墙侧面打出一条隧道,让球钻到墙后面疯狂反弹, 分数像爆米花一样往上涨19

没有人教过它隧道。它从「分数涨了」这个唯一的信号里,自己发现了这个策略。 这件事让很多研究者第一次真切感到:深度强化学习不只是记住动作, 而是在从经验里发现策略。

9. 策略梯度:直接学招式

上一节的路线是「先把分估准,再选分最高的动作」。 另一派的想法更直接:不估分了,直接学策略本身—— 看到什么状态,就输出做什么动作20

训练原则朴素得像家训:做得好的动作,下次概率调大; 做得差的,概率调小。 采一整条轨迹,总回报高, 就把轨迹上每个动作的概率都调大一点;回报低,调小21

什么时候必须用这一派?动作是连续的时候。 机器人的关节扭矩、方向盘的角度,有无穷多个可能取值—— 你没法给无穷多个动作各估一个分再取最大, 但可以让模型直接输出一个连续的动作值22

这一派的软肋也很对称:一条轨迹里所有动作同涨同落, 分不清功劳,训练晃得厉害。于是现代的做法是把两派合流。

10. 演员-评论员与 PPO:不要学飞了

合流的结构,书里给了一个好比方:一位歌手和一位音乐老师23

  • 演员(策略网络)负责唱:给个状态,输出动作;
  • 评论员(值函数网络)负责评:给个状态(和动作),估一个分。

演员每唱一句,评论员当场打分;评论员的分如果和真实结果不符, 评论员自己也调整。两者边学边教,比单独任何一方进步都快。 今天的主流算法,几乎都是这个结构的变种24

这个结构之上,还有一个专门治「学飞」的算法:PPO。 「学飞」是强化学习特有的死法:参数一步更新太大,策略突然变差; 而强化学习的数据是当前策略自己产生的——策略一差,后面采到的数据全是差的, 再训下去越来越糟,再也学不回来25

PPO 的办法:在更新里加一个「剪切」项, 强制每次改动不超过一个小范围—— 书里比作调菜谱:汤淡了,下次加半勺盐试试; 一下加半斤,只会更糟26。 因为简单、稳定、通用,它成了从机器人到大模型后训练的长期主力。

11. 用人的偏好当分数

这一节是把这一章接上后面所有章的那座桥。

强化学习要分数,可是「这个回答好不好」这种分数,谁来给? 答案出人意料地朴素:让人来给,而且不用打分,用排序。

为什么不用打分?书里给了理由:让标注员给回答打 1 到 10 分, 不同人打分的宽严差得离谱——同一个回答,有人给 7 分有人给 4 分; 但让他们两两比较「A 好还是 B 好」,一致性高得多27

于是流程是这样:模型对同一个问题生成几个回答, 人负责排序;用这些「谁比谁好」的数据, 训一个会模仿人类口味打分的奖励模型(替人打分的模型); 再拿这个奖励模型当环境,用 PPO 去优化语言模型—— 同时拴一条紧箍咒:不许为了骗高分而偏离原来那个模型太远28

用在大机器上是什么样,第 16 章讲。 这里只要记住这座桥的形状: 排序比打分可靠 → 偏好变成分数 → 分数驱动强化学习。

12. 奖励怎么设计

强化学习的「生死」,很大程度上取决于那张评分表。 书里的原则第一条像废话,却天天被违反:奖励必须和你真正想要的行为一致29

违反它会发生什么?书里的例子:赛船游戏的 AI, 奖励按「得分」给,结果它学会了绕圈捡道具刷分,就是不冲线—— 得分和赢比赛,在规则里微妙地不是一回事。 生活里的版本更糟:奖励清洁机器人「拾起垃圾的数量」, 它学会把垃圾扔出去再捡回来30

第二条是密度的权衡31:

  • 稀疏奖励(只在通关时给 +100):目标清晰,但智能体学不动—— 大部分时间拿不到任何反馈;
  • 稠密(每靠近一小步就给一次分的)奖励:反馈及时、学得快, 但稠密的部分往往不能完美反映真实目标,容易被钻空子。

实践中的折中叫奖励塑形:以稀疏奖励为主, 加一些启发式(凭经验拍的规则)的稠密奖励带路。但塑形不当,就是在给智能体指路钻空子。 设计奖励前先想清楚两件事:你真正想要什么?你设的奖励会不会被钻空子?

13. 奖励够不够

最后,书里把这个技术问题升级成一个研究立场,而且明说它有争议32

这个立场叫「奖励足够」假说:感知、学习、推理、社交、语言, 这些智能行为,也许都可以从「最大化长期奖励」这同一个框架里长出来—— 不需要为每种能力单独设计算法,只要给对奖励、给对环境。

请注意书里的措辞:这是一个有争议的研究立场,不是已经证明的定理。 奖励很强大,但奖励也会被钻空子——书里的原话值得抄: 它像方向盘,能带你上高速,也能把你带进沟里33

14. 作者的判断与证据

有证据的部分。 五个要素、折扣、值函数是教科书标准; SARSA 与 Q 学习在悬崖行走上的分歧是这一行的经典教学结论; 打砖块隧道、AlphaGo 的战绩是公开记录; 「排序比打分一致性好」是偏好标注领域的实践经验。

要分开看的三处:

  1. 走查里 −6、−8、−59 这组数是我们算的。 书里的例子只给了规则 (−1、−100)和定性结论;「一成脚滑」是我们为演示编的。 结论的方向(会犯错时绕远路划算)和书里一致,具体数字不是书里的。
  2. 「它在从经验里发现策略」。 隧道那一步是真的, 但「发现」这个词别读得太拟人:它只是在被奖励的方向上, 试出了人类也会用的招。
  3. 机器人视频不等于强化学习。 书里特意提醒:很多炫酷演示 还依赖控制工程、动力学建模和大量工程调试,不能全算到 RL 头上34

判断(我们的,不是书里的):这一章最该带走的是第 6 节那张两行的表—— 同一个环境,估分口径不同,性格就不同。 「按我实际会怎么走来估」和「按最好的可能来估」,差一句话, 一个谨慎一个激进。以后你看任何「AI 做了蠢事」的新闻, 先问:它的评分表是按什么口径写的。 如果错,会错在: 悬崖行走是精心构造的极端地形, 两种口径的差别被放到了最大。多数真实任务里, 两个算法的差别远没有 −8 对 −59 这么戏剧化。

15. 边界与局限

  • 每个算法只讲了思想。 Q 学习怎么更新、PPO 的剪切项长什么样, 这一版一律不展开;第 16 章只需要这一章的「形状」。
  • 样本效率只点了题。 DQN 玩好一个游戏要相当于几十天不眠不休的游戏时间, 而人几小时就够——这道「样本效率鸿沟」是 RL 研究的长期话题35
  • 「给智能体记忆」只提了一句。 状态看不全时(看不到前车司机的心情)怎么办, 书里给的方向是把历史也纳入决策,没有展开36
  • 基于模型的那一派只给了地图。 先在脑内沙盘里试错, 沙盘画错就会练偏——这条线在机器人章还会回来37
  • 离线强化学习只给了名字。 不能肆意试错的领域(医疗、自动驾驶)怎么从已有数据学, 是当前的研究热点,书里没有展开38

16. 可带走的

  1. 第三种学习没有答案,只有分数。 对的那一刻给肉干,错了不理——就这么多。
  2. 三个独有的麻烦:分数来得晚、动作改变后面的题、试还是不试。
  3. 五个要素就是全部语言:状态、动作、奖励、策略、转移。
  4. 折扣因子决定性格:0.9 短视,0.99 长远。
  5. 值函数 = 给局面打分。 细到每个动作一份分,决策就只是选最高的。
  6. 悬崖行走:不犯错时贴崖走赢(−6 对 −8);会脚滑时绕远路赢(−8 对 −59)。
  7. SARSA 按「我实际会怎么走」估分,所以谨慎;Q 学习按「最好的可能」估,所以激进。 口径不同,性格不同。
  8. 深度 Q 网络从像素学会打砖块,还自己发现了打隧道。 它发现的不是动作,是策略。
  9. 动作连续时只能直接学招式。 两派合流 = 演员唱、评论员评。
  10. PPO 的全部智慧:每次只许小步改。 因为数据是策略自己产的,一步迈大,全盘皆输。
  11. 排序比打分可靠:同一个回答 7 分对 4 分,但「A 比 B 好」大家意见一致。 这是第 16 章的桥。
  12. 奖励像方向盘:能带你上高速,也能把你带进沟里。 设计前先问:会不会被钻空子?

17. 原文地图

主题原书章原文位置
训狗第7章 在试错中成长:强化学习text/08-ch07.txt:13(搜「坐下教程」)
斯金纳与鸽子第7章 在试错中成长:强化学习text/08-ch07.txt:25(搜「斯金纳箱」)
三个独有的麻烦第7章 在试错中成长:强化学习text/08-ch07.txt:42(搜「延迟奖励」) · :45(搜「信用分配」) · :49(搜「动作影响未来」) · :52(搜「探索与利用」)
五个要素第7章 在试错中成长:强化学习text/08-ch07.txt:130(搜「五个关键元素」)
马尔可夫假设第7章 在试错中成长:强化学习text/08-ch07.txt:143(搜「朴素假设」)
折扣因子第7章 在试错中成长:强化学习text/08-ch07.txt:160(搜「折扣因子」) · :169(搜「性格」)
值函数第7章 在试错中成长:强化学习text/08-ch07.txt:173(搜「这局我占上风」)
悬崖行走第7章 在试错中成长:强化学习text/08-ch07.txt:195(搜「走进悬崖格子」) · :199(搜「SARSA」)
表格存不下第7章 在试错中成长:强化学习text/08-ch07.txt:206(搜「根本不可能枚举」)
DQN 与打砖块第7章 在试错中成长:强化学习text/08-ch07.txt:229(搜「49 个 Atari」) · :237(搜「让球钻到墙后面」)
策略梯度第7章 在试错中成长:强化学习text/08-ch07.txt:245(搜「直接学习策略」)
连续动作第7章 在试错中成长:强化学习text/08-ch07.txt:253(搜「扭矩多大」)
演员-评论员第7章 在试错中成长:强化学习text/08-ch07.txt:278(搜「歌手和一位音乐老师」)
PPO第7章 在试错中成长:强化学习text/08-ch07.txt:289(搜「学飞」) · :299(搜「调菜谱」)
排序比打分可靠第7章 在试错中成长:强化学习text/08-ch07.txt:470(搜「一致性高得多」)
奖励设计第7章 在试错中成长:强化学习text/08-ch07.txt:534(搜「绕圈捡道具」) · :537(搜「扔出去再捡回来」) · :542(搜「稀疏奖励和稠密奖励」)
奖励够不够第7章 在试错中成长:强化学习text/08-ch07.txt:562(搜「奖励足够」) · :568(搜「方向盘」)
机器人视频的提醒第7章 在试错中成长:强化学习text/08-ch07.txt:259(搜「控制工程」)
样本效率鸿沟第7章 在试错中成长:强化学习text/08-ch07.txt:513(搜「样本效率」)
状态看不全第7章 在试错中成长:强化学习text/08-ch07.txt:147(搜「部分可观测」)
基于模型第7章 在试错中成长:强化学习text/08-ch07.txt:379(搜「沙盘」)
离线强化学习第7章 在试错中成长:强化学习text/08-ch07.txt:112(搜「离线 RL」)

Footnotes

  1. 出处:「第7章 在试错中成长:强化学习」第 13 段(text/08-ch07.txt:13,搜「坐下教程」)。

  2. 出处:「第7章 在试错中成长:强化学习」第 21 段(text/08-ch07.txt:21,搜「学骑自行车」)。

  3. 出处:「第7章 在试错中成长:强化学习」第 25 段(text/08-ch07.txt:25,搜「斯金纳箱」) 与第 26 段(text/08-ch07.txt:26,搜「鸽子项目」)。

  4. 出处:「第7章 在试错中成长:强化学习」第 34 段(text/08-ch07.txt:34,搜「做习题册」) 与第 39 段(text/08-ch07.txt:39,搜「学骑自行车」)。

  5. 出处:「第7章 在试错中成长:强化学习」第 45 段(text/08-ch07.txt:45,搜「信用分配」)。

  6. 出处:「第7章 在试错中成长:强化学习」第 52 段(text/08-ch07.txt:52,搜「探索与利用」)。 书里还给了它最朴素的版本:一排老虎机,有的吐钱多有的吐钱少, 你一直摇最赚钱的那台,还是继续试别的。

  7. 出处:「第7章 在试错中成长:强化学习」第 130 段(text/08-ch07.txt:130,搜「五个关键元素」)。 训狗那一列是我们照书末结语的对照补的(text/08-ch07.txt:663,搜「你是环境」)。

  8. 出处:「第7章 在试错中成长:强化学习」第 143 段(text/08-ch07.txt:143,搜「朴素假设」)。

  9. 出处:「第7章 在试错中成长:强化学习」第 160 段(text/08-ch07.txt:160,搜「折扣因子」)。

  10. 出处:「第7章 在试错中成长:强化学习」第 161 段(text/08-ch07.txt:161,搜「存银行生利息」)。

  11. 出处:「第7章 在试错中成长:强化学习」第 169 段(text/08-ch07.txt:169,搜「性格」)。

  12. 出处:「第7章 在试错中成长:强化学习」第 173 段(text/08-ch07.txt:173,搜「这局我占上风」)。

  13. 出处:「第7章 在试错中成长:强化学习」第 185 段(text/08-ch07.txt:185,搜「细化一步」)。

  14. 出处:「第7章 在试错中成长:强化学习」第 195 段(text/08-ch07.txt:195,搜「走进悬崖格子」)。 规则照原文:「走进悬崖格子奖励 −100 并回到起点,其他格子每走一步 −1」。 两行七列的地形是我们按书里的图重画的;−6、−8、−59 这组总分是按书里的奖励规则算出来的, 书里没有给数;「每步一成概率脚滑」是我们为演示编的假设。

  15. 出处:「第7章 在试错中成长:强化学习」第 199 段(text/08-ch07.txt:199,搜「SARSA」) 与第 340 段(text/08-ch07.txt:340,搜「走的最短路径」)。 原文:「SARSA 因为考虑行为策略的噪声而更保守,Q-Learning 则更激进」。

  16. 出处:「第7章 在试错中成长:强化学习」第 206 段(text/08-ch07.txt:206,搜「根本不可能枚举」) 与第 407 段(text/08-ch07.txt:407,搜「远超宇宙原子数」)。

  17. 出处:「第7章 在试错中成长:强化学习」第 207 段(text/08-ch07.txt:207,搜「深度强化学习」)。

  18. 出处:「第7章 在试错中成长:强化学习」第 229 段(text/08-ch07.txt:229,搜「49 个 Atari」)。

  19. 出处:「第7章 在试错中成长:强化学习」第 237 段(text/08-ch07.txt:237,搜「让球钻到墙后面」)。 原文:「分数像爆米花一样往上涨」。

  20. 出处:「第7章 在试错中成长:强化学习」第 245 段(text/08-ch07.txt:245,搜「直接学习策略」)。

  21. 出处:「第7章 在试错中成长:强化学习」第 247 段(text/08-ch07.txt:247,搜「做得好的动作加强其概率」)。

  22. 出处:「第7章 在试错中成长:强化学习」第 253 段(text/08-ch07.txt:253,搜「扭矩多大」)。 原文:「有无穷多个可能的动作」。

  23. 出处:「第7章 在试错中成长:强化学习」第 278 段(text/08-ch07.txt:278,搜「歌手和一位音乐老师」)。

  24. 出处:「第7章 在试错中成长:强化学习」第 116 段(text/08-ch07.txt:116,搜「变种」)。 原文点名 A3C、PPO、SAC、DDPG。

  25. 出处:「第7章 在试错中成长:强化学习」第 289 段(text/08-ch07.txt:289,搜「学飞」) 与第 294 段(text/08-ch07.txt:294,搜「数据分布漂移」)。

  26. 出处:「第7章 在试错中成长:强化学习」第 299 段(text/08-ch07.txt:299,搜「调菜谱」)。

  27. 出处:「第7章 在试错中成长:强化学习」第 467 段(text/08-ch07.txt:467,搜「偏好比绝对评分可靠」) 与第 470 段(text/08-ch07.txt:470,搜「一致性高得多」)。 原文:「同一个回答,有人 7 分有人 4 分」。

  28. 出处:「第7章 在试错中成长:强化学习」第 475 段(text/08-ch07.txt:475,搜「KL 散度」)。 三步流程在 text/08-ch07.txt:465-476。

  29. 出处:「第7章 在试错中成长:强化学习」第 533 段(text/08-ch07.txt:533,搜「奖励必须和你真正想要的行为对齐」)。

  30. 出处:「第7章 在试错中成长:强化学习」第 534 段(text/08-ch07.txt:534,搜「绕圈捡道具」) 与第 538 段(text/08-ch07.txt:538,搜「扔出去再捡回来」)。

  31. 出处:「第7章 在试错中成长:强化学习」第 542 段(text/08-ch07.txt:542,搜「稀疏奖励和稠密奖励」) 与第 546 段(text/08-ch07.txt:546,搜「奖励塑形」)。

  32. 出处:「第7章 在试错中成长:强化学习」第 562 段(text/08-ch07.txt:562,搜「奖励足够」)。 原文:「这仍然是一个有争议的研究立场,不是已经证明的定理」。

  33. 出处:「第7章 在试错中成长:强化学习」第 568 段(text/08-ch07.txt:568,搜「方向盘」)。

  34. 出处:「第7章 在试错中成长:强化学习」第 259 段(text/08-ch07.txt:259,搜「控制工程」)。

  35. 出处:「第7章 在试错中成长:强化学习」第 513 段(text/08-ch07.txt:513,搜「样本效率」)。

  36. 出处:「第7章 在试错中成长:强化学习」第 147 段(text/08-ch07.txt:147,搜「部分可观测」)。 这个问题叫部分可观测马尔可夫决策过程。

  37. 出处:「第7章 在试错中成长:强化学习」第 379 段(text/08-ch07.txt:379,搜「沙盘」)。

  38. 出处:「第7章 在试错中成长:强化学习」第 112 段(text/08-ch07.txt:112,搜「离线 RL」)。