跳到主要内容

强化学习为什么输了

1. 这一章讲什么

三件事: 一套和前面完全不同的训练设定——没有标准答案,只有事后打分; 这套设定的四个基本词和两大类算法(以及那个最当红的算法为什么存在); 以及它和可微物理在同一个任务、同样规模上的正面对决,结果是三项全输。

它在全书链条里的位置:这是全书唯一的对照组,不在那三档里,也不在那两把刀上。 第 10 章讲长程控制时提过一句「这个设定说明强化学习也是一个可能的选项」—— 这一章就是把那个选项真的试了一遍。

2. 顶层全景

前面所有章节的训练设定 这一章的训练设定

给一道题 + 一个标准答案 给一个环境,允许你反复动手
看答得差多远 → 往差得少的方向挪 一整条跑完之后 → 给一个总分
「哪一步做对了」没人告诉你

┌────────────── 同一个任务:控制一维流体 ──────────────┐
│ │
│ 可微物理那边 强化学习这边 │
│ 损失的梯度穿过每一个仿真步 环境是没有梯度的黑箱 │
│ 一路传回之前的时间步 另训一个网络去猜 │
│ │ │ │
│ ▼ ▼ │
│ 「我现在这一下,十步后 价值网络预测 │
│ 会造成什么」是算出来的 「这么做大概能得多少分」│
└──────────────────────────────────────────────────────┘


三项对比:视觉质量 · 施加的力有多大 · 收敛要多久


三项全输,而力那一项才是真正的指标

这张图在讲什么: 上半是设定的差别,中间是那条最本质的分界(长期依赖谁来管), 下半是对决的三个维度。 注意中间那一栏:两边解的是同一个问题,差别只在「未来的后果怎么被知道」。

3. 换一套设定(一):没有标准答案,只有事后打分

结论先行:这一章之前每一次训练都有一份「正确输出」摆在那儿。这里没有。

拿第 10 章那个控制任务改写一遍,四个词就都有了具体所指:

你面前是一段流体。每走一个时间步,你可以往流场里施加一个力。 但没有人告诉你这一步该施多大——没有标准答案。 一整条跑完之后,才给你一个分数:力用得多不多、末状态离目标近不近。

这套设定里的四个词,书列在开头1:

在这个任务里指什么
状态当前那一整片流场(准确说是你能观测到的那部分)
动作你这一步施加的那个力
环境接收动作、把流场往前推一步、再回给你新状态和一个分数的那整套东西
智能体做决定的那一方,也就是我们要训的网络

最后那个词要留一下英文名,因为你出门到处都会撞见它:智能体的英文是 agent。 这个词现在还有另一个更流行的用法(指会自己调工具、自己规划步骤的那类程序), 但它最早就是从这里来的——「在一个环境里反复动手、按分数调整行为的那一方」。

书还点明了「分数」是怎么来的:它由一个事先定好的函数给出, 通常是为这个环境量身定做的——可能是游戏得分、做错事的惩罚,或者完成任务的赏金1

读法:分数完全是设计者定的。这一点后面第 7 节会变成一个具体的设计。

4. 换一套设定(二):目标是一整条,不是一步

结论先行:要最大化的不是某一步的分数,是整条路上所有分数的总和。

书给的学习目标一句话:让「一整条轨迹上所有分数加起来」的期望最大1(「期望」就是「平均而言」——因为每次跑出来的轨迹不一样,只能看多跑几次的平均。)

轨迹 = 从头到尾那一串「状态-动作」。

为什么这个区别要紧:因为它允许「现在故意少拿一点」。 如果只看当前这一步,你会每一步都挑分最高的动作; 而看整条,你可能愿意这一步少拿几分,好换到一个后面能拿更多分的位置。

这也正是这类任务难的地方:一个动作的好坏,要很久以后才看得出来。 书管这件事叫长期依赖,而它是这一章全部争论的焦点。

5. 两大类算法

结论先行:所有做法可以粗分成两类,差别在「要不要先学会评估」。

书的分法2:

类别网络学的是什么怎么训
策略梯度直接学一个「看到这个状态就输出这个动作」的函数提高那些「导致后半条轨迹回报更高」的动作的概率,降低回报低的
值函数方法学一个打分函数:给一个状态和一个动作,预测「从这儿往后平均能拿多少分」选动作时挑打分最高的那个

「策略」这个词在这里就是那个函数本身:状态进去,动作出来。 书用的形式稍精确一点:它返回的是各个动作的概率,而且同时取决于状态和网络参数。

然后是两者的合体2:

actor-critic:策略网络产生的动作,由另一个网络来打分。 一个负责动(actor),一个负责估分(critic)。

这一章用的算法属于这一类,它叫 PPO——全称是 proximal policy optimization, 直译「近端策略优化」;「近端」说的就是下一节那个「不许离上一版太远」的限制。

6. PPO 为什么存在

结论先行:它不是为了更强,是为了不崩。

书把病因讲得很清楚,而且这一段是理解 actor-critic 的关键3:

actor 的目标本质上依赖 critic 的输出(是 critic 告诉它哪些动作值得做), 而 critic 又依赖 actor 生成的动作(是 actor 决定了要去探索哪些状态)。

这种相互依赖会促成不稳定。书举了具体的样子: 被严重高估或者低估的状态值,会在学习时给出错误的冲量; 而回报更高的动作,往往也有助于到达信息价值更高的状态。

结果是:当个别样本那个(可能是错的)价值估计,被允许不受限制地影响智能体的行为时, 学习进展可能会崩掉。

PPO 就是为了对抗这一件事被提出来的: 限制单个状态的价值估计,能对 actor 的行为造成多大改变3

具体动作:留一份「上一轮的网络」,把「新策略和旧策略给同一个动作的概率之比」 夹在一个小区间里——比值超出去就不再让它继续推动更新4

书还给了它流行的理由:在连续动作空间上尤其常用, 因为它往往能在学习过程稳定的同时拿到好结果,而且相对好实现3

critic 那一边训什么:一个「从这个状态起,预期总共能拿多少分」的函数; 它的目标是让「优势」的平方最小。 优势的意思是:按当前策略做出的这个决定,比随便乱做好多少5书用的估计方式会把未来各步的偏差按一个折扣一路累加起来, 而那两个折扣系数控制的正是「多遥远的未来还算数」。

7. 奖励的设计:它和可微物理那边的损失几乎一一对应

结论先行:这一节是全章最能说明「两条路在做同一件事」的地方。

书给的奖励由两部分组成6:

部分什么时候给是什么
每一步都给每个时间步施加的那个力的负平方 —— 力越大扣得越多
只在末尾给轨迹的最后一步末状态离目标状态的负平方距离

把它和第 10 章那边的损失并排看:

可微物理那边强化学习这边
惩罚用力过猛损失里的力的平方项每步的负平方力
惩罚没到位末状态和目标的平方误差末尾那一笔

一模一样的两项,一边写成损失(越小越好),一边写成奖励(越大越好)。 所以这场对决比的不是「目标定得对不对」,是「同一个目标,谁学得更好」。

8. 最本质的分界:长期依赖由谁来管

结论先行:这一节是整章的题眼,一句话就能记住。

书的原话7:

在带可微物理损失的控制力估计器设置里,长期依赖是靠 「把损失的梯度穿过仿真步、传回之前的时间步」来处理的。 与之相反,强化学习通常把环境当成一个没有梯度信息的黑箱。 用 PPO 时,是由那个价值估计网络来追踪长期依赖—— 靠预测任何一个动作对未来系统演化的影响。

摊开成两句话:

「我现在这一下,十步之后会造成什么」这件事怎么知道
可微物理算出来的。 梯度真的穿过了那十个仿真步
强化学习猜出来的。 另训一个网络去预测

这就是「免模型」三个字的含义: 它不需要、也不使用那个物理模型本身,只把环境当成一个能给反馈的黑盒子。 (这里的「模型」按全书的约定指物理方程,不指网络。)

还有一处差别书也点了:PPO 靠给 actor 选出的动作加一个随机偏移来探索, 这样才能发现比之前更精细的新行为模式7换句话说,它靠试。

9. 主走查:同一个 Burgers 控制任务

主走查第 1 步(任务与规模,和可微物理那边完全一样): 一维的 Burgers 方程当作物理环境——32 个格子、黏性 0.003、32 个时间步、 每步 dt = 0.03;造 1000 个 case,其中 100 个验证、100 个测试、800 个训练8任务:预测在两个给定状态之间产生一段平滑过渡所需要的力。

主走查第 2 步(一条轨迹是怎么生成的): 每一步 = 网络看着当前速度场和目标,给出一个力 → 把这个力加到速度场上 → 让求解器推一步 → 得到新状态。反复 32 次7注意这里网络直接输出力本身,不是「若干个离散动作的概率」——因为动作空间是连续的。

主走查第 3 步(两个网络长得不一样): actor 用的是第 10 章那个执行器网络的同款 U-Net 变体; critic 是一串一维卷积加池化(池化就是把相邻几个数合成一个,尺寸随之减半), 把特征图一路缩到一个值,最后用一个卷积把各通道合成一个输出9

主走查第 4 步(训练配置): 10 个环境并行跑;每次 rollout 每个环境收集 32 × 10 = 320 步; 每次更新做 10 轮,学习率 1e-4,批大小 12810

主走查第 5 步(训练要多久,这一步本身就是结论的一半): 书用的是一个已经训过 3500 次迭代的预训练智能体, 在这个例子里只再微调 500 次; 这 500 次大约要 2 小时,所以从头训将近 18 小时11书自己说:太长了,不适合交互式的试验。

主走查第 6 步(结果一:视觉质量): 训好的智能体能相当好地重建轨迹,但「明显不如真值那么光滑」12; 而可微物理那一版重建得同样贴近,并且「看起来比强化学习那版噪声更少」13

主走查第 7 步(结果二:力有多大——这才是主要指标): 可微物理学会施加略低的力14在「预测的力 对 真值的力」那张散点图上,可微物理那些点总体上更贴近对角线, 也就是它学到的力更接近真值。

主走查第 8 步(结果三:收敛速度): 可微物理显著更快,墙钟时间和训练迭代数两个口径都是15。 (「墙钟时间」就是挂钟上真实流逝的时间,区别于「跑了多少步」。)

主走查第 9 步(书的最终裁决): PPO 施加的力更高,所以它给出的解质量略逊; 而且它收敛所需的时间显著更长,两个口径都是16

10. 为什么「力有多大」才是对的指标

这一节单列,因为它是这场对决在方法论上最讲究的一处。

书给的理由14:

这个任务用「在最后一个时间步施加一个巨大的力」就能平凡地解决。 因此理想的解会考虑 PDE 的动力学,尽量少施加力。 所以这个指标非常好地度量了网络对底层物理环境学到了多少。

摊开讲这个论证为什么漂亮: 如果比「离目标多近」,两边都能作弊——最后一脚猛踹就到了。 而「用了多少力」量的恰恰是「你有没有顺着物理本来的走向去引导它」。 书也说了两边在「到达目标的程度」上打平,所以力才成为主要的比较量。

这条思路可以搬走:当一个任务存在平凡解时,不要拿「达成度」当指标, 要拿「达成它付出了什么」当指标。

11. 书给的解释,以及公平的另一面

书对「为什么输」给的解释15:

不感知物理的强化学习训练,和紧耦合了求解器的可微物理之间, 主要区别在于后者带来显著更快的收敛。 也就是说,数值求解器提供的梯度给出的学习信号, 比强化学习那种无方向的探索好得多。

书还把强化学习这一侧的原因拆成两条: 训练数据是同策略收集的,以及这类技术那种「暴力」的探索方式。

「同策略」得当场讲清,它是这一条的关键: 每换一版策略,之前收集的经验就作废了,必须拿新策略重新去环境里采一批数据。 所以它不能像监督训练那样反复利用一个固定的数据集。

补充(不在书里):这条性质有一个更一般的说法—— 策略梯度这一系样本效率低,因为它的血统是「用整局回报去估梯度」,数据贵的时候吃亏17

但书也公平地给了强化学习一个优势,这一条不能漏18:

强化学习算法不像可微物理那样受训练集大小的限制, 因为新的训练样本是同策略生成的。 然而这也在训练时引入了额外的仿真开销。

再加一条书没有并列写、但贯穿全章的:强化学习根本不要求仿真器可微。 这是它真正的适用场景——当你手上那个仿真器是一个不给源码的商业软件、 或者它内部根本没法求导时,可微物理那条路直接不通。

12. 主走查合起来看

发生了什么具体的数
1任务Burgers 控制:32 格、黏性 0.003、32 步、dt = 0.03
2数据1000 个 case:800 训练 / 100 验证 / 100 测试(和可微物理那边同规模)
3一条轨迹网络给一个力 → 加到速度场上 → 求解器推一步,重复 32 次
4奖励每步 −‖力‖²;末尾再加 −‖末状态 − 目标‖²
5两个网络actor 是第 10 章那个执行器的同款 U-Net;critic 是卷积加池化缩到一个值
6训练配置10 个并行环境、每次收 320 步、每次更新 10 轮、学习率 1e-4、批 128
7训练时长预训练 3500 次迭代 + 微调 500 次(约 2 小时);从头约 18 小时
8结果一轨迹重建得不错,但明显不如真值光滑;可微物理那版噪声更少
9结果二可微物理施加的力略低;散点图上它更贴近对角线
10结果三可微物理收敛显著更快,墙钟时间和迭代数两个口径都是
11裁决三项全输;而「力有多大」才是主要指标,因为末尾猛踹一脚能平凡地解掉这题

每个数都是书里给的(逐条见脚注); 书没有给两边的力的具体数值,只给了柱状图和散点图。

13. 作者的判断与证据

书里给了证据的:

说法证据
可微物理施加的力更低一张三根柱子的对比图(强化学习 / 可微物理 / 真值)14
可微物理学到的力更接近真值散点图上它的点更贴近对角线14
可微物理收敛更快一张按墙钟时间画的训练曲线15
强化学习那边训练很慢500 次迭代约 2 小时,从头约 18 小时11
「力有多大」是对的指标一段论证:任务能被「末尾猛踹一脚」平凡解掉14

作者的判断:

说法为什么算判断
「数值求解器的梯度比无方向的探索好得多」一句归因,而且被比的双方框架、实现都不同15
把慢归因于「同策略」和「暴力探索」没有做消融(比如换一个离策略的算法再比一次)15
「两边在到达目标的程度上打平」书没有给这一项的数字,只有一句话14
「视觉上更噪」靠看图,没有量化指标1213
被比的双方都出自同一个组这一条全书通用,总纲第 1 节已经点明

判断(我们的,不是书里的): 这场对决的结论要连着适用条件一起记, 否则很容易被读成「强化学习不行」。 它真正证明的是:当你手上有一个可微的仿真器时,别把它当黑箱用。 梯度是已经躺在那儿的信息,不用白不用;而强化学习是在假装那个信息不存在。 如果错,会错在: 如果换一个梯度本身很糟糕的物理系统 (第 19 章会讲:接近奇异的雅可比会让梯度失真), 那么「有梯度」不等于「梯度有用」,这场对决的结论就不能外推。 判据是:把仿真器的梯度打印出来,它的量级在不同方向上差几个数量级? 差得太多的话,那个梯度可能还不如乱试。

14. 边界与局限

  • 只比了一个任务、一个分辨率。 书自己在「下一步」里把 「换分辨率再比」「换环境参数看泛化」列成了读者练习,没有做19;
  • 只比了一个强化学习算法。 换成别的算法会不会好一些,书没有试;
  • 两边的实现来自不同的框架(一边是通用的强化学习库,一边是可微 PDE 求解器), 而书自己在别处说过「跨实现的运行时比较要打折扣」——这里没有重复这句提醒;
  • 强化学习那边用了预训练的智能体,而可微物理那边的训练曲线是从头的; 书没有说明这个不对称对「收敛更快」这个结论有多大影响;
  • 没有给任何一项的具体数值。 力的大小、到达目标的程度,全是图,正文没有报数;
  • 强化学习的那条优势(不受训练集大小限制)只有一句话,没有实验;
  • 「不要求仿真器可微」这条最实际的优势,书没有单列, 而这恰恰是强化学习在工程里真正的适用场合;
  • 这一章的可微物理版本被简化过:它去掉了第 10 章那个预测器网络, 只做直接控制20所以严格说,被比的不是第 10 章那个完整方案。

15. 可带走的

  1. 这一章的设定和前面所有章节都不同:没有标准答案,只有一整条跑完之后的事后打分;
  2. 四个词各有所指: 会变的那个流场是状态,你每步能做的那件事是动作, 接收动作把流场往前推一步再回给你新状态的那整套东西是环境, 从头到尾那一串「状态-动作」是轨迹;
  3. 要最大化的是整条轨迹上所有分数的总和,所以「现在故意少拿一点」是合理的;
  4. 两大类算法:直接学策略(不评估),或者先学一个打分函数(值函数); 两者接起来就是 actor-critic;
  5. PPO 存在的理由不是更强,是不崩: actor 依赖 critic 的评分, critic 又依赖 actor 探出来的状态,这种相互依赖会让学习进展崩掉;
  6. 它的做法是限制单个状态的价值估计能对行为造成多大改变 ——把新旧策略的概率之比夹在一个小区间里;
  7. 奖励完全是设计者定的,而这里的设计和可微物理那边的损失几乎一一对应: 每步扣力的平方,末尾扣离目标的距离;
  8. 最本质的分界是长期依赖由谁来管: 可微物理出来(梯度穿过仿真步),强化学习出来(价值网络预测);
  9. 「免模型」就是不用物理方程本身,只把环境当成能给反馈的黑盒子;
  10. 比的指标要挑对:这个任务能被「末尾猛踹一脚」平凡解掉, 所以比「达成度」没意义,要比「用了多少力」;
  11. 结果三项全输: 视觉上更噪、施加的力更大、收敛显著更慢(墙钟和迭代数都是);
  12. 书给的原因:数值求解器提供的梯度,比无方向的探索给出好得多的学习信号;
  13. 同策略意味着换一版策略就得重采一批数据,老经验作废——这是它慢的一部分原因;
  14. 但它有两条真优势:样本现生成、不受训练集大小限制; 而且它根本不要求仿真器可微。

16. 原文地图

主题原书章原文位置
环境与智能体、状态与奖励、学习目标34 Introduction to Reinforcement Learningtext/18-p341-360.txt:308(搜「The environment receives actions」) · text/18-p341-360.txt:323(搜「neural network policy」)
两大类算法与 actor-critic34.1 Algorithmstext/18-p341-360.txt:330(搜「vanilla policy gradient methods」) · text/18-p341-360.txt:335(搜「actor-critic methods combine」)
PPO 为什么存在34.2 Proximal policy optimizationtext/18-p341-360.txt:344(搜「inherently depends on the output of the critic」) · text/18-p341-360.txt:351(搜「specifically counteract this problem」)
裁剪的具体做法34.2.1 PPO-cliptext/18-p341-360.txt:358(搜「sets a hard limit」) · text/18-p341-360.txt:370(搜「clip(」)
critic 与优势34.2.3 Critic and advantagetext/18-p341-360.txt:384(搜「predicts the expected cumulative reward」) · text/18-p341-360.txt:391(搜「Generalized Advantage」)
探索靠加随机偏移34.3 Application to inverse problemstext/18-p341-360.txt:411(搜「random offset to the actions」)
长期依赖由谁来管(全章题眼)34.3 同上text/18-p341-360.txt:415(搜「long term effects」) · text/18-p341-360.txt:418(搜「black box without」)
轨迹怎么生成、奖励怎么设计34.3 同上text/18-p341-360.txt:422(搜「simulation steps of the environment」) · text/18-p341-360.txt:430(搜「negative square norm of the applied forces」)
「免模型能不能匹敌基于模型的」35.1text/18-p341-360.txt:501(搜「does not have access to a differentiable physics solver」) · text/18-p341-360.txt:504(搜「model-free」)
任务规模、1000 个 case 的划分35.3 Data generationtext/18-p341-360.txt:532(搜「The remaining 800 are used for training」) · text/18-p341-360.txt:534(搜「VISCOSITY = 0.003」)
训练超参35.4text/18-p341-360.txt:587(搜「N_ENVS = 10」) · text/18-p341-360.txt:598(搜「RL_BATCH_SIZE = 128」)
两个网络的架构35.4 同上text/18-p341-360.txt:640(搜「two different neural network architectures」)
预训练 3500 次、微调 500 次、约 18 小时35.4 同上text/18-p341-360.txt:647(搜「trained for 3500 iterations」)
强化学习的重建「不够光滑」35.5 RL evaluationtext/19-p361-380.txt:53(搜「reconstruct the trajectories」)
可微物理那版噪声更少35.6 Differentiable physics trainingtext/19-p361-380.txt:257(搜「less」)
为什么「力有多大」才是对的指标35.7 Comparison between RL and DPtext/19-p361-380.txt:264(搜「trivially solved」)
可微物理施加的力更低、点更贴对角线35.7.2text/19-p361-380.txt:339(搜「slightly lower forces」) · text/19-p361-380.txt:356(搜「closer to the diagonal」)
收敛更快、同策略与暴力探索35.8 Training progress comparisontext/19-p361-380.txt:381(搜「significantly faster convergence」) · text/19-p361-380.txt:383(搜「on-policy」)
最终裁决35.8 同上text/19-p361-380.txt:405(搜「exerts higher forces」)
书自己列的「下一步」35.9 Next stepstext/19-p361-380.txt:412(搜「different resolution」)

Footnotes

  1. 出处:第 34 章开头(p.341)第 308 段 (text/18-p341-360.txt:308,搜「The environment receives actions」) 与第 323 段(text/18-p341-360.txt:323,搜「neural network policy」)。 学习目标那个式子在第 319 段;原文明说奖励由一个事先定好的函数给出, 通常是为环境量身定做的。 「轨迹 = 从头到尾那一串状态-动作」这个说法是我们的写法; 书直接用 trajectory 这个词,没有单独下定义。 2 3

  2. 出处:第 34.1 节 Algorithms(p.341–342)第 330 段 (text/18-p341-360.txt:330,搜「vanilla policy gradient methods」) 与第 335 段(text/18-p341-360.txt:335,搜「actor-critic methods combine」)。 书把值函数方法的代表写作 Q-Learning,把这一章用的算法写作 PPO。 2

  3. 出处:第 34.2 节 Proximal policy optimization(p.342)第 344 段 (text/18-p341-360.txt:344,搜「inherently depends on the output of the critic」) 与第 351 段(text/18-p341-360.txt:351,搜「specifically counteract this problem」)。 原文还说 PPO 在连续动作空间上尤其常用,因为它往往能在学习过程稳定的同时拿到好结果, 而且相对好实现。 2 3

  4. 出处:第 34.2.1 节 PPO-clip(p.342–343)第 358 段 (text/18-p341-360.txt:358,搜「sets a hard limit」) 与第 370 段(text/18-p341-360.txt:370,搜「clip(」)。 被夹住的是「新策略和旧策略给同一个动作的概率之比」。

  5. 出处:第 34.2.3 节 Critic and advantage(p.343)第 384 段 (text/18-p341-360.txt:384,搜「predicts the expected cumulative reward」) 与第 391 段(text/18-p341-360.txt:391,搜「Generalized Advantage」)。 书说那两个折扣系数控制「多遥远的未来的奖励和状态价值预测,还对优势的计算有影响」, 通常取小于 1 的值。

  6. 出处:第 34.3 节(p.344)第 430 段 (text/18-p341-360.txt:430,搜「negative square norm of the applied forces」)。 奖励的式子在第 433–437 段。

  7. 出处:第 34.3 节 Application to inverse problems(p.343–344)第 411 段 (text/18-p341-360.txt:411,搜「random offset to the actions」)、 第 415 段(text/18-p341-360.txt:415,搜「long term effects」) 与第 418 段(text/18-p341-360.txt:418,搜「black box without」)。 轨迹生成的式子在第 421–424 段; 原文明说因为动作空间连续,策略网络直接算出一个力,而不是一组离散动作的概率。 2 3

  8. 出处:第 35.3 节 Data generation(p.347)第 532 段 (text/18-p341-360.txt:532,搜「The remaining 800 are used for training」) 与第 534 段(text/18-p341-360.txt:534,搜「VISCOSITY = 0.003」)。 代码里 STEP_COUNT = 32DT = 0.03SCENE_COUNT = 1000

  9. 出处:第 35.4 节(p.349)第 640 段 (text/18-p341-360.txt:640,搜「two different neural network architectures」)。 actor 用的 U-Net 变体和第 10 章那个执行器网络出自同一篇工作。

  10. 出处:第 35.4 节(p.348)第 587 段(text/18-p341-360.txt:587,搜「N_ENVS = 10」) 与第 598 段(text/18-p341-360.txt:598,搜「RL_BATCH_SIZE = 128」)。 每次 rollout 每个环境收集的步数在代码里写作「时间步数 × 10」,也就是 320 步。

  11. 出处:第 35.4 节(p.349)第 647 段 (text/18-p341-360.txt:647,搜「trained for 3500 iterations」)。 原文:这 500 次微调通常要约 2 小时,所以将近 18 小时的总训练时间对交互式试验来说太长了。 2

  12. 出处:第 35.5 节 RL evaluation(p.351)第 53 段 (text/19-p361-380.txt:53,搜「reconstruct the trajectories」)。 2

  13. 出处:第 35.6 节 Differentiable physics training(p.355)第 257 段 (text/19-p361-380.txt:257,搜「less」)。 2

  14. 出处:第 35.7 节 Comparison between RL and DP(p.356)第 264 段 (text/19-p361-380.txt:264,搜「trivially solved」)、 第 339 段(text/19-p361-380.txt:339,搜「slightly lower forces」) 与第 356 段(text/19-p361-380.txt:356,搜「closer to the diagonal」)。 书只给了柱状图和散点图,正文没有报出任何一边的力的具体数值。 2 3 4 5 6

  15. 出处:第 35.8 节 Training progress comparison(p.359–360)第 381 段 (text/19-p361-380.txt:381,搜「significantly faster convergence」) 与第 383 段(text/19-p361-380.txt:383,搜「on-policy」)。 2 3 4 5

  16. 出处:第 35.8 节(p.360)第 405 段(text/19-p361-380.txt:405,搜「exerts higher forces」)。

  17. 补充(不在书里,依据我们的 ai-book-reference 书架): 依据: shelf=ai-book-reference/reinforcement-learning-sutton-barto#13-policy-gradient.md 事实=策略梯度方法样本效率低,因为它的血统是蒙特卡洛式的「用整局回报去估梯度」,数据贵的时候吃亏。 书把慢归因于「同策略」和「暴力探索」,但没有解释这两件事为什么导致样本效率低,这条由我们补上。

  18. 出处:第 35.8 节(p.360)第 407 段附近 (text/19-p361-380.txt:407,搜「training iterations」)。 书在这一部分同时指出强化学习不受训练集大小限制,因为样本是同策略生成的, 但这也在训练时引入了额外的仿真开销。

  19. 出处:第 35.9 节 Next steps(p.360)第 412 段 (text/19-p361-380.txt:412,搜「different resolution」)。 书列的三条读者练习是:换超参、换分辨率、换环境参数看泛化。

  20. 出处:第 35.6 节(p.351)第 59 段 (text/19-p361-380.txt:59,搜「second OP」)。 原文明说这里瞄准的是「直接控制」,省掉了第 10 章那个单独的预测器网络。