跳到主要内容

策略这条线 — 直接优化策略,以及它的方差

这一章讲三件事: 为什么必须换一条线; 「奖励高的动作以后多做一点」怎么变成一个能求导的式子; 以及这条线天生的毛病(估计飘得厉害)有哪两个不花钱的解法。

它在全书链条里的位置:第二条主线的起点。 第 07 章那条线做到头了,而它接不了连续动作。这一章换一条路,而换路之后又是一串新的补丁。 这一章治「飘」,第 09 章治「步子多大算合适」。

顶层全景:Pong 上一条 20 步的轨迹,三行权重

这一章从头到尾用同一条轨迹:乒乓球游戏里连着打了 20 步,期间赢了两分。

我们要做的事只有一件:给这 20 步里的每一个动作,定一个「该被鼓励多少」的权重。 同一条轨迹,三种写法算出三行权重 —— 三行并排,这一章要讲的全部内容就在里面。

一条 20 步的轨迹:第 8 步赢了一分(+1),第 20 步又赢了一分(+1),其余各步都是 0。
整条轨迹的回报 = 2。

写法一(最朴素): 每一步的权重都等于整条轨迹的回报
第 1~20 步: +2 +2 +2 …… +2 +2
★ 连开局那几步「球还在对面、你怎么动都一样」的动作,也被同等鼓励。★

写法二(砍掉动作之前的奖励): 每一步只算它自己之后拿到的分
第 1~8 步: +2 (后面还有两分)
第 9~20 步: +1 (只剩最后那一分)
★ 第 8 步之前那一分,和第 15 步的动作毫无关系 —— 不该算在它头上。★

写法三(再减去一个基准): 减掉「站在这个局面上,本来就该拿到多少」
第 1~8 步: +2 − 1.5 = **+0.5**
第 9~20 步: +1 − 1.3 = **−0.3** ← ★ 变成负数了 ★
★ 这一整条轨迹明明赢了两分,后半段的动作却被压低 ——
因为在那个局面上本来就该拿 1.3 分,而实际只拿了 1 分。★

图说:这就是本章的主走查。第 4 节推出写法一,第 6 节推出写法二和写法三的前半,
第 7 节说明写法三减掉的那个数是什么,第 8 节把它换成一个学出来的估计。
(Pong 的 ±1 设定是书里的;20 步、两分的位置、1.5 与 1.3 这两个基准值
**全部是为演示编的**,不是真实数值。)

1. 为什么必须换一条线

这一节回答:第 07 章那套已经很能打了,为什么还要重来?

先看现象

第 07 章那条线的最后一步永远是:把每个动作都算一遍分,挑分最高的那个。

现在把游戏换成开车。方向盘该打多少度?

−30 度、−29.9 度、−29.99 度…… 可能的角度有无穷多个。「每个都算一遍」当场破产。

书里给的三条理由

书里在这一章开头列了直接学策略的三个好处1:

好处说明
不需要在动作空间里求解「哪个动作价值最大」这个优化问题★ 所以适合连续的动作,也适合一次要定很多个数的动作(这一行管后者叫高维) ★
可以很自然地对随机策略建模价值那条线要额外造一个探索策略(比如 ε-贪心)才能有随机1
利用了梯度的信息来引导优化,所以有更好的收敛性保证但书里在脚注里当场限定:一般也仅限于局部收敛,不是全局1

注意第三条那个脚注 —— 书里没有把话说满,我们也不该说满。

换成什么

不再学「每个动作值多少」,而是直接学一个函数:输入局面,输出「该怎么做」。 这个函数用神经网络来表示,书里管这种策略叫参数化策略2

2. 策略输出的不是一个动作,是一组机会

这一节讲这条线的第一个具体形状。

三种分布,对应三种动作空间

书里列了三种常见的写法3:

动作长什么样用哪种分布网络实际输出什么
只有「是 / 否」两种伯努利分布一个数:选「是」的机会
有限的几个动作(上 / 下 / 左 / 右)类别分布每个动作一个数,加起来等于 1
★ 连续的(方向盘角度、每块肌肉的力度)对角高斯(下面解释)分布一组平均值 + 一组「上下大约浮动多少」

第三行才是这条线存在的理由。 它输出的不是一个角度,而是**「大概打多少度,上下浮动多少」**; 真正的动作是从这个范围里随机抽出来的。

那个「大概是多少」叫平均值,那个「上下浮动多少」有个正式的名字叫标准差

而「给一个平均值和一个标准差,按中间高两边低的钟形去抽」这种随机方式,数学上就叫高斯分布 (也叫正态分布)。

书里对「对角」两个字给了准确的说明: 动作有好几个分量时,一般的高斯分布要一整张表来记 「各分量之间怎么牵连」, 而对角的只需要一排数 —— 代价是它假定动作的各个分量之间互不相关4

类别分布那一行还有一个实现细节值得记: 因为所有机会加起来必须是 1, 参数化时最后一层常用 softmax3 —— 就是第 05 章第 4 节那个。

随机不是妥协,是能力

第 02 章第 6 节证过一次:面对会针对你的对手,确定性的策略必输。

这条线天生输出的就是一组机会,所以它天生带随机。 而第 07 章那条线只能靠外挂一个 ε-贪心来凑随机 —— 书里在脚注里正是这么说的1

3. 一个技巧:随机采样出来的动作,怎么求导

这一节讲一个到第 10 章和第 20 章都会回来的技巧。

先看现象:一个很实在的麻烦

你要用梯度去调网络。可中间有一步是「从这个分布里随机抽一个动作」—— 「抽签」这个动作没法求导。

书里把这件事说得很准:没有其他技巧时,有采样过程或者取最大这类操作的随机节点 往往是不可微的,从而在用基于梯度的优化时可能有问题5

做法:把随机挪到外面去

书里给的技巧叫再参数化6:

原来: 动作 ← 从「均值 μ、标准差 σ」这个分布里抽一个 ← 抽签在中间,断了
改成: 先从一个**固定的**标准分布里抽一个数 z(和网络无关)
动作 = μ + σ × z ← 抽签挪到了外面

★ 现在从「动作」往回看,μ 和 σ 都是乘加运算,一路可导。★
z 是随机的,但它不含任何要学的参数,梯度不必穿过它。

离散动作那边有一个对应的技巧,书里叫耿贝尔-softmax: 它让「从类别分布里采样」这个过程保持可微5

★ 这个技巧到第 10 章会用来降低方差(SAC 那一节), 到第 20 章会作为「想把某个连续动作的算法用在离散动作上」的救场手段回来。★

4. 策略梯度定理:「奖励高就多做」怎么变成一个式子

这一节走主走查的写法一,而它是这条线的地基。

先看现象:那句大白话怎么写成公式

我们想说的是:一条轨迹拿到的回报高,那么这条轨迹上做过的那些动作,以后就多做一点。

问题是:「多做一点」怎么变成一个能让网络参数往哪边挪的量?

定理长什么样

书里给的策略梯度定理,拆开看是三个零件相乘再求平均7:

∇J = 平均( 对每一步: 「把这个动作的机会调大一点」的方向 × 这个动作值多少 )
└───── 只和策略网络有关 ─────┘ └── 一个权重 ──┘

图说:左边那一项是「往哪边挪能让这个动作更容易被选中」;
右边那个权重决定了「该往那边挪多少、还是反着挪」。
★ 整个式子的意思就是那句大白话:权重为正就把这个动作的机会调大,为负就调小。★

主走查的写法一,就是把右边那个权重取成「整条轨迹的回报」(我们的例子里是 2)。

推导里最要紧的一步:环境整项消失

书里给了完整的推导,而其中有一步值得单独拎出来8

推导的关键是一个叫「对数-导数技巧」的变形:把「对一个概率求梯度」换成 「这个概率 × 对它的对数求梯度」。

换完之后会发生一件事:一条轨迹发生的机会 = 起点的机会 × 每一步转移的机会 × 每一步策略选它的机会。 取对数之后连乘变成连加;而求梯度时,前两项都不含策略参数 —— 整项归零。

一条轨迹的对数机会 = log(起点机会) + Σ log(转移机会) + Σ log(策略选它的机会)
↑ 与策略无关 ↑ 与策略无关 ↑ 只有这一项含参数
对策略参数求梯度后: 0 0 ← 只剩这一项

★ 这就是策略梯度不需要环境模型的全部原因。★
你根本不必知道「做这个动作会到哪儿」——那一项在求导时自己没了。

这一句要记住。它是第 06 章那条轴上「无模型」三个字在这条线上的具体来源。

5. 岔一句:改策略未必要算梯度

这一节讲原书 2.7.3 一开头就分出去的另一支。这一章其余各节走的都是梯度那一支。

书里把策略优化分成两支:基于梯度的,和无梯度的9

无梯度那一支怎么做:交叉熵方法

它的做法朴素到有点粗暴10:

① 把策略的那一整套参数,看成一个从某个分布里抽出来的向量
② 抽 n 组参数出来,每一组都拿去跑一遍,看它拿到多少回报
③ 把这 n 组按回报排序,只留最好的那一小撮(比如前 20%)
④ 用留下来的那些,重新算一遍分布的均值和方差
⑤ 照新分布再抽 n 组,回到 ②

图说:它一次梯度都不算 —— 全靠「撒一批、留好的、照好的重新估分布」。
(「前 20%」是**为演示编的**;做法与那两个更新式是书里的。)

它的长处和它的死穴,书里都写了

长处: 书里说它**「是一个有效且普遍的优化算法」,在强化学习里常用于快速的策略搜索**10

死穴书里说得很直白: 此前的研究表明它对强化学习问题的适用性**「严重局限于一个现象, 即分布会过快集中到一个点上」;所以「它在强化学习的应用中虽然速度快, 但是也有其他限制,因为它经常收敛到次优策略」**11

补救办法也给了:往方差上持续掺一点噪声,防止它过早收拢11

★ 把这一支和第 02 章连起来看:「过快集中到一个点」就是探索停了。★ 同一个病,在这里的药是「掺噪声」,到第 10 章会变成「把保持不确定写进目标函数」。

这一支到此为止。下面回到梯度那一支。

6. 它的毛病:估计飘得厉害,以及两个不花钱的解法

这一节走主走查的写法二和写法三,是本章的重点。

先看现象

书里说得很直接:REINFORCE 简单直观,但它的一个缺点是对梯度的估计有较大的方差; 对于一个长度为 L 的轨迹,奖励的随机性可能对 L 呈指数级增长12

「方差」就是第 04 章第 5 节那个词 —— 只是这次被估的东西换了: 第 04 章估的是一个局面的价值,这里估的是「参数该往哪边挪」。

为什么飘? 回头看主走查的写法一:20 步的权重全是同一个数(整条轨迹的回报)。 这条轨迹赢了两分,于是开局那几步「球还在对面、你怎么动都无所谓」的动作, 也被当成功臣同等鼓励。 换一条轨迹、运气差一点,同样这几步又被同等打压。

★ 大量与结果无关的动作在被反复推来推去 —— 这就是那个方差的来源。★

解法一:一个动作,不该为它之前的奖励负责

书里给的第一条:一个动作不应该用这个动作执行以前的奖励值来对其进行估计, 而这也得到数学上的证明 —— 这个动作之前的奖励对最终期望梯度只有零影响13

所以可以直接把它们丢掉,而这样得到的写法书里叫「将得到的奖励」(reward-to-go)13

注意「只有零影响」这五个字:这不是近似,是等价 —— 丢掉它们不改变期望,只降低方差。

主走查的写法二:

第 1~8 步的权重: +2 (它们之后还会拿到两分)
第 9~20 步的权重: +1 (第 8 步那一分和它们无关,丢掉)

★ 第 15 步的动作,再也不会因为「第 8 步赢过一分」而被表扬。★

书里在这里还顺手给了一条实践口径: 折扣因子本身也有助于减少方差; 而实际使用中那个随时间指数衰减的系数经常被去掉,以免过分强调轨迹早期的状态14

解法二:再减去一个只与局面有关的数

第二条更漂亮:从权重里减去一个只依赖当前局面的数,期望一点都不变。

为什么能减? 书里给了一条引理(名字很长,意思很简单): 「一个概率分布(第 01 章说过:哪些结果各有多大机会的一张清单)的对数梯度, 在这个分布下求平均,恒等于 0」15

书里连证明也给了,而且只有两行:任何概率分布加起来都等于 1; 对一个恒等于 1 的东西求梯度,当然是 015

由此直接得到:那个只依赖局面的数,乘上去之后期望是 0 —— 所以减掉它不影响梯度的期望。 书里管这个被减掉的数叫基准,并说它可以是任何一个只依赖当前状态的函数15

为什么减了会降方差:书里给了具体的式子

书里的论证很干净16:

要估一个量 X 的平均。找一个平均为 0 的量 Y,那么 X − Y 仍然是无偏的。
而 X − Y 的方差 = X 的方差 + Y 的方差 − 2 × 两者的协方差

★ 所以:如果 Y 自己的方差小、而且和 X 高度正相关,X − Y 的方差就更小。★
书里的原话正是这一句。[^16]

这就给出了「基准该选谁」的判据:选一个和权重高度相关、自己又不怎么抖的东西。

7. 基准取这个局面的价值,减出来的就是优势

这一节走主走查的写法三,并给出一个到第 13 章还会用的词。

选谁当基准

书里给的常见选择:这个局面的价值 —— 也就是第 03 章那个「从这里出发以后能拿多少」17

为什么它合适? 照上一节那条判据:「这个局面本来能拿多少」和「这条轨迹实际拿到多少」 显然高度相关,而它本身比一条具体轨迹稳得多。

减出来的那个量有名字

书里写明:权重可以取「这个动作的价值」,也可以取「这个动作的价值减去这个局面的价值」; 两者都等价于原来的形式,只是实际中方差不同18

后面那个量叫优势 —— 它回答的是:

「在这个局面上做这个动作,比这个局面的平均水平好多少?」

主走查的写法三:

第 1~8 步: 实际拿到 2,而这个局面本来就该拿 1.5 → 权重 **+0.5** (确实比平均好)
第 9~20 步: 实际拿到 1,而这个局面本来就该拿 1.3 → 权重 **−0.3** (★ 反而不如平均 ★)

★ 这就是优势的全部意思:不看绝对分数,看「比这个局面的平均水平强还是弱」。★
一整条赢了两分的轨迹里,照样可以有一半的动作被压低。
(1.5 与 1.3 是**为演示编的**;取价值当基准、减出来叫优势,是书里的。)

★ 为什么这一步这么要紧:如果所有奖励都是正的,写法一会把好动作和坏动作一起鼓励, 只是鼓励的力度不同 —— 而优势把「不如平均」的那些直接变成负数、真正压下去。★

「优势」这个词在第 07 章第 6 节已经露过一面(那里把 Q 拆成「局面值多少 + 这个动作比平均好多少」)。 它到第 13 章还会以一个意想不到的身份回来。

8. 让一个批判者去估那个基准:演员-批判者

这一节把上一节那个「本来该拿多少」变成一个学出来的东西。

先看现象:那个基准从哪儿来

上一节说基准取「这个局面的价值」。可这个价值你不知道 —— 它正是第 03、04 章要估的那个数。

做法:再养一个网络去估它

书里的做法:同时学两个函数 —— 一个叫演员(也就是策略),一个叫批判者(也就是价值函数)19(第 06 章第 4 节说过:书里把演员译作「行动者」,我们统一叫演员。)

而这里还做了第二件事,值得留意:书里说它「沿用了自举法的思想」—— REINFORCE 里那个「往后一直加到底再减基准」的误差项,被时间差分误差取代了19

REINFORCE 的权重: 从这一步一直加到片段结束的实际分数 − 基准
↑ 要等整局跑完,而且飘

演员-批判者的权重: 这一步的分数 + 折扣 × 下一个局面的估计 − 这一个局面的估计
↑ ★ 这正是第 04 章那个时间差分误差 ★ —— 走一步就能算

图说:★ 又是第 04 章那根轴:拿一点偏,换掉大量的飘。★
批判者自己怎么学?最小化这个误差的平方——就是第 06 章那个做法。[^20]

书里还给了一个工程细节:两个网络通常共享底层。

交接口径:并行版整块让给第 17 章

把这一套复制几十份同时跑,就是原书 5.5 节的 A2C 和 5.6 节的 A3C。

★ 它们不是新算法,是「演员-批判者 + 并行」。★ A2C 有一个协调器,等所有工人都算完再统一更新;A3C 去掉协调器,谁算完谁提交。

这一整块(为什么要并行、等齐了再更新和谁算完谁提交各浪费什么、通信怎么组织)整块放到第 17 章讲。 这一章到「一个演员配一个批判者」为止。

9. 一处看起来像闲笔的对照:生成对抗网络

这一节是书里专门写的一节,而它在这里读着像闲笔 —— 其实是给第 13 章铺路。

书里的观察

书里说:生成对抗网络和演员-批判者初看是截然不同的算法,一个是专门用来造出新东西的模型、一个是强化学习算法, 但实际上它们的结构十分类似20

生成对抗网络: 生成器 造出一个东西 → 判别器 给它打分「这是真的还是造的」
演员-批判者: 演员 给出一个动作 → 批判者 给它打分「这个动作值多少」

★ 书里总结的共同结构:两个相继的部分——一个负责生成,一个用一个分数评估;
优化时先让第二部分评得准,再把梯度从第二部分反传到第一部分,
让它生成我们想要的内容。★[^21]

书里还逐条对照了两边: 生成器和演员在前向和反向上基本一致 —— 生成器拿一串随机数当输入、输出一个对象,目标是最大化判别分数; 演员拿局面当输入、输出一个动作,目标是最大化这个局面-动作的评估值21而判别器和批判者的优化公式不同(判别器还额外吃真实对象),但遵循相同的目标21

★ 为什么这一节值得留意:第 13 章有一个方法,就是把「判别器打的分」直接当成奖励。★ 读到那里你会发现,它之所以能这么干,靠的正是这一节点破的同构。

作者的判断与证据

书里给了证明或明确推导的:

  • 策略梯度定理,以及推导中环境那一项因为不含策略参数而消失78;
  • 「动作之前的奖励对最终期望梯度只有零影响」,书里说这**「得到数学上的证明」, 但明说「这里我们不给出两种策略梯度公式等价性的严格证明」**13;
  • 基准不引入偏差,书里给了完整的两行证明(概率加起来等于 1,对常数求梯度得 0)15;
  • 减去基准为什么降方差,书里给了方差分解的式子16;
  • 交叉熵方法的两个更新式,以及「分布会过快集中到一个点上」这个失效现象1011

作者的判断与限定:

  • 「有更好的收敛性保证」,而书里在脚注里当场限定**「一般也仅限于局部收敛性,而不是全局收敛性」**1 —— 这处自我限定很重要,不要漏掉;
  • 「实际使用中那个折扣系数经常被去掉」14 —— 这是一条经验做法,不是定理;
  • 生成对抗网络与演员-批判者同构20 —— 这是一个结构上的观察, 书里说**「共性认识有助于提新方法」**,但没有给出任何由此产生的新算法。

判断(我们的,不是书里的): 这一章的两个降方差手段有一个共同的形状, 而这个形状值得单独记住:「不改变期望,只降低方差」。 砍掉动作之前的奖励是这样(丢掉的部分期望为 0),减基准也是这样(减掉的部分期望为 0)。 后面第 09、10 章的很多改动就不是这样了 —— 它们是拿偏差换方差,是有代价的。 读一个新算法时,先问它属于哪一种:白捡的,还是有代价的。 如果错,会错在: 「不改变期望」是在「样本无穷多」这个意义上说的。 样本有限时,减基准也可能引入实际的偏差(比如基准本身是学出来的、还没学准)。 判据是:那个基准是不是与当前的动作无关 —— 只要它只依赖局面,这条就成立。

边界与局限

  • 这条线是在线策略的。 权重里的那些分数必须来自当前策略走出来的轨迹; 策略一改,旧样本就作废。所以第 07 章那个回放缓存在这里用不了 —— 这就是它样本效率低的根源,也是第 10 章要合流的理由;
  • 收敛保证只到局部,书里在脚注里自己说了1;
  • 书里没有给出方差到底有多大的任何数。「对轨迹长度呈指数级增长」是一句定性描述, 没有实验数据;
  • 基准取价值时,批判者本身估得准不准,书里没有讨论。而这恰恰是第 10 章 TD3 要治的问题;
  • 无梯度那一支只给了一节。 它在实践中的适用范围、和梯度那一支的性能对照,书里都没有;
  • A2C 与 A3C 这一章不讲(整块交给第 17 章),所以这一章看不到它们的并行结构。

可带走的

全章那条走查,一行写完: Pong 上一条 20 步的轨迹,第 8 步和第 20 步各赢一分 → 写法一每一步的权重都是整条轨迹的回报 +2(连开局那几步无关的动作也被同等鼓励) → 写法二砍掉动作之前的奖励:前 8 步 +2、后 12 步 +1 → 写法三再减去「这个局面本来该拿多少」:前 8 步 +0.5、后 12 步 −0.3 —— 一条赢了两分的轨迹里,照样有一半的动作被压低。 (Pong 的 ±1 是书里的;20 步、两分的位置、1.5 与 1.3 是为演示编的。)

  1. 换这条线的硬理由只有一个:连续动作上「每个动作都算一遍再取最大」做不到;
  2. 策略输出的是一组机会,不是一个动作 —— 连续动作用「一组均值 + 一组标准差」;
  3. 随机是这条线自带的能力,价值那条线要外挂一个 ε-贪心才有;
  4. 再参数化 = 把抽签挪到网络外面去,这样梯度才能穿过去。它到第 10、20 章会回来;
  5. 策略梯度定理 = 「把这个动作的机会调大一点」的方向 × 一个权重。 权重为负就反着挪;
  6. ★ 推导时环境那一项整个消失 —— 这就是它不需要环境模型的全部原因。★
  7. 还有一支完全不算梯度的办法(撒一批、留最好的、照它们重估分布): 快,但分布会过早收拢到一个点,常停在次优;
  8. 这条线天生的毛病是估计飘得厉害,根源是「大量与结果无关的动作被同等推来推去」;
  9. 两个不花钱的解法:砍掉动作之前的奖励(期望零影响)、减去一个只与局面有关的基准(期望不变);
  10. 减基准为什么降方差,有具体的式子:选一个自己方差小、又和权重高度正相关的;
  11. 基准取这个局面的价值时,减出来的东西就叫优势 ——「比这个局面的平均水平好多少」;
  12. ★ 优势能把「不如平均」的动作真正压成负数;而全是正奖励时,不减基准就只会「一起鼓励」。★
  13. 演员-批判者 = 让一个网络去估那个基准,同时把权重换成时间差分误差 —— 又是拿偏换飘;
  14. 生成对抗网络和演员-批判者是同一个结构(一个生成、一个打分),这是第 13 章的伏笔。

原文地图

主题原书章原文位置
直接学策略的三条好处与那两个脚注第5章 策略梯度text/09-ch05.txt:13(搜「不需要在动作空间中求解价值最」) · text/09-ch05.txt:21(搜「探索策略」) · text/09-ch05.txt:22(搜「局部收敛性」)
参数化策略第2章 强化学习入门text/06-ch02.txt:820(搜「参数化策略」)
三种动作分布第2章 强化学习入门text/06-ch02.txt:1830(搜「伯努利」) · text/06-ch02.txt:1843(搜「输出层」) · text/06-ch02.txt:1870(搜「对角高斯策略」)
对角高斯的取舍第2章 强化学习入门text/06-ch02.txt:1873(搜「协相关性」)
采样不可微、耿贝尔-softmax第2章 强化学习入门text/06-ch02.txt:1848(搜「耿贝尔」) · text/06-ch02.txt:1851(搜「不可微」)
再参数化技巧第2章 强化学习入门text/06-ch02.txt:1874(搜「再参数化」) · text/06-ch02.txt:1877(搜「再参数化技巧」)
策略梯度定理第2章 强化学习入门text/06-ch02.txt:1924(搜「策略梯度定理」) · text/06-ch02.txt:1932(搜「定理 2.2」)
对数-导数技巧与推导第2章 强化学习入门text/06-ch02.txt:2004(搜「对数-导数技巧」) · text/06-ch02.txt:2011(搜「上面第三个等式」)
reward-to-go第2章 强化学习入门text/06-ch02.txt:2085(搜「不应该用这个动作执行以前的奖励」) · text/06-ch02.txt:2088(搜「Reward-to-Go」)
EGLP 引理与基准第2章 强化学习入门text/06-ch02.txt:2107(搜「EGLP」) · text/06-ch02.txt:2112(搜「归一化」) · text/06-ch02.txt:2134(搜「基准」)
权重可取 Q 或优势第2章 强化学习入门text/06-ch02.txt:2162(搜「便于实际使用」) · text/06-ch02.txt:2170(搜「不同的方差」)
方差大、基准函数的要求第5章 策略梯度text/09-ch05.txt:66(搜「较大的方差」) · text/09-ch05.txt:69(搜「不能是关于」)
折扣项常被去掉第5章 策略梯度text/09-ch05.txt:63(搜「减少估计梯度时的方差」)
减基准为什么降方差第5章 策略梯度text/09-ch05.txt:109(搜「无偏估计」) · text/09-ch05.txt:114(搜「高度正相关」) · text/09-ch05.txt:115(搜「常见选择是状态价值函数」)
演员-批判者、自举、时间差分误差第5章 策略梯度text/09-ch05.txt:123(搜「行动者」) · text/09-ch05.txt:127(搜「自举」) · text/09-ch05.txt:128(搜「被时间差分误差取代」)
批判者怎么学第5章 策略梯度text/09-ch05.txt:129(搜「最小化该误差的平方」)
无梯度优化与交叉熵方法第2章 强化学习入门text/06-ch02.txt:1887(搜「无梯度」) · text/06-ch02.txt:2545(搜「快速的策略搜索」) · text/06-ch02.txt:2557(搜「选择比率」)
交叉熵方法的失效与补救第2章 强化学习入门text/06-ch02.txt:2572(搜「过快集中到一个点」) · text/06-ch02.txt:2573(搜「引入」)
生成对抗网络与演员-批判者同构第5章 策略梯度text/09-ch05.txt:206(搜「截然不同」) · text/09-ch05.txt:213(搜「相同的结构」) · text/09-ch05.txt:223(搜「基本一致」)

Footnotes

  1. 出处:「第5章 策略梯度」第 13 段(text/09-ch05.txt:13,搜「不需要在动作空间中求解价值最」)、第 21 段(text/09-ch05.txt:21,搜「探索策略」)与第 22 段(text/09-ch05.txt:22,搜「局部收敛性」)。第 21、22 段都是原书的脚注:一条说明价值那条线要额外构造探索策略,另一条限定收敛性「一般也仅限于局部收敛性,而不是全局收敛性」。 2 3 4 5 6

  2. 出处:「第2章 强化学习入门」第 820 段(text/06-ch02.txt:820,搜「参数化策略」)。原文明确:这里的「参数化」指用神经网络的参数来表示抽象的策略。

  3. 出处:「第2章 强化学习入门」第 1830 段(text/06-ch02.txt:1830,搜「伯努利」)与第 1843 段(text/06-ch02.txt:1843,搜「输出层」)。原文写明伯努利和类别分布用于离散动作,对角高斯用于连续动作。 2

  4. 出处:「第2章 强化学习入门」第 1873 段(text/06-ch02.txt:1873,搜「协相关性」)。原文的说法是:用对角高斯表示概率性动作时,它移除了不同动作维度间的协相关性。

  5. 出处:「第2章 强化学习入门」第 1848 段(text/06-ch02.txt:1848,搜「耿贝尔」)与第 1851 段(text/06-ch02.txt:1851,搜「不可微」)。 2

  6. 出处:「第2章 强化学习入门」第 1874 段(text/06-ch02.txt:1874,搜「再参数化」)与第 1877 段(text/06-ch02.txt:1877,搜「再参数化技巧」)。原书指出这个技巧和变分自动编码器里用的是同一个。

  7. 出处:「第2章 强化学习入门」第 1924 段(text/06-ch02.txt:1924,搜「策略梯度定理」)与第 1932 段(text/06-ch02.txt:1932,搜「定理 2.2」)。 2

  8. 出处:「第2章 强化学习入门」第 2004 段(text/06-ch02.txt:2004,搜「对数-导数技巧」)与第 2011 段(text/06-ch02.txt:2011,搜「上面第三个等式」)。原书把整条推导逐行列了出来,每一行右边还标注了这一步用了什么。 2

  9. 出处:「第2章 强化学习入门」第 1887 段(text/06-ch02.txt:1887,搜「无梯度」)。原书在这里列了四种无梯度方法:交叉熵、协方差矩阵自适应、爬山法,以及一种单纯形法。

  10. 出处:「第2章 强化学习入门」第 2545 段(text/06-ch02.txt:2545,搜「快速的策略搜索」)与第 2557 段(text/06-ch02.txt:2557,搜「选择比率」)。原书给了均值与方差两条更新式:取被选中样本的平均当新均值,取它们与新均值之差的平方平均当新方差。 2 3

  11. 出处:「第2章 强化学习入门」第 2572 段(text/06-ch02.txt:2572,搜「过快集中到一个点」)与第 2573 段(text/06-ch02.txt:2573,搜「引入」)。原书还给了一个具体的加噪公式来源。 2 3

  12. 出处:「第5章 策略梯度」第 66 段(text/09-ch05.txt:66,搜「较大的方差」)与第 69 段(text/09-ch05.txt:69,搜「不能是关于」)。原书对基准函数的要求写得很死:它只能是关于状态的函数,不能是关于动作的函数。

  13. 出处:「第2章 强化学习入门」第 2085 段(text/06-ch02.txt:2085,搜「不应该用这个动作执行以前的奖励」)与第 2088 段(text/06-ch02.txt:2088,搜「Reward-to-Go」)。原书紧接着说:「这里我们不给出两种策略梯度公式等价性的严格证明」。 2 3

  14. 出处:「第5章 策略梯度」第 63 段(text/09-ch05.txt:63,搜「减少估计梯度时的方差」)。原文的理由是:去掉它可以避免过分强调轨迹早期的状态。 2

  15. 出处:「第2章 强化学习入门」第 2107 段(text/06-ch02.txt:2107,搜「EGLP」)、第 2112 段(text/06-ch02.txt:2112,搜「归一化」)与第 2134 段(text/06-ch02.txt:2134,搜「基准」)。原书给这条引理起的名字是 EGLP 引理,证明只有两步:所有概率分布加起来等于 1,对它求梯度就是对常数 1 求梯度。 2 3 4

  16. 出处:「第5章 策略梯度」第 109 段(text/09-ch05.txt:109,搜「无偏估计」)、第 114 段(text/09-ch05.txt:114,搜「高度正相关」)与第 115 段(text/09-ch05.txt:115,搜「常见选择是状态价值函数」)。 2

  17. 出处:「第5章 策略梯度」第 115 段(text/09-ch05.txt:115,搜「常见选择是状态价值函数」)。原书还说这个写法「和初版的 Actor-Critic 算法很相像」,并给了三篇讨论其他基准选择的文献。

  18. 出处:「第2章 强化学习入门」第 2162 段(text/06-ch02.txt:2162,搜「便于实际使用」)与第 2170 段(text/06-ch02.txt:2170,搜「不同的方差」)。原书写明两种取法都等价于原始形式,只是实际中方差不同,并给出了用「重复期望规则」的证明。

  19. 出处:「第5章 策略梯度」第 123 段(text/09-ch05.txt:123,搜「行动者」)、第 127 段(text/09-ch05.txt:127,搜「自举」)与第 128 段(text/09-ch05.txt:128,搜「被时间差分误差取代」)。原书的译名是「行动者(Actor)」与「批判者(Critic)」;本组文档把前者统一叫演员(见第 06 章第 4 节),出处里的检索短语保留原词。 2

  20. 出处:「第5章 策略梯度」第 206 段(text/09-ch05.txt:206,搜「截然不同」)与第 213 段(text/09-ch05.txt:213,搜「相同的结构」)。 2

  21. 出处:「第5章 策略梯度」第 223 段(text/09-ch05.txt:223,搜「基本一致」)与第 228 段(text/09-ch05.txt:228,搜「相同的目标」)。原书还提到自动编码器与生成对抗网络互为反结构,并说这类共性认识「有助于提新方法」。 2