跳到主要内容

换成网络之后 — 泛化、死亡三件套,与给任何算法定位的四条轴

这一章讲三件事: 换成函数之后多了什么好处、多了什么麻烦; 为什么第 04 章那条「必然收敛」的保证会作废;以及拿哪四条轴给任何一个陌生算法定位。

它在全书链条里的位置:病因诊断书。 第 05 章把零件换上去了,这一章说明换上去之后坏在哪 —— 而后面十四章的算法,几乎每一个都是在给这一章列出的毛病打补丁。

顶层全景:接着第 05 章那笔账往下算

第 05 章算过一笔账:一帧 84×84 的画面,可能的样子多到没法给每个都留一格。 换成一个网络之后,参数只有几百万 —— 账算平了。

这一章要问的是:代价是什么?

① 换之前:一个局面一格,改一格只动那一格 —— 精确,但写不下
② 换之后:所有局面共用同一批参数(几百万个)

★ 改一个局面的值,就必然连带改动所有长得像的局面。★

③ 好处:没见过的局面也有答案了(这叫泛化)
麻烦:你没法只改一格——**改哪儿都是一片一片地改**

④ 再把它接上第 04 章那两样(拿估计更新估计、学别人走过的路)

★ 三样凑齐,值可以从 1 涨到 1.4、1.96、2.744…… 一路发散,而真值是 0。★

图说:这就是本章的主走查。第 1 节走 ②③,第 2 节讲另一处水土不服,
第 3 节把 ④ 那三个数完整算给你看。
(84×84 与「参数只有几百万」是接第 05、07 章的设定;
④ 那几个数是**我们按书里给的三个条件构造的最小例子**,不是书里的数。)

1. 换成函数,好处和麻烦是同一件事

这一节回答:换零件到底换来了什么?

先看好处:书里列了三条

书里把「用一个函数代替表格」的好处说得很清楚1:

好处说明
能扩展到大规模任务这是换它的原始动机(第 05 章那笔账)
在连续的局面空间里,能从见过的推到没见过的★ 这一条就是泛化,是本节的重点 ★
减少或缓解「人为设计特征来表示状态」的需要第 05 章讲过:这一步原来要人来做

书里还提了一条很实在的效率好处:换成函数之后可以对一批样本一起更新参数, 而不像表格法那样一格一格地更新1

泛化是怎么发生的

因为所有局面共用同一批参数。

表格法: 局面 A 的值存在第 137 格,局面 B 的值存在第 5482 格
改 137 格,5482 格纹丝不动 —— **两者毫无关系**

函数: 局面 A 的值 = 那几百万个参数算出来的
局面 B 的值 = **同一批参数**算出来的
改参数 → **两个值一起变**

图说:所以「没见过的局面也能给出一个答案」——因为它用的是同一批参数。
★ 而这也意味着:你想只改 A、不动 B,做不到。★

这就是这一章标题里那件事:好处和麻烦是同一件事,同一个机制。

书里对不同函数的分类,只需要记结论

书里列了一整棵分类树:表格法、线性方法(多项式、傅立叶基、粗略编码、瓦式编码、径向基函数)、 非线性方法(神经网络)、以及其他方法2

最后那一档里书里点了两个名字:决策树(用一连串「是 / 否」的判断把局面一层层分开) 和最近邻(拿记忆里最像的那个局面的值顶上)2

这些名字后面十四章一次都没用到,不必记。要记的是书里给的两句判断:

  • 线性方法配上时间差分,在一定条件下可以证明收敛 —— 但「收敛性保证很诱人,实际上特征选取有一定难度」3换句话说:能证明的那一档,要人先想好「拿哪些量描述局面」,而这一步很难;
  • 神经网络成了实际上的主力,书里给的理由是它**「很好的可扩展性和对多样函数的综合能力」**; 而且它可以求导,所以能用梯度来优化4

书里在这里留了一句很关键的限定,值得原样记住: 可微分、能用梯度优化,「提供了在凸函数情况下收敛到最优的保证」; 「然而,实践中,它可能需要极大量的数据来训练,而且可能造成其他困难」4

「凸函数情况下」这五个字就是全部的问题所在 —— 而神经网络恰恰不是凸的。

它是怎么训的:目标是「离真值多远」的平方

书里给的做法很直接:把「网络给出的值」和「真实的值」之间的均方误差当成要最小化的目标, 再用第 05 章那套梯度下降去调参数5

但这里有一个立刻要问的问题:「真实的值」你从哪儿来?

答案是:你没有,只能拿一个估计顶上。 第 04 章那个自举就在这里进场 —— 而它正是下面那三件套里的一件。

2. 监督学习那套搬不过来:数据既不独立,也不同分布

这一节讲第二处水土不服,而它是第 07 章第一个补丁的全部动机。

先看现象

第 05 章讲的所有东西,前提都是**「有一个固定的数据集,里面的样本彼此独立、来自同一个分布」**。 书里说:绝大多数监督学习方法都建立在这个假设上6

强化学习的数据两条都不满足。

第一条不满足:样本高度相关

书里说:强化学习的训练数据**「通常包括高度相关的样本,它们是在智能体和环境交互中顺序得到的, 而这违反了监督学习中的独立性条件」**6

具体到画面上: 一秒钟六十帧,连着的四帧几乎一模一样。 把它们直接一条条喂进网络,等于反复拿同一张图去训练

第二条不满足:分布本身在动

书里说得更狠:「更糟的是,强化学习中的训练数据分布通常是不稳定的」6

为什么? 书里给了完整的链条6:

价值是照着当前策略估的,或者至少受「当前策略去过哪些局面」的影响
↓ 而策略随训练一直在更新
↓ 策略一变,它去的地方就变了
⟹ 你手上那批数据来自哪个分布,**每一轮都在变**

★ 换句话说:你在追一个自己一直在挪的靶子。★

这两条到第 07 章各有一个专门的补丁 —— 一个把相关的样本打散,一个把靶子钉住一阵子。 这一章只诊断,不开药。

3. 死亡三件套:两两都安全,三个一起必炸

这一节是全章的落点,也是后面十四章那一串补丁共同的病因。

先看现象:第 04 章那条保证怎么没的

第 04 章第 3 节证过:每刷一遍,两张价值表的距离至少乘上折扣因子,所以必然收敛到唯一答案。

那条证明的关键一步是:「这一步的分数」在两张表里是一样的,相减时当场消掉。 而它成立的前提是:你能一格一格地精确更新。

换成函数之后,你改不了一格 —— 你只能改参数,而改参数会连带动一片。这条证明当场作废。

书里给的三个条件

书里说得很正式:不稳定和发散的危险,在以下三个条件同时发生时就会产生7:

书里的说法说人话我们在哪一章见过它
在一个不满足「自然产生」条件的转移分布上训练(书里举的例子是离线学习)学的是别人走过的路,不是自己现在走的路第 04 章第 8 节那个 max
可扩展的函数拟合用一个函数代替表格第 05、06 章
自举拿一个还没学准的数去更新另一个数第 04 章第 6 节

书里给这三样凑齐的名字:死亡三件套。7

而书里那句最要紧的话是:「这三个主要属性只有在它们被结合时会导致学习的发散」7 —— 两两组合都是安全的,三个一起才炸。

走查:一个能算完的最小例子

书里给了条件但没给例子。下面这个最小例子是我们按那三个条件构造的,每一步都能自己核。

设定(**这些数是我们编的**,书里没有这个例子):
只有两个局面 s1 和 s2,s1 走一步必到 s2,所有奖励都是 0,折扣 0.9。
⟹ 真实的价值显然是:两个局面都值 0。

① 函数逼近:不给每个局面一格,而是用**一个参数 w**:
s1 的值 = 1 × w s2 的值 = 2 × w
★ 只有一个 w —— 所以动它,两个值必然一起动。★
② 自举:更新 s1 时,目标值用的是「这一步的分数 + 0.9 × s2 的当前估计」
③ 学别人走的路:我们**只更新 s1,从来不更新 s2** —— 更新的分布和实际走的分布对不上

从 w = 1 开始,步长取 0.5:

第 1 次 s1 现在的值 = 1.0,目标 = 0 + 0.9 × (2×1.0) = 1.8
差 0.8 → w ← 1.0 + 0.5 × 0.8 × 1 = **1.4**
第 2 次 s1 现在的值 = 1.4,目标 = 0 + 0.9 × (2×1.4) = 2.52
差 1.12 → w ← 1.4 + 0.5 × 1.12 = **1.96**
第 3 次 s1 的值 1.96,目标 3.528,差 1.568 → w ← **2.744**

★ 每一次都乘 1.4。真值是 0,而它一路涨到天上去。★

再看拆掉任何一件会怎样 —— 这是「两两都安全」的具体含义:

拆掉哪一件会发生什么
拆掉函数逼近(改回一个局面一格)更新 s1 时 s2 那一格纹丝不动,s1 的值稳定停在 1.8 —— 不炸
拆掉自举(改用整局跑完的真实总账)目标值就是实际拿到的 0,w 一路被拉向 0 —— 不炸
拆掉离线策略(照实际走的路更新,s2 也更新)s2 的值被拉向 0,s1 跟着被拉向 0 —— 不炸

判断(我们的,不是书里的): 上面这个两状态的例子是我们构造的, 书里只给了三个条件和一篇文献,没有给任何例子。 我们做这件事的理由是:光有「三样凑齐会发散」这句话,读者只会点头,复述不出来; 而算完这三步之后,他能自己解释为什么。 如果错,会错在: 这个例子里的发散来自「只更新一个局面」这种极端的更新分布。 真实的算法不会这么极端,所以它证明的是「可能发散」,不是「一定发散」 —— 事实上第 07 章那些算法在很多任务上跑得好好的。 判据是:把更新分布调得越接近实际走的路,这个例子里的发散就越慢、直到消失。

还有一个副作用:估出来的值会系统性偏高

书里在同一处点了另一个毛病:用函数逼近时,基于价值的方法可能会有过估计或欠估计的问题; 原始 DQN 就有 Q 值过估计的问题,这在实践中会导致略差的学习表现, 而 Double DQN、Dueling DQN 这些技术就是为了缓解它8

这是第 07 章第 5、6 节的预告。而书里在这里还留了一句对照: 「总体来说,使用策略梯度的基于策略的方法相比基于价值的方法有更好的收敛性保证」8 —— 这一句是第 08 章存在的一部分理由。

4. 四条轴:拿它们给任何一个陌生算法定位

这一节是原书第 3 章的全部内容,而它的用法是「一张坐标纸」。

往下十四章会出现几十个算法名字。与其一个个记,不如记住四个问题 —— 遇到任何一个陌生算法,拿这四个问题问它一遍,你就知道它站在哪儿了。

要问的问题两端
它知不知道环境怎么动?基于模型 / 无模型
它学的是「每个局面值多少」,还是直接学「该怎么做」?基于价值 / 基于策略
它等整局结束才更新,还是走一步就更新?蒙特卡罗 / 时间差分
它学的是不是自己现在走出来的路?在线策略 / 离线策略

后两条第 04 章已经讲透了(第 5、6、8 节),这里不重讲。下面只讲前两条。

轴一:知不知道环境怎么动

书里的定义:知道「环境的那五样东西」就是模型已知9

已知的时候可以怎么办? 书里说:可以直接在模型上算,不必再和真实环境交互 —— 第 04 章那个动态规划就是这一类9

不知道的时候呢? 两条路:

① **学一个模型出来**:拿交互采到的样本去拟合「做这个动作会到哪、给多少分」,
学出来之后就当已知,再用规划的办法解 —— 这叫**基于模型**[^10]

② **压根不建模型**,直接找最优策略 —— 这叫**无模型**[^10]

图说:书里给的判据只有一句:**智能体是否利用了环境的动力学模型。**[^10]

书里把基于模型的又分成两小类10:

例子
给定模型围棋 —— 规则固定,而且容易用计算机语言描述,所以直接就能用
学习模型环境太复杂、规律写不出来,只好先学一个

书里给的两个优缺点很实在:

  • 优点:能预测未来的局面和分数,从而帮助更好地规划11;
  • 缺点有两条:「存在或构建模型的假设过强」——现实中环境的动力学可能复杂到无法显式表示; 以及「学习得到的模型往往是不准确的」,而基于带误差的模型做出来的策略, 往往会在真实环境里失效11

而无模型的缺点书里也说得很硬:采样效率低,而在真实环境里探索的代价可能极高 —— 巨大的时间消耗、不可逆的设备损耗、安全风险。书里举的例子是自动驾驶: 不能在没有防护的情况下让智能体在现实世界里试错,因为任何交通事故的代价都难以承受12

★ 这一段就是第 11 章「样本效率」那一节的种子。★

轴二:学价值,还是学策略

这一条是第 07 到第 10 章的整个结构。

基于价值基于策略
学什么每个局面-动作值多少,然后挑最大的那个动作直接学「在这个局面各个动作各占多大机会」
优点采样效率相对高、估计的方差小、不容易停在一个「附近都不如它、但离最好还差远」的地方13参数化简单、收敛速度快,而且适用于连续的、或者一次要定很多个数的动作14
缺点通常不能处理连续动作;最终给出的是一个固定动作,而不是「各个动作各占多大机会」;而且 ε-贪心加上取最大容易导致过估计13(第 08 章会讲:方差大、步长难定)

两条路还可以合起来用,合出来的那一类叫演员-批判者。 名字里是两个角色:「演员」就是策略,负责真的做出动作; 「批判者」就是价值函数,负责在旁边给这个动作打分。 ★ 一处译名要先说好:这本书把「演员」译作「行动者」,而本组文档从这里到最后一章一律叫演员 —— 同一个零件,不再换第二个名字;只有逐字引原书的句子里会照原样保留「行动者」。★

书里对这一类也给了一句很准的定位: 它**「可以看作是基于价值的方法在连续动作空间中的扩展,也可以看作是基于策略的方法 在方差与采样效率这两件事上的改进**; 但它同时继承了两边的缺点 —— 批判者有过估计的问题,演员有探索不足的问题15

★ 这一句话就是第 10 章那三个算法的完整议程:一个治过估计,一个治探索不足。★

5. 一个必须现在挂牌的歧义:「模型」这个词

这一节只做一件事:防止一个到第 14 章还会绊人的误会。

先看现象

「基于模型的方法」——听起来像是「用了神经网络的方法」。完全不是。

书里专门为这件事写了一段,而且对照写得极清楚9:

「模型」在哪一行指什么
在深度学习里一个带参数的函数,比如一个全连接网络、一个卷积网络
★ 在强化学习里 ★特指环境,即环境的动力学 —— 「做这个动作会到哪个局面、给多少分」

所以「基于模型」的意思是「用到了环境的动力学」,和你有没有用神经网络毫无关系。

DQN(第 07 章) 用了一个很大的卷积网络 —— 但它是**无模型**的
AlphaGo(第 19 章) 用了围棋规则 —— 它是**基于模型**的[^17]

图说:两个词长得一样,指的是两件事。**记住这一条,第 14 章会省很多力气。**

这一章只挂牌,不展开。「模型」到底包含哪些零件、怎么学出来、学不准会怎样 —— 第 14 章讲透。

6. 两条线的长短正好互补,所以后面按这个顺序走

这一节交代第 07 到第 10 章为什么是这个次序。

把第 4 节那张表压成一句话:

基于价值: 样本效率高、方差小 —— 但**接不了连续动作**
基于策略: 能连续、能高维 —— 但**方差大、步长难定**

↓ 两个缺点正好是对方的优点

第 07 章 把基于价值这条线做到头(DQN 与它的六个补丁)
第 08 章 换到基于策略这条线,治它的方差
第 09 章 接着治它的步长
第 10 章 ★ 两条线合流 ★

图说:这就是后面四章的全部安排。
**注意第 10 章合的正是「离线策略 + 连续动作」这两个性质** ——
一个来自左边,一个来自右边。

这一节只给坐标系,不提前搬第 10 章那张对照表。 到那一章你会看到完整的三行对比。

作者的判断与证据

书里给了明确条件或引用的:

  • 死亡三件套的三个条件,以及**「只有在它们被结合时会导致学习的发散」**, 书里引了一篇 2018 年的文献7;
  • 线性函数配时间差分在一定条件下可证收敛,引了一篇 1997 年的文献3;
  • 神经网络有普遍的拟合能力,引了一篇 1993 年的文献4;
  • 原始 DQN 有过估计问题,引了一篇 2016 年的文献8;
  • 强化学习的数据既不独立也不同分布,书里给了完整的因果链6

作者的判断(没有实验或证明支撑的):

  • 「总体来说,使用策略梯度的基于策略的方法相比基于价值的方法有更好的收敛性保证」8 —— 这是一句概括,书里没有给出具体条件;
  • 「无模型方法仍然是现在的主流方法,但由于其采样效率低的缺点很难克服, 天然具有高采样效率的基于模型的方法发挥着越来越重要的作用」16 —— 这是 2021 年的判断,书里把论证推给了第 7 章;
  • 四条轴本身是一种整理方式,不是定理。书里没有声称它们是完备的或互斥的。

判断(我们的,不是书里的): 这一章最该带走的不是「死亡三件套」这个名字, 而是**「你没法只改一格」这一句**。 第 07 章那两个补丁、第 09 章那个信赖域、第 10 章那三招, 本质上全部是在给这一句话打补丁 —— 既然改哪儿都是一片一片地改, 那就想办法让「一片一片地改」不至于失控。 如果错,会错在: 如果某个补丁的动机其实与「牵连」无关 (比如第 07 章那个按误差大小偏心抽样,它治的是学得慢,不是发散), 那么这条串联对它就是过度归因。判据是:去掉函数逼近之后,那个补丁还有没有必要。

边界与局限

  • 书里给了死亡三件套的条件,但没给例子、没给实验、也没给任何能算的判据 —— 「什么时候会炸、炸得多快」一个字都没有。本章那个两状态的例子是我们补的;
  • 四条轴之间不是互相独立的。 比如「基于价值」的算法几乎总是「离线策略」的, 书里没有讨论这些相关性;
  • 书里那棵函数拟合器的分类树很长,但后面十四章只用到其中一个分支(神经网络) —— 其余全部是陈列;
  • 「非独立同分布」这一节只诊断不开药。 补丁在第 07 章,而书里没有在这里指过去;
  • 本章没有讲收敛性在函数逼近下还剩什么。 书里只说「可能发散」, 没有给出任何「在什么条件下仍然安全」的正面结果。

可带走的

全章那条走查,一行写完: 84×84 的画面换成网络之后参数只有几百万 → 代价是所有局面共用同一批参数,改一个必然连带改一片 → 这份牵连就是泛化(好处),也是「你没法只改一格」(麻烦) → 再接上自举和「学别人走过的路」,一个两状态的例子里值从 1 涨到 1.4、1.96、2.744,而真值是 0拆掉三件里的任何一件,它都不炸。 (那三个数是我们按书里的三个条件构造的,书里没有这个例子。)

  1. 好处和麻烦是同一个机制:所有局面共用参数 —— 所以能泛化,所以不能只改一格;
  2. 书里列的那棵函数拟合器分类树,后面只用到一个分支。 名字不必记;
  3. 线性方法能证明收敛,代价是要人先想好用哪些量描述局面 —— 而这一步很难;
  4. 神经网络的收敛保证只在「凸函数情况下」成立,而它自己不是凸的;
  5. 强化学习的数据既不独立(连着采的几乎一样),也不同分布(策略一直在变) —— 这是第 07 章两个补丁的动机;
  6. 死亡三件套 = 函数逼近 + 自举 + 学别人走过的路。两两组合都安全,三个一起可以发散;
  7. 第 04 章那条收敛证明作废的具体原因:它依赖「能一格一格精确更新」;
  8. 函数逼近还带来一个副作用:估出来的值会系统性偏高(第 07 章第 5 节治它);
  9. 四条轴:知不知道环境怎么动 / 学价值还是学策略 / 等整局还是走一步 / 学的是不是自己走的路。 遇到陌生算法就拿这四条问一遍;
  10. ★ 在强化学习里,「模型」专指环境的动力学,和「用没用神经网络」无关。★ DQN 用了很大的网络,但它是无模型的;
  11. 无模型的真正代价是采样效率低,而真实环境里试错可能极贵(自动驾驶) —— 第 11 章会算这笔账;
  12. 两条线的缺点正好互补 —— 一条接不了连续动作,一条方差大;第 10 章合的就是这两处。

原文地图

主题原书章原文位置
函数拟合的三条好处、按批更新第2章 强化学习入门text/06-ch02.txt:1725(搜「不仅包括可以扩展」) · text/06-ch02.txt:1728(搜「逐个」)
函数拟合器的分类树第2章 强化学习入门text/06-ch02.txt:1645(搜「函数拟合器」) · text/06-ch02.txt:1712(搜「非线性方法」) · text/06-ch02.txt:1721(搜「决策树」)
线性方法可证收敛、特征选取难第2章 强化学习入门text/06-ch02.txt:1651(搜「一定条件下可以收敛」) · text/06-ch02.txt:1677(搜「有一定难度」)
神经网络为什么成主力、凸函数那句限定第2章 强化学习入门text/06-ch02.txt:1639(搜「可扩展性」) · text/06-ch02.txt:1733(搜「凸」)
基于梯度的价值拟合、均方误差目标第2章 强化学习入门text/06-ch02.txt:1763(搜「均方误差」)
非独立同分布、分布不稳定第2章 强化学习入门text/06-ch02.txt:1737(搜「稳定的独立同分布」) · text/06-ch02.txt:1738(搜「而这违反了监督学习中的」) · text/06-ch02.txt:1739(搜「不稳定的」)
死亡三件套的三个条件第2章 强化学习入门text/06-ch02.txt:1745(搜「三个条件同时发生」) · text/06-ch02.txt:1752(搜「死亡」)
过估计与两条对照第2章 强化学习入门text/06-ch02.txt:1754(搜「过估计或欠估计」) · text/06-ch02.txt:1757(搜「更好的收敛性保证」)
「模型」在两个领域的不同含义第3章 强化学习算法分类text/07-ch03.txt:18(搜「在深度学习」) · text/07-ch03.txt:20(搜「特指环境」)
模型已知时可以直接算第3章 强化学习算法分类text/07-ch03.txt:25(搜「无须再与真实环境」)
基于模型与无模型的判据第3章 强化学习算法分类text/07-ch03.txt:39(搜「不尝试对环境建模」) · text/07-ch03.txt:44(搜「区别在于」)
给定模型与学习模型第3章 强化学习算法分类text/07-ch03.txt:47(搜「给定」) · text/07-ch03.txt:50(搜「围棋规则固定」)
基于模型的优缺点第3章 强化学习算法分类text/07-ch03.txt:59(搜「预测未来的状态和奖励」) · text/07-ch03.txt:62(搜「假设过强」) · text/07-ch03.txt:64(搜「往往是不准确的」)
无模型的代价、自动驾驶的例子第3章 强化学习算法分类text/07-ch03.txt:70(搜「不可逆的设备损耗」) · text/07-ch03.txt:70(搜「自动驾驶」)
基于价值的优缺点第3章 强化学习算法分类text/07-ch03.txt:96(搜「采样效率相对较高」) · text/07-ch03.txt:98(搜「容易导致过估计」)
基于策略的优点第3章 强化学习算法分类text/07-ch03.txt:115(搜「收敛速度快」)
演员-批判者的定位与它继承的缺点第3章 强化学习算法分类text/07-ch03.txt:125(搜「扩展」) · text/07-ch03.txt:128(搜「探索不足」)
基于模型的方法越来越重要第3章 强化学习算法分类text/07-ch03.txt:78(搜「采样效率」) · text/07-ch03.txt:81(搜「MuZero」)

Footnotes

  1. 出处:「第2章 强化学习入门」第 1725 段(text/06-ch02.txt:1725,搜「不仅包括可以扩展」)与第 1728 段(text/06-ch02.txt:1728,搜「逐个」)。原文列的三条好处是:扩展到大规模任务、在连续状态空间中从所见状态泛化到未见状态、以及减少人为设计特征的需要。 2

  2. 出处:「第2章 强化学习入门」第 1645 段(text/06-ch02.txt:1645,搜「函数拟合器」)、第 1712 段(text/06-ch02.txt:1712,搜「非线性方法」)与第 1721 段(text/06-ch02.txt:1721,搜「决策树」)。 2

  3. 出处:「第2章 强化学习入门」第 1651 段(text/06-ch02.txt:1651,搜「一定条件下可以收敛」)与第 1677 段(text/06-ch02.txt:1677,搜「有一定难度」)。收敛性那条引的是一篇 1997 年的文献。 2

  4. 出处:「第2章 强化学习入门」第 1639 段(text/06-ch02.txt:1639,搜「可扩展性」)与第 1733 段(text/06-ch02.txt:1733,搜「凸」)。原文对神经网络的拟合能力引了一篇 1993 年的文献。 2 3

  5. 出处:「第2章 强化学习入门」第 1763 段(text/06-ch02.txt:1763,搜「均方误差」)。原文给了状态价值和动作价值两个版本的目标函数与对应的梯度。

  6. 出处:「第2章 强化学习入门」第 1737 段(text/06-ch02.txt:1737,搜「稳定的独立同分布」)、第 1738 段(text/06-ch02.txt:1738,搜「而这违反了监督学习中的」)与第 1739 段(text/06-ch02.txt:1739,搜「不稳定的」)。 2 3 4 5

  7. 出处:「第2章 强化学习入门」第 1745 段(text/06-ch02.txt:1745,搜「三个条件同时发生」)与第 1752 段(text/06-ch02.txt:1752,搜「死亡」)。书里对第一个条件的原始表述比较绕:「在一个转移分布上训练,而这个分布不满足由一个过程自然产生且这个过程的期望值被估计的条件」,并举了离线学习作为例子——这就是我们说的「学的不是自己现在走的路」。这一条引的是 2018 年的一篇文献。 2 3 4

  8. 出处:「第2章 强化学习入门」第 1754 段(text/06-ch02.txt:1754,搜「过估计或欠估计」)与第 1757 段(text/06-ch02.txt:1757,搜「更好的收敛性保证」)。 2 3 4

  9. 出处:「第3章 强化学习算法分类」第 18 段(text/07-ch03.txt:18,搜「在深度学习」)、第 20 段(text/07-ch03.txt:20,搜「特指环境」)与第 25 段(text/07-ch03.txt:25,搜「无须再与真实环境」)。原文把马尔可夫决策过程的五个元素逐一列出,并说这些全都已知时模型就是已知的。 2 3

  10. 出处:「第3章 强化学习算法分类」第 47 段(text/07-ch03.txt:47,搜「给定」)与第 50 段(text/07-ch03.txt:50,搜「围棋规则固定」)。学习模型那一类原书举的例子之一是先用一个编码器把局面压成一串低维的数,再学这串数的预测模型。

  11. 出处:「第3章 强化学习算法分类」第 59 段(text/07-ch03.txt:59,搜「预测未来的状态和奖励」)、第 62 段(text/07-ch03.txt:62,搜「假设过强」)与第 64 段(text/07-ch03.txt:64,搜「往往是不准确的」)。 2

  12. 出处:「第3章 强化学习算法分类」第 70 段(text/07-ch03.txt:70,搜「不可逆的设备损耗」)与第 70 段(text/07-ch03.txt:70,搜「自动驾驶」)。

  13. 出处:「第3章 强化学习算法分类」第 96 段(text/07-ch03.txt:96,搜「采样效率相对较高」)与第 98 段(text/07-ch03.txt:98,搜「容易导致过估计」)。 2

  14. 出处:「第3章 强化学习算法分类」第 115 段(text/07-ch03.txt:115,搜「收敛速度快」)。

  15. 出处:「第3章 强化学习算法分类」第 125 段(text/07-ch03.txt:125,搜「扩展」)与第 128 段(text/07-ch03.txt:128,搜「探索不足」)。

  16. 出处:「第3章 强化学习算法分类」第 78 段(text/07-ch03.txt:78,搜「采样效率」)。原文把论证推给了第 7 章——那正是我们的第 11 章。