跳到主要内容

算法齐了,却还是不好用 — 八个结构性障碍

这一章讲三件事: 为什么算法讲完了这本书还没完; 「不好用」被拆成了哪八件互不重叠的事; 以及每一件的具体代价是多少 —— 作者给的是账单,不是形容词。

★ 它在全书链条里的位置:枢纽。★ 前十章是一部算法史,这一章把它翻成一份工程议程 —— 后面六章(第 12 到 17 章)每一章正是去治这八件里的一件。 书里自己也这么说:本章提出这些挑战,来引出本书第二个板块的前沿主题1

顶层全景:同一个机器人抓取任务,八个位置各有一笔账

这一章从头到尾用同一个任务:一条机械臂,要把桌上的一个物体抓起来。

这个任务是书里第 18 章那个真实项目,而它正好把八个障碍全撞了一遍。

任务:机械臂看着桌面,自己学会把一个长方体抓起来。

① 样本效率 光采样就要 7 台真机、800 小时、连续 4 个月 ← §2(书里的数)
② 稀疏奖励 只在抓到时给分,中间几万步全是 0、彼此没差别 ← §3
③ 学习稳定性 换一个随机种子,曲线可以完全不重合 ← §4(书里的实测)
④ 灾难性遗忘 先在模拟里学、再拿真机微调,前面学的会被冲掉 ← §5
⑤ 探索 夹具随机乱动,一万次里可能一次都没碰到物体 ← §6
⑥ 泛化 换一个形状的物体,几乎要从头再来 ← §7
⑦ 有别人 换成两条机械臂抢一个物体,「最优」就失效 ← §8
⑧ 现实鸿沟 模拟里摄像头零延时,真机上永远拿滞后的画面 ← §9
(再加一件:规模 —— 想扩到一百种物体还缺什么 ← §10)

图说:这就是本章的主走查。同一个任务,八个位置,每个位置一笔具体的账。
★ 这八件事互不重叠 —— 治好任何一件,其余七件一件不少。★
★ ①–⑧ 这套编号是我们排的,全章从头到尾只用这一套;
书里自己的排法和它差一处,§1 会把两边对上。★
(①③⑧ 的数字是书里第 7 章给的;②④⑤⑥⑦ 落到这个任务上的说法是我们的转写,
机制本身是书里的。)

1. 这一章为什么是转折点

这一节回答:算法都讲完了,为什么还要有第二个板块。

先看现象

读完前十章,你手上有一整套算法,而且每一个都有推导、有收敛性讨论。

然后你去做一个真任务 —— 它不动。

你会本能地怀疑自己:是不是超参没调好、是不是网络太小、是不是训得不够久。

★ 这一章要说的是:很多时候都不是。是这门学问本身还缺一块。★

书里怎么拆的

书里在开头列了八条1它的排法和上面那张全景差一处,而且只差这一处: 书里把「稀疏奖励」放在「探索」里一块儿讲,我们把它单拎出来放在了 ② —— 理由是它在主走查上有一笔自己的账(梯度直接变成 0),混着讲会看不见。

下面两张表的最后一列,就是书里那一条对应全景里的哪一个号:

书里的说法一句话对应全景
样本效率问题学一件事要试太多次
训练稳定性同一份代码跑两遍,结果可以完全不一样
灾难性遗忘:学新的会把学过的冲掉旧本事保不住
探索相关问题该试的地方根本试不到⑤,外加从它里面拎出来的 ②

书里的前四条是「学得动学不动」;后四条是「学到的东西管不管用、扩不扩得开」。

书里的说法一句话对应全景
元学习和表示学习的跨任务泛化学会一个任务,换一个还是不会
有其他智能体作为环境一部分对手也在学,「最优」这个词失效
模拟到现实的迁移模拟里学会了,搬上真机就废
大规模的分布式训练:把一次训练拆到很多台机器上同时跑规模一上去,算法本身不够用了全景末尾那件附加的:规模

★ 从这里往下,全章只用全景那一套号 ①–⑧,书里的次序不再出现。★

后面六章的分工(这是我们按书的结构整理的,不是书里的一张表):

障碍哪一章去治用什么药
① 样本效率第 12、13 章拿人的示范省样本
① 样本效率第 14 章拿学出来的环境模型造样本
⑤ 探索 / ② 稀疏奖励第 15 章把长任务拆成两层
⑦ 有别人第 16 章把对手当环境的一部分,重新定义「最优」
规模(全景末尾那件附加的)第 17 章用机器换时间
⑧ 现实鸿沟第 18 章把差异当成随机性练进去

★ 剩下的三件谁都没接:③ 学习稳定性、④ 灾难性遗忘、⑥ 泛化。★ ③ 会在第 20 章变成一条很实在的工程判断(同一份代码换 3 到 5 个随机种子重跑,再看结果); ④ 和 ⑥ 到本章为止就不再展开了 —— 书里也没有第二处讲它们。

2. 第一件:学一件事要试太多次

这一节走主走查的第一个位置,并给出这一章最贵的那笔账。

先看现象:一个很扎心的对比

书里拿乒乓球游戏做对比:一个普通人可能通过几十次尝试就基本掌握游戏规则并取得较好的分数; 而现有的算法(尤其是无模型的方法)可能需要成百上千个样本来逐渐学到一些有用的策略2

「样本效率」这个词书里给了定义:同样数量的训练样本下, 一个样本效率高的方法在学习曲线或最终结果上表现得更好2

为什么这件事致命:代价不在算力(机器每秒能算多少)上

如果只是慢,多等几天就完了。问题是在真实世界里,「试一次」是要付真钱的。

书里列的代价3:

  • 时间消耗 —— 即使在模拟里,交互本身也要时间和能源;
  • ★ 设备损耗 ★ —— 机器人每试一次都在磨自己;
  • 探索过程中的安全性,和失败情况下的风险。

主走查上这一笔账

书里在讲现实鸿沟那一节给出了这个任务的真实数字:有一个方法能同时在 7 个真实机器人上进行分布式训练,但代价是「持续 4 个月的 800 个小时的机器人数据采样时间」4

800 小时是多久?
一个人每天工作 8 小时,800 小时 = 连着上 100 天班。
而这还是 7 台机器人一起干的,横跨 4 个月的日历时间。
★ 而它换来的只是「学会抓东西」这一件事。★

书里对这个结果的评价一点没客气:
他们成功示范了直接在现实世界部署的机器人学习,
★ 但是「其时间消耗和资源上的要求一般是无法接受的」。★[^4]
(100 天这个换算是我们做的;7 台、800 小时、4 个月是书里的。)

书里给了三条出路,而其中两条就是后面两章

书里列的三个方向5:

出路靠什么在哪一章
从专家示范中学借外部信息:一份人做过的记录第 12、13 章
基于模型的方法借外部信息:环境怎么动的一个模型第 14 章
改进算法本身不借任何外部信息 —— 书里说的是「如果没有额外信息可以利用,那就改进算法本身」5前十章那一整串补丁

书里给了第二条路上的一个具体战果:有一个叫 PILCO 的方法,用一种非神经网络的办法 去近似环境怎么动,在「推车双钟摆上翻」这个真实任务上, 「用仅 20 到 30 次尝试就能学会一个控制的有效策略」; 而其他方法(比如多层感知机)「可能最终需要至少几百次尝试」6

★ 20–30 次对几百次 —— 差一个数量级。这就是「借环境模型」这条路值多少钱。★

书里也当场写了它的死穴:学策略参数是一个非凸优化问题,难以保证搜到最优; 而且那种办法「无法扩展到复杂模型的高维参数空间上」6

3. 第二件:奖励只在最后给一次

这一节走主走查的第二个位置。

先看现象

「稀疏奖励」这个词第 01 章第 4 节就见过 —— 一整局只在最后给一次分,中间全是 0。

这一节讲它为什么让学习无从下手。

抓取任务的第一版奖励:抓到了给 +10,其余每一步都是 0。

一个片段跑 200 步,前 199 步的奖励全是 0。
再跑一个片段,前 199 步的奖励还是全是 0。
★ 两个片段里,一个走得很接近、一个方向完全错了 —— 它们拿到的分一模一样。★

→ 于是:第 08 章那个「奖励高的动作多做一点」的权重,在这里全是 0
→ 梯度是 0,参数一动不动
→ ★ 不是学得慢,是根本没有信号。★

书里的说法

书里把这件事写成一句很关键的话:「这里稀疏奖励任务的瓶颈实际在于探索本身」7

书里给的机理:稀疏奖励可能使价值网络和策略网络在一个不平滑且非凸的超曲面上优化, 甚至在训练的某些阶段有不连续的情况;因此一步优化后的策略可能无法帮助探索到更高奖励的区域7

「非凸」是什么意思: 想象一片山地。凸的地形只有一个山顶,你顺着坡往上走一定能到; 非凸的地形有很多个小山包,顺着坡走只会卡在离你最近的那个上。

书里还补了一句更狠的:即便偶然采样到了接近最优的轨迹, 基于价值或基于策略的方法「可能也没有对这些样本充分重视」,而导致失败或者缓慢学习7

★ 也就是说:好不容易撞对一次,现有的算法还未必抓得住。★

4. 第三件:同一份代码跑两遍,结果可以完全不同

这一节走主走查的第三个位置,而它是这一章最有可带走价值的一处。

先分清两种「不稳」

书里把「不稳定」拆成了两件事,而它们的处理办法完全不同8:

哪一种长什么样书里的说法
单次训练内部一条曲线自己忽上忽下,有时甚至会下降「巨大的局部方差或在单次学习曲线上的非单调增长8
★ 多次训练之间 ★同一份代码跑五遍,五条曲线对不上「每一个阶段上的多次学习表现之间的巨大差异」8

根源:三样东西一起作用

书里给的三条9:

目标分布一直在动 —— 策略一直在变,它采到的数据分布跟着变
↓ 而价值函数是拿这些数据估的
数据不独立 —— 连着交互产生的样本高度相关,
书里的说法是「这打破了有效学习神经网络的独立性条件」[^9]

价值估计有偏 —— 而且书里特别点了一句:
★ 偏差本身也不稳定的时候,它就成了另一个不稳的根源 ★[^9]

图说:这三样一起把梯度估计里的噪声推高,学习表现就跟着抖。
★ 注意最后一样:平常我们只讨论偏差和方差的权衡,
而这里说的是「偏差自己也在晃」。★
(这里不编号,是为了不和全景那套 ①–⑧ 撞车。)

书里对「价值估计有偏」这一样还给了一处很实在的坦白:第 02 章里为了让价值估计无偏, 有一些条件需要被满足;而「实践中,这些要求或条件经常被放宽」9

★ 这是全书少见的一句自我拆台:理论上的保证,在实践中普遍不成立。★

主走查上那笔最刺眼的账

书里引了 2018 年一篇专门调查这件事的工作,给了五条结论10:

#结论
1策略网络的结构对 TRPO 和 DDPG 的结果有显著影响
2ReLU 或 Leaky ReLU 往往表现最好,但效果的大小在不同算法和环境上不一致
3奖励值缩放的效果在不同环境和不同缩放值上不一致
4★ 5 个随机种子(通常的报告设置)可能不足以论证显著的结果 ★
5环境本身不稳定会迅速削弱 DDPG 的表现

上面那张表的第 4 条要展开说,因为它的原话比结论更吓人:

「如果你仔细挑选随机种子,不同的随机种子可能得到完全不重合的置信区间, 即使采用完全相同的实现方式」10

落到抓取任务上是这样:

同一份代码,只改一个随机种子:
种子 A: 成功率曲线爬到 0.6
种子 B: 成功率曲线在 0.1 上趴着不动
★ 两条曲线的误差范围可以完全不重叠 —— 看起来像两个不同的算法。★

(0.6 和 0.1 是为演示编的;「完全不重合的置信区间」是书里引的实测结论。)

★ 可带走的判断:看到一张漂亮的曲线,先问「跑了几个种子」。★
书里还说「随机种子」本身就是造成不稳的因素之一。[^9]

「随机种子」是什么: 程序里的「随机」其实是算出来的,给它一个起始数, 后面整串随机数就定了 —— 那个起始数就叫随机种子。 改一个种子,网络的初始参数、探索时抽到的动作、从缓存里抽到哪批经验,全都变了。

5. 第四件:学新的会把学过的冲掉

这一节走主走查的第四个位置。

先看现象:这一行的数据集自己会变

书里给了一个很准的比喻:强化学习不像监督学习那样在固定的数据集上学, 它「可以被看作是追逐一个移动目标的过程,而数据集在整个过程不断被更新」11

这件事导致的后果书里叫灾难性遗忘:新的数据经常使得已训练过的网络改变很多来拟合它, 「从而忘记网络在之前训练过程中所学到的内容,即使这些内容也是有用的」11

书里给它的定性很硬:这是「在强化学习方法中使用神经网络做拟合器的一种局限性」11

哪种情况最容易遗忘

书里点了名:对于在线策略学习,样本通常以相关联数据的形式被采集, 「这极大促使了灾难性遗忘的发生」12

在线策略(第 08、09 章那条线): 只能用刚采的样本 → 高度相关 → ★ 最容易忘 ★
离线策略(第 07、10 章那条线): 有回放缓存 → 旧数据留着 → 缓解

书里的话:离线策略方法使用经验回放池来缓解这个问题,
「从而在某种程度上保留旧数据来学习」;
而优先经验回放与后见之明经验回放是更进一步的做法。[^12]

★ 这就把第 07 章那个回放缓存的价值又抬高了一层:它不只是省样本,还是防遗忘的。★

还有一种遗忘,和数据无关

书里指出的第二种情况更隐蔽:分几个阶段训练的时候。

主走查上正好有这么一步: 先在模拟里训一个策略,再拿真机数据微调 —— 而书里说,这两个过程「可能使用不同的损失函数,而且损失函数可能不总是与整体强化学习目标一致」13

书里给的具体例子: 有一项工作先把摄像头拍到的画面压成一串数,再拿这串数当策略的输入 —— 这个「把原始输入压成一串数」的动作在这一行叫嵌入,干这件事的那个网络就叫嵌入网络。

而书里说,这个嵌入网络在从模拟适应到现实的过程中,是用一个自监督(不用人来标答案, 拿数据自己造出监督信号)的损失去微调的,而不是原来训练时用的强化学习损失13

★ 结果就是:策略可能把预训练(正式开练之前先在别处训一轮打底)里学到的技能忘掉。★13

两条补救(书里给的):

  • 固定住一部分网络层,并用之前的损失函数继续更新 —— 让预训练的部分尽量保住13;
  • ★ 另一条叫残差策略学习:把预训练的网络整个冻住,在旁边加一个新网络专门学修正量。★ 书里明说这个想法要到第 8 章(我们的第 12 章)才展开13

6. 第五件:该试的地方根本试不到

这一节走主走查的第五个位置。

那个著名的例子

书里拿的例子是雅达利上一个叫《蒙特祖玛的复仇》的游戏。

它难在哪: 书里说这个游戏的智能体必须完成几十个连续动作才能通过一个房间, 而这个游戏有 23 个不同的房间14

★ 把这两个数摆在一起看:★
要拿到第一分,得连对几十个动作;
任何一步走错,这几十步全部作废、什么分都没有。

对比:第 07 章那个 Breakout,球拍随便动几下就能碰到球、就有分。
★ 「随机乱试也能撞到分」和「随机乱试永远撞不到分」,是两种任务。★

主走查上对应的是:夹具随机乱动,一万次里可能一次都没碰到物体。
(一万次是为演示编的;书里没有给抓取任务的这个数。)

两家宣布解决了它,而作者不买账

这是这一章最见作者态度的一处。

书里说:两家顶级实验室都声称他们用高效的深度强化学习方法解决了这个游戏。 然而 ——「这些结果可能不令人满意」15

理由很具体:在他们的解决方案里,专家示范都被用于辅助探索 —— 一家让智能体观察 YouTube 视频,另一家使用人类示范来更好地初始化智能体位置15

判断(我们的,不是书里的): 作者这句「可能不令人满意」不是在挑刺, 它是这本书结构的一部分 —— 如果连这个基准都得靠人的示范才能过, 那么「拿人的示范省样本」就不是一条捷径,而是一条必经之路。 这正是接下来两章(我们的第 12、13 章)整整两章讲模仿学习的理由。 如果错,会错在: 作者也可能只是在陈述事实、不带评价。 判据是:看他把这句话放在哪 —— 它紧跟在「解决了」三个字后面, 而且用的是转折词。

除了稀疏奖励,还有动作太多

书里给了第二个来源:较大的动作空间和不稳定的环境16。它举的例子是《星际争霸 II》, 并给了一张三个游戏的对照表17:

雅达利游戏围棋《星际争霸》
信息类型近完美完美不完美
动作空间17361★ 10 的 26 次方 ★
每场活动次数100/秒100/秒1000/秒
玩家数量单个两个多个

★ 那个 10 的 26 次方要有参照物才有感觉:★ 围棋每一步 361 种选择,已经被公认为大到不可能穷举; 而把围棋的 361 连乘十次,才刚刚够到 10 的 26 次方这个量级。 (这个换算是我们做的;三列数字是书里表 7.1 的。)

书里还点了一句和 ⑦「有别人」(§8)相通的话:多玩家的设置使得对手在某种程度上成为游戏环境的一部分, 这也增加了探索的难度16

一个不用神经网络的解法

书里介绍了一个叫 Go-Explore 的方法,并明说「它不是一个深度强化学习的解决方案」18: 先用不带神经网络的确定性搜索把游戏世界探完,再用神经网络去模仿探到的最好轨迹。

补充(不在书里): 这本书写于 2021 年 4 月,而 Go-Explore 那篇工作 2021 年 2 月已经登上了《自然》,并且论文摘要里明说 「加上一个以目标为条件的策略,可以进一步提升它的探索效率,并让它在整个训练过程中应对随机性」 —— 也就是说它后来确实和神经网络策略结合了。19 ★ 所以书里那句「它不是一个深度强化学习的解决方案」是有日期的 —— 读的时候要把「2021 年 4 月」这个成书时间一并带上。★

7. 第六件:学会一个任务,换一个还是不会

这一节走主走查的第六个位置,并把两个常被混为一谈的词分开。

元学习:学「怎么学」

先看现象:换一个形状的物体,策略几乎要从头再来。

书里给的定义很干净:元学习,也称学会学习,是让智能体根据以往经验在新任务上更快学习的方法, 而非将每个任务作为一个单独的任务20

普通学习: 任务 A 从头学 → 任务 B 从头学 → 任务 C 从头学

元学习: ┌── 内循环:拿当前这套「起手参数」去学任务 A、B、C ──┐
│ │
└── 外循环:照 A、B、C 学得快不快,去改那套起手参数 ──┘
★ 外循环学的不是「怎么做任务」,是「从哪儿起步学得最快」★

书里的说法:普通学习者学一个具体任务的过程是内循环,
而元学习者通过一个外循环来更新内循环学习者;
两者可以同时优化,也可以交替进行。[^20]
书里还说,这个问题最早可以追溯到 1980—1990 年。[^20]

书里列了三个主要类别:循环模型、度量学习、学习优化器20; 书里还说,有一类方法只要给几个例子、或者只更新几步,就能解决一个简单的新任务; 这种「只给几个例子就要学会」的设定,书里叫小样本学习20

表征学习:学一个「什么都不变」的输入

这是另一件事,别和元学习混。 元学习管的是「起手参数」,表征学习管的是**「喂什么进去」**。

书里给的定义:从原始数据中学习表示方式、提取有效信息或特征,便于后面的预测器使用21; 用在强化学习环境里学复杂状态的简单表示时,书里叫它状态表征学习21

书里那个例子非常具体,值得整段记住:

在一段拍摄物体运动的视频里,物体表面角上的关键点(或者物体表面上其他的特殊点)集合, 是对物体运动的一种恒定且鲁棒的表示 ——「尽管帧中的像素点总是随着物体运动而改变」21

主走查上是这样:

直接喂像素: 物体挪 1 厘米 → 整张图几万个像素全变了 → 网络看到的是一个全新输入
喂关键点: 物体挪 1 厘米 → ★ 还是那 8 个角点,只是位置各挪了一点 ★

★ 前者每挪一下就是一个新世界,后者挪一下只是同一件东西换了个位置。★
书里还说:这些关键点的位置在物体运动中会改变,所以可以用来表示运动;
而不同的物体有不同的关键点集合,所以也可以用来区分物体。[^21]
(8 个角点是我们举的数;例子本身是书里的。)

8. 第七件:环境里有一个也在学的家伙

这一节走主走查的第七个位置,并给出全书最有哲学味的一段。

书里的判断

「现代学习算法更多的是出色的受试者,而非创新者。智能体的智能上限可能受到其所在环境的限制。」22

这句话的意思是: 算法很会应付你给它出的题,但它不会自己出新题; 而它能有多聪明,取决于它面对的环境有多难。

所以怎么办?书里给的路是:让环境里出现另一个也在学的家伙。

书里的例子很妙:古老的围棋游戏的发明者从未定义什么策略能够击败对手; 是在一代又一代玩家的自我演化中,大量先进的策略被发明出来 —— 每个智能体作为其他人环境的一部分,而对自身的提高也构成他人的新挑战22

★ 这是一个自己给自己加难度的环路:★

我变强 → 你的环境变难 → 你被逼着变强 → 我的环境变难 → 我再变强
↑ │
└────────────────────────────────────────────────────────────┘

图说:单智能体的环境难度是人定死的,所以智能有上限;
多智能体的环境难度由对手提供,所以没有上限。这就是书里这一段的全部意思。
主走查上对应的是:换成两条机械臂抢同一个物体,「什么算最优」立刻没有答案。

书里给了一个工程上的落点:那个下《星际争霸 II》的系统用了一种叫「联盟」的训练方式 —— ★ 策略优化的单位不再是每个智能体的单一策略,而是整个联盟的智能体 ★23

★ 这一件的完整展开在第 16 章:「最优」怎么换成「均衡」。★

9. 第八件:模拟里学会了,搬上真机就废

这一节走主走查的第八个位置,并给出一个非常具体、书里独有的病因。

名字与定义

模拟和现实之间的差异,书里叫现实鸿沟24书里说得很直接:由于这个差异,「模拟环境中的成功策略无法很好地迁移到相应的现实中」24

一个你多半想不到的病因

大多数人想到的病因是物理不准:摩擦力、质量、光照对不上。 书里给了另一个,而它是纯计算层面的:

在模拟环境或传统强化学习设置下,「状态采集和策略推理过程都认为是始终没有时间损耗的」; 而在现实情况下,这两个过程都可能需要相当的时间 —— 这使得智能体「总是根据先前动作执行时的先前状态产生的滞后观察量来进行动作选择」25

模拟里的一步: 看一眼(0 秒) → 想一下(0 秒) → 动 → 看一眼(0 秒) → …
★ 时间轴上,「看」和「动」是同一个瞬间 ★

真机上的一步: 摄像头拍照 + 定位算法处理(要时间) → 网络前向(要时间) → 动

★ 等它决定要动的时候,眼前这张画面已经是过去式了 ★

书里的落点:实践中的策略其实是「拿延迟了一段时间的观察去决定这一步的动作」,
而不是「拿当前状态决定当前动作」——★ 这两件事不是同一个策略。★[^25]

书里给了一条最直接的补救,和它的新麻烦:修改模拟器,让它也有同样的时间延迟。 但这会带来别的问题 —— 怎么精确地表示和测量模拟与现实中的时间延迟、 怎么保证基于延迟观察量学习的智能体的表现25

两大类解法

书里把解法分成两类26:

类别意思具体做法
零样本(目标环境里一个样本都不用,直接搬过去)★迁移过程中完全不用现实世界的数据再学域随机化
自适应学习拿新环境里的少量数据去适应预训练的策略元学习、残差策略学习、渐进网络

「域随机化」是这一章要留下的名字,而书里给它的定义一句话说得完:

★ 把源环境和目标环境的差异,建模成源环境里的随机性。★26

翻译成人话:既然不知道真机的摩擦力到底是多少,那就在模拟里每次随机换一个 —— 练出来的策略就不会只对某一个摩擦力有效。

书里说这样学到的是更普适的策略,而不是过拟合到具体模拟器设置的策略26; 并给了两类具体随机什么2627:

  • 动力学随机化:摩擦力和质量的大小、力矩和速度的误差 —— 书里说这些在实际机器人上都会影响控制精度(动作做得准不准);
  • 视觉随机化:纹理、光照条件和物体位置 —— 书里说这样可以不需要任何现实的图像就把基于视觉的策略搬到现实里。

★ 这一件的具体展开在第 18 章:那个抓取项目随机了哪几样。★

10. 再加一件:规模

这一节收口,并给出作者最重的一句判断。

作者的明确判断

书里拿两个大型游戏系统当例子。 它说在其中一个里,深度强化学习和监督学习 (比如模仿学习里的行为克隆)都被用在一个基于族群的训练框架中, 再加上几种高级网络结构 ——「这使得深度强化学习在整个策略中实际上只占一小部分」28

然后是这一章分量最重的一句:

「当前的深度强化学习算法本身,对于完美地从端到端去解决一个大规模任务, 可能仍旧是不足够有效且高效的。一些其他技术如模仿学习等通常需要被用来解决这些大规模问题。」28

★ 这句话由这本书的作者写在第 7 章 —— 而这本书的前六章正是在讲那些算法。★ 这是一次很硬的自我限定,不要漏掉。

收尾:作者引了《苦涩的教训》

书里在这一章末尾引了强化学习那位奠基者 2019 年的一篇短文29

引的两段的意思:

  1. 能随算力不断扩展的通用方法,长期看会赢过嵌入人类知识的方法。 书里引的原话是:「有两个看起来能够以这种方式任意扩展的方法是搜索和学习」29;
  2. 不该把「空间、物体、多个智能体、对称性」这类东西直接嵌进系统, 而该去构建能自己找到和采集这种复杂度的元方法29

补充(不在书里,依据我们的 book 书架): 这篇短文的分量比这本书给它的位置大得多 —— 它是今天「大力出奇迹」那套叙事的理论源头。 书架上有一本 AI 简史专门讲了它。30

判断(我们的,不是书里的): 用这篇短文收尾,和这一章前面九节是有张力的。 前面九节讲的全是「怎么把人的知识塞进去」 —— 拿人的示范、拿人设计的奖励、 拿人挑的关键点、拿人写的模拟器;而这篇短文说的恰恰是「别塞」。 我们的读法是:这不是自相矛盾,是作者在标一个时间点 —— 今天必须塞,是因为算法还不够;而长期该往哪走,是另一回事。 如果错,会错在: 书里没有对这两者的关系作任何说明,这是我们补的。 判据是:第 20 章那份工程清单里没有任何一条是「少用人的知识」—— 它通篇都在教你怎么把人的判断塞得更准。

作者的判断与证据

书里给了具体数字或引了实证工作的:

  • 7 台真机、800 小时、4 个月4 —— 引的是 2018 年那项工作;
  • PILCO 的 20–30 次对几百次6;
  • 《蒙特祖玛的复仇》一个房间几十个动作、全游戏 23 个房间14;
  • 表 7.1 的三列数字(动作空间 17 / 361 / 10 的 26 次方)17;
  • ★ 五条稳定性实测结论,尤其是「5 个随机种子可能不够」★10 —— 这是这一章唯一一处有对照实验支撑的结论。

作者的判断(书里没有给证据的):

  • 「这些结果可能不令人满意」15 —— 对两家宣布解决探索难题的评价;
  • 「现代学习算法更多的是出色的受试者,而非创新者」22 —— 一个论断,没有实验;
  • ★「当前的深度强化学习算法本身端到端解决大规模任务仍旧不够有效」★28 —— 书里给的支撑是两个案例,不是普遍论证;
  • 八个挑战这个划分本身 —— 书里没有说明为什么是八个、为什么这么切。

书里的坦白(值得记住的两处):

  • 无偏价值估计需要的那些条件,「实践中经常被放宽」9;
  • 直接在物理系统上训练策略的成功例子,「尚且只在有限的领域得到验证」30

边界与局限

  • ★ 这一章没有一个可执行的方案。★ 它是一份问题清单和一份阅读地图, 每一条的解法都在后面的章里 —— 而其中三条(③ 稳定性、④ 遗忘、⑥ 泛化)根本没有专章;
  • 八个挑战之间的关系书里没有讨论。 比如稀疏奖励和探索显然高度重叠 (书里自己说「稀疏奖励的瓶颈实际在于探索本身」),但它们被列成了两条;
  • 「成百上千个样本」这个数和「人几十次尝试」的单位对不上 —— 前者数的是时间步,后者数的是完整的尝试。这个对比在方向上成立,在量级上不严谨;
  • 书里对每个挑战给的解法都只到「有哪些方向」为止,没有任何方向之间的效果对比;
  • 这一章写于 2021 年 4 月,而它引的很多工作在 2019—2020 年。 离线强化学习这条后来很重要的路,这一章一个字都没提 (总纲第 4 节把它列进了不覆盖的范围);
  • 书里最后那一条「大规模」其实是两件事(算法本身不够用 + 需要并行框架), 而只有后一半在第 17 章有落点。

可带走的

全章那条走查,一行写完: 一个机械臂抓取任务,八个障碍逐一落上去 —— 采样要 7 台真机、800 小时、连续 4 个月(相当于一个人上 100 天班) → 奖励只在抓到时给,中间几万步全是 0、彼此无差别,梯度是 0 → 换一个随机种子,同一份实现给出完全不重合的置信区间 模拟预训练 + 真机微调用了两个不同的损失,前面学的被冲掉 → 夹具乱动撞不到物体 → 换个形状的物体就得重学(除非喂的是关键点而不是像素) → 换成两条臂抢同一个物体,「最优」失效 → 真机上摄像头有延时,它永远在拿过去式的画面做决定。 (①③⑧ 的数字是书里的;其余是把书里的机制落到这个任务上,机制本身都出自书里第 7 章。)

  1. ★ 这一章是全书的转折点:算法史到此为止,后面全是工程议程。★
  2. 八个障碍互不重叠,治好一件其余七件一件不少;而后面六章各治其中一件;
  3. 样本效率的代价不在算力上,在设备损耗、时间和安全上 —— 这是它致命的原因;
  4. ★ 7 台真机、800 小时、4 个月 —— 而书里对这个结果的评价是「一般是无法接受的」。★
  5. 省样本有三条路:借人的示范、借环境模型、改进算法本身;前两条各占后面一整章;
  6. 稀疏奖励的瓶颈其实是探索 —— 书里原话;而它让梯度直接变成 0,不是「学得慢」;
  7. 「不稳」有两种:一条曲线自己抖,和多条曲线互相对不上。第二种更要命;
  8. ★ 5 个随机种子可能不够;精心挑种子能得到完全不重合的置信区间,即使代码一模一样。★ 看到漂亮曲线先问「跑了几个种子」;
  9. 在线策略最容易遗忘(样本高度相关),而回放缓存不只是省样本,还是防遗忘的;
  10. 分阶段训练时换了损失函数,同样会遗忘 —— 补救是冻住一部分层,或者在旁边加一个学修正量的网络;
  11. ★ 两家宣布解决了探索难题,而两家都用了人的示范 —— 作者判为「可能不令人满意」。★ 这句话是后面两章讲模仿学习的理由;
  12. 动作空间:雅达利 17、围棋 361、星际 10 的 26 次方(把 361 连乘十次才够到这个量级);
  13. 元学习管「从哪儿起步」,表征学习管「喂什么进去」 —— 两件事,别混;
  14. 喂关键点而不是像素:物体挪一下,前者只是几个点各挪一点,后者是一个全新的输入;
  15. ★ 智能的上限由环境决定;而环境里有另一个也在学的家伙时,这个上限就没有了。★
  16. 现实鸿沟有一个纯计算的病因:模拟里「看」和「动」在同一瞬间,真机上不是 —— 它永远拿滞后的观察做决定;
  17. 域随机化 = 把源环境和目标环境的差异,建模成源环境里的随机性;
  18. ★ 作者的明确判断:当前算法端到端解决大规模任务仍旧不够有效,通常还得靠模仿学习一类的技术。★

原文地图

主题原书章原文位置
八个挑战的清单与用意第7章 深度强化学习的挑战text/12-ch07.txt:3(搜「本章介绍了现有深度强化学习研究和应用中的挑战」) · text/12-ch07.txt:12(搜「来引出本书第二个」)
样本效率的定义与 Pong 对比第7章 深度强化学习的挑战text/12-ch07.txt:21(搜「一个普通人可能通过几十次尝试就基」) · text/12-ch07.txt:23(搜「它可能需要成百上千个样本来逐渐学到一些有用的策略」)
交互的三种代价第7章 深度强化学习的挑战text/12-ch07.txt:29(搜「设备损耗」)
三条出路第7章 深度强化学习的挑战text/12-ch07.txt:33(搜「从专家示范」) · text/12-ch07.txt:64(搜「那么我们就应该改进算法本身的学习效率」)
PILCO 的 20–30 次与它的死穴第7章 深度强化学习的挑战text/12-ch07.txt:58(搜「用仅 20 到 30 次尝试就能学会一个控制的有效策略」) · text/12-ch07.txt:61(搜「高斯过程的求解无法扩展到复杂模型的高维参数空间上」)
两种不稳定第7章 深度强化学习的挑战text/12-ch07.txt:108(搜「深度强化学习可能非常不稳定或有随机性」) · text/12-ch07.txt:110(搜「非单调增长」)
三条根源与那句坦白第7章 深度强化学习的挑战text/12-ch07.txt:113(搜「移动的目标分」) · text/12-ch07.txt:118(搜「这打破了有效」) · text/12-ch07.txt:127(搜「这些要求或条件经常被」)
五条实测结论第7章 深度强化学习的挑战text/12-ch07.txt:151(搜「策略网络结构可以对 TRPO 和 DDPG 算法的结果有显著影响」) · text/12-ch07.txt:155(搜「5 个随机种子」) · text/12-ch07.txt:156(搜「不同的随机种子可能得到完全不重合的置信区间」)
灾难性遗忘第7章 深度强化学习的挑战text/12-ch07.txt:184(搜「一个叫作灾难性遗忘」) · text/12-ch07.txt:187(搜「从而忘记网络在之前训练过程中所学到的内容」)
在线策略最容易忘第7章 深度强化学习的挑战text/12-ch07.txt:193(搜「这极大促使了灾难性遗忘的发生」)
多阶段训练的遗忘与两条补救第7章 深度强化学习的挑战text/12-ch07.txt:198(搜「两个过程可能」) · text/12-ch07.txt:202(搜「这种在多阶段训练过程损失函数上的不匹配」) · text/12-ch07.txt:205(搜「固定部分网络层并用之前的损失」)
蒙特祖玛的复仇第7章 深度强化学习的挑战text/12-ch07.txt:221(搜「智能体必须完成几十个连续动作来通过一个房间」) · text/12-ch07.txt:229(搜「这里稀疏奖励任务的瓶颈实际在于探索本身」)
两家都用了示范、作者的评价第7章 深度强化学习的挑战text/12-ch07.txt:224(搜「这些结果可能不令人满意」) · text/12-ch07.txt:227(搜「他们让智能体观察 YouTube 视频」) · text/12-ch07.txt:228(搜「使用人类示范来更好地初始化智能体位置」)
表 7.1 三个游戏对照第7章 深度强化学习的挑战text/12-ch07.txt:238(搜「大的动作空间和长的游戏控制序列」) · text/12-ch07.txt:245(搜「动作空间」)
Go-Explore第7章 深度强化学习的挑战text/12-ch07.txt:259(搜「它不是一个深度强」)
元学习的定义与内外循环第7章 深度强化学习的挑战text/12-ch07.txt:283(搜「元学习的问题实际上可以追溯到」) · text/12-ch07.txt:288(搜「是让智能体根据以往经验在新任务上更快学习的方法」)
表征学习与关键点第7章 深度强化学习的挑战text/12-ch07.txt:301(搜「表征学习起初在机器学习中提出」) · text/12-ch07.txt:309(搜「物体表面角上的关键点」) · text/12-ch07.txt:310(搜「尽管帧中的像素点总是随着物体运动而」)
受试者而非创新者、围棋的例子第7章 深度强化学习的挑战text/12-ch07.txt:325(搜「现代学习算法更多的是出色的受试者」) · text/12-ch07.txt:330(搜「的发明者从未定义什么策略能够击败对手」)
联盟与优化单位第7章 深度强化学习的挑战text/12-ch07.txt:344(搜「在 PBT 中,策略优化的单位不再是每」)
7 台真机 800 小时 4 个月第7章 深度强化学习的挑战text/12-ch07.txt:367(搜「提出能同时在 7 个真实机器人上进行分布式训练的 QT-Opt」) · text/12-ch07.txt:368(搜「但是需要持续 4 个月的 800 个小时的机器人数据采样时间作为代价」)
观察滞后这个病因第7章 深度强化学习的挑战text/12-ch07.txt:403(搜「状态采集和策略推理过程都认为是始终没有时间损耗的」) · text/12-ch07.txt:404(搜「这使得智能体总是根据先前动作执行时的先前状态产生的滞后观察量」) · text/12-ch07.txt:414(搜「如何精确地表示和测量模」)
现实鸿沟与两类解法第7章 深度强化学习的挑战text/12-ch07.txt:425(搜「这个现实鸿沟即模拟和现实的差异」) · text/12-ch07.txt:435(搜「渐进网络」) · text/12-ch07.txt:438(搜「源和目标域的差异被建模为源域中的随机性」)
随机什么:动力学与视觉第7章 深度强化学习的挑战text/12-ch07.txt:440(搜「摩擦力和质量的大小」) · text/12-ch07.txt:445(搜「包括纹理、光照条件和物体位置等」)
深度强化学习只占一小部分第7章 深度强化学习的挑战text/12-ch07.txt:477(搜「这使得深度强化学习」) · text/12-ch07.txt:482(搜「当前的深度强化学习算法本身对于完美地从端到端去解决一个大规模任务可能仍旧」)
引《苦涩的教训》第7章 深度强化学习的挑战text/12-ch07.txt:509(搜「即那些能够随着计算能力提升而不断扩展的方法」) · text/12-ch07.txt:517(搜「我们应当只构建元方法来找到」) · text/12-ch07.txt:521(搜「The Bitter Lesson」)

Footnotes

  1. 出处:「第7章 深度强化学习的挑战」第 3 段(text/12-ch07.txt:3,搜「本章介绍了现有深度强化学习研究和应用中的挑战」)与第 12 段(text/12-ch07.txt:12,搜「来引出本书第二个」)。原文写明这一章的用意是引出第二个板块(原书第 8 到 12 章),给读者关于现有方法缺陷、近来发展和未来方向的理解。 2

  2. 出处:「第7章 深度强化学习的挑战」第 17 段(text/12-ch07.txt:17,搜「样本高效」)、第 21 段(text/12-ch07.txt:21,搜「一个普通人可能通过几十次尝试就基」)与第 23 段(text/12-ch07.txt:23,搜「它可能需要成百上千个样本来逐渐学到一些有用的策略」)。原文的定义是:样本高效意味着算法可以更好地利用收集到的样本,从而实现更快速的策略学习。 2

  3. 出处:「第7章 深度强化学习的挑战」第 25 段(text/12-ch07.txt:25,搜「现实世界中的智能体与环境交互往往有较大的代价」)与第 29 段(text/12-ch07.txt:29,搜「设备损耗」)。原文还说,即使在模拟环境中交互也需要时间和能源上的消耗。

  4. 出处:「第7章 深度强化学习的挑战」第 367 段(text/12-ch07.txt:367,搜「提出能同时在 7 个真实机器人上进行分布式训练的 QT-Opt」)、第 368 段(text/12-ch07.txt:368,搜「但是需要持续 4 个月的 800 个小时的机器人数据采样时间作为代价」)与第 369 段(text/12-ch07.txt:369,搜「但是其时间消耗和资源上的要求一般是无法接受的」)。这段在原书的 7.7 节,不在 7.1 节。 2

  5. 出处:「第7章 深度强化学习的挑战」第 33 段(text/12-ch07.txt:33,搜「从专家示范」)与第 64 段(text/12-ch07.txt:64,搜「那么我们就应该改进算法本身的学习效率」)。原文对前两条的归纳是:它们都是「利用额外信息」;第三条是不利用额外信息。 2

  6. 出处:「第7章 深度强化学习的挑战」第 54 段(text/12-ch07.txt:54,搜「一种基于模型的高效强化学习算法叫 PILCO」)、第 58 段(text/12-ch07.txt:58,搜「用仅 20 到 30 次尝试就能学会一个控制的有效策略」)与第 61 段(text/12-ch07.txt:61,搜「高斯过程的求解无法扩展到复杂模型的高维参数空间上」)。原文说 PILCO 用的是「非参数化的概率模型高斯过程」来近似环境的动力学,而不是用神经网络拟合。 2 3

  7. 出处:「第7章 深度强化学习的挑战」第 229 段(text/12-ch07.txt:229,搜「这里稀疏奖励任务的瓶颈实际在于探索本身」)、第 230 段(text/12-ch07.txt:230,搜「不平滑且非凸的超曲面」)与第 233 段(text/12-ch07.txt:233,搜「可能也没有对这些样本充分重视」)。 2 3

  8. 出处:「第7章 深度强化学习的挑战」第 108 段(text/12-ch07.txt:108,搜「深度强化学习可能非常不稳定或有随机性」)、第 110 段(text/12-ch07.txt:110,搜「非单调增长」)与第 111 段(text/12-ch07.txt:111,搜「不稳定的学习过程体现为在每一个阶段上的多次学习表现之间的巨大差异」)。 2 3

  9. 出处:「第7章 深度强化学习的挑战」第 113 段(text/12-ch07.txt:113,搜「移动的目标分」)、第 118 段(text/12-ch07.txt:118,搜「这打破了有效」)、第 127 段(text/12-ch07.txt:127,搜「这些要求或条件经常被」)与第 131 段(text/12-ch07.txt:131,搜「数值计算的随机种子」)。原文还提到第 2 章那个「可兼容函数拟合条件」是无偏估计的前提,而实践中它常被放宽。 2 3

  10. 出处:「第7章 深度强化学习的挑战」第 149 段(text/12-ch07.txt:149,搜「先前关于强化学习的调研」)、第 151 段(text/12-ch07.txt:151,搜「策略网络结构可以对 TRPO 和 DDPG 算法的结果有显著影响」)、第 155 段(text/12-ch07.txt:155,搜「5 个随机种子」)与第 156 段(text/12-ch07.txt:156,搜「不同的随机种子可能得到完全不重合的置信区间」)。原书引的是 Henderson 等人 2018 年那篇调研;五条结论是原书的逐条转述。 2 3

  11. 出处:「第7章 深度强化学习的挑战」第 180 段(text/12-ch07.txt:180,搜「追逐一个移动目标的过程」)、第 184 段(text/12-ch07.txt:184,搜「一个叫作灾难性遗忘」)、第 187 段(text/12-ch07.txt:187,搜「从而忘记网络在之前训练过程中所学到的内容」)与第 188 段(text/12-ch07.txt:188,搜「一种局限性」)。 2 3

  12. 出处:「第7章 深度强化学习的挑战」第 193 段(text/12-ch07.txt:193,搜「这极大促使了灾难性遗忘的发生」)与第 194 段(text/12-ch07.txt:194,搜「验回放池来缓解这个问题」)。原文还说,基于信赖域的方法(第 09 章那两个)对更新范围做了限制,换来的是稳定但相对缓慢的进步。

  13. 出处:「第7章 深度强化学习的挑战」第 198 段(text/12-ch07.txt:198,搜「两个过程可能」)、第 202 段(text/12-ch07.txt:202,搜「这种在多阶段训练过程损失函数上的不匹配」)、第 205 段(text/12-ch07.txt:205,搜「固定部分网络层并用之前的损失」)与第 207 段(text/12-ch07.txt:207,搜「残差策略学习」)。原书在这里明说残差策略学习会在原书 8.6 节展开,也就是我们的第 12 章。 2 3 4 5

  14. 出处:「第7章 深度强化学习的挑战」第 219 段(text/12-ch07.txt:219,搜「是一个非常典型的稀」)与第 221 段(text/12-ch07.txt:221,搜「智能体必须完成几十个连续动作来通过一个房间」)。原文还说另一个雅达利游戏 Pitfall 也有相似的情况,这两个游戏常被用作评估探索能力的基准。 2

  15. 出处:「第7章 深度强化学习的挑战」第 223 段(text/12-ch07.txt:223,搜「都声称他们用高效的深度强化学习方法」)、第 224 段(text/12-ch07.txt:224,搜「这些结果可能不令人满意」)、第 227 段(text/12-ch07.txt:227,搜「他们让智能体观察 YouTube 视频」)与第 228 段(text/12-ch07.txt:228,搜「使用人类示范来更好地初始化智能体位置」)。 2 3

  16. 出处:「第7章 深度强化学习的挑战」第 235 段(text/12-ch07.txt:235,搜「较大的动作空间和不稳定的环境」)与第 238 段(text/12-ch07.txt:238,搜「大的动作空间和长的游戏控制序列」)。 2

  17. 出处:「第7章 深度强化学习的挑战」第 245 段(text/12-ch07.txt:245,搜「动作空间」)。这是原书的表 7.1。要注意一处转码陷阱: 星际那一格在清洗出来的文本里显示为「1026」,那是上标丢失所致,实际是 10 的 26 次方 —— 从量级上也只能是它,17 与 361 都是普通整数。 2

  18. 出处:「第7章 深度强化学习的挑战」第 259 段(text/12-ch07.txt:259,搜「它不是一个深度强」)与第 260 段(text/12-ch07.txt:260,搜「首先使用无神经网络的确定性训练来探索游戏世」)。

  19. 补充(不在书里):Go-Explore 的正式发表是《First return, then explore》,作者依次为 Adrien Ecoffet、Joost Huizinga、Joel Lehman、Kenneth O. Stanley、Jeff Clune,刊于 Nature 590 卷 580–586 页(2021 年),预印本编号 arXiv:2004.12919。摘要里明写它「加上一个以目标为条件的策略,可以进一步提升探索效率并在整个训练过程中应对随机性」。来源:arXiv 摘要页 https://arxiv.org/abs/2004.12919 (查阅于 2026-08-29)。

  20. 出处:「第7章 深度强化学习的挑战」第 283 段(text/12-ch07.txt:283,搜「元学习的问题实际上可以追溯到」)、第 288 段(text/12-ch07.txt:288,搜「是让智能体根据以往经验在新任务上更快学习的方法」)、第 291 段(text/12-ch07.txt:291,搜「三个元学习的主要类别为循环」)与第 296 段(text/12-ch07.txt:296,搜「小样本学习」)。 2 3

  21. 出处:「第7章 深度强化学习的挑战」第 301 段(text/12-ch07.txt:301,搜「表征学习起初在机器学习中提出」)、第 306 段(text/12-ch07.txt:306,搜「这被称为状态表征学习」)、第 309 段(text/12-ch07.txt:309,搜「物体表面角上的关键点」)与第 310 段(text/12-ch07.txt:310,搜「尽管帧中的像素点总是随着物体运动而」)。原书还提到这些关键点在计算机视觉里的术语叫「描述器」。 2 3

  22. 出处:「第7章 深度强化学习的挑战」第 325 段(text/12-ch07.txt:325,搜「现代学习算法更多的是出色的受试者」)、第 330 段(text/12-ch07.txt:330,搜「的发明者从未定义什么策略能够击败对手」)与第 331 段(text/12-ch07.txt:331,搜「大量先进的策略被发明出来」)。 2 3

  23. 出处:「第7章 深度强化学习的挑战」第 344 段(text/12-ch07.txt:344,搜「在 PBT 中,策略优化的单位不再是每」)。原书说的是 AlphaStar 用「基于族群的训练」框架,每个智能体是图里的一个色块。

  24. 出处:「第7章 深度强化学习的挑战」第 371 段(text/12-ch07.txt:371,搜「模拟到现实迁移」)与第 425 段(text/12-ch07.txt:425,搜「这个现实鸿沟即模拟和现实的差异」)。 2

  25. 出处:「第7章 深度强化学习的挑战」第 403 段(text/12-ch07.txt:403,搜「状态采集和策略推理过程都认为是始终没有时间损耗的」)、第 404 段(text/12-ch07.txt:404,搜「这使得智能体总是根据先前动作执行时的先前状态产生的滞后观察量」)、第 412 段(text/12-ch07.txt:412,搜「而这不同于模拟中根据实时观察量训」)与第 414 段(text/12-ch07.txt:414,搜「如何精确地表示和测量模」)。原书还提到两项针对这个问题的工作,其中一项叫「边运动边思考」。 2

  26. 出处:「第7章 深度强化学习的挑战」第 427 段(text/12-ch07.txt:427,搜「零样本」)、第 435 段(text/12-ch07.txt:435,搜「渐进网络」)、第 438 段(text/12-ch07.txt:438,搜「源和目标域的差异被建模为源域中的随机性」)与第 439 段(text/12-ch07.txt:439,搜「而非过拟合到具体模拟器设置的特征策略」)。原书把「零样本」定义为:迁移过程中没有任何基于现实世界数据的进一步学习过程。 2 3 4

  27. 出处:「第7章 深度强化学习的挑战」第 440 段(text/12-ch07.txt:440,搜「摩擦力和质量的大小」)与第 445 段(text/12-ch07.txt:445,搜「包括纹理、光照条件和物体位置等」)。原书把前者叫「动力学随机化」,并说视觉随机化可以不需要任何现实图像就把基于视觉的策略搬到现实。

  28. 出处:「第7章 深度强化学习的挑战」第 477 段(text/12-ch07.txt:477,搜「这使得深度强化学习」)与第 482 段(text/12-ch07.txt:482,搜「当前的深度强化学习算法本身对于完美地从端到端去解决一个大规模任务可能仍旧」)。原书举的两个例子分别是 AlphaStar 与 OpenAI Five,并说前者的关键步骤是怎么从示范数据里学、怎么结合联盟里不同的次优策略。 2 3

  29. 出处:「第7章 深度强化学习的挑战」第 507 段(text/12-ch07.txt:507,搜「我们引用 Richard Sutton」)、第 509 段(text/12-ch07.txt:509,搜「即那些能够随着计算能力提升而不断扩展的方法」)、第 517 段(text/12-ch07.txt:517,搜「我们应当只构建元方法来找到」)与第 521 段(text/12-ch07.txt:521,搜「The Bitter Lesson」)。原书在脚注里给了这篇短文的标题与日期:2019 年 3 月 13 日。 2 3

  30. 出处:「第7章 深度强化学习的挑战」第 370 段(text/12-ch07.txt:370,搜「尚且只在有限的领域得到验证」)。另,补充(不在书里,依据我们的 book 书架):这篇短文在 AI 发展史上的位置,书架上有专门的拆解。依据: shelf=ai-book-reference/ren-gong-zhi-neng-jian-shi#05-learning-from-nature.md 事实=那一章把《苦涩的教训》讲成「通用方法加算力打败专用方法」,并把它认作今天规模定律叙事的思想源头。 2