跳到主要内容

前沿与收官 — 方法空间、奖励设计与作者自认的欠账

这一章讲三件事: off-policy 学习的「真实用途」 finally 亮出来(泛值函数与 options); 奖励信号设计的四类坑与作者开的药方; 以及那六条作者承认「就算全书都对,仍然悬着」的问题。 读完你会拿到这本书的方法论遗嘱——哪些它认为已解决,哪些它自己都没敢签字。

1. off-policy 的终极理由:并行(同时、互不等待)学很多预测

前文一直把 off-policy 当作「探索的技术手段」;收官章才亮出底牌:off-policy 的充分理由是想要一条经验流,同时学大量不同的预测。人不仅预测奖励——预测眨眼后会看到什么、走路回家要多久、投篮命中的概率;这些「泛值函数」(GVF:任意问题+任意策略下的值函数)各有自己的目标策略,一条行为流不可能同时等于所有目标策略,唯有 off-policy 能并行(同时进行、互不等待)学1。这也顺手解释了世界模型(对「环境接下来会怎样」的内部预测)与规划的数据来源(第 08 章的伏笔在此回收)1

第二件武器 options(时间抽象):把「一串动作+终止条件」打包成一个宏观动作,使规划可以在不同时间尺度上进行;option 模型的学习同样是 off-policy 问题2

2. 奖励设计:应用的成败题

书里给了应用工程里最实在的一节。先立共识:RL 相对监督学习的优势是不需要告诉它正确动作;但代价是——奖励信号怎么框定目标、怎么如实反映进展,直接决定应用成败3。四类坑,书里逐一给了4:

内容书里的药方
目标难翻译家务机器人这类复杂目标压不成一个数老实迭代:设计者盯行为,改信号,再试
agent 走野路它会发现「意想不到的拿奖励方式」,可能危险一切基于优化的方法的通病;交给安全议题(第 5 节)
稀疏(非零奖励寥寥可数)奖励非零奖励稀少到 agent 可能永远撞不上一次(「plateau 问题」,Minsky 1961)别急着加子目标奖励(见下)
好心的毒药给「中间步骤」发奖励,agent 可能学会拿中间步不达终点不动奖励,改给值函数一个初始猜测(式 17.11)

最后一条最反直觉也最值钱:想引导学习,首选不是改奖励信号,而是把领域直觉灌进值函数的初值 v̂(s,w)=wᵀx(s)+v₀(s)——直觉作为先验垫底,渐近最优性不受损4

主走查:同一个小房间,两种引导方式(数值为演示编的,式 17.11 为书中定义):

任务:清扫机器人,房间 s 的真值是 4 分(设计者心里有数,机器人不知道)。

方式一(毒药):给「抵达 s」直接发 8 分子目标奖励。
后果:机器人学会反复进出 s 刷这 8 分——中间步成了终点,真任务反而没人干。

方式二(先验,式 17.11):奖励信号一个字不动,给值函数垫初值:
取 v₀(s)=8、特征 x(s)=1、权重 w=0 → v̂(s,w) = 0×1 + 8 = 8
开局:机器人「觉得」s 值 8,更愿意先去 s —— 引导达成;
学真:经验发现 s 只值 4,TD 误差为负,权重被往负向推,v̂ 从 8 滑向 4
—— 先验只管开局,渐近答案由数据决定,不会被 8 绑架。

对照读法:同一份直觉,放进奖励信号里是毒药,垫进值函数初值里是拐杖。

作者还提醒:人脑的奖励信号是几百万年演化调出来的,别把设计奖励当成容易事4

3. 作者自认的欠账:六条

书里问了个罕见的问题:「假设本书的路线图全对,还剩什么没解决?」然后自己列了六条5。逐条交齐(每条原文都只给方向,没给方案):

  1. 适合在线增量环境的函数逼近仍缺席——原话狠:「An honest assessment has to be that current deep learning methods are not well suited to online learning」;新知识覆盖旧知识(灾难性干扰),业界用 replay buffer 绕,而不是治。作者还补刀:多数深度学习研究在「绕开」这个限制,不在「移除」它6
  2. 表示学习:怎么让经验不只学会一个函数,还学会「让以后学得更快」的归纳偏置(学习系统的天生倾向)——1950 年代传下来的老问题,书里说「也许就没有解」7
  3. 用学到的模型做规划,缺可扩展的方法:AlphaGo Zero 那类成功靠的是规则给定的模型;「从数据学出模型、再拿去规划」的完整案例很少——Dyna 用的还是表格模型,应用被卡死;而且模型学多精选多粗,直接决定规划效率8
  4. 让 agent 自己挑任务:现在学哪些辅助任务、泛值函数的三个件怎么定,全靠设计者手选;要让 agent 自动给自己出题,任务选择本身就得成为可表示、可查可换的东西9
  5. 计算版的好奇心:拿「学习进展」本身当内部(内在)奖励,让行为反过来喂养学习,长出类似玩耍的机制10
  6. 安全:让「把 RL agent 嵌进物理环境」这件事足够安全——作者称这是最紧迫的一条,下一节直接接着谈11

4. RL 与 AI 的未来:作者的态度

成书前夜的形势判断:深度强化学习刚带来一波真实应用,但「人工智能与人类(及其他动物)智能之间的鸿沟依然巨大」——超人在封闭领域(Go)与「完整、交互、能快速学习的通用 agent」之间隔着作者明说的距离12。对安全议题,作者借 Herbert Simon 2000 年的普罗米修斯/潘多拉演讲表了态:技术新知必然两用,「作为未来的设计者而非看客,我们的抉择能让天平倒向普罗米修斯一边」;具体到 RL:模拟器里学最安全,但 RL 的全部潜力要求 agent 住进真实世界(而不只待在模拟器里)——那正是危险开始的地方13

5. 收官:把全书装回「维度」里

第 08 章末的方法空间地图,现在可以填完了。全书所有方法的共同骨架三件事:估价值函数、沿轨迹 backup、GPI;差异全在一组坐标轴上(宽度、深度、on/off-policy、回报定义、值类型、探索方式、同步性、经验来源、更新位置/时机/记忆,加上第二部分补上的函数逼近这根轴)14。作者的方法论立场可以一句话复述:不要背算法清单,要背坐标轴——新算法不过是老坐标上的新取值。

6. 作者的判断与证据

书里给了设计的: 式 17.11(值初值先验)有推导与适用条件;GVF/options 的形式定义齐全。

作者的立场(全书最后的立场清单): ①「便宜的无模型方法」是正道(前言已表);②深度学习与 RL 的联姻当前是「相互将就」而非「天作之合」(第 1 条欠账);③RL 的心理学/神经科学连接让它在「理解心智」这个 AI 老目标上有特殊份额;④安全上站 Simon 的「设计者」立场——乐观,但把责任收进工程师手里13

书里坦白的: 六条欠账本身就是全书最大的一块坦白;另有一句值得单独引——「我们不能确定还需要什么,只能猜」5

7. 边界与局限

  • GVF/options 在 2018 年都是框架不是成果:没有杀手级应用背书,书里也只作方向陈述。
  • 奖励设计的「药方」主要是经验法则;式 17.11 只解决「引导」不解决「目标翻译」。
  • 六条欠账里最核心的两条(在线深度学习、表示学习)到今天仍是开放问题——引用本书谈「未来」时,先核对哪条已被后续工作兑现。
  • 未来一节的社会议题(医疗、教育、公共交通这类领域)停留在展望层,没有案例支撑。

8. 可带走的

  1. off-policy 的终极理由:一条经验流,并行学大量预测(GVF);探索只是顺带的好处。
  2. 想引导学习,先改值函数初值,别改奖励:子目标奖励是最容易翻车的帮忙方式。
  3. 奖励设计四坑:难翻译、走野路、稀疏、好心的毒药;每一条都有翻车的真实案例在书外。
  4. 作者的自我批评:当前深度学习「不擅长在线学习」,灾难性干扰是结构缺陷,replay buffer 是绕不是治——评估深度 RL 方案时先问这一条。
  5. 维度思维:方法=坐标取值;读新论文先问它动了哪根轴。
  6. 鸿沟仍在:封闭领域超人 ≠ 通用智能;别拿 AlphaGo 的战绩外推到开放任务。
  7. 安全立场:设计者而非看客;住进真实世界是 RL 的潜力所在,也是风险所在。

9. 原文地图

主题原书章原文位置
泛值函数、off-policy 终极理由Frontierstext/20-fm-frontiers.txt:8(搜「General Value Functions」) · text/20-fm-frontiers.txt:8(搜「auxiliary」)
optionsFrontierstext/20-fm-frontiers.txt:98(搜「Options」)
奖励设计定位Frontierstext/20-fm-frontiers.txt:453(搜「critical」)
几百万年演化Frontierstext/20-fm-frontiers.txt:460(搜「millions of years」)
意外拿奖励、危险Frontierstext/20-fm-frontiers.txt:473(搜「undesirable」)
稀疏奖励、plateauFrontierstext/20-fm-frontiers.txt:482(搜「plateau」)
好心的毒药、值初值药方Frontierstext/20-fm-frontiers.txt:492(搜「well-intentioned」) · text/20-fm-frontiers.txt:495(搜「initial guess」)
六条欠账、诚实评估Frontierstext/20-fm-frontiers.txt:591(搜「Remaining Issues」) · text/20-fm-frontiers.txt:619(搜「An honest assessment」) · text/20-fm-frontiers.txt:615(搜「catastrophic interference」)
表示学习Frontierstext/20-fm-frontiers.txt:425(搜「representation learning」)
鸿沟Frontierstext/20-fm-frontiers.txt:732(搜「remains great」)
Simon、设计者立场Frontierstext/20-fm-frontiers.txt:766(搜「Prometheus」) · text/20-fm-frontiers.txt:772(搜「carelessly deployed」)
模拟 vs 真实世界Frontierstext/20-fm-frontiers.txt:779(搜「simulated experience」)
本书路线自述(Dyna 式组合)Frontierstext/20-fm-frontiers.txt:593(搜「Dyna architecture」)
维度收官Planning and Learningtext/11-fm-planning-and-learning-with-tabular-methods.txt:1355(搜「three key ideas」)

Footnotes

  1. 出处:「Frontiers」第 8 段(text/20-fm-frontiers.txt:8,搜「General Value Functions」)与第 11 段(搜「auxiliary」);off-policy 的完整理由陈述在第 591-598 段(搜「Dyna architecture」附近,搜「off-policy」亦可)。 2

  2. 出处:「Frontiers」第 98 段(text/20-fm-frontiers.txt:98,搜「Options」);option 模型学习是离策问题在第 889 段(搜「options was intro」→ 以 verify 为准,搜「temporally abstract」亦可)。

  3. 出处:「Frontiers」第 453 段(text/20-fm-frontiers.txt:453,搜「critical」)与第 447 段(搜「detailed instructional」)。

  4. 出处:「Frontiers」第 460 段(text/20-fm-frontiers.txt:460,搜「millions of years」);野路与危险在第 463-466 段(搜「undesirable」);稀疏与 plateau 在第 470-473 段(搜「plateau」);子目标奖励的风险与值初值药方在第 479-483 段(text/20-fm-frontiers.txt:492,搜「well-intentioned」;式 17.11 见第 488 段附近,搜「asymptotic」)。 2 3

  5. 出处:「Frontiers」第 591 段(text/20-fm-frontiers.txt:591,搜「Remaining Issues」);「只能猜」在第 599 段(搜「make some guesses」)。 2

  6. 出处:「Frontiers」第 619 段(text/20-fm-frontiers.txt:619,搜「An honest assessment」);灾难性干扰与 replay buffer 在第 606-610 段(搜「catastrophic interference」);「绕开而非移除」在第 612 段(搜「working around」)。

  7. 出处:「Frontiers」第 425 段(text/20-fm-frontiers.txt:425,搜「representation learning」);「也许没有解」在第 620 段(搜「Perhaps there is no solution」)。

  8. 出处:「Frontiers」第 643 段(text/20-fm-frontiers.txt:643,搜「scalable methods for planning」);「模型学习需要有取舍」在第 655 段(搜「needs to be selective」)。

  9. 出处:「Frontiers」第 669 段(text/20-fm-frontiers.txt:669,搜「automating the」);「任务选择要从设计者脑中搬进机器」在第 679-682 段(搜「explicitly represented」)。

  10. 出处:「Frontiers」第 692 段(text/20-fm-frontiers.txt:692,搜「fifth issue」)与第 700 段(搜「computational form of curiosity」)。

  11. 出处:「Frontiers」第 710 段(text/20-fm-frontiers.txt:710,搜「acceptably safe to embed」);「最紧迫」在第 709 段(搜「most pressing」)。

  12. 出处:「Frontiers」第 732 段(text/20-fm-frontiers.txt:732,搜「remains great」)。

  13. 出处:「Frontiers」第 766 段(text/20-fm-frontiers.txt:766,搜「Prometheus」)与第 753 段(搜「carelessly deployed」);真实世界嵌入的必要与危险在第 770-780 段(搜「embedded」)。 2

  14. 出处:「Planning and Learning with Tabular Methods」第 1355 段(text/11-fm-planning-and-learning-with-tabular-methods.txt:1355,搜「three key ideas」);函数逼近维度在第 1449 段(搜「orthogonal spectrum」)。