前沿与收官 — 方法空间、奖励设计与作者自认的欠账
这一章讲三件事: off-policy 学习的「真实用途」 finally 亮出来(泛值函数与 options); 奖励信号设计的四类坑与作者开的药方; 以及那六条作者承认「就算全书都对,仍然悬着」的问题。 读完你会拿到这本书的方法论遗嘱——哪些它认为已解决,哪些它自己都没敢签字。
1. off-policy 的终极理由:并行(同时、互不等待)学很多预测
前文一直把 off-policy 当作「探索的技术手段」;收官章才亮出底牌:off-policy 的充分理由是想要一条经验流,同时学大量不同的预测。人不仅预测奖励——预测眨眼后会看到什么、走路回家要多久、投篮命中的概率;这些「泛值函数」(GVF:任意问题+任意策略下的值函数)各有自己的目标策略,一条行为流不可能同时等于所有目标策略,唯有 off-policy 能并行(同时进行、互不等待)学1。这也顺手解释了世界模型(对「环境接下来会怎样」的内部预测)与规划的数据来源(第 08 章的伏笔在此回收)1。
第二件武器 options(时间抽象):把「一串动作+终止条件」打包成一个宏观动作,使 规划可以在不同时间尺度上进行;option 模型的学习同样是 off-policy 问题2。
2. 奖励设计:应用的成败题
书里给了应用工程里最实在的一节。先立共识:RL 相对监督学习的优势是不需要告诉它正确动作;但代价是——奖励信号怎么框定目标、怎么如实反映进展,直接决定应用成败3。四类坑,书里逐一给了4:
| 坑 | 内容 | 书里的药方 |
|---|---|---|
| 目标难翻译 | 家务机器人这类复杂目标压不成一个数 | 老实迭代:设计者盯行为,改信号,再试 |
| agent 走野路 | 它会发现「意想不到的拿奖励方式」,可能危险 | 一切基于优化的方法的通病;交给安全议题(第 5 节) |
| 稀疏(非零奖励寥寥可数)奖励 | 非零奖励稀少到 agent 可能永远撞不上一次(「plateau 问题」,Minsky 1961) | 别急着加子目标奖励(见下) |
| 好心的毒药 | 给「中间步骤」发奖励,agent 可能学会拿中间步不达终点 | 不动奖励,改给值 函数一个初始猜测(式 17.11) |
最后一条最反直觉也最值钱:想引导学习,首选不是改奖励信号,而是把领域直觉灌进值函数的初值 v̂(s,w)=wᵀx(s)+v₀(s)——直觉作为先验垫底,渐近最优性不受损4。
主走查:同一个小房间,两种引导方式(数值为演示编的,式 17.11 为书中定义):
任务:清扫机器人,房间 s 的真值是 4 分(设计者心里有数,机器人不知道)。
方式一(毒药):给「抵达 s」直接发 8 分子目标奖励。
后果:机器人学会反复进出 s 刷这 8 分——中间步成了终点,真任务反而没人干。
方式二(先验,式 17.11):奖励信号一个字不动,给值函数垫初值:
取 v₀(s)=8、特征 x(s)=1、权重 w=0 → v̂(s,w) = 0×1 + 8 = 8
开局:机器人「觉得」s 值 8,更愿意先去 s —— 引导达成;
学真:经验发现 s 只值 4,TD 误差为负,权重被往负向推,v̂ 从 8 滑向 4
—— 先验只管开局,渐近答案由数据决定,不会被 8 绑架。
对照读法:同一份直觉,放进奖励信号里是毒药,垫进值函数初值里是拐杖。
作者还提醒:人脑的奖励信号是几百万年演化调出来的,别把设计奖励当成容易事4。
3. 作者自认的欠账:六条
书里问了个罕见的问题:「假设本书的路线图全对,还剩什么没解决?」然后自己列了六条5。逐条交齐(每条原文都只给方向,没给方案):
- 适合在线增量环境的函数逼近仍缺席——原话狠:「An honest assessment has to be that current deep learning methods are not well suited to online learning」;新知识覆盖旧知识(灾难性干扰),业界用 replay buffer 绕,而不是治。作者还补刀:多数深度学习研究在「绕开」这个限制,不在「移除」它6。
- 表示学习:怎么让经验不只学会一个函数,还学会「让以后学得更快」的归纳偏置(学习系统的天生倾向)——1950 年代传下来的老问题,书里说「也许就没有解」7。
- 用学到的模型做规划,缺可扩展的方法:AlphaGo Zero 那类成功靠的是规则给定的模型;「从数据学出模型、再拿去规划」的完整案例很少——Dyna 用的还是表格模型,应用被卡死;而且模型学多精选多粗,直接决定规划效率8。
- 让 agent 自己挑任务:现在学哪些辅助任务、泛值函数的三个件怎么定,全靠设计者手选;要让 agent 自动给自己出题,任务选择本身就得成为可表示、可查可换的东西9。
- 计算版的好奇心:拿「学习进展」本身当内部(内在)奖励,让行为反过来喂养学习,长出类似玩耍的机制10。
- 安全:让「把 RL agent 嵌进物理 环境」这件事足够安全——作者称这是最紧迫的一条,下一节直接接着谈11。
4. RL 与 AI 的未来:作者的态度
成书前夜的形势判断:深度强化学习刚带来一波真实应用,但「人工智能与人类(及其他动物)智能之间的鸿沟依然巨大」——超人在封闭领域(Go)与「完整、交互、能快速学习的通用 agent」之间隔着作者明说的距离12。对安全议题,作者借 Herbert Simon 2000 年的普罗米修斯/潘多拉演讲表了态:技术新知必然两用,「作为未来的设计者而非看客,我们的抉择能让天平倒向普罗米修斯一边」;具体到 RL:模拟器里学最安全,但 RL 的全部潜力要求 agent 住进真实世界(而不只待在模拟器里)——那正是危险开始的地方13。
5. 收官:把全书装回「维度」里
第 08 章末的方法空 间地图,现在可以填完了。全书所有方法的共同骨架三件事:估价值函数、沿轨迹 backup、GPI;差异全在一组坐标轴上(宽度、深度、on/off-policy、回报定义、值类型、探索方式、同步性、经验来源、更新位置/时机/记忆,加上第二部分补上的函数逼近这根轴)14。作者的方法论立场可以一句话复述:不要背算法清单,要背坐标轴——新算法不过是老坐标上的新取值。
6. 作者的判断与证据
书里给了设计的: 式 17.11(值初值先验)有推导与适用条件;GVF/options 的形式定义齐全。
作者的立场(全书最后的立场清单): ①「便宜的无模型方法」是正道(前言已表);②深度学习与 RL 的联姻当前是「相互将就」而非「天作之合」(第 1 条欠账);③RL 的心理学/神经科学连接让它在「理解心智」这个 AI 老目标上有特殊份额;④安全上站 Simon 的「设计者」立场——乐观,但把责任收进工程师手里13。
书里坦白的: 六条欠账本身就是全书最大的一块坦白;另有一句值得单独引——「我们不能确定还需要什么,只能猜」5。
7. 边界与局限
- GVF/options 在 2018 年都是框架不是成果:没有杀手级应用背书,书里也只作方向陈述。
- 奖励设计的「药方」主要是经验法则;式 17.11 只解决「引导」不解决「目标翻译」。
- 六条欠账里最核心的两条(在线深度学习、表示学习)到今天仍是开放问题——引用本书谈「未来」时,先核对哪条已被后续工作兑现。
- 未来一节的社会议题(医疗、教育、公共交通这类领域)停留在展望层,没有案例支撑。
8. 可带走的
- off-policy 的终极理由:一条经验流,并行学大量预测(GVF);探索只是顺带的好处。
- 想引导学习,先改值函数初值,别改奖励:子目标奖励是最容易翻车的帮忙方式。
- 奖励设计四坑:难翻译、走野路、稀疏、好心的毒药;每一条都有翻车的真实案例在书外。
- 作者的自我批评:当前深度学习「不擅长在线学习」,灾难性干扰是结构缺陷,replay buffer 是绕不是治——评估深度 RL 方案时先问这一条。
- 维度思维:方法=坐标取值;读新论文先问它动了哪根轴。
- 鸿沟仍在:封闭领域超人 ≠ 通用智能;别拿 AlphaGo 的战绩外推到开放任务。
- 安全立场:设计者 而非看客;住进真实世界是 RL 的潜力所在,也是风险所在。
9. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 泛值函数、off-policy 终极理由 | Frontiers | text/20-fm-frontiers.txt:8(搜「General Value Functions」) · text/20-fm-frontiers.txt:8(搜「auxiliary」) |
| options | Frontiers | text/20-fm-frontiers.txt:98(搜「Options」) |
| 奖励设计定位 | Frontiers | text/20-fm-frontiers.txt:453(搜「critical」) |
| 几百万年演化 | Frontiers | text/20-fm-frontiers.txt:460(搜「millions of years」) |
| 意外拿奖励、危险 | Frontiers | text/20-fm-frontiers.txt:473(搜「undesirable」) |
| 稀疏奖励、plateau | Frontiers | text/20-fm-frontiers.txt:482(搜「plateau」) |
| 好心的毒药、值初值药方 | Frontiers | text/20-fm-frontiers.txt:492(搜「well-intentioned」) · text/20-fm-frontiers.txt:495(搜「initial guess」) |
| 六条欠账、诚实评估 | Frontiers | text/20-fm-frontiers.txt:591(搜「Remaining Issues」) · text/20-fm-frontiers.txt:619(搜「An honest assessment」) · text/20-fm-frontiers.txt:615(搜「catastrophic interference」) |
| 表示学习 | Frontiers | text/20-fm-frontiers.txt:425(搜「representation learning」) |
| 鸿沟 | Frontiers | text/20-fm-frontiers.txt:732(搜「remains great」) |
| Simon、设计者立场 | Frontiers | text/20-fm-frontiers.txt:766(搜「Prometheus」) · text/20-fm-frontiers.txt:772(搜「carelessly deployed」) |
| 模拟 vs 真实世界 | Frontiers | text/20-fm-frontiers.txt:779(搜「simulated experience」) |
| 本书路线自述(Dyna 式组合) | Frontiers | text/20-fm-frontiers.txt:593(搜「Dyna architecture」) |
| 维度收官 | Planning and Learning | text/11-fm-planning-and-learning-with-tabular-methods.txt:1355(搜「three key ideas」) |