稳定化 — 给致命三件套拆雷
这一章讲四件事: 线性值函数的几何图 景——为什么 TD 与最小二乘各拜各的庙; 「贝尔曼误差不可学」这个二版新结论; Gradient-TD 怎么把离策 TD 变成真梯度下降; Emphatic-TD 怎么用「强调」改写分布,让老算法在离策下收敛。 读完你会明白:离策+逼近的病根不是「算错」,是「在优化一个你够不着的东西」。
1. 定位
上一章的结论是消极的:函数逼近+bootstrapping+离策训练三者同台,最简单的方法也会发散。本章是正面强攻。先给结论排版:三条出路——(a) 丢 bootstrapping(用 MC 类目标,贵);(b) 只用不做外推的逼近器(averagers,如最近邻(按「最像的已知样本」给答案);tile coding 与神经网络都看不上);(c) 换目标函数,让梯度真的指向它——这是本章的主线1。
2. 核心原理一:几何——三件套炸的深层原因
把「所有可能的值函数」看成一个大空间,线性逼近 v̂=wᵀx 只能覆盖其中一个小平面(d 维),真值 vπ 一般不在这个平面上。于是问题来了:平面离 vπ 最近的点和满足 Bellman 一致性(自己跟自己对得上)的点是两个不同的点;而离策时,连「哪个分布下的最近」都 产生了分歧。书里画出的图景里有一组角色:vπ(真值,平面外)、Πvπ(投影,平面内离真值最近的点,MC 类方法奔它去)、TD fixed point 平面内的自洽(自己跟自己对得上)点、以及贝尔曼误差的最小点2。
一句话记忆:TD 方法优化的「目标」取决于数据分布;分布被离策改写后,它奔向的点既不是投影点、常常也不是任何你能命名的最优点——于是就自由落体了。几何这一节是星标的进阶内容,读者拿到这张草图即可,细节不必强记2。
3. 核心原理二:「贝尔曼误差」不可学(二版新结论)
顺着「换目标」的思路,最想最小化的自然是贝尔曼误差(BE):让 v̂ 尽量满足 Bellman 方程。坏消息是二版新增的结论:BE 在一个很强的意义下「不可学」——存在两个环境,从任何数据分布的样本里无法区分,却有不同的 BE 最优解;也就是说,不存在任何算法能仅凭观测数据把它最小化3。这不是技术性瑕疵,是「你想优化的量从数据里原则上提不出来」。
(书里还顺带把另一个候选目标「最小化贝尔曼残差(Bellman 方程两边的差)MSBE」也分析了一遍,同样有分布依赖的坑。)
4. 核心原理三:Gradient-TD——把目标换成「够得着的」
Gradient-TD 的解法漂亮在妥协:目标改成投影贝尔曼误差 PBE(最小化平面上的点经 Bellman 算子后再投影回来的位移),并且用巧技把这个目标写成了期望可以采样、且是真梯度的形式——从而 SGD 的全部保证回归:离策、线性、bootstrapping 三者并存下收敛4。
主走查看它的代价(数值为演示编的,机制为书中定义):
承接第 10 章的 w→2w 例子:两个特征退化为一个标量特征(1 和 2),w 一个数。
半梯度 TD 的更新方向只有「朝 δ·x(s)」一项,δ 越推越大 → 爆炸。
Gradient-TD 每步额外维护一个「辅助向量」(可理解为对『期望意义上的下一步修正』的在线平均),
更新方向变成「当前样例的贡献 − 用辅助向量估计的期望贡献」:
w ← w + α·ρ·[ x(s) − γ·x(s′) ]·δ′ − α·ρ·γ·x(s′)·(x(s)ᵀ辅助向量)
拿同一组数走一步:w=1,x(s)=1,x(s′)=2,γ=1,ρ=1:
半梯度方向 = δ·x(s) = (2−1)·1 = +1 → 继续变大(爆炸方向)
Gradient-TD 方向里多出减项,期望下恰把这个自抬项抵消 → 收敛到 w=0(真值)。
代价:每步更新的计算量约翻倍,还要多养一个与 w 同维的向量。
书里的评价口径:稳定是用每步更大的计算换来的。
族里成员按目标与迹分:GTD(0)、GTD(λ)、GQ(λ)(动作值版,off-policy 控制用)5。
5. 核心原理四:Emphatic-TD——不动算法,改分布
另一条路反过来:算法不变(还是普通 semi-gradient TD),改写「数据的重要性权重」。思路:离策的病根在更新分布不再是 on-policy 分布;那就给每条经验乘一个「强调」系数,把被行为策略扭曲了的分布,重新加权回目标策略的 on-policy 分布——第 09 章那个收敛证明的地基于是被人工恢复,TD fixed point 与其误差界重新成立6。
两族算法的气质对比:
| Gradient-TD | Emphatic-TD | |
|---|---|---|
| 动什么 | 换目标函数(改成真梯度可达的 PBE) | 改写数据的权重(重建 on-policy 分布) |
| 保住什么 | 离策下收敛,方差可控 | TD fixed point 与 1/(1−γ) 误差界 |
| 代价 | 每步计算翻倍、多一个辅助向量 | 权重的方差可能大,收敛可能慢 |
| 一句话 | 「别去够够不着的目标」 | 「把够得着的分布修回来」 |
6. 作者的判断与证据
书里给出定理/构造的: PBE 的梯度写法(GTD 的收敛)、不可学性的构造 性反例、Emphatic-TD 下 fixed point 的恢复,都有完整论证;两个方法都是二版新收的新进展(Gradient-TD 出自 Sutton, Szepesvári & Maei 2009;Emphatic-TD 出自 Sutton, Mahmood & White 2016)——本书成书时它们就是领域的前沿,不是老生常谈7。
作者的立场与坦白: 「贝尔曼误差不可学」一节书里明说是二版新写、且有作者本人深度参与——这是把自家的最新研究写进教材的例子;同时书里如实交代这些方法的实际采用远不如半梯度方法普遍:稳定性和每步成本之间的市场价,至今没有定论。
7. 边界与局限
- Gradient-TD/Emphatic-TD 的干净结论基本都在线性情形;非线性(神经网络)下的离策稳定性在本书成书时仍是开放问题。
- Emphatic-TD 的强调权重继承自重要性采样的方差问题——它换了一种方式付方差账单。
- 几何图景与不可学性都是线性情形(以及能从模型生成样本的情形)的论断,读者不应把它们直接外推到深度网络的实践直觉。
- 与第 12 章衔接:把迹与这些稳定化组合(GTD(λ)、GQ(λ)、带迹的 Emphatic)是文献的活跃区,本书只给入口。
8. 可带走的
- 发散的病 根是「优化了一个够不着的目标」:分布被离策改写后,半梯度 TD 连要奔向的点都换了。
- 几何一句话:线性逼近只能活在平面里;投影点(MC 所爱)与自洽点(TD 所爱)是两个点,离策时都不是。
- 贝尔曼误差不可学:你想优化的量,原则上提不出来——换目标是被迫的,不是偷懒。
- Gradient-TD:目标换成投影贝尔曼误差,重写更新使它成为真梯度;离策+线性+bootstrap 下收敛,代价是计算翻倍。
- Emphatic-TD:算法不动,给数据加权重建 on-policy 分布,把第 09 章的定理赎回来;代价是权重方差。
- 选型直觉:能 on-policy 就 on-policy(一切保证都在);必须 off-policy 时,按「预算买稳定」在两族之间挑。
- 这两族是二版新收的前沿——教科书可以住进它自己参与制造的历史里。
9. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 三条出路 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:325(搜「can be given up」) · text/14-fm-off-policy-methods-with-approximation.txt:294(搜「averagers」) |
| 线性值函数几何 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:378(搜「Geometry」) |
| BE 不可学 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:875(搜「Not Learnable」) |
| 二版新写 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:2071(搜「new to this text」) |
| Gradient-TD | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:1684(搜「Gradient-TD」) |
| GTD 出处 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:2073(搜「2009b」) |
| Emphatic-TD | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:1871(搜「Emphatic-TD」) |
| Emphatic 出处 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:2082(搜「2016」) |
| 降方差 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:1948(搜「Reducing Variance」) |
| 线性几何出处 | Off-policy Methods with Approximation | text/14-fm-off-policy-methods-with-approximation.txt:2056(搜「pioneered」) |