资格迹 — 一份短期记忆,把 TD 与 MC 焊成连续谱
这一章讲 四件事: λ-return 怎么把所有 n-step return 加权平均; 资格迹这个短期记忆怎么用「往回喊」实现同一件事; TD(λ) 的三个实际优点;控制与离策情形的几个变体。 读完你会拿到全书机制上最优雅的一件工具——以及「λ 该调多大」的实感。
1. 定位:机制,不是参数
书的开篇给足了地位:资格迹是强化学习的基本机制之一;几乎所有 TD 类方法(Q-learning、Sarsa)都能接上它,变得可能更高效1。它与第 07 章 n-step 的关系要说准:两者都统一 TD 与 MC,但资格迹额外给的是一个优雅的算法机制,带实打实的计算优势2。
机制本身一句话:给每个权重配一份短期记忆(资格迹 z):某权重参与生成了当前估计,它的资格就抬高一点,然后随时间衰减;衰减到零之前若发生 TD 误差,这份资格决定它分到多少更新。衰减率就是 λ∈[0,1]3。