切分大纲(16 章)
自查记录(2026-08-27):原切分 17 章里「w→2w 发散」同时出现在控制章与离策章——已把 deadly triad 定理的部分并入 10(控制与发散),把「怎么救」(Gradient-TD/Emphatic-TD/几何)单独立 11,两章的「出去时知道」不再重叠。01 章「四要素」与 03 章「策略/值函数」曾像同一件事:01 只留直觉(它是什 么),03 才给形式定义,已经错开。
- 01 试错学习:进来时以为「强化学习=奖励驱动的机器学习」→ 出去时知道它的两大特征(试错搜索+延迟奖励)为什么把它从监督/无监督里分出来、评估性反馈意味着什么、四个要素各自管什么、演化方法为什么被排除、井字棋里值函数怎么在不用模型的情况下实现「计划的效果」。
- 02 老虎机:进来时以为「探索就是 多试试」→ 出去时知道评估性反馈与指导性反馈的区别、为什么贪婪会卡死(10 臂试验台的具体数字)、增量式更新的一般形状(全书所有更新的模板)、非平稳为什么要常数步长、乐观初值/UCB/梯度赌博机各自的探索逻辑、什么情况下探索问题没有完美解。
- 03 有限 MDP:进来时以为「MDP 是个数学形式化」→ 出去时知道奖励假说(目标=最大化标量信号)是全书的地基、折扣怎么把无限求和变成有限、为什么值函数(而非奖励)才是决策的依据、Bellman 方程说的是什么、最优值函数为什么把长程最优变成一步贪心、精确解的三个假设为什么在实践中不成立。
- 04 动态规划:进来时以为「DP 是另一种算法」→ 出去时知道把 Bellman 方程改成赋值语句就得到算法、策略评估/策略改进定理/策略迭代/值迭代怎么环环相扣、GPI 为什么是全书所有方法的原型(两条互相拉扯的线)、异步 DP 为什么重要、bootstrapping 这个词的确切含义。
- 05 蒙特卡洛:进来时以为「MC=用平均估计价值」→ 出去时知道它靠完整回合不要模型、first-visit/every-visit 的差别、探索起点假设为什么不可靠、on-policy 与 off-policy 的分野从这章开始、重要性采样怎么把一个策略的数据换成另一个策略的答案、为什么加权重要性采样方差小、ordinary IS 在什么情况下方差无穷。
- 06 时序差分:进来时以为「TD 是 MC 的加速版」→ 出去时知道 TD 误差的形状、为什么等一秒就能学(开车回家)、TD 与 MC 收敛到不同答案(3/4 vs 0 的分歧)及各自的最优性含义、Sarsa/Q-learning/Expected Sarsa 三兄弟的差别、悬崖行走里 on/off-policy 的实际表现差异、最大化偏差从哪来、double learning 为什么用两套值就无偏。
- 07 n-step:进来时以为「多步只是折中参数」→ 出去时 知道 n-step return 的构造、误差缩减性质保证整个谱都收敛、中间的 n 为什么最好、「时间步的暴政」是什么、离策时重要性采样的方差问题、tree-backup 怎么不用重要性采样做离策、Q(σ) 怎么把采样与期望统一起来。
- 08 规划:进来时以为「规划与学习是对立的」→ 出去时知道分布模型与样本模型的差别、规划=对模拟经验做与学习相同的更新、Dyna 怎么把真实/模拟经验喂进同一个更新、模型错了的两类后果与探索加成、决策时规划(启发式搜索/rollout/MCTS)与后台规划的分界、第一部分结尾的「维度」视角。
- 09 函数逼近:进来时以为「表格存不下就压缩」→ 出去时知道每次更新怎么变成一条监督学习样例、为什么必须有状态分布目标(VE)、semi-gradient「半」在哪、线性情形的 TD fixed point 及其误差界(1/(1−γ) 倍)、tile coding 等特征构造在干什么、神经网络什么时候进场。
- 10 控制与致命三件套:进来时以为「把 TD 换成 Sarsa 就能控制」→ 出去时知道半梯度 Sarsa 与 Mountain Car、持续任务里折扣为什么站不住(γ 对策略排序零影响)、平均奖励设定、w→2w 与 Baird 反例的发散机制(带具体数字)、致命三件套(逼近+bootstrap+离策)为什么两两可以、三个一起必炸。
- 11 稳定化:进来时以为「发散了就换算法」→ 出去时知道线性值函数的几何解释(三个投影)、贝尔曼误差为什么「不可学」、Gradient-TD 与 Emphatic-TD 各自怎么救、以及它们的代价。
- 12 资格迹:进来时以为「λ 只是另一个平滑参数」→ 出去时知道 λ-return 是所有 n-step return 的加权平均、前向视角与后向视角怎么等价、资格迹这个短期记忆怎么让每步更新都在线发生、true online 的精确等价、控制版 Sarsa(λ) 与离策迹。
- 13 策略 梯度:进来时以为「先估值再选动作是唯一路线」→ 出去时知道直接学策略参数的四点优势(含随机最优策略,短走廊的具体数字)、策略梯度定理、REINFORCE 的更新形状与高方差、baseline 为什么不影响期望却影响方差、actor–critic 怎么用 TD 误差替代完整回报、连续动作怎么参数化。
- 14 心智中的 RL:进来时以为「算法与大脑的类比是装饰」→ 出去时知道 TD 模型怎么同时解释经典条件反射的 blocking/高级条件化/时间提前、习惯与目标导向=model-free 与 model-based、多巴胺=奖励预测误差假说及 Schultz 实验的四个平行特征、神经 actor–critic 与 basal ganglia、这个假说在哪些地方对不上。
- 15 应用案例:进来时以为「RL=会下棋」→ 出去时知道 TD-Gammon(自弈+TD(λ)+网络,分支部 400 使搜索失效)、Samuel 跳棋的谱系起点、Watson 下注与内存控制这类非游戏应用、DQN 在 49 个 Atari 游戏上自动化特征设计、AlphaGo/Zero 的组合与「Zero」的纯度、以及案例背后的共同机制。
- 16 前沿与收官:进来时以为「书到此结束」→ 出去时知道泛值函数与 options 把 off-policy 的用途推到「并行学很多预测」、奖励设计为什么是应用成败的关键(含危险与稀疏奖励)、作者自认的六个遗留问题(含「深度学习不适合在线学习」的诚实评估)、以及 RL 与 AI 未来/安全的态度。
每章对应原书:01←Ch1;02←Ch2;03←Ch3;04←Ch4;05←Ch5;06←Ch6;07←Ch7;08←Ch8;09←Ch9;10←Ch10+Ch11.1–11.3;11←Ch11.4–11.9;12←Ch12;13←Ch13;14←Ch14+Ch15;15←Ch16;16←Ch17。前言与 8.13 维度总结分别进 index 的「这是谁在什么时候写的」与 16 章。