大纲 — An Introduction to Deep Reinforcement Learning(14 章)
自查(2026-08-27):逐行核过「出去时知道」,无两行是同一件事;批模式下不停笔,连续写完。 切分依据:原书 ch1/ch2 大量重复(同一张 NN 清单讲两遍)→ 合并进 01/02;ch4 的 15 个小节按「值函数路线(06/07)→ on-policy 路线(08)→ 策略梯度路线(09)→ 支撑网络(10)」四条推理链重组;ch6 拆成两章(12 架构向、13 对齐向)。
| # | 文件 | 拆原书 | 进来时以为 → 出去时知道 |
|---|---|---|---|
| 01 | 01-what-is-reinforcement-learning.md | Prologue, ch1, §2.4 | 进来时以为「机器学习=给数据打标签」→ 出去时知道第三条路:没人给正确答案,只给一个事后分数,靠试错把分数攒起来;这想法的两个源头(1911 效果律 + 最优控制),以及「表格 → 网络」这一步为什么是 RL 变 deep 的分界 |
| 02 | 02-learning-paradigm-map.md | ch2(§2.4 除外) | 进来时以为范式分类是背诵表 → 出去时知道一张判据(信号从哪来)能推出整张地图;自编码器「压-重建」走查;迁移=先修课;集成=三个臭皮匠 |
| 03 | 03-markov-decision-process.md | ch3 §3.1–3.2 | 进来时以为 MDP 是符号堆 → 出去时知道六元组就是「格子世界」的精确化;马尔可夫性=只看现在;agent 三型(model-free/model-based/mixed)怎么选 |
| 04 | 04-value-functions-bellman.md | ch3 §3.3–3.4+附录 | 进来时以为 v/Q/V/A 四个符号各管各 → 出去时知道它们是同一问题(「接下来值多少」)的四种问法,贝尔曼方程把「整条未来」折成「一步+下一步的价」,拿 3 格走廊两轮备份走通 |
| 05 | 05-loss-activation-entropy.md | ch3 §3.5–3.7 | 进来时以为损失/激活/熵是三堆公式 → 出去时知道它们回答三个问题:「错多少」「通过多少」「有多不确定」,每个拿具体数字算一遍;SAC/TRPO 后面全靠熵和 KL |
| 06 | 06-td-and-q-learning.md | ch4 引言, §4.1 | 进来时以为 Q-learning 玄 → 出去时知道它就是「预测←一步真实」的 TD 误差反复叠;off/on policy 的分野(replay buffer);拿 2 状态世界把 Q 表从瞎猜走向收敛 |
| 07 | 07-dqn-and-continuous-q.md | §4.2, §4.14 | 进来时以为 DQN=「Q-learning 加个网络」一句带过 → 出去时知道三件发明缺一不可(网络当 Q 表、经验回放断相关、目标 y 冻结),拿 Pong 一帧走通一步更新;连续动作的 argmax 难与 NAF 的二次型解法 |
| 08 | 08-sarsa-actor-critic.md | §4.3–4.6 | 进来时以为这些缩写是平行算法 → 出去时知道一条线:同一策略边走边学(SARSA)→ 多步折中(λ)→ 给策略配一个打分员(A2C)→ 打分员多开几份(A3C);SARSA vs Q-learning 同一步两种更新的数字对照 |
| 09 | 09-policy-gradient-family.md | §4.16, §4.7–4.11 | 进来时以为策略梯度是一族玄学 → 出去时知道核心一行式「∇回报=E[回报×∇logπ]」,之后全是降方差与防步子过大的工程:基线→熵奖励(SAC)→确定性(DDPG/TD3)→信赖域(TRPO)→裁剪(PPO);REINFORCE 一条 3 步轨迹算一遍、PPO ratio 越界被裁的数字 |
| 10 | 10-lstm-som-gan.md | §4.12–4.13, §4.15 | 进来时以为这三个是凑数的章节 → 出去时知道它们各补 DRL 的一块短板:记不住(LSTM 三门两态)、高维没法聚类(SOM 竞争-合作-适应)、没处找训练信号(GAN 造);GAN vs AC 对照表 |
| 11 | 11-multi-agent-rl.md | ch5 | 进来时以为多智能体=多个 06 章 → 出去时知道别人成了环境的一部分,最优没了、只剩均衡;零和/合作/混合三分、纳什与帕累托、奖励机拆任务、4 通道张量表示走查 |
| 12 | 12-physics-nns-and-architectures.md | ch6 §6.1–6.2, §6.5–6.6 | 进来时以为前沿=更大模型 → 出去时知道另一条路是把已知物理塞进损失或架构(PiNN 残差怎么算)、注意力怎么一次看全序列、图结构怎么进网络、1 bit 权重怎么省电 |
| 13 | 13-rlhf-xai-quantum.md | ch6 §6.3–6.4, §6.7–6.8 | 进来时以为「对齐」是聊天机器人的事 → 出去时知道它是奖励设计问题(偏好→奖励模型→PPO),XRL 为什么比一般 XAI 难(延迟回报),量子路线到底在赌什么 |
| 14 | 14-applications.md | ch7, Epilogue | 进来时以为应用章=案例罗列 → 出去时知道一条判据贯穿全部案例:「监督信号能不能写出来、动作会不会改变世界」;自动驾驶/Pong/医疗/机器人各拿 state-action-reward 落到具体 |
index.md 六节规划
- 30 秒导读:一本 30 万字符的教材,条目式罗列;拆解把它重排成「问题逼出方法」的一条线。
- 作者/时代:Vinod K. Mishra,Taylor & Francis 2025-10;写作时点=RLHF/多智能体/量子 RL 已进教材;利益无关(纯教学)。书有 明显编辑粗糙(列 6 处勘误表)。
- 全书主线(独立成篇):标签难写→奖励好给;奖励是延迟的、稀疏的→要估值(贝尔曼);状态太多表装不下→用网络近似(DQN);估值不稳→让策略直接学+降方差+控步长(REINFORCE→PPO);环境里有别人→均衡;物理已知→塞进损失;人类偏好写不成公式→学一个奖励模型。
- 章节地图(14 章,推荐顺序=编号序)。
- 覆盖/不覆盖:覆盖=概念+公式+伪代码层全部;不覆盖=可运行的代码、收敛性证明细节、2024 后的端到端大模型 agent(DARPA 式 XP 章)、实验对比数字。
- 我们的判断:教材定位 vs 综述定位;「表格思维」是全书贯穿的 teaching device;编辑粗糙不影响机制讲解但具体史实/归类要核。