跳到主要内容

大纲 — An Introduction to Deep Reinforcement Learning(14 章)

自查(2026-08-27):逐行核过「出去时知道」,无两行是同一件事;批模式下不停笔,连续写完。 切分依据:原书 ch1/ch2 大量重复(同一张 NN 清单讲两遍)→ 合并进 01/02;ch4 的 15 个小节按「值函数路线(06/07)→ on-policy 路线(08)→ 策略梯度路线(09)→ 支撑网络(10)」四条推理链重组;ch6 拆成两章(12 架构向、13 对齐向)。

#文件拆原书进来时以为 → 出去时知道
0101-what-is-reinforcement-learning.mdPrologue, ch1, §2.4进来时以为「机器学习=给数据打标签」→ 出去时知道第三条路:没人给正确答案,只给一个事后分数,靠试错把分数攒起来;这想法的两个源头(1911 效果律 + 最优控制),以及「表格 → 网络」这一步为什么是 RL 变 deep 的分界
0202-learning-paradigm-map.mdch2(§2.4 除外)进来时以为范式分类是背诵表 → 出去时知道一张判据(信号从哪来)能推出整张地图;自编码器「压-重建」走查;迁移=先修课;集成=三个臭皮匠
0303-markov-decision-process.mdch3 §3.1–3.2进来时以为 MDP 是符号堆 → 出去时知道六元组就是「格子世界」的精确化;马尔可夫性=只看现在;agent 三型(model-free/model-based/mixed)怎么选
0404-value-functions-bellman.mdch3 §3.3–3.4+附录进来时以为 v/Q/V/A 四个符号各管各 → 出去时知道它们是同一问题(「接下来值多少」)的四种问法,贝尔曼方程把「整条未来」折成「一步+下一步的价」,拿 3 格走廊两轮备份走通
0505-loss-activation-entropy.mdch3 §3.5–3.7进来时以为损失/激活/熵是三堆公式 → 出去时知道它们回答三个问题:「错多少」「通过多少」「有多不确定」,每个拿具体数字算一遍;SAC/TRPO 后面全靠熵和 KL
0606-td-and-q-learning.mdch4 引言, §4.1进来时以为 Q-learning 玄 → 出去时知道它就是「预测←一步真实」的 TD 误差反复叠;off/on policy 的分野(replay buffer);拿 2 状态世界把 Q 表从瞎猜走向收敛
0707-dqn-and-continuous-q.md§4.2, §4.14进来时以为 DQN=「Q-learning 加个网络」一句带过 → 出去时知道三件发明缺一不可(网络当 Q 表、经验回放断相关、目标 y 冻结),拿 Pong 一帧走通一步更新;连续动作的 argmax 难与 NAF 的二次型解法
0808-sarsa-actor-critic.md§4.3–4.6进来时以为这些缩写是平行算法 → 出去时知道一条线:同一策略边走边学(SARSA)→ 多步折中(λ)→ 给策略配一个打分员(A2C)→ 打分员多开几份(A3C);SARSA vs Q-learning 同一步两种更新的数字对照
0909-policy-gradient-family.md§4.16, §4.7–4.11进来时以为策略梯度是一族玄学 → 出去时知道核心一行式「∇回报=E[回报×∇logπ]」,之后全是降方差与防步子过大的工程:基线→熵奖励(SAC)→确定性(DDPG/TD3)→信赖域(TRPO)→裁剪(PPO);REINFORCE 一条 3 步轨迹算一遍、PPO ratio 越界被裁的数字
1010-lstm-som-gan.md§4.12–4.13, §4.15进来时以为这三个是凑数的章节 → 出去时知道它们各补 DRL 的一块短板:记不住(LSTM 三门两态)、高维没法聚类(SOM 竞争-合作-适应)、没处找训练信号(GAN 造);GAN vs AC 对照表
1111-multi-agent-rl.mdch5进来时以为多智能体=多个 06 章 → 出去时知道别人成了环境的一部分,最优没了、只剩均衡;零和/合作/混合三分、纳什与帕累托、奖励机拆任务、4 通道张量表示走查
1212-physics-nns-and-architectures.mdch6 §6.1–6.2, §6.5–6.6进来时以为前沿=更大模型 → 出去时知道另一条路是把已知物理塞进损失或架构(PiNN 残差怎么算)、注意力怎么一次看全序列、图结构怎么进网络、1 bit 权重怎么省电
1313-rlhf-xai-quantum.mdch6 §6.3–6.4, §6.7–6.8进来时以为「对齐」是聊天机器人的事 → 出去时知道它是奖励设计问题(偏好→奖励模型→PPO),XRL 为什么比一般 XAI 难(延迟回报),量子路线到底在赌什么
1414-applications.mdch7, Epilogue进来时以为应用章=案例罗列 → 出去时知道一条判据贯穿全部案例:「监督信号能不能写出来、动作会不会改变世界」;自动驾驶/Pong/医疗/机器人各拿 state-action-reward 落到具体

index.md 六节规划

  1. 30 秒导读:一本 30 万字符的教材,条目式罗列;拆解把它重排成「问题逼出方法」的一条线。
  2. 作者/时代:Vinod K. Mishra,Taylor & Francis 2025-10;写作时点=RLHF/多智能体/量子 RL 已进教材;利益无关(纯教学)。书有明显编辑粗糙(列 6 处勘误表)。
  3. 全书主线(独立成篇):标签难写→奖励好给;奖励是延迟的、稀疏的→要估值(贝尔曼);状态太多表装不下→用网络近似(DQN);估值不稳→让策略直接学+降方差+控步长(REINFORCE→PPO);环境里有别人→均衡;物理已知→塞进损失;人类偏好写不成公式→学一个奖励模型。
  4. 章节地图(14 章,推荐顺序=编号序)。
  5. 覆盖/不覆盖:覆盖=概念+公式+伪代码层全部;不覆盖=可运行的代码、收敛性证明细节、2024 后的端到端大模型 agent(DARPA 式 XP 章)、实验对比数字。
  6. 我们的判断:教材定位 vs 综述定位;「表格思维」是全书贯穿的 teaching device;编辑粗糙不影响机制讲解但具体史实/归类要核。