通读笔记 — An Introduction to Deep Reinforcement Learning(Mishra, 2025)
通读完成于 2026-08-27。正文 23 个文件(跳过导航章 01-03、27-29)。
全书结构与口径
- 原书 7 章 + 前后件。真正讲机制的是 ch3(数学)、ch4(单智能体算法,15 个小节)、ch5(多智能体)、ch6(前沿)、ch7(应用)。
- 写法特征:条目式。每个算法一节:表格(算法/模型/动作/策略/性能度量)+ 数学形式化 + 伪代码 + 应用清单。几乎没有走查、没有数字例——这正是我们要补的。
- 编辑粗糙的证据(可写进边界):4.1 节里混入 SARSA 的描述(
09:43);4.2 表格把 DQN 动作标成 Continuous(10:30);4.13 GAN 表格 Model/Policy 填 xx(19:26-34);4.14 NAF 的伪代码编号错标 4.13.1(20:108);GPT-4 说成 "released by Microsoft"(05:362);AlphaGo 说成赢了"Chinese master" 四局(05:333,实为韩国李世石 4:1,对中国的柯洁是 3:0)。→ 拆解里按「书里的说法 vs 核实」分别标注。 - ch1 与 ch2 有大量重复(LSTM/GAN/清单各讲两遍)→ 我们的切分合并,不重复。
各文件要点(行号已核)
04prologue:数字革命→ML;本书目的=RL 高层导览。05ch1:AI 两层(基础设施/算法);三范式;NN 动物园(FFNN/感知机/MLP/RNN/LSTM/RBF/CNN/AE/Seq2Seq/MNN);历史时间线:Bayes 1763(:258)、Turing 1950(:271)、Samuel 跳棋 1952(:276)、Dartmouth/McCarthy 1956(:281)、感知机 1957 电位器+电机(:286)、AI winter(:291)、PDP 1986(:300)、Tesauro 西洋双陆棋 1992(:309)、Deep Blue 1997 每秒 2 亿步(:314)、Watson 2011(:323)、ImageNet 2012(:328)、AlphaGo 2016(:333)、Libratus 德州扑克 2017(:338)、Transformer 2017(:343)、GPT-3 2020(:357)、GPT-4 2023(:362);大脑 860 亿神经元/100 万亿突触/<20W vs ANN 100-1000 神经元/~200W(:375)。06ch2:DL=高维函数近似(:20);表 2.1 范式清单;MLP 组件(input/hidden/output/weights/bias/activation/backprop,:153-200);CNN(卷积/池化/全连接,:205-225);RNN 消失梯度(:234)+LSTM/GRU 三门(:242);半监督三假设(连续/簇/流形,:275-285);无监督规则(Hopfield/Boltzmann/RBM/堆叠/Helmholtz,:324-344);GAN(G vs D,:352-371);SOM(Kohonen 1980s 无反传,:398-402);AE 三件套+SAE/DAE/CAE/VAE(:411-482);DBN(:491-499);SSL(遮词、SEER 10 亿图,:512-546);混合/迁移(预训练-微调、车→卡车,:595-603);多实例 bag(:637);推断三视角(归纳/演绎/直推 Vapnik,:655-677);MTL/主动(oracle)/在 线/集成(bagging/boosting/stacking,:691-762);2.4 RL 两个源头:效果律 Thorndike 1911(:777-784,Pavlov 1927 强化定义)、最优控制 Bellman 方程+MDP(:789-793);RL vs DRL:表会太复杂+访问不到状态-动作对 vs NN 隐式函数近似可泛化到没见过的(:821-832)。07ch3:RL 四特征(无监督者/延迟反馈/时序决策/反馈依赖动作+不确定,:25-46);MDP 六元组(S,A,P,r,γ,s0,:84-115);马尔可夫性质(:126-130);策略(stationary/nonstationary;确定性/随机,:143-184);agent 三型(model-free/model-based/mixed,:194-231);奖励 0..rmax、奖励/回报/价值函数三分(:239-266);折扣(连续任务 γ<1 vs 情节任务 γ=1,:275-293);价值函数家族 v/Q/V/A(A=Q−V 考虑其他动作,:307-377);最大熵策略 ∝exp(Q)、Q 当负能量、所有动作非零似然→适应变化(:382-404);贝尔曼:递归 Rt=rt+1+γRt+1(:417-434)、v 的 BE、最优 BE、Q 的 BE、soft BE(log-sum-exp,:409-523);损失函数 7 种(BCE/hinge/MSE/MAE/Huber/log-cosh/quantile,:532-700);激活 sigmoid 三病/tanh/softmax=玻尔兹曼/ReLU 及 LReLU(a=0.01)/ELU/PReLU、实测无明确胜负(:705-883);熵家族 13 种(玻尔兹曼→Gibbs→Tsallis→Rényi→Shannon(等概率最大 log2n、单一结果 H=0)→Hartley→collision→min→交叉熵→KL(H(P,Q)=H(P)+DKL)→互信息→信息增益→Fisher,:888-1125);附录:BE 解析解两例(计量经济 log 效用、量子控制 HJB,:1130-1288)。08ch4 引言:RL 始于表格(Go/棋,不算 deep,:16);环境分类(确定/随机、有限/无限视界、静态);off-policy=replay buffer 随机抽批、不按当前表现更新 vs on-policy=每回合更新、收敛慢且噪(:65-74);TD 公式 (4.1):V(s)←V(s)+α[r+γV(s′)−V(s)],α 太大有害、最优值靠实验(:83-95);通用循环(采轨迹→replay buffer→小批量→策略梯度/ critic 梯度,:99-123);值迭代 (4.3);算法分类树(MCTS/I2A/World model;SARSA on;Q-learning/DQN off;QT-opt/SAMUEL;PG/TRPO/PPO/ACKTR,:185-231)。09Q-learning:Watkins 1989(:39);表格内存大→连续几乎不可能→DQN(:47);更新 (4.4)=加权平均当前值与新信息(:65-131);应用:网页自配置/新闻推荐/流量控制(:148-163)。10DQN:「Deep」=NN 因为表格组合无穷(:39);策略梯度定理推导塞在这节(4.5-4.11,∇E=E[r∇logπ],与遍历分布无关→model-free,MCMC 采样,:54-117);DQN=Q-learning+deep CNN(:126);伪代码:replay 容量 N、ε-greedy、y=r 或 r+γmaxQ′、对 (y−Q)² 梯度下降(:133-193);出处 Mnih 等 "Playing Atari with Deep RL"(:197);应用六类(机器人/车 LIDAR-RADAR-GPS/无人机/智能家居/医疗/金融,:212-266)。11SARSA:SARSA=五元组缩写(:39);on-policy=选动作与回传值用同一个策略;Q(st+1,at+1)=Q(st+1,π(st+1))(:43-53);优点直接优化目标收敛快,缺点样本效率低(:53);SARSA(λ):资格迹、多步回报从 1 步(SARSA)到 ∞(MC)、q^λ 加权、λ=0/1 两端、偏差方差权衡、指数衰减(:123-243)。12A2C:critic=值网络测「这步有多好」,actor=策略网络控制动作,并行互喂(:39-62);优势 A=Q−V,正优势把梯度往该方向推(:66-88);自举回报 Gt≈Rt+1+γVω(st+1);actor 梯度、critic 用 MSE/Huber+SGD(:97-157);伪代码来源 Lilian Weng 博客(:217)。13A3C:DeepMind 2016;多线程各带环境副本、异步、全局网络汇总→打破样本相关、并行本身稳定训练(:39-43);Atari/电机控制/3D 迷宫(:168)。14SAC:连续控制 SOTA;最大化熵+期望回报→鼓励探索、防过早收敛到坏局部最优(:39);软策略迭代:评估(加熵的 Bellman 算子)↔改进(KL 最小化),表格情形单调改进有保证(:48-95);α=熵温度,权衡随机性与回报(:117-121);tanh-Gaussian 策略(:131)。15DDPG+TD3:确定性策略(动作非随机)→argmax 难→DPG 用函数近似 argmax(:39-46);MSBE+目标网络 y=r+γ(1−d)Q_targ(:61-76);软更新 ρ(:136);TD3:双 Q 取 min 治高估、延迟更新、目标动作加噪防钻高估空子(:200-221)。16TRPO:信赖域+KL 约束 ≤δ;共轭梯度算 H⁻¹g;回溯线搜索;假设成立则单调改进有保证(:39-154)。17PPO:一阶方法;Penalty(自动调系数)与 Clip(裁剪掉远离旧策略的激励)两种;L=min(rA, clip(r,1±ε)A)(:39-82);Adam(:118);「首选方法」(:139)。18LSTM:RNN 记不住(消失/爆炸);三门(f/i/o)两态(h 短期 c 长期);c_t=f⊗c_{t−1}+i⊗c̃_t、h_t=o⊗σ(c_t)(:39-146)。19GAN:G 从隐分布造样本、D 分真假;零和=交叉熵上的博弈;每轮 k 步训 D 再 1 步训 G(:39-114);GAN vs AC 对照表(目标/凸性/组件/学习/监督;D 拿走 G 无法训练 vs actor 没 critic 也能训只是更糙,:122-198)。20NAF:连续动作 argmax 难;把 A 写成动作的二次型 −½(u−μ)ᵀP(u−μ),三输出流 V/P=LLᵀ/μ,μ 天然是 argmax(:44-103)。21SOM:竞争(欧氏 距离选 winner)/合作(邻域核)/适应(w←w+ηh(x−w));η、σ 都指数衰减(:38-116)。22REINFORCE:∇E=E[ΣGt∇logπ];整条轨迹采完才更新、方差大;加基线 bb∇logπ=0 无偏;好基线=V(s)(:38-87)。23ch5 MARL:纯竞争(零和:围棋/国际象棋/AlphaGo/Deep Blue)/纯合作(Overcooked、收敛到「约定」)/混合(自动驾驶、囚徒困境、Diplomacy、StarCraft II、社会困境)(:46-58);训练两路:各自独立 vs CLDE(:78-83);多智能体 Q/策略框架、随机博弈(:153-241);示例:状态=4 通道 W×H 张量(背景/对手/盟友/自己;非零像素=数量)、一次训一个其余冻结、策略分发给盟友(学习集中执行分布)、同位两盟友用 softmax 随机策略破对称(:270-309);奖励机 RM=Mealy 机把非马尔可夫奖励编成阶段,QRM 每个机状态一个 q 函数、表格版收敛有保证(:318-565);马尔可夫博弈/纳什(别人不动没人能改)/帕累托/ε-Nash(:385-438);神经符号(符号三推理 vs 联结主义局限;六种组合,:574-691);MORL 六场景+标量化之苦(:713-811)。24ch6 前沿:表 6.1(Double DQN 分离选择与评估治高估、Rainbow 六合一、AE-DQN、RDPG、分层/封建网络,:20-182);物理 NN 四框架:PgNN(物理校验的监督映射;病:物理不可知、无分辨率不变)/PiNN(损失=PDE 残差+边界;两个 NN:数据 NN+配点 NN;自动微分;病:3D 慢、无收敛证明、损失权重无指南、低频偏置)/PeNN(物理编进架构;PeRCNN/NeuralODE)/NO(学算子,DeepONet/FNO/GNO,分辨率不变,一次训练处处推断)(:192-400);PiRL 三步(交互→学模型(拉格朗日)→学行为)(:409-446);Transformer(一次处理整序列+注意力;EDT/BERT/GPT;dm=512、dk=64;位置编码 sin/cos N=10000;softmax(QKᵀ/√dk)V;多头;自回归分解 6.5)(:455-610);GAI(Pmodel 模仿 Pdata;三类应用:纯生成/目标最大化/人的偏好=对齐;奖励建模之难:多样性坍缩、越狱)(:620-762);XAI(透明/信任/公平;透明三法 simulatability/decomposability/算法透明;事后解释 model-agnostic/specific)(:814-885);XRL(RL 特有:延迟回报,所以要解释短期长期后果;信任=愿意委托;新洞见;可修)(:891-924);GNN(GCN/GAENN/RGNN/GGNN;GNN 当 Q 函数+消息传递→网络拓扑上的 DQN)(:933-978);BNN(权重 1/−1、位运算、嵌入式)(:987);RLHF(监督训奖励模型→PPO;InstructGPT;偏好数据贵且带偏)(:1000);量子 RL(量子比特 α|0⟩+β|1⟩、α²+β²=1;n 量子比特 2^n 振幅 O(2^n) vs 经典 O(n);酉算子 XYZ/Hadamard/CX/CZ;测量 Born 规则;VQC on NISQ;Grover 振幅放大、投射模拟(随机行走→量子行走)、量子玻尔兹曼机)(:1018-1203)。25ch7 应用:自动驾驶(监督失效三因:动作改变未来观测/TTC 等监督信号需随机代价/组态高维;ego 状态清单、占据栅格、鸟瞰图中层表示;离散化两难:太粗抖动太贵;DDPG/LQR/iLQR;LfD CNN 像素→转向、max-ent IRL)(:25-188);Pong(+1/−1/0;监督三病:要超人标注、数据要覆盖全、上限=人;信用分配:整串不能全丢;Montezuma 稀疏奖励;reward shaping 手工非最优)(:197-272);医疗 DTR(决策规则序列=策略;SMART;慢性病+ICU 3C 数据噪声偏缺)(:281-375);营销(实时竞价、Netflix;暗面:奖励冲动、加剧分裂)(:384-414);图像(表 7.1 十二任务)(:423-585);机器人(sim-to-real 两难:实采不安全、仿真不精确;四足落地 ANYbotics/Swiss-Mile/Boston Dynamics;操作类四难)(:592-726);NLP(语言=句上的概率分布;五类 MDP 任务;2016 两个 RL 智能体互聊被客服采用;MT 的 exposure bias)(:735-834);能源(谷歌数据 中心节能 40%、5 分钟快照)(:849-877)。26epilogue:RL 可被用于害人,需要社会性防范;希望用于环境退化与不平等。
② 类出处(库内已拆、可引用)
shelf=ai-book-reference/nndl-2e#29-rl-value-based.md(MDP 五元组/值函数/TD/Q 表→DQN)shelf=ai-book-reference/nndl-2e#30-rl-policy-based.md(REINFORCE/基线/AC/TRPO/PPO/GAE)shelf=ai-book-reference/nndl-2e#11-backprop-and-autodiff.md(反向传播=反向模式自动微分的机制)shelf=ai-book-reference/nndl-2e#16-long-range-and-gating.md(LSTM 加法通道三门)shelf=ai-book-reference/nndl-2e#20-attention.md(打分再加权/自注意力)shelf=ai-book-reference/nndl-2e#37-vae-and-gan.md(GAN 最优判别器=JS 散度/模式坍塌)shelf=ai-book-reference/nndl-2e#26-density-and-clustering.md(聚类/K-Means,给 SOM 当参照)- Sutton & Barto 库内书是 unread,铁律不许引用,不引。
书的错/过时处(写进各章「边界」)
- GPT-4 "released by Microsoft"(
05:362)— 实为 OpenAI 出品。 - AlphaGo 赢 "Chinese master" 四局(
05:333)— 李世石是韩国人。 - 4.2 表格把 DQN 动作写成 Continuous(
10:30)— 经典 DQN 是离散动作。 - GAN/LSTM/SOM 套算法表格填 xx(
19:26)— 原书自己的框架套不上。 - Q-learning 节混入 SARSA 描述(
09:43)。 - 「ANN 100-1000 个神经元」(
05:375)是 2025 年也不该有的旧口径(现代网络以十亿计参数)— 按通用知识补正。