审查 reinforcement-learning-sutton-barto — 2026-08-28
结论: ISSUES(6 条:2 条应修 + 4 条轻微;主体质量高,修完即可 PASS)
门禁实跑:
book-verify: 1 本有拆解、共 680 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)
逐项核查结果
完整性 ✓。原书 17 个内容章(不含两篇序言、符号表、References、Index——按标准本就该跳过)
全部映射到 16 个拆解章:14-mind 合并 Psychology+Neuroscience,10 合并原书 10+11 的前半,
11/12/13 一一对应,16-frontiers 对应原书 17。各章 sourceChapters 与 chapters.json 章名逐一核对一致。
浓缩比裁断(0.13–0.15×,本案核心)✓。抽三条线:
- TD 学习(06):TD(0) 更新式、δ 身世、开车回家走查、batch 下 TD=certainty-equivalence vs MC=最小 MSE、 A→B 思想实验、「谁更快无定论」的坦白——主干完整,且把「外推」这个 TD 真正的卖点讲出了机制。
- Q-learning 收敛(06 §4+§7):收敛条件(无限访问+随机逼近步长)两点都在,并如实写「表格之外没有一般保证」; 原书本章也不自证,引 Watkins & Dayan 1992——无承重推导被压掉。
- 策略梯度定理(13 §4):定理内容按原文讲清(按访问频率加权、qπ×∇lnπ),REINFORCE 两步推导(求和→期望、 qπ→G(t))写出,高方差坦白、baseline 只动方差、actor–critic 偏差「不源于 bootstrapping 本身」的精细区分都保留。
- 被压掉的主要是:每章大习题、排版乱码区、星标进阶节(压缩但显式标注「星标/书里给了完整推导」)。 骨架级保留、未静默丢失的承重推导清单:策略改进定理证明(04 §4)、误差缩减性质证明(07 §3)、 TD fixed point 正定性证明(09 §5/§7)、废弃折扣带框证明(10 §2 论证保留)、PBE 梯度构造(11 §4,只述未推)、 前后向等价(12,述明「近似、true online 精确」)。结论:读完确能向别人讲清 RL 主干,判据过。 压缩最重处是 14-mind(原书 14+15 章约 27 万字符 → 1.35 万),但 blocking 走查+四行多巴胺表+ 假说边界保住了主干,且 compress 处如实。
奠基人立场 ✓。index §1 交代两位奠基人身世、Klopf 源头、DeepMind 利益相关;奖励假说在 03 §2 立为 「全书的公理」、§7 明写「公理不是定理」并给出 Littman 出处;02 §7「作者明说这是他的看法(opinion)」; 01 §5 把「第三条路」「演化法不行」标为立场非定理;14 §4 把多巴胺=δ 明标为假说并列四条边界; 10 §2 的「With function approximation we have lost it!」按作者重话引用。立场与公理、实验与归因全程分开。
结构映射与主走查数字 ✓。抽核:03 Gridworld(中心格 0.7,邻值 2.3/−0.4/0.7/0.4,0.225×3.0=0.675≈0.7, 与书习题 3.14/图 3.2 相符;A 格 8.8<+10 的读法与原文一致);08 Dyna 迷宫(25/5/3 幕、第一幕约 1700 步); 10 Mountain Car(8 层 tile、例 10.1);06 悬崖 −100、Windly 17 步、最大化偏差 5%;07 例 7.1(n=1 只改 E、 n=2 改 D/E、n≥3 三格同幅)逐句对上;13 短走廊 p≈0.59、−11.6、两种 ε-greedy 打法 <−44/<−82; 05 无穷方差例与 0.27726。所有「演示值」处均当场标注,书给值均标「来自书」。
出处抽查 5 条 ✓ 全属实:01 fn13(50% chance,04:364)、03 fn5(reward hypothesis,06:292)、 06 fn18(5% more often,09:837)、10 fn9(greater than 1 / 步长无关,14:157/159)、13 fn5(0.59/11.6,16:108-109)。
混排区避让 ✓。全库 16 章引用进 text/06 的行号无一落在 583–619、进 text/09 的无一落在 640–774; 抽查确认这两段确为公式/图注乱码。写手自报的避让属实且干净。
差异化 ✓。与 an-introduction-to-deep-rl 的重叠章(其 06-td-and-q-learning)比对:那本走两状态 Q 表 从 0 修到 5 的入门走查,无开车回家、无 certainty-equivalence、无悬崖行走——两书零复用,分工清楚 (综述 vs 理论原典)。
总纲 ✓。六节齐全;§2 十步主线独立成篇,海拔守住了(机制细节留章层,「第 N 章讲」挂账并全数记入 21 行兑现表,抽 5 行全兑现);判断块 3 条全带「如果错」。
其余。台账零混入(index 尾注与样板书同款,不算);TODO(没懂) 零命中;无整段搬原文(引文均为单句)。
问题清单
- [16-frontiers §3] 「六条欠账」没交全 — 兑现表许诺「六条欠账」兑现在本节,但正文「四条最重的」里 第 3 条是对另外两条的模糊合并、第 4 条( exploratory 方向)根本不是六条之一,读者拿不到六条全名单 — 违反「兑现的是许诺的那件事」— 修法:按原文 17.5 把六条逐条一行列全(每条原文都极短),或把标题与 正文改为「六条中最重的两条」并删掉「四条最重的」框架。
- [16-frontiers 全章] 缺带具体数字的主走查 — GVF/options/式 17.11 都只有定义与药方,全书 16 章里 唯独这章指不出「拿一个具体输入从头走到尾」的段落 — 违反红线二走查口径 — 修法:给式 17.11(值初值 先验)编一个单状态演示(标注演示值)走一遍;或用 GVF 的「走路回家还要多久」式预测走一步。
- [15-applications §3] 「书里给了具体实验数字」却把数字吞了 — 内存控制一节写「两位数百分比的吞吐 提升,书里给了具体实验数字」,原书实给 7%–33%、平均 19%(text/19:806-807)——留话不给数 — 违反 数字条「留下的每个数字要有参照物」的反面(该给没给)— 修法:补上 7%–33%/均值 19%,并以生产规则 FR-FCFS 为参照物。
- [06-td-learning §9] 原文地图「风中网格」行正文无对应 — 正文只走查悬崖行走,Windy Gridworld 仅存在于跳转表 — 跳转表指向未讲内容会误导 agent — 修法:删该行,或在 §4 补一句 Sarsa 在风中网格 稳定在约 17 步的结果(一句话即可)。
- [13-policy-gradient §1/§8、fn12] 书外背景未标「补充(不在书里)」 — 「RLHF 与大模型微调的共同 祖先」「这条立场日后被深度 RL 全面兑现」是 ④ 类通用知识/判断,未挂 ④ 类标注也无判断块;另 fn12 句尾多一个句号 — 违反来源四类标法 — 修法:两处各加一行「补充(不在书里,来自通用知识)」脚注; 删多余句号。
- [03-mdp fn13] 清洗文本负号丢失点宜加一句防呆提示 — 习题 3.14 邻值在 text/06:709 里「−0.4」的 负号在转码中丢失(显示为「+0.4, 0.4」);拆解取数与图 3.2 一致、且已自查标注「该区排版有乱码,数字 以图为准」,处理是对的 — 但未来回核者拿清洗文本逐字比对会被误导 — 修法:fn 里补一句「该行负号系 转码丢失,以上 2.3/−0.4/0.7/0.4 以图 3.2 为准」。
裁决说明
四条门禁全绿、5 条抽查出处全属实、17 章映射完整、浓缩比判据过、立场标注到位——主体是合格偏优的一份
拆解。不能直接 PASS 的硬原因是问题 1(许诺未足额兑现)与问题 2(16 章走查缺位,收尾自检「走查」一项
不过)。修掉 1、2 即达 PASS 门槛;3–6 为顺手修的轻微项。书卡 readState/claims/notCovered/soWhat 与
实际覆盖一致,主人认可(book-verdict)一项在本审查范围之外,仍待主人。