审查 an-introduction-to-deep-reinforcement-learning — 2026-08-27
结论: ISSUES(6 条:须改 3,低危 1,nit 2)
门禁实跑(本人重跑,非转抄写手自报):
book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)
book-verify: 1 本有拆解、共 519 处出处、0 处对不上
总量 279,671 字符,与交待相符。reviewer 未修改任何拆解正文。
专项核查(任务书点名的六件事)
- nndl-2e 互引锚(7 处):逐一打开
docs/nndl-2e/对应章核「事实=」,7 处全部吻合——#11-backprop(两处:常数倍/完整机制,见其 essence L10)、#13-convolution(滑动点积/特征图,L99–100)、#16-long-range-and-gating(加法通道+三软开关治梯度消失,L10/46)、#37-vae-and-gan(判别器最优⇒梯度消失与模式坍塌,L44/175)、#20-attention(打分再加权可手算、自注意力一步可达,L10/46)、#32-alignment-and-reasoning(覆盖 RLHF 之外的后训练路线,DPO 等,L40–41)。 格式:shelf=ai-book-reference/nndl-2e#<章文件>被 book-verify 正确解析(「519 处出处 + 7 处书架锚,0 处对不上」),#后确为我们自己写的拆解章,与锚规则「两种指法」一致。但见问题 5、6:这是书库互引的新用法,与模板有出入。 - 重排忠实性:原书 7 个正文章 + 序/跋全部覆盖(对照
chapters.json29 个文件逐一核对;导航章未读未引 ✓; 4.4 SARSA(λ)、4.9 TD3 内容在 4.3/4.8 文件内,已分别落 08 §3.2、09 §3.4)。frontmattersourceChapters与实际内容一致。 策略梯度推导从 DQN 节归位 09 章的两处声明都在位:07 §3.3「书里在这节塞错了地方的推导(挪走)」; 09 §1 重排说明 + §4「归属改变的声明见第 07 章 §3.3」+ 注 1。已回核原文:原书确在text/10:84(搜「Policy Gradient Theorem」) 放了这块推导,归位判断属实。兑现表对应行(07§3.3 →09§2、§3.1)核实无误。 - 两处史实硬伤 + 4 处编辑粗糙,「照录+注明」全部合格:
GPT-4 微软(原文
05:362「GPT-4 was released by Microsoft (2023)」,01 §5 照录+脚注注明 OpenAI 出品为补充); AlphaGo 对手(原文05:333「won four out of five games against Chinese master」,注明李世石为韩国棋手、对柯洁 3:0); LSTM 仍称机器翻译首选(25:823原文核实,10 §5 注明过时并引书内第 6 章自相矛盾处); ANN 100–1000 神经元(05:375核实,01 §5 注明过时并指出参数/神经元口径混用); 登记表填 xx/错位(19:28xx、18:28、21:28错位均核实,10 §1 照录); DQN 动作标 Continuous(10:30核实,07 §3.4 照录勘误)。另有三处原书粗糙(SARSA 句串入 Q-learning 节09:43、 reward shaping 一句带过10:39、V(a) 记号不一致)也均照实注明,超出任务要求。 - Sutton & Barto 未被引用 ✓:全目录 grep 仅
notes/reading-notes.md:47记录「unread,铁律不许引用,不引」, 14 章 + index 正文零引用。书卡 soWhat 提及属书卡层面的书目关系,不算作锚,合规。 - 脚注回核(抽 13 条,超额):01[^11][^12]、06[^2]、07[^4][^5]、09[^2][^3][^5][^15]、10[^1][^12]、14[^24]、04[^12] 全部属实,
指向段落确实说了拆解声称的事(含 Pong +1/−1 在
25:264、SAC 单调改进在14:95、基线无偏在22:84)。 - 主走查数字落位(DQN/PPO/SAC):07 §3.1(y=0.99、损失 0.0441)、09 §3.1(G₀/G₁/G₂=8.1/9.0/10)、 09 §3.6(min(3.0,2.4)=2.4;min(−1.0,−1.6)=−1.6,PPO-Clip 方向正确)、04 走廊备份(−1→7.1→7.74→7.80)、 08(1.85 对 0.59)、06(0→2.5→3.75→4.375)、02 自编码器、05 的 MSE/MAE/Huber/交叉熵——手算复核全对。 唯一算错的数见问题 1、2。 SAC(09 §3.3)按书讲软策略迭代/KL 改进/α 温度,未配数字走查, 符合「一章一主走查+至多两处」的详略裁决,不算违规;若日后补,可在 α 的「随机性值多少钱」上给一对演示数。
问题清单
- [03-markov-decision-process.md §3.5 L145–146] 折扣算例的收尾句自相矛盾 — 本例是「两步之后」:0 + 0.9×0 + 0.9²×10 = 8.1;紧接着却写「十步之后的十块钱在今天只值九块 (0.9¹⁰≈0.35)」——0.9¹⁰≈0.35 对应 3.5 块,不是 9 块;且与本章「可带走」第 6 条「十步之后的 10 分今天只值约 3.5 分」直接打架。 违反:第 13 条(留下的每个数字都要有参照物/自洽)。修法:改为「两步之后的十块钱,今天只值八块一;若是十步之外,只剩三块五(0.9¹⁰≈0.35)」。
- [05-loss-activation-entropy.md §3.1 L68] log-cosh 行的算例数值错误 — 对误差 (−1, 2, 0),log-cosh 真值 = 0.434 / 1.325 / 0,均值 ≈ 0.59;文中写「近似 (0.5 + 2.04 + 0)/3 ≈ 0.85」, 中间量 2.04 对不上任何口径(log-cosh(2)=1.325;二次近似 x²/2 得 2.0 且在 |x|=2 处误差已过半)。 违反:红线二口径 2(走查里每个数值必须真实,「为演示编的」只豁免输入数,不豁免算错的结果)。 修法:改为真值 0.43/1.33/0 → 均值 ≈0.59;或注明取小误差近似并给出真值对照。
- [05 脚注[^1]、03 脚注[^8]、04 脚注[^12]] 脚注的「原书章名」字段与所指文件不符 —
05[^1] 标「3.1 A Mathematical Model of DRL」第 43 段,但地址是
text/06-ch02-01…(第 2.1 章); 03[^8]、04[^12] 标「『A Mathematical Model of DRL』所属的第 6 章算法表」,该章实名是「Recent Developments in DRL」。 book-verify 只核file:行号+短语(全对),核不出人读的章名字段——正是「只改一边等于让给人看的那句 去骗读者」的变体。 修法:三处章名改为与文件一致(「2.1 Learning from Problems」/「Recent Developments in DRL」)。 - (低)[02 §4 L151、10 §4 L154] 两处「(我们的观察)」没有可证伪条件 — 「第 2 章把同一些网络讲了两遍」「套用登记表是章法松动」是我们的判断,章内孤立读时是裸判断; 其承重版本在 index §5 判断块 2(带「如果错」),但章内未指回。修法:各补一句「如果错,会错在……」 或括号注明「可证伪条件见总纲 §5 判断二」。
- (nit,改标准不改书)② 类锚的格式变体未入标准 — 7 处锚均省略了 BOOK-TEARDOWN 模板中的「依据:」前缀
(写法为「补充(不在书里,依据我们的 ai-book-reference 书架):shelf=… 事实=…」),且未带 @commit。
事实层面全部核实无误、校验器可解析,但「书架锚指向书库自己的拆解」是三个代码书架之外的新用法,
标准只写了「引我们自己另外三个书架」。建议:在 BOOK-TEARDOWN「书架锚怎么写」补一行:
库内互引可用同款
shelf=ai-book-reference/<书>#<章文件>,免 @commit(docs 在库内,git 可溯),防腐靠book-review。 - (nit)[09 §3.6] PPO 评语转述丢了原文限定语 — 原文(
17:139)是「preferred method for solving identification and classification problems」,拆解转述为「是求解的首选方法」。转述后反而更接近事实,但既然标了引号评语, 宜照录原文的古怪限定(或加半句注明原书措辞即如此)。
收尾自检逐项(过/不过)
完整性 过(7 章全覆盖、两处归位声明在位)| 生词 过(0/0/0)| 台阶 过(抽查 07 §3、09 §3 首句成列不跳)|
走查 过(14 章每章主走查可指认;数值手算复核,除问题 1、2 两处)| 句子 过(TODO 0)| 数字 不过(问题 1、2)|
许诺 过(兑现表 55 行抽查 8 行均真兑现)| 总纲 过(六节齐、§2 主线可独立成篇、机制细节未上提、术语就地解释)|
出处 过(519+7 全绿、亲抽 13 条属实;唯章名字段失真,问题 3)| 分层 过 | 诚实 过(三声音分开、演示数全声明、自造词「走廊类比」已声明)|
来源 过(书外说法全标补充、无外部 URL 故无查阅日期义务)| 干净 过(仅 index 末尾一行,与样板同款)|
版权 过(引文均短句)| 锚没腐烂 过(7 锚事实全核)|
主人认可 — 未审(不属于本次范围,待 book-verdict)。
判定依据
四门禁全绿、5+8 条出处抽查全属实、专项六项五项过硬;唯问题 1、2 是走查正文里读者可亲手算出的错数, 问题 3 是人读出处字段失真——按「有任何一项不过就是 ISSUES」判定。三条均为局部修改,不动结构,修完可复审判 PASS。