审查 dive-into-deep-learning — 2026-08-29
结论: ISSUES(2 条,均为轻微、易修)
门禁实跑(本人重跑,非写手自报):
book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)
book-verify: 1 本有拆解、共 874 处出处、0 处对不上
审查范围:index.md + 20 章全部通读;notes/01-outline.md 与 reading-notes.md 抽查; 书卡 aiRef/sources/dive-into-deep-learning.md 与拆解实际覆盖核对一致 (claims 五条均在对应章兑现;notCovered 六条与各章「边界与局限」及 ch20 §5 交代一致)。
问题清单
-
[07-builders-guide.md 全章] 指不出主走查 — 违反红线二加强 (「每一章必须 有一条主走查……指不出来就是不合格」)。 这是全书 20 章里唯一没有可走查段落的章:§1 讲 module 递归、§2 讲参数三件事、 §3 讲 GPU 三条铁律,都是规则陈述,没有「挑一个具体输入从头走到尾、每步带数」的段落。 该章 8.9k 字符,也是全书最短(低于篇幅参考的 9k 下限),却压了原书 7 节(33-39)。 缓解因素:本章内容是工程抽象而非数据流机制,是走查要求最难适配的一章; 且 GIL 卡 GPU 的失败路径有半步走查的影子。 建议修: 补一条短走查即可——例如拿
nn.Sequential堆一个 28×28→784→256→10 的三层网,逐步写出每步的张量形状与参数归属 (哪份参数挂在哪个 module 下、共享参数时梯度怎么汇总), 或把一个 minibatch 的设备放置从 CPU 到 GPU 逐步走一遍(撞上铁律一的那一步写出来)。 -
[index.md §6 兑现表] 总纲 §2 主线有 4 处「第 N 章讲」未记账 — 违反「许诺」自检 (「每一处往后指的话都要在兑现表里记一行」)。 漏记:§2②「两次检测 13%→83% 的完整走查在第 02 章」、 §2③「从此只能靠迭代(……第 03 章)」、§2⑨「幂律……(第 13 章)」、 §2⑩内的三个次级指针(学习率→14、批量→03、日志暗坑→07)。 已核实:这些许诺的实质全部兑现(02§6 HIV 走查、03§4 minibatch SGD、 13§3 scaling law、14§3-4、07§3 均在),纯属兑现表记账不全,不是空头支票。 建议修: 兑现表补 3-4 行即可,正文一个字不用动。
逐项核对记录(其余各项全过)
完整性(149/149): 程序化核对:20 章 frontmatter 的 sourceChapters 共 149 条, 与 library/dive-into-deep-learning/chapters.json 的 0-148 号正文节一一对应、无重无缺 (逐条匹配标题,uncovered=0,duplicated=0)。 附录 19 节(149-167)不进 sourceChapters,由 20 章 §5「附录怎么用」成组交代: 明写「查阅性质,我们没有逐节拆」,给出两摞(数学 150-160 / 工具 161-168)的使用场景, 并配原文地图行与脚注(text/160、text/167)。这种处理与书卡 notCovered 一致,合格。
浓缩裁断(原书 300 万字符 → 拆解 35 万): 被压掉的是代码实现 (每章明示「代码有意不搬/拆解只取机制」)、Kaggle 实战调参流程(ch06/16 边界里点名)、 pandas/API 等工具内容(ch02 §1)、公式推导边栏(指向附录)。 三条主线抽查机制完整性:
- ML 基础(01-05):四组件→训练循环→泛化→分类/偏移,链条完整,读完可复述;
- CNN(08-09):两原则推卷积→LeNet→AlexNet 两味料→BN→ResNet 函数类嵌套,完整;
- Transformer(12-13):数据库查询→√d→Bahdanau→多头/自注意力/位置编码→ 架构组装→scaling law→三种预训练模式→ICL/RLHF 来路,完整。 承重内容未见被压掉的;「读完能复述主干」成立。
红线一(不搬原文): 抽查的脚注引文均为短句 (如 「you should not get used to such good fortune」),无整段搬运。
红线三/配额: book-jargon 195 个词首现全有解释,段/节配额 0 超额;逐条看过,非误报放行。
走查抽查(数字回核原文):
- ch02 §6 HIV:0.1306 / 0.8307 在 text/10:802、:848 原样在;中间算术 0.011485 复核一致;
- ch05 §4:2500 / 10,000 / 15,000 在 text/24:184、:188、:215 原样在;
- ch08 §3:卷积走查 19=0×0+1×1+3×2+4×3 在 text/41:85 原 样在;参数两刀 10¹²→4×10⁶→4Δ² 在 text/40:151-170;
- ch11 §3:贪心 0.048 vs 另一路径 0.054 在 text/68:101、:131 原样在;
- ch13 §3-4:BERT 250B token(text/77:109)、GPT-3 300B(:331)、GPT-2 40GB(:287)、 Chinchilla 70B/1.4T(:386)全部原样在;
- ch19 §3:Q-learning 约 250 轮收敛、值迭代更少,在 text/129:151 原样在。 演示编数(16 章 NMS、17 章 skip-gram、18 章对齐权重、20 章 GAN/矩阵分解) 全部按规矩当场标了「为演示编的,不是真实数值」。
脚注抽查 5 条(亲自开原文):
- 02[^26] → text/10:848 「0.8307」✓ 内容即第二次检测后验;
- 08[^9] → text/41:85 卷积走查数值 ✓;
- 11[^8] → text/68:101 贪心反例 0.048 ✓;
- 13[^9] → text/77:386 Chinchilla 1.4 万亿 token、70B 胜 Gopher ✓;
- 20[^10] → text/142:3 Simon Funk 博客首提矩阵分解 ✓。 5/5 属实。
台阶抽查(三节首句成列): 03§3(平方误差→双刃剑→为什么偏偏是平方→最大似然→ 假设换尺换)、12§2(打分引擎→点积来源→数值毛病→除 √d→加性→工程件)、 17§5(死结→crane 两义→三步演进→双向的代价→MLM 走查→NSP)——三列均不跳。
判断块: 全部 21 个文件逐一核对:18 章各 1 条、index 3 条,每条都带「如果错,会错在」; 02、07 两章无我们的判断块(不违规:章级只要求「作者的判断与证据」节,两章都有)。
总纲: 六节齐全(30 秒导读为题头引用块,§1 谁写的、§2 主线、§3 地图、§4 覆盖/不覆盖、 §5 判断、§6 兑现表);§2 主线 12 步推理链(规则写不出→数学三件→第一循环→泛化→分类→ 深度→卷积→序列/注意力→Transformer→幂律→旋钮与机器→七个应用面) 独立成篇可 复述全书,机制细节均压成一句从句并指回章节,未越海拔。 地图每行「读完能回答」与对应章「可带走的」逐条对过,一致。
台账: 20 章正文无格式/许可/清洗统计;index 末尾的 「依据 GitHub master @23d7a5ae(CC BY-SA 4.0)」与样板书 what-is-chatgpt-doing 的同款落款(「依据 2023 年中文版」)同规,不算泄漏。 index 的「约 300 万字符」经实测核对准确(text/ 全量 3,002,842 字符); 任务书里说的「247 万」与实际不符,以实测为准。TODO(没懂) 零命中。
互引分工: d2l 在库内是②类锚源——handbook-of-deep-learning-models/06 的 [^14] 以「我们书架的 dive-into-deep-learning 条目」佐证其卷积章与 d2l 逐节同构(单向引用); ai-design-lab 课程 survey 亦引。本书拆解无需反向引用 handbook(拆解以原书为主体, 分工正确),且 index §5 判断一已把本书定位为「机制的第一落点」并指向更轻的 what-is-chatgpt-doing 与 nndl——互引没有扭曲这本书的读法,分工干净。
书卡: readState=read、readChapters=149 通读+附录略读、claims/notCovered/summary/soWhat 均填,且与拆解实际覆盖一致(抽查:claims 的「scaling law/BERT/GPT/T5」对应 13 章, notCovered 的「扩散模型一线」对应 01§5+20§6 的交代)。
边角观察(不构成问题,供下轮参考)
- 05 章没有标「主走查」字样的段落(最近的是 §4 的 ±0.01 样本量推导与 §5 Oxford 鞋思想实验, 两者都有中间步骤,实质够用,但没像其他章那样点名)。若修第 1 条时顺手,可给 05 §4 补个标注。
- 02、07 是全书仅有的两个没有「我们的判断块」的章;不违规,但 02 章 (数学工具箱)其实有可供判断的料(比如「只学这三件数学」本身就是取舍判断)。