跳到主要内容

审查 little-book-of-deep-learning — 2026-08-29

结论: ISSUES(9 条:5 条数字/事实硬伤,4 条轻微)

门禁实跑:

book-verify: 1 本有拆解、共 397 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

通过的项(收尾自检表逐项)

  • 完整性:机核 26 个内容章对 sourceChapters,0 missing、0 extra;导航章(目录/图目录/参考文献/索引)正确跳过。
  • 红线一:抽 5 条脚注全部属实(01[^13]/04[^11]/07[^11]/10[^5]/12[^10]),引文均为短句钉说法,无整段搬运;两处行号漂 1–6 行,短语可定位,verify 判 0 错。
  • 红线二:12 章主走查全部指得出(01§2 四件事、02§3 批量、03§2 交叉熵、04§2+§4 下山与记账、05§6 四种并行、06§3 卷积、07§3 dropout、08§2 注意力、09§3 ResNet-50 全形状、10§2 SSD、11§3 RLHF、12§3 Q4_1),步旁带具体数/字串,演示数均带声明;另起走查均未超两处。
  • 红线三/配额:门禁全绿;人工抽读未见「一段两个以上没解释术语」。
  • 台阶:抽 05§2、08§2、12§3 三节首句连读,均逐级不跳。
  • 可疑体检复核:写手预检「可疑 629 字/页」——独立抽 text/21(注意力)、text/27(算力分裂)两章原文,正文连贯可读、无整段丢失;撕词(syn/synthesis、Quan/Quantization)为排版性,拆解已照实声明并规避。复核结论:体检「可疑」不构成本书障碍。
  • 总纲:六节齐全、顺序正确;§2 主线独立成篇(①→⑨ 一步逼一步,覆盖全书);海拔基本守住,术语均就地一句解释;兑现表 23 行逐行核,全部兑现。
  • 判断块:3 块全带「如果错,会错在」(均在总纲 §6)。TODO 零残留。
  • 书卡:readState=read、readChapters 26 章、claims/notCovered/summary/soWhat 与拆解实际覆盖一致。
  • 台账:正文无许可/清洗统计;「转码公式碎片」声明属影响理解的背景,合规。
  • 「小书」判据:三条线(ML 三要素 01/03/04、网络结构 06–09、训练 04/05)逐句承重,无口水段;密度靠就地解释与走查托住,零基础可跟上。与 nndl-2e 的差异化(精炼出处 vs 系统教材)在总纲判断块与 12§8 指路中立住。

问题清单

  1. [12-compute-schism.md §4] LoRA 走查算术错 10 倍 — W=4096×4096=1.67 亿,R=16 时 A+B=13.1 万,占比 0.78%,正文写「修正量 = W 的 0.08%」;且与下一句「『几个百分点』是原书给的典型量级」自相矛盾(0.08% 不是几个百分点)。违反主走查「每步旁边的数必须经得起重算」。→ 改为「约 0.8%(几个百分点的量级)」。

  2. [index.md §2④] 反向传播代价数字与第 04 章矛盾 — 总纲写「它叫反向传播——代价约是正向的三倍」;04§5 与书卡 claims 均为「反向≈前向两倍,一趟训练步≈三倍前向」。总纲把「三倍」安在了反向传播头上。→ 改为「反向本身约是正向的两倍,一趟训练合计约三遍」或「一趟训练约等于正向算三遍」。

  3. [05-training-in-practice.md §5] 「一次训练 ≈ 一块 GPU 不停算上万年」 — (a) 书里没有任何对应句(grep years/millennia 零命中),未按第 13 条补款标「补充(不在书里)」;(b) 按本书自己的数也算不出来:10²⁰–10²³ FLOP ÷ 单卡 10¹³–10¹⁴ FLOPS ≈ 3–300 年,差两个量级,换算不可被读者核对。→ 改成可核对的换算(如「最大一档 ≈ 一张卡不停算几十年到几百年」)并标注来源,或删。

  4. [01-learning-from-data.md §3] 「解出来大约是 w₁≈2.0、w₂≈0.10、w₃≈0.05」与自造数据的真实解不符 — 对所给 5 个点做最小二乘,真解为 (2.69, 0.115, −0.233):w₃ 连符号都相反,紧随的解释「再带一点开根号项的弯曲」方向也因此错了。演示数可以编,但「解出来」是对这组数的事实断言。→ 要么调整数据使解自洽,要么改措辞为「一组合适的权重比如……」。

  5. [04-gradient-descent-backprop.md §2] 「每步砍掉离碗底距离的 40%」与自己的算式矛盾 — 按所给 η=0.3,距离 7→2.8,是「剩 40%」即「砍掉 60%」。图说里这句是读者复算时第一眼会核的话。→ 改为「每步把离碗底的距离砍到原来的四成」。

  6. [05-training-in-practice.md §5] 「十年间,文本数据从『百万本书』涨到『百亿本书』」口径不合 — 原书表中文本集最早一档是 WMT-18 的 14M(千万级,且拆解的表把 WMT 行删了);拆解自己表里最早文本集是 16 亿本。「百万」两头都对不上。→ 改为「从千万本涨到百亿本」并保留 WMT 行,或删这句概括。

  7. [index.md §2⑥] 「四种基础件」自报四、只列二 — 主线只讲了全连接与卷积,池化、转置卷积缺席,读者按数清点会对不上;同节「### 训得动件」「### 三个核心件」有子标题而基础件没有。→ 补两个一句条目,或把「四种」改成「两种主力基础件」。

  8. [08-attention.md §2] 走查两行数字不自洽 — 「softmax 后(注意力分数)」0.55/0.15/0.08/0.05/0.17 并不是上一行点积 0.9/0.2/0.1/0.0/0.3 的 softmax(真算约为 0.34/0.17/0.15/0.14/0.19)。有「演示编的」免责声明,但两行之间声称了推导关系,细心的读者会重算。→ 把第二行换成第一行真实 softmax 的值(顺带:同句「√D(d 是向量长度)」大小写统一为 D)。

  9. [02-compute-substrate.md §2] CPU 参照物未标来源 — 「笔记本 CPU 峰值大约是 GPU 的百分之一到千分之一」不在书里(原文只在搬运转折处提 CPU 内存),量感方向虽对,按补款须标。→ 句尾加「(补充:不在书里,来自通用知识)」。

附:主走查抽核记录(08 / 05)

  • 08§2:Q/K/V→点积→softmax→加权取值的步骤、演示声明、两个极端情形校准俱全;除问题 8 的数字自洽外合格。因果掩码、多头、自/交叉、排列盲、嵌入、位置编码各落在正文位置,与 03/06/09 章的互指全部对上。
  • 05§6:70 GB/4×24 GB 演示,FSDP 每卡 17.5 GB 算得对;四种切法「切数据/切参数/切层/切层内」对照清楚,原文出处(13-fm 全章)属实。三套数据与缩放律以逻辑台阶+量级表承载,可接受。