跳到主要内容

审查 building-large-language-models-from-scratch — 2026-08-27

结论: PASS(5 条 nit,均不拦路;红线零违反、门禁四绿、抽查出处全属实)

审查人独立重跑四条门禁(未采信写手自报数);读毕总纲 + 13 拆解章 + notes 两件; 对照 library/…/chapters.json(96 文件 = 7 导航 + 11 真实章 + 索引)核覆盖; 抽 6 条脚注回核原文;本案专项(AI 综述降档、公式重建、两处笔误、差异化)逐项核到原文行。

门禁实跑:

book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)
book-verify: 1 本有拆解、共 655 处出处、0 处对不上

专项核查(本案四个重点)

1. AI 生成综述降档处理 —— 在位,且没有把可疑数字当事实转述。

  • 总纲 §1 亮明「机器代笔痕迹」「对综述降档处理:当导览用,不当论据用」;§5 第三条判断块给出过滤器口径与可证伪条件。
  • 抽核三处点破,全部在位、锚点属实: a) 01 §6 判断块:「GPT-4 万亿级参数是市场传闻口径」——原文 41:29 确为 "boasting trillions of parameters",拆解在 06 §8 边界、06 原文地图又各点一次; b) 07 §7:抓到原书内部口径打架(42:493「32-80 层」vs 第 50 章「数百层」),取保守值并注明; c) 09 §6:460 万美元 / 2 万亿 token 等标注「属二手转述的公开估计,原书未给一手来源」;10 §7 对 petaflop-天口径同样标注。
  • 最要紧的一条:BERT「第 7 层注意力 >0.8」(原书 64:11,实为 codecogs 公式图残链)在 13 章正文里一次都没有被当事实复述——只在总纲 §1/§5 当反面例子点名;同理 Claude 3.7「估计 2000 亿参数」在 02 §7 版图表里被主动弃用(只写「参数未公开」)。降档不是贴标签了事,是真的没让脏数字进正文。

2. 公式图片丢失的散文重建 —— 声明在位,抽 1 处实算通过。

  • 声明三处:index §4 第一条、02 §8、04 §6;原文侧证实凿:21:14964:11 等处残留 codecogs 公式链接,公式确为图片全丢。
  • 实算抽 04 §3 RMSNorm 手算:[2,0,4,0] → 均方 20/4=5 ✓ → 1/√(5+10⁻⁵)≈0.4472 ✓ → 输出 [0.89, 0, 1.79, 0] ✓,且脚注 [^8] 明示「向量取值是为演示编的」,算式锚回原书公式节。附带核了 05 §2 旋转点积走查(cos30°=0.87、cos(60°−30°)=0.87 的恒等式成立)。全部走查演示数(02/04/05/06/08/09)均带「为演示编的」声明。

3. 两处原书笔误标注 —— 方式正确。

  • 05 §5 判断块 + 脚注 [^17] + 原文地图两行,三处齐备;回核原文:40:1063 确写 "Reformer"(而 40:17 正文自引《RoFormer》)、40:773 确写 "Neuro Tangent Kernel"。标注同时给出「不影响机制讲解,引用以论文原题为准」与可证伪条件(Apress 勘误即过时)。

4. 与 cong-ling-gou-jian-da-mo-xing 差异化 —— 立住了。

  • index §4 首条 + §5 判断一:Raschka=2024 复古配方、中文教材=2017 原教旨组件、本书=2025 配方拼全 + 对齐流水线;判断块带可证伪条件并给出核对路径。对照已拆中文书的实际章节表(transformer 零件/生成/BERT/ViT/PEFT/数据/算力/鲁棒/优化器/压缩/训练/微调),确无对齐流水线与 MoE 专章——「不覆盖对齐与专家混合」的说法与事实相符。

常规项

  • 完整性:原书 11 个真实章全部被 13 章覆盖(01←ch1;02←ch2;03←ch3;04←ch4;05←ch5;06←ch6;07←ch7;08←ch8;09←ch9;10/11←ch10;12/13←ch11),sourceChapters 与 chapters.json 一致;7 个导航章与索引未读未引,合规。
  • 红线一:抽 6 条脚注(01[^7]、03[^18][^21]、04[^12]、05[^17]、12[^9])逐条回核原文,短语全部真实存在、指向的段落确实说了拆解声称的事;引用均为短句级。
  • 红线二:每章主走查落位——06 §3 掩码 4×4 矩阵(演示数已声明)、10 §3 滑窗切样本 + §5 真实日志(24.2249/3.29e+10 → 0.1183/1.13,与原文 73:335/:373 逐位一致)、04 §3、05 §2、09 §2、13 §2 全在正文;11 §4 三幕解剖的引文碎片全部真实且顺序未颠倒(对照 75:195-201)。
  • 红线三/配额:门禁双 0;抽读三节(06§1、10§4、12§4)段首句连读不跳。
  • 总纲:六节齐、顺序对;主线节(§2)十步因果链只读即可复述全书,机制全部退回章层;兑现表 43 行,抽核 7 行(含 03§7→11§3、06§8→13§3、10§1→12§6、04§4→07§2、05§4→10§5)全部兑现且兑现的是许诺的那件事。
  • 判断块:16 处全部带「如果错,会错在」。
  • 书卡:readState=read、11 章 readChapters、claims 6 条、notCovered 与总纲 §4 一致,soWhat/usedByTopics 齐。
  • 台账:正文无格式/许可/清洗统计;「公式是 epub 图片丢失」属影响理解的背景,合规。docs-lint 43 处命中全为脚注反引号/顿号串类误报(标准明文豁免)。

问题清单(5 条 nit,均不违反红线、不影响门禁)

  1. [02-training-math.md §5 防背题三件套表] dropout 行只有 2 格(表头 3 列)——「做法」被并进「手段」、「防什么」内容错位进「做法」列 — 违反行文第 5 条表格规范 — 修:拆回三格(dropout | 训练时随机清零约 10% 神经元输出 | 不把宝押在个别连接上)。
  2. [01-what-is-an-llm.md §1] 「好 40%、吧 12%」的演示数字未标「为演示编的」— 标准红线二口径 2(走查非书内数值须当场声明)— 修:句尾加一句声明。
  3. [index.md §1] 「读之前必须知道的一件事」一段连续 7 行(docs-lint 段落墙),超「一段不超过三四行」— 修:在「所以我们的拆解对综述降档处理」前断段。
  4. [03-bpe-tokenizer.md §8] 「词表普遍到 5 万-20 万、中文一字一 token」是书外通用知识,未用标准标记格式「补充(不在书里,来自通用知识)」,只写了「书里没展开……的补充」— 语义已标、格式不合 — 修:补标准前缀。
  5. [11-inference-big-moment.md §4] 「照录原文输出」实为省略号拼接的节录:实际输出在两次背诵之间还夹了「The height of his glory」段的完整复读(L197/L199),拆解未提 — 三幕归因与原书 77 章一致、无事实错误,但「照录」略强于实 — 修:改「节录照录」或在省略号处注明中段还有一次复读。

复核记录(备查)

  • 脚注抽查:01[^7]→10:17✓;03[^18]→38:11「Vocab size: 111 (requested 160)」✓、[^21]→38:99「lease,only this token.」✓;04[^12]→39:357「7–64%」✓;05[^17]→40:1063「Reformer」/40:773「Neuro Tangent Kernel」✓;12[^9]→88:35「Ten thousand high-quality examples…」✓。
  • 可疑数字原文锚:41:29(GPT-4/PaLM trillions)、64:11(BERT >0.8,公式残链)、40:427("Empirical studies show" 20–30%,与总纲「快两三成」例子对得上,拆解引用时已带「书里引的数字」口径)。