跳到主要内容

审查 large-language-models — 2026-08-29

结论: PASS(6 条小问题,均不拦门禁,建议下一轮顺手修)

审者:独立 agent,未参与写作;通读 16 章拆解 + index + 书卡 + BOOK-TEARDOWN 收尾自检表逐项过。

门禁实跑:

book-verify: 1 本有拆解、共 988 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了(217 个专业词首次出现处都有解释)
--quota: 段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

(注意:book-verify 带 1 条 warn,见问题 5。)

抽查记录(全部属实)

出处回核 11 条(超出要求的 5 条,全部亲开 text/ 核对):

  • 01[^11]「hundred GPUs」= 07-ch02-2-background.txt:67 ✓;02 KM 实验区间「768M1.5B / 22M23B」与拆解「7.68 亿15 亿 / 2200 万230 亿」一致 ✓;03[^16] 1.38% 存留率 ✓;
  • 04[^18] 0.1% 重复 100 次→800M 退化到 400M ✓;06[^18] 参数公式代入与 6,738,415,616、原书自述「exactly the same」✓;07 5.03×10⁻⁶ 与 8,388,608 ✓;
  • 08[^26] LLaMA-2 五轮迭代、前四轮拒绝采样 ✓;13[^13] Reflexion 把搜索词改成「Sam Kelly」✓;14[^13] 3900 条 / Interstellar 轨迹 ✓;15[^6][^19] Pass@k 无偏估计与 7_481 分词 ✓。

主走查数字复算 3 章(另加笔算核验):

  • 06 章四笔账:2VH+H+L(4H²+3HH′+2H) 代入真数 = 6,738,415,616(笔算复现 ✓);8CP = 7.28×10²³ ÷ (2048×2×10¹⁴) = 1.78×10⁶ 秒 ≈ 20.6 天(笔算 ✓,原书 :541 同数);LoRA 2P+16P_LoRA = 13,611,048,960(笔算 ✓);
  • 11 章量化走查:S=0.0486、Z=152、Xq 与还原矩阵全部逐字对上原书 :49-51(注:S 的分数 12.8/255 精确值是 0.0502,原书给 0.0486 是按 Z=152 反算的取整——拆解照抄原书,不算错,但见问题 6);
  • 15 章 Pass@k:C(15,3)=455、C(20,3)=1140、1−455/1140≈0.601(笔算 ✓,n/c/k 已声明为演示编的,符合口径第 2 条)。

完整性:75 个原文件,导航章(copyright/contents/list of symbols/references×10/glossary/bibliography/abstract 头)排除后 51 个内容文件,全部落在各章 sourceChapters(13 个正文章逐一映射,无遗漏;前言由 01 章引用并作时间锚)。

接力接缝 02→03:两侧各抽 01/02 与 03 对比——「讲三件事+主走查」引头、七段骨架顺序(判断→边界→可带走→原文地图)、判断块格式、脚注五部件格式、generated: book-teardown 0.3 完全一致;术语(token/显卡/代理模型/检查点)首现解释口径一致,03 无重复解释也无漏接(03 明确回指 02 的「数据/参数比」与 01 的流水线)。09/14/16 三章(第三棒)同样接得上:12 章判官偏差→15 章、08 章 DPO 伏笔→09 章、01 章换挡→14 章,均兑现。

综述书判据三条线(非论文摘要堆叠,各线有脉络与边界):

  • 预训练数据:03§3(1.38% 矿石)→ 04(三道清洗带阈值出处、BPE 走查、YuLan 1680B 配方)→ 15§2(污染 1.3B>65B)→ 16§3(自动化是下一步)——每环有「什么时候失效」(代理模型假设不总成立、规则英文中心);
  • 对齐:07(解锁非注入)→ 08(3H→偏好数据→裁判→PPO 四部件)→ 09(DPO 推导+SFT/RLHF 对照+幻觉三层病因)→ 14§4(可验证奖励 vs 人类偏好是同一引擎两种燃料)——边界判据齐(DPO 放弃在线打分、可验证奖励限有答案任务);
  • 评测:02§4(尺子争议)→ 04/07(污染与判官偏差两处伏笔)→ 15(指标适配→三范式硬伤→能力地图→选型)→ 16§1(作者亲手修污染)。

复旦版差异化(index §6 + 抽 03§6、06§5、16§5 对照):「复旦推公式铺体系,本书给脉络判据可复算的账」在四处口径一致、无互相矛盾;16§5 分工表逐行可落到具体章。

总纲:六节齐全;§3 只读它可复述全书主线(四段流水线、每步「上一步逼出什么」);机制细节未整段上抬,术语只留一行括号注;兑现表 28 行抽核 8 行全部兑现(05→11 KV cache、03→06 ZeRO、09→10 温度、12→14 长 CoT 等)。书卡 readState/claims/notCovered/soWhat 与拆解实况一致。

问题清单(均不拦 PASS,建议修)

  1. [05-architecture.md §8] 编辑残迹:第 235-237 行「原书的复杂度:……」一句是被截断的插注,且 (O(TH+H²)), 在相邻两行重复出现两次 — 违反行文整洁/名词成箭头的读感 — 建议改为「原书用复杂度(计算量随输入规模涨多快的度量)对照表 5.2 把这笔账写清」并删重复片段。
  2. [06-pretraining-playbook.md 章首引块] 「讲三件事」被拆成 6 个孤立引段,「学习率」「批/批量」的定义各占一行、彼此割裂(「它的正式名字叫批量」悬空) — 违反引头三件事的结构承诺 — 建议合并为两三段连贯引文。
  3. [07-instruction-tuning.md §9] 错字:「教师没有的的能力」多一个「的」 — 建议删。
  4. [10/11/15 三章无判断块] 标杆书每章 ≥1 个判断块,本书 13/16 章有 — 与标杆不一致(非门禁项,但三棒合稿后这是最可见的杆差)— 建议各补一条:10 章「挑法是产品决策」、11 章「宁大勿小/算术强度诊断法」、15 章「任何分数先问考题进没进训练料、谁当裁判」,均自带「如果错」。
  5. [02-scaling-laws.md 脚注1] book-verify 的唯一 warn:text/07-ch02-2-background.txt:357(nat 的原文注)没写「搜」短语,行号一漂就找不回 — 建议补「搜 nat」。
  6. [11-inference-efficiency.md §5] 两处小瑕疵:①「解方程组 → S = (13.6−1.2)/(127−(−128)) = 0.0486」的等式本身算不出 0.0486(精确 0.0502;0.0486 是原书按 Z=152 反算的值)——数字照抄原书没错,但演示推导与结果对不上,建议加半句「原书给 0.0486(按 Z=152 取整)」;②§4「一个二分类(……)器判断」插注把「二分类器」劈成了两半,建议挪正。

通过项明细(免得下轮重查)

  • 红线一(不搬原文):抽查 10/14 章英文引语均为短句钉子,无整段搬运;
  • 红线二(主走查):16 章中 15 章可指出主走查(01§4、02§2、03§6、04§5嵌+§6、05§3、06§4、07§6、08§6、09§2、10§2、11§4/§5、12§1、13§5、14§1、15§1),全部在正文、演示值全部当场声明「编的」;16 章为结论章无承重机制,不适用;
  • 红线三:机器 0 命中 + 抽读(05§2、09§1、14§4 段首句成列)不跳级;
  • 台账:正文无格式/许可/清洗统计(04/05/14 的「转码丢图」披露是内容缺口诚实声明,属「书里没有照实写」,不算台账);
  • 空转词:「显然」「最值得注意的是」各 1 处,低于红旗线(3 次/页);
  • 判断块 13 个全部带「如果错,会错在」;书卡 lastReviewed/claims 与正文一致。