跳到主要内容

审查 the-rlhf-book-reinforcement-learning-from — 2026-08-27

结论: ISSUES(6 条,均为局部修补,无结构性返工)

门禁实跑:

book-verify: 1 本有拆解、共 806 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了(122 个专业词首现处都有解释)
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

审了什么、怎么审的

  • 通读 docs/_authoring/BOOK-TEARDOWN.md、书卡、index.md、16 章拆解全文;
  • 四条门禁本机重跑(结果如上,与中央复核一致);
  • 承重机制实算 3 处(数字独立重算,并回核原文):
    1. 04 章 RM 主走查:r_c−r_r=1.5 → σ(1.5)=0.8176≈0.82 ✓ → −ln(0.82)=0.201≈0.20 ✓;损失式 -logsigmoid(r_chosen−r_rejected) 与原文 text/08-ch05:198(搜「logsigmoid」)一致;
    2. 06 章 GRPO 主走查:[1,0,1,0] → 均值 0.5、样本标准差 0.5774(PyTorch 无偏口径,与原文伪代码 std_grouped_rewards 一致,text/22-ch06-02-6-2-5:38)→ 优势 ±0.866≈±0.87 ✓;三种损失聚合的 0.25/0.14(0.1429)/0.0909 与原文 text/19-ch06-02-6-2-2:200-206 的真实代码输出逐一吻合 ✓;
    3. 08 章 DPO 推导:最优策略 ∝ π_ref·e^(r/β) → 反解隐式奖励(log-ratio)→ 代回 Bradley-Terry 配分函数消掉 → 一行 sigmoid 损失。与原文推导链(Eq 8.10 配分函数 → 8.16–8.17 Gibbs 不等式取最优 → 8.26 sigmoid)结构一致;隐式奖励、静态 β 与在线动态 KL、缓存省 50% 显存三处表述均与原文 152/645/648 段逐句对上 ✓;
    • 附带:05 章 PPO 六情况表与原文 13-ch06-01-6-1-4 的 NO UPDATE 两例(正优势 r>1+ε、负优势 r<1−ε)及「信任区内等同一般策略梯度、区外目标函数是平的」一致 ✓;07 章素数和 77、12 章 fib(50)=12586269025 复算正确 ✓;
  • 5 条脚注回核(打开 text/ 原文搜短语):04:352「35 to 48」✓、19:255「reward = torch.tensor([3.0, 1.0])」✓、27:695「a hair behind」✓(上下文确为受控对比后 DPO 略逊)、30:444「6 week」✓、35:270「150K training samples」✓;另核 36:410「random rewards」跨章引用,原话与 07 章[^20]声称一致 ✓;
  • 完整性:原书 18 章 + A.1 全覆盖,导航章正确跳过。合并声明三处齐全:ch06 拆两(05 §1「拆成两半」)、ch9+8 合一(08 §1 明写原书顺序与我们的倒排理由)、ch14+15 合一(13 §1「一件事的两半」);
  • 判断块:全书 17 处,17 处全带「如果错,会错在」;抽 5 处(01 断层、05 症状药表、07 RLVR 吞并、10 按吨买过渡、index 三声音)——4 处可证伪条件扎实;index「三个声音」一条的「如果错」写成了误用后果而非该判断本身的证伪条件,格式合规、力度偏弱(不单列问题);
  • 总纲:六节序齐(30 秒导读在前 + §5「今天读要修正」为合规增补);§2 十步主线逐词查过——RLHF/指令微调/奖励模型/梯度/PPO/GRPO/推理模型/拒绝采样/DPO/Goodhart/KL 缰绳/正则化/合成数据/优化全部首现处有就地白话解释,无公式无机制细节下放错误,能独立成篇;兑现表 11 行抽 4 行(⑥→07§3、⑧→14§3+13§3、⑩→11§3.4/15§3/16§3、地图行)全部兑现且兑现的是许诺的那件事;
  • 主走查红线二加强:16 章逐章指认,主走查全在正文、演示数全部当场声明「编的」、真实数(150K、$500K/6 周、0.25/0.1429/0.0909、35→48 等)标明来源;编的与真的分界清楚;
  • 作者立场:index §1「深度利益相关」+ ch04(RewardBench)/07(Tulu 3)/08(救 DPO 当事人)/15(OLMo 3)各章利益相关均当场点明;方法论推荐(如「1 epoch」「~1M 够用」「多阶段修噪音」)在「作者的判断与证据」节标为经验法则而非中立事实 ✓;
  • 台账泄漏:正文干净;index 尾注「原始书籍文件不入库」一句属库务台账措辞,可留可删(不单列问题)。

问题清单

  1. [12-tool-use.md §2 术语表] 「代码执行」整行重复出现两次(「工具是一台代码解释器」/「工具是一个代码解释器」)— 复制粘贴残留,读者会数出四个术语而原书是三个 — 删去一行。
  2. [10-preference-data.md §4 判断块] 「合成数据(第 11 章,便宜四个数量级)」与 11 章 §2 自己实算的口径(人 ~$1 vs AI <$0.01,「差出两个数量级以上」,原文 text/31:151 同)直接矛盾,且四个数量级无任何出处 — 改成与 11 章一致的「两个数量级以上」。
  3. [05/06 frontmatter sourceChapters] 05 章的策略梯度推导实际承重自原书第 6 章导语(text/09-fm-this-chapter-covers.txt,原文地图也引了),6.2.1 只出现在原文地图;06 章引了 6.3.3——三者均未列入 sourceChapters,元数据与实际覆盖不一致,影响 agent 按章路由 — 按 chapters.json 章名补全。
  4. [多处·文字残留] 13 §4「RLHF 在第一轴上 always 赚」、14 §3.2「行业 afterwards 的走向」、15 §3.3「 rarely 出现在对比表里」及「噪声带就很大::」双冒号、05 frontmatter「每個字」繁体字 — 未净化的中英混排/笔误 — 逐处清理。
  5. [15-evaluation.md §3.5 末两条 bullet] 「内部指标常是公众看不到的量,比如『熵』…」与「GPT-4 报告那种按交叉熵…公众永远看不到」语义重复,且「一类衡量差距的量」指代含混 — 合并重写为一条:内部用交叉熵类指标做预测,公众看不到。
  6. [index.md §5 兑现口径] 「价格口径(约 $1/条)→ 随模型降价…持续下移」是书出版之后的事实性断言,无 ③ 来源(带查阅日期)也未写成判断块,违反「书外说法必须标成补充或判断」— 补来源,或改写成不带事实断言的阅读建议(「把它当 2025 年量级快照」即可)。

抽查备注(不构成问题)

  • 全书 0 处 ②/③/④ 补充:本书 2025 年 11 月出版、内容自足,所有缺口书内都有交代,不违反取材规则;与库内 post-training-ai 的差异化目前只写在书卡,index 未提——可选优化,不拦。
  • index 判断 1/2 分别与 05/14 章判断块近重复,属总纲聚合口径,可接受。
  • 10 章 §3.4「约 50 万美元」数字属实(text/30:451),但所在脚注 [^12] 锚在 408/420/444/463,未覆盖 451——建议给该数字补一个锚。
  • 01 章 [^1] 续写引文为模型输出样例的节录、脚注声明「节录开头与中段」,红线一内;03 章 ChatML 模板为机械格式串,无版权风险。