跳到主要内容

通读之后的判断 — The Craft of Post-Training(备料第二份)

第一份 reading-notes.md 是逐文件的事实记录(Ch1-13 全书已覆盖)。 这一份是通读之后才看得出来的东西:主线、伏笔、切章建议、缺口清单、与本库其他书的分工。 写大纲的人拿这一份当地图,拿第一份当素材库。


零、这本书的基本盘(写总纲第 2 节要用)

事实出处
作者Chris von Csefalvay,原本受训为法律哲学家,后转 ML;住丹佛06:37「legal philosopher」·06:57
成书2024 年末起草,2026 年 1 月定稿(前言落款 2026-01-21),2026-06-30 出版06:59
缘起2025 年底给 HCLTech 企业研究服务部开的第一门微调课08:29
利益相关未声明商业利益;但对 NVIDIA 生态(DGX Spark、NeMo、Omniverse)着墨明显偏多,且 §162 那段 Omniverse 数据没有出处——写的时候要点明08:43·143:25·162:9-11
配套github.com/chrisvoncsefalvay/craft-of-post-training(notebook,含 DGX Spark 与 Colab 两版)06:41·08:41
参考文献211 条尾注,text/165-fm-notes.txt 完全可读,题名与 arXiv 链接齐全见第一份笔记末节

读者假定(这是我们最大的补课任务,单列): 书自己写明「We assume familiarity with transformer architectures and basic machine learning. Readers should be comfortable with backpropagation, gradient descent, and the general structure of neural networks.」(08:13)—— 它只从零建后训练的概念,不从零建神经网络的概念。 我们的读者两样都没有。


一、全书主线:一条从「为什么」到「怎么守住」的链

书自己没有把这条链写在一处。这是通读之后排出来的,总纲第 3 节应当照这条写

① 基础模型是「有能力、没目的」的泥
—— 前言的 Golem/shem 比喻:预训练给能力,后训练给它「该做什么、不该做什么」
↓ 那为什么是企业该干的活?
② 因为这是企业**唯一**能把自己的比较优势变现的那一层
—— 预训练是物流与规模,推理是工程优化,只有后训练关乎行为、品格、价值判断(`06:23`)
—— 「买智能」失败的三个理由:买不出规模、知识会流失(金鱼记忆)、人格租不来(`09:139-151`)
—— 用 Barney 的 VRIN 四条一验:领域适配过的模型**四条全过**(`09:199-209`)
↓ 可企业既不是发烧友也不是基础实验室,它到底在哪个位置?
③ 「关键中间层」(crucial middle):三种尺度,约束各不相同
—— memscale(1 卡,受显存约束)/ flopscale(几十到几百卡,受单位经济约束)/
powerscale(数千卡,受能源基建约束);企业在中间(`09:29-101`)
—— **这一层之所以存在,是因为 LoRA/QLoRA 这类技法存在**;没有它们,
有意义的后训练只有基础实验室做得起(`09:363` 明说)—— 这句话第 7 章才被兑现
↓ 那是不是所有问题都该微调?
④ 不是。先试更便宜的四条路,直到「生产要求缺口」把你逼到必须改权重
—— 提示、RAG、RAFT、激活引导,各有各的适用面(表 2-1 决策矩阵,`14:21-141`)
—— 逼你改权重的是三件事:一致性 / 合规 / 领域准确(`09:255-263`)
—— 判据是「知识还是行为」:RAG 改「知道什么」,微调改「怎么表现」(`11:21`,`12:3-9`)
↓ 好,要改权重了。最便宜的改法是什么?
⑤ SFT:给它看示范。**80% 的问题一周就解决**(`09:287`)
—— 但它有硬边界:有些品质**示范不出来**(好文笔)、有些偏好本质是比较性的、
有些行为是「知道什么时候别动手」——正例教不了(`09:289-291`)
—— 一句判据:「我能为这个输入写出完美回答吗?」能 → SFT;
「我看到好的能认出来」→ 得上偏好建模(Lemon test,`47:3`)
↓ 认得出、演不出,怎么把「认得出」变成可以优化的东西?
⑥ 奖励模型:它的作用不是当代理,而是**把偏好变得可微**(`51:39`)
—— Bradley-Terry 把成对比较变成一个可导的损失;然后 PPO 一边优化一边用 KL 拽住不许跑远
—— 代价:同时跑三个模型、约 3 倍显存,而且不稳(`51:27-29`)
↓ 太贵了,有没有更便宜的?
⑦ 有。DPO 把奖励模型消掉:KL 约束下的最优策略有闭式解,反解出奖励,
代进 Bradley-Terry 之后配分函数 Z(x) 抵消 —— **这就是 DPO 成立的全部理由**(`62:19-37`)
—— 奖励模型没被消灭,只是变成隐式的:策略的概率比就是奖励(`62:3`)
—— 后续一族(KTO 不要成对、GRPO 用组内均值当基线免掉价值网络、IPO/ORPO/SimPO 各治一病)
—— 口径:**举证责任在复杂度**,DPO 当默认,明确失败了才上 PPO(`70:163`)
↓ 等一下 —— 你怎么知道它真的变好了?
⑧ 评估。而且评估的难是**结构性的**:能算的指标与你真正要的东西只有弱相关,
所以 Goodhart 定律在这里格外毒(`73:5-7`,`74:7-11`)
—— 最狠的一句:**指标会塑造做开发的那些人的行为**(`74:19`)
—— 解药是三角测量:自动 + 模型评判 + 人评,三者同升才算真进步,
**发散本身是最重要的信号**(`75:3`)
↓ 训好了、也验过了,可它跑不起、也养不起
⑨ 效率:量化、PEFT、蒸馏、剪枝、服务
—— 这一章回收第 ③ 步的伏笔:QLoRA 把 70B 微调从「几千美元一小时的 A100」
压到「几百美元的 24GB 卡」,**关键中间层因此才存在**(`100:3`)
↓ 到这里为止,你有的还只是一个「通用但跑得动」的模型。它凭什么是你的?
⑩ **领域适配 —— 这是全书真正的落点**
—— 病灶叫 fluently clueless:广度是拿深度换来的;模型的自信是普遍的,知识不是(`111:5`,`111:21-23`)
—— **关键手法:别让专家写下他们知道的(没用),让专家去判断。**
作者亲历的金融项目里,写手册的那批专家自己都说不清规则,
但对「哪个回答更好」意见高度一致 —— 判断与产出是两种不同的认知过程(`111:41-45`)
—— 这就把第 ⑥ 步的偏好机器接到了企业最值钱的资产上:
机构知识的三种形态(显性文档 / 隐性结构 / 默会经验),**竞争对手下载不到**(`111:35`)
—— 配套:策略阶梯(表 8-1)、防遗忘的数据混合、领域奖励模型、
把「合规」当奖励信号(「clear and not misleading」编不成规则,但人判得出)、
五层验证、金丝雀与灰度、以及一句话的资产观:
**「你 2024 年微调的模型是 2026 年的遗留系统」**(`111:291`)
↓ 剩下的四章是把这套东西往外推
⑪ 让它动手(agent:工具调用 / 计划 / 最小权限)· 让它想清楚(推理:训出来的思维链 / 过程奖励 / 可验证奖励)
· 数据自己造(合成与自博弈 —— 但没有外部基准就会崩塌)· 不止文字(多模态:同一副骨架换编码器)
↓ 那我到底该把钱投在哪?
⑫ **战略落点:涨潮抬不起来的那些船。**
今天要微调的能力,明天可能提示词就够了。所以只投「基线推进之后仍然差异化」的东西
—— 专有数据 + 深度组织整合;通用能力(摘要、翻译、基础问答)交给 API(`164:145-147`)
—— 最稀缺的不是算力也不是数据,是**人才**,而且标注队伍是会复利的资产(`164:159-163`)
—— 技法会全部换掉;不换的是三条:**数据质量压过数量、评估必须对着部署而不是基准、
每个决定都是取舍且没有普遍最优**(`164:171-173`)

一句话主线: 基础模型是有能力没目的的原料,而企业唯一能把自身优势变现的地方就是给它目的; 这件事按「越便宜越先试」的顺序有一整套工具(提示 → SFT → 偏好 → 更便宜的偏好), 每一步都必须配得上一套能识破自己的评估,压到跑得动之后,最终靠专家的判断(而非专家的产出) 把领域灌进去 —— 而这套判断,连同承载它的数据与流程,才是涨潮抬不走的那条船。

落点在哪(重要,写总纲要说清): 技法上的落点是第 8 章领域适配(前七章全是为它做准备, 后四章是它的延伸);战略上的落点是第 13 章「涨潮抬不起来的那些船」。 第 1 章提出的问题(为什么是企业该干的活)到第 8 章才拿到机制、到第 13 章才拿到投资判据。


二、伏笔:埋在前面、后面才揭晓的七处

不通读看不出来。这七处是拆解相对原书最大的增值点——书把它们散在十三章里,从没并在一处说过。

伏笔 1(全书最重要的一条):「别走远」是同一件事的四个名字

第 2 章讲微调几何时埋下:预训练模型占据损失地形里一块盆地状区域,微调就是在 「‖θ − θ_pre‖ < r」这个邻域里找解;学习率太高会跳出盆地,直接能力崩溃(23:13-25)。

这条约束后面换了四个名字回来,书从没说过它们是同一件事:

出现在哪叫什么怎么实现「别走远」
第 3 章 SFT低学习率微调学习率比预训练低一个数量级(30:23);多段 SFT 级联时,窄能力再低一个数量级(30:9)
第 4/5 章 偏好优化KL 约束罚策略偏离参考模型;书自己写明 KL 有两个职责,其中一个就是防遗忘(56:47-63)
第 7 章 PEFT低秩LoRA 假设权重变化有低内蕴维度 —— 换个说法就是「只准在一个低维子空间里动」(98:7-15)
第 13 章 持续学习replay / EWC / 模块化三族遗忘缓解技法,全是在约束「离原来多远」(164:129-137)

建议:在讲损失地形那一章把这条主线立起来,后面每次出现就回指一次。 读者会突然发现四个看起来毫不相干的技术其实是一个念头 —— 这正是「读完能讲给别人听」的抓手。

伏笔 2:CoastRunners 那条打转的船,后面还要出现三次

第 4 章开篇的故事:OpenAI 2016 年的赛艇 agent 在泻湖里打转撞标靶刷分,着火、从不完赛, 得分却比人类高 20%;「它精确地做了研究者要求的事,一件研究者想要的事都没做」(49:5-7)。

同一个毛病在后面换名字出现三次:

  • 第 4 章 §55:reward hacking —— 与过拟合不同,它真的学到了新东西,只是学错了任务(55:47-49);
  • 第 6 章 §74:做开发的人自己也会 Goodhart —— 用困惑度做决策的团队会做出降困惑度但不提质的选择(74:19);
  • 第 10 章 §128:length hacking —— 模型学会「写长 = 高奖励」,三步能解的题写十五步(128:11);
  • 第 11 章 §141:自我改进回路 —— 没有外部基准,模型就是在优化「它自己已经相信的东西」(141:35)。

伏笔 3:steering test 是全书的能力守恒律

第 2 章给了一句判据:「base model 是否已经具备这个能力?」激活引导只能调制已有行为,教不了新能力(13:3-5)。

同一条守恒律后来两次以更硬的形式回来:

  • 第 10 章「组合性墙」:会做三步题却败在五步题 —— 学到的不是「证明步骤」,而是「三步证明」(135:7-9);
  • 第 11 章「自我改进的海市蜃楼」:模型无法为它不具备的能力生成训练信号; 数学弱的模型生成并「验证」不了证明,拿它的错误验证去训,训出来的是「看着很数学但答案错」(141:35);
  • 第 11 章 SPIN 的天花板同理:自博弈只能逼近人类参考数据的质量,越不过去(141:19)。

伏笔 4:teacher forcing 的债,第 9、10 章才还

第 3 章讲 SFT 机制时提了一句代价:训练时每个位置都条件在真值 token 上(所以能并行), 推理时却条件在自己不完美的输出上 —— 于是误差复合,而且模型从来没练习过从自己的错误里恢复(28:13)。

  • 第 9 章还账:只训成功轨迹的 agent 会无视错误、幻觉工具结果、死循环重试或直接放弃; 所以要故意注入失败(参数错 → 改参重试;工具挂 → 换备选;超时 → 等再试;没救 → 承认)(116:67-71,117:3);
  • 第 10 章再还一次:「the moving finger writes」—— 写进推理链的东西抹不掉, 于是要 checkpoint 推理步、rubric 逐项奖励、周期性假设检查(129:3-17)。

伏笔 5:同一个 0.9^n,在三章里各算了一遍

  • 第 9 章:每步 10% 出错,十步全对只剩约 35%(119:19);
  • 第 10 章:每步 95% 正确,十步 60%、二十步 36%(128:9);
  • 第 10 章 PRM:每步 90% → 十步 35%,所以步概率低于 0.7 就该剪掉换路(130:89-93)。

建议:拆解里把这条算术讲透一次(带具体数),后面两处直接回指。 它同时是「为什么多步 agent 会崩」「为什么要过程奖励而不是结果奖励」「为什么有组合性墙」的共同解释。

伏笔 6:GPT-4o 那件事,第 1 章和第 6 章各用了一次,角度相反

  • 第 1 章用它证明风格与人格是后训练的产物:2025 年 4 月的谄媚更新被回滚(公司史上第一次全量回滚), 后来 GPT-5 替换 4o 时 #BringBackGPT4o 上热搜 —— 用户丢的不是能力,是一个人格(09:165-167);
  • 第 6 章用同一件事证明基准不是目标:GPT-5 基准全面更优,用户却要 4o 回来 ——「Benchmark improvement is not the goal; user satisfaction is」(81:3)。

伏笔 7:第 2 章那条复合增益的数字链,就是全书的目录

第 2 章说后训练是一个独立的 scaling 维度,并给了一条复合示例: base 60% → SFT 加思维链 72% → 合成数据改善奖励模型 → DPO 81% → 多数投票 88%(16:15)。 这四步分别是第 3 章、第 11 章、第 5 章、第 10 章。 这条链可以直接当拆解的骨架数字。


三、切章建议:按新词密度切,不按字数切

原书 13 章、89 万字符。原书章序基本可用,但两章必须拆、两处顺序值得调。

3.1 各章承重生词粗数(我数的,不是书里的)

只数「学过这行才懂」的承重词,同概念不同叫法算一张脸。按标准「一节 ≤5、一段 ≤1」折算所需小节数。

原书章承重生词(估)折合最少小节结论
Ch1 后训练要义~255-61 章勉强,建议拆 2
Ch2 微调之前~40(全书最密)8+必须拆 3 章
Ch3 SFT~306-7建议拆 2(机制 / 工程)
Ch4 RL 与奖励模型~204-5建议拆 2(奖励从哪来 / PPO 怎么优化)
Ch5 偏好优化一族~1231 章
Ch6 评估~3061 章(偏长)或拆 2
Ch7 效率~408必须拆 2(压缩 / 服务)
Ch8 领域适配~204-51 章(但要写厚,这是落点)
Ch9 agent~204-51 章
Ch10 推理~2251 章
Ch11 合成数据~2551 章
Ch12 多模态~3061 章(偏长)
Ch13 前沿~153-41 章

3.2 推荐的 16 章切法

index.md 总纲

01 为什么要再训一遍 ← 前言 + 导论 + Ch1 前半
Golem/shem、基础模型 vs 后训练 vs 微调、「right of pre」、三种尺度与关键中间层、
企业 ikigai、买智能为什么失败、VRIN
主走查起点:一家区域健康险公司,要一个写「理赔拒付说明信」的模型(见 3.3)

02 提示词为什么不够 ← Ch1 后半 + Ch2 §prompting 一节
jagged frontier、few-shot 学到的其实是格式而非映射(Min et al.)、
浮点非结合性导致同一提示不同硬件差 9%(Yuan et al.)、
生产要求三件:一致性 / 合规 / 领域准确 = 生产要求缺口

03 改权重之前的四条便宜路 ← Ch2 §RAG / RAFT / steering / 决策矩阵 / 隐藏成本
参数化 vs 非参数化知识、知识 vs 行为、RAFT、激活引导与 steering test、
决策矩阵、太空笔现象、重训周期与漂移、机构记忆三件

04 模型内部长什么样 ← Ch2 §Transformer 解剖(**这一章是书没写、我们必须补的**)
token、注意力/QKV、多头、层的分工、残差流、前馈层=键值记忆、ROME/MEMIT
⚠️ 书明说假定读者已懂(`08:13`),我们的读者不懂 —— 见第四节缺口 A

05 切词与地形:两个隐形前提 ← Ch2 §tokenization + §微调几何 + §底座选型
BPE/WordPiece/Unigram/SentencePiece、词表扩张、符号化 tokenization(Epic CoMET)、
损失地形与盆地、平坦 vs 尖锐极小、学习率、正则、冻结策略、灾难性遗忘、
开源 vs 闭源底座与许可地雷
★ 伏笔 1「别走远」在这一章立起来

06 示范教学:SFT 的机制 ← Ch3 前半
teacher forcing 与误差复合、causal、交叉熵与困惑度、completion-only loss、
AdamW / 学习率日程 / 批大小 / 序列打包、数据质量压过规模、披萨法、LIMA、
chat template(格式不匹配是微调失败最常见原因)、去重与污染

07 把 SFT 跑起来 ← Ch3 后半
训练循环与显存四件账、fp16 vs bf16、TRL/Unsloth/Axolotl、监控最低集、
分布式(DDP / ZeRO / FSDP)、成本三类与 Always Be Costing、
loss 曲线诊断表、验证层级(秒→分→时→天)、检查点、什么时候该毕业到 RL(Lemon test)

08 认得出、演不出:偏好与奖励模型 ← Ch4 前半
CoastRunners、判断的经济学(识别 vs 生成不对称)、on-policy vs off-policy、
三阶段流水线、偏好数据采集与标注一致率(κ)、Bradley-Terry、
平移不变性与 reward centering、reward hacking、长度偏差

09 贴着原点优化:PPO 与 KL ← Ch4 后半
策略梯度直觉、基线与优势、PPO 裁剪、KL 的两个职责、超参与失败模式表、
调试顺序(先查奖励模型,再查 KL,最后读输出)、HHH 三者相冲

10 把奖励模型消掉:DPO 一族 ← Ch5 全章
闭式解与 Z(x) 抵消、隐式奖励、DPO 三局限、KTO(前景理论/不成对)、
GRPO(组内均值当基线)、GRPO-LEAD、IPO/ORPO/SimPO、选型四维、举证责任在复杂度

11 怎么知道它变好了 ← Ch6 全章
评估难的结构性原因、两种 Goodhart、三角测量、评估栈与 1000:100:10、
自动指标家族、pass@k 与基准饱和、LLM 评判与它的五种偏差、
基准动物园与污染、人评协议与一致率统计、A/B 与样本量、living benchmark

12 压得下才用得起 ← Ch7 前 2/3
精度阶梯、PTQ 两族(校准 vs 免校准)、GGUF/K-quants/IQ、量化验证与质量门、
LoRA / QLoRA / DoRA、soft prompt、PEFT 全表、模型合并、蒸馏、剪枝与彩票假设
★ 回收伏笔:关键中间层因 QLoRA 才存在

13 送到用户面前 ← Ch7 末段
vLLM 与 PagedAttention、FlashAttention、continuous batching、投机解码、
硬件分层与路由、最小可用模型、优化栈可组合
(篇幅紧可与 12 合并,但新词密度不建议)

14 让它变成你的:领域适配 ← Ch8 全章 —— **技法上的落点,要写最厚**
fluently clueless、默会知识与 FOGBANK、**让专家判断而不是让专家写**、
策略阶梯、继续预训练与数据混合、领域奖励模型、合规当奖励信号、
反馈飞轮、五层验证(Hollandaise)、金丝雀与灰度、模型是资产不是项目

15 往外推的四个方向 ← Ch9 + Ch10(建议各独立一章 → 实为 15、16)
15 让它动手:函数调用、交错生成为什么难、工具描述即提示工程、沙箱、
无关性检测、失败注入、计划即沟通、错误累积、最小权限、三层安全栈
16 让它想清楚:思维链 vs 事后合理化、scratchpad 与披露政策、过度思考与长度作弊、
ORM vs PRM、PRM800K / Math-Shepherd、ToT 与 MCTS、test-time 算力经济学、
可验证奖励(Lean / 编译器即奖励模型)、领域推理(IRAC / 鉴别诊断)、组合性墙

17 数据自己造 ← Ch11 全章
六个里程碑技法(Self-Instruct / Evol-Instruct / Persona Hub / Magpie / 教材合成 / WRAP)、
过滤即信噪分离、RLAIF 适用性两问、辩论与 SPIN、STaR 的 rationalization、
自我改进的海市蜃楼、数据工厂与工具生态、偏差放大与**模型崩塌**

18 不止文字 ← Ch12 全章
VLM 三件套骨架、投影层为什么是甜点、视觉指令微调、视觉幻觉与鸭兔图、
标注的双重负担、冻结问题、放射科实例(可当本章主走查)、
VLM 偏好优化与 nSFT、为什么 VLM 必须人评、语音与语码转换、视频/3D/传感器、
跨模态漂移与跨模态攻击

19 接下来投什么 ← Ch13 全章 + 全书回收
test-time 算力、MoE 与专家坍缩、长上下文的容量 vs 利用、从执行学、
自动课程、持续学习三族、**涨潮抬不起来的那些船**、自建 vs 采购、人才瓶颈、
三条不会变的原则

总数 19 章 + 总纲。 若要压到 16,可合并的三处(按牺牲从小到大): 12+13 合并 · 08+09 合并 · 02+03 合并。不建议合并的:04(补课章)、14(落点章)。

3.3 建议的全书主走查(每章的主走查都挂在同一个输入上)

书本身用的例子跨医疗、法律、金融、制造,散得厉害。建议拆解统一用一条:

一家区域性健康保险公司,要一个模型来写「理赔拒付说明信」。 它必须:每封信口径一致(一致性)、措辞过得了合规审查(合规)、引对保单条款(领域准确)。

这条输入能被全部十九章接住,而且正好对应书里的三类生产要求:

这条走查走到哪一步
01-03先用提示词写一封 → 换个说法就变卦 → 上 RAG 能查到条款但语气仍不稳 → 逼到必须改权重
04-05要改的是模型里的什么?哪几层动、动多远
06-07拿 800 封历史信里挑出的 300 封精修件做 SFT;loss 曲线怎么读、什么时候停
08-10合规专家写不出模板,但两封信摆一起立刻能挑出更好的那封 → 偏好数据 → DPO
11怎么知道新模型真的更好?BLEU 涨了但合规员说更差怎么办
12-13压到一张 24GB 卡上、每封信要 2 秒内出
14把「本公司怎么解释模棱两可的条款」这种没人写下来的东西灌进去;五层验证;先给 10% 流量
15-16让它自己去查保单系统与理赔历史;让它把条款适用逐条推一遍
17真实拒付信只有 800 封 —— 合成扩到 2 万条,以及为什么不能全合成
18理赔还附着事故照片与医疗影像
19明年这套还值不值得自建

四、缺口清单:哪些要补外部来源

先说一个反常的结论:这本书 2026 年 1 月定稿、6 月出版,今天(2026-08-29)只有两个月书龄。 所以「书出版后被修正」这一类缺口几乎不存在,不要硬找。 而且它有 211 条尾注、题名与链接齐全,「书里用了却没交代来历」这一类也很薄。

真正的缺口集中在另外三类。

A 类(最大的一块):书假定读者已懂、我们的读者不懂 —— 到自己书架上取

书自己写明只从零建后训练概念,不从零建神经网络概念(08:13)。清单:

缺什么到哪儿取(同一个书架,用 shelf=ai-book-reference/<id>#<章>)
神经网络 / 参数 / 权重 / 梯度下降 / 反向传播build-large-language-modelnndl-generallittle-book-of-deep-learningdeep-learning-with-python-2e
token 与切词what-is-chatgpt-doing(样板书第 01 章,主人验收过那一章的写法)
Transformer / 注意力build-large-language-modelhands-on-large-language-modelswhat-is-chatgpt-doing
强化学习基本概念(策略/奖励/状态/动作/回报)reinforcement-learning-sutton-bartoan-introduction-to-deep-reinforcement-learningdeep-rl-fundamentals-research-applications
困惑度、交叉熵build-large-language-modelnndl-general

这一类不许省。 第 04 章(模型内部长什么样)整章就是为这件事存在的。

B 类:书里点了名的框架 —— 我们三个代码书架上全有,而且已经拆过

ai-frontier-reference有 clone 的源码 + 已写好的拆解,直接指过去,不要重讲实现:

书里点名我们的拆解(shelf=ai-frontier-reference/<源>#<章>)
TRL(SFTTrainer / DPOTrainer / RewardTrainer / PRMTrainer)trl#01-trainer-family.md#02-sft.md#03-dpo.md#04-online-rl.md#05-data-and-rewards.md
PEFT / LoRA 数学与合并peft#01-lora-math.md#03-lora-layer-merge.md#04-other-methods.md
vLLM / PagedAttention / continuous batchingvllm#01-paged-attention-kv-cache.md#02-continuous-batching-scheduler.md
Unsloth(内核、快 LoRA、导出)unsloth#01-patch-mechanism.md#02-triton-kernels.md#04-fast-lora.md#05-loading-and-export.md
verl / accelerate / transformers / hf-datasets同名目录,均已 clone(源码锚用 @src: 形式)

C 类:书里没给出处、或明确标成推测的说法 —— 必须标成作者的判断,不许写成事实

说法位置怎么处理
Omniverse Replicator:「单个 CAD 文件做到 97%+ 精确率」「数万张标注图零真实照片」162:11整段无尾注。要么找到 NVIDIA 官方来源标 ③ 类并带查阅日期,要么写明「书里没给出处」
Sora / Genie 2 / UniSim「隐式学到了物理」;Grounded-VideoLLM;Molmo 2159:11-17三处均无尾注。属于作者综述式陈述
可验证域训出的推理能力迁移到不可验证域132:15164:107书自己写的是「early evidence suggests」——必须照实写成推测
MoE 专家会自发形成领域专长164:87书自己写「还没被完全理解,也无法直接控制」——照实写
Anthropic 用 Claude 3.5 Opus 生成合成数据后训 Sonnet16:13(尾注 39,SemiAnalysis 时事通讯)书用的是「据传」,来源是二手时事通讯 —— 标成传闻
Meta 在 Llama 2 偏好标注上花 800 万-2000 万美元16:13(尾注 40,Lambert 博客)二手估算,标成估算
DGX Spark「已成为后训练桌面工作机的 ubiquitous workhorse」08:43无出处的市场判断,且与作者对 NVIDIA 生态的偏好一致 —— 标成作者判断
NVFP4 比 FP8 快 3.6 倍、更省电93:21-25厂商数字,要核或标明
VLM 标注贵 2-3 倍 / 复核修正快 3-4 倍 / 放射科医生 10 张→40 张每小时152:9152:79154:3三处均为作者经验估计,无出处 —— 标成经验值
Unsloth 省 40-70% VRAM、快 2 倍39:9-21154:145项目自报数字;我们书架有 unsloth 源码拆解可佐证机制,数字仍标成项目自报

D 类:书自己的两处小错(拆解里可以顺手点出,也能当「我们真读了」的证据)

  1. 第 12 章两次把合成数据说成「Chapter 10」,实际是第 11 章。 位置:152:79162:7
  2. 尾注 203 用的是 Qwen2-VL 的论文,正文说的却是 Qwen2.5-VL。 位置:150:7165:409。 顺带:尾注 59 与 204 是同一篇 Visual Instruction Tuning,重复收录(年份还写得不一样)。

E 类:值得花一次外部核对的(最多三条,别多)

按「会不会改变读者判断」排序:

  1. Perspective API 2026 年底停服(77:125-167)—— 这是会影响读者选型的事实,值得核一次;
  2. EU AI Act 分阶段执行时间表(09:349)—— 2026 年 8 月的今天,读者会想知道走到哪一步了;
  3. DeepSeek-Prover / AlphaProof 的最新数字(132133)—— 书给到 miniF2F 88.9%, 这类数字半年就会动,但只在写到「当前上限」时才需要核;核不到就照书写并标明截至 2026-01。

其余一律不必上网:书内尾注已经给了题名与 arXiv 链接。


五、与本库其他书的分工(避免重复讲)

同题材的书本库已有五本。这本的位置是「最全景 + 最偏企业决策」,不是最深。

它更强的地方我们这本该怎么让
the-rlhf-book(Lambert,16 章)RLHF 数学链条最完整:奖励建模、策略梯度、DPO 一族、RLVR、过度优化第 09、10 章的数学细节指过去,我们只讲「为什么要这一步」与工程取舍
post-training-ai-practical-guide-to(Burtenshaw)从零手写最小 SFT / GRPO 循环,入门层最好第 06、10 章的「亲手实现」指过去
fine-tuning-with-python-train-align消费级硬件的显存账、LoRA/QLoRA 工程细节、部署第 12、13 章的显存与部署细账指过去
build-reasoning-model用 0.6B 模型把五条推理路线各实测一遍,数字硬第 16 章的实测对照指过去
large-vision-language-models-pre-trainingCLIP 系模型「不重训就用起来」的论文合集第 18 章可对照,但主题不同(它讲不训练的用法)

这本独有、别的书都没有的四块(拆解要重点写):

  1. 三种尺度与「关键中间层」 —— 把技法选择挂在组织资源约束上,别的书没有这一层;
  2. 「先别微调」的完整决策矩阵 —— 提示 / RAG / RAFT / 激活引导 / 微调五选一,以及最小干预原则;
  3. 领域适配一整章 —— 尤其「让专家判断而不是让专家写」与五层验证,是全书最有原创性的部分;
  4. 战略层 —— 涨潮抬不起来的那些船、自建 vs 采购、人才与标注队伍是复利资产。

六、给写大纲的人的五条提醒

  1. 别按原书章序一比一。 Ch2 必须拆三章(全书新词最密的一章),Ch7 必须拆两章; 并且要加一章原书没有的第 04 章补 Transformer 基础 —— 那是书明说跳过的。
  2. 落点写厚。 第 14 章(领域适配)是全书答案所在;前面十三章都在为它准备条件。 如果篇幅要压,压前面的工具章,不压这一章。
  3. 伏笔 1(「别走远」的四个名字)是这份拆解相对原书最大的增值。 建议在第 05 章立起来, 在 09(KL)、12(低秩)、19(持续学习)各回指一次,并在总纲主线里点名。
  4. 数字要给参照物。 书里数字极多(显存表、超参表、基准分数),按标准第 13 条: 正文只留有参照物的效果句,九项清单进表格。 例:讲 QLoRA 不要只说「70B 用 48GB」, 要说「同一个 70B 全精度微调要 140GB —— 也就是两张最贵的数据中心卡, 压完之后是一张两万块的消费卡」。
  5. 三个声音要分开。 这本书里有大量「From the Trenches」是作者亲历(金融程序项目、 药物研发 agent 的计划偏好、航空航天术语的语音微调、多语环境成长经历), 还有大量 Vibe Check 是作者对 coding agent 的观察。这两类都不是行业共识, 要标成「作者自己的经验」。