跳到主要内容

The Craft of Post-Training — 全书拆解

30 秒导读: 这本书回答一个很具体的问题——一家不是 OpenAI 的公司, 拿到一个公开可下载的大模型之后,该做什么。

它的出发点是:模型出厂时是有能力、没目的的原料。它读遍了网上的文字, 能接着任何一句话往下写,但没人告诉过它该扮演谁、什么不能说、你们公司的规矩是什么。 把目的装进去的那道工序,书里叫「后训练」。

它真正的价值不在技法清单,而在一条判断链:什么时候还不该动手、 什么时候只能动手、动手之后凭什么说它变好了、以及明年这笔钱还值不值得花。

本组文档是我们重写的完整拆解。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者Chris von Csefalvay。原本是法律哲学出身,后来长期做这一行,书里多处写「我亲历的某个项目」
写作时间正文落款 2026 年 1 月 21 日1,2026 年 6 月出版。今天它只有两个月书龄
它从哪来2025 年底他给一家技术服务公司的研究部门开的一门课,讲义扩写成书
利益相关书里点名了大量开源工具与厂商,但没有出现「本书由某公司赞助」这类声明;他推荐的默认路线全是开源栈

两件事先说破,否则会误读这本书:

第一,「后训练」这个词很新。 作者自己写道,它在 2023 年之前几乎不存在; 到 2024 年,几家大实验室里干这件事的团队已经从几个人涨到几百人, 预算过亿美元2。所以这不是一本总结二十年成熟工艺的书, 而是一本给一个两三岁的行当画地图的书——它的很多结论会过期, 而书自己也把这件事写进了最后一章。

第二,它是写给企业的,不是写给发烧友、也不是写给基础实验室的。 同一件事在这三种人手里根本不是同一件事,卡住他们的东西完全不同—— 这是全书第一个真正的论点,第 01 章讲。

2. 全书一条主线

只读这一节,不打开任何一章,你也应该能把这本书讲给别人听。 每一步先说上一步逼出了什么问题。

第一段(第 01–04 章):凭什么轮到你、什么时候才轮到动手

① 模型出厂时是「有能力、没目的」的原料。 它读遍了网页,能接着任何一句话写下去,但没人告诉过它该扮演谁、什么不能说。 把目的装进去的那道工序,书里叫后训练——指的是模型被造出来之后所做的一切, 包括教它怎么说话、评估它、以及把它压小到跑得动。

逼出的问题:那这道工序,凭什么轮到一家普通公司来干?

② 因为这是这家公司唯一能把自己的长处变现的那一层。 造原始模型拼的是钱和物流,把模型跑快拼的是工程, 只有「它该怎么表现」关乎这家公司自己的判断。 而「智能直接买现成的」在实践中败于三点:买来的东西不随你的规模长、 供应商换代时你积累的东西会流失、人格租不来

逼出的问题:那这家公司到底站在什么位置上?

③ 它站在「关键中间层」。 干这件事有三档尺度,卡住它们的东西各不相同: 一个人用一张显卡的那档,卡在显卡的内存装不装得下; 一家公司用几十上百张卡的那档,卡在这笔账划不划算; 几家大实验室用几千张卡的那档,卡在电力和厂房。企业在中间那一档。 而中间这一层不是天然存在的,是被几项技法造出来的—— 没有把大模型的改造从数据中心压到一台工作站上的那几招,这一层根本不存在。 (怎么压的,第 11、12 章讲。)

逼出的问题:那是不是碰到问题就该动手改模型?

④ 不是。越便宜的越先试。 把要求写清楚交代给它(行话叫提示词)、给它外挂一个能查资料的库、教它好好用查来的资料、 甚至直接在它算一句话的中途给它的中间数值加一个方向——四条路都比改模型本身便宜。 真正把你逼到必须改的,是三类生产上的硬要求: 每次输出的口径要一致、措辞要过得了合规审查、内容要在你这个行当里真的准确。

第二段(第 05–13 章):从最便宜的改法一路加码,再压回跑得动

⑤ 最便宜的改法是给它看示范。 拿几百上千份「这种输入,人是这么答的」喂进去。 书里的话很直白:大多数团队绕了远路才发现,一周的示范训练能解决八成的问题。 但它有一条硬边界——有些品质你示范不出来。 判据是一句能当场自问的话:「我能亲手为这个输入写出完美回答吗?」 能,示范就够;只答得出「我看到好的能认出来」,示范就到头了。

逼出的问题:认得出、演不出的东西,怎么变成可以优化的目标?

⑥ 训一个打分器。 让人在两份候选答案里挑一份更好的,拿这些「A 比 B 好」训出一个会打分的模型。 它真正的作用不是替人当代理,而是把「哪个更好」这种比较,变成一个能被优化的量。 然后一边朝高分走,一边用一条绳拽住它,别离原来的自己太远。

逼出的问题:这一套要同时把四个模型养在显卡内存里、开销约三倍,还容易训崩。有没有更便宜的?

⑦ 有:把打分器消掉。 2023 年那篇论文证明,那条绳约束下的最优解可以写成一个式子, 反解出来代回去,最麻烦的那一项恰好抵消——于是打分器不必真的存在。 它没被消灭,只是变成隐式的。由此得到一条能当场用的口径: 举证责任在复杂的那一侧——默认用便宜的,明确失败了才上贵的。

逼出的问题:等一下,你凭什么说它真的变好了?

⑧ 评估的难是结构性的:算得出来的数,和你真正想要的东西只有弱相关。 所以这里那条「一个指标一旦变成目标,就不再是好指标」的定律格外毒。 而最毒的一层不是模型学会作弊——是指标会塑造做开发的那些人的行为, 他们不觉得自己在作弊。解药是三种口径一起看(机器算的、模型评的、人评的), 三者同升才算真进步,而它们互相打架本身就是最重要的信号

逼出的问题:验过了,可这东西跑不动也养不起。

⑨ 压。 用更少的位表示同一个模型、只训其中很小一块、让小模型学大模型、把服务本身做快。 压到这里,第 ③ 步埋的那句伏笔才被兑现:中间层之所以存在,正是因为这些技法。

逼出的问题:到这一步,你手上仍然只是一个「通用但跑得动」的模型。它凭什么是你的?

第三段(第 14–20 章):让它变成你的,再看这一套还能推到哪儿

⑩ 领域适配——这是全书真正的落点。 病灶书里给了个名字:流利地一无所知。模型的广度是拿深度换来的, 而且它的自信是普遍的、它的知识不是,它甚至不知道自己缺哪一块。 解法反直觉:别让专家写下他们知道的(他们做不到),让专家去判断。 作者亲历的一个金融项目里,写手册的正是那批专家,他们说不清自己遵循的规则, 却对「哪个回答更好」高度一致。而第 ⑥ 步那台机器,要的恰好只是判断。

逼出的问题:这一套还能往外推到哪儿?

⑪ 往外推的四步问的是同一个问题:谁来告诉它对不对。 有外部裁判的地方走得最远——工具返回的结果、编译器、单元测试, 这些裁判不要人力,反馈可以按机器的速度跑; 没有外部裁判的地方,它只是在优化自己已经相信的东西。 所以书的后半段其实分成两半:第 15、16 章是在给它找裁判(让它动手、让它想清楚), 第 17、18、19 章是在演示裁判缺席时会烂成什么样(数据自己造会塌; 换成图像和声音之后,能自动算的指标压根不可靠,人评不是可选项)。

逼出的问题:那明年我到底该把钱投在哪?

⑫ 只投那些「等大家的起跑线一起往前挪之后,你仍然比别人强」的能力。 今天要动手改模型才有的本事,明年可能只要写几句话交代给它就够了。 所以通用的那部分交给现成的服务——它们会自动变好,你不必掺和; 你自己只投别人拿不到的数据,加上把模型接进日常业务的那些深度改造。 而最稀缺的东西不是显卡、也不是数据,是人。 技法会全部换掉,不换的只有三条:数据质量压过数量、 评估必须对着你实际的用法而不是对着公开的考卷、每个决定都是取舍且没有普遍最优。

3. 章节地图

拆解共 20 章。推荐顺序就是编号顺序——它是一条推理链,跳着读会缺台阶。 唯一的例外:如果你已经清楚模型内部长什么样,第 02 章可以跳过。

讲什么什么时候来读状态
01模型出厂时缺什么;干这件事的三档尺度各卡在哪;为什么这一课只能你自己补想说服自己或说服老板「值不值得干」已写
02你要改的那些数长什么样:它们从哪来、一句话进去之后发生了什么不清楚模型内部构造时先读这一章已写
03改模型之前的四条便宜路,以及什么时候它们不够用手上有个具体问题,不确定该不该动手已写
04改模型到底改了什么、能改多远;为什么它会把原来会的忘掉决定要动手之后,动手之前已写
05给它看示范:一条训练样本到底长什么样,该拿哪一段来考它准备做第一次训练已写
06把这次训练真跑起来:内存怎么算、曲线怎么读、什么时候该收手训练跑起来了但看不懂发生了什么已写
07认得出、演不出的东西怎么变成可优化的目标示范训练到头了已写
08朝高分走,同时别走远想搞清楚那条最经典的路线为什么又贵又不稳已写
09把打分器消掉,以及它的一族亲戚要在几条偏好路线里选一条已写
10你凭什么说它变好了任何时候。这一章是全书最该先读的一章已写
11用更少的位装同一个模型模型跑不动、或者显卡装不下已写
12只动一小部分:给模型挂一条很小的旁路,或者干脆换个更小的同上;这一章兑现第 01 章那句伏笔已写
13送到用户面前:一百个人同时用,怎么不排长队要上线了已写
14让它变成你的——全书技法落点,写得最厚前面都跑通了,但它还不像「你们家的」已写
15让它动手:自己去查你们的系统、自己执行动作要它不只是答话,还要办事已写
16让它想清楚:把中间步骤写出来,并且训它写对任务要多步推导才答得了已写
17数据自己造:让模型生成训练数据,以及这么干什么时候会塌真实样本不够用已写
18让它看见:视觉输入里有图已写
19声音、时间,以及别的输入形式输入里有录音、视频、传感器读数已写
20接下来投什么——战略落点做年度预算的时候已写

全书二十章已经全部落盘。 章级大纲在 notes/01-outline.md, 逐章的读书笔记(带原文行号)在 notes/reading-notes.mdnotes/reading-notes-2.md

4. 它覆盖什么、不覆盖什么

覆盖: 从「要不要动手」这个决策开始,一路走到示范训练、偏好训练、验收、 压缩与上线、让它变成你们家的、让它动手办事、让它多步推导、让它自己造训练数据、 让它看图听声,最后落到投资判断——一条完整的链,中间没有断口。 它是我们书架上唯一一本把技法选择挂在这家公司有多少资源上的后训练书。

不覆盖(书自己声明的): 模型内部原理的基础课——书里明说假定读者已经懂, 所以我们额外写了第 02 章来补这一课;以及「从零造出一个模型」的那一大段; 还有完整可以直接跑的训练代码(书里只给带注解的片段)。

我们有意不覆盖的: 书里七个「Vibe Check」专栏(约 5 万字符, 讲怎么让编码助手替你干杂活)。代价说清楚: 读者因此拿不到作者关于「哪些活可以交给编码助手、哪些危险」的经验清单。

5. 我们的判断

判断(我们的,不是书里的): 这本书最值得买的不是技法,是顺序。 它把「越便宜的越先试」写成了一条能当场执行的判断链, 而市面上大多数同题材的书是按技法分章、默认你已经决定要动手了。 如果错,会错在: 如果读者的处境本来就已经确定要改模型(比如合规硬性要求私有部署), 那这条链的前四章对他没有增量,他会觉得书前四分之一在讲废话。

判断(我们的,不是书里的): 全书有一条原书自己没有明说的暗线,我们给它起名叫「别走远」。 同一句话——改可以,但不许离原来的自己太远——在书里换了五副面孔出现, 分别在第 04、08、12、14、20 章,而原书从没说过它们是同一件事。 我们在第 04 章给它命名,后面四处各回指一次。这是我们相对原书最大的一处增值。 如果错,会错在: 这五种手段的做法确实各不相同, 把它们并成一条,可能会让读者以为它们能互相替代——它们不能, 所以每一处我们都会写清它管住的到底是什么。

判断(我们的,不是书里的): 书里那句「模型无法为它不具备的能力生成训练信号」, 是全书最硬的一条,它同时解释了三件看起来无关的事: 为什么在推理时给中间数值加方向教不了新能力、为什么会撞上组合性的墙、为什么数据自己造会塌。 如果错,会错在: 「不具备」这个词的边界是模糊的—— 模型可能「会但不稳定」,而挑出稳定的那部分再拿去训,确实能变好。 这条律的准确说法应该是「无法凭空生成它一次都做不到的能力」,而不是「无法自我改进」。

6. 兑现表

正文里每一处往后指的话,都要在这里记一行,全书写完逐行核。

这张表是给写作者和接手的人用的账本,不是给读者的。 它逐字引用各章里那句「往后指」的原话,所以里面会出现一些你还没读到的词—— 读到那一章时它们都会当场讲清楚,这里不必看懂。

许诺在哪应兑现在哪状态
index.md §2 第 ③ 步「怎么压的,第 11、12 章讲」11 全章 · 12 §5「两种省法相乘」已兑现
index.md §2 第 ⑨ 步「第 ③ 步埋的伏笔在这里兑现」12 §5「两种省法相乘」已兑现
01 §5「这三个名字具体怎么做到的,第 11、12 章讲」11 全章 · 12 全章已兑现
01 §5「那三笔账第 06 章算」06 §3「关 1:训练时的显存是四笔账」已兑现
01 §5「中间那一档不是天然存在的,是被技法造出来的」12 §5(并在那里写明书内两处自相矛盾)已兑现
01 §3「『要不要微调』的答案经常是『先别』,第 03 章整章讲后一个问题」03 全章已兑现
01 §3「这两个词分不清,后面每一章的成本判断都会错」03 §8「三笔最常被漏掉的账」 · 06 §3已兑现
05 §3「这串中间步骤第 16 章会当成正题来讲」16 §1(那里给它落了正式名字并整章展开)已兑现
05 §3「这条顺序后来被一件事动摇过,第 09 章第 6 节会讲质疑掉了多少」09 §6「亲戚二:把价值头也拿掉」里那段「跳过示范直接强化」的判断块已兑现
05 §4「模型没练过从自己的错误里爬出来,这笔债第 15、16 章还」15 §6「必须故意注入失败」 · 16 §5「写进链条的东西抹不掉」已兑现
05 §7「数据从哪来、不够了怎么办,整块在第 17 章」17 全章已兑现
06 §6「成体系的评估是第 10 章整章的事」10 全章已兑现
06 §9「只答得出『我看到好的能认出来』就去第 07 章」07 全章已兑现
07 §5「自己生成 / 拿现成的这条分界,第 09 章各回来一次」09 §4(好处那一面) · 09 §5(代价那一面)已兑现
07 §9「第一条防线的名字第 08 章讲,它是『别走远』的第二副面孔」08 §6「机制四:罚它偏离原来的自己」已兑现
08 §4「减基线这条第 09 章会以『拿同组回答的平均分当基线』的形态回来」09 §6「亲戚二:把价值头也拿掉」已兑现
08 §7「第 09 章那条路把『生成』这一半整个拿掉了」09 §4「训起来像给它看示范」已兑现
08 §10「值不值得跑这条路,推到第 09 章末尾那条口径」09 §7「举证责任在复杂的那一侧」已兑现
09 §4「参考模型占显存,对策是第 12 章那套只训一小块旁路的技法」12 §3「把变化量写成两个瘦长矩阵相乘」已兑现
09 §5「同分布留出数据会高估部署表现,评估设计见第 10 章」10 §9「真正算数的是你自己那套题库」已兑现
09 §5「转向让 AI 提供反馈的做法,第 17 章讲」17 §5已兑现
09 §7「组内相对 + 合成偏好这条混合流水线,完整机制第 17 章讲」17 §5已兑现
09 §6「课程式地按顺序上偏好对,第 20 章还会回来」20 §7「课程学习」已兑现
08 §10「省显存的技法在第 12 章」12 §5已兑现
07 §1「那条打转的船后面还会以三个名字回来」10 §4(人对着指标作弊) · 16 §4(写长骗分) · 17 §6(自我改进回路)已兑现
07 §9「那条『指标变成目标』的定律第 10 章讲」10 §4「那条定律的两层」已兑现
07 §11「合成偏好数据的完整机制在第 17 章」17 §5「能不能让模型给自己打分」已兑现
06 §3「位宽这件事第 11 章正面讲」11 §3「高精度里本来就有大量富余」已兑现
02 §5「领域术语被切碎怎么办,第 14 章讲」14 §4「词表这一层能做什么」已兑现
02 §10「那条旁路为什么挂在注意力和前馈层上,第 12 章讲」12 §4「这条旁路该挂在哪儿」已兑现
02 §4「微调用的是同一套流程,第 05 章再说一遍」05 §3已兑现
03 §6「这条规律第 16、17 章会以更硬的形式回来」16 §10「组合性墙」 · 17 §6「自我改进的海市蜃楼」(三处并起来说了一次)已兑现
03 §3「95% 够不够用由用途定,这条判据后面还会以别的形式回来」10 §11「门槛必须由用途定」 · 06 §8「74% 够不够用不是技术问题」已兑现
03 §4「这条判据第 14 章还会回来用」14 §4「先兑现第 03 章那条判据」已兑现
04 §3「『别走远』后面换四个名字回来」08 §6 · 12 §3 · 14 §5 · 20 §8「持续学习」(五处并起来核过了)已兑现
04 §5「这条比例关系是第 12 章那整章的种子」12 §1「一个反直觉的观察」 · 12 §3已兑现
04 §8「减轻遗忘的那几种做法整体推到第 20 章」20 §8「遗忘缓解三族」已兑现
04 §8「怎么选学习率靠第 06 章的曲线诊断」06 §5「七种曲线形状」已兑现
01 §6「GPT-4o 那件事第 10 章还会再出场」10 §4「★ GPT-4o 那件事第二次出场」已兑现
14 §7「合成样例的循环问题,第 17 章正面讲」17 §6已兑现
16 可带走的第 28 条「『早期证据显示』是第 20 章那处的措辞」20 §6「那条『会不会迁移』,书自己就没写死」已兑现
16 §9「把成本从常数变成变量,是第 20 章那条的种子」20 §3「每次回答的成本从常数变成变量」已兑现
15 §7「那条 0.9 的 n 次方管着第 16 章的三件事」16 §4(倒 U) · 16 §6(过程奖励) · 16 §10(组合性墙)已兑现
15 §12「合成轨迹那条流水线,完整机制在第 17 章」17 §5 · 17 §7已兑现
14 §4「把图切成小方块当 token,第 18 章讲」18 §2「顺带兑现第 14 章那句话」已兑现
10 §11「门槛必须由用途定,第 11 章会以另一种形式再出现」11 §7「门槛必须由用途定」已兑现
11 §6「『装得下』要留出对话缓存的空间,第 13 章正面讲」13 §3「代价:它会吃掉显存」已兑现
11 §1「效率技法叠着用,第 13 章正面算一遍」13 §7「三章的技法叠起来,一笔总账」已兑现

Footnotes

  1. 出处:「PREFACE」第 59 段(text/06-fm-preface.txt:59,搜「January 21, 2026」)。这是作者在序言末尾的落款地与落款日。

  2. 出处:「PREFACE」第 35 段(text/06-fm-preface.txt:35,搜「barely existed before 2023」)。原文说的是这个词本身在 2023 年前几乎不存在,而到 2024 年,大实验室的后训练团队「已经从小组长成了数百人的组织」,预算「超过数亿美元」。