跳到主要内容

Build a Reasoning Model (From Scratch) — 全书拆解

30 秒导读: 这本书回答一个很具体的问题 —— 一个小到能装进笔记本电脑的程序,数学只能考 15 分,怎么把它变成能考 47 分的? (这一行管这种程序叫模型。)

它的做法是把五条路各走一遍,每一条都自己动手写、自己量分数。 而它真正值钱的地方不在任何一条路上,在那把尺子: 五条路是在同一批题、同一个模型、同一把尺子上量的,所以它们的分数能横着比。 「哪条路最划算」这个问题,别处多半只有定性的答案,这里有一张表。 (我们认为这一点是这本书在同类书里独有的价值 —— 依据、以及「什么情况下这条判断就不成立」, 都写在第 6 节的第一个判断块里。)

本组文档是我们重写的完整拆解,十四章。读完不必看原书。 不需要任何基础,遇到的生词都在当场解释。

1. 先交代清楚:这是谁在什么时候写的

作者Sebastian Raschka(PhD)——同一位作者还写过《Build a Large Language Model (From Scratch)》,那本讲「模型本身怎么造」,这本不要求先读那本
版本状态早期试读版(出版社叫它 MEAP),不是定稿1
写作时间电子书文件里记的日期是 2026 年 3 月;书里引用的最新材料到 2025 年 12 月
篇幅正文八章约 40 万字符,外加七个很重的附录约 17 万字符

三件事必须先说,否则会误读这本书。

第一,它是早期试读版。 文字还会改、章节还会增删。 我们通读时抓到七处书自己前后对不上的地方,每一处都在对应的章节里如实标了出来,不替书打圆场:

书自己对不上的地方我们在哪儿标了
同一个起点分数,书给了两组(在两台不同的机器上量的)05 第 8 节
两处代码里,「什么算不掺随机地挑词」写反了07 第 4 节末
同一个耗时,正文写 862.9 分钟、表里写 862.6 分钟08 脚注 8
一段引文,和书自己印出来的那段输出对不上09 第 5 节末
一句结论说「四组对照里这把尺都最差」,可表里有一组不是09 第 7 节
程序跑起来时打印出来的记录,书指的步骤编号错位了11 第 5 节
一段和前后文都接不上的文字,明显是粘贴时留下的13 脚注 32

第二,作者划了一条很硬的界:这不是一本部署手册。 他自己的说法是「把它当成一次让你亲手造机器的幕后参观」,并且全书不用任何第三方的大模型工具库2。 所以你在这本书里学不到怎么把东西上线,但能学到每一个零件为什么长成那样。

第三,作者主动披露过一处利益相关。 他 2023 年参与创建了一个云计算平台并在书里推荐了它, 同时说明自己现在已无财务利益、不是赞助、自己付费使用3。 这处披露只影响第 04 章那一小段的读法,不影响全书的技术结论。

2. 这本书为什么现在才写得出来

这是一本踩着两个具体事件写出来的书,不了解这两件事,会看不懂它为什么这么安排章节。

  • 2024 年 9 月,OpenAI 发布 o1,主打「回答之前多花点时间想」,让一个词进了公众视野:推理 —— 在这一行里,它指的是「给出最终答案之前,先把中间步骤写出来」4;

  • 2025 年 1 月,DeepSeek 放出 R1 和它的技术报告。书的评价是:它不但公开了一个能和 o1 打平甚至超过的模型, 还公开了整套怎么造出来的做法5

第二件事才是这本书的前提。 蓝图公开之前,这些做法只有几家公司知道;公开之后, 才可能有一本书说「我们把它从零写一遍」。全书拿 R1 当参照系的次数,比拿任何别的模型都多。

3. 全书一条主线(读完这一节,你就懂了这本书)

这本书是一条从头贯到尾的推理链:每一步都是被上一步逼出来的。 下面把这条链完整走一遍 —— 不看后面任何一章,只读这一节,你也能把这本书讲给别人听。

细节全部留给对应的章节,这里只讲「发生了什么、为什么只能这样」。

① 现象:一个「不会推理」的模型,把逻辑题做对了

书的开场是一道小学逻辑题:「所有鸟都会飞。企鹅是鸟。企鹅会飞吗?」

拿去问 OpenAI 的一个模型 —— 它叫 GPT-4o(GPT 指的是他们那一系列模型的总名字), 而官方从没说过它会推理。它答对了6

但它并没有在推理。 它只是见过太多「企鹅不会飞」这句话, 于是「企鹅」和「不会飞」这两件事在它内部早就连在一起了。矛盾是被数据顺手抹平的,不是被发现的。

这件事重要在:它同时证明了两个方向的事 —— 光凭见得多就能装得很像; 可一旦碰到没见过的情形、或者要连着推好几步,这套装法就会塌。

② 那「推理」到底该指什么?书给的是一个工程定义

作者明说他不谈哲学,只谈工程:推理 = 模型在给出最终答案之前,先把中间步骤生成出来7

就这么一句。不谈它像不像人在思考,只谈它把力气花在哪 —— 是直接跳到结论,还是先花一段篇幅把过程写出来。

这个定义是全书的地基。 后面每一章都在回答同一个问题的两半: 怎么让它多花点力气在中间过程上,以及多花的这些力气凭什么值。

③ 可是「多写几步」为什么会贵?因为它每写一个字都要从头算一遍

这台机器写字的方式很笨:它每吐出一小块,整台机器就要从头到尾算一遍, 算完得到「下一块该是什么」,写上去,再从头算一遍8

(它吐的不是字也不是词,是切碎的小块 —— 这种小块的名字叫 token, 出门在别人的文档和账单里天天撞见,第 03 章讲透。)

于是「先写中间步骤」这件事的代价就摆在明处了:

回答长一倍 ⟹ 整台机器多跑一倍的次数
一道题要问它好几遍(采多个答案、跑一遍检查) ⟹ 再乘几倍

图说:这两条就是「推理模型为什么又慢又贵」的全部原因,没有第三条。

所以这本书的第一件正事不是提分,是先让这台机器在普通电脑上跑得动。 (具体怎么让它快起来,第 04 章讲。)

④ 第二件正事:先造尺子,再改东西

这是这本书区别于「炫技型」教程的地方,作者说得很直白: 先做出一个能判断「某个改法到底有没有用」的工具,后面每改一次都回来量一次9

于是有了一把自己手写的尺子:让模型答数学题,把它写在答案框里的那个数抠出来, 和标准答案比 —— 对得上就算对。500 道题跑一遍,得到一个百分比。

起点量出来了:15.2%10同一家公司出的「官方推理版」是 48.2% —— 那就是这本书想够到的天花板。以后每一步改进,都回来和这两个数比。

记住这把尺子。第 10 章会把它原样变成另一样东西。

⑤ 最便宜的一招:在题目后面加一句话

改进从最不费力的一招开始:在题目后面加一句「Explain step by step.」(请一步步解释)。

15.2% → 40.6%11没有改动模型里的任何一个数,只是多说了四个词。

为什么会有用?书给的说法很克制:它不给模型任何新知识,只改变它使用已有知识的方式。 (两条具体机制,第 06 章讲。)

代价也一起摆出来了:同一批题的耗时从 10 分钟涨到 84 分钟 —— 因为回答变长了。 这是这条路要付的第一笔钱。

⑥ 再往上:让它多答几遍,然后投票

同一道题让它答五遍,五个答案里出现次数最多的那个当作最终答案。

能这么干的前提是「五遍答得不一样」 —— 而这需要在「挑下一块」那一步故意掺进随机。 掺随机靠两个旋钮。第一个管「它有多敢冒险」,这个旋钮叫温度

第二个管「只在最靠谱的那一小撮里挑」,这个旋钮叫 top-p。 两个名字你在任何一家模型服务的文档里都会撞见,第 07 章讲透。

这里有一个反直觉的发现:这两个旋钮本身几乎不提分(15.2% → 17.8%), 它们只是让「多答几遍」成为可能。真正提分的是投票。

投票 + 上一招一起用,分数爬到 52.0% —— 全书不改模型能拿到的最高分。

但账单是这样的:

起点投票十遍 + 加那句话
分数15.2%52.0%(涨 3.4 倍)
同一批题跑完要多久10.1 分钟862.6 分钟(涨 85 倍)12

这一栏对比就是「不改模型」这条路的全部交易:拿机器的计算时间换准确率,而且换得越来越不划算。

⑦ 还有一招:让它改自己的作业

先让它答一遍,再把题目和答案一起塞回去、让它当审稿人挑毛病,最后照着批评重写一遍。

书老实交代:在这个模型这个任务上,它不如投票。 但这一章顺带造出了两把「怎么给一个答案打分」的尺子, 而其中一把有个很值得记住的毛病 —— 它会偏爱那些说得很有把握、其实答错了的答案。 (为什么,第 09 章讲。)

到这里,不动模型能拿的基本拿完了。要再往上,只能动模型本身。

⑧ 动模型:让它试,好的加强、坏的削弱

这个做法有个名字叫强化学习 —— 不给它标准答案,只在它做完之后给个评分, 好的做法就让它以后更容易做出来,坏的就压下去。

而「反复调整机器内部那些数,让它一次比一次做得好」这整件事,统称就叫训练

卡点在「谁来当评委」。 ChatGPT 那一套的评委是先花人力给一堆回答排序、再训出来的一个打分模型, 而那东西的大小和成本常常和被训的模型相当 —— 对我们太贵。

这本书的做法是把评委换掉:数学题的对错机器能判,第 ④ 步那把尺子直接就是评委。 答对给 1 分,答错给 0 分。两步的流水线,塌缩成一个循环。

⑨ 有了评分,怎么变成模型内部那几亿个数的改动?让一组回答互相比

同一道题让它答四遍,四个回答各自拿到 1 分或 0 分。 然后不看绝对分,只看「比这一组的平均好多少」 —— 比平均好的,让它以后更容易被写出来; 比平均差的,压下去。

结果:50 步训练,15.2% → 47.4%13,已经贴到官方推理版的 48.2%。 而且模型的平均回答长度从 79 个字涨到 586 个 —— 它是真的学会了先写中间步骤,不是学会了猜答案。

⑩ 那多训几步不是更好?—— 不是,跑久了会崩

这是全书最有价值的两章:它们把崩掉的现场原样画成曲线,而且明说「代码是对的也会崩」。 把上面那 50 步接着跑到 500 步,约 400 步的时候分数掉了下来。

书为这次下跌开了三副药,只有一副真管用:限制单次更新的幅度 —— 一次更新里,某个回答变得比原来可能 20 倍,就把这个倍数卡住不许再大。 加上它,那次跌下来的现象不见了。

另外两副各自把事情搞得更糟: 一副把模型训成了吐乱码, 一副让模型发现「光守着格式就能赚分」,于是不好好答题了。 这两次失手都是一张能读的曲线,而读懂这些曲线本身就是一门手艺。(第 12、13 章)

⑪ 最后一条路,也是最便宜的一条:抄作业

前面那条路要跑 12 小时、吃 70 GB 内存。还有一条路便宜得多: 找一个强得多的模型,让它把一万两千道题全做一遍,然后让小模型去学它的答案 —— 这条路的名字叫蒸馏。

3 小时、15 GB —— 时间省四分之三,内存省近八成14

分数则要看请谁当老师,而这本书跑了两次: 书自己从头跑到尾的那一次拿到 33.6%; 换一个和学生同家族的老师,45.0% —— 只比上一条路低 2.4 个点。 书只量了第一次的耗时,第二次的耗时它没给,所以「三小时拿到 45.0%」这句话 听起来顺,书里却没有一次运行同时给出这两个数(第 14 章第 6 节把两组数摆开说)。

而这里冒出全书最反直觉的一条发现:

更强的老师不一定教出更好的学生。 一个考 91.2 分的老师教出来的学生只有 33.6 分; 另一个考 92.4 分的老师教出来的学生有 45.0 分 —— 因为后者和学生是同一个家族的模型, 说话的习惯更像,学生更容易照着学15

⑫ 落点:五条路,一把尺子

走哪条路动模型吗分数大概要多久
什么都不做(起点)15.2%10 分钟
加一句「一步步解释」不动40.6%85 分钟
多答几遍再投票(+ 上一条)不动52.0%863 分钟
让它改自己的作业不动25.0%85 分钟
让它试错、好的加强(50 步)47.4%约 12 小时 + 70 GB
抄作业 · 老师是 DeepSeek-R1(书跑到底的那次)33.6%约 3 小时 + 15 GB
抄作业 · 老师换成学生的同家族大模型45.0%书没给
(参照)同一家的官方推理版48.2%182 分钟

抄作业占两行,是因为书在这条路上跑了两次、而只量了第一次的耗时。 挤成一行就得拿这一次的成本去配另一次的成绩 —— 那正好毁掉这张表唯一的价值。

这张表就是这本书的全部产出,也是它在同类书里独一份的地方: 同一个模型、同一批 500 道题、同一把尺子,每一行的分数和代价都出自同一次运行,所以能横着比。

而作者最后给的建议不是「挑一条」,是「组合着用」 —— 先抄作业抄出一个小模型,再拿试错法接着训,部署的时候再叠上投票。

4. 十四章地图

这张表不用记任何术语 —— 每一章的名字后面,写的是「读完你能回答什么问题」。

读完你就能回答
01 「推理」到底指什么一个不会推理的模型为什么能把逻辑题做对?那「会推理」的判据到底是什么?
02 一个模型是怎么造出来的没人教它规则,它是怎么会的?想让它更会推理,一共有几条路、各自要付什么?
03 它怎么一个字一个字往外吐你打进去的一句话,在它眼里是什么?为什么让它「多想一会儿」就一定更贵?
04 让它在自己的电脑上跑得动为什么它写得越长越慢?两招把速度提了十几倍,各自在省什么?
05 先把尺子造出来怎么让机器自动判一道数学题答得对不对? 这把尺子在哪里会判错?
06 加一句话就多考 25 分一句话为什么能让分数翻一倍多?什么时候它反而会帮倒忙?
07 让它每次答得不一样同一句话问两遍为什么答案不同?那两个到处都能看见的旋钮到底在动什么?
08 多答几遍然后投票为什么「多答几遍再投票」真的管用?贵到什么程度就不值了?
09 让它改自己的作业不知道标准答案的时候,怎么判断一个答案好不好?为什么「模型很有把握」不等于「答对了」?
10 奖励从哪来试错学习卡在哪一步?那把尺子怎么摇身一变成了评委?
11 让一组回答互相比「答对了」这三个字,怎么变成模型内部几亿个数的改动?
12 训练跑久了会崩代码没写错也会崩,那该盯哪几个数才看得出来要出事?
13 三种补救,一种管用两种出事三种稳住训练的办法,哪一种真管用?另外两种各自怎么把事情搞得更糟?
14 抄作业:便宜四分之三的那条路让小模型去学大模型的答案,能追到多少分?为什么更强的老师反而教得更差?

推荐顺序: 01 → 02 → 03 → 04 → 05,然后按 06 到 14 顺读,这也是原书的推理顺序。

只想拿结论的话,读本页第 3 节就够。 只关心「不改模型能做什么」的,加读 05、06、07、08; 只关心「怎么真的训一个」的,加读 05、10、11、12、13。 但 05 谁都不能跳 —— 后面所有数字都出自那把尺子。

5. 这本书覆盖什么、不覆盖什么

这两张表和上面那张地图一个口径:不用记任何术语。

覆盖(而且讲得比多数材料清楚)—— 读完你能回答:

  • 「推理」在这一行里到底是什么意思,它和真正的逻辑推理差在哪、差在哪一步;
  • 你输进去的一句话,到它吐出第一个字之间发生了什么,每一步的中间结果长什么样;
  • 怎么从零写一把能自动判数学题对错的尺子 —— 抠答案、统一写法、判两个式子是不是同一个数、分段打分,一步不落;
  • 不改模型就能提分的三招各自怎么做、提多少分、要多花多少时间;
  • 怎么真的用试错法训出一个会写中间步骤的模型,以及每一步的中间数字是多少;
  • 训练崩掉时曲线长什么样、该怎么读 —— 这类「失败现场」在论文和教科书里都很难见到;
  • 怎么用一个强模型生成的答案去教一个小模型,以及这条路的性价比;
  • 外加大量诚实的坦白:哪一招在这个模型上没用、哪一处是作者自己也没调好。

不覆盖(别指望在这本里找):

缺什么说明
模型本身是怎么造的内部结构、怎么从头训 —— 书明说当黑盒,那是作者前一本书的题目
代码题怎么自动判对错明说因为要搭一个安全的隔离环境去跑模型写的代码,太复杂,不做
怎么上线一个字没讲。作者在开篇就划了这条界
多张显卡、成批处理正文全部是「一次一条」;成批处理的部分放在附录和补充脚本里
十几种改进办法的具体内容只列了名字和论文链接,不解释、不实现
这本书之后的进展早期试读版定格在 2026 年初,作者自己说这个领域变得很快
它到底像不像人在思考明说是开放问题,本书不试图回答

还有一处书自己留下的空缺,我们补了: 书在参考文献里列了苹果那篇《The Illusion of Thinking》(直译「思考只是一种错觉」), 并且一句话概括了它的结论 —— 但正文从头到尾一个字没提它。 那恰恰是「模型到底算不算在推理」这个问题上最有力的反方。我们在第 01 章把它补了进来,并标明是书外来源。

6. 我们的判断

判断(我们的,不是书里的): 这本书对一个已经读过几本同类书的人来说, 增量不在「那些方法是什么」,而在「同一把尺子上的那一列数」。 讲试错训练那套办法本身,书架上另外三本讲得更细; 但**「哪条路最划算」这个问题,据我们所知只有这本书是用同一批题、同一个模型答的。** 引用它的时候引这张表,别引它对那几套办法的讲解。 引的时候有一处要当心: 抄作业那条路书跑了两次,耗时只量了其中一次, 所以那一格必须写清是哪一次的成本配哪一次的成绩(第 3 节那张表已经拆成两行)。 如果错,会错在两处。 一,「只有这本书」是我们读过的范围内的判断,不是查全的结论 —— 只要举出另一本把这五条路在同一个模型同一批题上量完的书,这一条就不成立。 二,这些数字全部来自一个只有 6 亿个可调的数的小模型、和一个数学题库; 如果换成大模型或者别的任务,几条路的相对高低完全可能翻过来 —— 书自己也没做这个验证。

判断(我们的,不是书里的): 全书最该带走的一条做事方法,是第 ④ 步那句 「先造尺子,再改东西」 —— 而且尺子必须是自己造的、能自动跑的、每次都给同一个答案。 这本书的每一个结论之所以站得住,不是因为方法多高明,是因为每一次改动都回到同一把尺子上量了一遍; 那几处反直觉的发现(投票十遍不比三遍强多少、更强的老师教出更差的学生), 全都是尺子量出来的,不是想出来的。 如果错,会错在: 如果尺子本身有系统性偏差(比如那 500 道题本来就在训练数据里), 那么所有基于它的比较会一起偏。书自己也承认了这个风险,见第 05 章末尾。

判断(我们的,不是书里的): 这是早期试读版,引用时要当心。 我们通读时找到七处书自己的不一致(清单见本页第 1 节)—— 最要紧的一处是两组起点分数对不上: 第 3 章自己跑出来的是 15.3% 和 50.8%,而后面四章的表全部用 15.2% 和 48.2%, 书没有解释为什么。我们的口径是:凡是要做纵向比较的地方一律用后者,因为那一批数是同一台机器上跑的。 如果错,会错在: 如果定稿版把这两组数统一了或者补了说明, 我们这条「必须指明是哪张表的哪一行」的规矩就成了多余的谨慎 —— 但多这一句的代价远小于混用。

7. 许诺兑现表

这份拆解里每一处「第 N 章讲」「后面会讲」,都在这里记一行、逐行核过。 核的是两件事:那一章真的讲了吗?讲的是不是许诺的那件事,而不是同名的另一件事。

许诺在哪许诺了什么应兑现在哪核过了吗
本页 §3 ③怎么让这台机器在普通电脑上快起来04 第 3、4 节
本页 §3 ③它吐的那种「小块」叫 token,这个词讲透03 第 1 节(切块)· 第 2 节(一共多少种)
本页 §3 ④那把尺子第 10 章会变成什么10 第 3 节(它被原样搬去当评委)
本页 §3 ⑤「加一句话」为什么有效,两条机制06 第 3 节
本页 §3 ⑥那两个旋钮的名字与它们在动什么07 第 2、5 节
本页 §3 ⑦为什么「模型很有把握」的那把尺子最差09 第 7 节
本页 §3 ⑩400 步那次下跌,以及三副药里哪一副管用、另外两副怎么出事12 第 1 节(下跌)· 13 第 1 节(管用的那副)· 13 第 2、3 节(出事的两副)
本页 §3 ⑪抄作业那条路的成本和成绩分属两次运行,把两组数摆开14 第 6 节(成绩单下面那个对照块)· 14 第 8 节(总账表拆成两行)
本页 §4 地图 03为什么「多想一会儿」一定更贵03 第 6 节
本页 §4 地图 05这把尺子在哪里会判错05 第 6 节那 16 条用例
本页 §5苹果那篇反方论文我们补了01 第 7 节
本页 §6 判断三两组起点分数对不上,口径写死05 第 8 节那个口径块
01 第 3 节末「先生成中间步骤」为什么会让它变贵03 第 6 节
01 第 1 节「反复调整机器内部的数」具体怎么调02 第 2 节
01 第 5 节末模式匹配崩掉之后怎么补救02 第 5 节那三条路
01 第 6 节「连续谱」的证据:base 模型出厂就会写分步解法05 第 2 节
01 脚注 5<think> 这对标签后面还会再出现13 第 3 节(它被当奖励,然后被钻了空子)
02 第 1 节末模型内部那几亿个数具体怎么被调对02 第 2 节✓(同章内)
02 第 1 节第 14 章会出现一个 6710 亿个数的模型当「老师」14 第 1 节
02 第 2 节「朝差得少一点的方向挪」的完整机制另一本书(脚注给了书架地址)
02 第 3 节ChatGPT 那套调教语气的办法具体怎么做、代价在哪10 第 2 节
02 第 4 节末DeepSeek 证明训练可以直接加在 base 上10 第 5 节(只补新事实,理由不重讲)
02 第 6 节抄作业那条路的两种含义差在哪、为什么只用前一种14 第 2 节
02 第 7 节「先造尺子再改东西」这条路线图05 全章
02 第 7 节末推理模型为什么贵03 第 6 节
03 第 2 节末「块数翻一倍,花费也翻一倍」这条尺子怎么用03 第 6 节✓(同章内)
03 第 4 节末除了「挑分最高的」还有什么挑法07 第 2、5 节
03 第 4 节末换掉贪心解码本身几乎不提分07 第 6 节
03 第 3 节那被扔掉的五行、约 76 万个数,后面会被捡起来用09 第 3 节(拿去量「有多大把握」)· 11 第 2 节(拿去算整条回答的可能性)
03「作者的判断与证据」那一堆下划线似的怪块,第 07 章会真的被抽出来07 第 4 节那张一千次抽签的表(' ____' 出现 169 次)
03「边界与局限」第 4 条同一个数换一种算法(算这个数的一套固定步骤)算,结果差 0.06,书归因为浮点舍入11 第 2 节
03 第 6 节末两招把同一段生成从 7.94 秒压到 0.60 秒04 第 3、4 节
04 第 5 节末后面那些吓人的耗时是「一次只跑一条」跑出来的05 第 8 节起每一张成绩表
05 第 1 节末另外三种量法是什么05「边界与局限」第一段
05 第 1 节末这把尺子后面会变成奖励10 第 3 节
05 第 1 节那张代价表「只能用在能确定判对错的领域」会变成一个更硬的限制10 第 3 节
05 第 8 节末题目的措辞换一个词就差 20 个点,下一章更明显06「边界与局限」第 4 条✓(但兑现方式是「照实说没兑现」 —— 这句许诺是书自己的,而第 06 章并没有再换别的措辞去量,06 边界第 4 条把这件事写明了)
06 第 1 节三招里的另外两招08(投票)· 09(自我精修)
06 第 5 节末整条路的完整账本08 第 4 节那张十二行的表
06 第 5 节末第 08 章会动第一个因子,时间涨 85 倍08 第 5 节
07 第 4 节故意让它有时候答错,图什么08 第 1 节
07 第 6 节末答一遍不会让它变聪明,真正提分的是投票08 第 1、4 节
08 第 2 节平局要靠一把打分尺来裁09 第 3、4 节
08 第 6 节末下一章那招「让模型反复改进自己的答案」09 第 5 节
09 第 1 节末那套「有多大把握」的算账办法下一章会进入训练目标11 第 2 节 · 14 第 5 节
09 第 2 节末「给过程打分」这条路后来怎样了10 第 4 节(失败)· 14 第 8 节(被翻转)
09 第 4 节末第 11 章会把「求平均」改回「求和」,而且理由完全不同11 第 2 节
10 第 1 节那两个带「策略」的技术名词11 第 3 节 · 13 第 1 节
10 第 1 节这个信号具体怎么改到模型内部那几亿个数上11 全章
10 第 4 节为什么同一道题要采好几个回答11 第 1 节(全对或全错就没有信息)
10 第 4 节末「不要中间奖励」这条结论后来被翻转14 第 8 节那条时间线
11 第 2 节末「求和会偏爱短回答」这条性质闯的祸13 第 2 节(KL 崩溃的原因一)
11 第 4 节末「一组好坏一致就学不到东西」怎么做成仪表12 第 3 节
11 第 4 节末省掉的那一项后来补上会怎样13 第 2 节(补上之后崩了)
11 第 6 节末训更久不一定更好12 第 1 节 · 13 全章
12 章首导语 ·「边界与局限」第 5 条三种补救各自的效果13 第 1、2、3 节
13 第 3 节引入 <think> 那对标签之前要先做的那一段调教14(抄作业那条路做的正是这一段)
13 第 4 节那十几种改法各自在修什么另一本书(脚注给了书架地址)

拆解写于 2026-08-29,依据 Manning 早期试读版(电子书文件里记的日期是 2026-03-17)。原始书籍文件不入库, 本组文档是我们自己的重写;每条引用都可用 node scripts/book-verify.mjs build-reasoning-model 回核。

Footnotes

  1. 出处:「welcome」第 12 段(text/02-fm-welcome.txt:12,搜「MEAP」)。MEAP 是 Manning 出版社的早期试读计划,读者在成书之前就能拿到逐章更新的稿子。

  2. 出处:「welcome」第 42 段(text/02-fm-welcome.txt:42,搜「production deployment」)。原文把这本书形容成「a behind-the-scenes tour where you get to develop the machinery yourself」。

  3. 出处:「2.3 Understanding hardware needs and recommendations」第 144 段(text/08-ch02-03-2-3-understanding-hardware-needs-and-recommendat.txt:144,搜「no longer have any financial interest」)。原文的完整说法是:2023 年参与创建该平台,现已无财务利益,不是赞助,自己付费使用。

  4. 出处:「1 Understanding reasoning models」第 339 段(text/04-ch01-1-understanding-reasoning-models.txt:339,搜「September 12, 2024」)。书还引了当时官方的说法:「spend more time thinking before they respond」。

  5. 出处:「1 Understanding reasoning models」第 351 段(text/04-ch01-1-understanding-reasoning-models.txt:351,搜「shared a blueprint」)。技术报告地址书里给的是 https://arxiv.org/abs/2501.12948(查阅于 2026-08-29)。

  6. 出处:「1 Understanding reasoning models」第 579 段(text/04-ch01-1-understanding-reasoning-models.txt:579,搜「appears to answer correctly」)与第 591 段(text/04-ch01-1-understanding-reasoning-models.txt:591,搜「penguins cannot fly」)。后一处给的归因是:训练数据里纠正这个矛盾的句子够多,模型学到了「企鹅」和「不会飞」之间的统计关联。

  7. 出处:「1 Understanding reasoning models」第 89 段(text/04-ch01-1-understanding-reasoning-models.txt:89,搜「practical engineering sense」)。作者特意声明这是工程意义上的用法,不是哲学意义上的。

  8. 出处:「1 Understanding reasoning models」第 701 段(text/04-ch01-1-understanding-reasoning-models.txt:701,搜「twice as many forward passes」)与第 714 段(text/04-ch01-1-understanding-reasoning-models.txt:714,搜「running the model several times」)。这两段就是书给出的「推理模型为什么更贵」的全部两条理由。

  9. 出处:「1 Understanding reasoning models」第 751 段(text/04-ch01-1-understanding-reasoning-models.txt:751,搜「we return to stage 2 to measure whether the change actually helped」)。

  10. 出处:表 4.1 第 1 行与第 2 行,「4.6 Improving response accuracy with self-consistency」第 387 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:387,搜「15.2%」)与第 400 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:400,搜「48.2%」)。口径说明: 原书第 3 章自己跑出来的是 15.3% 和 50.8%(在 H100 上),而第 4 章之后所有的表都用 15.2% 和 48.2%(在 DGX Spark 上),书没有解释这两组数为什么不一致。我们全书统一用后者,理由见第 05 章第 7 节。

  11. 出处:表 4.1 第 3 行,「4.6 Improving response accuracy with self-consistency」第 413 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:413,搜「40.6%」)与第 415 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:415,搜「84.5 min」)。

  12. 出处:表 4.1 第 11 行,「4.6 Improving response accuracy with self-consistency」第 527 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:527,搜「52.0%」)与第 529 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:529,搜「862.6 min」)。注意: 同一节的正文第 587 段(text/33-ch04-06-4-6-improving-response-accuracy-with-self-consis.txt:587,搜「staggering」)把这个数写成了 862.9 min,和表里的 862.6 对不上 —— 早期试读版的笔误,我们按表里的数。

  13. 出处:表 6.1 第 5 行与作者的解读,「6.12 Loading and evaluating saved model checkpoints」第 209 段(text/57-ch06-12-6-12-loading-and-evaluating-saved-model-checkpoi.txt:209,搜「47.4%」)与第 238 段(text/57-ch06-12-6-12-loading-and-evaluating-saved-model-checkpoi.txt:238,搜「close to the accuracy of the official Qwen3」)。

  14. 出处:「8.1 Introduction to model distillation for reasoning tasks」第 25 段(text/68-ch08-01-8-1-introduction-to-model-distillation-for-reaso.txt:25,搜「about 3 hours on a DGX Spark」)。同一段给出了对照:第 6 章那条路在同一台机器上约 12 小时、约 70 GB。更精确的一组数(3 小时 5 分钟、15.02 GB)在「8.8 Evaluating the distilled model」第 56 段(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:56,搜「3 hours and 5 minutes」)。**这个耗时属于哪一次运行:**同一节第 44 段那行命令(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:44,搜「deepseek-r1-math-train.json」)写明喂进去的是 DeepSeek-R1 老师的数据、跑三个训练轮;第 202 段(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:202,搜「used in this chapter」)明说 Qwen3 那一组是另外附上作参照的第二次运行 —— 书没有给这第二次的耗时和显存。

  15. 出处:「8.8 Evaluating the distilled model」第 345 段(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:345,搜「same model family」)与第 357 段(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:357,搜「92.4%」)。两个学生的分数见表 8.1 第 5 行与第 6 行(text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:291,搜「33.6%」;text/75-ch08-08-8-8-evaluating-the-distilled-model.txt:304,搜「45.0%」)。