Build a Reasoning Model (From Scratch) — 全书拆解
30 秒导读: 这本书回答一个很具体的问题 —— 一个小到能装进笔记本电脑的程序,数学只能考 15 分,怎么把它变成能考 47 分的? (这一行管这种程序叫模型。)
它的做法是把五条路各走一遍,每一条都自己动手写、自己量分数。 而它真正值钱的地方不在任何一条路上,在那把尺子: 五条路是在同一批题、同一个模型、同一把尺子上量的,所以它们的分数能横着比。 「哪条路最划算」这个问题,别处多半只有定性的答案,这里有一张表。 (我们认为这一点是这本书在同类书里独有的价值 —— 依据、以及「什么情况下这条判断就不 成立」, 都写在第 6 节的第一个判断块里。)
本组文档是我们重写的完整拆解,十四章。读完不必看原书。 不需要任何基础,遇到的生词都在当场解释。
1. 先交代清楚:这是谁在什么时候写的
| 作者 | Sebastian Raschka(PhD)——同一位作者还写过《Build a Large Language Model (From Scratch)》,那本讲「模型本身怎么造」,这本不要求先读那本 |
| 版本状态 | 早期试读版(出版社叫它 MEAP),不是定稿1 |
| 写作时间 | 电子书文件里记的日期是 2026 年 3 月;书里引用的最新材料到 2025 年 12 月 |
| 篇幅 | 正文八章约 40 万字符,外加七个很重的附录约 17 万字符 |
三件事必须先说,否则会误读这本书。
第一,它是早期试读版。 文字还会改、章节还会增删。 我们通读时抓到七处书自己前后对不上的地方,每一处都在对应的章节里如实标了出来,不替书打圆场:
| 书自己对不上的地方 | 我们在哪儿标了 |
|---|---|
| 同一个起点分数,书给了两组(在两台不同的机器上量的) | 05 第 8 节 |
| 两处代码里,「什么算不掺随机地挑词」写反了 | 07 第 4 节末 |
| 同一个耗时,正文写 862.9 分钟、表里写 862.6 分钟 | 08 脚注 8 |
| 一段引文,和书自己印出来的那段输出对不上 | 09 第 5 节末 |
| 一句结论说「四组对照里这把尺都最差」,可表里有一组不是 | 09 第 7 节 |
| 程序跑起来时打印出来的记录,书指的步骤编号错位了 | 11 第 5 节 |
| 一段和前后文都接不上的文字,明显是粘贴时留下的 | 13 脚注 32 |
第二,作者划了一条很硬的界:这不是一本部署手册。 他自己的说法是「把它当成一次让你亲手造机器的幕后参观」,并且全书不用任何第三方的大模型工具库2。 所以你在这本书里学不到怎么把东西上线,但能学到每一个零件为什么长成那样。
第三,作者主动披露过一处利益相关。 他 2023 年参与创建了一个云计算平台并在书里推荐了它, 同时说明自己现在已无财务利益、不是赞助、自己付费使用3。 这处披露只影响第 04 章那一小段的读法,不影响全书的技术结论。
2. 这本书为什么现在才写得出来
这是一本踩着两个具体事件写出来的书,不了解这两件事,会看不懂它为什么这么安排章节。
-
2024 年 9 月,OpenAI 发布 o1,主打「回答之前多花点时间想」,让一个词进了公众视野:推理 —— 在这一行里,它指的是「给出最终答案之前,先把中间步骤写出来」4;
-
2025 年 1 月,DeepSeek 放出 R1 和它的技术报告。书的评价是:它不但公开了一个能和 o1 打平甚至超过的模型, 还公开了整套怎么造出来的做法5。
第二件事才是这本书的前提。 蓝图公开之前,这些做法只有几家公司知道;公开之后, 才可能有一本书说「我们把它从零写一遍」。全书拿 R1 当参照系的次数,比拿任何别的模型都多。
3. 全书一条主线(读完这一节,你就懂了这本书)
这本书是一条从头贯到尾的推理链:每一步都是被上一步逼出来的。 下面把这条链完整走一遍 —— 不看后面任何一章,只读这一节,你也能把 这本书讲给别人听。
细节全部留给对应的章节,这里只讲「发生了什么、为什么只能这样」。
① 现象:一个「不会推理」的模型,把逻辑题做对了
书的开场是一道小学逻辑题:「所有鸟都会飞。企鹅是鸟。企鹅会飞吗?」
拿去问 OpenAI 的一个模型 —— 它叫 GPT-4o(GPT 指的是他们那一系列模型的总名字), 而官方从没说过它会推理。它答对了6。
但它并没有在推理。 它只是见过太多「企鹅不会飞」这句话, 于是「企鹅」和「不会飞」这两件事在它内部早就连在一起了。矛盾是被数据顺手抹平的,不是被发现的。
这件事重要在:它同时证明了两个方向的事 —— 光凭见得多就能装得很像; 可一旦碰到没见过的情形、或者要连着推好几步,这套装法就会塌。