跳到主要内容

一个模型是怎么造出来的 — 以及让它更会推理的三条路

这一章讲什么: 第 01 章说它靠「见得多」答对题,那它到底是怎么「见」的? 这一章拆开造一个模型的流水线,说清没人教它规则、规则是怎么试出来的; 然后给出让它更会推理的三条路,以及这三条路各自要付什么代价。 顺带把两个最容易让人出门认错的术语陷阱当场拆掉。

它在全书链条里的位置: 第二环,全书的骨架。 后面十二章正好分别走这三条路 —— 第 06 到 09 章走第一条,第 10 到 13 章走第二条,第 14 章走第三条。 这一章看不懂,后面就不知道自己在哪条路上。

需要的基础只有第 01 章那一条: 它是拿自己刚写下的字当输入、按可能性接着往下写的。

顶层全景:一条流水线,一个模型停在了第一站

这一章的主走查只有一个对象:这本书从头用到尾的那个模型 —— Qwen3 0.6B base。 先看它在流水线上停在哪儿。

① 一堆随机的数(约 6 亿个)—— 此刻它什么都不会
│ 经过「预训练」:喂进天量的文字,只让它反复猜「下一块该是什么」

② ★ base 模型 —— 会写像人写的话;还顺带会了翻译、写代码这些没人专门教过的活
│ ↑ 本书用的 Qwen3 0.6B base 停在这里,后面几段一段没走
│ 经过「指令微调」:教它「你说的是一条指令,照着办,别接着往下续写」

③ 会听指令的模型
│ 经过「偏好微调」:教它把话说得让人爱听

④ 我们平时用的那种模型
│ 再套上「聊天界面」:又一层,不属于模型本身

⑤ ChatGPT 那样的产品

⑥ 而这本书的岔路口在 ★ 那里:三条让它更会推理的路,各自动这 6 亿个数的什么

图说:①→⑤ 每一段都在改同一批数。这本书**一段都不重做**,
它直接拿 ★ 那个半成品开工,理由在第 4 节;第 5 节走第 ⑥ 步。
**下面每一节开头的「走查第 N 步」,指的就是这张图上的编号。**

1. 没人教它规则:预训练,以及所谓「它」到底是什么

先回答第 01 章留下的那个问题:它凭什么知道「penguins cannot fly」?

答案是这条流水线的第一段。这一行管它叫预训练: 把天量的文字倒给它 —— 书说的量级是好几个太字节(TB)的文本—— 然后只让它做一件事:盖住下一块,让它猜,猜错了就调一调,再来1

注意这里没有任何人在教它规则。 没有人告诉它「所有鸟都会飞是一条全称判断」, 也没有人给这些文字打过标签说「这句是对的、那句是错的」。 它见到的就是网上、书里原样的文字;规则(如果那也算规则的话)是这个猜词游戏的副产品。

所谓标注,就是人一条条给数据写上「正确答案是什么」这样的说明 —— 预训练里没有这道工序,这正是它能吃下天量文字的原因:根本不用人碰。

那被调的是什么?这是这一章第二个要钉死的词。

所谓「一个模型」,拆开看就是一大堆可以调的数。你把它想成一台机器上密密麻麻的旋钮, 每个旋钮拧到哪个位置,决定了这台机器给出什么输出 —— 这些数就叫权重

你在别处还会看到它的另一个名字 —— 它也叫参数;和权重说的是同一件事,记住哪个都行。

本书用的这个模型,这样的数有约 6 亿个 —— 型号名字里的 0.6B 就是这个意思。 6 亿听着多,但它在这一行里属于极小的那一档: 第 14 章会出现一个当「老师」用的模型,有 6710 亿个 —— 一千多倍。 这本书之所以能让你在自己的笔记本上跑完全书,靠的就是选了最小的那一档。

预训练跑完之后,得到的东西叫 base 模型(直译是「底座模型」,这一行通常直接说 base)。 书对它的描述很克制:它会写很像人写的文字1它还会一些没人专门教过它的活 —— 比如翻译、写代码。 这一行管这种「没教也会」的现象叫涌现1

走查第 ①、② 步:

① 起点:约 6 亿个随机的数 —— 拿一句话问它,吐出来的是乱码
② 预训练之后:同样这 6 亿个数,只是每个都被挪到了别的位置
⟹ 现在拿 "The capital of Germany is" 问它,它接得出 "Berlin."

同一批数,只是值不一样了。这就是「训练」的全部含义。 (那 6 亿个数具体怎么被挪对,下一节讲。)

2. 那几亿个数怎么会自己变对:一个朴素得出奇的循环

这一节是这一章的地基。不讲它,后面第 11 章、第 14 章的「训练」全都悬空。

做法比多数人想的朴素得多:

拿一段文字来,盖住下一块


让它猜 → 看它猜得离真正的下一块差多远


把那 6 亿个数,每一个都朝「差得少一点」的方向挪一丁点


换下一段文字,重复 —— 重复几万亿次

图说:整件事就这四步,没有第五步。「学会了」不是某一刻发生的,
是这四步转了足够多圈之后的结果。

三件事必须当场说清,否则这一节会被当成套话读过去。

第一,「差多远」是个能算出来的数,不是感觉。 它猜下一块时给出的是一张可能性清单; 真正的下一块在这张清单上分到多少,决定了这个数是大是小。

第二,「朝差得少一点的方向挪一丁点」这句话里,每个字都是实指。 对每一个数,都能算出「把它调大一点点会让差距变大还是变小」,然后按这个结论去挪。 6 亿个数是一起挪的,不是一个一个试的 —— 靠的是一套固定的计算步骤, 这种「一步步照着做就能得出结果」的固定步骤,就叫算法

那套算法出自微积分,它的完整机制不在这本书的范围内(书自己也说了); 想补的见我们书架上的那一章2

第三,重复的次数和花的钱,是这一节唯一的量级感来源。 这件事要用到一种专门的芯片:它原本是给游戏画画面用的,因为特别擅长同时做海量简单算术, 如今成了训练模型的主力 —— 这种芯片就叫 GPU

书给的口径是:几千块 GPU 跑好几个月,花掉几百万美元1对照一下:你手上的笔记本电脑通常只有一块这样的芯片,而且跑的是几秒钟的活。 (更精确的一笔账,第 04 章第 2 节算给你看。)

这就是为什么这本书从头到尾不训练底座,只训练改进。 它要教的是「怎么在一个已经造好的东西上加东西」,不是「怎么从零造一个」。

3. 预训练完还不能用:后面还有两段调教,而且它仍然不是聊天机器人

base 模型有个很具体的毛病:它只会续写,不会办事。

你写「请把下面这段话总结一下」,它可能接着写「……并给出三点建议。请把下面这段话」—— 因为在它见过的文字里,这句话后面本来就常常跟着更多的话。它没有「这是一条指令」的概念。

所以流水线后面还有两段,书把它们统称为后训练3。 这两段做的事都是「在已经训好的那批数上接着调,幅度和花的钱都比预训练小得多」—— 这种「接着小调一段」的做法就叫微调

第一段教它把你的话当成一条任务去执行,这一段就叫指令微调; 第二段教它把话说得让人爱听,这一段就叫偏好微调

干什么效果
指令微调拿「指令 + 标准回答」成对的例子接着训它开始把你的话当成任务去执行,而不是当成待续写的文字
偏好微调拿「人更喜欢哪个回答」的比较数据接着训语气、口吻、详略变得合人心意

第一段还有两个别名,出门都会撞见:一个就叫监督微调, 另一个是它的英文缩写 SFT —— 三个名字指同一件事,记住哪个都行。

第二段最常见的实现手段有个名字叫 RLHF(基于人类反馈的强化学习)—— 就是把「人更喜欢哪个回答」这件事变成一个分数,再照这个分数去调那批数。 它具体怎么做、代价在哪,第 10 章第 2 节讲。

书举的例子很直观:同一个问题「睡眠和健康的关系」, 预训练完的版本答得沾边但不切题;指令微调完的版本给出简洁准确的总结; 偏好微调完的版本再加上友好的口吻,读起来更像在跟人说话3

但这里有一句最容易被跳过、也最值钱的话:

就算做完了指令微调,它也还不是一个聊天机器人。 聊天界面是另外一层:开场先塞一段固定的交代、把前几轮说过的话拼回去、 还要管什么时候该调用别的工具。这一层不属于模型4

这一条为什么要在第二章就讲? 因为后面全书都是直接把一段文字丢给模型、接住它吐出来的字, 中间没有任何界面。读者若把「模型」和「ChatGPT」当成一回事,会一直觉得书里的做法太原始。 不是原始,是那一层被剥掉了。

走查第 ③、④、⑤ 步 —— 这三步本书用的那个模型一步都没走:

走到哪一步Qwen3 0.6B base
(第 ② 步)预训练之后的 base它就停在这儿
第 ③ 步:指令微调之后没走
第 ④ 步:偏好微调之后没走
第 ⑤ 步:套上聊天界面没有

所以我们手上的,是一个只会续写的半成品。 这不是将就,是刻意挑的 —— 理由在下一节。

4. 为什么偏要用这个半成品:理由只有一个,归因

这是这本书方法论上的第一个硬选择,而且它给的理由只有一条。

作者的原话是:从 base 模型起步,才更容易看出哪些能力是推理方法本身带来的5

把这句话摊开:

如果从一个调教好的助手模型起步:
分数涨了 10 个点

└─ 是我们加的推理方法带来的?还是它本来就被调教过、只是被激活了?
**分不清。**

如果从 base 模型起步:
分数涨了 10 个点

└─ 这个模型出厂时什么调教都没做过
⟹ 涨的这 10 个点,只可能来自我们加的东西。**归因是干净的。**

这个选择要付代价,书没有回避: base 模型的起点分数很低 —— 第 05 章会拿 500 道数学题量它,只做对 15.2%; 而同一家公司出的、调教过的「官方推理版」是 48.2% —— 差三倍多。 这本书就是要用各种办法,把 15.2 往 48.2 上推。

这两个数有个坑,提前说一句免得你翻到第 05 章对不上号: 起点这件事, 书在两台不同的机器上各量过一次,得出两组数 —— 第 05 章那一章自己跑出来、 印在它顶层全景末尾的是 15.3%(以及官方推理版 50.8%), 而后面四章所有的成绩表用的是 15.2% / 48.2%。书没有解释这两组为什么不一样。 我们全书凡是做纵向比较一律用后一组,因为后面每一行成绩都和它们在同一台机器上跑出来。 两组数并排摆在第 05 章第 8 节,口径也是在那里写死的。

这两个数在全书里有一个专门的身份,叫基线 —— 基线的意思就是「改动之前的那个数」,以后每一次改进都回来和它比。 基线是什么、怎么量出来的,是第 05 章一整章的题目。

这个「归因」的理由后面还会再出现一次,但只出现一次。 第 10 章第 5 节会说到 DeepSeek 团队证明了训练可以直接加在 base 模型上, 那里只补一条新事实,理由回指这一节,不重讲。

5. 让它更会推理,一共三条路 —— 分界线是动不动那几亿个数

这是全书的骨架。三条路,一张表。

动那几亿个数吗做法一句话书里哪几章
推理时扩展不动在你提问的那一刻多花算力:让它写长一点、或者让它多答几遍4、5 章(我们的 06–09)
强化学习让它试,做得好的加强、做得坏的削弱6、7 章(我们的 10–13)
蒸馏找一个强得多的模型把题做一遍,让它去学那些答案8 章(我们的 14)

第一条:推理时扩展。 名字里的「推理时」指的是你提问、它作答的那一刻 (和第 01 章那个「推理」不是一个意思,这里说的是「用的时候」)。 书给的定义是:在不训练、不修改那几亿个数的前提下,拿更多算力换更好的表现6。 所谓算力,就是让机器算这一次要花掉的计算资源 —— 说白了就是时间和电费。

第二条:强化学习。 就地讲明,它不神秘:

不给它标准答案,只在它做完之后给一个评分。 得分高的做法,让它以后更容易做出来;得分低的,压下去。反复试、反复评。

书的说法是:奖励可以很宽泛(任务成功了没有、打个大概的分), 也可以很窄很硬(数学题答对没有、代码跑通没有)。 和第一条路的区别写得很明白:它会在训练过程中更新那几亿个数, 让模型通过试错学出更好的解题套路7这本书走的是「很窄很硬」那一支。

第三条:蒸馏。 一句话:把强模型学到的推理套路,搬进小模型里。 具体做法是拿一个更大更强的模型生成一批高质量的答案,再拿这批答案去做前面说的指令微调8说白了就是抄作业。

走查第 ⑥ 步 —— 三条路分别动我们那个模型的什么:

Qwen3 0.6B base(约 6 亿个数)

├─ 推理时扩展:这 6 亿个数一个不动,只改「怎么问」和「问几遍」
├─ 强化学习 :这 6 亿个数被改写 —— 靠它自己试出来的评分
└─ 蒸馏 :这 6 亿个数被改写 —— 靠抄一个大模型的答案

6. 两个会让你出门认错的陷阱

书自己主动标出了这两个陷阱。它们不是细节,是「出门会撞见」的那一类。

陷阱一:「蒸馏」在这一行和在更早的那一行里,不是同一件事。 这里说的「更早的那一行」有个名字叫深度学习 —— 指的就是「用很多层这种可调的数堆起来的模型」 这一整套做法,大语言模型只是它最新的一支。

LLM 圈说的蒸馏(这本书用的)传统深度学习里的知识蒸馏
学生学什么只学老师生成出来的文字老师的输出加上老师内部那一整套打分
实际上是什么拿这些文字做一次指令微调一套单独的训练方法

书用的措辞是「略有不同」,但对读者来说这个差别很关键: 你在别处看到「蒸馏」,它多半指的是后者;而在这本书和绝大多数 LLM 实践里,指的是前者8为什么 LLM 圈几乎只用前者、以及第三种做法是什么,第 14 章第 2 节讲。

陷阱二:推理用的强化学习,和调教语气用的 RLHF,底层是同一套东西。

书专门开了一段辨析:两者的差别不在算法,在奖励从哪来9:

奖励从哪来书的评价
RLHF(偏好微调用的)来评价或排序模型的回答直接把模型推向人偏好的行为
推理用的强化学习自动的、或者环境给的信号,比如「这道数学题答对没有」可能更客观,但也可能离人的偏好更远

这一条为什么要记住: 你会在很多材料里看到「用强化学习训推理模型」, 然后想当然地以为它和 ChatGPT 那套是一回事。算法上确实很像,但评委换人了 —— 而换掉评委正是这本书第 10 章的全部内容。

7. 推理不是越多越好,以及全书的四阶段路线图

先泼一盆冷水,这盆水是书自己泼的。

作者明说:推理不是任何时候都必要、也不总是可取的10。他给的适用清单很具体:

适合不适合
谜题、高等数学、难写的代码摘要、翻译
需要把任务拆成步骤、规划、挑工具的场合靠背下来的知识作答的问答

而且他点了一个失效模式:想太多(overthinking)反而更容易出错。 书还顺带说了一句实在话:拿推理模型干所有活,既低效又贵10。 (为什么贵,第 03 章第 6 节算给你看 —— 那里要先讲清它是怎么一个字一个字吐出来的。)

最后是全书的路线图。书自己画了四个阶段,而第二个阶段是这本书的灵魂:

阶段 1 拿一个常规模型当起点(我们的 03、04 章)


阶段 2 ★ 先把「怎么量」做出来(我们的 05 章) ←──────┐
│ │
▼ │ 阶段 3、4 每做完一次
阶段 3 不动那几亿个数,在答题时改进(06–09 章)──────┤ 都要回到阶段 2 复量
│ │
阶段 4 动那几亿个数,靠训练改进(10–14 章)──────────┘

图说:注意那两条回头的箭头 —— 它们是这本书和「炫技型教程」的全部区别。

作者把这件事说得很直白:阶段 2 造出来的是一件工具,用来判断某个方法到底有没有用; 所以阶段 3 和阶段 4 之后都要回到阶段 2,量一次这次改动到底帮上忙没有11

一句话记住这本书的方法论:先造尺子,再改东西,改完回来复量。 尺子怎么造,是第 05 章一整章的内容。

作者的判断与证据

说法性质
预训练要几千块 GPU、几个月、几百万美元有证据,但书在这一章只给了量级;精确到某个具体模型的数字在原书第 2 章(我们的 04 章)
预训练会带来「涌现」的能力(翻译、写代码)书当成公认事实陈述,没有给实验或引文
从 base 模型起步能把提升归因到推理方法作者的方法论主张。它在第 10 章拿到了一条外部支撑:DeepSeek 团队证明训练可以直接加在 base 模型上
三条路的划分作者的整理,不是学界的标准分类;但这个划分和大多数材料对得上
「蒸馏」两义、「RL 与 RLHF」同源书主动做的辨析,有具体依据(前者说明了学生学什么,后者说明了奖励从哪来)
推理不适合摘要、翻译、知识问答作者的判断,书在这里没有给数据支撑
「想太多反而更容易错」作者提到的失效模式;这一条在第 06 章会拿到一个具体的机制解释,但仍然没有实验

还有一处必须点明的边界口径: 书明说预训练和后训练这两段不是本书的题目, 它是作者前一本书的内容;这本书直接加载已经训好的模型12所以这一章讲的流水线,在原书里只有三页纸的篇幅 —— 我们把它讲厚了, 因为不知道这条流水线,后面「动权重 / 不动权重」这条分界线就没有意义。

边界与局限

  1. 「那几亿个数怎么一起挪」这件事,这本书不讲。 它明说超出范围。 我们在第 2 节只讲到「朝差得少一点的方向挪」这一级, 再往下(那套微积分的算法叫什么、为什么算得动)请看书架上另一本2
  2. 三条路不是穷举。 作者自己在第 4 章会交代,他评过十几种推理时的做法, 这本书只挑了其中三个;强化学习那一支也有十几种改法,书只实现了一种。
  3. 「涌现」这个说法本身有争议。 书把它当成既定事实陈述, 但学界对「这些能力是真的突然冒出来的,还是量的方式造成的错觉」有过不小的争论 —— 书没有提这场争论,我们也没有在这里展开,只点出它存在。
  4. 这一章的路线图是作者画的,不是行业标准。 别拿它去对照别家公司的实际流程。
  5. 聊天界面那一层,书放在附录 G。 正文只提了一句。 我们在第 04 章的「可带走的」里补了它最实用的一条:问第二句话时,前面说过的话要怎么拼回去。

可带走的

  1. 「模型」拆开就是一大堆可以调的数,这些数叫权重(也叫参数)。 本书用的这个有约 6 亿个;第 14 章那个当老师的有 6710 亿。训练 = 把这些数挪到别的位置。
  2. 预训练的全部动作是「盖住下一块让它猜」。 没有人标注、没有人教规则 —— 所以它学到的是统计规律,这正好接上第 01 章说的模式匹配。
  3. 记住那个四步循环:让它猜 → 看差多远 → 每个数朝差得少的方向挪一丁点 → 换下一段。 这本书后面所有的训练,不管叫强化学习还是叫蒸馏,换的都只是「差多远」那一步怎么算
  4. base 模型只会续写,不会办事。 它需要指令微调才听得懂指令,需要偏好微调才说得中听。
  5. 指令微调 = SFT = 监督微调,是同一件事的三个名字。 出门都会撞见。
  6. 就算做完全部调教,它也还不是聊天机器人 —— 那一层是界面,不属于模型。
  7. 这本书用没调教过的版本,理由只有一个:归因。 起点低(15.2%)是代价,换来的是 「涨的分只可能来自我们加的东西」。这个取舍值得在你自己的实验里照抄。
  8. 三条路,一条分界线:动不动权重。 不动的那条最便宜、见效最快,但有上限; 动的那两条要花钱花时间,天花板更高。
  9. 两个术语陷阱: 这一行说的「蒸馏」只学老师生成的文字; 推理用的强化学习和 RLHF 只差奖励从哪来。这两条记错了,读别人的材料会一路读岔。
  10. 推理不是越多越好。 摘要、翻译、查知识这类活,用推理模型既慢又贵,还可能因为想太多而答错。
  11. 先造尺子,再改东西,改完回来复量。 这是全书唯一的方法论主张,也是它最值得抄走的一条。

原文地图

主题原书章原文位置
常规训练流水线(标题)1 Understanding reasoning modelstext/04-ch01-1-understanding-reasoning-models.txt:217(搜「standard LLM training pipeline」)
预训练的规模、成本与涌现同上text/04-ch01-1-understanding-reasoning-models.txt:281(搜「emergent properties」)
把 mid-training 并进预训练同上text/04-ch01-1-understanding-reasoning-models.txt:235(搜「mid-training」)
后训练两段:SFT 与偏好微调同上text/04-ch01-1-understanding-reasoning-models.txt:287(搜「supervised fine-tuning」) · :300(搜「preference tuning helps tailor responses」) · :306(搜「raw language prediction」)
指令微调完也还不是聊天机器人同上text/04-ch01-1-understanding-reasoning-models.txt:312(搜「not yet a "chatbot."」)
这两段不在本书范围内同上text/04-ch01-1-understanding-reasoning-models.txt:325(搜「does not require detailed knowledge of these stages」)
三条路:推理时扩展同上text/04-ch01-1-understanding-reasoning-models.txt:382(搜「Inference-time compute scaling」)
三条路:强化学习同上text/04-ch01-1-understanding-reasoning-models.txt:385(搜「high reward signals」) · :388(搜「RL updates the model's weights」)
三条路:蒸馏 + 术语陷阱同上text/04-ch01-1-understanding-reasoning-models.txt:391(搜「traditional knowledge distillation」)
RL 与 RLHF 的分别同上text/04-ch01-1-understanding-reasoning-models.txt:403(搜「distinguish the RL approach here」) · :415(搜「more objective but potentially less aligned」)
推理不是越多越好、想太多同上text/04-ch01-1-understanding-reasoning-models.txt:683(搜「not always necessary or desirable」) · :689(搜「overthinking」)
四阶段路线图同上text/04-ch01-1-understanding-reasoning-models.txt:732(搜「the roadmap is simple」) · :745(搜「we begin with a conventional LLM」) · :751(搜「measure whether the change actually helped」) · :776(搜「chapter 2 introduces the base model」)
为什么从 base 模型起步2 Generating text with a pre-trained LLMtext/05-ch02-2-generating-text-with-a-pre-trained-llm.txt:38(搜「which capabilities come from the reasoning methods themselves」)

Footnotes

  1. 出处:「1 Understanding reasoning models」第 281 段(text/04-ch01-1-understanding-reasoning-models.txt:281,搜「emergent properties」)。这一段同时给了四件事:数据量级(好几个太字节的文本)、算力与花费(几千块 GPU、好几个月、几百万美元)、「capable」的定义(写出很接近人写的文字),以及「涌现」的定义(能干一些没有被明确训练过的活,例如翻译和写代码)。原书还在第 235 段说明,有些论文会在预训练和后训练之间再分出一个 mid-training 阶段,这本书为了简化术语,把它并进了预训练(text/04-ch01-1-understanding-reasoning-models.txt:235,搜「mid-training」)。 2 3 4

  2. 补充(不在书里,依据我们的 book 书架):这本书明说预训练和后训练的细节属于作者前一本书(出处:「1 Understanding reasoning models」第 325 段,text/04-ch01-1-understanding-reasoning-models.txt:325,搜「does not require detailed knowledge of these stages」)。依据: shelf=ai-book-reference/build-large-language-model#06-pretraining.md 事实=该章从零讲清了「衡量差多远的那个数怎么算、怎么按它把每个参数往哪个方向挪」这一整套训练循环。 2

  3. 出处:「1 Understanding reasoning models」第 287 段(text/04-ch01-1-understanding-reasoning-models.txt:287,搜「supervised fine-tuning」)与第 300 段(text/04-ch01-1-understanding-reasoning-models.txt:300,搜「preference tuning helps tailor responses」)。「睡眠和健康」那个三段对比是图 1.4 的说明文字,见第 294 段(text/04-ch01-1-understanding-reasoning-models.txt:294,搜「relationship between sleep and health」)。书自己的一句话总结在第 306 段(text/04-ch01-1-understanding-reasoning-models.txt:306,搜「raw language prediction」)。 2

  4. 出处:「1 Understanding reasoning models」第 312 段(text/04-ch01-1-understanding-reasoning-models.txt:312,搜「not yet a "chatbot."」)。原文列的那三样是 system prompt、conversation history management 和 orchestration,并指向附录 G,那里用一个真实的界面把这一层实现了一遍。

  5. 出处:「2 Generating text with a pre-trained LLM」第 38 段(text/05-ch02-2-generating-text-with-a-pre-trained-llm.txt:38,搜「which capabilities come from the reasoning methods themselves」)。原文同一段还把话说得更死:本章的常规模型是一个非推理模型,而且具体说明是 base 模型,不是指令微调或偏好微调过的助手。

  6. 出处:「1 Understanding reasoning models」第 382 段(text/04-ch01-1-understanding-reasoning-models.txt:382,搜「Inference-time compute scaling」)。原文列了这个概念的几个别名:inference-compute scaling、test-time scaling 等等 —— 出门撞见哪一个都是同一件事。

  7. 出处:「1 Understanding reasoning models」第 385 段(text/04-ch01-1-understanding-reasoning-models.txt:385,搜「high reward signals」)与第 388 段(text/04-ch01-1-understanding-reasoning-models.txt:388,搜「RL updates the model's weights」)。原文给的两类奖励例子:宽泛的(任务成功、启发式分数)与可验证的(数学题或代码题的正确答案)。

  8. 出处:「1 Understanding reasoning models」第 391 段(text/04-ch01-1-understanding-reasoning-models.txt:391,搜「traditional knowledge distillation」)。原文说 LLM 语境里的蒸馏「通常意味着用一个更大更强的模型生成的高质量指令数据做监督微调」,并说明这和传统知识蒸馏「略有不同」——后者的学生要同时学老师的输出和老师内部那一整套打分。 2

  9. 出处:「1 Understanding reasoning models」第 403 段(text/04-ch01-1-understanding-reasoning-models.txt:403,搜「distinguish the RL approach here」)与第 415 段(text/04-ch01-1-understanding-reasoning-models.txt:415,搜「more objective but potentially less aligned」)。这是书里的一个边栏,标题就叫「Reinforcement learning for reasoning and preference tuning」。

  10. 出处:「1 Understanding reasoning models」第 683 段(text/04-ch01-1-understanding-reasoning-models.txt:683,搜「not always necessary or desirable」)与第 689 段(text/04-ch01-1-understanding-reasoning-models.txt:689,搜「overthinking」)。原文的收尾是一句朴素的话:用对工具(或者说,用对类型的模型)。 2

  11. 出处:「1 Understanding reasoning models」第 751 段(text/04-ch01-1-understanding-reasoning-models.txt:751,搜「measure whether the change actually helped」)。同一节第 745 段(text/04-ch01-1-understanding-reasoning-models.txt:745,搜「we begin with a conventional LLM」)说明了为什么「拿一个现成模型当起点」值得单列成一个阶段:实践中推理方法几乎总是加在已有模型上,而不是从零训。

  12. 出处:「1 Understanding reasoning models」第 325 段(text/04-ch01-1-understanding-reasoning-models.txt:325,搜「does not require detailed knowledge of these stages」)。原文说得很清楚:我们会加载一个已经做完那些昂贵阶段的模型,好把注意力集中在推理模型特有的方法上。