跳到主要内容

奖励从哪来 — 把「对错」变成能训练的信号

这一章讲什么: 三件事。第一,「谁来当评委」是训练推理模型的真正卡点 —— ChatGPT 那套的解法很贵,这本书换了一个。第二,换掉之后长什么样 —— 第 05 章那把尺子被原样搬过来,对得 1 分、错得 0 分。 第三,一个「答案明明是对的却拿 0 分」的例子,它揭示了这套奖励里藏着的东西。

它在全书链条里的位置: 「动权重」这条路的第一站。 它只管一件事:有什么学习信号可用。 至于「这个信号怎么变成那 6 亿个数的改动」, 是第 11 章的题目 —— 书自己就是这么切的。

需要的基础: 第 05 章那把尺子(它就是这一章的评委), 第 02 章第 5 节对强化学习的那句话(让它试,好的加强坏的削弱)。

顶层全景:一道题,四个回答,四个分

还是那道题:3x−9 的一半等于 x+37,答案 83。 书为了把流程讲清楚,故意造了四个回答(不是模型真跑出来的,是编的教学素材):

同一道题,采出四个回答:
r1: \boxed{83}
r2: The correct answer is \boxed{83}
r3: The final answer is 83
r4: We get \boxed{38}

│ 拿第 05 章那把尺子逐个判

r1 → 1.0 答对,而且装进了框里
r2 → 1.0 同上
r3 → **0.0** ← **答案 83 是对的!但没写成 \boxed{}**
r4 → 0.0 框里的数是 38,错了


奖励 = [1, 1, 0, 0]

图说:这四个分就是这一章的产出。
**第 11 章会把它们变成模型内部那 6 亿个数的改动。**
r3 那个 0 分不是 bug,是这套设计里最要紧的一处 —— 第 4 节讲。

1. 为什么必须换一条路,以及被改的那个东西叫什么

先把上一条路的账结清。

走到哪分数代价
起点15.2%10.1 分钟
不动权重的最高分(投票十遍 + 思维链)52.0%862.6 分钟

52% 已经是这条路的顶了,而且性价比在一路下滑(第 08 章第 5 节算过)。 要再往上,只能动模型本身。

办法第 02 章第 5 节提过了,不重复定义:强化学习 —— 让它试,做得好的加强,做得坏的削弱。

但这一章要给一个新名字,因为后面三章会反复用到它:

被加强、被削弱的那个东西,在强化学习的行话里叫策略(policy)。 书明说这是这一行的黑话,在我们这里它指的就是我们要训的那个模型本身1 —— 更具体地说,是它那一整套「看到一段文字之后怎么挑下一个词」的办法。

为什么这个名字非记不可: 后面第 11 章和第 13 章各有一个很唬人的技术名词, 它们名字里都带着「策略」两个字,而那个「策略」指的就是这里说的这一件事 —— 我们要训的那个模型。认出这一点,后面那些名字就不吓人了。

书还把这一章和下一章的分工划得很干净,这句话值得原样记住2:

RLVR 决定「有什么学习信号可用」,GRPO 决定「这个信号怎么拿去改权重」。

(这两个缩写是什么,分别在第 3 节和第 11 章讲。现在只要记住:这一章管前半句。)

书顺带交代了为什么不用另一套更早就流行起来的算法(PPO): 那一套需要额外养一个 「估计这一步值多少分」的模型,而 GRPO 从一组采样回答的互相比较里取信号,开销小得多3PPO 本身书没有讲,我们书架上有一整章4

顺带交代规模: 书说这一章做的事和 DeepSeek 的 R1-Zero 相似,但规模小得多 —— 同等规模的完整训练要几十万美元的显卡算力3

2. ChatGPT 那套评委:两步,而且很贵

这一节讲的是 RLHF —— 第 02 章第 3 节挂过牌,这里讲透。

先说它的地位:2022 年那篇 InstructGPT 论文提出了它,而书的评价很高 —— 它是把 GPT-3 变成 ChatGPT 里那个模型的关键成分,也可以说正是它让大模型在 2022 年火起来的5

它分两步6:

第一步:训一个「打分模型」
① 让模型对同一个问题生成好几个回答
② 让人类标注员从好到坏排个序
③ 把这些「两两比较」的结果换算成分数
④ 训出一个模型:给它任何一个回答,它吐出一个数
↑ **注意:这个打分模型本身也是一个大模型**

第二步:拿这个打分模型给回答打分,照着分数去调被训模型的权重

书举的例子很具体,值得搬7:问「买笔记本电脑用来编程和日常使用,该考虑什么」——

回答内容
A只是罗列:CPU、内存、存储、显卡、屏幕、续航、键盘、插口、散热、价格
B给了具体值:至少 16GB 内存、至少 256GB 固态硬盘……显卡只有你想在本地训小模型才重要

书说人类标注员多半会更喜欢 B,因为它更具体、更贴合问题里说的用途7

——注意这里的评委是人。这就是「谁来当评委」这个问题的第一个答案,而它有一个硬伤:

那个打分模型的大小和成本,常常和被训的模型相当8

换句话说:你想训一个模型,得先训另一个差不多大的模型。 对这本书(一台机器、一个小模型)来说, 这条路直接就走不通。

3. 换掉评委:让机器判对错

这一节是这一章的转折点,而且它的解法在第 05 章就已经造好了。

书的做法一句话说完9:

把那个「训出来的打分模型」换成一个确定性的验证器。 而所谓可验证的奖励,就是不用人标注、算出来永远一样的奖励书明说:第 3 章那个数学验证器,就是一个这样的奖励产生器。

具体到数学题10:

给一道数学题(和它的标准答案)
│ 让模型答一遍
▼ 拿验证器核对:最终答案和标准答案对得上吗?
▼ 对 → 奖励 1 错 → 奖励 0

这套做法有个名字:RLVR(reinforcement learning with verifiable rewards,可验证奖励的强化学习)。

换掉评委之后,整条流水线塌了一层,这是这一节最要紧的一句11:

RLHF:第一步(训打分模型) → 第二步(用它打分并更新)
↑ 这一步整个不见了
RLVR: 一个循环:模型答题 → 验证器给分 → 直接拿这些分去更新模型

图说:两步的流水线塌缩成一个循环。**省掉的不是一点代码,是一整个模型。**

书列了三条好处和一条代价12:

内容
好处一不用训、不用养一个额外的打分模型 —— 那东西的大小和成本常常和被训的模型相当
好处二确定、可复现:同一个输出永远得到同一个分,没有人类标注的噪音和前后不一致
好处三天然能放大:只要有参考答案,任意多的输出都能自动算奖励,不用再花人力
代价它要求存在可靠的验证信号,因此被限制在数学、代码这类领域

那条代价不是新东西 —— 第 05 章第 1 节讲验证器时已经说过同一件事。 但在这里它的性质变了:那时它限制的是「能评测什么」,现在它限制的是「能训练什么」。

为什么这条路现在火了,书给了一个具体的事件13: DeepSeek-R1 在 2025 年证明了:不靠人类偏好数据、也不靠训出来的打分模型, 照样能拿到很强的推理表现。

书自己划的一条边界: R1 用的可验证奖励里还有一种是「代码能不能编译运行」。 这本书不做代码那一种 —— 因为要在一个隔离的环境里编译执行模型写的代码, 不让它碰到宿主系统、私有文件和外部服务,比解数学题复杂得多14但书强调:两者的训练算法是一模一样的15 —— 所以学会这一套,换个领域就能用。

4. 走查:采四个回答,其中一个答对了却拿 0 分

现在把上面那套东西跑一遍。

第一件事:同一道题要采好几遍。 每采一遍,得到一个回答,这一遍在行话里叫一个 rollout (直译是「跑一趟」)。为什么要采好几遍,是第 11 章的事;这一章只要知道有这么几个回答。

书为了把流程讲清楚,故意造了四个回答16:

r1: \boxed{83}
r2: The correct answer is \boxed{83}
r3: The final answer is 83
r4: We get \boxed{38}

把第 05 章那把尺子套上去,四个分数是17:

回答奖励为什么
r11.0答对 83,而且装进了 \boxed{}
r21.0同上,前面多几个字不影响
r30.0答案 83 明明是对的 —— 但它没写成 \boxed{}
r40.0框在,可里面的数是 38,错了

⟹ 奖励 = [1, 1, 0, 0]。这就是这一章的产出。

r3 那个 0 分是整章最好的教学点

这不是尺子出了 bug,是作者故意的。

他在算奖励的时候特意关掉了「抠不出框就退而求其次找个数」这条兜底规则, 于是这个奖励函数隐含了一条格式约束18:

只有又对、又按规定格式写出来,才给 1.0 分。

书把这件事的意义写得很清楚19: 既然只有「答对 + 格式对」才拿得到非零的奖励,那就是在鼓励模型学会同时做到这两件事。

——这一条的实用价值极高:

常见的做法:另外写一套规则去检查模型有没有守格式,不守就惩罚
这本书的做法:**什么都不用另写,把格式要求编进奖励函数里就行**

图说:奖励函数是你唯一要设计的东西。
你想让模型学会什么,就让什么在这里拿到分。

一条书顺带记下的负面结果,很有价值20: DeepSeek-R1 团队试过用「给中间解题步骤打分的模型」来训练,失败了。 他们的结论是:只用最终答案的正确性做奖励更好,不要中间奖励。 ——这条和第 09 章第 2 节那句「专门给推理过程打分的那类模型实践中并不总是更好」互相印证。 (但这条判断在第 14 章末尾会被一条新证据翻转,到时候我们把这三处连起来讲。)

5. 一条重要的观察:训练可以直接加在 base 模型上

这一节只补一条新事实。理由那一半在第 02 章第 4 节,不重讲。

通常的做法是:强化学习加在指令微调之后(见第 02 章那条流水线)。 但书给了一条新的观察21:

DeepSeek 团队证明了:面向推理的强化学习可以直接加在预训练完的 base 模型上, 跳过指令微调和偏好微调这两段。

这么做的效果书说得很平衡22:

代价这样训出来的模型,推理准确率一般比走完整流水线的弱一些
但是它仍然表现出清晰而稳健的推理行为
更要紧的是它避免了把好几个训练阶段的效果混在一起,从而能把观察到的提升明确归因到推理训练本身

最后那一条,正是第 02 章第 4 节那个「归因」论证在外部拿到的支撑。 ——书自己的选择(从 base 模型起步),和 DeepSeek 的做法对上了。

6. 训练用什么题:12000 道,和考卷严格不重叠

最后一件正事:训练数据。这一节短,但有两处不能跳过。

第一处:训练题和考卷严格分开23:

原始的 MATH 题库,约 12500 道
├── MATH-500(500 道)→ 从第 05 章起一直当考卷,**只用来评测**
└── 另外 12000 道 → 这一章拿来训练,**和上面那 500 道完全不重叠**

图说:书自己说明了这么做的理由 —— **防止数据泄漏,保证训练和评测干净地分开。**

为什么这件事值得单独强调: 如果训练时见过考卷上的题,后面所有的分数都不作数了。 这是第 05 章第 8 节那个「题目可能本来就在训练数据里」的问题,在我们自己这一侧的防守。

第二处:数据里其实带着完整解法,而书故意不用它。 先认一个词:学得太贴着见过的那几个样子、换个样子就不会了,这种毛病就叫过拟合24

每一条数据里都有一个写好的完整解法。 原则上可以拿它来评价模型中间的推理步骤,但书不这么做 —— 理由是那样会不必要地限制模型,并且有过拟合到某一种解法和风格的风险书希望模型更自由地去探索解题的空间。

——这一条和第 4 节末尾那条(不要中间奖励)是同一个态度的两面: 只管最后答对没有,过程随它自己去摸索。

作者的判断与证据

说法性质
四个回答的四个奖励 [1,1,0,0]书里印出来的实测,但那四个回答是作者故意造的,不是模型跑出来的
RLHF 是把 GPT-3 变成 ChatGPT 的关键成分作者的评价,他用了「arguably」(可以说)这个留余地的词
打分模型的大小和成本常常和被训模型相当作者给的行业观察,没有列具体数字
RLVR 的三条好处、一条代价作者的归纳
RLVR 火起来是因为 DeepSeek-R1有出处的事件,书给了论文地址
数学和代码的训练算法「一模一样」作者的判断,书没有实现代码那一支来验证
关掉兜底规则 = 隐含的格式约束作者的设计,而且是有意为之的教学点
DeepSeek 团队试中间步骤打分失败了作者转述的外部结果,不是他自己的实验
强化学习可以直接加在 base 模型上有出处:DeepSeek 团队证明的
不用完整解法是为了不限制模型作者的取舍与推测(措辞是「有……的风险」),没有做对照实验

判断(我们的,不是书里的): 这一章的真正主张只有一句 —— 「谁来当评委」是这条路上唯一真正贵的东西,而在能自动判对错的领域里,这个成本可以归零。 这就是为什么推理模型这一波首先在数学和代码上爆发,而不是因为这两个领域「更重要」。 如果错,会错在: 我们没有独立核过「打分模型的成本和被训模型相当」这条 —— 它是作者给的行业观察,没有出处。 如果实践中打分模型可以做得小很多(近年确实有这类做法), 那么 RLVR 的成本优势就没有书说的那么绝对,只是仍然更简单、更可复现。

边界与局限

  1. 那四个回答是编的。 它们是教学素材,不是模型的真实输出 —— 书自己说明了这一点。
  2. RLVR 只能用在数学、代码这类能确定判对错的领域。 这是它最硬的限制。
  3. 代码那一支书没有实现。 需要一个隔离的执行环境,超出范围。
  4. 奖励只有 0 和 1 两个值。 「差一点点就对了」和「完全离谱」拿到同样的分 —— 书在这一章没有讨论这个粒度问题。
  5. 中间步骤完全不给奖励。 这是书跟着 DeepSeek 的结论做的选择, 但第 14 章末尾会看到这条结论后来被新证据翻转。
  6. 「策略」这个词只在这里被解释了一次。 它是行话,而且和日常中文里的「策略」不是一回事 —— 它指的就是那个模型本身。
  7. 这一章不含任何权重更新。 它只产出四个数;怎么用这四个数,是第 11 章。

可带走的

  1. 不动权重的上限是 52.0%(代价 862.6 分钟)。 要再往上只能动模型本身。
  2. 训练推理模型的真正卡点不是算法,是「谁来当评委」。
  3. 被加强、被削弱的那个东西叫策略 —— 在这里它就是我们要训的那个模型本身。 第 11 章和第 13 章那两个名字里带「策略」的技术名词,说的都是这一个。
  4. RLHF 的评委是人:先花人力排序,再训出一个打分模型。 而那个打分模型的大小和成本,常常和被训的模型相当。
  5. RLVR 把评委换成了一段代码:对得 1,错得 0。 两步的流水线因此塌缩成一个循环 —— 省掉的是一整个模型。
  6. 换来的三条好处:不用养第二个模型、结果确定可复现、可以无限放大而不花人力。 代价只有一条:它要求存在可靠的验证信号。
  7. 记住这条分工:RLVR 决定有什么学习信号可用,GRPO 决定这个信号怎么改权重。
  8. 同一道题要采好几个回答,每一个叫一个 rollout。
  9. 想让模型学会守格式,不用另写规则 —— 把格式要求编进奖励函数里就行。 书的做法是:只有「答对 + 写进 \boxed{}」才给 1 分。 那个答对却拿 0 分的回答,就是这条设计的实物演示。
  10. 训练题和考卷必须严格不重叠。 书从 12500 道里划出 500 道当考卷, 另外 12000 道当训练集 —— 不这么做,后面所有分数都不作数。
  11. 不给中间步骤打分,是这本书(和 DeepSeek)有意的选择 —— 理由是那会限制模型、并让它过拟合到某一种解法。只管最后答对没有。

原文地图

主题原书章原文位置
本章覆盖什么6 Training reasoning models with reinforcement learningtext/45-ch06-6-training-reasoning-models-with-reinforcement-l.txt:32(搜「the most commonly used training method for reasoning models」)
RL 可以直接加在 base 模型上6.1 Introduction to reinforcement learning for LLMstext/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:51(搜「skipping both instruction fine-tuning」) · :57(搜「easier to attribute any observed improvements」)
RLHF 的地位同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:100(搜「InstructGPT paper」) · :106(搜「key ingredient in transforming GPT-3」)
买笔记本那个例子同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:136(搜「You should consider the CPU」) · :144(搜「more concrete and specific to the use case」)
RLHF 的两步同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:156(搜「two main steps」)
RLVR 是什么同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:217(搜「replacing the LLM reward model with verifiable rewards」) · :223(搜「1 for correct, and 0 for incorrect」)
两步塌缩成一个循环同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:229(搜「collapses into a single training loop」)
为什么 RLVR 火了同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:248(搜「without relying on human preference data」)
代码那一支不做 · 但算法相同同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:260(搜「isolated sandbox」) · :266(搜「the RLVR training algorithm would be identical」)
三条好处与一条代价同上text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:272(搜「comparable in size and cost to the base LLM」) · :284(搜「scales naturally to large training sets」)
规模比 R1-Zero 小得多6.2 Reinforcement learning with verifiable rewards walkthrough using GRPOtext/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:7(搜「similar to DeepSeek-R1-Zero」)
「策略」这个词同上text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:20(搜「is an RL-specific jargon」)
两章的分工同上text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:32(搜「RLVR determines what learning signal is available」)
为什么不用 PPO同上text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:45(搜「proximal policy optimization」) · :51(搜「does not require a separate value model」)
训练题与考卷不重叠6.4 Loading a MATH training subsettext/49-ch06-04-6-4-loading-a-math-training-subset.txt:13(搜「prevents data leakage」) · :35(搜「A non-overlapping set of 12,000 problems」)
故意不用完整解法同上text/49-ch06-04-6-4-loading-a-math-training-subset.txt:159(搜「explore the solution space more freely」)
四个回答6.5 Sampling rolloutstext/50-ch06-05-6-5-sampling-rollouts.txt:180(搜「rollouts = [」)
四个奖励6.6 Calculating rewardstext/51-ch06-06-6-6-calculating-rewards.txt:89(搜「Answer: '\boxed{83}'」) · :96(搜「Reward: 0.0」) · :105(搜「only provides a reward of 1.0」)
隐含的格式约束同上text/51-ch06-06-6-6-calculating-rewards.txt:20(搜「implicit format constraint」) · :53(搜「correct and properly formatted answers」)
中间步骤打分失败了同上text/51-ch06-06-6-6-calculating-rewards.txt:111(搜「These attempts were unsuccessful」)

Footnotes

  1. 出处:「6.2 Reinforcement learning with verifiable rewards walkthrough using GRPO」第 20 段(text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:20,搜「is an RL-specific jargon」)。原文明说这是强化学习的专门行话,在这里指的就是我们要训的那个模型。

  2. 出处:「6.2 Reinforcement learning with verifiable rewards walkthrough using GRPO」第 32 段(text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:32,搜「RLVR determines what learning signal is available」)。这句话是我们把原书第 6 章劈成两章的依据 —— 书自己给了这道缝。

  3. 出处:「6.2 Reinforcement learning with verifiable rewards walkthrough using GRPO」第 7 段(text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:7,搜「similar to DeepSeek-R1-Zero」)。原文说同等规模的完整训练要花几十万美元的显卡算力。同一节还交代了为什么用 GRPO 而不是 PPO:PPO 需要一个单独的价值模型,而 GRPO 从一组采样回答的互相比较里取学习信号,开销小得多(第 45、51 段,text/47-ch06-02-6-2-reinforcement-learning-with-verifiable-rewar.txt:45,搜「proximal policy optimization」;:51,搜「does not require a separate value model」)。PPO 本身书没有讲。 2

  4. 补充(不在书里,依据我们的 book 书架):这本书只把 PPO 当作 GRPO 的对照物提了两句,没有讲它是什么。依据: shelf=ai-book-reference/the-rlhf-book-reinforcement-learning-from#05-policy-gradient-ppo.md 事实=该章讲清了 PPO 的策略梯度目标、它为什么需要一个单独的价值模型来估计价值函数 —— 也就是本章脚注里说的 GRPO 省掉的那个东西。

  5. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 100 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:100,搜「InstructGPT paper」)与第 106 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:106,搜「key ingredient in transforming GPT-3」)。

  6. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 156 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:156,搜「two main steps」)。原文明确写了那个打分模型「本身也是一个大模型」。

  7. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 136 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:136,搜「You should consider the CPU」)是回答 A;书的判断在第 144 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:144,搜「more concrete and specific to the use case」)。 2

  8. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 272 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:272,搜「comparable in size and cost to the base LLM」)。

  9. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 217 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:217,搜「replacing the LLM reward model with verifiable rewards」)。原文明说第 3 章那个数学验证器就是一个可验证奖励的产生器。

  10. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 223 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:223,搜「1 for correct, and 0 for incorrect」)。

  11. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 229 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:229,搜「collapses into a single training loop」)。原文说这个循环像 RLHF 的第二步:模型生成回答、验证器给分、这些分直接拿去更新模型。

  12. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 272 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:272,搜「comparable in size and cost to the base LLM」)与第 284 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:284,搜「scales naturally to large training sets」)。

  13. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 248 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:248,搜「without relying on human preference data」)。书给的论文地址写在附录里(见「Appendix A. References and further reading」第 41 段,text/79-apx-a-appendix-a-references-and-further-reading.txt:41,搜「2501.12948」)——那个地址我们没有另行打开核对。

  14. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 260 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:260,搜「isolated sandbox」)。

  15. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 266 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:266,搜「the RLVR training algorithm would be identical」)。

  16. 出处:「6.5 Sampling rollouts」第 180 段(text/50-ch06-05-6-5-sampling-rollouts.txt:180,搜「rollouts = [」)。这四个回答是书为了演示流程写死在代码里的,不是模型真跑出来的

  17. 出处:「6.6 Calculating rewards」第 89 段起(text/51-ch06-06-6-6-calculating-rewards.txt:89,搜「Answer: '\boxed{83}'」),四个奖励依次是 1.0、1.0、0.0、0.0;第三个的 0.0 见第 96 段(text/51-ch06-06-6-6-calculating-rewards.txt:96,搜「Reward: 0.0」);书的总结在第 105 段(text/51-ch06-06-6-6-calculating-rewards.txt:105,搜「only provides a reward of 1.0」)。

  18. 出处:「6.6 Calculating rewards」第 20 段(text/51-ch06-06-6-6-calculating-rewards.txt:20,搜「implicit format constraint」)。原文明说:通过把兜底参数设成「无」,我们同时引入了一条隐含的格式约束。

  19. 出处:「6.6 Calculating rewards」第 53 段(text/51-ch06-06-6-6-calculating-rewards.txt:53,搜「correct and properly formatted answers」)。

  20. 出处:「6.6 Calculating rewards」第 111 段(text/51-ch06-06-6-6-calculating-rewards.txt:111,搜「These attempts were unsuccessful」)。原文说 DeepSeek-R1 团队试过用过程奖励模型给中间步骤打分,不成功,结论是只用最终答案的正确性做奖励更好。

  21. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 51 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:51,搜「skipping both instruction fine-tuning」)。

  22. 出处:「6.1 Introduction to reinforcement learning for LLMs」第 57 段(text/46-ch06-01-6-1-introduction-to-reinforcement-learning-for-l.txt:57,搜「easier to attribute any observed improvements」)。

  23. 出处:「6.4 Loading a MATH training subset」第 13 段(text/49-ch06-04-6-4-loading-a-math-training-subset.txt:13,搜「prevents data leakage」)与第 35 段(text/49-ch06-04-6-4-loading-a-math-training-subset.txt:35,搜「A non-overlapping set of 12,000 problems」)。这个训练集是怎么构造出来的,作者放了一个公开仓库,见第 26 段(text/49-ch06-04-6-4-loading-a-math-training-subset.txt:26,搜「math_full_minus_math500」)。

  24. 出处:「6.4 Loading a MATH training subset」第 159 段(text/49-ch06-04-6-4-loading-a-math-training-subset.txt:159,搜「explore the solution space more freely」)。