跳到主要内容

RLVR — 可验证奖励与推理模型

这一章讲三件事: RLVR 相对 RLHF 改的只是一个零件(打分器 → 判分函数), 为什么威力完全不同;让这个循环转起来的三条工程前提(难度的题、够长的上下文(机器一次能读多少字)、 稳的基础设施);以及「推理能力是 RL 训出来的还是本来就藏着」这个悬而未决的 问题。读完你能对着任何一款「思考模型」说出它的训练配方大致长什么样。

1. 这一章讲什么

2024 年底,OpenAI 的 o1 和 2025 年初 DeepSeek 的 R1 把整个行业的目光拽到一类新模型上(这类模型的统一动作:先写一长串「思考」再回答): 推理模型——回答之前先在 <think> 段落里写几百到几万个「思考 token」,显著更强于 数学、代码、科学问题。它们的训练方法叫 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励的强化学习):RLHF 的流水线原封不动,只把奖励模型 换成验证函数——答案对给 1 分,错给 0 分1

书里给这一章的定位很清楚:这是「书中所有技术的最前沿」,也是作者自认最快过时的 一章——推理模型的实践表在成书时就已经在过时2

2. 顶层全景与主走查

主走查:书里的原题。问模型「20 以内的素数之和是多少?」3:

模型输出(简化):
The prime numbers less than 20 are 2, 3, 5, 7, 11, 13, 17, and 19.
Adding them: … 58 + 19 = 77. The answer is \boxed{77}

验证函数做的事:
第 1 步 用一条正则表达式从回答里抠出 \boxed{ } 里的内容 → "77"
第 2 步 与标准答案比对:77 == 77 ✓
第 3 步 奖励 = 1

图说:全程没有一个「学出来的评分器」。判分是纯代码,
所以不可能被「讨好」,讨好也无济于事——这是它与 RLHF 的本质分野。
(\boxed{} 是数学排版的惯例记号,专门为了让答案好抠。)

RLHF 与 RLVR 的对照用书里另一道题看更清楚:「解释一下机会成本」——这样的回答 要判「清晰吗、准确吗、有帮助吗」,每一条都需要学出来的偏好;而素数题只需要 一个 ==。书里给的代码域例子:让模型写 fib(n),验证函数就是一组单元测试, 全过 = 1,挂一个 = 0(也有按通过比例给部分分的)4

主循环本身朴素到不像强化学习:采样多个答案 → 向答对的那些走梯度步 → 换题重复。 书里的原话:这个循环「在 RL 文献里几乎是教科书的定义」,真正的创新全在怎么让它 在语言模型上稳定运行而不毁掉其他能力5

3. 核心原理

3.1 为什么是现在:三个前提

「RL 不 work」喊了十年,2024 年后忽然能用了。书里归了三条6:

  1. 稳定性问题被磨平了:训练不再动辄崩,开源工具链(TRL、veRL、OpenRLHF 等) 把入门门槛压到历史最低;
  2. 底模能力够了:多个来源指向同一结论——推理训练只在 2024 年以后的前沿基座上 才跑得动。基座里没有的那点「潜在的正确行为」,RL 放大不出来(呼应第 01 章的 引出解释);
  3. 可验证的题够多:数学、代码、精确指令遵循——「答案能被机器判对」的题目 储量决定了这个方法的边界。

「可验证」这个词还有个容易误解的地方:它不等于「有唯一标准答案」。书里特意 区分:数学有唯一答案;代码题可以有很多正确写法,单元测试照样能验证。作者还交待 了命名史——他们最初想叫「RL with Ground-Truth rewards」,后改成 RLVR,就是因为 验证函数能覆盖「多解但对」的场景7

3.2 训练配方的公共件

各家推理模型报告的方法五花八门,书里归纳出几件反复出现的公共件8:

离线难度过滤。 强化学习只能从「有梯度」的样本里学:一道题如果基座全对全错,组内所有回答一个样,梯度为零。所以开跑前先用当前模型对每道题采样 (比如 16 条),只保留解对率在 20%–80% 之间的题——太易太难题全扔。

去掉 KL 惩罚。 第 02 章那条缰绳(它拴的是「生成与参考的距离」),在推理训练里被大量队伍拆除(拆掉缰绳的队伍有 Ragen、 Magistral、Open-Reasoner-Zero、Skywork OR-1 等):RL 跑得又长又重,而判对错的 奖励不像人类偏好评测那么容易被钻空子,「怕模型漂走」的顾虑小了很多,拆掉缰绳 反而让探索更放开9

格式与语言奖励。 为了让输出可解析(好拆出答案)、可预测,在判分之外加一点小奖励:逼模型 把思考放进 <think>…</think> 标签、思考时不切换语言10

长度治理。 新毛病是「想太多」(overthinking):简单题也烧几千个思考 token。 解法包括渐进放宽的目标长度、超长软惩罚——注意这与 RLHF 时代的长度偏差方向 正好相反:那边愁太长,这边愁「长度没有换来质量」11

同时多路投票(行话叫并行)。 训练之外,推理时把同一道题同时算多遍、取多数答案,是推理 模型公布成绩的标准姿势(第 15 章会回来说这怎么污染评测对比)12

3.3 RL 训练与推理时扩展:一条因果线的两端

推理时扩展(inference-time scaling,或 test-time scaling)是一类方法的统称: 花更多算力在「使用模型」上换更好的答案——多次采样再选优、价值引导的搜索等, 这些在 o1 之前就有了13。RL 训练与它的关系,书里的判断是:RL 训练是通往 推理时扩展的捷径——RL 天然教会模型「把更多 token 花在推理上」,而 token 数 与下游成绩强相关14

这带来一个与第 01 章遥相呼应的转折:早期 RLHF 的长度增长是「边际收益换话痨」 (评测有专门的长度惩罚来抵消);RLVR 的长度增长首次真的对应能力。书里提醒, 也有研究专门在做「不靠变长的推理提升」——长度只是当前最顺手的载体,不是本质15

3.4 蛋糕比喻的兑现,与 2025 的井喷

2016 年 Yann LeCun 给深度学习(这一整门「多层网络自己学」的学问)分过一块蛋糕。

蛋糕体,是没人给答案、机器自己学的部分——行话叫无监督学习

糖霜,是照着标准答案练的部分(监督学习);樱桃上的一点,才是强化学习——RL 一直被认为「数据效率高但用处窄」。书里开篇就拿 这个比喻开题:预训练吃掉蛋糕体,SFT 是糖霜,RLVR 把「樱桃」变成了承重墙—— 这是 2016 年那个比喻的完整兑现16

兑现的规模:书里的推理模型表从 2025 年 1 月(R1、Kimi 1.5)一直列到 12 月 (DeepSeek V3.2、Nemotron 3 Nano),二十多个模型——开源阵营半年走完了过去 三年的路。表里有几个标志性节点:INTELLECT-2(第一个公开记录的全球去中心化 RL 训练)、MiniMax-M1(CISPO 的出生地,第 06 章)、OLMo 3 Think(把整个训练 生命周期的中间结果存档(行话叫检查点)和数据全开放,四周、220 块 GPU)17

训练配方本身,第 02 章的 R1 四步(冷启动 → 大规模 RLVR → 拒绝采样 → 混合打磨) 就是这一章的落点;另一条路线是蒸馏:不跑 RL,直接拿推理模型的输出去做 指令微调——便宜得多,是大多数后来者的第一步18

4. 作者的判断与证据

书里有证据的部分:验证函数的形状、难度过滤的 20–80% 区间、各模型的公开报告、 o1/R1 的发布时间,全部可查;作者本人是 Tulu 3 的负责人,而 Tulu 3 正是「RLVR 作为可复现开源配方」的早期代表——这一章的乐观有作者自己的产品线背书,读时 要记得。书里给判断的部分:「改善会泛化到没见过的题和领域」被作者称为 remarkable,但仍以观察口径给出,没有机制解释;推理能力的来源(引出 vs 新增) 书里保持了两可19

判断(我们的,不是书里的): RLVR 最大的思想贡献不是某个算法,而是把 「对齐」与「能力」的工坊合并了——同一条 GRPO 流水线,换一个奖励函数就从 调风格变成教推理。这意味着「后训练」这个阶段本身正在吞并原以为属于预训练 的部分;而它的硬边界也在这里:没有验证函数的领域(大多数人文任务), RLVR 进不去——于是有了第 11 章的 rubric 折中方案。 如果错,会错在: 如果「判对错」的覆盖面被快速拓宽(评分模型、通用判官 足够可靠),这条边界就会消融,上面的判断过期。

5. 边界与局限

  • 快门速度:书里自陈模型表发布即过时;公共件清单也注明「可能已被新做法 取代」2;
  • 污染疑云:部分早期 RLVR 复现(尤其在 Qwen 系基座上)后来被发现可能吃到了 基座的基准污染——「随机奖励也能涨分」的著名结果就指向这里(第 15 章展开)20;
  • 泛化的边界:书里引用的「训练题上的进步泛化到未见领域」是有限观察; 对「推理能力究竟是引出还是新增」,全书没有给结论19;
  • 成本黑箱:推理模型的 RL 阶段算力开销没有任何公开细账。

6. 可带走的

  1. RLVR = RLHF 换判分器:验证函数(正则抠答案、单元测试)替代奖励模型;
  2. 「可验证」≠「唯一答案」:单元测试能验多解;
  3. 难度过滤(解对率 20–80%)是 RLVR 的第一道工序——全对全错的题没有梯度;
  4. 推理训练普遍拆掉 KL 缰绳——奖励不易被钻空子时,缰绳弊大于利;
  5. RL 训练是推理时扩展的捷径:token 变长首次与真实能力强相关;
  6. LeCun 蛋糕比喻的兑现:RL 从樱桃变承重墙;
  7. 蒸馏(拿推理模型的输出做 SFT)是预算不足时的正路;
  8. 底模能力是前提——RL 放大存在的行为,造不出不存在的种子

7. 原文地图

主题原书章原文位置
RLVR 定义与判分对比7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:110(搜「verification function」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:79(搜「subjective qualities」)
素数题与代码验证7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:127(搜「Adding them」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:141(搜「regular expression」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:184(搜「partial credit」)
主循环与泛化观察7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:337(搜「Sample multiple answers」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:348(搜「generalize to questions」)
为什么是现在7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:384(搜「all time low」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:392(搜「certain level of underlying capability」)
RLVR 命名史7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:196(搜「Ground Truth」)
goldfish 诗与思考 token7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:215(搜「goldfish」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:325(搜「thousands of tokens」)
推理时扩展7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:404(搜「value-guided sampling」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:410(搜「short path」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:410(搜「length-bias」)
RLVR 的 epochs 口径7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:434(搜「hundreds or thousands of epochs」)
o1/R1 之前的工作7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:470(搜「STaR」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:470(搜「VinePPO」)
难度过滤7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:732(搜「20-80%」)
去 KL7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:738(搜「Remove KL penalty」)
格式/语言/长度治理7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:747(搜「format rewards」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:753(搜「overthinking」)
多数投票7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:759(搜「majority of rollouts」)
蛋糕与承重7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:44(搜「cake」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:796(搜「load-bearing」)
模型表与快门7 Reasoning & Inference-Time Scalingtext/26-ch07-7-reasoning-amp-inference-time-scaling.txt:488(搜「Table 7.1」) · text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:790(搜「4 week long training run」)

Footnotes

  1. 出处:「7 Reasoning & Inference-Time Scaling」第 32 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:32,搜「think extensively」)与第 73 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:73,搜「makes the reward model optional」)。

  2. 出处:「7 Reasoning & Inference-Time Scaling」第 784 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:784,搜「incomplete」)与第 784 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:784,搜「superseded」)。 2

  3. 出处:「7 Reasoning & Inference-Time Scaling」第 121 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:121,搜「prime numbers less than 20」)与第 133 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:133,搜「Reward = 1」)。

  4. 出处:「7 Reasoning & Inference-Time Scaling」第 176 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:176,搜「All tests pass」)与第 184 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:184,搜「partial credit」)。

  5. 出处:「7 Reasoning & Inference-Time Scaling」第 190 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:190,搜「textbook definition」)与第 354 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:354,搜「lightly search over behavior space」)。

  6. 出处:「7 Reasoning & Inference-Time Scaling」第 378 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:378,搜「doesn't work yet」)至第 392 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:392,搜「certain level of underlying capability」)。

  7. 出处:「7 Reasoning & Inference-Time Scaling」第 196 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:196,搜「Ground Truth」)。

  8. 出处:「7 Reasoning & Inference-Time Scaling」第 732 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:732,搜「difficulty filtering」)。

  9. 出处:「7 Reasoning & Inference-Time Scaling」第 738 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:738,搜「Remove KL penalty」)。

  10. 出处:「7 Reasoning & Inference-Time Scaling」第 747 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:747,搜「format rewards」)与第 750 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:750,搜「language consistency rewards」)。

  11. 出处:「7 Reasoning & Inference-Time Scaling」第 753 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:753,搜「overthinking」)。

  12. 出处:「7 Reasoning & Inference-Time Scaling」第 759 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:759,搜「majority of rollouts」)。

  13. 出处:「7 Reasoning & Inference-Time Scaling」第 404 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:404,搜「value-guided sampling」)。

  14. 出处:「7 Reasoning & Inference-Time Scaling」第 410 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:410,搜「short path」)。

  15. 出处:「7 Reasoning & Inference-Time Scaling」第 410 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:410,搜「length-bias」)与第 416 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:416,搜「wasted energy」)。

  16. 出处:「7 Reasoning & Inference-Time Scaling」第 44 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:44,搜「cherry」)与第 796 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:796,搜「load-bearing」)。

  17. 出处:「7 Reasoning & Inference-Time Scaling」第 488 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:488,搜「Table 7.1」)、第 551 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:551,搜「INTELLECT-2」)、第 790 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:790,搜「220 GPUs」)。

  18. 出处:「7 Reasoning & Inference-Time Scaling」第 452 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:452,搜「distillation」)。

  19. 出处:「7 Reasoning & Inference-Time Scaling」第 348 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:348,搜「Even more remarkable」)。 2

  20. 出处:「7 Evaluation」第 410 段(text/36-ch17-17-evaluation.txt:410,搜「random rewards」)。原书评测章的原话:在随机奖励上做 RL 也能涨分,「should only increase performance if a model has certain types of data contamination」。