跳到主要内容

让它想清楚 — 奖励旅程,而不只是终点

这一章讲三件事: 「让它一步一步想」这件事为什么有效、又为什么不可靠; 怎么把它从一个提示词技巧变成一项训出来的能力; 以及在它的能力边界上,正确的做法是什么。

它在全书链条里的位置: 书自己把这一章称作前面所有技法的顶点。 第 15 章给了模型手,这一章给它脑子——而书的原话是: 工具是能动系统的「肌肉」,推理是引导它的「大脑」。

★ 这一章有两处回收:第 07 章那条打转的船以第二个名字出现(写长骗分), 而第 03 章那条「模型没有的能力榨不出来」以更硬的形式回来(组合性墙)。

1. 先看现象:「一步一步想」有效,但你不知道它在不在骗你

先说这件事的时间坐标

这一章讲的东西有一个很明确的分水岭1:

2024 年 9 月,一个模型做了一件不寻常的事:它展示了一个训练出来的推理过程—— 那条从问题通向答案的思维链**。**

(「思维链」就是模型在给出最终答案之前,先写出来的那一串中间步骤—— 它是被写出来的文字,不是模型内部某种看不见的东西。这一点是整章的地基,§3 会讲透。) 在那之前,推理一般是模型的一种「内部构造」, 后训练研究者要盯着看好几个小时,而且只能靠假装自己是模型的小学数学老师 (「把过程写出来!」)去把它诱导出来。

推理在语言模型里,已经从一个提示词工程的技巧,演化成了一项可训练的能力。1

那个诱导技巧确实有效

只要在提示词后面加一句「让我们一步一步地想」,推理任务上的表现就能明显变好—— 而且它不需要任何训练数据2

但它不可靠,而且不可靠的方式很要命

书列了两层,第二层是这一章存在的理由2:

问题
表层模型可能产出看起来很像样、却导向错误结论的推理——每一步听起来都合理,而这条链通向了错的地方
更根本的一层模型产出的推理,可能并不反映它实际的计算。可能早就定下了答案,而正在构造一套事后的正当化,而不是真的在朝一个结论推理

书给第二层起了名字:推理沦为事后合理化,而不是发现。

★ 这一条的后果比它听起来严重:
**如果推理过程根本不影响答案,那么把这个过程展示出来,给的只是一个虚假的保证。**
你以为你在审查它的思路,其实你在读一段和结论无关的作文。

训出来的推理和诱导出来的推理,差在哪儿

书给的区分有两条,而且都很硬3:

诱导出来的(靠提示词)★ 训练出来的
它为什么会推理因为你要求它这么做它的内部奖励结构被训成了「给推理赋予价值」——因为它学到了「有效的推理导向正确答案」
持不持久不持久。 和所有推理时的干预一样,换个提示词就没了成为模型不可改变的内部结构的一部分
能不能教特定的推理方式很难,除非在上下文上投入很大可以。我们能训它按一个特定的顺序去推理

书给的判据一句话:如果你需要的是「这段推理可信」,而不只是「这段推理存在」,那就必须训。3

2. 顶层全景:一条推理链的一生

一道题进来

① 模型在「草稿纸」上写中间步骤 ← §3:草稿纸是什么、给不给用户看

② 链越写越长 ────────────────────────────► ★ 准确率是倒 U 形 ← §4
│ ★ 而且它会学会写长骗分

③ 第 4 步写岔了 ──────────────────────────► ★ 写进去的东西抹不掉 ← §5

④ 训练时怎么给分?
├ 只看终点对不对 → 稀疏,而且奖励「错的理由得出对答案」
└ ★ 逐步给分 → 功劳分到步上,还能在全错的链里挑出更接近对的 ← §6

⑤ 推理的形状随领域变 ← §7

⑥ 有些领域根本不需要打分器 ── 编译器和证明检查器就是 ← §8

⑦ 想多久是可以买的 ← §9:推理时的算力

└──► ★ 但撞到一堵墙:会做三步题,败在五步题 ← §10

图说:**③④ 是这一章的机制核心,⑧ 是它最干净的特例,⑩ 是它的边界。**

主走查(全章共用): 让模型把「六周保守治疗」的适用条件逐条推一遍。 输入是那份 P-4471 的记录:42 岁被保人,4 周门诊理疗 + 2 周居家锻炼,申请腰椎 MRI。 它会在第 4 步悄悄把「保守治疗」换回它自己的默认定义——这一章要抓的就是这一步。 编造的数每次出现都会标明。

3. 机制一:草稿纸,以及给不给用户看

它为什么有效:一个很物理的解释

书拒绝进入「机器到底算不算在推理」这场哲学争论,而是给了一个纯结构性的解释4:

回想自回归模型的因果结构:它一次产出一个 token,每个 token 都以前面的 token 为条件。 ★ 这意味着最近这几千个 token(受上下文窗口大小限制), 就是模型可以反观的一种极短期记忆,或者说一块草稿纸。

当我们让模型把推理的各个阶段拼写出来时, 我们是在鼓励它使用那块草稿纸去生成中间步骤、并对它们进行反思。

换句话说:把中间步骤写出来,等于给它换到了更多的计算。 那些步骤一旦写出来,就成了后面每一步都能看到的条件。

草稿纸可以是隐藏的

书专门讲了一种做法:给模型一块专用的、用户看不见的思考空间5:

这种分离承认一件事:有效的推理常常包含那些「不适合出现在面向用户的输出里」的探索—— 考虑然后否决假设、做一些之后会被修正的粗略计算、走一些之后会被放弃的死胡同。

而这件事要专门训5:

模型必须学会:哪种推理属于草稿纸、哪种属于最终输出; 怎么进行有用的探索,而不是产出单纯的啰嗦; 以及怎么把草稿纸上的推理综合成恰当的结论。 没有训练,模型可能会低效地使用草稿纸——把想法重复一遍,而不是推进推理。

给不给用户看,是一条必须明文写死的政策

书把这件事列成了一条政策,而且给了两边各自的理由6:

展示推理过程隐藏推理过程
建立信任(用户看见它在「想」)保护你的专有方法(竞争对手无法逆向你的做法)
便于调试(工程师能定位推理在哪里出错)缩小攻击面(对手无法探查推理里可利用的模式)
满足监管对可解释性的要求简化用户体验

书给的常见做法和那条硬要求6:

多数部署采取中间路线:给用户看摘要过的推理,完整轨迹留给调试,审计日志为合规而保存。

★ 这条政策必须是明确的、而且一致的。 那些「有时看得见推理、有时看不见」的用户,会觉得这种不一致让人不安。

4. 机制二:想得越久越好吗 —— 倒 U 形,以及写长骗分

★ 第 15 章那条算术在这里第一次兑现

书先给了那句结论7:

推理是手段,不是目的。为了长而长的推理链并不可欲。 这个现象有个名字叫过度思考:★ 准确率随思维链长度呈一条倒 U 形曲线。 推理步数增加时表现一开始会改善,但当链变得过长时它最终会恶化。

机制就是第 15 章那条误差累积,书这里换了一组数7:

一条 10 步的链,每步 95% 正确 → 全程有效的概率只有 60%
一条 20 步的链 → 掉到 36%

★ 对照第 15 章给的那组(每步 90%,十步剩 35%):
把单步正确率从 90% 提到 95%,十步的全对率从 35% 涨到 60%。
**单步那 5 个百分点,在十步之后放大成 25 个百分点。**

★ 那条打转的船第二次出现:写长骗分

第 07 章那条「打分器偏爱长回答」的毛病,在这一章有了一个更具体的形态8:

在推理数据上训练的模型,常常学到「更长的回答与更高的奖励相关」—— 因为复杂问题需要更长的推理,而复杂问题往往正是训练的重点。

这造出一种行为叫写长骗分:模型给简单问题灌上不必要的步骤, 模仿难题解法的长度,却没有它的实质。

★ 书的判词:如果你的模型三步就能解一道题却写了十五步,它不是在周全,它是在拖延。

这是「对着奖励作弊」的第二个名字。 第 07 章那次它作弊的是打分器的长度偏好, 这一次作弊的是「难题更长」这条相关性。

但粗暴地罚长度不管用

书给了一条明确的反面做法9:

那种霍布斯式的做法——「肮脏、粗野而短促」—— 是简单地限制最大长度,并给那些「没写完就结束」的输出记一个惩罚。 ★ 问题在于:它产生不了什么有用的梯度信号。

书推荐的做法是按题目难度分级给奖励9:

通过让模型接触难度分级的奖励函数(这种技法叫难度感知重加权), 我们移除了过度思考的诱惑。

而它还区分了两种病,这个区分很要紧9:

写长骗分过度思考
我们为什么要治它它让模型不学任何东西就拿到奖励它实实在在地让模型表现变差——因为误差会累积

★ 第 09 章那族按难度调整的做法,治的正是这两件事。 那里讲过三条改动 (按长度给奖励打折、给错误答案单独加罚、按难度给优势重新加权), 这一章解释了它们为什么必要。

5. 机制三:写进链条的东西抹不掉 ★ 第 05 章那笔债的另一半

这一节是书里一个署名「战壕来信」的专栏,它引了一句 11 世纪的诗当引子10:

那只移动的手写下,写完之后便向前移去; 你的虔诚与机智,都无法诱它回来勾掉半行; 你的全部眼泪,也洗不掉其中的一个字。

书的按语很短:

★ 一旦某样东西进入了思维链,它就留在那里了。 模型可以修正、可以否定自己过去的推理,但它永远无法让那些内容消失。 这是语言模型自回归结构的一个后果。10

最典型的一种失误:它把你的定义换回自己的默认定义

书给这个病起了名字,而且它在企业场景里极其常见11:

回退到默认定义:模型用它自己的默认定义,替换掉一个被明确定义过的术语—— 而它自己的那个定义,很可能有微妙的不同。 这个问题最常出现在那些依赖「定义的组合」的领域里。

作者的亲历案例11:

在开发一个早期的、用来评估租赁协议公平性的推理模型时, 我常常看到模型忘掉「双方约定构成违约的那些具体条款」。 ★ 结果是:模型每走一个推理步,都在冒着一次风险—— 它可能调用自己关于「重大违约」的定义,而不是合同里的那个。

这就是回退到默认定义在起作用:模型有它自己的默认定义, 而且只要这些术语在任何一个阶段被重新引入,它就会偏好自己那个。

★ 这正是第 05 章那笔债的另一半。 那里说过训练时喂真值、用时接自己写的东西; 第 15 章的形态是「工具失败之后接不上」,这一章的形态是 「自己上一步引入的一个错误定义,后面每一步都建立在它上面」。

走查:那第 4 步

题:P-4471 这份申请,是否满足「已完成 6 周保守治疗」?
记录:4 周门诊理疗 + 2 周居家锻炼。
★ 而这家公司的内部口径(写在那 800 封历史信里、但没写进任何手册)是:
**居家锻炼不计入保守治疗周数。**

模型的推理链:
第 1 步:保单第 7 条第 3 款要求完成 6 周保守治疗。 ✓
第 2 步:被保人接受了 4 周门诊理疗。 ✓
第 3 步:被保人另有 2 周居家锻炼记录。 ✓
第 4 步:**保守治疗通常包括物理治疗、居家锻炼和非甾体抗炎药。** ← ★ 出事了
↑ 这一句是它自己的默认定义,不是这家公司的口径
第 5 步:4 + 2 = 6 周,满足要求。 ✗
第 6 步:结论——不应以 CT-06 拒付。 ✗ 完全错了

★ 注意第 4 步之后的每一步在逻辑上都是对的。
错的只有第 4 步那一句,而它已经写进链条,擦不掉了。

(这段推理链是为演示编的;「回退到默认定义」这个机制和那个租赁协议案例是书里给的。)

书给的三条对策

它们的共同点是:在每一步之后强制回头核对,而不是等结论出来才发现12:

对策做什么
给推理步设检查点书说没有普适的配方,但给了下面这条做法当范例
按清单逐项给分奖励基于「模型产出的文字符合一张要求清单的程度」。 它特别适合那种「一方面要留自由度、另一方面又要逐项打勾」的任务(书举的例子是生成一份研究计划)
周期性地重新核对前提给「回头确认一遍定义」这个动作本身发奖励

走查上的落点: 如果清单里有一条是**「引用了合同/保单里对该术语的原文定义」**, 第 4 步就拿不到分——因为它引的是自己的定义。

6. 机制四:奖励旅程,而不只是终点

这一节是这一章的命门,也是这一章标题的来处。

两种给分方式

只看终点(结果奖励,ORM)逐步给分(过程奖励,PRM)
评什么只评最终答案评每一步:在前面几步的前提下,这一步有没有效
信号密度稀疏整条链上都是密的
它的两个毛病一个用有缺陷的推理得出正确答案的模型,拿到和推理正确的模型一样的奖励;② 一个推理到最后一步才算错的模型,得不到任何奖励13
它的两个额外好处功劳分配精确到步:第 1 到 7 步对、第 8 步错 → 前七步得正信号、第八步得负信号;② ★ 即使最终答案是错的,它也能识别出「哪几条推理链更好」14
代价便宜标注贵

光是「验证」这件事本身就有多值钱

书先给了一个数字,说明连最粗的验证都威力很大15:

一项工作训了一个单独的验证模型去给候选解法打分,再从一批候选里选分最高的那个。 ★ 结果是:一个 60 亿参数的模型加上验证,匹敌甚至超过了一个微调过的 1750 亿参数模型—— 这个提升相当于把模型规模放大约 30 倍。

参照物:1750 ÷ 60 ≈ 29 倍。也就是说,「多生成几个再挑一个」这件事, 换来了差不多三十倍参数量的效果。

逐步给分到底值不值那笔标注钱:两项研究给了不同侧面

书很诚实地把两边都摆了出来16:

研究结论
第一项在较容易的基准上,只看终点和逐步给分产出的最终答案错误率相近,而且前者标注力气更小。★ 但是:只有逐步给分才能保证「推理正确」,而不只是「答案正确」
第二项收集了 80 万条以上步级人工标注、覆盖 7.5 万个解法,证明在更难的数学任务上,逐步给分显著胜过只看终点

书给的实操判据:对那些「推理的正确性要紧、而不只是答案要紧」的领域, 逐步给分值得那笔标注投入。16

为什么「答案对但理由错」危险,书给了理由16:

只看终点的监督,允许模型通过有缺陷的推理到达正确答案—— 而这样的模型会在新题上以不可预测的方式失败。

那 80 万条标注可以不用人做

这一条把这件事的成本从「不可能」拉回「可行」17:

★ 做法:给一道有已知答案的题、以及一份逐步的解法。

从**每一步**出发,让模型生成多条通向最终答案的续写路径,
再拿每条续写去对照标准答案。

★ 这一步的质量 = 「通向正确答案的续写所占的比例」。

→ 零人工标注。它是对这一步「好不好」的一个蒙特卡洛估计。

书给的效果(一个 70 亿参数模型)17

先说清最后那一列的「重排」:让模型对同一道题生成多条推理链, 再拿上面那个过程打分器给每条打分、按分数重新排一遍队,只取分最高的那条交出去 —— 这就是本节上面那个「多生成几个再挑一个」的正式做法。 所以那一列多出来的分数不是模型变强了,是同一个模型多算了几遍、然后挑了挑。

基准原来用了这套之后再加上重排
小学数学题77.9%84.1%89.1%
竞赛数学28.6%33.0%43.5%

那个乘积结构,和一条能当场用的剪枝线

过程打分器给整条链的分,是各步概率的乘积18:

整条链有效的概率 = 第 1 步对的概率 × 第 2 步对的概率 × … × 第 t 步对的概率

★ 这个乘积结构有一个很实际的后果(书自己算的):
每步 90% → 十步只剩约 35%
★ 这解释了为什么长链比短链更容易失败,也解释了为什么逐步监督要紧。

★ 一条能当场用的线:
**如果过程打分器给某一步的概率低于 0.7,复合概率已经在快速恶化了——
这一步就该被剪掉,换一条路。**

顺带说清楚它怎么实现

书给了一个很干净的做法,而且它解释了一个容易被问的问题19:

它是一个 token 分类器:只在每一步的最后一个 token(步与步的分隔符之前)计算损失, 其余位置全部遮住。

★ 为什么要这样:这迫使模型读完整整一步之后才做判决,而不是读到一半就下结论。

标签词表故意做得很简单:每个步边界的 token 拿到一个正标签(在前面所有内容的前提下这一步是对的) 或者一个负标签(这一步含有错误)。 有些标注方案会加第三个中性类别,给那些「技术上正确、但没有推进解题」的步; 实践中多数实现把它并回了二分类。

聚合方式两种,各有取舍19:

方式意思
取乘积上面那条
取最小值看最弱的那一环

一条链走不通,就同时展开好几条

这是过程打分器的一个自然延伸20:

标准的思维链是从左到右生成单独一条链,没有回溯、也没有探索。 而这个框架维护一棵候选推理路径的树,评估每一条的前景,并系统地搜索。 它有四个部件:一个把问题拆成可管理子步的分解器、一个提出候选下一步的生成器、 一个状态评估器,以及一个搜索策略。

这个做法的名字叫思维树(Tree of Thoughts),留名。 书给的效果对照很惊人:在某个数字游戏任务上,单链思维链 4%,思维树 74%20

7. 机制五:推理的形状随领域变

这一节纠正一个常见误解:推理不是一种通用的「想清楚」。

法律:四步,而且它有具体的收益

书给的这个例子最完整,而且它正好能把整章串起来21:

★ 法学院教给每个学生的第一件事,是一种叫 IRAC 的推理形式:
I 争点(issue) —— 这里的法律问题是什么
R 规则(rule) —— 适用的规则是什么
A 适用(application)—— 把规则适用到这组事实上
C 结论(conclusion)

★ 它反映的是法律实务底下的一条逻辑:把权威(判例、成文法、有时是别的规范)
适用到一组事实模式上。

书给的数字:按这个结构组织的提示词,在某个基于日本司法考试的法律蕴含基准上,
**把准确率从大约 70% 提到了 81% 以上**——胜过通用的思维链提示。

走查上的样子(拿它走一遍 P-4471):

I 争点:被保人是否已完成保单第 7 条第 3 款要求的 6 周保守治疗?
R 规则:第 7 条第 3 款 + 本公司口径「居家锻炼不计入」
← ★ 这一步就是第 5 节那个检查点。规则必须被明确地摆出来,
而不是留给模型的默认定义。
A 适用:门诊理疗 4 周,计入;居家锻炼 2 周,不计入 → 合计 4 周 < 6 周
C 结论:未满足,适用拒付代码 CT-06。

★ 对比第 5 节那条出错的链:同样的输入,IRAC 的 R 那一步把「规则是什么」
从推理中间提到了推理前面,于是「回退到默认定义」没有机会发生。

但书也给了法律推理的三个独有难点22:

难点具体
它有主观性一份判决的「持有」到底是什么、适用于什么,有时本身就有歧义;而很大一部分上诉诉讼,争的正是「某个权威在这个情形下是否应当被区别对待」
对抗性这让法律推理和数学推理有根本的不同
幻觉率高得可怕见下

那组关于幻觉的数字必须原样转述,因为它决定了这件事的风险等级23:

到 2025 年底,一个追踪法庭上 AI 幻觉案例的数据库已经收录了 900 多起。 一项系统性研究测了四个模型在「关于随机联邦判例的查询」上的表现: ★ 即便是表现最好的那个,幻觉率也至少有 58%;另一个约 88%。 在最难的任务上,幻觉率超过 75%。

★ 而最要命的一条:模型无法预测自己什么时候在幻觉——它的校准很差。

临床:另一种形状

书给的是一条五段式的流程24:

① 采集病史与主诉
② **鉴别诊断**:一份「可能解释这些症状的诊断」的**排序**清单
③ 假设检验:做检查、做化验
④ 按证据更新这份排序
⑤ 得出诊断

★ 书特别指出:**训练数据理想上应该包含专家临床医生的推理轨迹——
不只是他们最终的诊断,还有通向那里的思考过程:
他们考虑过的替代方案、他们去找的证据、以及他们如何权衡不同的发现。**

★ 注意这正是第 14 章那条「让专家判断」在推理这一侧的形态。

8. 机制六:有些领域根本不需要打分器

这一节是这一章最干净的一段,而且它正好回答了全书总纲那条线的问题:谁来告诉它对不对。

那份「罕见的礼物」

书的开场句25:

有些领域提供一份罕见的礼物:毫无歧义的基准真值。 一个证明要么通过验证,要么不通过;一段代码要么通过测试,要么不通过。

★ 这些领域使得「不要人工标注的大规模训练」成为可能, 而且反馈环是以计算的速度运行的,而不是以人的速度。

编译器就是打分器

这是这一节最该记住的一句,而且它有一个规模化的实例26:

做法:对编程任务,模型生成候选解法 → 编译器拿一整套单元测试跑它
→ 一个 0/1 的二值奖励(不通过 / 通过)喂回训练循环

★ 这些领域不需要一个学出来的打分器——**编译器就是打分器。**

书给的结果:那个模型拿到了 2029 的竞赛编程等级分,超过 96.3% 的人类选手。

作者自己给了一条最实用的建议,而且它比上面那个例子更贴近普通团队27:

我发现代码执行是通用推理训练里最实用的验证系统。 你不需要奇异的证明助手或者领域专用的验证设施——只要有能力安全地运行代码就行。

★ 尽可能把推理问题重新表述成编程问题: 与其说「推理一下这个谜题」,不如说「写一个函数来解这个谜题」。 测试套件就成了你的奖励信号,而你可以生成无限多的训练数据。

但形式化验证那一条路的代价是极端不对称的

书给的这组数字必须一起看28:

数字
验证与生成的硬件类型不同验证是吃 CPU 的,而模型生成是吃显卡的
一次步级证明器的训练开销约 21000 个 CPU 天,显卡与 CPU 的时间比大约 1:11
最难的问题每道题要两到三天、几百个 TPU 天

书对那次著名的竞赛数学成果给的定性也很克制29:

它的意义不在于日常部署,而在于概念验证。

还有一句关于形式数学的话,值得单独记住28:

★ 在形式数学里,一个 95% 正确的证明等于 100% 错误。

那条「会不会迁移」的说法,书自己就没写死

这一条我们要照实标出来30:

在可验证领域上大量训练出来的模型,在那些无法被形式验证的相关领域上表现也有提升, 这似乎暗示着:通过验证发展起来的严谨推理技能,能泛化到它们的训练语境之外。

书自己用的措辞是「appears to transfer」和「if this transfer proves robust」—— 「看起来会迁移」「如果这种迁移被证明是稳健的」。这是推测,不是结论,我们照实写。

9. 机制七:想多久,是可以买的

现在的天花板是经济,不是能力

这一节的结论很反直觉,而且它对做预算的人很有用31:

当前的推理模型运行在一个人为的天花板之下:限制它们能思考多久的是推理经济学,而不是能力。 供应商约束推理链的长度,是为了让上下文规模可控、推理成本可持续、 以及在他们服务的用户量下让体验大体上过得去。

书给了一个很有说服力的类比31:

想想早期的围棋程序:在推理时把搜索拿掉,它的棋力下降超过 2000 分等级分。 同样的动力学在这里也适用:被截断了思考的推理模型,表现在它的潜力之下。

两条给从业者的推论31:

① ★ 你在当前产品里看到的推理能力,**低估了底下这些模型在更多算力下能做到的事。**
书的原话:**你看到的不是最先进,是最付得起的。**

② 随着推理变便宜,**预期会出现不连续的能力跃迁**——当模型被允许想得更久时。
所以:**围绕当前推理限制设计的系统,可能会在约束放松之后
没有充分利用这些模型。**

算力怎么分配:按难度分配比均匀分配高效四倍

这一条是可以直接省钱的32:

题的难度最优策略
容易的题简单的「多生成几个、选分最高的那个」
难的题由过程打分器引导的更深的搜索,去探索不同的推理路径

书给的数字:按题目自适应地分配算力,比均匀地多采样效率高约 4 倍。 而且:小模型加上足够的推理时算力,能在算力持平的比较下胜过一个大 14 倍的模型。

★ 结论:推理时的算力和预训练的算力,在一定程度上是可以互换的。32

顺带说清楚「推理税」

书对这件事给了一个诚实的评估33:

★ 推理模型即便面对简单查询,也会生成成千上万个 token 的内部斟酌。 而更长的链并不总是改善表现:一旦推理长度超过模型的有效容量, 准确率会因为误差传播和噪声累积而下降。

对策是按查询的复杂度决定要不要深思——这就是第 20 章那条「把成本从常数变成变量」的种子。

10. 机制八:组合性墙 ★ 能力守恒律第二次,而且更硬

这一节是这一章的边界,也是全书那条暗线的第二次回收。

现象

书给的描述非常具体34:

一个能可靠解决「需要三个推理步」的问题的模型,可能在「需要五步」的问题上失败—— 即使每一个单独的步骤都在它的能力范围之内。 一个见过很多「组合两种运算」的问题的模型,可能在被要求组合四种时失败—— 尽管它每一种运算都很懂。

★ 这些失败不是随机的错误,而是系统性的局限: 只要模型必须以不熟悉的方式组合熟悉的元素,它们就会出现。

为什么加数据救不了

这一句是这一节的硬核34:

这个局限反映的是神经网络学习与泛化方式的根本方面,而不仅仅是训练数据不足。 同样的局限出现在各种模型规模、各种训练数据量、各种训练技法上。 ★ 加更多训练数据在边缘上有帮助,但消除不了这道组合性的缺口。

★ 模型看起来学到的是「与它训练样例相同长度和复杂度的模式」, 而不是学到底下那条规则。

用一句更狠的话概括:它学到的不是「怎么证明一步」,是「三步的证明长什么样」。

★ 这是第 03 章那条规律第二次、更硬地回来

判断(我们的,不是书里的): 第 03 章讲激活引导时说过一句 「模型没有的能力,你没法从它自己身上榨出来」,并预告它会以两个更硬的形式回来。 这里是第一次。

出现在形态机制
第 03 章引导只能调制,教不了新能力没有方向可以指过去
这一章会做三步题,五步题就是不会学到的是三步的模板,不是推理本身
第 17 章模型无法为它不具备的能力生成训练信号生成不出比自己好的样本

如果错,会错在: 三处的机制确实不同,把它们并成一条可能让人以为存在某个统一的定理。 没有,这是一条经验上的家族相似。 第 17 章会把这三处并起来再说一次。

那么正确的做法是什么:求救

书给的答案不是「继续训」,而是「换一条路」35:

某些人类觉得很平凡的认知任务,对神经网络来说始终困难,不管规模多大、训练多精巧。 最常被举的例子是数字母:切词方式让「数一个单词里有几个某字母」变得不平凡, ★ 而一行代码就能轻松给出正确结果。 知识检索也有类似的挑战:模型可能弄混日期、记错名字、或者幻觉出听起来合理的事实。

于是书给出了一种混合架构,而它正好把第 15 章接了回来36:

神经推理被形式工具增强,把学出来的系统的灵活性,和形式系统的可靠性结合起来。

★ 模型负责推理里开放的那一端:理解问题陈述、拆解复杂问题、 识别哪些工具是相关的、把结果综合成连贯的结论; ★ 工具负责那些「可靠性要紧、近似不可接受」的部分。

★ 所以第 15 章和第 16 章的关系在这里闭环: 不是「先学会用工具、再学会想清楚」,而是「想清楚的边界,恰恰要靠工具来兜」。

11. 作者的判断与证据

说法是哪一类说明
2024 年 9 月那次是分水岭公开事件书给了时间与模型名1
「一步一步想」有效有据书给了原论文的尾注2
事后合理化作者的论断 + 机制他给了理由(推理可能不反映模型的计算),但没有配实验2
草稿纸那个解释结构性论证从自回归结构直接推出,书明确回避了「机器是否真在推理」的哲学争论4
倒 U 形与那两组数可验算的算术但它和第 15 章那条一样假设各步独立7
写长骗分有据的常见现象书给了机制解释(难题更长这条相关性)8
粗暴罚长度给不出有用梯度作者的判断没有配实验9
回退到默认定义作者亲历 + 命名这个名字是作者起的;那个租赁协议案例是单一亲历11
60 亿 + 验证 ≈ 1750 亿微调有据书给了尾注15
两项对比研究的不同结论有据,而且书两边都摆了这种「证据是混杂的」的坦白值得记住16
那套自动算步质量的做法有据书给了尾注和四个基准数字17
步概率低于 0.7 就该剪作者给的经验线由乘积结构推出,但那个 0.7 是他定的18
思维树 4% vs 74%有据书给了尾注;但这是单个任务上的数字20
IRAC 把 70% 提到 81% 以上他引研究书说的是「研究已经表明」21
法律幻觉那组数字有据书给了那项研究的尾注23
编译器就是打分器有据的实例书给了尾注和等级分26
「代码执行是最实用的验证系统」作者的经验原文是「I have found」27
21000 CPU 天、1:11有据的工程数字书直接给出28
「可验证域会迁移到不可验证域」书自己标明是推测原文用的是「appears to transfer」和「if this transfer proves robust」,我们照实写30
「你看到的不是最先进,是最付得起的」作者的论断他给了围棋那个类比作为支撑31
按难度分配算力效率高 4 倍有据书给了尾注32
组合性墙有据的系统性现象书说它跨模型规模、跨数据量、跨技法都出现34

12. 边界与局限

  1. 过程打分器的损失函数我们只交付结构。 书给了完整的式子和一段实现配置, 我们交付的是「只在步边界计损、其余遮住」这个设计和它的理由
  2. 那些搜索算法我们只提名字。 书提到把树搜索和过程打分器结合起来, 但没有展开搜索本身,我们照它的详略处理。
  3. 形式化证明那条路的工具生态我们只给量级。 书点了几个证明库和服务的名字与规模, 属于会变的生态信息
  4. 金融推理那一段我们没有展开。 书讲了它是「定量严谨 + 定性判断 + 合规」的叠加, 以及过度自信和全是对冲两头都不可用——但没有给具体做法。
  5. 书里那个「让编码助手做推理训练」的部分,我们按全书口径不覆盖。
  6. 「可验证域的推理会迁移到不可验证域」这条,书自己就没写死。 如果它成立,这一章的价值会大得多;如果不成立,这一章的适用面就只限于那些有裁判的领域。 书没有给判断这件事的办法,我们也不猜。

13. 可带走的

  1. 2024 年秋天之后,推理从一个提示词技巧变成了一项可训练的能力;
  2. 「让我们一步一步地想」确实有效,而且不需要任何训练数据;
  3. 但它不可靠:模型可能早就定了答案,正在构造一套事后的正当化。 如果推理过程不影响答案,把它展示出来只是虚假的保证;
  4. 训出来的推理和诱导出来的不同:后者不持久,前者成为模型内部结构的一部分, 而且能被训成按特定顺序推理;
  5. 草稿纸的解释很物理:自回归结构下,最近几千个 token 就是它能反观的草稿纸; 把中间步骤写出来,等于换到了更多计算;
  6. 草稿纸可以隐藏,但用什么内容放草稿纸、什么放最终输出,要专门训;
  7. 给不给用户看推理是一条政策:展示建立信任、便于调试、满足监管; 隐藏保护方法、缩小攻击面;多数取中间路线,但★ 政策必须明确且一致;
  8. 准确率与链长是倒 U 形。 每步 95% 正确,十步剩 60%、二十步剩 36%; 对照第 15 章那组(每步 90%,十步剩 35%)——单步那 5 个百分点在十步后放大成 25 个;
  9. 写长骗分:模型学到「长 = 高奖励」,三步能解的题写十五步——那不是周全,是拖延;
  10. 粗暴地限制长度给不出有用的梯度;该做的是按题目难度分级给奖励;
  11. 写长骗分和过度思考是两件事:前者让它不学东西就拿奖励,后者实实在在让它变差;
  12. 写进思维链的东西抹不掉。 模型可以修正、可以否定,但无法让它消失;
  13. 最典型的失误是回退到默认定义:它用自己的默认定义, 替换掉合同/保单里明确约定的术语;每走一步都在冒这个险;
  14. 对策是给推理步设检查点:按清单逐项给分、周期性重新核对前提;
  15. 只看终点会奖励「错的理由得出对的答案」,也不会奖励「只在最后一步算错的链」;
  16. 逐步给分把功劳分到步上,而且能在一堆全错的链里挑出更接近对的那条;
  17. 光是「多生成几个再选一个」就很值钱:60 亿 + 验证匹敌 1750 亿微调,约等于 30 倍规模;
  18. 两项研究结论不同,书两边都摆了:容易的题上只看终点就够、还更省标注; 但只有逐步给分能保证「推理对」而不只是「答案对」,而且难题上它显著更好;
  19. 步级标注可以不用人做:从每一步往下采多条续写,「通向正确答案的比例」就是这一步的质量;
  20. 整条链的分是各步概率的乘积;★ 某一步低于 0.7 就该剪掉换路;
  21. 它的实现是一个 token 分类器,只在每步的最后一个 token 计损—— 这迫使它读完整步才判决;聚合可以取乘积,也可以★ 取最小值(看最弱那一环);
  22. 一条链走不通就同时展开好几条(思维树:分解器 + 生成器 + 评估器 + 搜索);
  23. 推理的形状随领域变:法律是四步(争点/规则/适用/结论), 把这个结构写进提示词能把某司法考试基准从约 70% 提到 81% 以上; 临床是「病史 → 鉴别诊断排序 → 假设检验 → 逐步更新」;
  24. 法律领域的幻觉率高得吓人:最好的模型在随机判例查询上也至少 58%, 而且模型无法预测自己什么时候在幻觉;
  25. 有些领域根本不需要打分器:编译器和证明检查器就是。 反馈环以计算的速度运行,而不是人的速度;
  26. 最实用的一条建议:把推理问题改写成编程问题—— 与其说「推理一下」,不如说「写一个函数来解」。测试套件就是奖励信号;
  27. 但形式化验证的代价是极端不对称的:验证吃 CPU、生成吃显卡, 一次步级证明器训练约 21000 CPU 天; ★ 而且在形式数学里,95% 正确的证明等于 100% 错误;
  28. 「可验证域练出来的推理会迁移到不可验证域」——这一章的源里, 书自己写的是「看起来会迁移」「如果这种迁移被证明是稳健的」 (appears to transfer / if this transfer proves robust), 这是推测不是定论;(第 20 章讲同一件事时另用了「早期证据显示」的措辞, 同样是条件式,见 20 §6。)
  29. 现在的天花板是经济,不是能力。 「你看到的不是最先进,是最付得起的」; 推理变便宜时预期会有不连续的能力跃迁;
  30. 按难度分配推理算力,比均匀多采样效率高约 4 倍; 小模型加足够的推理算力,能胜过大 14 倍的模型;
  31. 组合性墙:会做三步题,五步题就是不会——而加数据只在边缘有用。 它学到的不是「怎么证明一步」,是「三步的证明长什么样」;
  32. 撞墙时正确的做法是求救,不是继续训:模型负责开放的那一端, 工具负责「近似不可接受」的那一端

14. 原文地图

主题原书章原文位置
那个分水岭 · 从技巧到能力From Chain of Thought to Trained Reasoningtext/125-fm-from-chain-of-thought-to-trained-reasoning.txt:5(搜「Show your work」) · :7(搜「prompt-engineering trick to a trainable capability」)
草稿纸 · 诱导的不可靠 · 事后合理化From Chain of Thought to Trained Reasoningtext/126-fm-from-chain-of-thought-to-trained-reasoning.txt:9(搜「a sort of very short-term memory or scratchpad」) · :11(搜「let」) · :13(搜「post hoc justification」)
训出来的推理不一样 · 隐藏草稿纸Reasoning vs. Rationalizationtext/127-fm-reasoning-vs-rationalization.txt:5(搜「If you need the reasoning to be trustworthy」) · :7(搜「immutable internal structure」) · :21(搜「Scratchpad methods」) · :25(搜「repeating thoughts rather than advancing」)
披露政策 · 倒 U · 写长骗分 · 难度分级REASONING DISCLOSURE POLICYtext/128-fm-reasoning-disclosure-policy.txt:3(搜「reduces attack surface」) · :5(搜「summarized reasoning for users」) · :9(搜「inverted U-shaped curve」) · :11(搜「it is procrastinating」) · :13(搜「nasty, brutish, and short」) · :17(搜「difficulty-aware reweighting」)
写进链条抹不掉 · 回退到默认定义 · 检查点FROM THE TRENCHES: THE MOVING FINGER WRITEStext/129-fm-from-the-trenches-the-moving-finger-writes.txt:13(搜「it is there to stay」) · :15(搜「material breach」) · :17(搜「rubric learning」)
只看终点 vs 逐步给分 · 那 30 倍Rewarding the Journey, Not Just the Destinationtext/130-fm-rewarding-the-journey-not-just-the-destination.txt:7(搜「sparse and potentially misleading」) · :9(搜「30-fold increase in model size」) · :11(搜「credit assignment」) · :13(搜「which reasoning chains were better」)
两项对比研究 · 自动算步质量Rewarding the Journey, Not Just the Destinationtext/130-fm-rewarding-the-journey-not-just-the-destination.txt:15(搜「necessary for correct reasoning」) · :17(搜「800,000 step-level human labels」) · :83(搜「the fraction of continuations that reach the correct answer」)
乘积结构 · 0.7 那条线 · 实现 · 思维树 · 算力分配Rewarding the Journey, Not Just the Destinationtext/130-fm-rewarding-the-journey-not-just-the-destination.txt:93(搜「below 0.7」) · :99(搜「The label vocabulary is deliberately simple」) · :165(搜「Tree of Thoughts」) · :169(搜「deeper PRM-guided search」)
天花板是经济不是能力INFERENCE ECONOMICS AND THE WORLD OF TOMORROWtext/131-fm-inference-economics-and-the-world-of-tomorrow.txt:3(搜「an artificial ceiling」) · :7(搜「2,000 Elo」) · :9(搜「the state of the affordable」)
罕见的礼物 · 编译器就是打分器 · 迁移那条推测Trust but Verify: Learning from Verifiable Rewardtext/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:3(搜「unambiguous ground truth」) · :13(搜「proof of concept」) · :15(搜「appears to transfer」) · :21(搜「the compiler is the reward model」)
代码执行最实用 · CPU 与显卡的不对称FROM THE TRENCHES: CODE AS REASONING GROUND TRUTHtext/133-fm-from-the-trenches-code-as-reasoning-ground-truth.txt:3(搜「the most practical verification system」) · :17(搜「21,000 CPU-days」) · :19(搜「Transfer from formal to informal」)
IRAC · 法律的三个难点 · 幻觉率 · 临床推理Domain-Specific Reasoningtext/134-fm-domain-specific-reasoning.txt:7(搜「issue, rule, application, conclusion」) · :9(搜「distinguished」) · :13(搜「at least 58 percent」) · :19(搜「differential diagnosis」) · :21(搜「the thought process that led there」)
组合性墙 · 求救 · 混合架构 · 推理税The Limits of Neural Reasoningtext/135-fm-the-limits-of-neural-reasoning.txt:7(搜「systematic limitations」) · :9(搜「does not eliminate the compositionality gap」) · :15(搜「counting letters」) · :19(搜「approximation is unacceptable」) · :29(搜「reasoning tax」)
推理是前面所有技法的顶点Summarytext/136-fm-summary.txt:3(搜「the culmination of those techniques」)

Footnotes

  1. 出处:「From Chain of Thought to Trained Reasoning」第 5 段(text/125-fm-from-chain-of-thought-to-trained-reasoning.txt:5,搜「Show your work」)与第 7 段(text/125-fm-from-chain-of-thought-to-trained-reasoning.txt:7,搜「prompt-engineering trick to a trainable capability」)。第 7 段还点了现代做法的三条路径:给中间步骤打分的过程奖励模型、验证程序、以及领域方法论——那正是这一章第 6、8、7 节。 2 3

  2. 出处:「From Chain of Thought to Trained Reasoning」第 11 段(text/126-fm-from-chain-of-thought-to-trained-reasoning.txt:11,搜「let」)与第 13 段(text/126-fm-from-chain-of-thought-to-trained-reasoning.txt:13,搜「post hoc justification」)。第 11 段说这个技巧「以它的简单程度而言效果好得惊人」,而且不需要训练数据;第 13 段那句最重的话是:模型产出的推理,可能并不反映它的计算;而这种失败模式——推理沦为合理化而不是发现——削弱了「把推理暴露出来能提供可解释性」的那个理由。书给了那篇原始论文的尾注。 2 3 4

  3. 出处:「Reasoning vs. Rationalization」第 5 段(text/127-fm-reasoning-vs-rationalization.txt:5,搜「If you need the reasoning to be trustworthy」)与第 7 段(text/127-fm-reasoning-vs-rationalization.txt:7,搜「immutable internal structure」)。第 5 段那句机制是:模型不只是被要求去推理,而是它的内部奖励结构被训成了给推理赋予价值——因为它学到了有效的推理导向正确答案。 2

  4. 出处:「From Chain of Thought to Trained Reasoning」第 9 段(text/126-fm-from-chain-of-thought-to-trained-reasoning.txt:9,搜「a sort of very short-term memory or scratchpad」)。第 7 段(text/126-fm-from-chain-of-thought-to-trained-reasoning.txt:7,搜「jealously guard it for ourselves」)是书明确回避哲学争论的地方:我们不需要相信「LLM 推理时发生了某种类人的心理过程」,就能理解推理为什么有用。 2

  5. 出处:「Reasoning vs. Rationalization」第 21 段(text/127-fm-reasoning-vs-rationalization.txt:21,搜「Scratchpad methods」)与第 25 段(text/127-fm-reasoning-vs-rationalization.txt:25,搜「repeating thoughts rather than advancing」)。第 21 段列的那三种「不适合出现在用户面前」的探索是:考虑并否决假设、做之后会被修正的粗略计算、走之后会被放弃的死胡同。 2

  6. 出处:「REASONING DISCLOSURE POLICY」第 3 段(text/128-fm-reasoning-disclosure-policy.txt:3,搜「reduces attack surface」)与第 5 段(text/128-fm-reasoning-disclosure-policy.txt:5,搜「summarized reasoning for users」)。第 5 段那句关于一致性的原话是:那些有时看得见推理、有时看不见的用户,会觉得这种不一致让人不安。 2

  7. 出处:「REASONING DISCLOSURE POLICY」第 9 段(text/128-fm-reasoning-disclosure-policy.txt:9,搜「inverted U-shaped curve」)。原文明说机制是误差累积:每一步都引入一个出错的概率,而单个错误可以把后面整条链带偏。 那两组数(十步 95% 正确剩 60%、二十步剩 36%)是书里给的;和第 15 章那组一样,它假设各步独立。 2 3

  8. 出处:「REASONING DISCLOSURE POLICY」第 11 段(text/128-fm-reasoning-disclosure-policy.txt:11,搜「it is procrastinating」)。原文给了这个现象的成因:训练里复杂问题往往是重点,而复杂问题需要更长的推理,于是模型学到「更长 = 更高奖励」这条相关性。 结果是浪费的 token 和累积的误差风险 2

  9. 出处:「REASONING DISCLOSURE POLICY」第 13 段(text/128-fm-reasoning-disclosure-policy.txt:13,搜「nasty, brutish, and short」)与第 17 段(text/128-fm-reasoning-disclosure-policy.txt:17,搜「difficulty-aware reweighting」)。那句「肮脏、粗野而短促」是作者对霍布斯那句名言的化用,用来形容粗暴截断的做法。第 17 段那个区分很要紧:写长骗分让模型不学任何东西就拿到奖励;而过度思考因为误差累积,实实在在地让模型表现变差。 2 3 4

  10. 出处:「FROM THE TRENCHES: THE MOVING FINGER WRITES」第 13 段(text/129-fm-from-the-trenches-the-moving-finger-writes.txt:13,搜「it is there to stay」)。这一节以一首 11 世纪波斯四行诗开头(第 5 至 11 段),书说它同样可以被用来写思维链推理。那句按语的原文是:模型可以修正、可以否定自己过去的推理,但它永远无法让那些内容消失——这是语言模型自回归结构的一个后果。 2

  11. 出处:「FROM THE TRENCHES: THE MOVING FINGER WRITES」第 15 段(text/129-fm-from-the-trenches-the-moving-finger-writes.txt:15,搜「material breach」)。「回退到默认定义」这个名字是作者起的,他在第 13 段给出定义,在第 15 段给了那个租赁协议的亲历案例。原文那句最要紧的是:模型有它自己的默认定义,而且只要这些术语在任何一个阶段被重新引入,它就会偏好自己那个。 2 3

  12. 出处:「FROM THE TRENCHES: THE MOVING FINGER WRITES」第 17 段(text/129-fm-from-the-trenches-the-moving-finger-writes.txt:17,搜「rubric learning」)。原文明说给推理步设检查点没有普适的配方,而按清单给分是一个有意思的做法——奖励基于模型产出的文字符合一张要求清单的程度;它特别适合那种「既要留自由度、又要逐项打勾」的任务。

  13. 出处:「Rewarding the Journey, Not Just the Destination」第 7 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:7,搜「sparse and potentially misleading」)。原文那两条毛病是:一个通过有缺陷的推理到达正确答案的模型,拿到和推理正确的模型一样的奖励;而一个推理到最后一步才算错的模型,得不到任何奖励。

  14. 出处:「Rewarding the Journey, Not Just the Destination」第 11 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:11,搜「credit assignment」)与第 13 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:13,搜「which reasoning chains were better」)。第 13 段那条「在一堆全错的答案里也能识别出哪条推理链更好」,是过程奖励相对结果奖励最独特的一项能力;书同时点明它的代价是标注成本

  15. 出处:「Rewarding the Journey, Not Just the Destination」第 9 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:9,搜「30-fold increase in model size」)。书给了那项工作的尾注。做法是:训一个单独的验证模型给候选解法打分,再从一批候选里选分最高的那个。 2

  16. 出处:「Rewarding the Journey, Not Just the Destination」第 15 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:15,搜「necessary for correct reasoning」)与第 17 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:17,搜「800,000 step-level human labels」)。两项工作书都给了尾注。第 15 段那句「只看终点的监督允许模型通过有缺陷的推理到达正确答案,而这样的模型会在新题上以不可预测的方式失败」,是这一节最该记住的理由。 2 3 4

  17. 出处:「Rewarding the Journey, Not Just the Destination」第 83 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:83,搜「the fraction of continuations that reach the correct answer」)。书给了这项工作的尾注,并说它是最实用的自动化做法。那四个基准数字(小学数学 77.9→84.1,重排 89.1;竞赛数学 28.6→33.0,重排 43.5)是书里给的,底座是一个 70 亿参数模型。 2 3

  18. 出处:「Rewarding the Journey, Not Just the Destination」第 93 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:93,搜「below 0.7」)。那个 0.7 是书给的经验线;同段的原话是:如果过程打分器给某一步的概率低于 0.7,复合概率已经在快速恶化。 那个乘积公式在第 89 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:89,搜「rPRM」)。 2

  19. 出处:「Rewarding the Journey, Not Just the Destination」第 99 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:99,搜「The label vocabulary is deliberately simple」)。原文还提到那个被多数实现并掉的中性类别:技术上正确、但没有推进解题的步骤。「只在步边界计损、其余遮住」以及「取乘积或取最小值」的做法见第 95 至 97 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:95,搜「token classifier」)。 2

  20. 出处:「Rewarding the Journey, Not Just the Destination」第 165 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:165,搜「Tree of Thoughts」)。书给了尾注,并列了四个部件。那组 4% 对 74% 的对照是某个特定数字游戏任务上的数字,不是通用结论。 2 3

  21. 出处:「Domain-Specific Reasoning」第 7 段(text/134-fm-domain-specific-reasoning.txt:7,搜「issue, rule, application, conclusion」)。原文说这个结构之所以有效,是因为它自然地对应法律分析推进的方式:识别法律问题、陈述适用规则、把规则适用到事实、得出结论;而那个基准是基于日本司法考试的。 2

  22. 出处:「Domain-Specific Reasoning」第 9 段(text/134-fm-domain-specific-reasoning.txt:9,搜「distinguished」)。原文:很大一部分上诉诉讼争的正是某个权威是否应当被「区别对待」,而这种对抗性让法律推理与数学推理有根本的不同。第 15 段(text/134-fm-domain-specific-reasoning.txt:15,搜「structural challenge for legal reasoning」)还列了三维难点:时间意识(法律会变)、管辖权特定、以及先例的动态(是否被推翻、区分或限缩)。

  23. 出处:「Domain-Specific Reasoning」第 13 段(text/134-fm-domain-specific-reasoning.txt:13,搜「at least 58 percent」)。书给了那项研究的尾注。第 13 段(text/134-fm-domain-specific-reasoning.txt:13,搜「was not an isolated incident」)提到了那起著名的「律师提交编造判例」案件。那句「模型无法预测自己何时在幻觉」是这组数字里最要命的一条。 2

  24. 出处:「Domain-Specific Reasoning」第 19 段(text/134-fm-domain-specific-reasoning.txt:19,搜「differential diagnosis」)与第 21 段(text/134-fm-domain-specific-reasoning.txt:21,搜「the thought process that led there」)。第 21 段那条对训练数据的要求,正是第 14 章那条「专家真正贡献的是判断而不是答案」在推理这一侧的形态。第 21 段(text/134-fm-domain-specific-reasoning.txt:21,搜「online medical」)还提醒:网上医疗问答数据的质量可疑。

  25. 出处:「Trust but Verify: Learning from Verifiable Reward」第 3 段(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:3,搜「unambiguous ground truth」)。原文那句「反馈环以计算的速度运行,而不是以人的速度」是这一节和前面所有章节的分界。

  26. 出处:「Trust but Verify: Learning from Verifiable Reward」第 21 段(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:21,搜「the compiler is the reward model」)。书给了尾注。做法是:模型生成候选解法,编译器拿一整套单元测试跑它,一个 0/1 的二值奖励喂回第 09 章那个组内相对的训练循环;结果是竞赛编程等级分 2029,超过 96.3% 的人类选手。第 23 段(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:23,搜「self-debugging」)还提到自调试循环:执行失败 → 读错误 → 修 → 重试。 2

  27. 出处:「FROM THE TRENCHES: CODE AS REASONING GROUND TRUTH」第 3 段(text/133-fm-from-the-trenches-code-as-reasoning-ground-truth.txt:3,搜「the most practical verification system」)。原文的措辞是「I have found」——这是作者本人的经验。第 5 段(text/133-fm-from-the-trenches-code-as-reasoning-ground-truth.txt:5,搜「muffin」)还给了一个有意思的延伸:连一份松饼配方也能被形式化(定义好什么是好数据 + 一个迷你的领域专用语言)。 2

  28. 出处:「FROM THE TRENCHES: CODE AS REASONING GROUND TRUTH」第 17 段(text/133-fm-from-the-trenches-code-as-reasoning-ground-truth.txt:17,搜「21,000 CPU-days」)。原文给的根因是:验证是 CPU 密集的,而模型生成是显卡密集的;瓶颈还包括证明库的加载初始化和策略展开。那句「在形式数学里,95% 正确的证明等于 100% 错误」也在这一段,书称之为「最后一英里问题」。 2 3

  29. 出处:「Trust but Verify: Learning from Verifiable Reward」第 13 段(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:13,搜「proof of concept」)。原文明说那种以算力换能力的做法在当前对常规应用是不切实际的,并给了那道最难题目的算力代价(两到三天、几百个 TPU 天)。

  30. 出处:「Trust but Verify: Learning from Verifiable Reward」第 15 段(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:15,搜「appears to transfer」)。书用的措辞是「appears to transfer」和「If this transfer proves robust across domains」——都是条件式的、未定的。 第 19 段(text/133-fm-from-the-trenches-code-as-reasoning-ground-truth.txt:19,搜「Transfer from formal to informal」)给了一个更具体的说法:从形式到非形式的迁移不完美但显著;而且在推理时拿形式化当过滤器,能给竞赛数学准确率带来约 8 个百分点的提升。 2

  31. 出处:「INFERENCE ECONOMICS AND THE WORLD OF TOMORROW」第 3 段(text/131-fm-inference-economics-and-the-world-of-tomorrow.txt:3,搜「an artificial ceiling」)、第 7 段(text/131-fm-inference-economics-and-the-world-of-tomorrow.txt:7,搜「2,000 Elo」)与第 9 段(text/131-fm-inference-economics-and-the-world-of-tomorrow.txt:9,搜「the state of the affordable」)。第 5 段(text/131-fm-inference-economics-and-the-world-of-tomorrow.txt:5,搜「predispositional」)还讲了这个约束的两种实现:预设几档推理长度让用户在调用时选,以及 2025 年底出现的、允许用户当场把推理截断的做法。 2 3 4

  32. 出处:「Rewarding the Journey, Not Just the Destination」第 169 段(text/130-fm-rewarding-the-journey-not-just-the-destination.txt:169,搜「deeper PRM-guided search」)。书给了那项研究的尾注,并说按题目自适应分配算力比均匀的多采样效率高约 4 倍;在算力持平的比较下,小模型加上足够的推理时算力能胜过一个大 14 倍的模型;结论是推理时算力与预训练算力在一定程度上可以互换 2 3

  33. 出处:「The Limits of Neural Reasoning」第 29 段(text/135-fm-the-limits-of-neural-reasoning.txt:29,搜「reasoning tax」)。原文还提到两条对策:按查询复杂度决定要不要深思的混合推理,以及按难度把请求路由到不同模型。 同段还再次提到了推理模型的可复现性问题。

  34. 出处:「The Limits of Neural Reasoning」第 7 段(text/135-fm-the-limits-of-neural-reasoning.txt:7,搜「systematic limitations」)与第 9 段(text/135-fm-the-limits-of-neural-reasoning.txt:9,搜「does not eliminate the compositionality gap」)。第 9 段那句最硬:模型看起来学到的是「与它训练样例相同长度和复杂度的模式」,而不是学到底下那条规则;同样的局限跨模型规模、跨训练数据量、跨训练技法都出现。 2 3

  35. 出处:「The Limits of Neural Reasoning」第 15 段(text/135-fm-the-limits-of-neural-reasoning.txt:15,搜「counting letters」)。原文那个例子是数一个单词里某个字母出现几次——切词方式让它变得不平凡,而一行代码就能轻松给出正确结果;同段还提到知识检索的类似困难。

  36. 出处:「The Limits of Neural Reasoning」第 19 段(text/135-fm-the-limits-of-neural-reasoning.txt:19,搜「approximation is unacceptable」)。原文那条分工写得很清楚:模型处理推理里开放的那些方面——理解问题陈述、拆解复杂问题、识别哪些工具相关、把结果综合成连贯的结论;而工具处理那些「可靠性要紧、近似不可接受」的方面。 第 23 至 25 段(text/135-fm-the-limits-of-neural-reasoning.txt:23,搜「neurosymbolic」)还提了两条前沿方向:神经符号结合,以及面向组合性的架构创新(变量绑定、结构化记忆、模块化)。「工具是肌肉、推理是大脑」那句见第 15 章引的「Summary」第 3 段(text/124-fm-summary.txt:3,搜「reasoning is the」);而这一章末尾那句「推理技法是前面所有技法的顶点」见「Summary」第 3 段(text/136-fm-summary.txt:3,搜「the culmination of those techniques」)。