跳到主要内容

让它想得更深 — 从思维链到推理模型

这一章讲三件事: 为什么「让它一步步想」这种看起来像是话术的东西真的有效; 「多试几次再挑」这条朴素思路怎么一路加码成树搜索和逐步打分; 以及 2024 年之后,「回答前多花计算」怎么从提示技巧变成了可以训练、可以售卖的产品参数。

它在全书链条里的位置:第 06 章讲的是把模型塑成「会合作的助手」, 这一章讲的是把它推向「能解难题的思考者」。 第 11 章讲智能体时,推理模型会作为「内核的一个可选档位」再次出现。

顶层全景:一条逐级加码的链

模型在复杂题上「一步走岔、整链失败」

① 先把任务说清楚 角色、例子、格式、怀疑 §1 §2
│ (做不好这一步,后面全白搭)

② 把中间步骤写出来 思维链 §3
│ (写出来了也不一定算得对 §4)

③ 多打几张草稿 采样 20 条投票、带剪枝的树 §5

④ 让评分介入每一步 整篇打分 → 逐步打分 §6

⑤ 回答前先想一会儿 几百词元 → 几万词元 §7

⑥ 把「会想」训进模型 初始化 + 奖励 + 搜索 + 学习 §8

└─ 怎么知道它真的会想了? → 评测的尺子 §10

图说: 这六环不是六个孤立技巧,而是同一个问题的六次回答—— 计算该花在什么时候、花在哪儿。 越往下走,花的计算越多,换来的准确率越高,答案也越贵。

1. 先把任务说清楚:一个失败的提示怎么被改到能交活

要让模型把活做对,第一步往往落在你这边,而不在模型那边1提示工程——名字唬人,解决的事却很朴素:怎么把任务说清楚。 这一层做不扎实,后面所有的思维链、检索、工具调用都没有可靠起点—— 模型连任务都听岔了,再花哨的系统设计也救不回来。

体会它最好的方式,是看一个提示怎样从「没法用」被一步步改到「能交活」2。 书里用的例子:你手里有一份几十页的供应商合同,顺手敲下「帮我看看这份合同有没有问题」。 模型很快回来一大段:本合同包含付款、保密、违约、续约等条款,建议逐条仔细阅读…… 话不算错,却几乎没用——既没说清风险在哪,也没法直接拿去改合同。 毛病不在模型不会读合同,而在你没说清「有没有问题」对你究竟意味着什么3

接下来每修一处,输出就清晰一截:

第一修:把角色和目标说明白。 换成「你是有十年经验的企业法务,请找出这份合同里付款、违约、数据处理和续约条款中的高风险点」, 它的注意力立刻收拢到该看的地方。 角色和目标越具体,输出越聚焦——这比任何「请认真一点」的客套都管用4

第二修:给一两个例子。 它对「高风险点」的理解未必和你一致。示范一条「某条款写了什么、为什么算风险、该怎么改」, 它就能照着模仿。任务越具体,一两个好例子往往比一大段抽象指令更顶用5—— 这就是第 03 章讲过的上下文学习在干活。

第三修:把输出格式约束住。 每个风险点都给出原文位置、风险解释、建议动作,证据不足时老实写「需人工确认」。 这么一改,它就在按一份可检查的清单干活,不再泛泛作答。 如果结果要接进程序,结构化输出(按规定的栏目、类型、可选值给出机器可读的答案, 比如一张固定列名的表)更是硬要求。

每个字段(结构化数据里的一个固定栏目,比如「风险等级」这一栏)叫什么、 是什么类型、缺失信息怎么表示,都得讲明白6

第四修:需要分情况的子问题,让它先一步步分析再下结论。 这正是 §3 要展开的思维链。

第五修,也是最后一修:保持怀疑。 无论提示打磨得多顺,关键条款你都得自己交叉核对—— 别把模型自信的语气当成证据。涉及法律、医疗、金融和关键事实时, 幻觉的代价可能很重,怀疑这一步省不得7

把这一路改动收起来,写好提示其实就五件事: 说清角色与目标、给好例子、必要时让它分步思考、约束输出格式、对结果保持怀疑8。 2025 年前后,这几条被推向一个更统一的理解:提示更像人与模型之间的一份临时接口、 一份小型任务说明书,而不是一句随口的请求—— 写得越像接口,模型越容易稳定执行,后续也越容易验证和复用9

2. 挑模型、拆流程、避坑

提示写得再好,模型选错了也白费。 书里那句吐槽很形象:用顶级推理模型写菜谱,就像开法拉利买菜—— 既贵,也浪费了它在别处的本事10。 对话和简单问答这一档最宽容,随便一个主流免费版都够用; 差别在任务真正要「动脑筋」时才显出来:一道连锁推理的数学题、 一个跨越数百行代码的 bug、一份要找漏洞的复杂合同。 书里给的经验很实操:如果你过去一个月里在某种问题上反复和 AI 磨过几次, 那就值得考虑推理模型11。 总结成一句:先看任务最难的那一步需要什么,再按那一步的要求挑模型—— 既不要把最贵的当默认,也别省到用不够用的12

对复杂任务,不要指望一个提示词(你发给模型的那段指令文字的俗称)搞定一切。 把任务拆成多个步骤,每步用合适的模型,比单提示词效果好得多: 每一步都有明确目标和检查点(一步做完可以核对「这一步成了没有」的位置),错了能定位到具体环节回头修, 省得对着一份糟糕的最终输出却不知道哪里出了问题。 以写一篇分析报告为例:列大纲(强模型)、搜集资料(检索增强)、 起草内容(快模型)、评审修改(另一个模型换视角审稿)、人工润色(人定稿)—— 大纲和评审用强模型、起草用快模型,组合起来既省钱又稳13

最后是几个新手反复栽跟头的坑,书里点得很准14: 盲信权威式回答(答得越自信越要警惕); 让它做不擅长的事(精确数值计算、实时信息、没有工具就硬扛极长推理); 忽略上下文(早前对话一旦被压缩它就可能「忘事」); 过度依赖(最后拍板的应该是你,高风险场景里这条尤其要记牢)。

3. 思维链:加一句「一步步想」为什么有用

模型有一个有趣的现象:被鼓励一步步思考时,它解题更准。 这个做法叫思维链——不直接要答案,而是让它把解题的中间步骤一步步写出来, 再给出结论15

书里的小例子一看就懂。问:「小明有 5 个苹果,吃了 2 个,又买来 3 个, 还分给朋友 1 个,现在有几个?」直接让它答,它可能蒙一个数字(还蒙错了)。 加一句「让我们一步一步思考」,它会输出: 「小明原来 5 个。吃掉 2 个剩 3 个。买来 3 个变成 6 个。分出 1 个剩 5 个。答案是 5。」 ——正确率立刻上升16

它表面上是个提示技巧,背后藏着两层机制,这一节值得慢读17

第一层:计算重新分配。 模型处理每个词元只有一次固定的计算预算——前向传播(输入从网络这头流到那头、完整走完一遍、产生输出的过程)只有一遍。 直接要答案,相当于把整个问题的计算都压在最后一个词元上——对复杂问题,这点预算不够。 让它先写中间步骤,相当于把计算摊开到几十个词元上, 每个中间步骤都享受一次完整的前向计算,整体预算翻了好几倍。 这是它在数学题上效果好的最直接原因。

第二层:显式中间状态。 模型不善于在内部隐式保持复杂状态(比如「算到一半还没写出来的中间结果」), 但很善于读取自己写过的文本。把中间状态写出来, 它下一步看到的就是白纸黑字的「已经算好的 3」, 而不是「内部某串数字里大概是 3 的东西」18。 这就是为什么它在多步算术、逻辑链、代码追踪上特别有效—— 这些任务都需要稳定的中间状态。

实现上有三种常见形式:只在末尾加引导句的(最便宜但效果常不稳)、 给几个「问题 + 分步解答」示例让它模仿的(效果好但要造例子)、 让模型自己先生成示例推理过程再拿来用的(介于两者之间)19

但有一句警告必须放在这里:模型写出来的「思考过程」, 不一定等于它内部真实的计算过程——有时更像事后解释。 它有用,但不是给模型大脑做 CT。 你不能因为它写出一段漂亮的推理,就断定它内部确实走了这条路20。 这句话到 §7 讲长思维链、到第 17 章讲可解释性时,都会一再回来。

4. 思维链的边界:写得像在算,不保证算得对

思维链不是万能药。它在多步推理上提升显著,但对真正的精确计算帮助有限。 让它算一个 12 位数字乘法,即使一步步算,也可能在中间某一步把进位算错; 让它统计一段长文本里某个字母出现的次数,也常常数错21

这个局限来自范式本身:模型学会的是生成像真实文本的序列,不是执行精确算术。 它能从语言数据里归纳出大致正确的数学模式, 但逐词生成天然带噪声,要求每一步都精准时就露出短板。 书里一句话钉死了这个边界:思维链让模型写得像在算,写得像却不保证算得对22

更可靠的办法是让它调用计算器工具——这和人类一样,复杂算数用计算器,不靠心算。 这条思路是第 12 章工具调用的先声。

5. 多打几张草稿:投票与树

思维链让模型沿一条链给出答案,但单条链不一定走得对。 如果让它多走几条路,把结果对比一下,准确率能不能再提? 这就是多路径推理23

最直接的一招:多采几条,投票。 对同一个问题,让模型用较高的温度(控制生成随机性的旋钮,调高更发散、调低更保守) 采样多条独立的思维链(比如 20 条),每条给出一个最终答案; 然后投票,选出现频率最高的那个24。 这看似不讲道理,效果却出乎意料地好:在几个数学推理基准上, 能在思维链的基础上再提升 5 到 15 个百分点25

直觉解释是:复杂问题有许多种推理路径,单条路径走错的概率不小, 但走错的路径各自错得不一样,走对的路径却往往收敛(越来越聚拢、 最后停在同一个值上)到同一个答案——多数票天然把噪声路径过滤掉。

代价同样直白:计算成本线性增长,采样 20 次就要花 20 倍词元26

投票的局限是:每条路径必须独立、完整地走到底,中间无法调整。 于是有人把推理过程展开成一棵显式的树: 每一步生成几个「下一步思路」候选,对每个候选评估价值, 再选最有希望的几条往下走——这就是把搜索(先撒网再收窄的找法)引入推理

这棵树是带剪枝(把没希望的分支整枝砍掉、不再往下走)的: 评估价值低的分支不再浪费计算。

这种做法在论文里叫思维树27,读者翻文献会撞见这个名字。 它在需要回溯和重新选择的任务上(数学证明、24 点游戏、创意写作) 效果显著优于单链;代价是搜索代价指数增长,树的深度和宽度都要权衡28

6. 让评分介入每一步:从整篇打分到逐步剪枝

投票要求多条路径走完后能算出可比较的最终答案—— 这在数学题里成立(答案是一个数),在开放问题里就难成立(怎么对两段文字投票?)。 另一条路是让评分器来挑。

整篇打分:采样 N 条,裁判挑最好的。 让模型采样 N 条独立完整的回答,再用一个独立的奖励模型给每条打分, 选分数最高的那条作为最终输出29。 好处是:只要评分器比生成器更准,采样数一上去,准确率就能持续提升—— 在数学和代码这类可验证任务上,N 取 64 或 256, 常常能把单次通过率推到接近「N 次里至少对一次」的上限。 弱点是依赖评分器质量:如果奖励模型本身有偏差,采样越多反而越往坏方向偏—— 第 06 章讲的奖励作弊,在推断时同样成立30

逐步打分:让评分介入每一步。 如果评分器能对推理的每一步打分(就是第 06 章 §8 讲过的过程奖励), 搜索就可以更细粒度地剪枝:每生成一步就打一次分, 只保留最好的几个候选继续扩展,其余剪掉。 这种逐步引导的搜索,把预算花在更有希望的分支上, 相比平均采样,能用更少的总词元取得更高的准确率31。 有研究在数学基准上验证过:逐步打分选答案比纯投票高几个百分点; 把它用在每一步的搜索上,固定算力下能比整篇打分做到更高的准确率32

把这几招排成一条线,能看出同一根轴:评分粒度越来越细—— 从事后投票,到事后挑选,到逐步剪枝,再到主动展开树。 每往前走一步,搜索更精细,代价也更高33

工业部署里还有一层权衡:采样越多、搜索越深,准确率上升, 但前几次采样带来明显提升,再往后边际收益递减。 于是出现了几种「聪明搜索」: 用草稿模型先快速生成候选、再用主模型仔细验证; 对简单问题少采样、对难题多采样; 让模型自己估计「这道题需要多想吗」,再决定是否进入更深搜索。 共同思路是一句话:不同的词元,不该花同样多的计算34。 这个观点后来直接进入推理模型的训练——把「什么时候该多想」也变成训练目标。

7. 测试时扩展与长思维链:回答前多花计算

传统观点认为「训得大就变强」——变强靠第 05 章那条训练时的规模法则。 2024 年之后,另一个方向突然成了前沿竞争的主线: 测试时让模型花更多算力,也能变强。 这里的「测试时」不指测试集,而指模型已经训练好、正在回答问题的那个阶段35

最直观的早期代表是两个 2024–2025 年的模型系列: 它们把更多计算花在回答前的内部求解过程中,再给出最终答案—— 用户看到的是一个简洁答案,背后却可能消耗了大量隐藏的推理计算: 拆解问题、比较路径、检查中间结果,再生成回答36。 书里有张图的对比很好记:普通推断像一次交卷,顺着最可能的路径往前写; 测试时扩展像考试时多打几张草稿纸,先拆题、尝试、检查,再把最可靠的答案交出来37规模法则从此有了新维度:不只是训练时扩大,测试时也能扩展38

这一代推理模型有一个明显特征:它们的思维链很长。 普通思维链几百个词元就结束;推理模型的内部思维链常常上万词元, 包含拆题、尝试、回溯、自我质疑、改写、重新尝试等多轮内部对话—— 这背后是模型在内部经历了一种近乎人类「想了很久」的过程,并非单纯把话写得更长39

长思维链带来三个明显改变40:

  1. 回溯能力变强。 传统思维链一旦走错就一路错下去; 长思维链允许它中途意识到「这条路不对」,回到岔口换条路。
  2. 自我质疑变成常规动作。 它会主动写出「等等,让我检查一下」 「这一步好像不对」之类的内部反思,再决定是否调整。
  3. 推理可以根据难度伸缩。 简单问题几百词就完,难题可以想几千词——预算自适应。

三点合起来,让推理模型在数学竞赛、编程比赛、抽象推理这些基准上 显著超过许多普通对话模型。 但书里特意提醒:最好不要只记某个百分比——模型版本、采样预算、 工具设置和评测口径都会影响数字; 更稳定的结论是,许多原本区分度很高的竞赛题和代码任务, 开始被头部(排在最前面的那几家)推理模型部分攻克41

代价是推断成本飙升。一个普通问答可能消耗几百到几千词元, 一道难数学题可能消耗几万到几十万词元的内部思维链。 这把推断成本的分布从「均匀」拉成「长尾」:简单问题便宜得不变,难题贵几个数量级42。 产品设计因此也变了:推理模型被定位为「难题专用」,简单对话仍交给普通模型。

8. 推理模型怎么训:四大组件

前面几节讨论的都是「如何让一个已训好的模型多想一会儿」。 这一节回到训练阶段:怎么把「会想」这件事直接训进模型。 书里把这条流水线归纳成四大组件43:

组件干什么
策略初始化给模型一个会做基本推理的起点
奖励设计告诉模型「什么样的思考路径是好的」
搜索训练时和测试时都用,生成高质量的解
学习把搜索找到的好解写回模型参数

组件一:策略初始化。 强化学习一个非常实际的问题是冷启动(刚开始时什么都不会、 连探索的方向都没有的状态):一个完全不会思考的模型, 即便有再好的奖励信号,也很难自己摸索出「长思维链该长什么样」。 所以训练几乎都从一个已经会做基本推理的起点出发,起点有三条路: 拿一个已对齐的对话模型直接当起点(最激进的一例:完全不经微调引导,直接在基座上做大规模强化学习); 先用一批高质量的「问题 + 长思维链 + 答案」数据做监督微调(用成对的「题目 + 标准答案」继续训练,第 06 章讲的指令微调就是它的一种),把格式、节奏、自我反思的习惯学起来; 或者用一个已经会长思考的强模型给问题生成长解答,过滤后当训练数据—— 第三条路能把推理能力「下放」到小模型上,成本低得多44

数据本身的关键不在数量,而在推理过程的真实性和多样性: 如果所有思维链都按同一种模板走(先列条件、再分情况、再得结论), 模型容易停在表面格式这一层,真正的推理能力练不出来。 好的数据集会刻意保留各种「走弯路、又改正」的轨迹—— 让模型学会的不只是「一次成功的推理」,还有「失败后怎么回头」45。 书里还记了一笔:专家手写推理数据质量最高但极贵,一道题的标注成本可能上千美元。

组件二:奖励设计。 三种奖励的取舍,第 06 章 §8 已经讲过骨架,这里补全视角: 结果奖励只在最后给分(答案对就 +1,错就 −1),最便宜、几乎零标注成本, 但信号稀疏——一条长链侥幸对了、中间乱七八糟,坏路径也会被强化下去; 过程奖励在每一步上打分,信号密、可解释, 但它本身需要训练,而且一旦被长期优化,模型会学会生成「裁判喜欢但实际不正确」的中间步骤; 可验证奖励直接用程序检查答案对错或测试是否通过,比主观打分更稳定、 更难被绕过去,缺点是只能用在可验证任务上,对开放任务无能为力46。 实际系统里三种常常结合使用:开放任务用过程奖励加少量人类偏好, 可验证任务直接用规则奖励,结果奖励用作最终一致性检查47

组件三:搜索——训练和测试时各用一次。 训练时,模型要面对很多它当前未必会解的难题; 如果每次只采样一两个回答,大概率都是错的,训练信号几乎不可用。 引入搜索后,对每道题采样很多次(组内方法通常一组 8 到 64 个), 过滤出真正正确的轨迹,再把这些「高质量解」回喂给模型—— 这等价于用算力换数据:把「模型本来不会」的题, 变成「现在有正确轨迹可学」的题48。 测试时,训练完成的模型仍然可以再搜索一次: 多采样投票、裁判挑选、树搜索; 而最新一代推理模型倾向于在单条很长的思维链里完成所有探索和回溯—— 搜索没有消失,只是从外部循环变成了内部的词元预算49

书里引了一份综述的判断,值得原样记住: 推理模型的能力提升,本质上来自训练时搜索和测试时搜索这两条曲线的协同放大—— 训练阶段用搜索把好策略写进模型,测试阶段再用搜索把模型推到更高表现; 任一边单独放大都会很快遇到边际收益递减50。 这和传统的「参数 × 数据」两条轴形成对照,推理模型的扩展是「训练时搜索 × 测试时搜索」两条新轴。

组件四:学习——把搜索结果写回参数。 两条路: 直接把搜到的正确轨迹当训练数据做监督学习(快、稳、便宜, 但能学到的上限就是搜索数据的上限——搜索中没出现过的策略,模型学不会); 或者用强化学习,让模型在线和奖励信号交互, 不只学「已经搜出来的好解」,还学「在没见过的题上自己摸索」的能力51。 第 06 章 §10 讲过的组内相对优势在这里被反复验证: 它的成功说明,在大规模可验证强化学习上,那个和策略模型同尺寸的价值网络并不是必要组件52

这一层还有一个微妙问题:如果模型一开始已经会一种「还算可以」的解法, 它倾向于沿用,新路径几乎不会被采样到,训练就陷在局部最优 (一个看起来不错、但其实不是最好的位置,小步走不出去)。 常见对策:调高采样温度增加多样性、 用(衡量输出分布有多分散的刻度,越分散熵越高)正则化惩罚分布过于尖锐、 刻意构造「需要回溯才能解」的训练题、用课程学习让能力分层积累53

把四大组件合起来看,书里有一句很好的对照: 对齐塑形的是「更礼貌的回答」,推理训练塑形的是「更深入的思考」。 当「想得深」变成可优化目标,思维链就从「偶尔有效的提示」变成「模型内嵌行为」54

9. 从一款模型到群雄并起

理解了训练框架,再看产品和发布层面发生了什么。 书里不追版本号,只抓一条稳定的脉络:从 2024 年下半年开始, 「回答前多花计算」从少数实验室的研究技巧,变成前沿产品线里的显性能力55

2024 年 9 月,第一个商业推理模型系列发布预览版,公众开始大规模见到这种产品形态; 同年 12 月,正式版和更高计算预算的档位把它推进付费产品; 2025 年 4 月,新一代又把工具使用、成本效率和更强推理放进同一条产品线。 比起具体分数,更值得关注的是产品形态的变化: 推理已经变成训练、测试时计算和接口参数共同决定的能力, 不再只是提示词里写一句「一步步想」56

2025 年 1 月,一个开放权重模型系列发布并震动业界: 它的极端变体展示了大规模可验证奖励的强化学习可以直接激发推理行为、几乎不需要微调冷启动; 正式版走多阶段训练让能力更稳定;同时发布的蒸馏系列把推理能力下放到一组开源底座上, 显著降低了本地研究和部署的门槛。 书里给的评价很准:它的意义不是宣告「算力不重要」, 而是把长思维链从一种提示技巧变成了一种可训练的策略, 并证明这条路并非某一家公司专有——工程效率、数据设计和训练策略同样能改变竞争格局57

另一条产品路线是把普通对话和长思考放进同一个模型族: 简单问题快速回答,难题再显式分配更多思考预算。 这种「混合架构」既保留了普通对话的低成本,又能在难题上调用推理能力, 正成为产品级推理模型的重要形态58

把整段时间线收起来,书里看到两个趋势: 第一,推理能力从「少数实验室专属」扩散为前沿模型的基础能力; 第二,推理预算从隐式变成显式产品参数—— 用户可以选择让模型大致「想多久」,计费和时延(从发出请求到拿到结果要等的时间)也随之变化。 两点合起来说明:推理模型已经从研究故事进入了工程化和商品化阶段59

10. 用什么尺子量「会想」

推理模型一旦成为竞争主战场,评测就必须跟上。 传统基准在推理模型上很快被「打到天花板」—— 几乎所有前沿模型都拿到 85% 以上,失去区分度。 新一代评测因此被重新设计,书里列了六个,外加三类题的具体样子60:

基准考什么难在哪
AIME(美国数学邀请赛)历年竞赛题,15 题,答案都是 0–999 的整数答案是一个数,只有对或错,没有部分分;同余、边界或最后一步算术滑一下就归零
GPQA Diamond博士级科学问答,198 题,物理化学生物题目设计成「即便允许搜索,非专业人士也很难答对」
FrontierMath专业研究水平的数学题一道题要数小时甚至几天的人类专家工作
ARC-AGI(一个抽象推理基准;AGI 是 Artificial General Intelligence 的缩写,第 18 章会正面讨论这个目标)少样例网格变换:给三五对「输入→输出」示例,归纳规则后变换新网格没有自然语言描述,所有信息都在网格里;人类儿童看几个例子就能猜规则,模型长期吃力
SWE-bench Verified真实开源仓库的 issue:读仓库、定位代码、写最小补丁、让测试通过几十万行代码库里定位;补丁要符合项目风格;还不能让原本通过的回归测试退化
Codeforces直接参加在线编程竞赛,按真实赛题打分公开竞争环境,比静态函数题更接近「在压力下解题」

这些评测有一个共同特征:对正确答案有明确判据——数学题对错可验证、 代码可跑测试用例。所以它们天然适合同时充当训练时的可验证奖励来源: 评测和训练共享同一种「真相」,评测分数的提升直接对应训练目标的改进。 这也是为什么在推理模型时代,「基准、训练数据、奖励信号」三者越来越难分离61

但这种紧耦合有阴影:训练数据里如果不小心混入了历年竞赛题或仓库用例,分数会虚高。 前沿团队开始用「评测保留集 + 时间分割」(只用晚于训练截止时间的题目)来控制, 但完全杜绝几乎不可能。 书里给读者的习惯,值得抄下来:看到「某模型在某基准上跑出最高分」时, 先问基准发布时间,再问模型训练截止时间—— 两者的相对位置,很大程度上决定了分数的可信度62

书里还给了三个题目的压缩转述,各藏一个读分数的要点: AIME 类——读具体分数时要连带看模型版本、是否多次采样、是否使用工具、题目年份和报告口径; SWE-bench 类——这类数字尤其依赖运行外壳(给模型配的工具集、迭代次数、 最大上下文、是否允许重试,英文叫 harness),只看一个百分比很容易得出错误结论, 看分数必须连带看运行设置63; ARC-AGI 类——曾有一个预览系统在高算力配置下达到 87.5%, 但同页也提醒:该测试对象与正式发布的版本并不完全相同,且算力配置远高于常规预算—— 它说明「推理模型在足够预算下开始触碰少样例抽象」, 不应被解读成「已经完全掌握抽象推理」64

11. 工程现实:缓存、成本与可见性

把推理模型部署到产品里,还有一组论文里讨论得不多、但工程团队天天遇到的问题。

长思维链对缓存的压力。 第 04 章讲过,生成每个词元都要重看前面所有词元的键值缓存。 推理模型的内部思维链常常是几万到几十万词元,这份缓存随之膨胀: 书里给的数字是,一个 700 亿参数的模型在 3.2 万词元下,缓存大约 10 GB; 到 10 万词元就变成 30 GB——而它的权重本身在半精度下已占约 140 GB, 通常要跨多卡才装得下,留给缓存的显存,单卡往往只够支撑一两个这样的长 会话(从用户开口到对话结束、上下文一直保留的一段完整来回)。

这把推断成本曲线从「线性」推到「超线性」: 同样硬件,推理模型的并发(同一时刻能同时服务多少个请求)能力 只有普通对话模型的几分之一65

成本曲线。 同一个问题,普通模型生成 500 词回答, 推理模型可能要先生成几千词的内部思维链再给出答案——词元数差很多。 开源推理模型权重免费,但只要进入线上服务, 长思考同样会转化成显存、时延和并发成本。 直接后果还是那句:推理模型适合「难题专用」,简单对话交给普通模型66

思维链的可见性。 有厂商选择不向用户公开完整内部思维链,只提供压缩后的推理摘要; 开放权重的路径则让用户和研究者更容易观察推理痕迹。 背后的产品哲学差异很稳定:思维链到底属于模型内部状态,还是用户应该看到的输出? 这个问题的答案,很大程度上会决定推理模型在企业、教育、医疗等场景的接受度67

这些工程问题加在一起说明:推理模型绝非「比对话模型多想了几步」那么简单—— 它的工程账本、成本曲线、产品形态都和上一代不在同一个尺度上。 这也是为什么 2024–2026 年这一波竞争,越来越不像「模型更大」的较量, 而更像「训练-评测-推断-产品」四个维度的协同竞赛68

12. 推理模型与智能体:深度和长度是两条轴

推理模型刚出来时,有一种很流行的判断: 既然模型自己会做长思维链、会规划、会自我反思, 那智能体那套「外壳 + 工具 + 记忆」框架是不是就要过时了? 书里专门讨论了这个问题,它是连接这一章和第 11–13 章的桥69

先看推理模型擅长什么、不擅长什么。 它在封闭世界的难题上确实强:数学竞赛、形式化证明、可验证编程、一次问答内完成的多步逻辑—— 这些任务的共同特征是,所有信息都在输入里,所有验证都可以离线做, 所有计算都发生在模型自己脑子里。 但它不会自己去打开浏览器查今天的新闻,不会自己读本地文件系统, 不会调用一个训练数据里不存在的内部接口,也不会跨几小时去盯一个长任务。 这些事需要的不是「想得更深」,而是触达外部世界的能力—— 那正是智能体框架要解决的另一个维度70

所以两者本质上是正交的(两条互不影响的轴,各走各的): 推理模型回答的是「单次推断要花多少计算才能更准」, 智能体框架回答的是「一个任务要跨多少次推断、调多少外部能力才能完成」。 前者是深度,后者是长度。 两条轴可以独立增长,也可以协同:用推理模型当内核的智能体, 在每个关键决策点都享受深度;不用推理模型但工具、记忆、规划完备的智能体, 可以靠工程把长链任务跑稳71

为什么不会完全替代?书里给了三个结构性原因72:

  1. 信息边界。 再深的思维链也没法凭空知道训练数据之外的事实,这必须靠检索和工具。
  2. 成本曲线。 推理模型自己也是个推断负载,它的成本决定了不可能每一步都用—— 「简单步骤用小模型、关键点切到推理模型」的分层调度,才是把推理算力花在刀刃上的做法。
  3. 可观测性。 内部思维链是隐藏或半隐藏的;在企业场景中, 可审计、可中断、可回滚这些框架特性,反而比「内部想得更深」更重要。

更可能的图景是两者深度融合:智能体框架变成推理模型的「工作台」—— 推理模型负责深度思考,框架负责长程行动、状态管理、副作用控制、可观测性和人机协作。 书里那句话可以直接带走:推理模型不是智能体的对手, 而是给智能体多了一档新引擎可以选73

主走查:一道竞赛风格的整数题,四种做法,四笔词元账

这条走查贯穿本章。 挑一道 AIME 风格的题(题目和数字都是为演示编的): 「把 1 到 9 填入 3×3 方格,使每行、每列的乘积都等于指定值,共有多少种填法?」 跟着它走完 §3 到 §7 的每一环,每环旁边记一笔词元账。

做法一:直接答。(§1) 模型一口气给出「48 种」。错了(正确答案设为 72,这两个数都是编的)。 账:输出约 20 个词元。 快,但复杂题上这就是§1 说的「一步走岔、整链失败」。

做法二:加一句「让我们一步一步思考」。(§3) 它开始写:「先考虑 5 只能放中心……如果 5 在角上,那么含 5 的行乘积含因子 5……」 写出 12 行中间步骤后给出「72 种」。对了。 账:输出约 400 个词元——是直接答的 20 倍。 多花的词元就是 §3 第一层机制说的「摊开的计算预算」; 中间写下的「5 只能放中心」就是第二层机制说的「显式中间状态」—— 后面每一步读的是这行白纸黑字,而不是内部某个模糊状态。 但注意 §4 的边界:如果中间某一步枚举(把所有可能挨个列出来核对)时漏了一类, 它不会发现——写得像在算,不保证算得对。

做法三:采样 20 条,投票。(§5) 用较高温度把做法二重复 20 遍。结果:11 次得 72,4 次得 48, 3 次得 36,2 次得别的(这组分布是编的)。多数票:72。 账:20 × 400 = 8000 个词元,错误率从「单条的约三成」压到「投票后不足一成」 (这两个百分数也是编的,书里给的真实区间是再提升 5 到 15 个百分点)。 走错的 9 条各自错得不一样,走对的 11 条收敛到同一个数——这就是投票有效的全部原因。

做法四:逐步打分,带剪枝。(§6) 还是那道题,但每生成一步就让过程裁判打分: 「5 只能放中心」得 0.9,保留;「先枚举所有排列」得 0.2,这条分支整枝剪掉; 「按因子分解分类讨论」得 0.8,保留(分数是编的)。 账:只展开了 6 条有希望的分支,总共约 2400 个词元——比做法三的 8000 省七成, 准确率反而略高。 这就是 §6 那句「用更少的总词元换更高的准确率」在这条题上的样子。

做法五:交给推理模型。(§7) 同一道题,推理模型先在内部分类讨论、枚举、自检, 中途写出「等等,我漏算了 5 在边上的情况」,回到岔口重来, 最后给出 72 和一段压缩过的推理摘要。 账:内部思维链约 8000 个词元,但你只为最终答案和摘要付费看到的部分是 300 个词元。 那个「等等,我漏算了」的回溯,就是 §7 说的长思维链三个改变里的第一个; 而它训出来的时候,靠的正是 §8 那四块:初始化给的起点、 可验证奖励判的 72 对不对、搜索攒下的正确轨迹、学习把它写回参数。

五种做法排在一起,就是这一章的全部内容: 同一道题,你可以花 20 个词元赌一把,也可以花 8000 个词元买个稳—— 这一章讲的是每一档钱花出去,到底买回了什么。

作者的判断与证据

书里给了硬证据的地方:

  • 投票能在思维链基础上再提 5–15 个百分点,有论文和多个数学基准支撑25;
  • 逐步打分优于整篇打分(固定算力下更高准确率),有 2023–2024 年的公开研究支撑32;
  • 训练时搜索与测试时搜索协同放大,来自 2024 年一份综述的提炼, 书里原样引用并给了「任一边单独放大都会边际递减」的论证50;
  • 长思维链的三个改变(回溯、自我质疑、按难度伸缩),是对开放技术报告的归纳40;
  • 缓存的两个数字(3.2 万词元约 10 GB、10 万词元约 30 GB),是可复算的估算65;
  • ARC-AGI 那个 87.5% 的限定条件,书里原样保留了发布方的提醒64

书里明确标成判断或提醒的地方:

  • 「不要只记某个百分比」——书里两次强调分数随版本、预算、口径浮动41;
  • 「写出来的思考过程不一定等于内部真实计算」,书里明说它更像事后解释20;
  • 纯强化学习涌现的「反思行为」是风格还是认知,书里把它作为一个开放问题留在习题里, 没有下结论。

判断(我们的,不是书里的): 这一章的六环链里,真正改变格局的不是任何单一技巧, 而是**「答案对不对可以自动判」这件事和「多花计算」这两件事的合流**。 自动判定让多花出去的每一次采样都能被筛出金子,于是「用算力换数据」才成立。 在不能自动判对错的领域(写作、调研、产品判断),这条链会断在第 ③ 环—— 投票和逐步打分都失去地基,推理模型的优势会小得多。 如果错,会错在: 第 06 章 §11 那种「会长出推理的裁判」如果把开放任务的自动评审 做到足够可靠,「不可自动判定」这一类就会缩小,这条判断的分界线就得重画。

边界与局限

  • 提示工程那一节是经验总结,不是配方。 书里自己也说「技术细节会变,这件基本功不会」。
  • 具体分数全部有时效性。 这一章刻意没有搬运任何排行榜数字; 书里列基准的目的是教「怎么读分数」,不是报分数。
  • 思维树、图结构、自我改稿这些更复杂的结构只给了一两句, 书里在扩展阅读里指了路,本组拆解没有展开。
  • 多模态推理(看图推理)完全没讲——书里把它放在第 8 章之后, 这一章全部在文本范围内。
  • §8 的四组件是一个解读框架,不是唯一框架。 书里自己也提醒, 不同团队的实现路径各异,只是「都能被这一框架解读」。

可带走的

  1. 先把任务说清楚,再谈一切技巧。 五件事:角色与目标、例子、分步、格式、怀疑。
  2. 挑模型看任务最难的那一步。 开法拉利买菜,既贵又浪费。
  3. 思维链有效的两层机制:计算摊开 + 中间状态写出来。 不是话术。
  4. 写出来的思考过程 ≠ 内部真实计算。 它更像事后解释,别拿它当 CT 报告。
  5. 写得像在算,不保证算得对。 精确计算交给工具。
  6. 多采样的全部逻辑:走错的路径各自错,走对的路径收敛;评分粒度从投票到逐步剪枝到展开树,越细越贵,也能用更少总词元换更高准确率。
  7. 测试时也能扩展:回答前多花计算也能变强。 规模法则从此有两条轴;长思维链带来能回溯、会自我质疑、按难度伸缩。
  8. 推理模型训练四组件:初始化、奖励、搜索、学习。 搜索在训练和测试时各用一次,协同放大。
  9. 读分数的三个连带问题:基准发布时间 vs 训练截止时间;采样预算;运行外壳设置。
  10. 推断成本从均匀变成长尾,推理模型与智能体是两条轴: 难题专用、简单问题走普通模型;一个管深度,一个管长度,不是对手。

原文地图

主题原书节原文位置
第一步落在你这边7.1text/08-ch07.txt:24(搜「第一步往往落在你这边」)
失败的合同提示7.1.1text/08-ch07.txt:36(搜「话不算错,却几乎没用」) · text/08-ch07.txt:37(搜「毛病不在模型不会读合同」)
角色与目标7.1.1text/08-ch07.txt:43(搜「比任何“请认真一点”的客套都管用」)
例子与格式7.1.1text/08-ch07.txt:46(搜「一两个好例子往往比一大段抽象指令更顶用」) · text/08-ch07.txt:51(搜「结构化输出更是硬要求」)
保持怀疑7.1.1text/08-ch07.txt:57(搜「怀疑这一步省不得」)
五件事与接口7.1.1text/08-ch07.txt:58(搜「写好提示其实就五件事」) · text/08-ch07.txt:64(搜「写得越像接口」)
挑模型7.1.2text/08-ch07.txt:69(搜「开法拉利买菜」) · text/08-ch07.txt:74(搜「值得考虑推理模型」) · text/08-ch07.txt:79(搜「任务最难的那一步」)
拆流程7.1.3text/08-ch07.txt:83(搜「不要指望一个提示词搞定一切」) · text/08-ch07.txt:86(搜「列大纲(强模型)」)
避坑7.1.4text/08-ch07.txt:97(搜「反复栽跟头的地方」)
思维链与苹果例子7.2.1text/08-ch07.txt:116(搜「被鼓励一步步思考时,它解题更准」) · text/08-ch07.txt:124(搜「小明原来 5 个」)
两层机制7.2.2text/08-ch07.txt:138(搜「第一层是计算重新分配」) · text/08-ch07.txt:143(搜「第二层是显式中间状态」)
不是做 CT7.2.2text/08-ch07.txt:148(搜「有时更像事后解释」) · text/08-ch07.txt:149(搜「不是给模型大脑做 CT」)
精确计算的边界7.2.3text/08-ch07.txt:154(搜「12 位数字乘法」) · text/08-ch07.txt:160(搜「写得像却不保证算得对」)
自一致性7.3.1text/08-ch07.txt:172(搜「采样多条独立的思维链」) · text/08-ch07.txt:175(搜「再提升 5–15 个百分点」) · text/08-ch07.txt:177(搜「往往收敛到同一个答案」)
思维树7.3.2text/08-ch07.txt:181(搜「中间无法调整」) · text/08-ch07.txt:184(搜「这就是把搜索引入推理」)
整篇打分7.3.3text/08-ch07.txt:199(搜「只要评分器比生成器更准」) · text/08-ch07.txt:201(搜「采样越多反而越往坏方向偏」)
逐步打分7.3.4text/08-ch07.txt:208(搜「候选继续扩展,其余剪掉」) · text/08-ch07.txt:210(搜「用更少的总 token 取得更高准确率」)
聪明搜索7.3.5text/08-ch07.txt:220(搜「用草稿模型先快速生成候选」) · text/08-ch07.txt:224(搜「不同 token 不该花同样多的计算」)
测试时扩展7.4.1text/08-ch07.txt:240(搜「也能变强,这就是测试时扩展」) · text/08-ch07.txt:244(搜「更多隐藏的推理计算」)
草稿纸对比7.4.2text/08-ch07.txt:259(搜「普通推断像一次交卷」) · text/08-ch07.txt:261(搜「测试时也能扩展」)
长思维链7.4.3text/08-ch07.txt:283(搜「内部思维链常常上万词元」) · text/08-ch07.txt:285(搜「回溯能力变强」)
不要只记百分比7.4.3text/08-ch07.txt:291(搜「不要只记某个百分比」)
成本长尾7.4.3text/08-ch07.txt:295(搜「从“均匀”变成“长尾”」)
四大组件7.5text/08-ch07.txt:304(搜「归纳为四大组件」)
策略初始化7.5.1text/08-ch07.txt:315(搜「冷启动」) · text/08-ch07.txt:335(搜「走弯路、又改正」) · text/08-ch07.txt:340(搜「直接决定 RL 阶段的上限」)
奖励设计7.5.2text/08-ch07.txt:350(搜「代价是信号稀疏」) · text/08-ch07.txt:359(搜「生成 PRM 喜欢但实际并不正确的中间步骤」) · text/08-ch07.txt:364(搜「更难被奖励黑客绕过」)
搜索两面7.5.3text/08-ch07.txt:374(搜「生成高质量解供学习」) · text/08-ch07.txt:380(搜「现在有正确轨迹可学」) · text/08-ch07.txt:384(搜「内化」)
协同放大7.5.3text/08-ch07.txt:389(搜「训练时搜索和测试时搜索」) · text/08-ch07.txt:391(搜「边际收益递减」)
学习7.5.4text/08-ch07.txt:399(搜「搜索过程中没出现的策略」) · text/08-ch07.txt:407(搜「Critic」)
探索与利用7.5.4text/08-ch07.txt:409(搜「探索 vs 利用」) · text/08-ch07.txt:411(搜「熵正则化」)
对齐与推理的对照7.5.4text/08-ch07.txt:419(搜「更深入的思考」) · text/08-ch07.txt:420(搜「模型内嵌行为」)
o 系列7.6text/08-ch07.txt:429(搜「2024 年 9 月发布」) · text/08-ch07.txt:433(搜「不再只是提示词里写一句」)
R17.6text/08-ch07.txt:438(搜「开放模型权重」) · text/08-ch07.txt:445(搜「变成了一种可训练的策略」)
混合模型与开源7.6text/08-ch07.txt:448(搜「同一个模型族里」) · text/08-ch07.txt:457(搜「thinking / non-thinking」)
两个趋势7.6text/08-ch07.txt:462(搜「从隐式变成显式产品参数」) · text/08-ch07.txt:465(搜「工程化和商品化」)
评测天花板7.7text/08-ch07.txt:471(搜「失去区分度」)
六个基准7.7text/08-ch07.txt:475(搜「0–999 的整数」) · text/08-ch07.txt:478(搜「即便允许 Google 搜索」) · text/08-ch07.txt:487(搜「让 issue 关联的测试通过」)
共享真相7.7text/08-ch07.txt:494(搜「对正确答案有明确判据」) · text/08-ch07.txt:495(搜「共享同一种」)
污染与时间分割7.7text/08-ch07.txt:500(搜「评测保留集 + 时间分割」) · text/08-ch07.txt:502(搜「先问基准发布时间」)
三道题的样子7.7.1text/08-ch07.txt:513(搜「只有对或错,没有部分分」) · text/08-ch07.txt:530(搜「连带看 harness 设置」) · text/08-ch07.txt:540(搜「高算力配置下达到 87.5%」)
缓存压力7.8text/08-ch07.txt:553(搜「KV 缓存大约 10 GB」) · text/08-ch07.txt:556(搜「只有普通对话模型的几分之一」)
成本曲线7.8text/08-ch07.txt:561(搜「500 词回答」) · text/08-ch07.txt:563(搜「难题专用」)
可见性7.8text/08-ch07.txt:574(搜「不向用户公开完整内部思维链」)
四个维度协同7.8text/08-ch07.txt:582(搜「训练-评测-推断-产品」)
正交:深度与长度7.9text/08-ch07.txt:597(搜「触达外部世界的能力」) · text/08-ch07.txt:601(搜「前者是深度,后者是长」)
三个结构性原因7.9text/08-ch07.txt:606(搜「三个结构性原因」) · text/08-ch07.txt:613(搜「可观测性更差」)
多一档引擎7.9text/08-ch07.txt:622(搜「不是智能体的对手」) · text/08-ch07.txt:623(搜「多了一档新引擎可以选」)

Footnotes

  1. 出处:「7.1 先把任务说清楚」第 24 段(text/08-ch07.txt:24,搜「第一步往往落在你这边」)。

  2. 出处:同节第 26 段(text/08-ch07.txt:26,搜「从“没法用”被一步步改到“能交活”」)。

  3. 出处:「7.1.1」第 36 段(text/08-ch07.txt:36,搜「话不算错,却几乎没用」) 与第 37 段(text/08-ch07.txt:37,搜「毛病不在模型不会读合同」)。

  4. 出处:同节第 43 段(text/08-ch07.txt:43,搜「比任何“请认真一点”的客套都管用」)。

  5. 出处:同节第 46 段(text/08-ch07.txt:46,搜「一两个好例子往往比一大段抽象指令更顶用」)。

  6. 出处:同节第 48 段(text/08-ch07.txt:48,搜「需人工确认」) 与第 51 段(text/08-ch07.txt:51,搜「结构化输出更是硬要求」)。

  7. 出处:同节第 57 段(text/08-ch07.txt:57,搜「怀疑这一步省不得」)。

  8. 出处:同节第 58 段(text/08-ch07.txt:58,搜「写好提示其实就五件事」)。

  9. 出处:同节第 61 段(text/08-ch07.txt:61,搜「一份临时接口、一份小型任务说明书」) 与第 64 段(text/08-ch07.txt:64,搜「写得越像接口」)。

  10. 出处:「7.1.2」第 69 段(text/08-ch07.txt:69,搜「开法拉利买菜」)。

  11. 出处:同节第 74 段(text/08-ch07.txt:74,搜「值得考虑推理模型」)。

  12. 出处:同节第 79 段(text/08-ch07.txt:79,搜「任务最难的那一步」)。

  13. 出处:「7.1.3」第 83 段(text/08-ch07.txt:83,搜「不要指望一个提示词搞定一切」) 与第 86 段(text/08-ch07.txt:86,搜「列大纲(强模型)」)。

  14. 出处:「7.1.4」第 97 段(text/08-ch07.txt:97,搜「反复栽跟头的地方」)。

  15. 出处:「7.2.1」第 116 段(text/08-ch07.txt:116,搜「被鼓励一步步思考时,它解题更准」)。

  16. 出处:同节第 121 段(text/08-ch07.txt:121,搜「可能会蒙一个数字」) 与第 124 段(text/08-ch07.txt:124,搜「小明原来 5 个」)。

  17. 出处:「7.2.2」第 137 段(text/08-ch07.txt:137,搜「背后藏着两层机制」)。

  18. 出处:同节第 143 段(text/08-ch07.txt:143,搜「第二层是显式中间状态」) 与第 146 段(text/08-ch07.txt:146,搜「在内部某个激活向量里大概是 3 的东西」)。

  19. 出处:「7.2.1」第 133 段(text/08-ch07.txt:133,搜「三者各有优劣」)。

  20. 出处:「7.2.2」第 148 段(text/08-ch07.txt:148,搜「有时更像事后解释」) 与第 149 段(text/08-ch07.txt:149,搜「不是给模型大脑做 CT」)。 2

  21. 出处:「7.2.3」第 154 段(text/08-ch07.txt:154,搜「12 位数字乘法」) 与第 157 段(text/08-ch07.txt:157,搜「它也常常数错」)。

  22. 出处:同节第 160 段(text/08-ch07.txt:160,搜「写得像却不保证算得对」)。

  23. 出处:「7.3」第 165 段(text/08-ch07.txt:165,搜「单条链不一定走得对」)。

  24. 出处:「7.3.1」第 172 段(text/08-ch07.txt:172,搜「采样多条独立的思维链」) 与第 173 段(text/08-ch07.txt:173,搜「选出现频率最高的那个作为最终输出」)。

  25. 出处:同节第 175 段(text/08-ch07.txt:175,搜「再提升 5–15 个百分点」)。 2

  26. 出处:同节第 177 段(text/08-ch07.txt:177,搜「往往收敛到同一个答案」) 与第 178 段(text/08-ch07.txt:178,搜「采样 20 次就要花 20 倍 token」)。

  27. 出处:「7.3.2」第 181 段(text/08-ch07.txt:181,搜「中间无法调整」) 与第 184 段(text/08-ch07.txt:184,搜「这就是把搜索引入推理」)。

  28. 出处:同节第 185 段(text/08-ch07.txt:185,搜「24 点游戏」) 与第 186 段(text/08-ch07.txt:186,搜「搜索代价指数增长」)。

  29. 出处:「7.3.3」第 196 段(text/08-ch07.txt:196,搜「让一个独立的奖励模型」)。

  30. 出处:同节第 199 段(text/08-ch07.txt:199,搜「只要评分器比生成器更准」) 与第 201 段(text/08-ch07.txt:201,搜「采样越多反而越往坏方向偏」) 与第 202 段(text/08-ch07.txt:202,搜「reward hacking 在测试时也成立」)。

  31. 出处:「7.3.4」第 208 段(text/08-ch07.txt:208,搜「候选继续扩展,其余剪掉」) 与第 210 段(text/08-ch07.txt:210,搜「用更少的总 token 取得更高准确率」)。

  32. 出处:同节第 211 段(text/08-ch07.txt:211,搜「PRM800K」) 与第 212 段(text/08-ch07.txt:212,搜「beam search 上」)。 2

  33. 出处:「7.3.5」第 226 段(text/08-ch07.txt:226,搜「同一条主线在不同评分粒度上的展开」)。

  34. 出处:同节第 220 段(text/08-ch07.txt:220,搜「用草稿模型先快速生成候选」) 与第 224 段(text/08-ch07.txt:224,搜「不同 token 不该花同样多的计算」)。

  35. 出处:「7.4.1」第 240 段(text/08-ch07.txt:240,搜「也能变强,这就是测试时扩展」) 与第 241 段(text/08-ch07.txt:241,搜「正在回答问题的阶段」)。

  36. 出处:同节第 242 段(text/08-ch07.txt:242,搜「o1 系列和 DeepSeek 的R1 系列」) 与第 244 段(text/08-ch07.txt:244,搜「更多隐藏的推理计算」)。

  37. 出处:「7.4.2」第 259 段(text/08-ch07.txt:259,搜「普通推断像一次交卷」) 与第 260 段(text/08-ch07.txt:260,搜「多打几张草稿纸」)。

  38. 出处:同节第 261 段(text/08-ch07.txt:261,搜「测试时也能扩展」)。

  39. 出处:「7.4.3」第 283 段(text/08-ch07.txt:283,搜「内部思维链常常上万词元」) 与第 284 段(text/08-ch07.txt:284,搜「想了很久」)。

  40. 出处:同节第 285 段(text/08-ch07.txt:285,搜「回溯能力变强」) 与第 290 段(text/08-ch07.txt:290,搜「预算自适应」)。 2

  41. 出处:同节第 291 段(text/08-ch07.txt:291,搜「不要只记某个百分比」) 与第 293 段(text/08-ch07.txt:293,搜「开始被头部推理模型部分攻克」)。 2

  42. 出处:同节第 294 段(text/08-ch07.txt:294,搜「代价是推断成本飙升」) 与第 295 段(text/08-ch07.txt:295,搜「从“均匀”变成“长尾”」)。

  43. 出处:「7.5」第 304 段(text/08-ch07.txt:304,搜「归纳为四大组件」)。

  44. 出处:「7.5.1」第 315 段(text/08-ch07.txt:315,搜「冷启动」) 与第 321 段(text/08-ch07.txt:321,搜「完全不经 SFT 引导」) 与第 323 段(text/08-ch07.txt:323,搜「长思维链 + 答案」) 与第 328 段(text/08-ch07.txt:328,搜「下放」)。

  45. 出处:同节第 334 段(text/08-ch07.txt:334,搜「停在表面格式这一层」) 与第 335 段(text/08-ch07.txt:335,搜「走弯路、又改正」)。

  46. 出处:「7.5.2」第 350 段(text/08-ch07.txt:350,搜「代价是信号稀疏」) 与第 359 段(text/08-ch07.txt:359,搜「生成 PRM 喜欢但实际并不正确的中间步骤」) 与第 364 段(text/08-ch07.txt:364,搜「更难被奖励黑客绕过」)。

  47. 出处:同节第 366 段(text/08-ch07.txt:366,搜「常常结合使用」)。

  48. 出处:「7.5.3」第 375 段(text/08-ch07.txt:375,搜「梯度信号几乎不可用」) 与第 380 段(text/08-ch07.txt:380,搜「现在有正确轨迹可学」)。

  49. 出处:同节第 384 段(text/08-ch07.txt:384,搜「内化」) 与第 385 段(text/08-ch07.txt:385,搜「内部 token 预算」)。

  50. 出处:同节第 389 段(text/08-ch07.txt:389,搜「训练时搜索和测试时搜索」) 与第 391 段(text/08-ch07.txt:391,搜「边际收益递减」) 与第 393 段(text/08-ch07.txt:393,搜「两条新轴」)。 2

  51. 出处:「7.5.4」第 399 段(text/08-ch07.txt:399,搜「搜索过程中没出现的策略」) 与第 402 段(text/08-ch07.txt:402,搜「在没见过的题上自己摸索」)。

  52. 出处:同节第 407 段(text/08-ch07.txt:407,搜「Critic」) 与第 408 段(text/08-ch07.txt:408,搜「并不是必要组件」)。

  53. 出处:同节第 409 段(text/08-ch07.txt:409,搜「探索 vs 利用」) 与第 411 段(text/08-ch07.txt:411,搜「熵正则化」)。

  54. 出处:同节第 419 段(text/08-ch07.txt:419,搜「更深入的思考」) 与第 420 段(text/08-ch07.txt:420,搜「模型内嵌行为」)。

  55. 出处:「7.6」第 427 段(text/08-ch07.txt:427,搜「回答前多花计算」)。

  56. 出处:同节第 429 段(text/08-ch07.txt:429,搜「2024 年 9 月发布」) 与第 433 段(text/08-ch07.txt:433,搜「不再只是提示词里写一句」)。

  57. 出处:同节第 438 段(text/08-ch07.txt:438,搜「开放模型权重」) 与第 445 段(text/08-ch07.txt:445,搜「变成了一种可训练的策略」)。

  58. 出处:同节第 448 段(text/08-ch07.txt:448,搜「同一个模型族里」) 与第 451 段(text/08-ch07.txt:451,搜「混合架构」)。

  59. 出处:同节第 462 段(text/08-ch07.txt:462,搜「从隐式变成显式产品参数」) 与第 465 段(text/08-ch07.txt:465,搜「工程化和商品化」)。

  60. 出处:「7.7」第 471 段(text/08-ch07.txt:471,搜「失去区分度」)。

  61. 出处:同节第 494 段(text/08-ch07.txt:494,搜「对正确答案有明确判据」) 与第 495 段(text/08-ch07.txt:495,搜「共享同一种」) 与第 498 段(text/08-ch07.txt:498,搜「越来越难分离」)。

  62. 出处:同节第 500 段(text/08-ch07.txt:500,搜「评测保留集 + 时间分割」) 与第 502 段(text/08-ch07.txt:502,搜「先问基准发布时间」)。

  63. 出处:「7.7.1」第 529 段(text/08-ch07.txt:529,搜「很容易得出错误结论」) 与第 530 段(text/08-ch07.txt:530,搜「连带看 harness 设置」)。

  64. 出处:同节第 540 段(text/08-ch07.txt:540,搜「高算力配置下达到 87.5%」) 与第 542 段(text/08-ch07.txt:542,搜「少样例抽象」)。 2

  65. 出处:「7.8」第 553 段(text/08-ch07.txt:553,搜「KV 缓存大约 10 GB」) 与第 555 段(text/08-ch07.txt:555,搜「只够支撑一两个这样的长会话」) 与第 556 段(text/08-ch07.txt:556,搜「只有普通对话模型的几分之一」)。 2

  66. 出处:同节第 561 段(text/08-ch07.txt:561,搜「500 词回答」) 与第 563 段(text/08-ch07.txt:563,搜「难题专用」)。

  67. 出处:同节第 574 段(text/08-ch07.txt:574,搜「不向用户公开完整内部思维链」) 与第 577 段(text/08-ch07.txt:577,搜「思维链到底属于模型内部状态」)。

  68. 出处:同节第 582 段(text/08-ch07.txt:582,搜「训练-评测-推断-产品」)。

  69. 出处:「7.9」第 589 段(text/08-ch07.txt:589,搜「是不是就要过时了」)。

  70. 出处:同节第 593 段(text/08-ch07.txt:593,搜「所有信息都在输入里」) 与第 597 段(text/08-ch07.txt:597,搜「触达外部世界的能力」)。

  71. 出处:同节第 600 段(text/08-ch07.txt:600,搜「跨多少次推断、调多少外部能力」) 与第 601 段(text/08-ch07.txt:601,搜「前者是深度,后者是长」)。

  72. 出处:同节第 606 段(text/08-ch07.txt:606,搜「三个结构性原因」) 与第 607 段(text/08-ch07.txt:607,搜「训练数据之外的事实」) 与第 613 段(text/08-ch07.txt:613,搜「可观测性更差」)。

  73. 出处:同节第 622 段(text/08-ch07.txt:622,搜「不是智能体的对手」) 与第 623 段(text/08-ch07.txt:623,搜「多了一档新引擎可以选」)。