跳到主要内容

接下来投什么 — 涨潮抬不起来的那些船

这一章讲三件事: 有哪几项新技法值得现在就纳入预算、哪几项还只是研究课题; 一项能力今天值得自建、明年还值不值得; 以及全书十九章的技法之下,有哪三条是不会变的。

它在全书链条里的位置:这是战略落点。 前面十九章回答的是「怎么做」,这一章回答的是「做不做、投多少」。

第 04 章那条暗线「别走远」在这一章第五次、也是最后一次出现, 这一次它管的是时间上的累积漂移

1. 先看现象:同一个模型,明年还值得自建吗

回到那家保险公司。第 14 章那个模型上线一年了,现在到了做明年预算的时候。

★ 摆在桌上的问题:
这套东西明年还值得自己养吗?
还是说,到时候直接写几句话交代给一个现成的服务就够了?

书给的那句判断,是这一章的全部起点

它的措辞很不客气1:

★ 今天需要微调才有的能力,明天可能只要提示词就够了。

2023 年辛辛苦苦微调出来的那个摘要模型,可能在 2025 年就被开箱即用的能力超过了; 而 2024 年看着必需的领域适配,到 2026 年可能零样本提示就能做到。

★ 而书给的战略回应不是「所以别投」1:

战略上的回应不是停止投资,而是把投资集中到那些 「在基线推进之后仍然差异化」的能力上。

主走查(全章共用): 把那封拒付信拆成两半—— 「通用能力」的那一半和「只有你有」的那一半,各归各的去处。 编造的数每次出现都会标明。

2. 顶层全景:一张成熟度表,先看地图再逐项走

书给的这张表可以直接拿去做预算。我们照它整理2:

技法成熟度最适合什么关键前提
推理时算力已可上生产复杂推理、高风险决策要为「可变的推理成本」留预算
混合专家成熟中规模上的效率需要稀疏路由方面的经验
长上下文训练已可上生产文档处理、代码库问答要有长上下文的训练数据
从执行反馈做强化学习已可上生产代码、数学、可验证的领域要有验证的基础设施
自动课程研究阶段高效训练要有难度估计的能力
持续学习研究阶段消除重训周期要有遗忘缓解手段
★ 读这张表的方式:
「已可上生产」那三项 → 明年的预算里可以有它们
「成熟中」那一项 → 只有当你已经在那个规模上时才相关
「研究阶段」那两项 → 现在只需要知道它们存在,以及它们的前提是什么

★ 而这一章的后半段(§8 起)讲的不是技法,是钱和人。

3. 机制一:每次回答的成本,从常数变成变量

那个把经济学倒过来的问题

书用一个问句起头3:

★ 如果每次回答所花的算力,从一个常数变成一个变量呢?

简单问题得到一个又快又便宜的答案; 复杂问题得到延长的推理——它可能贵好几个数量级,但相应地也做得更好。

★ 这是第 16 章那条「现在的天花板是经济,不是能力」的战略化版本。 那里说的是「你看到的不是最先进,是最付得起的」;这里说的是「那你可以选择付得起多少」。

它对训练目标的改变

这一条是这一节最该带走的4:

为「有效使用推理时算力」而训练,要求的目标与「为单遍生成而训练」不同。 ★ 模型必须学的不只是产出好回答,还有:评估自己的输出、找出弱点、迭代改进。

★ 而由此推出一个直接的后果: 那些评估中间步骤的奖励模型(第 16 章那个逐步给分的), 比只评最终答案的更重要。

训练课程也要跟着变4:

要转向那些「推理时的额外算力能带来优势」的更难问题, 而不是那些快答就够的简单题。

一条新的取舍轴

书专门开了个小框讲这件事5:

★ 推理时算力造出了一条新的取舍轴:响应时间 对 响应质量。

一个客服应用可能用最少的推理算力来换快; 一次复杂分析可能用大量算力来换准。 ★ 而「有效地使用额外算力」这件事本身是可训练的——只是训练方式与单遍优化不同。

走查上的落点:

同一个拒付信模型,两档:
常规拒付(理由代码清楚、条款无歧义)→ 最少的推理算力,2 秒出信
★ 疑难拒付(条款有歧义、被保人有律师)→ 延长推理,20 秒出信,
但先把 IRAC 那四步(第 16 章)走一遍

★ 关键:这不是两个模型,是同一个模型的两档预算。
而「什么时候该走哪一档」这个判断,本身要训。

(2 秒 / 20 秒是为演示编的。)

4. 机制二:混合专家,以及它独有的那个麻烦

它挑战的那个假设

书的表述很干净6:

★ 这种架构挑战的是「所有参数都必须参与每一次前向」这个假设。

不是一个单块的网络,而是多个专门化的「专家」子网络, 外加一个路由机制,决定哪些专家来处理哪个 token。

书给的数字很直观6:

★ 一个总参数 4000 亿的模型,可能对任一输入只激活 500 亿。

→ 以小得多的推理成本,达成超大模型的能力。

★ 参照物:激活的只有八分之一。
而第 13 章讲过,推理时的瓶颈主要在「搬权重」——所以这直接就是八倍的账。

★ 但后训练它有一个稠密模型没有的麻烦

(「稠密模型」就是前十九章讲的那种普通模型:每一次前向,全部参数都参与。 这个词是相对上面那种「只激活一部分」而言的,出门在模型卡上会撞见。)

这一条是这一节的重点7:

① 路由机制必须学会「哪些专家适合哪些输入」
★ 而微调会打乱已经学好的路由模式。

② 如果训练数据偏向某些领域:
★ 一部分专家拿到不成比例的训练信号,另一部分停滞。
**这叫专家坍缩,它会降低模型能力。**

对策两条7:

对策说明
负载均衡损失鼓励专家被均衡地使用,但它的超参要小心调
常见做法:初期微调时冻住路由器让专家先适配,之后再重训路由,以反映专家们新的能力

★ 注意这和第 18 章「先训投影层、再解冻主干」是同一个形状: 先让下游适配,再让分配机制跟上。

一个有意思的可能性,但书自己标了它没被理解

这一段必须照实转述,因为书自己划了界8:

不同的专家在预训练期间可能已经对不同领域形成了专门化, 而微调可以强化这种专门化—— 一份法律微调数据集可能加强某些专家的法律推理,而不动其他专家的通用能力

但书明确写道:这种涌现出来的专门化还没有被完全理解,也无法直接控制。 知道这种可能性存在会影响微调策略,但它不是一个可以拿来设计的机制。

5. 机制三:长上下文 —— 容量不等于有效利用

现象

书先给了这件事的规模变化9:

上下文窗口已经涨了好几个数量级: 从 2022 年那时候听着就很惊人的几千个 token, 到如今能装下整个代码库或者一本书的百万级。

★ 但这一节真正的内容是那个「但是」

这一句是这一节的全部9:

★ 原始的容量,不自动等于有效的利用。

一个百万 token 的窗口能「看见」整个代码库,
★ 却仍然可能找不到它要的那个函数定义;

它能读完整套法律取证文档,
★ 却可能漏掉夹在中间的那封关键邮件。

于是后训练的机会正在这个缝上

书给了三条具体的训练目标10:

训什么治什么
更可靠地关注上下文各处的信息中间的东西被忽略
回答那些「需要整合远距离事实」的问题只会用局部信息
抵抗「把上下文末尾的信息看得过重」的近因偏差偏重结尾

★ 而数据必须怎么造,书写得很硬10:

训练数据必须包含长上下文的样例,而且★ 正确答案要依赖各个位置上的信息, 而不只是开头和结尾。 造这种数据集贵,但值。

走查上的落点: 那套理赔卷宗有 200 页,而决定性的那一条批注在第 87 页。 要训模型找到它,训练样例的正确答案就必须依赖第 87 页,而不能依赖第 1 页或第 200 页。

超出窗口之外的方向

书点了一条更远的路11:

超出扩展上下文窗口之外,研究在探索那些「跨对话、甚至跨会话持久」的外部记忆机制。 第 03 章那条外挂检索是其中一种; 而把信息压缩存储、以备日后取回的「学到的记忆系统」是另一种。

★ 目标是给模型某种类人的长期记忆。 后训练这一侧的含义还在浮现,但能训出「会记住、并在过去交互之上继续构建」的模型, 会从根本上改变 AI 助手能做什么。

6. 机制四:那条不对称,是下一步的核心

把它写成一个对照

书用两句话就说完了12:

人类反馈执行反馈
昂贵、缓慢、规模有限便宜、快、无限
例子标注员判断哪个回答更好代码通没通过测试?证明验没验过?

★ 这种反馈成本上的不对称,创造出了「靠人来做时不可能达到的训练规模」的机会。

书给的量级对照13:

★ 人在环的训练能管几千次迭代的地方,
这里能做**几百万次**。

→ 而在数学推理与代码生成上,能力增益一直很显著。

★ 这就是第 16 章那条「编译器就是打分器」在战略层面的表达。

★ 但那条「会不会迁移」,书自己就没写死

这一条必须照实标出来14:

那个有意思的研究问题是:在可验证任务上发展出来的能力, 会不会迁移到那些无法验证的领域?

书用的措辞是「早期证据显示有意义的迁移」—— 大量训练数学的模型,在与数学无关的多样推理任务上也表现更好。

★ 而它给的结论是一个条件句:如果这种迁移足够稳健, 就存在一条路径——在可验证域上的自动反馈, 培养出惠及不可验证域的能力,从而降低对稀缺人类反馈的整体依赖。

判断(我们的,不是书里的): 这是全书赌注最大的一条推测, 而它同时出现在第 16 章和这一章,两处用的都是条件式的措辞。 我们的读法是:把它当成一个「值得押注、但不能拿来做承诺」的方向。 如果错,会错在: 如果这种迁移不成立,那么可验证域的所有成果 就只是可验证域的成果;而对拒付信这类没有外部裁判的活,你仍然只能靠人的判断—— 也就是第 14 章那条路,一步都省不掉。

7. 机制五:课程学习 —— 顺序也是可优化的

那个类比

书从人类教育起头15:

数学课程先算术、再代数、再微积分, ★ 不是因为后面的话题任意地「更难」,而是因为前面的话题提供了后面所需的基础。

★ 自动课程的核心思想

这一条可以直接当判据用16:

★ 把样例呈现在**模型当前能力的边缘**上。

太简单的 → **给不了学习信号**(模型已经会了)
太难的 → ★ **给的是噪声信号**——全都失败时,模型分不清好办法和坏办法
刚超出当前能力、但够得着的 → **提供最丰富的学习机会**

★ 书的比方:像一个实时调整挑战难度的好教练。

★ 注意「太难也没信号」这一条正是第 09 章那族按难度调整的做法所依据的同一件事: 那里说「模型已经能做对九成的简单题,那些题给出的学习信号基本是噪声」。

难处在于难度估计本身要花算力

书列了三条实现上的困难17:

困难具体
难度估计有开销要在候选样例上评估模型
批次构造要平衡课程上的考虑 vs 硬件效率
训练中的分布漂移可能导致不稳

但书给了一个反直觉的早期结果17:

★ 早期结果表明这笔投入可能划算: 用课程训练的模型,有时用更少的总训练算力,达到了更高的最终表现。

书还坦白了当前的实操办法15:

手工设计课程要同时理解任务结构和模型的学习动力学。 ★ 目前多半的出路,是用那些「难度或复杂度可以确定的考试」, 或者拿一批考生的成绩当难度的代理。

8. 机制六:持续学习 ★ 「别走远」第五次,也是最后一次

现在的做法把改进当成离散事件

书先把现状的代价说清18:

当前的实践把模型改进当成一个有明确边界的离散事件: 训练 → 评估 → 部署 → 过一阵子再来一轮。

★ 这既造成运营开销,也造成能力缺口: 今天部署的模型反映的是训练时可得的数据,不重训就吸收不了生产经验里的教训。

★ 这正是第 14 章那句「你 2024 年微调的模型是 2026 年的遗留系统」的机制。

障碍只有一个:灾难性遗忘

而对它的三族缓解,书列成了一个方框19:

做什么代价
回放训练时把旧样例和新数据混着来要存旧数据
正则化罚那些「对先前任务重要的参数」的改变要先算出哪些参数重要
加模块为新任务增加新容量,而不修改已有的权重会让模型变大

书的收口:没有哪一族能完全解决这个问题, 但把它们组合起来,能在实现有意义的适配的同时保住大部分旧能力。19

★ 「别走远」的第五副面孔

判断(我们的,不是书里的): 第 04 章我们给这条暗线起了名字,并预告它会换四个名字回来。这是最后一次。

出现在长什么样管住的是什么
第 04 章(命名处)学习率:一步迈多大每一步的位移
第 08 章罚模型偏离原来的自己输出的分布
第 12 章只准在一个很小的旁路里改动能动的方向数
第 14 章领域数据与通用数据按比例混数据的构成
这一章持续学习的三族遗忘缓解时间上的累积漂移

★ 五处的共同形状:改可以,但不许离原来的自己太远。 而这一次它管的东西是别处都管不了的:前四处都在管「这一次改动」, 只有这一次在管「改了一百次之后,它还是不是它」。

如果错,会错在: 这五种手段的做法确实各不相同,它们不能互相替代。 尤其这一次:学习率、偏离惩罚、低秩、混合比,全都管不住「一年之内被改了两百次」 这种累积漂移——那是一个跨越多次训练的问题,而前四者都只在一次训练之内起作用。

书对它的定性:还不是可部署的能力,但经济诱因太强

这句判断值得记住20:

大规模的、真正的持续学习,仍然是一个研究目标,而不是一项可部署的能力。 ★ 但经济诱因太强了——消除重训周期能大幅降低运营成本——所以这些技法很可能会成熟起来。

9. 机制七:涨潮抬不起来的那些船

这一节是这一章、也是全书的战略核心。

那条判据,只有一句话

书把它压缩成了一个可以在会议室里直接问的问题21:

★ 企业评估 AI 投资的判据就一句: 这个能力,在整个领域的基线推进之后,还会差异化吗?

★ 会 → 投。 ★ 不会 → 用标准接口(它们会随提供商的进步自动变好)。

什么在潮水里、什么不在

会被涨潮抬起来(别投)★ 涨潮抬不起来()
摘要、翻译、基础问答这类通用能力依赖「提供商拿不到的数据与专长」的领域特定能力
组织的专有文档、内部流程、积累的领域专长

最耐久的优势是什么

书给的这一句是全书的落点22:

★ 最耐久的优势,是把专有数据和深度的组织整合结合起来。

一个在这个组织的历史决策上微调过、嵌进它的工作流系统、 并且持续从它的运营数据里学习的模型—— ★ 竞争对手用开箱即用的接口是复制不了的。

走查:那封信拆成两半

★ 把「写一封拒付说明信」这件事拆开:

┌ 会被涨潮抬起来的那一半 ────────────────────────┐
│ · 把一份记录组织成一封结构清楚的正式信件 │
│ · 语气恰当、措辞专业、段落合理 │
│ · 语法与拼写 │
│ ★ 处置:**交给现成的服务。它们会自动变好。** │
└────────────────────────────────────────────────┘

┌ ★ 涨潮抬不起来的那一半 ────────────────────────┐
│ · 「本公司历来怎么解释模棱两可的第 7 条第 3 款」 │
│ ← 这来自 800 封真实历史信 + 三位资深专员的判断 │
│ · CT-06 这个内部代码体系 │
│ · 合规专员对「清楚且不误导」的那套判断 │
│ ★ 处置:**投。而且这正好是第 14 章那一整章。** │
└────────────────────────────────────────────────┘

★ 明年的预算问题因此有了答案:
**不是「这个模型还养不养」,是「这两半的边界今年移动了没有」。**

自建还是采购,是一道会移动的题

书对这件事的处理很漂亮,而且它的结论反直觉23:

提供商的微调接口从当初粗浅的参数调整,发展到支持复杂的定制流程; 提示缓存降低了「本来要把知识烤进权重」的上下文成本; 预建的领域模型覆盖了常见的垂直行业。 ★ 每一次进步,都把自研的门槛抬高。

★ 而书的转折在这里23:

但这不消灭自研的理由,反而使它更锐利。

★ 因为:如果一家企业的要求超出了成熟的提供商方案所能给的, 那些要求很可能正反映着竞争对手难以复制的真实差异化。

所以这是一道要反复重估的题24:

★ 三年前自研的一个模型,今天可能已经能被「能力更强、成本更低」的接口替代。
★ 反过来,当年看着能用接口解决的要求,可能已经演化到需要定制。

→ **它是持续的再评估,不是一次性的选择。**

10. 机制八:最稀缺的不是算力,也不是数据

那个反直觉的结论

书说得毫不含糊25:

★ 后训练里最稀缺的资源不是算力,也不是数据,而是人才。

三类人,而且每一类的定义都很挑剔25:

要求
机器学习工程师既懂训练动力学的理论,又会调试发散的训练
标注员能给出「改善模型行为」的反馈,而不只是填表
技术领导能在技法选择与资源分配上做出有见识的判断

而市场情况对中间那一档很不利26:

基础实验室在激进抢人,创业公司给出传统企业匹配不了的股权包, 学术管道的产出比以往快但仍供不应求。

★ 处在那个「关键中间层」的企业,与基础实验室正面抢顶尖人才通常不现实。

替代策略三条26:

  1. 用结构化的培训培养内部人才;
  2. 与研究机构合作;
  3. 组建「小核心专家 + 更广工程支持」的混合团队

★ 而标注队伍这一条,书说值得特别注意

这一段是这一章最容易被略过、也最该记住的27:

高质量的人类反馈,要求标注员既懂任务的领域, 又懂「什么让一个回答比另一个更好」的微妙之处。 建这个能力要时间:学领域、通过练习建立校准、拿反馈改进判断。

★ 投资建设一支标注队伍(而不是完全依赖众包或外包), 是一项会随时间复利的能力资产——微调数据的质量提升,模型质量随之提升。

★ 这笔人力资本的投入,不如算力开支显眼,但最终可能更有分量。

★ 这一条把第 07、14、17 三章串了起来: 第 07 章说「认得出比写得出便宜 60 倍」、第 14 章说「别让专家写、让专家判断」、 第 17 章说「保有高质量人类数据当分布锚的组织有结构性优势」—— 它们的共同前提,都是你有一支会判断的队伍。

怎么养:书在别处给了一份操作清单

上面只说了「值得投」。书另有一节讲「怎么投」,而它开头第一句就把方向定死了28:

★ 我合作过的最好的标注团队,不是招来的,是养出来的。

五条,顺序就是时间顺序28:

第几步做什么为什么是这一条
选人的标准招那些能把话写清楚、能照复杂指令办事的人★ 注意这里没有要求领域背景——那是下一步的事
重投领域教育书的用词是「大力投入他们的领域教育」领域知识教得会,写不清楚、跟不了指令教不会
每周开校准会专门讨论边界案例(那些「两边都说得通」的样本)★ 这是共同判断唯一的来源。不开这个会,十个标注员就是十把尺子
让他们看见结果建一条反馈回路,让标注员看得到「用他们的数据训出来的模型表现如何」书说这能造出主人翁感和动力
给它六个月★ 见下面那个参照物

那个参照物是这五条里最该记住的一个数28:

★ 六个月之后,一支养成的标注队伍能产出媲美专家标注的数据—— 而成本只是零头。

参照物往两头看: 第 07 章算过「让专家写一份完美答案 vs 让他在两份里挑一份」 差 60 倍;这里说的是另一件事——不是换个问法省钱,而是换一批人省钱: 你不必长期雇着领域专家来标注,六个月之后这支队伍产出的东西就和专家标的一个水准, 花的却只是零头。 代价是那六个月,以及上面四条不能省。

而书最后那句话的语气是全章最重的

这一段书自己用了「最重要的是」起头29:

★ 最重要的是:善待你的标注员。 他们不只是在产出让你的模型能用的数据,他们还是数据质量问题的第一道防线。 要让他们能提出疑虑、能建议改进、能为自己的工作感到自豪。

★ 我不止一次见到企业因为把标注员当成低技能、可弃的劳动力而追悔莫及。 考虑到他们对做出高质量模型的极端重要性,这既不道德也不公平, 而且从长远看还是一个非常昂贵的错误。

「第一道防线」这个说法值得停一下,因为它是可操作的: 标注员是唯一逐条看过你训练数据的人。 指令有歧义、样本混进了错的、领域规则变了——他们最先撞见。

★ 把他们当填表工,你就把这道防线关掉了。而下一个发现问题的地方, 是第 06 章那条已经跑了一周的训练曲线,或者更晚——上线之后。

11. 收束:技法会全换掉,不换的只有三条

全书开篇那个问题的答案

书用它开的头,也用它收的尾30:

我们以一个问题开始这本书:是什么把 「从 AI 系统里榨出非凡价值的组织」与「挣扎着做不出生产级结果的组织」区分开?

★ 答案更多在于对技法的掌握,而非对资源的获取。

反复出现的三条主题

这三条是全书的沉淀,而且书明说它们不会随技法一起过期31:

内容它在哪几章出现过
① 数据质量压过数据数量一千条精心策展的样例,胜过一百万条噪声样例05(垃圾进垃圾出)· 09(数据质量压过算法选择)· 14(10% 错误数据)· 17(砍到一半反而更好)
② 评估必须反映部署要求,而不只是基准表现在学术测试上出色的模型,可能在运营现实里失败10(自建题库)· 11(三级质量门)· 14(五层验证)· 18(人评必需)
③ 每个设计决策都是互相竞争的好东西之间的取舍能力 vs 效率、适配 vs 保全、定制 vs 通用;★ 没有普遍最优的选择,只有适合特定情境的选择全书

而技法本身会全部换掉

书自己把这件事说破了,而这正是它值得读的理由32:

今天占主导的那些具体算法,可能让位给更好的替代品; 那些特定的架构,可能被新的设计取代;而工具和框架必定会变。

★ 然而这些底层原则会留下来:仔细的数据策展、严格的评估、周到的取舍分析。 ★ 内化了这些原则的实践者,比只背下当前流程的实践者,更容易适应新技法。

从哪儿起步:三条

书最后给的建议,正好也是这套拆解的阅读顺序33:

★ ① 从给它看示范起步(第 05 章)——**动件少,反馈信号清楚**
★ ② 先掌握单模态,再碰多模态
★ ③ **先建评估基础设施,再上那些需要复杂评估的技法**

书给的警告:「强化学习听起来比示范训练唬人」这种诱惑可以理解,
★ **但跳过基础会导向挫败与失败;从理解到精通的路是练出来的,没有捷径。**

全书最后一句的定位

这一句解释了这本书为什么值得读完34:

后训练不只是一门技术学科,而是 ★ 基础模型的非凡能力,与真实世界部署的具体要求之间的一座桥。

这本书里的技法让这座桥成为可能,而运用它们的判断力则决定这座桥承不承得住重量。 ★ 对处在那个「关键中间层」的企业来说, 后训练大概是通往有意义的 AI 差异化的、最可及的一条路径。

12. 作者的判断与证据

说法是哪一类说明
「今天要微调、明天只要提示词」作者的战略判断他给了两个具体年份的例子,但没有配数据1
那张成熟度表作者的评估它是这一章最实用的东西,但「已可上生产 / 成熟中 / 研究阶段」是他的判断2
4000 亿总参数只激活 500 亿有据的架构事实这是这类结构的定义性质6
专家坍缩有据的已知问题书给了成因(训练数据偏斜)和对策7
专家的领域专门化「还没被理解、无法直接控制」书自己的限定我们照实转述,不把它写成可用的机制8
容量不等于有效利用作者的论断 + 两个例子那两个例子(找不到函数定义、漏掉夹在中间的邮件)是他构造的9
训练数据的正确答案要依赖中间位置机制的直接后果否则治不了偏重结尾的毛病10
人类反馈 vs 执行反馈的不对称可验证的事实「几千次 vs 几百万次」是量级1213
可验证域会迁移到不可验证域书自己标明是早期证据原文用的是「early evidence suggests」和「If this transfer proves robust」,两处都是条件式。我们照实写14
「太难也给不了学习信号」机制论证理由是「全都失败时模型分不清好办法和坏办法」16
课程训练可能总算力更省早期结果书用的措辞是「early results suggest」17
遗忘缓解三族有据的技法族每一族书都给了代价19
持续学习仍是研究目标作者的定性但他同时判断「经济诱因太强,技法很可能成熟起来」20
那条投资判据作者的战略框架它是这一章唯一可以直接拿去开会的东西21
「自研门槛被抬高反而使自研理由更锐利」作者的论证这是全章最漂亮的一处推理,但它是论证不是实测23
最稀缺的是人才作者的判断没有配调研数据25
标注队伍是会复利的能力资产作者的判断没有配数据,但它把第 07、14、17 三章串起来了27
那三条不变的主题全书沉淀它们是作者对整本书的自我总结31

13. 边界与局限

  1. 这一章几乎不给数字。 它是战略章,交付的是判断结构; 所以走查里的数比别的章更多是编的,我们每一处都标了。
  2. 那张成熟度表的分级会过期。 书 2026 年 1 月定稿, 「研究阶段」那两项完全可能在一两年内挪档;读者应当把它当作定稿时的快照。
  3. 那条「可验证域会迁移」的推测,是全书赌注最大的一条,而书没有给判断它的办法。 我们照实标成推测。
  4. 混合专家那一节书讲得很浅。 它给了机制和一个麻烦, 但没有给任何可照做的配方;要真做,书本身不够。
  5. 书里那个「让编码助手帮你监控研究进展」的部分,我们按全书口径不覆盖。 它有一条口径值得记:它不替代自己读论文,但大幅减少「找哪些论文该读」的时间。
  6. 书没有给「投多少钱」的任何数字。 它给的是「投什么、不投什么」的判据, 具体金额得你自己按显卡小时和专家小时算。

14. 可带走的

  1. ★★ 今天要微调才有的能力,明天可能只要提示词就够了; 战略回应不是不投,而是只投「基线推进之后仍然差异化」的那部分;
  2. 六项新技法的成熟度:★ 已可上生产的三项——推理时算力(要为可变成本留预算)、 长上下文训练(要有长上下文数据)、从执行反馈做强化学习(要有验证基础设施); 成熟中的一项——混合专家;研究阶段的两项——自动课程、持续学习;
  3. ★★ 每次回答的成本可以从常数变成变量:简单问题快而便宜, 复杂问题给延长的推理,可能贵好几个数量级但相应地做得更好;
  4. 由此训练目标也变了:模型要学的不只是产出好回答, 还有评估自己的输出、找出弱点、迭代改进; ★ 所以逐步给分的奖励模型,比只看终点的更重要;
  5. 新的取舍轴是「响应时间 对 响应质量」; ★ 而「有效使用额外算力」这件事本身是可训练的;
  6. 混合专家挑战的是「所有参数都必须参与每一次前向」这个假设: ★ 4000 亿总参数可能只激活 500 亿;
  7. 后训练它有独有的麻烦:微调会打乱已学好的路由;数据偏斜会导致专家坍缩; ★ 常见做法是初期冻住路由器,让专家先适配,之后再重训路由;
  8. 专家会自发形成领域专长这件事,书自己说「还没被完全理解、也无法直接控制」;
  9. ★★ 容量不等于有效利用:百万 token 的窗口能「看见」整个代码库, 却仍可能找不到那个函数定义;
  10. 训练数据的正确答案必须依赖中间位置的信息, 否则治不了「偏重结尾」的近因偏差;
  11. 超出窗口之外的方向是跨会话持久的外部记忆——外挂检索是一种, 把信息压缩存储以备后取的学到的记忆系统是另一种;
  12. ★★ 那条不对称是下一步的核心:人类反馈昂贵、缓慢、规模有限; 执行反馈(代码过没过测试、证明验没验过)便宜、快、无限; ★ 人在环能管几千次迭代的地方,这里能做几百万次;
  13. 但「可验证域会迁移到不可验证域」,书自己写的是「早期证据显示」——是推测不是定论;
  14. ★★ 课程学习的核心思想:把样例呈现在模型当前能力的边缘上。 太易没信号(它已经会了),太难也没信号(全都失败时它分不清好办法和坏办法);
  15. 难处是难度估计本身要花算力; ★ 但早期结果表明:课程训练的模型有时用更少的总算力达到更高的最终表现;
  16. 现在把改进当离散事件,代价是能力缺口—— 今天部署的模型反映的是训练时可得的数据,不重训就吸收不了生产经验;
  17. ★★ 持续学习的障碍就是灾难性遗忘,三族缓解各有代价: 回放要存旧数据 · 正则化要先算出哪些参数重要 · 加模块会让模型变大; 没有哪一族能完全解决,但组合起来能保住大部分旧能力;
  18. ★★ 这是「别走远」最后一次换名字,它管的是时间上的累积漂移—— 前四处都在管「这一次改动」,只有这一次在管「改了一百次之后它还是不是它」;
  19. 持续学习仍是研究目标,但经济诱因强到技法很可能成熟起来;
  20. ★★ 那条投资判据只有一句:这个能力在领域推进之后还会差异化吗? 会就投,不会就用标准接口(它们会自动变好);
  21. ★★ 最耐久的优势是专有数据 + 深度组织整合: 一个在历史决策上微调过、嵌进工作流、并持续从运营数据学习的模型, 竞争对手用开箱即用的接口复制不了;
  22. 自建还是采购是一道会移动的题,而且它的逻辑反直觉: 提供商每进步一次就把自研门槛抬高一次,而这反而让自研的理由更锐利—— ★ 如果你的要求超出了成熟方案能给的,那些要求很可能正反映着难以复制的真实差异化;
  23. ★★ 最稀缺的不是算力也不是数据,是人: 既懂训练动力学又会调试发散训练的工程师 · 能给出「改善模型行为」而不只是填表的标注员 · 能在技法选择上有见识地判断的技术领导;
  24. 中间层企业与基础实验室正面抢人不现实;替代是内部培养、与研究机构合作、 小核心专家 + 更广工程支持的混合团队;
  25. ★★ 标注队伍是一项会随时间复利的能力资产——数据质量提升,模型质量随之提升; 这笔投入不如算力开支显眼,但最终可能更有分量;
  26. ★★ 最好的标注团队不是招来的,是养出来的,五步: 招能把话写清楚、能照复杂指令办事的人(不要求领域背景)→ 大力投入他们的领域教育 → 每周开边界案例的校准会来建立共同判断 → 让他们看得见「用他们的数据训出来的模型表现如何」→ 给它六个月。★ 六个月之后,这支队伍产出的数据能媲美专家标注,成本只是零头;
  27. ★★ 善待标注员——他们是数据质量问题的第一道防线,是唯一逐条看过训练数据的人; 书说不止一次见到企业因为把他们当低技能、可弃劳力而追悔莫及;
  28. ★★ 全书那个问题的答案:区别更多在于对技法的掌握,而非对资源的获取;
  29. ★★ 技法会全部换掉,不换的只有三条: ① 数据质量压过数量(一千条精心策展胜过一百万条噪声); ② 评估必须反映部署要求,而不只是基准表现; ③ 每个决定都是取舍,没有普遍最优,只有适合特定情境的选择;
  30. 从哪儿起步:先做示范训练(动件少、反馈清楚)· 先单模态再多模态 · ★ 先建评估基础设施,再上需要复杂评估的技法;
  31. 跳过基础会导向挫败与失败;从理解到精通的路是练出来的,没有捷径;
  32. 后训练是基础模型的能力,与真实部署的要求之间的一座桥; 对处在「关键中间层」的企业,它大概是通往有意义的差异化最可及的一条路径。

15. 原文地图

主题原书章原文位置
标注队伍怎么养:五步与那六个月BUILDING ANNOTATION CAPABILITYtext/35-fm-building-annotation-capability.txt:3(搜「not hired but grown」)
善待标注员 · 第一道防线BUILDING ANNOTATION CAPABILITYtext/35-fm-building-annotation-capability.txt:5(搜「first line of defense」)
前沿在挑战哪些假设 · 成熟度表The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:5(搜「challenge assumptions we have treated as settled」) · :9(搜「Readiness and Enterprise Applicability」)
成本从常数变成变量 · 对训练目标的改变 · 新取舍轴The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:69(搜「a variable rather than a constant」) · :75(搜「evaluate their o」) · :79(搜「response time versus response quality」)
混合专家 · 专家坍缩 · 未被理解的专门化The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:83(搜「all parameters must participate in every forward pass」) · :85(搜「fine-tuning can disrupt learned routing patterns」) · :87(搜「Different experts may develop specialization」)
长上下文 · 容量不等于有效利用 · 外部记忆The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:91(搜「millions of tokens that enable processing entire codebases」) · :93(搜「attend more reliably to information throughout their context」) · :95(搜「external memory mechanisms that persist」)
那条不对称 · 执行反馈 · ⚠ 迁移那条推测The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:99(搜「cheap, fast, and unlimited」) · :103(搜「requiring no human annotation」) · :107(搜「transfer to domains where verification is impossible」)
课程学习 · 边缘原则 · 实现困难The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:111(搜「arithmetic before algebra」) · :113(搜「the model」) · :115(搜「at the edge of the model」) · :117(搜「Difficulty estimation requires evaluating the model」)
持续学习 · 遗忘缓解三族The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:121(搜「a discrete event with clear boundaries」) · :129(搜「Three families of techniques」) · :137(搜「None fully solves the problem」)
★ 涨潮抬不起来的船 · 那条投资判据 · 最耐久的优势The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:143(搜「What the Rising Tide Will Not Lift」) · :145(搜「surpassed by off-the-shelf capabilities」) · :147(搜「cannot be replicate」)
自建还是采购The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:151(搜「The build-versus-buy calculus shifts continuously」) · :155(搜「regularly reassess their build-versus-buy decisions」)
人才瓶颈 · 标注队伍The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:159(搜「not compute or data but talent」) · :163(搜「Annotation workforce development deserves particular attention」)
全书回收 · 三条不变的 · 从哪儿起步 · 最后的定位The Shifting Frontiertext/164-fm-the-shifting-frontier.txt:167(搜「mastery of technique」) · :171(搜「a thousand carefully curated examples」) · :173(搜「these underlying」) · :187(搜「Build capability incrementally」) · :191(搜「a bridge between the remarkable capabilities」)

Footnotes

  1. 出处:「The Shifting Frontier」第 145 段(text/164-fm-the-shifting-frontier.txt:145,搜「surpassed by off-the-shelf capabilities」)与第 141 段(text/164-fm-the-shifting-frontier.txt:141,搜「may require only prompting tomorrow」)。这一节的标题是「涨潮抬不起来的那些船」(见第 143 段,text/164-fm-the-shifting-frontier.txt:143,搜「What the Rising Tide Will Not Lift」)。第 145 段还点明该避开的是通用能力(摘要、翻译、基础问答),该聚焦的是那些依赖「提供商拿不到的数据与专长」的领域特定能力 2 3

  2. 出处:「The Shifting Frontier」第 9 段(text/164-fm-the-shifting-frontier.txt:9,搜「Readiness and Enterprise Applicability」)。这是书里的表 13-1,六行,列出技法、成熟度、最佳用例、关键前提。「已可上生产 / 成熟中 / 研究阶段」这三档是作者的判断,而且它是 2026 年 1 月定稿时的快照。 第 5 段(text/164-fm-the-shifting-frontier.txt:5,搜「challenge assumptions we have treated as settled」)是这一章的开场:前沿研究在挑战那些我们已经当成定论的假设 2

  3. 出处:「The Shifting Frontier」第 69 段(text/164-fm-the-shifting-frontier.txt:69,搜「a variable rather than a constant」)与第 73 段(text/164-fm-the-shifting-frontier.txt:73,搜「orders of magnitude more but achieves」)。原文列的三种机制是:带验证的束搜索(生成多个候选再评估选择)、迭代精修(批评并改进初始回答)、以及用学到的价值函数引导探索的树搜索。同段还有一句:在难题上,小模型加充足的推理时算力,可能胜过大模型的单遍回答。

  4. 出处:「The Shifting Frontier」第 75 段(text/164-fm-the-shifting-frontier.txt:75,搜「evaluate their o」)。那句「评估中间步骤的奖励模型比只评最终答案的更重要」直接回指第 16 章。 同段还要求训练课程转向那些「推理时的额外算力能带来优势」的更难问题。 2

  5. 出处:「The Shifting Frontier」第 79 段(text/164-fm-the-shifting-frontier.txt:79,搜「response time versus response quality」)。这是书里一个独立的小方框。那句「有效使用额外算力这件事本身是可训练的,只是训练方式与单遍优化不同」是它最有价值的一条。

  6. 出处:「The Shifting Frontier」第 83 段(text/164-fm-the-shifting-frontier.txt:83,搜「all parameters must participate in every forward pass」)。那组数字(4000 亿总参数、任一输入只激活 500 亿)是书里给的。 2 3

  7. 出处:「The Shifting Frontier」第 85 段(text/164-fm-the-shifting-frontier.txt:85,搜「fine-tuning can disrupt learned routing patterns」)。原文明说:训练数据偏斜时,一部分专家拿到不成比例的训练信号而另一些停滞——这叫专家坍缩,它会降低模型能力;负载均衡损失能鼓励均衡使用但超参要小心调;而常见做法是初期微调时冻住路由器,让专家先适配,之后再重训路由以反映新的专家能力 2 3

  8. 出处:「The Shifting Frontier」第 87 段(text/164-fm-the-shifting-frontier.txt:87,搜「Different experts may develop specialization」)。★ 书自己明确写道:这种涌现出来的专门化还没有被完全理解,也无法直接控制。我们照实转述,不把它写成可用的机制。 2

  9. 出处:「The Shifting Frontier」第 91 段(text/164-fm-the-shifting-frontier.txt:91,搜「millions of tokens that enable processing entire codebases」)。那两个例子(能看见整个代码库却找不到那个函数定义、能读完整套取证文档却漏掉夹在中间的关键邮件)是书里的原例。 2 3

  10. 出处:「The Shifting Frontier」第 93 段(text/164-fm-the-shifting-frontier.txt:93,搜「attend more reliably to information throughout their context」)。那条对训练数据的硬要求(正确答案要依赖各个位置上的信息,而不只是开头和结尾)是这一节唯一可以直接照做的东西。 原文还点名了要治的那个毛病:把上下文末尾的信息看得过重的近因偏差。 2 3

  11. 出处:「The Shifting Frontier」第 95 段(text/164-fm-the-shifting-frontier.txt:95,搜「external memory mechanisms that persist」)。原文那句收口是:能训出「会记住、并在过去交互之上继续构建」的模型,会从根本上改变 AI 助手能做什么。

  12. 出处:「The Shifting Frontier」第 99 段(text/164-fm-the-shifting-frontier.txt:99,搜「cheap, fast, and unlimited」)。这一段的标题就是关于不对称的,而它是这一章后半段的组织原则。 2

  13. 出处:「The Shifting Frontier」第 103 段(text/164-fm-the-shifting-frontier.txt:103,搜「requiring no human annotation」)与第 105 段(text/164-fm-the-shifting-frontier.txt:105,搜「millions of iterations」)。那组量级对照(人在环几千次 vs 这里几百万次)是书里给的。 2

  14. 出处:「The Shifting Frontier」第 107 段(text/164-fm-the-shifting-frontier.txt:107,搜「transfer to domains where verification is impossible」)。★ 原文用的是「early evidence suggests」和「If this transfer proves robust」——两处都是条件式。 第 16 章那一处(text/132-fm-trust-but-verify-learning-from-verifiable-reward.txt:15,搜「appears to transfer」)同样是条件式。我们两处都照实标成推测。 2

  15. 出处:「The Shifting Frontier」第 111 段(text/164-fm-the-shifting-frontier.txt:111,搜「arithmetic before algebra」)与第 113 段(text/164-fm-the-shifting-frontier.txt:113,搜「the model」)。第 113 段那句实操坦白是:目前多半的出路,是用那些难度或复杂度可以确定的考试,或者拿一批考生的成绩当难度的代理。 2

  16. 出处:「The Shifting Frontier」第 115 段(text/164-fm-the-shifting-frontier.txt:115,搜「at the edge of the model」)。「太难的给的是噪声信号——全都失败时模型分不清好办法和坏办法」这一条,和第 09 章那族按难度调整的做法依据的是同一件事。 书还用了一个比方:像一个实时调整挑战难度的好教练。 2

  17. 出处:「The Shifting Frontier」第 117 段(text/164-fm-the-shifting-frontier.txt:117,搜「Difficulty estimation requires evaluating the model」)。那句「课程训练的模型有时用更少的总训练算力达到更高的最终表现」,书用的措辞是「早期结果表明」。 2 3

  18. 出处:「The Shifting Frontier」第 121 段(text/164-fm-the-shifting-frontier.txt:121,搜「a discrete event with clear boundaries」)。那句「今天部署的模型反映的是训练时可得的数据,不重训就吸收不了生产经验里的教训」,正是第 14 章那句「2024 年的模型是 2026 年的遗留系统」的机制。

  19. 出处:「The Shifting Frontier」第 129 段(text/164-fm-the-shifting-frontier.txt:129,搜「Three families of techniques」)与第 137 段(text/164-fm-the-shifting-frontier.txt:137,搜「None fully solves the problem」)。三族的定义分别见第 131、133、135 段(text/164-fm-the-shifting-frontier.txt:131,搜「Replay methods mix old examples」;text/164-fm-the-shifting-frontier.txt:133,搜「penalize changes to parameters important」;text/164-fm-the-shifting-frontier.txt:135,搜「add new capacity rather than modifying existing weights」)。第 125 段(text/164-fm-the-shifting-frontier.txt:125,搜「Elastic weight consolidation」)给了正则化那一族的一个具体方法名。 2 3

  20. 出处:「The Shifting Frontier」第 137 段(text/164-fm-the-shifting-frontier.txt:137,搜「preserve most prior capability while enabling」)。「经济诱因太强,技法很可能成熟起来」是作者的判断,他给的理由是「消除重训周期能大幅降低运营成本」。 2

  21. 出处:「The Shifting Frontier」第 147 段(text/164-fm-the-shifting-frontier.txt:147,搜「cannot be replicate」)。那条判据的原话是:这个能力在领域推进之后还会差异化吗?会就投,不会就用标准接口——它们会随提供商的进步自动变好。 2

  22. 出处:「The Shifting Frontier」第 147 段(text/164-fm-the-shifting-frontier.txt:147,搜「The most durable advantages combine proprietary data」)。这一句是全书的战略落点,也是第 01 章那句「人格租不来」的最终形态。

  23. 出处:「The Shifting Frontier」第 151 段(text/164-fm-the-shifting-frontier.txt:151,搜「The build-versus-buy calculus shifts continuously」)。原文列了三条抬高门槛的进步:微调接口变强、提示缓存降低了上下文成本、预建的领域模型覆盖了常见垂直。★ 那个转折(门槛被抬高反而让自研理由更锐利)是全章最漂亮的一处推理:如果一家企业的要求超出了成熟方案能给的,那些要求很可能正反映着竞争对手难以复制的真实差异化。 2 3

  24. 出处:「The Shifting Frontier」第 155 段(text/164-fm-the-shifting-frontier.txt:155,搜「regularly reassess their build-versus-buy decisions」)。原文举了两个方向的例子:三年前自研的模型今天可能已被更强更便宜的接口替代;而当年看着能用接口解决的要求,可能已演化到需要定制。

  25. 出处:「The Shifting Frontier」第 159 段(text/164-fm-the-shifting-frontier.txt:159,搜「not compute or data but talent」)。三类人的定义都在这一段,而每一类的定语都很挑剔——尤其标注员那一条:「能提供改善模型行为的反馈,而不只是填表」。 2 3

  26. 出处:「The Shifting Frontier」第 161 段(text/164-fm-the-shifting-frontier.txt:161,搜「hybrid teams」)。原文明说处在那个关键中间层的企业,与基础实验室正面抢顶尖人才通常不现实,并给了三条替代策略。 2

  27. 出处:「The Shifting Frontier」第 163 段(text/164-fm-the-shifting-frontier.txt:163,搜「Annotation workforce development deserves particular attention」)。★ 那句「这笔人力资本的投入不如算力开支显眼,但最终可能更有分量」是这一章最容易被略过的一条。 原文还说明了建这个能力为什么要时间:学领域、通过练习建立校准、拿反馈改进判断。 2

  28. 出处:「BUILDING ANNOTATION CAPABILITY」第 3 段(text/35-fm-building-annotation-capability.txt:3,搜「not hired but grown」)。原文这一段是作者的亲历口径:我合作过的最好的标注团队不是招来的,是养出来的;起手先招那些能把话写清楚、能照复杂指令办事的人,然后大力投入他们的领域教育;每周开一次校准会讨论边界案例,以此建立共同判断;再建一条反馈回路,让标注员看得到用他们的数据训出来的模型表现如何,由此造出主人翁感和动力;六个月之后,一支养成的标注队伍能产出媲美专家标注的数据,而成本只是零头。 上面那张表的分步与「为什么是这一条」两列是我们按这段话拆的,书里是连续一段。 2 3

  29. 出处:「BUILDING ANNOTATION CAPABILITY」第 5 段(text/35-fm-building-annotation-capability.txt:5,搜「first line of defense」)。原文以「最重要的是」起头:善待你的标注员——他们不只是在产出让你的模型能用的数据,还是数据质量问题的第一道防线;要让他们能提出疑虑、能建议改进、能为自己的工作感到自豪。作者接着写:不止一次见到企业因为把标注员当作低技能、可弃的劳动力而追悔莫及;考虑到他们对做出高质量模型的极端重要性,这既不道德也不公平,而且从长远看还是一个非常昂贵的错误。 「他们是唯一逐条看过训练数据的人」这一句解释是我们加的,书里没有明说。

  30. 出处:「The Shifting Frontier」第 167 段(text/164-fm-the-shifting-frontier.txt:167,搜「mastery of technique」)。这句话呼应的是全书开篇提出的那个问题。

  31. 出处:「The Shifting Frontier」第 171 段(text/164-fm-the-shifting-frontier.txt:171,搜「a thousand carefully curated examples」)。原文三条依次是:数据质量比数量更重要;评估必须反映部署要求而非仅仅基准表现(在学术测试上出色的模型可能在运营现实里失败);每个设计决策都是相互竞争的好东西之间的取舍——能力对效率、适配对保全、定制对通用,而且没有普遍最优的选择,只有适合特定情境的选择。 2

  32. 出处:「The Shifting Frontier」第 173 段(text/164-fm-the-shifting-frontier.txt:173,搜「these underlying」)。★ 那句「内化了这些原则的实践者,比只背下当前流程的实践者更容易适应新技法」,正好也是这套拆解存在的理由。

  33. 出处:「The Shifting Frontier」第 187 段(text/164-fm-the-shifting-frontier.txt:187,搜「Build capability incrementally」)。那句警告的原话是:跳过基础会导向挫败与失败;从理解到精通的路是练出来的,没有捷径。

  34. 出处:「The Shifting Frontier」第 191 段(text/164-fm-the-shifting-frontier.txt:191,搜「a bridge between the remarkable capabilities」)。全书最后那句关于「关键中间层」的定位,和第 01 章那一节首尾呼应。