跳到主要内容

让它变成你的 — 别让专家写下他们知道的,让专家去判断

这一章讲三件事: 通用模型在你这一行到底缺什么(而且它自己不知道缺); 机构里最值钱的那部分知识为什么写不下来、以及怎么绕过「写下来」这一步把它装进模型; 以及装进去之后,怎么验、怎么放、怎么养。

它在全书链条里的位置:这是全书真正的落点。 前面十三章都是通用工序——任何人拿同样的开源模型跑同样的流程,得到的东西差不多。 这一章是唯一一处「别人复制不了」的地方。 而它接的是第 07 章那台机器:那里造出了「把判断变成可优化的量」的能力, 这里把它接到企业最值钱、也最难交付的那项资产上。

第 04 章那条暗线「别走远」在这一章第四次出现, 这一次它管的是数据的构成:领域数据和通用数据按比例混。

1. 先看现象:外行惊艳,专家皱眉

书开篇给的场景只有两句话,但它把整章的问题说完了1:

拿心脏病学去问一个前沿模型,它会产出自信、流畅的文字,听在外行耳朵里相当唬人。 把同一段输出拿给一位心脏科医生看,你会看着他皱眉。

它混淆药物类别、引用多年前就已被取代的指南、 漏掉任何一位医生都会注意到的临床细节。

为什么它自己不知道自己在胡说

这是这一节最要紧的一句,而且原因很具体1:

模型知识的不均匀是很惊人的。 这一点和人没什么不同—— 区别在于,大多数人知道自己的缺口在哪。

而因为我们是分开训练「领域知识」和「态度」的, 所以它的自信是普遍的,哪怕它的知识不是。

★ 这一条要记住,它解释了后面所有验收动作为什么必须做。 模型不会举手说「这一块我不熟」,它会用同样流畅的语气把错的说出来。

病灶的名字:流利地一无所知

书对这个病的定性一句话2:

问题不是能力,是具体性。 底座模型被训成通才,学的是广而相对浅的知识。 所以它对心脏病学(或者金融、法律、材料工程、文艺复兴早期诗歌)的了解同样地广、 但不深,更绝不是你们组织实践它的那个方式。

你们组织积累下来的知识——你们用的术语、你们遵守的法规、 你们的专家凭本能做出的那些判断——在模型的训练数据里根本不存在。

书给了一个特别具体的例子来说明「行业惯例和日常语言会打架」3:

核磁共振报告里有一个词叫 flow void(直译:血流空缺)。

按日常语言理解:没有血流。
实际的意思:**恰恰因为血液流出了成像层面,所以那个位置没有信号。**
★ 完全相反。

书的判词:在法律、医疗、技术写作这类领域里,这种怪癖比比皆是;
**而风格上的特异性是可欲的,领域上的特异性却可能带来法律与监管后果。**

这不是缺陷,是训练过程的必然

这一句划掉了「等更大的模型出来就好了」这条退路4:

这些局限不是待修的缺陷,而是训练过程本身的特征。 模型学到的是数据里有的东西,而广泛的互联网训练数据,是拿深度换来的广度。

维基百科用几千字讲完心脏病学;而一位心脏科医生积累的是多年判读心脏超声的临床经验。 训练数据传递不了默会知识、演变中的最佳实践、以及从领域经验里长出来的判断。

「默会知识」这个词在这里第一次出现,它的意思就是上面那一句: 会做,但说不出来为什么这么做。 第 6 节会正面处理它。

一句必须转述的立场声明

书在这里主动划了一条界,免得整章被误读5:

我不是在暗示语言模型以人类专家的方式「理解」医学或法律。 领域训练的目的也不是灌输对事实的知晓(那个目标用几乎任何别的办法都更划算)。 ★ 目的是:教这个模型产出不只是像模像样、而且是正确的输出。

他还给了一个很精确的措辞区分:

「写得像一位心脏科医生」和「作为一位心脏科医生来写」之间有一道细微的分别。 一个「推理起来像心脏科医生」的模型——哪怕它在任何人类意义上都不懂心脏病学—— 产出的东西更可能是对的,也更可能被领域专家信任。5

2. 顶层全景:一架五级的干预阶梯

┌ ① 只写提示词 ──────── 要什么数据:无 成本:可忽略
│ 什么时候够:这个领域在预训练里覆盖得很好

├ ② 外挂检索 ────────── 要什么数据:领域文档 成本:低到中
│ 什么时候用:信息是时新的,或者是你专有的

├ ③ 领域示范训练 ────── 要什么数据:几百到几千例 成本:中
│ 什么时候用:要改的是**任务上的行为**

├ ④ 继续预训练 ──────── 要什么数据:**几十亿 token** 成本:高
│ 什么时候用:领域错配严重;有全新的术语体系

├ ⑤ 领域偏好优化 ────── 要什么数据:专家的偏好判断 成本:很高
│ 什么时候用:要把质量精修到**超过示范所能达到的水平**

└ ⑥ 全套一起上 ──────── 以上全要 成本:最高
什么时候用:**受监管的领域;对生产至关重要的场景**

图说:**这是第 03 章那条「越便宜的越先试」在领域这一侧的完整展开。**
★ 书的判据一句话:**把干预的强度匹配到领域的要求上**——
领域缺口深就重投,通用能力够用就轻放。

主走查(全章共用): 「本公司历来怎么解释模棱两可的第 7 条第 3 款」——这件从没被写下来的事,怎么装进模型。 后面每一节各出一步:第 6 节把它变成训练信号,第 9 节验它,第 10 节放它上线。 编造的数每次出现都会标明。

3. 机制一:通用模型在你这一行具体缺什么

上一节讲了病灶,这一节讲它具体会怎么犯病——因为你得认得出这些症状才能对症。

书列了四种可预测的表现6:

症状具体是什么走查里长什么样
认不出领域术语把技术词切得七零八落,或者把它和听起来相似的通用词混起来「CT-06」被切成 CT + - + 06 三块,模型不知道这是一个整体
用的是十年前的惯例那些当年是标准、后来已经变了的做法引了 2019 年版的保单模板措辞
不知道你这个领域特有的实体药名、法律先例、行业特定法规CT-06 这个拒付代码是这家公司自己定的,任何训练数据里都没有
输出对外行像模像样,却违反任何专家一眼能看出的约束信里写了「建议您尽快复诊」——这是医疗建议,保险公司不能给

为什么这件事对企业格外要命:机构知识流失是有价钱的

书举了一个极端但很有说服力的例子7:

有一种物质代号 FOGBANK,几乎所有关于它成分与用途的信息都是保密的, 只知道它是热核武器的关键部件。

当美国要翻修老化的核弹头时才发现:冷战结束后停产的那十年里, 制造它的专门知识已经失传了。 花了五年、几百万美元,才把几十年前本来众所周知的东西逆向工程回来。

书的判词:这就是机构知识,以及失去它的代价。

机构知识有三种形态,最值钱的恰恰是最难拿的那种

书把它分成三层,这个分法是整章后面所有做法的地基8:

形态在哪儿好不好拿
显性知识内部文档、政策、流程手册好拿。但它只是冰山露出来的那一角
隐含知识嵌在系统的结构里、嵌在决策的模式里难拿。没人把它写下来,但它体现在「事情实际是怎么走的」里面
默会知识在资深从业者身上:他们知道事情该怎么做,却说不清为什么最难拿,也最值钱

书的收口:这三种形态合起来构成一项资产—— 竞争对手没法直接下载它;就算下载到了,也不知道该怎么用。8

4. 机制二:五级阶梯,以及词表这一层能做什么

先兑现第 03 章那条判据

第 03 章给过一句判据,书在这一章还要用它:

问自己:模型是需要「知道不一样的东西」,还是需要「表现得不一样」? 知识问题 → 外挂检索。行为问题 → 改参数。

在这一章,它变成了那架阶梯的第 ② 级和第 ③ 级之间的分水岭:

你的缺口上哪一级
「它应该知道我们这版保单的第 7 条」② 外挂检索就够了
「它应该按我们公司的口吻和格式写拒付信」③ 领域示范训练
「它应该像我们的资深专员那样解释模棱两可的条款」⑤ 领域偏好优化(第 6 节)

第 ④ 级:什么时候连示范训练也不够

这一级和前三级有质的不同,书说得很明白9:

有些领域缺口深到任务示范填不上。这时模型需要的是接触「你这个领域的语言是怎么运作的」。

示范训练教的是「怎么执行具体任务」;继续预训练动的层次更深—— 它调整的是模型对词、概念和它们之间关系的表示,让这些表示更符合这个领域里它们的实际用法。

书给了一个很硬的例子:

一个在预训练里从来没碰到过量子化学术语的模型, 靠几百条微调样例是学不会正确使用那些术语的。 它需要的是「在很多文档里,看到这些术语被放在上下文里使用」。9

什么时候该上这一级,书给了三个可以当场查的信号10:

信号怎么查
切词有问题领域术语被切成一堆别扭的碎片,模型没法连贯处理
知识过时从模型的训练截止到现在,这个领域出了新法规、新产品、新术语、新的最佳实践
文体不合领域文本遵循的书写惯例,和通用文本差别很大

代价先说清楚10:

这一级比示范训练贵得多:通常要几十亿 token 的领域文本, 算力预算以几千到几万显卡小时计。 第 12 章那套「只训一小块旁路」能压低它的显存占用,但算力时间仍然可观。

一个可以当参照物的真实数字11:

一份被广泛采用的继续预训练配方(它影响了某个知名模型家族)设想的是约 28 亿 token 的 精选领域文本。 书的按语:这按任何标准都不是一次随随便便的数据收集。

★ 词表这一层:第 02 章那笔欠账在这里还

第 02 章讲切词时留过一句「领域术语被切碎怎么办,第 14 章讲」。答案分三层。

第一层:能不能干脆换掉切法?

技术上可以,但实践中远不如「在现有词表内想办法」常见。12

第二层:扩词表(往现有词表里加新 token)。

做法是:加新 token → 把嵌入层扩大 → 给新 token 初始化一个向量 (通常用现有向量的平均,或者用这个新词被切碎后那几块的向量)12

有研究表明这确实能改善领域表现:在化学文献上做继续预训练之前先加化学术语 token, 能缩短序列长度,并可能提升下游任务表现。 ★ 但书的定性很克制:扩词表仍然更多是一个活跃的研究课题,而不是标准做法。12

第三层:更常见的两条替代路12:

做法意思
不改词表,直接在领域文本上继续预训练让模型通过大量接触,自己为那些被切碎的术语学出更好的表示。 书举了一个例子:某种把领域语料改写成阅读理解格式的做法,让一个 70 亿参数的模型在结果上能和大得多的专用领域模型竞争
实体感知训练教模型正确处理领域实体,而不把它们加成新 token

但有一种情况扩词表确实说得通:让 token 去表示别的东西

这是这一节最有冲击力的一段,而且它把第 02 章那个「token 是什么」推到了尽头13:

最清楚的一种情况是符号化切词:让 token 代表的不是文字,而是别种形式的信息。

一个临床基础模型,在 1.18 亿名患者、1150 亿条医疗事件上训练。
★ 它的词表只有 7105 个 token,而这些 token 代表的不是词,是临床概念:

事件之间的时间 → 被切成区间桶,从「1–5 分钟」到「3–6 个月」;
超过六个月的间隔,就生成多个「6 个月」token
诊断 → 表示为疾病编码的片段序列(大类、小类、扩展)
用药 → 变成药物分类编码的 token(解剖学组、药理学亚组、化学物质)
化验结果 → 用两个 token:一个是化验项目的编码,
一个是这个结果落在哪个十分位桶里

★ 然后它干的事和语言模型一模一样:**预测下一个医疗事件。**
于是它能预测患者的时间线、筛查疾病风险、预判就医交互 ——
全部来自「一个接一个地往下生成」。

书给的那句总结,是理解这整件事的钥匙13:

词表被扩充的不是新的词,而是一整个新的模态。 这之所以可能,是因为 token 归根到底对「它代表什么」是无所谓的—— 它们只是被映射到向量空间的一串离散编号。

参照物:第 02 章讲过,通用模型的词表通常是几万到十几万个 token。 这个临床模型只有 7105 个——但它们每一个都承载着一个完整的临床概念, 而不是一个词的碎片。

5. 机制三:混合比是「第二个学习率」★ 别走远第四次

现象:学会新的,就会忘掉旧的(第 04 章那件事,规模放大版)

继续预训练那一级的风险,书写得很直白14:

随着模型适应领域数据,它可能丢掉原来具备的通用能力。 机制就是第 04 章讲过的那一条:训练的本质是调整权重去降低训练数据上的损失, 而那些对通用能力重要的权重,如果能被改用来更好地拟合领域模式,就可能被覆盖掉。

一个原本能摘要新闻、能答常识问题的模型,会随着它越来越专门化而失去这些能力。

怎么做:按比例混

书给的第一条对策就是数据混合15:

把领域文本和通用文本混在同一份训练语料里, 确保模型在学领域模式的同时,仍然持续看到那些锻炼通用能力的样例。

★ 于是这个混合比本身变成了一个超参数,而它的两头正好对称:

混得更偏领域混得更偏通用
适应更快保住能力
遗忘风险更大领域学得更慢

书给的起手值和调法

一个常见的起手点是:七成领域数据、三成通用数据。 训练之后领域表现不够 → 提高领域那一份。 通用能力退化到不可接受 → 提高通用那一份。 ★ 两边都要监控:盯领域基准的同时,也要盯那些「你需要保住的能力」对应的通用基准。16

★ 那句给它命名的话

书自己引了从业者的一个叫法,而这个叫法正好把这一节钉进我们那条暗线16:

有些团队开始把这个混合比称作「迷你学习率」, 因为它在另一个方向上表现出相似的动力学: 混合比更低(领域含量少)= 更安全但更慢;混合比更高 = 适应更快,但灾难性遗忘的风险高得多。

★ 这就是「别走远」的第四副面孔,它管的是数据的构成。 第 04 章那次管每一步的位移(学习率)、第 08 章那次管输出的分布(偏离惩罚)、 第 12 章那次管能动的方向数(低秩); 这一次,它靠「让模型持续看见旧世界」来防止它走丢。

四者仍然不能互相替代: 混合比管不了「这一步迈多大」, 也管不了「输出会不会漂到参考模型认不出来」。 它管的是——模型的训练视野里,还剩多少旧世界。

书专门点名的那个最常见的错

这一条值得单独抄出来16:

我在实践中相当常见的一个错误是:定了一个混合比,然后只监控领域能力。 如果领域能力涨到了令人满意的水平,而通用能力退化了,这个混合比就值得重新想一遍。

另外两条对策,以及一条选取标准

书还给了两条15:

对策做什么
降低学习率每次梯度更新对预训练权重做更小的改动,限制它能走多远(★ 就是「别走远」的第一副面孔)
正则化 / 蒸馏回原模型把原模型当老师,让新模型在通用任务上别偏离它太多(★ 第 12 章那个蒸馏,反过来用)

该在这几条之间怎么取舍,书给了一条按部署场景来定的判据17:

★ 只做领域任务的模型(比如一个「永远不会被问到医疗账单之外任何事」的编码助手)
→ **可以激进适配,哪怕通用能力受损**

★ 既要处理领域问题、又要能闲聊的模型(比如客服)
→ **需要更保守的适配,保住通用流畅度**

书的口径:**在开始继续预训练之前就搞清楚部署语境,才能做对这个取舍。**

6. 机制四:别让专家写,让专家判断 ★ 这一章的命门

这一节是整章、也可能是整本书最有价值的一段。

现象:让专家写下他们知道的,很少奏效

书的措辞很不客气18:

机构知识里有相当一部分,按定义就从来不会被写下来。 这常常被看成 AI 落地的障碍——在复杂的企业场景里,主要的门槛正是捕获领域专长。

★ 也许有点反直觉:单纯地让领域专家把他们关于某个流程、结构或职能所知的一切写下来, 很少奏效。

怎么做:换一种认知动作

我们可以用强化学习去捕获领域专家的判断—— 不是让他们产出,而是让他们判断, 靠的正是第 07 章那套偏好优化的经济学。18

作者亲历的那个例子,是这一节的证据

这个例子必须原样转述,因为它的力量全在那个转折上19:

项目:捕获一套复杂的金融业务流程。

做法:先拿标准作业程序和手册做示范训练,
然后用成对偏好数据做偏好优化(第 09 章那条主路)来精修。

结果:**专家们几乎总是偏好那些「以某种特定方式化解了原手册里潜在歧义」的回答。**

★ 转折:**这些专家,正是当初写那本手册的同一批人。**

书对这件事的解释,就是这一章要交付的那条原理19:

判断所调用的,是一种与产出截然不同的认知过程; 而前者常常能捕获到后者捕获不了的专长。

结果是一个模型,它反映领域专家的判断, 而且比任何「直接试图复现这份专长」的做法都更忠实于它。

走查:那件没人写下来的事怎么装进模型

要装的东西:「本公司历来怎么解释模棱两可的第 7 条第 3 款」

❌ 走不通的路:
把三位资深理赔专员请进会议室,问他们「你们是怎么判的?」
→ 得到的是手册里已经有的那句话:「未完成 6 周保守治疗者不予批准」
→ 而那句话恰恰没有回答「什么算保守治疗」「6 周怎么算」这些真正的分歧点。

✅ 走得通的路(第 07 章那台机器):
第 1 步:拿 300 封精修历史信做示范训练,得到一个会写信的模型
第 2 步:让它对同一份记录写两封候选信,两封都像样(第 07 章那条口径)
A:把「患者做了 4 周理疗 + 2 周居家锻炼」判为**未满足**
B:把同一情形判为**已满足**,并说明理由
第 3 步:三位资深专员各自挑一封 —— 三人都选了 A
第 4 步:这一对进入偏好数据集

★ 关键:**没有任何一个人被要求写出「居家锻炼不算保守治疗」这条规则。**
他们只是各挑了一封。而那条规则,现在在数据里了。

重复 800 次(用那 800 封真实历史信件当种子),这条从没被写下来的判断就装进去了。

(300、800、三位专员这几个数是为演示编的,与前面几章沿用同一套设定。)

顺带说清楚监管这件事,因为它决定了这条路能不能外包

书对此的态度很硬20:

把合规这件事外包给「声称专门做合规」的外部供应商,很少是一个有用的策略。 监管方通常不认为合规负担是可以委托出去的; 部署这个模型的组织仍然要为合规负责,不管适配工作是谁做的。

而内部能力的缺失还会削弱另一样东西:你识别「一个合规的模型长什么样」的能力。

书用了一句俏皮话收口:一个人不必是鸟才能当鸟类学家,但见过鸟肯定有帮助。

书还纠正了一个常见的误读21:

把监管要求看成 AI 采纳的障碍,是对它们目的的一种误解。 法规之所以存在,是因为它们管辖的领域承载着真实的风险:病人受害、财务损失、法律过失。 ★ 一个满足不了监管要求的模型,是一个带来不可接受风险的模型。 法规不是在阻止创新,是在阻止伤害。

从一开始就把监管要求纳进来的领域适配,产出的是「因为被设计成可部署、所以能部署」的模型; 把合规当成事后补的东西——等激动人心的技术工作做完再说——产出的是过不了监管的模型。

7. 机制五:数据的要求,和那条最紧的约束

专家真正贡献的不是「答案对」

这一句把「该找专家要什么」说清楚了22:

说到领域专家贡献的信息,事实正确性只是入场券。 这些专才真正有价值的贡献,不是把答案答对(任何一本教科书都能做到), 而是反映他们专业产出里那些更难描述的品质。 不管我们管它叫品味、方法还是判断,领域专家的贡献往往和它们的价值一样难以描述。

三条造数据的路,各自的坑

好处
专家亲手标注质量最高——专家能演示的不只是正确答案,还有**「一个谨慎的从业者会加上哪些限定」「一份周全的分析会考虑哪些信息」「什么场合用什么语气」**23专家时间贵、难约,而且这活对宁愿去做本职工作的专才来说很枯燥
让模型合成,再筛或验能快速产出大量数据循环问题:如果生成样例的模型和被训的模型相似,它们可能只是在强化模型已有的行为,而不是改进它24
主动学习(挑最有信息量的样例去标)把标注力气导向模型不确定、或者训练数据稀疏的那些地方

书对第二条的补丁:让专家去审核合成样例,而不是从零生成。 但审核本身也要花专家时间,而且引出一个问题: 有多少比例的合成样例带着「审核者没看出来」的细微错误?24

那条最紧的约束

书用一整段的分量强调了这一条25:

在我做过的每一个领域适配项目里,专家时间都是那条最紧的约束。 算力可以租,数据可以过夜跑完,而领域专家的小时数有限、而且各方都在抢。

★ 三条把每小时专家注意力的价值最大化的做法: ① 尽可能让专家做验证而不是生成; ② 把候选集先过滤一遍再送去审; ③ 把相似的判断批量放在一起,减少切换语境的成本。

数据质量的检查:通用检查抓不到要命的错

这一条和第 05 章那句「垃圾进,垃圾出」是同一件事,但危险等级高得多26:

通用的数据质量检查(去重、修格式、确认样例能被正确解析)
★ 处理的是表面问题,抓不到专业领域里最要命的那些细微错误:

├ 一个推荐了禁忌药物组合的样例
├ 一个把监管要求说错了的样例
└ 一个遵循了已过时的专业标准的样例

★ 它们在外行看来完全通顺、格式完美,**而它们在教模型危险的模式。**

书给了一个能直接换算成后果的数字26:

模型是极其忠实的学习者。它们复现训练数据里的模式,包括那些代表错误的模式。 ★ 一个在「含 10% 错误样例」的数据上训出来的模型,会以相应的频率产出错误输出。 而部署之后再来诊断这些失败,远比事先做质量检查昂贵。

除了逐条审,书还给了两项结构性检查26:

检查查什么
一致性检查数据集内部有没有互相矛盾:一条样例在情形 X 下建议做法 A、另一条在同样的情形下建议做法 B → 模型收到的是互相冲突的训练信号,表现出来就是行为不一致
覆盖分析有没有哪类重要任务被漏掉

风格不是表面功夫,它是硬要求

这一条最容易被当成次要的,而书说它是「最字面意义上的硬要求」27:

领域任务经常有通用模型没理由知道的格式要求:
├ 必须按规定顺序出现的结构化章节
├ 用标准化标识符而不是自然语言描述来指称实体
├ 某类建议必须附带的免责声明或限定语
└ 必须匹配官方术语表、而不是通用说法的用词

★ 后果是硬的:**格式不合规的输出没法通过下游系统,需要人工干预来修。
一个「内容对、格式错」的模型,是在制造工作,不是在消除工作。**

怎么让模型学会格式,书给了一对必须同时满足的条件27:

要做的为什么
训练数据里格式要求必须在所有样例上一致地体现如果有些样例带免责声明、有些不带,模型学到的是「声明有时有有时没有」,上线之后就会出现缺失必要元素的输出。一致的训练带来一致的生成
但同时,满足格式要求的方式必须有足够的变化否则模型背下来的是具体措辞,而不是学会底下那条规则

8. 机制六:领域打分器,以及把合规变成奖励信号

通用打分器学到的「好」不是你的「好」

这一节把第 07 章那台机器搬进领域28:

一个通用打分器,训在广泛的人类偏好上,学到的是通用意义上的清晰、有用和无害。 一个领域打分器学到的是:在这个领域里「清晰」意味着什么, 在这些任务下「有用」意味着什么,在这些约束下「恰当」意味着什么。

★ 放射科医生对「什么是一份好报告」的判断,和外行的判断差别很大。

它的价值:能超过示范的质量

这是第 07 章那条「示范有天花板」在领域侧的兑现29:

示范训练教模型产出「看起来像它见过的那些示范」的输出; 而用领域奖励做的强化学习,教模型产出「专家会偏好」的输出—— ★ 有可能超过示范本身的质量。

它能抓住示范训练难以教会的那些品质: 「胜任的分析」和「优秀的分析」之间的差别、区分专业与业余的那些微妙因素、 以及专家凭本能做出、却说不清的那些判断。

代价照实说29:

这份数据很贵。专家贵,他们的时间对本职工作更有价值, 而让他们做成百上千次偏好判断是一个不小的强加。 所以标注流程本身要精心设计:成对比较可能比绝对打分快, 结构化的标注界面能降低认知负担,校准练习能提高标注者之间的一致性。

把合规变成奖励信号 —— 这是这一节最有实操价值的一段

它解决的问题是:很多监管要求根本写不成规则。

书举的例子正好就在我们的走查上30:

一条要求「沟通必须清楚且不误导」的法规——这没法编码成简单的规则, 但人一看就判得出。

于是把它框成奖励信号:合规的输出得正分,违规的得负分, 训练过程学着产出让奖励最大化的输出、因而也就是让合规最大化的输出。

难处也说清楚31:

产出这个训练信号,通常需要专家判断:一位合规专员、一位法规事务专才、 或者一位既懂法规又懂它在具体语境下怎么适用的法律专业人士。 ★ 而这件事无法被完全自动化——理由和「那些要求本身抗拒被写成规则」是同一条。

但书给了一个反直觉的结论,而且它值得单独记住32:

有一种广泛存在、也不无道理的担心:语言模型的输出,不管经过什么训练, 在监管上按定义就是可疑的。 ★ 而经验显示的恰恰相反。

针对合规的强化学习,不仅能产出良好的合规性, 还能从多位合规专业人士的输入里形成一个打分器—— 它往往比任何单个专家都更全面、更一致。 规模化的偏好优化能够捕获一种「任何个人都复现不了的判断融合」。

判断(我们的,不是书里的): 这一条是这一章和第 07 章之间最紧的那根线。 第 07 章那个「一致率」的口径说过——标注者之间的分歧未必是坏事, 有时它反映的是真实的模糊;而这里说的是:把多位专家的判断融进一个打分器, 得到的东西比任何单个专家更一致。 这两句不矛盾:前者说的是「别急着把分歧当噪声抹掉」, 后者说的是「融合之后的产物,不再带任何单个人的个人偏差」。 如果错,会错在: 如果几位专家共享同一种系统性偏差(比如都来自同一个培训体系), 融合不会消除它,只会把它固化成「公司标准」。 书没有讨论这种情况,而这正是第 10 章那条「同族评判会共享盲点」的同一个风险。

反馈飞轮:模型上线之后才是开始

书给了一整节讲这件事,而它的核心是一句很朴素的话33:

★ 你没有收集到的反馈,按定义没有任何机会改进你的模型。

怎么把反馈真的收上来,书给的三条都不是技术问题33:

要素具体
用起来不打断工作流怎么让用户报告问题而不打断他们手上的活
分得出系统性问题和一次性烦恼怎么给「指示系统性问题」的反馈更高的优先级
要回话怎么向用户反馈「你们的意见被怎么用了」

书还点了名:第 09 章那个「不成对的赞/踩」做法, 在这里特别合用——它能从单次偏好交互里提取出足够的信号。33

而最好的结果来自那种把领域专长、机器学习专长和用户体验设计结合在一起的小团队, 做出用户「愿意用」的反馈系统。

9. 机制七:五层验证 —— 怎么知道它真的学到了

这一节是书里一个署名「战壕来信」的专栏,交付的是一份作者自己用了多年的检查清单34

没有哪一层单独够用,但合起来能给出一幅相当完整的图景。

第一层:领域困惑度的差值 —— 当闸门,不当分数

微调后的模型在留出的领域文本上,困惑度是不是低于底座? ★ 这是有用而且必要的起点,但不充分:一个模型可以有很漂亮的困惑度, 却在功能上毫无用处。 把它当成一道闸门,不是一个分数。34

★ 这和第 11 章那条「困惑度是第一道防线,但它恰恰漏掉罕见能力」是同一件事的两次出现。

第二层:遮住领域术语,看它填不填得回来

书自己说这一层被低估了34:

做法:拿领域文本段落,**把关键术语遮掉**(药名、通路组分、检测参数,
或者你这个领域在乎的任何东西),然后测它填回正确 token 的精确匹配率。

★ 它直接探的是:模型有没有把领域词汇及其上下文用法内化了,
**而不只是变得更擅长生成「像那个领域的散文」。**

★ 关键的一步:**按这些术语在训练集里的出现频率分层来看。**
→ 高频词填得好、低频词填不出 → **它在死记,不是在学。**

第三层:结构化抽取,用硬指标 —— 书说这是最有诊断力的一层

设计一些「必须从领域文本里抽出结构化信息」的任务(实体、关系、数值、分类), 然后量精确率、召回率和 F1。

(精确率=它抽出来的那些里有多大比例是对的;召回率=该抽出来的那些里有多大比例被抽到了; F1 是这两个数的一个折中平均——它高,说明两头都不差,而不是靠牺牲一头换另一头。) 它同时测了三样:理解、领域知识、指令跟随。

★ 关键在于标准答案毫无歧义: 要么模型正确抽出了「剂量:150 毫克,每日两次」,要么它没有。没有任何解释的余地。34

第四层:强制二选一的辨别探针

给模型一对领域陈述,一个正确、一个有细微错误,让它指出哪个准确。 可以把它想成领域版的常识消歧题:「某药靶向 HER2」对「某药靶向 HER3」。 难度可以通过控制错误的细微程度来校准。 它测的是模型有没有获得真正的领域知识,而不是表面的流利,而且给出一个干净的准确率数字。34

第五层:它知不知道自己知道什么

如果模型能产出任何形式的置信信号——哪怕只是隐含在 token 概率里—— 就在领域问题上量它的校准误差。 ★ 一个校准良好的领域模型,应当在领域内知识上自信,在边缘情形上不确定。 微调之后校准很差,是「对训练分布模式过拟合、而没有学到真正的领域结构」的一个红旗。34

走查:这五层在那封拒付信上分别查什么

第 1 层(闸门):在留出的 200 封真实历史信上,困惑度 8.9 → 6.2 ✓ 过闸

第 2 层(遮词):遮掉信里的「保守治疗」「预授权」「共付额」等 40 个术语
高频组(训练集出现 > 50 次):填对 92%
低频组(训练集出现 < 5 次):填对 31%
★ 差距很大 → 提示它在高频词上学到了、低频词上没有。要补语料。

第 3 层(抽取):从 100 份理赔记录里抽出
{保单号, 申请项目, 拒付代码, 依据条款}
精确率 0.96 / 召回率 0.91 / F1 0.93
★ 召回偏低 → 查了一下,漏的都是「依据条款」那一栏。

第 4 层(辨别):100 对细微差别的句子
「CT-06 指未完成 6 周保守治疗」 vs 「CT-06 指未完成 6 周物理治疗」
准确率 88%

第 5 层(校准):它在标准情形上自信、在「4 周理疗 + 2 周居家锻炼」这种边缘情形上
给出较低置信 ✓

★ 裁决:第 2 层和第 3 层都指向同一件事——**条款引用这一块没学扎实。**
这不是「再训一遍」能解决的,是语料里这类样例太少。

(除了「把困惑度当闸门不当分数」这条口径之外,上面所有数字都是为演示编的。)

而「怎么算对」本身,在不同领域难度差别极大

书给了一条很有用的分层35:

领域有没有外部裁判
医疗编码:正式的编码规则本身就是裁判
判例检索:很多判例带一段摘要(headnote),拿模型生成的摘要去比对它,就能验证这个判例是否支持模型的论断
临床决策支持没有。正确性更主观、更难验证

书对没有裁判的那一类给的做法: 尽可能设计一个贴近这个领域质量标准的基准,再补上领域专家的人评。 ★ 而最要紧的一条:在开始评估之前就把验收标准定下来。35

书还举了一个反面案例来说明「本可以避免」35:

那起著名的「律师提交了模型编造的判例引文」的事件, 本来只要拿一个法律检索数据库扫一遍就能避免。

10. 机制八:上线怎么放

书把软件部署的那套模式搬过来,但强调了 AI 系统的特殊性36:

传统软件失败的方式,测试大体上能预料到; 而 AI 系统可能以新颖的方式失败,这些失败只有在被投放进真实使用的野蛮复杂性里时才浮现。 保守的部署——多个阶段、清晰的回退路径——防的正是领域适配可能无意中引入的那些「未知的未知」。

四个动作

动作做什么书特别强调的点
金丝雀部署先只放给一小群用户,通常是几位既懂系统用途、也懂它可能的局限的领域专家★ 见下
留出组有意把一部分用户排除在新模型之外,让他们继续用旧模型,从而做直接对比通常约 10%,但最好做一次正经的样本量计算(第 10 章那套)
渐进铺开分阶段扩大用户群,每一阶段都监控在 1% 的测试用户身上出现的问题,当 100 个人每天遇到它时才会显形;小样本下看着像随机的模式,在更大暴露面上会变成系统性的
回退机制出事能退回已知良好的状态,可以是基于监控指标的自动触发,也可以是人工介入快速回退的能力,限制了任何一次部署可能造成的损害

那句关于金丝雀用户的话,值得单独记

这一条是书里少有的、关于「人」的具体经验37:

早期用户既是测试者也是线人:他们能发现正式验证漏掉的问题, 同时愿意忍受早期系统难免带来的不便。 他们的反馈对后续铺开的塑造作用,远大于任何数量的上线前测试。

所以挑对这一批人是一个关键决定。他们必须「有用」(能给出好反馈), 同时又「有代表性」(像目标最终用户)。★ 而这两样并不常同时出现。

★ 好的金丝雀用户是培养出来的,不是找到的。

走查上的落点: 那 100 个理赔坐席里,先给 10 个人用新模型、 留出 10 个人继续用旧的(约一成),其余 80 个人等第二阶段。 这 10 个先用的人,是那种会在群里认真写「这封信第三段引错条款了」的人—— 而不是随便抓 10 个。

11. 机制九:你 2024 年微调的模型,是 2026 年的遗留系统

这一节是这一章、也是这一整块的收口。

两头都会漂

书列了模型会过期的两个方向38:

哪一头在变具体
底座在变供应商会更新底座,带来更强的能力,但也可能以影响你那次适配的方式改变行为。认真的领域适配应当周期性地重新搭到更好的地基上
领域在变法规会改、最佳实践会变、新术语会进来、训练数据里引用的实体会被取代

所以模型是一项持续的资产

书给了一个很好用的比方,而且用完就落回正式说法39:

模型是一项长期承诺。把它们当成一次性成果的组织, 是在拿长期的架构债换取快速的满足感。

把模型当成持久资产、像给车安排年检那样安排检查,是基本的好实践: 定期查看已部署模型的性能指标、验证它的假设、重跑评估、监控漂移。

不维护的后果:用户先察觉,而且他们的判决很不留情

这一段有一个很敏锐的观察40:

用户会最先注意到:他们碰到覆盖上的缺口、过时的建议、 以及那些一看就属于上一个时代的术语。

★ 和语言模型不同,人是活在当下的,而且会对「信息的时效性」赋予一种情感上的价值—— 我们会把过时的信息整体地判为根本上是错的,不管它别的方面有什么优点。

那句标题句,以及它的经济学

不可避免地,退化会严重到迫使人紧急处理;而紧急处理(就像叫应急水管工一样) 往往比事先计划好的维护更贵。

★ 你在 2024 年微调的那个模型,是 2026 年的遗留系统:维护起来贵,替换起来有风险。

领域适配不是一个有完成日期的项目,而是一项需要持续投入的能力—— 而且重要的是,要有一种发自组织内部的对这一事实的承认, 具体表现为建立起那些「基本自动地更新这次适配」的工作流。41

这一整章的收口

书自己的最后一句,正好也是这一章要交付的东西42:

通用模型提供的是人人都能拿到的通用能力。 适配过的模型,承载的是花了多年才积累起来的知识, 而且以一种竞争对手没法直接下载的形式存在。

★ 领域适配不是你做一次的事,而是你变得有能力持续去做的事。

12. 作者的判断与证据

说法是哪一类说明
「自信是普遍的,知识不是」作者的论断 + 机制理由是「我们分开训练领域知识和态度」;这是他的解释,不是实验结论1
那个核磁术语的例子有据的领域事实可核查的专业术语3
「广度是拿深度换的」作者的论断他给了对照(百科几千字 vs 医生多年经验),这是论证不是实测4
FOGBANK 那件事公开的历史事实书没有配尾注,但这是可查证的公开事件7
机构知识的三种形态概念框架这是知识管理领域的通行分法,书没有给出处8
「让专家写下所知很少奏效」作者的经验判断没有配研究;但他给了一个亲历项目作为佐证18
那个金融项目里「写手册的人偏好某种化解歧义的方式」作者亲历这是全章最重要的证据,而它是单一案例19
「判断与产出是不同的认知过程」作者的解释第 07 章那一节引过认知心理学对「识别与生成」的区分,但这一句本身书没有配出处19
28 亿 token 那个配方有据书给了尾注,并点了它影响的模型家族11
扩词表能改善领域表现他引研究书给了尾注,同时明说它「更多是研究课题而不是标准做法」12
那个 7105 个 token 的临床模型有据的实例书给了尾注,并给了训练规模(1.18 亿患者、1150 亿事件)13
起手七成领域三成通用经验起手值书自己写的就是「a common starting point」16
「混合比是迷你学习率」他引从业者的叫法书写的是「有些团队开始这么叫」,不是他的命名16
「只监控领域能力是常见错误」作者的经验原文是「a mistake I see rather often」16
10% 错误数据 → 相应频率的错误输出作者的论断没有配实验;它建立在「模型是忠实的学习者」这个前提上26
合规打分器可以比单个专家更一致作者的经验判断原文措辞是「经验显示恰恰相反」,但没有配数据32
那份五层验证配方作者自己的方法书明写是「多年来我定下来的一套配方」,是个人实践不是行业标准34
「好的金丝雀用户是培养出来的」作者的经验判断没有配数据,但给了判据(有用 × 有代表性,两者不常同时出现)37
应急比计划维护贵作者的类比论证用的是叫应急水管工的比方41

13. 边界与局限

  1. 这一章书只有一个大文件,而且几乎不给数字。 它给的是判断结构和经验口径, 所以这一章走查里的数比别的章更多是编的,每一处我们都标了
  2. 那份五层配方的扩展版我们没写。 书提到扩展版另加三项 (按评分细则检查、针对语料的词面重合指标、简短的难反例), 但把细节放在配套笔记本里,正文没有展开。
  3. 法规的具体条文我们一条都不引。 这是全书口径里明确不覆盖的一块—— 书本身也只谈「合规怎么变成训练信号」,不谈具体条文。
  4. 「怎么组织专家标注队伍」这一块,我们只交付了三条口径。 书里那部分和第 07 章有重叠,我们没有重复。
  5. 书没有给「领域适配一次要花多少钱」的数字。 它给的是成本的相对量级 (那架阶梯的成本列),绝对数字得你自己按显卡小时和专家小时算。
  6. 书里那个「让编码助手做领域课程」的专栏,我们按全书口径不覆盖。 它里面有一条值得单独记的口径:在可验证的领域里,给编码助手配一个校验器就够了—— 有时一个正则表达式就是那个校验器。

14. 可带走的

  1. 病灶叫「流利地一无所知」:外行惊艳、专家皱眉; 它混淆药物类别、引用被取代的指南、漏掉任何专家都会注意到的细节;
  2. 而它自己不知道——因为领域知识和态度是分开训练的,所以自信是普遍的、知识不是;
  3. 问题不是能力,是具体性。 广度是拿深度换来的,这不是缺陷,是训练过程的必然;
  4. 日常语言和行业惯例会正面打架(比如那个「血流空缺」实际指的是相反的意思);
  5. 目的不是让它「理解」这个领域,是让它的输出不只像模像样、而且正确; 「写得像一位专家」和「作为一位专家来写」是两件事;
  6. 机构知识有三种形态:显性(文档)· 隐含(嵌在系统和决策模式里)· ★ 默会(会做但说不出)——最值钱的恰恰是第三种;
  7. 五级干预阶梯:提示 → 外挂检索 → 领域示范训练(几百到几千例)→ 继续预训练(几十亿 token)→ 领域偏好优化 → 全套; 判据是把干预强度匹配到领域要求上;
  8. 该上继续预训练的三个信号:领域术语被切得稀碎 · 知识过时 · 文体惯例差别大;
  9. 换切法技术上可以但很少做;扩词表更多是研究课题,不是标准做法; 更常见的是「不改词表,直接在领域文本上继续预训练」;
  10. 但有一种情况扩词表确实说得通:让 token 去代表别的东西。 一个临床模型用 7105 个 token 表示临床概念(时间区间、诊断编码、用药编码、化验结果), 然后照常「预测下一个事件」——token 对它代表什么是无所谓的;
  11. 混合比是「第二个学习率」:起手七成领域、三成通用; 偏领域 = 快但忘得多,偏通用 = 稳但学得慢; 这是「别走远」的第四副面孔,它管的是数据的构成;
  12. 最常见的错是:定了混合比,然后只监控领域能力;
  13. 别让专家写下他们知道的,让专家去判断。 让专家把所知写下来「很少奏效」;而判断调用的是一种截然不同的认知过程;
  14. 那个金融项目的转折:偏好某种化解歧义方式的那批专家, 正是当初写那本手册的同一批人;
  15. 合规不可外包:监管方不认为合规负担可以委托,部署方仍然要负责; 而且没有内部能力,你连「合规的模型长什么样」都识别不出来;
  16. 法规不是在阻止创新,是在阻止伤害;一个满足不了监管的模型,是一个风险不可接受的模型;
  17. 专家真正贡献的不是「答案对」(教科书就能做到),是品味、方法和判断;
  18. 专家时间是那条最紧的约束。 三条对策:让专家验证而不是生成 · 先过滤再送审 · 把相似判断批量放在一起;
  19. 通用的数据质量检查抓不到要命的错(禁忌药物组合、说错的监管要求、过时标准); ★ 10% 错误数据 → 相应频率的错误输出;
  20. 风格即实质:格式不合规的输出没法过下游系统,「内容对格式错」的模型是在制造工作; 训练数据里格式必须一致,但满足格式的措辞必须有变化(否则它背下来而不是学会);
  21. 领域打分器能超过示范的质量——它教的是「专家会偏好什么」,而不是「示范长什么样」;
  22. 合规可以变成奖励信号:「清楚且不误导」这类标准编不成规则、但人一看就判得出; 而多位合规专家融合出来的打分器,往往比任何单个专家更全面、更一致;
  23. 你没有收集到的反馈,按定义没有任何机会改进你的模型;
  24. 五层验证:困惑度差值(当闸门不当分数)→ 遮住领域术语看它填不填得回来 (按词频分层看是真学还是死记)结构化抽取的精确率/召回率(标准答案毫无歧义)强制二选一的辨别探针校准(它知不知道自己不知道);
  25. 有些领域有外部裁判(医疗编码规则、判例摘要),有些没有(临床决策支持); ★ 验收标准必须在评估开始之前就定下来;
  26. 上线四动作:金丝雀 → 留出组(约一成,但要做样本量计算)→ 渐进铺开 → 回退; ★ 好的金丝雀用户是培养出来的,不是找到的;
  27. AI 系统可能以「测试预料不到」的方式失败,所以要保守部署、留清晰的回退路径;
  28. 你 2024 年微调的模型是 2026 年的遗留系统。 底座会更新、领域会演变;应急永远比计划维护贵;
  29. 用户会最先察觉——而人会把过时的信息整体判为根本上是错的,不管它别的优点;
  30. 领域适配不是你做一次的事,是你变得有能力持续去做的事。

15. 原文地图

主题原书章原文位置
外行惊艳专家皱眉 · 自信普遍知识不普遍When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:5(搜「their confidence is pervasive」) · :7(搜「watch them wince」)
问题不是能力是具体性 · 那个反直觉的术语When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:9(搜「The problem is not capability but specificity」) · :11(搜「flow void」)
四种可预测的症状 · 广度换深度When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:21(搜「systematic weaknesses」) · :23(搜「breadth at the expense of depth」)
立场声明 · 像 vs 作为When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:25(搜「not merely plausible but also correct」) · :27(搜「writing like a cardiologist」)
机构知识流失的代价 · 三种形态When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:31(搜「FOGBANK」) · :35(搜「tacit knowledge held by experienced practitioners」)
★ 别让专家写,让专家判断When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:41(搜「rarely helpful」) · :43(搜「the same experts who wrote the original manual」) · :45(搜「distinctly different cognitive process」)
监管不可外包 · 法规不是障碍When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:53(搜「preventing harm」) · :57(搜「One does not have to be a bird」)
继续预训练:什么时候、三个信号、代价When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:65(搜「operates at a deeper level」) · :67(搜「quantum chemistry」) · :69(搜「Tokenization problems provide one signal」) · :71(搜「thousands or tens of thousands of GPU-hours」)
五级阶梯 · 语料从哪来 · 28 亿 tokenWhen Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:75(搜「When to Use Each Approach」) · :137(搜「2.8 billion tokens」) · :139(搜「Source identification is the first challenge」)
遗忘 · 混合比 · 「迷你学习率」When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:145(搜「may lose general capabilities」) · :147(搜「The mixing ratio becomes a hyperparameter」) · :149(搜「clinical coding assistant」) · :153(搜「70 percent domain data」) · :155(搜「mini-learning rate」)
专家贡献的是品味方法判断 · 三条造数据的路When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:159(搜「taste, method, or judgment」) · :165(搜「Expert annotation produces the highest-quality examples」) · :167(搜「circularity problem」)
数据质量 · 10% 错误 · 专家时间是瓶颈When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:191(搜「contraindicated drug interaction」) · :193(搜「Consistency checking」) · :195(搜「remarkably faithful learners」) · :199(搜「expert time proved the binding constraint」)
风格即实质When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:205(搜「format noncompliance」) · :207(搜「Consistency in training leads to consistency in generation」) · :209(搜「generates work rather than eliminating it」)
领域打分器 · 能超过示范When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:217(搜「The radiologist」) · :219(搜「a substantial imposition」) · :221(搜「competent analysis and an excellent one」)
合规作为奖励信号When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:225(搜「resist simple specification」) · :227(搜「cannot be fully automated」) · :229(搜「more comprehensive and consistent than any single expert」)
反馈飞轮When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:239(搜「uniquely positioned to identify problems」) · :241(搜「human factors」) · :243(搜「The feedback you don」)
★ 五层验证配方When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:257(搜「five-layer evaluation recipe」) · :259(搜「a gate, not a grade」) · :261(搜「Stratifying by term frequency」) · :263(搜「No interpretive wiggle room」) · :265(搜「forced choice」) · :267(搜「knows what it knows」)
有没有外部裁判 · 验收标准先定When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:269(搜「headnote」) · :271(搜「lay down acceptance criteria before beginning evaluation」)
上线四动作 · 金丝雀用户是培养的When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:275(搜「canary deployment」) · :277(搜「cultivated, not found」) · :279(搜「around 10 percent」) · :283(搜「become visible when 100 users encounter them daily」) · :285(搜「fallback mechanisms」) · :287(搜「unknown unknowns」)
2024 年的模型是 2026 年的遗留系统When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:291(搜「periodically rebased」) · :295(搜「schedule inspections as you would for a vehicle」) · :297(搜「humans do live in the present」) · :299(搜「emergency plumber」)
适配永不结束When Wikipedia Is Not Enoughtext/111-fm-when-wikipedia-is-not-enough.txt:303(搜「competitors cannot simply download」) · :309(搜「not something you do once」)
能不能换切法CAN YOU CHANGE THE TOKENIZER?text/20-fm-can-you-change-the-tokenizer.txt:5(搜「Vocabulary expansion involves adding new tokens」) · :9(搜「reading comprehension format」) · :11(搜「Entity-aware training techniques」)
让 token 代表别的东西SYMBOLIC TOKENIZATION: WHEN VOCABULARY EXPANSION MAKES SENSEtext/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:5(搜「7,105 tokens」) · :7(搜「predict the next medical event」) · :11(搜「agnostic as to what they represent」)

Footnotes

  1. 出处:「When Wikipedia Is Not Enough」第 5 段(text/111-fm-when-wikipedia-is-not-enough.txt:5,搜「their confidence is pervasive」)与第 7 段(text/111-fm-when-wikipedia-is-not-enough.txt:7,搜「watch them wince」)。第 5 段那句机制解释的原文是:因为我们分开地在领域知识和态度上训练模型,所以它们的自信是普遍的,即便它们的知识不是。 作者还自嘲了一句「别问我足球」来说明「人知道自己的缺口」。 2 3

  2. 出处:「When Wikipedia Is Not Enough」第 9 段(text/111-fm-when-wikipedia-is-not-enough.txt:9,搜「The problem is not capability but specificity」)。原文把这条缺口称作企业 AI 部署的核心挑战,并明说:你们组织积累的知识——术语、法规、专家凭本能做出的判断——在模型的训练数据里根本不存在。

  3. 出处:「When Wikipedia Is Not Enough」第 11 段(text/111-fm-when-wikipedia-is-not-enough.txt:11,搜「flow void」)。原文解释这个术语指的是因为血液流出了成像层面,所以血管里看不到信号——而不是标准的语言学解读会以为的「没有血流」。收口是:风格上的特异性是可欲的,而领域上的特异性可能有法律与监管后果。 2

  4. 出处:「When Wikipedia Is Not Enough」第 23 段(text/111-fm-when-wikipedia-is-not-enough.txt:23,搜「breadth at the expense of depth」)。原文那组对照是:百科用几千字覆盖心脏病学,而一位心脏科医生积累多年判读心脏超声的临床经验;文献摘要描述研究发现,而一位临床研究者知道哪些发现被复现过、哪些只是特定研究设计的假象。结论:训练数据传递不了默会知识、演变中的最佳实践,以及从领域经验里长出来的判断。 2

  5. 出处:「When Wikipedia Is Not Enough」第 25 段(text/111-fm-when-wikipedia-is-not-enough.txt:25,搜「not merely plausible but also correct」)与第 27 段(text/111-fm-when-wikipedia-is-not-enough.txt:27,搜「writing like a cardiologist」)。第 27 段还强调,这一点在我们关心的不只是最终输出、而且包括推理步骤、思维链和模型用来得出输出的内部表示时尤其重要;通用流畅与领域专长之间的差距不只是风格问题,而是实质问题。 2

  6. 出处:「When Wikipedia Is Not Enough」第 21 段(text/111-fm-when-wikipedia-is-not-enough.txt:21,搜「systematic weaknesses」)。原文逐条列了这四种表现,最后一条的原话是:它可能产出对外行来说表面上看似合理、却违反了任何领域专家都会立刻识别出的约束的输出。

  7. 出处:「When Wikipedia Is Not Enough」第 31 段(text/111-fm-when-wikipedia-is-not-enough.txt:31,搜「FOGBANK」)。书没有为这一段配尾注,但它描述的是一件可公开查证的事:冷战结束、停产十年之后,制造这种物质的专门知识失传,花了五年、数百万美元才逆向工程回来 2

  8. 出处:「When Wikipedia Is Not Enough」第 35 段(text/111-fm-when-wikipedia-is-not-enough.txt:35,搜「tacit knowledge held by experienced practitioners」)。原文的三分法是:编码在内部文档、政策与流程里的显性知识;嵌在系统结构与决策模式里的隐含知识;以及那些「知道事情怎么做、却说不清为什么」的资深从业者身上的默会知识这是知识管理领域的通行分法,书没有给出处。 2 3

  9. 出处:「When Wikipedia Is Not Enough」第 65 段(text/111-fm-when-wikipedia-is-not-enough.txt:65,搜「operates at a deeper level」)与第 67 段(text/111-fm-when-wikipedia-is-not-enough.txt:67,搜「quantum chemistry」)。第 61 段(text/111-fm-when-wikipedia-is-not-enough.txt:61,搜「no amount of fine-tuning can replicate」)是那句定性:继续预训练很贵,但对严重的领域错配,它奠定的基础是再多微调也复制不出来的。 2

  10. 出处:「When Wikipedia Is Not Enough」第 69 段(text/111-fm-when-wikipedia-is-not-enough.txt:69,搜「Tokenization problems provide one signal」)与第 71 段(text/111-fm-when-wikipedia-is-not-enough.txt:71,搜「thousands or tens of thousands of GPU-hours」)。第 71 段明说第 12 章那类只训一小块的做法能降低它的显存占用,但算力时间仍然可观 2

  11. 出处:「When Wikipedia Is Not Enough」第 137 段(text/111-fm-when-wikipedia-is-not-enough.txt:137,搜「2.8 billion tokens」)。书给了那份配方的尾注,并点了它影响的模型家族。同段还有一条对语料的要求:它必须能代表这个领域的语言模式——不是领域文本的随机抽样,而是一个覆盖了部署时会遇到的术语、文体与主题的精选集合。 2

  12. 出处:「CAN YOU CHANGE THE TOKENIZER?」第 3 段(text/20-fm-can-you-change-the-tokenizer.txt:3,搜「far less common in practice」)、第 5 段(text/20-fm-can-you-change-the-tokenizer.txt:5,搜「Vocabulary expansion involves adding new tokens」)、第 9 段(text/20-fm-can-you-change-the-tokenizer.txt:9,搜「reading comprehension format」)与第 11 段(text/20-fm-can-you-change-the-tokenizer.txt:11,搜「Entity-aware training techniques」)。第 5 段那句克制的定性是:扩词表仍然更多是一个活跃的研究课题,而不是标准做法。 第 9 段那个把领域语料改写成阅读理解格式的做法,书说它让一个 70 亿参数的模型在结果上能与大得多的专用领域模型竞争,而且它是在现有切法之内工作的 2 3 4 5

  13. 出处:「SYMBOLIC TOKENIZATION: WHEN VOCABULARY EXPANSION MAKES SENSE」第 5 段(text/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:5,搜「7,105 tokens」)、第 7 段(text/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:7,搜「predict the next medical event」)与第 11 段(text/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:11,搜「agnostic as to what they represent」)。书给了那个模型的尾注,训练规模是 1.18 亿名患者、1150 亿条医疗事件。第 9 段(text/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:9,搜「dividing them into patches」)是同一个主意的另一个应用——把图切成小方块当成 token,那正是第 18 章要讲的东西。 2 3

  14. 出处:「When Wikipedia Is Not Enough」第 145 段(text/111-fm-when-wikipedia-is-not-enough.txt:145,搜「may lose general capabilities」)。原文给的机制和第 04 章那一节完全一致:那些对通用能力重要的权重,如果能被改用来更好地拟合领域模式,就可能被覆盖。

  15. 出处:「When Wikipedia Is Not Enough」第 147 段(text/111-fm-when-wikipedia-is-not-enough.txt:147,搜「The mixing ratio becomes a hyperparameter」)。原文在同一段里给了三条对策:数据混合、降低学习率、以及正则化与蒸馏回原模型。混合比那一句原文是:更高比例的领域数据让适应更快但增加遗忘风险,更高比例的通用数据保住能力但拖慢领域学习。 2

  16. 出处:「MIXING RATIOS IN PRACTICE」第 153 段(text/111-fm-when-wikipedia-is-not-enough.txt:153,搜「70 percent domain data」)与第 155 段(text/111-fm-when-wikipedia-is-not-enough.txt:155,搜「mini-learning rate」)。这是书里一个独立的方框。「迷你学习率」这个叫法书明写是「有些团队开始这么叫」,不是作者自己起的名字;而「只监控领域能力」那个错误,原文的措辞是「a mistake I see rather often in practice」——是作者的实践观察 2 3 4 5 6

  17. 出处:「When Wikipedia Is Not Enough」第 149 段(text/111-fm-when-wikipedia-is-not-enough.txt:149,搜「clinical coding assistant」)。原文那两个例子分别是「永远不会被问到医疗账单以外任何事的临床编码助手」和「既要讨论专业产品、又要能闲聊的客服」。

  18. 出处:「When Wikipedia Is Not Enough」第 41 段(text/111-fm-when-wikipedia-is-not-enough.txt:41,搜「rarely helpful」)。原文明说这条路靠的是「第 4 章(我们的第 07 章)里辨认出的那同一套偏好优化的经济学」;「很少奏效」那句书没有配研究出处,是他的经验判断。 2 3

  19. 出处:「When Wikipedia Is Not Enough」第 43 段(text/111-fm-when-wikipedia-is-not-enough.txt:43,搜「the same experts who wrote the original manual」)与第 45 段(text/111-fm-when-wikipedia-is-not-enough.txt:45,搜「distinctly different cognitive process」)。第 43 段是全章最重要的证据,而它是单一亲历案例。 第 45 段那句原理是:判断调用的是一种与产出截然不同的认知过程,而前者常常能捕获后者捕获不了的专长。 2 3 4

  20. 出处:「When Wikipedia Is Not Enough」第 57 段(text/111-fm-when-wikipedia-is-not-enough.txt:57,搜「One does not have to be a bird」)。原文:监管方通常不认为合规负担是可委托的,部署模型的组织仍要负责;而内部能力的缺失也会削弱组织识别「合规模型长什么样」的能力。 第 55 段(text/111-fm-when-wikipedia-is-not-enough.txt:55,搜「must involve compliance expertise from the beginning」)补充了三条具体要求:训练用的数据在相关法规下必须是可用的、训练过程必须保住能支持审计与解释的性质、输出必须满足合规团队能验证的领域标准。

  21. 出处:「When Wikipedia Is Not Enough」第 53 段(text/111-fm-when-wikipedia-is-not-enough.txt:53,搜「preventing harm」)。原文列的那三种真实风险是:病人受害、财务损失、法律过失。 收口那句是:把合规当成事后补的东西——等激动人心的技术工作做完再说——产出的是过不了监管审查的模型。

  22. 出处:「When Wikipedia Is Not Enough」第 159 段(text/111-fm-when-wikipedia-is-not-enough.txt:159,搜「taste, method, or judgment」)。原文:事实正确性只是入场券;专才真正有价值的贡献是反映他们专业产出里那些更难描述的品质

  23. 出处:「When Wikipedia Is Not Enough」第 165 段(text/111-fm-when-wikipedia-is-not-enough.txt:165,搜「Expert annotation produces the highest-quality examples」)。原文列举的那三样「不只是正确答案」的东西是:一个谨慎的从业者会加上的限定、一份周全的分析会考虑的信息、以及各种场合下恰当的语气。

  24. 出处:「When Wikipedia Is Not Enough」第 167 段(text/111-fm-when-wikipedia-is-not-enough.txt:167,搜「circularity problem」)与第 169 段(text/111-fm-when-wikipedia-is-not-enough.txt:169,搜「Active learning approaches」)。第 167 段那个循环问题正是第 17 章那条「模型无法为它不具备的能力生成训练信号」的第一次露头。 第 169 段还给了数据集的总体要求:要覆盖模型在部署中会面对的全部任务范围,每类任务有足够样例以支持泛化,而不是只记住具体措辞。 2

  25. 出处:「When Wikipedia Is Not Enough」第 199 段(text/111-fm-when-wikipedia-is-not-enough.txt:199,搜「expert time proved the binding constraint」)。原文:算力可以租,数据可以过夜处理完,而领域专家的小时数有限、且各方都在抢。

  26. 出处:「When Wikipedia Is Not Enough」第 191 段(text/111-fm-when-wikipedia-is-not-enough.txt:191,搜「contraindicated drug interaction」)、第 193 段(text/111-fm-when-wikipedia-is-not-enough.txt:193,搜「Consistency checking」)与第 195 段(text/111-fm-when-wikipedia-is-not-enough.txt:195,搜「remarkably faithful learners」)。第 195 段还说明:质量检查的成本可能与初次数据收集相当甚至更高,但它被「在坏数据上训练的代价」所证成;而在训练前重投数据质量的团队,遇到的神秘故障更少、需要的迭代更少,最终交付更可靠的系统 2 3 4

  27. 出处:「When Wikipedia Is Not Enough」第 205 段(text/111-fm-when-wikipedia-is-not-enough.txt:205,搜「format noncompliance」)、第 207 段(text/111-fm-when-wikipedia-is-not-enough.txt:207,搜「Consistency in training leads to consistency in generation」)与第 209 段(text/111-fm-when-wikipedia-is-not-enough.txt:209,搜「generates work rather than eliminating it」)。第 209 段还说:做这件事所需的力气,相比内容质量检查是不大的——主要是把格式要求仔细写清楚,再系统性地核对训练样例是否符合。 2

  28. 出处:「When Wikipedia Is Not Enough」第 217 段(text/111-fm-when-wikipedia-is-not-enough.txt:217,搜「The radiologist」)。原文那组对照是放射科医生对好报告的判断 vs 外行的判断,以及律师对某类文书的评估。

  29. 出处:「When Wikipedia Is Not Enough」第 221 段(text/111-fm-when-wikipedia-is-not-enough.txt:221,搜「competent analysis and an excellent one」)与第 219 段(text/111-fm-when-wikipedia-is-not-enough.txt:219,搜「a substantial imposition」)。第 221 段那句「有可能超过示范本身的质量」是第 07 章那条「示范有天花板」在领域侧的直接兑现。 2

  30. 出处:「When Wikipedia Is Not Enough」第 225 段(text/111-fm-when-wikipedia-is-not-enough.txt:225,搜「resist simple specification」)。原文举的正是「要求沟通清楚且不误导」这类规定,它抗拒被写成简单规则

  31. 出处:「When Wikipedia Is Not Enough」第 227 段(text/111-fm-when-wikipedia-is-not-enough.txt:227,搜「cannot be fully automated」)。原文明说:合规感知的强化学习,其标注负担和一般的领域奖励建模相似——需要规模化的专家时间,因而同时构成成本约束和吞吐约束。

  32. 出处:「When Wikipedia Is Not Enough」第 229 段(text/111-fm-when-wikipedia-is-not-enough.txt:229,搜「more comprehensive and consistent than any single expert」)与第 231 段(text/111-fm-when-wikipedia-is-not-enough.txt:231,搜「this investment is not optional」)。第 229 段那句「经验显示恰恰相反」书没有配数据,是作者的经验判断。 第 231 段的收口是:对那些「不合规不仅是不可取、而是不可接受」的领域,这项投入不是可选项。 2

  33. 出处:「When Wikipedia Is Not Enough」第 243 段(text/111-fm-when-wikipedia-is-not-enough.txt:243,搜「The feedback you don」)、第 241 段(text/111-fm-when-wikipedia-is-not-enough.txt:241,搜「human factors」)与第 239 段(text/111-fm-when-wikipedia-is-not-enough.txt:239,搜「uniquely positioned to identify problems」)。第 239 段说明为什么领域专家是最好的反馈来源:他们遇到边缘情形、注意到输出何时达不到专业标准、并且明白哪些失败要紧、哪些可以容忍。 第 241 段点名了第 09 章那个不成对的方法。 2 3

  34. 出处:「FROM THE TRENCHES: A PREFERRED RECIPE FOR "DID IT TAKE?"」第 257 段(text/111-fm-when-wikipedia-is-not-enough.txt:257,搜「five-layer evaluation recipe」)、第 259 段(text/111-fm-when-wikipedia-is-not-enough.txt:259,搜「a gate, not a grade」)、第 261 段(text/111-fm-when-wikipedia-is-not-enough.txt:261,搜「Stratifying by term frequency」)、第 263 段(text/111-fm-when-wikipedia-is-not-enough.txt:263,搜「No interpretive wiggle room」)、第 265 段(text/111-fm-when-wikipedia-is-not-enough.txt:265,搜「forced choice」)与第 267 段(text/111-fm-when-wikipedia-is-not-enough.txt:267,搜「knows what it knows」)。书明写这是他多年来定下来的一套配方,团队按酱汁给配方起名,这个五件版叫 Hollandaise;扩展版另加三项(评分细则检查、针对语料的词面重合指标、简短的难反例),细节在配套笔记本里。 2 3 4 5 6 7

  35. 出处:「When Wikipedia Is Not Enough」第 269 段(text/111-fm-when-wikipedia-is-not-enough.txt:269,搜「headnote」)与第 271 段(text/111-fm-when-wikipedia-is-not-enough.txt:271,搜「lay down acceptance criteria before beginning evaluation」)。第 269 段还提到那起律师提交模型编造判例的事件,并说本来只要拿一个法律检索数据库扫一遍就能避免 2 3

  36. 出处:「When Wikipedia Is Not Enough」第 287 段(text/111-fm-when-wikipedia-is-not-enough.txt:287,搜「unknown unknowns」)。原文的对照是:传统软件失败的方式测试大体上能预料,而 AI 系统可能以新颖的方式失败,这些失败只有被投放进真实使用的野蛮复杂性里时才浮现。

  37. 出处:「When Wikipedia Is Not Enough」第 277 段(text/111-fm-when-wikipedia-is-not-enough.txt:277,搜「cultivated, not found」)与第 275 段(text/111-fm-when-wikipedia-is-not-enough.txt:275,搜「canary deployment」)。第 277 段那两条要求(有用 × 有代表性)以及那句「这两样并不常同时出现」,是这一节最实用的一处。留出组、渐进铺开与回退分别见第 279、283、285 段(text/111-fm-when-wikipedia-is-not-enough.txt:279,搜「around 10 percent」;text/111-fm-when-wikipedia-is-not-enough.txt:283,搜「become visible when 100 users encounter them daily」;text/111-fm-when-wikipedia-is-not-enough.txt:285,搜「fallback mechanisms」)。 2

  38. 出处:「When Wikipedia Is Not Enough」第 291 段(text/111-fm-when-wikipedia-is-not-enough.txt:291,搜「periodically rebased」)。原文:底座会被供应商更新,带来更强的能力,但也可能以影响此前适配的方式改变行为;而领域知识本身也在演变——法规会改、最佳实践会变、新术语进来、训练数据里引用的实体被取代

  39. 出处:「When Wikipedia Is Not Enough」第 295 段(text/111-fm-when-wikipedia-is-not-enough.txt:295,搜「schedule inspections as you would for a vehicle」)。原文列的四个定检动作是:定期查看已部署模型的性能指标、验证它的假设、重跑评估、监控漂移。 那个「像给车安排年检」是书自己的比方,用完即落回正式说法。

  40. 出处:「When Wikipedia Is Not Enough」第 297 段(text/111-fm-when-wikipedia-is-not-enough.txt:297,搜「humans do live in the present」)。原文那句观察是:和语言模型不同,人是活在当下的,并且会对信息的时效性赋予一种情感上的正确性价值;我们会把过时的信息整体地判为根本上是错的,不管它别的方面有什么优点。

  41. 出处:「When Wikipedia Is Not Enough」第 299 段(text/111-fm-when-wikipedia-is-not-enough.txt:299,搜「emergency plumber」)。原文那句标题句是:你在 2024 年微调的那个模型,是 2026 年的遗留系统——维护起来贵,替换起来有风险。 收口是:领域适配不是一个有完成日期的项目,而是一项需要持续投入的能力 2

  42. 出处:「When Wikipedia Is Not Enough」第 303 段(text/111-fm-when-wikipedia-is-not-enough.txt:303,搜「competitors cannot simply download」)与第 309 段(text/111-fm-when-wikipedia-is-not-enough.txt:309,搜「not something you do once」)。第 305 段(text/111-fm-when-wikipedia-is-not-enough.txt:305,搜「matching intervention intensity to domain requirements」)是那句判据:从业者的任务是把干预强度匹配到领域要求上——领域缺口深的地方重投,通用能力够用的地方轻放。