跳到主要内容

你凭什么说它变好了 — 评估的难是结构性的,不是方法还不够好

这一章讲三件事: 为什么「量出来它变好了」这件事本身就是难的、而且是结构性地难; 三种验收口径各自能看见什么、各自瞎在哪; 以及为什么最后真正算数的那套题库只能你自己攒。

它在全书链条里的位置: 前五章都在改模型,这一章是唯一一章在问「改对了吗」。 书自己把它放在技法中段,而我们的建议是:这一章可以最先读。 它同时是第 09 章那个坑的补丁——那里说过「同分布留出数据会高估部署表现」, 补法在这一章第 9 节。

★ 第 07 章那条在泻湖里打转的船,在这一章以第二个名字出现: 那次是模型对着打分器作弊,这一次是人对着指标作弊

1. 先看现象:两个数字打架,你信哪个

假设你把第 05 到 09 章的东西全跑通了,第二版拒付信模型出炉。 你手上有两份验收结果:

机器算出来的: BLEU 从 0.31 涨到 0.35 ← 涨了 0.04
困惑度从 12.4 降到 11.1 ← 也在变好

人说的: 三位合规专员两两比对了 60 对信,
★ 新版的胜率是 48% ← 旧版赢

(这几个数是为演示编的,不是真实数值。)

现在你必须做一个决定:上线,还是不上线。

这一章就是在回答这个局面。 而它的第一个结论会让人不太舒服:

这两个数字打架,不是因为其中一个坏掉了。 它们打架是常态,而且打架本身携带的信息,比任何一个数字单独告诉你的都多。

先把这一章的难度说破

书开篇给的定性很硬1:

可测量的代理和真实质量之间的这道缝,不是一个等着方法学突破来填上的临时不便。 它是「和开放式生成打交道」这件事的结构性特征。

为什么是结构性的,书用了一个很小的例子:

续写「那只猫坐在……」

① 「……航天飞机上」 ← 不是第一个会想到的,但它至少是句人话
② 「……vmslkrmw」 ← 这是一串乱码

★ 这两个都错。但它们错得完全不是一回事。
而任何一个能自动算出来的指标,都分不清这两种错。

2. 顶层全景:三种口径叠成一摞

┌─ 自动指标 ───────── 几秒 · 成本接近零 · 细腻度低
│ 用在:每一个训练检查点、每一次实验、抓回归

├─ 让模型当裁判 ───── 几分钟 · 成本中等 · 细腻度中
│ 用在:先筛掉明显不行的候选,给个初步排名

├─ 人评 ───────────── 几小时到几天 · 成本高 · 细腻度最高
│ 用在:最终选型、上线决策、给上面两层校准

└─ 线上分流试验 ───── 几周 · 成本视情况 · ★ 这是部署上的真相
用在:生产验证

经验用量比大约是 1000 : 100 : 10
(一千次机器检查 : 一百次模型评判 : 十次人评)

图说:**这不是四个可以互相替代的选项,是一摞。**
上层快而粗,下层慢而准;**下层的作用是校准上层有没有漂掉。**

主走查(全章共用): 就是第 1 节那一局—— BLEU 涨了 0.04、合规专员说更差,这一摞怎么判它。 后面每一节各出一步,到第 9 节给出裁决。

3. 机制一:难在哪里 —— 四条原因,一条都绕不开

结论先行:这不是方法学不够好,是任务本身的性质。

书把原因拆成了四条2:

原因具体是什么举例
答案是开放的对大多数提示词,很多种回答都可以接受,而「好回答」的空间既大又说不清边界一封合规的拒付信可以有几十种写法
好坏是主观的不同用户合理地偏好不同的风格、详略、正式程度有人要 300 字,有人要一页纸
好坏是多维的一份回答可以准确但没用、有用但啰嗦、简洁但不完整没有哪一个数能同时覆盖这几维
这几维还互相拉扯更谨慎会提高准确性、同时降低有用性;更详细对一些人有帮助、对另一些人是负担第 08 章那三条互相打架的品质,就是这一条

为什么「多收数据、换更复杂的指标」救不了

这是这一节最该带走的一条3:

你可以在任意大的数据集上算困惑度,但一个困惑度更低的模型, 按任何人类判断都可能产出更差的回答。 你可以发明越来越精巧的自动指标,但它们始终只是代理, 而它们所代理的那些品质,归根到底需要人的判断才评得了。

书给的姿势:接受这个难度,是让评估真正管用的第一步。 目标不是找到那个完美的指标,而是搭一套系统—— 让它在每一个单项都不完美的前提下,仍然给出有用的信号。

4. 机制二:那条定律的两层,第二层才是要命的

这一节是整章的思想核心,也是第 07 章那条打转的船第二次出现的地方。

先把这条定律讲清楚

一个量度一旦变成目标,它就不再是一个好量度。 这条观察由经济学家 Goodhart 在货币政策的语境里提出, 但它对任何依赖代理指标的优化过程同样成立4

为什么在这一行「格外毒」:因为这里每一个能轻松算出来的指标,都是代理; 而每一个代理都可以被钻空子4

第一层:模型学会应付考卷

这一层大多数人想得到5:

为了在某个基准上拿高分而训出来的模型,
学到的是**这个基准特有的模式**:

├ 选择题奖励的那些特定措辞
├ 人类评估者偏好的那些回答结构
└ 和训练数据吻合的那些长度分布

★ 后果:一个学会了「认出某类题型、然后套用这类题型的启发式」的模型,
可以在那个基准上考得很好,**而在真正的知识应用上并不更强**。

书的判词:**这个基准变成了一场「考试技巧」的测验,
而不是它当初想测的那项能力。**

这和第 07 章那条船是同一件事,只是换了场地: 那里是模型对着打分器作弊,这里是模型对着基准作弊。

第二层:做开发的人学会应付指标 —— 这一层才要命

这是本章最该记住的一句,它把这条定律从模型身上挪到了人身上6:

用某个指标做决策的开发者,会隐性地为那个指标优化。

一个拿困惑度当主要指南的团队,会做出一串降低困惑度的选择—— 哪怕这些选择并不提升输出质量。 一个只盯任务完成率的团队,可能会接受一个「把任务做砸了但做完了」的模型, 而不选那个「碰到超出能力的任务就恰当地拒绝」的模型。

★ 指标塑造的不只是被开发的那个模型,还有做开发的那些人。

这条为什么比第一层毒:因为这些人不觉得自己在作弊。 他们只是在做每天都要做的技术决定,而每一个决定单独看都合理。

★ GPT-4o 那件事第二次出场

第 01 章用一次模型更新引发的用户反弹,证明了「人格是后训练的产物」。 这一章用同一条线上的下一件事,证明另一件事:基准不是目标。

书是这么写的7:

基准是代理,不是现实。 如果它们不反映最终用户的视角, 它们会把人哄得心安理得,一直哄到一群不满的用户出现在门口。

GPT-5 发布时,它通过了发布前接受的所有测试,被誉为突破性的创新。 可用户不高兴。他们想要「他们的」4o 回来——那个被很多人批评为过分讨好、 却被更多人认为「更好相处」的模型。

书的收口:基准的提升不是目标,用户的满意才是。

注意这两次出场是同一件事的两端:

第 01 章那次这一章这次
用来证明人格是后训练的产物(一次更新就能把它换掉)基准不是目标(全考满分照样翻车)
事实是同一条产品线上的两次用户反弹同上

还有一个全行业尺度的后果

书顺带点了一个更大的现象8:

当所有人用同样的技法为同样的基准优化时,模型会收敛到相似的行为。 研究者开始把这叫做「人造蜂巢思维」。 一篇 2025 年的论文记录了这个现象:用相似偏好数据做过偏好训练的模型, 输出多样性比它们的底座明显更低。

书的判词:我们为同样的代理优化,于是抵达同样平庸的终点。 想要差异化,就得为不同的东西优化——而那意味着,得量不同的东西。

那么防线是什么

书给的答案只有一条,而且它就是下一节9:

防线是评估的多样性: 用多个不可能同时被钻空子的指标 · 轮换评估集,让模型没法对着具体样例过拟合 · 把人评当成一道持续的检查,看自动指标有没有和真实质量分道扬镳。

没有哪个单一指标是孤立可信的;可信度来自多个独立测量的互相印证。

5. 机制三:三角测量 —— 发散本身就是信号

这一节给出的是这一章唯一可以当场执行的判据。

三句话的操作规程

书把它写成了一条独立的规矩10:

永远别信任单一指标。 如果你在乎质量,就用三种方式量它: 一个自动指标求快 · 一次模型评判求细 · 定期的人评当基准真值。

三个一起涨,你才有了「真的进步了」的证据。 三个发散的时候(比如自动指标涨了、人评却原地踏步),★ 这个发散本身就是最重要的信号。

你最不信的那个指标,常常正在揭示另外两个藏起来的真相。

走查:那一局在这里走一步

自动指标: BLEU 0.31 → 0.35 ↑
困惑度 12.4 → 11.1 ↑(变好)
模型评判: 按四条标准打分,平均 3.6 → 3.9(5 分制) ↑
人评: 60 对成对比较,新版胜率 48% ↓

★ 前两层一起涨,第三层反着走。**按上面那条规矩,这就是最重要的信号。**

于是回去读输出——发现了这个:
新版的信里,**「依据保单第 7 条第 3 款」这一句被删掉了。**

为什么?因为参考文本里(那 800 封真实历史信件)很多封根本没写条款号。
→ BLEU 是在量「和参考文本有多像」
→ 新版更像参考文本了,所以 BLEU 涨
→ **而参考文本本身就是不合规的**

★ 结论:BLEU 涨的那 0.04,不是质量的证据,是「更像一批有缺陷的样本」的证据。

(这几个数是为演示编的;「BLEU 量的是与参考文本的词重合」是书里的定义。)

这一步同时验证了上一节那条定律的第一层: 如果你拿 BLEU 做训练决策, 你会一路把模型往「删掉条款号」的方向优化,而且全程觉得自己在做正确的事。

什么时候用哪一层

书给了明确的分工11:

这一层什么时候用为什么
自动指标每一个训练检查点、每一次实验它快到不会挡住迭代
模型评判在送去给人看之前,筛一遍有希望的候选它能滤掉明显不行的,并给一个初步排名
人评留给最终选型和上线决策它太贵,不能常规使用;但它是验证前两层有没有漂掉的必需品

6. 机制四:自动指标各测什么、各漏什么

这一节把常见的自动指标一个个说清。看着琐碎,但读者出门一定会撞见这些名字。

一类:比词面重合

名字量的是什么漏什么
BLEU生成文本与参考文本之间的词组精确率(生成的词组有多少在参考里出现过),外加一条对过短输出的惩罚换个说法就掉分
ROUGE反过来看召回:参考里的词组有多少出现在生成文本里;ROUGE-L 量的是最长公共子序列同上;它更适合摘要,因为那里「抓没抓到关键信息」比「用词一不一样」更要紧12
BERTScore不比字面,比语义向量的接近程度治得了换词,治不了「和参考不一样但同样好」

这一类有一条共同的死穴,书专门点出来了13:

它们全都要有参考答案,而对多数生成任务,好输出的空间大得很。 一份采用了和参考不同思路的好回答,可能在 BLEU 上得分很低,尽管它同样好甚至更好。

判据:参考答案是不是「唯一正解」。 是(比如某一句话的翻译)→ 这类指标好用; 只是众多合法选项之一(比如对用户问题的一个有帮助的回答)→ 低分可能只说明「和参考不一样」,而不是「不好」。

二类:困惑度

它量的是:模型看到一段文字时有多「意外」14

书给了一个很好用的读法:

困惑度是 20,意思是模型平均而言的不确定程度, 相当于每个位置都在 20 个等可能的候选词里均匀地猜。

参照物: 上面走查里从 12.4 降到 11.1,意思是平均每个位置的候选从大约 12 个缩到大约 11 个

但它有三条硬边界14:

  1. 它量的是流畅度和「与训练分布的吻合度」,不是事实准确性、也不是有用性。 一个模型可以在困惑度上表现优异,同时自信地生成假信息—— 因为困惑度奖励的是「预测文本通常怎么说」,不是「什么是真的」;
  2. 困惑度的绝对值不能跨模型比(它依赖分词方式等因素);
  3. 通过接口用别人的模型时,常常压根算不了—— 大多数商业接口不返回算它所需要的概率

三类:代码有一条别的路

代码和文本根本不同:代码要么跑得起来产出预期结果,要么跑不起来。 这让它可以完全绕开「和参考比对」这个问题15

名字意思
pass@k为一道题生成 k 份代码,各跑一遍单元测试,报告「至少有一份通过」的概率
pass@1 和 pass@k 之间的差距差距大 = 模型有这个能力,但发挥不稳定
all-k(k 份全通过的比例)一个更严的一致性检验。pass@k 高但 all-k 低,说明它是偶尔灵光;两者都高才叫可靠

书的判断:对「一致性比偶尔的神来之笔更重要」的生产系统,后面这个更严的比率更相关。

基准会饱和,这是一条要记住的规律

书用一个具体的数字链讲透了这件事16:

某个 164 道题的 Python 编程基准:
2021 年,当时最强的代码模型 pass@1 ≈ 28%
2025 年,前沿模型 pass@1 > 90% ← 饱和了

★ 饱和的意思是:它不再能区分强模型之间的差别。

于是有人做了它的加强版 —— 同一批模型在加强版上:
从 96% 掉到 76% ← 原来那 96% 有很大一部分是虚高

书给的规律:**创建 → 饱和 → 被替换,这个循环是健康的**,
它推动这一行去解更难的问题;**但它让长期的对比变得复杂。**

还有一条关于题型的提醒,它和第 07 章那条经济学呼应17:

这些基准共用的选择题格式,好处是客观——对就是对,错就是错,没有评分歧义。 局限是:它只捕捉到能力的很窄一面。 一个模型可能能从四个选项里挑出正确答案,却写不出来。

★ 这正是第 07 章那条「认得出比写得出容易」的反面用法: 认得出容易,所以选择题会高估真实能力。

7. 机制五:让强模型当裁判,和它的四种偏差

它解决什么问题

它填的是一个具体的缝:自动指标太粗,人评太贵。 做法很直白:拿一个有能力的模型去评被测模型的输出—— 裁判读到提示词、回答和评判标准,然后给出一个评分或者一个偏好判断18

三条硬要求

书把选裁判说成一个三方权衡:能力、成本、独立性19:

要求具体违反了会怎样
裁判至少要和被评的一样强,最好更强拿弱模型去评强模型,会产生系统性偏差——裁判认不出它自己产不出的质量
裁判要和被评的独立别用同一个模型家族的同族评判会产生盲点:如果两个模型以同样的方式误解一个概念,裁判会给错误答案打高分
评判标准要具体「给质量打个分」不行,那是让裁判自己去发明标准「回答有没有直接回应问题?信息是否事实准确?是否恰当地简洁?」这种才靠得住

书还给了一份评判提示词的四件套20:

① 明确的标准 —— 到底要评什么
② 要评的内容本身
③ 怎么表达判断 —— 打几分制、什么格式、要不要说理由
④ 校准样例 —— 几份好的和差的回答,连同它们该得的分

★ 缺任何一件,判断的可靠性都会下降。

书给标准那一件配了一句很锋利的话:
**如果你没法把「好」说清楚到能写进一段提示词里,你就没法可靠地评它。**

关于「让裁判先说理由再打分」,书的态度是罕见的坦白21:

证据是混杂的。 有些场景下,要求裁判把推理说出来,能把它锚定在具体观察上、降低噪声; 另一些场景下,推理过程本身引入偏差——裁判会构造事后的正当化, 去偏袒那些符合它自己风格偏好的回答。

最稳妥的做法:在一个有人类评分的校准集上先验证你打算用的那套流程,再信它。

四种偏差,以及各自的对策

书给了一张对照表22:

偏差长什么样对策
位置偏差成对比较时,有些裁判系统性地偏好排在前面(或后面)的那份同一对摆两遍、位置对调,只把两遍一致的结果当可靠信号
长度偏差偏好更长的回答,有时偏得很厉害明写「简洁是有价值的」,或者把简洁单独作为一个维度来评
风格趋同偏差偏好那些像裁判自己写出来的回答,可能因此惩罚了有效但风格不同的做法换一个不同模型家族的裁判
自信偏差奖励断言式的措辞,不管它对不对在校准样例里,给「恰当地表达不确定」打一个正面的分

长度偏差那一条书专门开了一个警告框,因为它会自我加强23:

一份把答案埋在冗余上下文里的啰嗦回答,会压过一份直接作答的简洁回答。 而当裁判的偏好被用来筛选偏好训练的数据时,这个偏差会复合—— 训出来的模型学会往回答里灌水。

★ 这正是第 07 章那条「打分器偏爱长回答」在评估侧的同一副面孔。

书给的金标准只有一条:定期拿人评来校准。 裁判的评分一旦和人的评估漂开,就说明这套偏差缓解失效了。22

8. 机制六:人评也是要做统计的

这一节纠正一个很常见的误解:人评不是「金标准」,它也有噪声,而且噪声大到能吞掉你的结论。

第一件事:指令模糊,每个人会自创标准

让评估者「给质量打个分」,每个人都会按自己心里那套隐含标准去理解「质量」。 一个人盯准确性、一个人盯有用性、第三个人盯文笔。 结果是几个不同维度被搅在一起,而且没法互相比较。24

书还列了几种评估任务的形态,各有适用24:

形态好处代价
给单条打绝对分每条有独立分数不同评估者的标尺不一样
两两比较人做起来更可靠要更多次比较才能排出一个完整顺序
多选项排序一次拿到更多信息认知负担高

第二件事:一致率要用能扣掉运气的统计量

这一条第 07 章讲标注质量时出现过,这里是它在评估侧的同一件事25:

统计量说明
简单百分比一致率直觉但会误导——当某一类评分本来就特别常见时,它会虚高
Cohen's kappa扣掉了「碰巧一致」的那部分。高于 0.6 通常算实质一致,低于 0.4 说明这次评估可能不可靠
Krippendorff's alpha扩展到多个评估者,而且能处理有序等级——它知道「4 分对 5 分」的分歧,比「1 分对 5 分」小

但书紧接着补了一条不许省略的话26:

一致率低不一定是流程失败。 对真正主观的品质(比如一份回答读起来吸不吸引人、文风合不合适), 讲道理的人本来就可能合理地不一致。 这种情况下的低一致率反映的是「关于什么算更好」的诚实的不确定,而不是流程有问题。 只是从低一致率的数据里得出的结论,要相应地谨慎。

第三件事:那个能吞掉结论的数

这是本节最该带走的一条26:

如果评估者只有 60% 的时候在「哪份更好」上意见一致, 那么 55% 对 50% 的胜率差别,整个落在噪声里。

走查:那一局在这里走第二步

回到我们那 60 对比较,新版胜率 48%。

第 1 步:先算一致率 → κ = 0.55
← 低于 0.6,「实质一致」都算不上。结论必须谨慎。

第 2 步:再看样本量。书给的功效计算公式,拿它的例子代一遍:
5 分制、标准差 0.8、要检出 0.1 分的差异、
八成把握、五个点的显著性水平
→ **每组约需 1003 个样本,总共约 2000。**

我们手上有多少?60 对。

★ 裁决:**这 48% 既不能证明它更差,也不能证明它不更差。样本量差了一个数量级。**
——但这一局真正的收获不在这个数字上,
而在第 5 节读输出时发现的那件事:**条款号被删了。**

(κ = 0.55 和 60 对是为演示编的;1003 这个数和那五个参数是书里算例给的。)

顺带把人评的成本说清

书给的量级:一次「比较两个模型输出」的评估,算上评估者时间、平台费和质控开销, 可能要一美元或更多;而要有统计功效地全面评一个模型,可能需要好几千次27

四条把它压下来的策略27:

  1. 只把人评留给高风险决策,常规监控用便宜的自动指标;
  2. 拿人评去校准模型评判,然后用模型评判铺量;
  3. 主动挑样本:两个模型差不多的提示词没信息量,把人力集中在两者分歧大的那些上;
  4. 把标注界面做顺手,直接压低每条的耗时。

9. 机制七:真正算数的是你自己那套题库

这一节是这一章的落点,也是第 09 章那个坑的补丁。

结论先行

公开基准告诉你「这个模型在别人的题上考得怎么样」。 而你要知道的是「它在你的活上干得怎么样」。这是两件事。

书给这一节起的标题就叫「你的基准,你的规矩」,并且给了三条构件28:

构件要求做砸了会怎样
任务说明要清楚模型到底该做什么:从文档里抽出哪几个字段?在什么范围内答问?按什么规范生成内容?说明含糊,评出来的结果就含糊
样例要覆盖真实分布常见情形、边缘情形,以及你的数据里那些特有的变体样例偏易 → 估计过于乐观;样例全是边缘 → 也不反映实际
要做版本管理样例本身、评判标准、自动打分的代码,三样都要有版本没有版本管理的基准,支撑不了「新模型比旧模型好」这个说法——因为基准自己可能变了

活基准:它不是造出来的,是长出来的

这是书里最实用的一段之一29:

起手:**50 到 100 条**精心挑选的样例,覆盖你的核心用途
← 参照物:公开基准动辄几千上万道题,而你只需要这个量级就能起步

然后:**每一个部署周期之后,把这个周期暴露出模型弱点的例子加进去**
├ 真实用户问了、模型答砸了的问题
├ 让你吃了一惊的边缘情形
└ 新冒出来的使用模式

一年之后:你会有一套**精确刻画了你这个部署到底需要什么**的基准。

★ 书的判词:这套从真实经验里长出来的基准,**比任何通用的替代品都值钱**。
而且它必须被严加看管——**只要一个不小心,这项攒了很久的资产就会失去价值。**

四条泄漏路径,后面两条没人觉得是作弊

这就是「严加看管」的具体所指30:

泄漏路径长什么样有没有人觉得这是作弊
① 直接重叠训练数据和评估数据有交集,或者两者来自同一来源且没去重
② 看着评估失败去改训练数据你研究了评估里的失败案例,然后调整训练数据去覆盖它们多数人不觉得
③ 拿评估样例做提示词工程或调试你已经让自己接触了评估分布多数人不觉得
④ 看着评估结果决定什么时候停止训练、选哪组超参光是看结果就可能造成泄漏几乎没人觉得

书给的防线是四条硬的30:

  1. 先建评估集,再攒训练数据——让这个切分在任何训练决定之前就定死;
  2. 技术上隔离:分开的存储、限制谁能看评估数据的访问控制、自动查重;
  3. 定期换血,把可能已经被污染的评估数据替掉;
  4. 按时间切分——让评估数据来自训练数据截止之后书说这一条保证最强:如果评估数据在训练时还不存在,它就不可能被学过。

公开基准的污染问题

同一件事在公开基准上是无解的31:

污染常常不是故意的。 大规模网络抓取可能无意中收进了那些被贴在网上的基准数据集, 而且不做仔细分析根本看不出重复。

书给的实操口径:用公开基准时,就假定存在一定程度的污染,并据此解读分数。 高风险场景要用从未公开过的私有留出集。

还有一件事必须一起做:回归测试

这是第 04 章那个灾难性遗忘在验收侧的样子32:

后训练想提升的是特定能力,但一个维度上的提升可能以另一个维度上的退化为代价。 为客服调过的模型可能丢掉写代码的能力;在医疗数据上训过的模型 可能变得更不会闲聊如果评估只盯着目标领域,这些退化在开发期间根本不会显形。

书给的做法有三条,第三条最反直觉32:

  1. 重点测那些和训练领域相关的能力,它们最可能被影响;
  2. 在各类能力上广泛采样,抓那些意料之外的退化;
  3. 标准基准上任何意料之外的变化都要查——哪怕那是提升。 因为意外的提升可能意味着分布漂移,而漂移可能在别处造成意外的退化。

最后一层:线上分流试验

这是那一摞的最底层,也是唯一贴着「部署真相」这个标签的一层33

书给了三条设计要点和两个坑:

要点说明
指标定义要清楚任务完成率、用户满意度、参与度、错误率——要量你在乎的,不是量容易量的
随机分组要真随机分配过程必须不可预测、且与用户特征无关
样本量要够如果新模型只比基线好 2%,要有把握检出它,就需要足够多的用户让 2% 达到统计显著

两个坑:

坑一:同时看很多指标
★ 测 20 个指标、拿 0.05 当显著性门槛,
**即使根本没有真实效果,你也预期会撞上大约 1 个假阳性。**
对策:多重检验校正,或者**事先指定一个主指标**。

坑二:中途偷看
★ 更阴险。如果你每天查一次「显著了没」、一显著就停,
**你会不成比例地停在「随机波动刚好偏向某一边」的那一刻。**

还有一条关于用户偏好本身的提醒34:

用户可能偏好更自信的模型,哪怕那份自信没有根据——他们把确定当成了准确。 他们可能过度看重最近的几次交互; 他们也可能预测不准自己的长期偏好:对某些功能一开始很热情、后来不用了, 对另一些一开始抵触、后来离不开。

最后一句:这不是一道闸门

书用整章最后一段纠正了一个很自然的误解35:

人的诱惑是把评估当成一道闸门:通过基准 → 拿到可接受的人类评分 → 上线 → 翻篇。 这个框架误解了问题的性质。 模型要面对的是会找出意料之外失败模式的用户、会随时间漂移的数据分布、 以及主动探测弱点的对手。 那次宣布模型「可以上线了」的评估,未必能覆盖上线之后才冒出来的问题。

★ 停止评估的组织不是成功了,只是停止寻找失败了。 在后训练这门手艺里,评估不是一件要完成的任务,而是一门要维持的功课。

10. 作者的判断与证据

说法是哪一类说明
可算指标与所求只有弱相关,而且这是结构性的作者的核心论点他给了四条原因论证,但这是论证不是实测12
那条「量度变成目标」的定律有据(经济学的既有原理)书交代了它的出处(货币政策语境)4
指标塑造做开发的人的行为作者的判断书里没有配研究出处,是行业观察;但这是全章最重要的一句6
GPT-5 全基准通过却引发用户不满公开事件书用它来论证「基准不是目标」;书没有给这一段配尾注,是作者的叙述
人造蜂巢思维有据书点名了一篇 2025 年的会议论文并给了尾注8
1000💯10 的用量比作者给的示意书自己写的措辞是「一个说明性的模式」,并说这个比例随预算而变11
困惑度 20 = 相当于在 20 个等可能候选里猜定义的直接后果可以自己验算14
某代码基准从 28% 涨到九成以上、加强版把 96% 打回 76%有据的数字书给了尾注16
裁判必须至少和被评模型一样强作者的判断 + 机制解释理由是「裁判认不出它产不出的质量」,这是论证不是实测19
让裁判先说理由是否有用书自己说证据混杂这类坦白比结论有价值,我们照实写21
60% 一致率下 55% 对 50% 落在噪声里统计推论书直接给出这个判断26
一次成对人评约一美元或更多作者给的量级没有配调研出处27
50–100 条起步、一年长成精准资产作者的经验法则书标在「FROM THE TRENCHES」栏目下,是他的实践经验29
那四条泄漏路径实践经验汇总后两条尤其值得注意,书明说「光是看评估结果」就可能造成泄漏30

11. 边界与局限

  1. 安全与公平那两大块我们只提名字。 书列了一批毒性检测服务、有害提示词数据集、 以及几种互相冲突的公平性定义,属于工具目录,而且更新很快; 它们不改变这一章的判断链,所以我们没有展开。
  2. 外挂检索系统的评估我们没展开。 书把它拆成「检索这一半」和「生成这一半」分别评, 并列了三个专门工具;这属于第 03 章那条路的验收,不在本章主线上。
  3. 样本量公式我们只交付了它的一个算例。 书给了完整公式, 我们交付的是「2000 个用户只够检出一个中等大小的效应」这个量感。
  4. 让编码助手来编排评估流水线那一节,我们按全书口径不覆盖。 书自己在那里给了一条口径值得单独记住:让它当编排者,不要让它当评估者。
  5. 书没有给「多好才算够好」的答案。 它给的是判断结构(三种口径 + 你自己的题库), 门槛必须由用途定——这一点第 11 章会以另一种形式再出现。

12. 可带走的

  1. 评估的难是结构性的,不是方法学还不够好。 可测代理和真实质量之间那道缝,是「开放式生成」这件事的固有特征;
  2. 四条原因:答案开放 · 好坏主观 · 好坏多维 · 这几维还互相拉扯;
  3. 「那只猫坐在航天飞机上」和「那只猫坐在 vmslkrmw」都错,但错得不是一回事—— 而任何自动指标都分不清;
  4. 那条定律有两层。 第一层是模型学会应付考卷; 第二层是指标塑造做开发的那些人的行为,而他们不觉得自己在作弊;
  5. 基准全考满分照样可能翻车(GPT-5 那件事);基准的提升不是目标,用户的满意才是;
  6. 所有人为同样的基准优化 → 模型收敛到同样平庸的地方; 想差异化,就得量不同的东西;
  7. 三角测量:自动指标求快、模型评判求细、人评当真值。三个一起涨才算真进步; 它们发散的时候,发散本身就是最重要的信号;
  8. 用量比大约 1000 : 100 : 10;自动指标每个检查点都跑,人评只留给上线决策;
  9. 比词面重合的那类指标要有「唯一正解」才好用; 开放任务上的低分可能只说明「和参考不一样」;
  10. 困惑度量流畅度,不量真假——一个模型可以困惑度很低、同时自信地胡说; 而且它跨模型不可比,通过接口用别人的模型时常常算不了;
  11. 代码可以绕开参考比对:pass@k 看「至少一份过」,all-k 看一致性; pass@k 高而 all-k 低 = 偶尔灵光,不是可靠;
  12. 基准会饱和:创建 → 饱和 → 被替换;加强版把同一批模型从 96% 打回 76%, 说明原来那个数虚高;选择题格式会高估真实能力(认得出比写得出容易);
  13. 裁判至少要和被评的一样强,而且别用同族——同族会共享盲点;
  14. 裁判的四种偏差:位置(对调再测,只信两遍一致的)· 长度(明写「简洁有价值」)· 风格趋同(换家族)· 自信(在校准样例里给「恰当的不确定」正面分);
  15. 人评也是要做统计的:一致率要用能扣掉运气的统计量; ★ 一致率只有六成时,55% 对 50% 的差别整个落在噪声里;
  16. 但一致率低不一定是流程坏了——对真正主观的品质,那是诚实的不确定;
  17. 一次线上试验每组约需一千个样本;同时看 20 个指标就预期会撞上一个假阳性; 中途偷看会膨胀假阳性;
  18. 真正算数的是你自己那套题库:50–100 条起步,每个部署周期把新暴露的失败加进去, 一年内长成精准资产;
  19. 四条泄漏路径,后两条没人觉得是作弊:看着评估失败改训练数据 · 拿评估样例做调试 · 光是看结果决定何时停训;最强的防线是按时间切分;
  20. 回归测试要做,而且意料之外的提升也要查——它可能意味着分布漂移;
  21. 评估不是一道闸门,是一门要一直维持的功课。 停止评估的组织不是成功了,只是停止寻找失败了。

13. 原文地图

主题原书章原文位置
错法有层次 · 缝是结构性的EVALUATION STRATEGIES: MEASURING MODEL QUALITYtext/73-fm-the-evaluation-problem.txt:5(搜「the space shuttle」) · :7(搜「structural feature of working with open-ended generation」)
四条原因 · 更多数据救不了The Evaluation Problemtext/74-fm-the-evaluation-problem.txt:7(搜「correlate only loosely with what we want」) · :9(搜「the dimensions interact」) · :11(搜「does not fully resolve these issues」)
那条定律的两层The Evaluation Problemtext/74-fm-the-evaluation-problem.txt:15(搜「when a measure becomes a target」) · :17(搜「a test of benchmark-taking skill」) · :19(搜「shapes the behavior of the humans doing the development」)
防线是评估多样性 · 人造蜂巢思维The Evaluation Problemtext/74-fm-the-evaluation-problem.txt:21(搜「Diverging metrics signal that something has gone wrong」) · :23(搜「artificial hivemind」)
三角测量 · 评估栈METRIC TRIANGULATIONtext/75-fm-metric-triangulation.txt:3(搜「The metric you trust least」) · :9(搜「Trade-offs at Each Level」)
各层什么时候用 · 1000💯10WHEN TO USE EACH LEVELtext/76-fm-when-to-use-each-level.txt:3(搜「a thousand automated checks」) · :65(搜「Recall-oriented understudy」)
参考答案的死穴 · 困惑度WARNINGtext/77-fm-warning.txt:3(搜「rather than one of many valid options」) · :7(搜「20 equally likely tokens」) · :9(搜「confidently generating false information」)
代码指标 · 基准饱和WARNINGtext/77-fm-warning.txt:13(搜「code has a notion of correctness that text lacks」) · :57(搜「the model has the capability but inconsistently applies it」) · :59(搜「sporadically」) · :61(搜「164 handwritten Python programming problems」)
选择题的局限 · 饱和循环The Benchmark Zootext/83-fm-the-benchmark-zoo.txt:83(搜「capture only narrow aspects」) · :85(搜「creation, saturation, and replacement」)
让模型当裁判 · 三条硬要求The Implementation Landscapetext/78-fm-the-implementation-landscape.txt:19(搜「LLM-as-a-judge」) · :23(搜「at least as capable as the model being evaluated」) · :25(搜「leaves the judge to invent its own interpretation」) · :27(搜「post hoc justifications」)
评判提示词四件套EVALUATOR PROMPT ANATOMYtext/79-fm-evaluator-prompt-anatomy.txt:3(搜「calibration examples showing good and poor responses」) · :49(搜「Length bias is pervasive」)
四种偏差与对策WARNINGtext/80-fm-warning.txt:3(搜「creating models that learn to pad responses」) · :7(搜「Mitigating Common LLM-as-a-Judge Biases」) · :29(搜「periodic calibration against human judgment」)
基准不是目标(GPT-5 那件事)WARNINGtext/81-fm-warning.txt:3(搜「Benchmark improvement is not the goal」)
基准污染 · 红队Benchmark Contaminationtext/84-fm-benchmark-contamination.txt:3(搜「often unintentional」) · :5(搜「temporal splits」) · :23(搜「cat-and-mouse dynamic」)
人评协议 · 一致率统计The Human in the Looptext/85-fm-the-human-in-the-loop.txt:7(搜「each will interpret quality according to their own implicit criteria」) · :9(搜「Absolute ratings provide independent scores」)
一致率的解读 · 成本与策略WARNINGtext/86-fm-warning.txt:9(搜「corrects for chance agreement」) · :13(搜「honest uncertainty about what better means」) · :17(搜「might cost a dollar or more」) · :21(搜「Active sampling」)
自建基准的三条构件YOUR BENCHMARKS, YOUR RULEStext/87-fm-your-benchmarks-your-rules.txt:9(搜「overly optimistic estimates」) · :11(搜「the benchmark itself may have changed」)
活基准 · 四条泄漏路径 · 回归测试FROM THE TRENCHES: THE LIVING BENCHMARKtext/88-fm-from-the-trenches-the-living-benchmark.txt:3(搜「50 to 100 carefully selected examples」) · :9(搜「Even looking at evaluation results can cause leakage」) · :11(搜「Temporal splits」) · :15(搜「Regression testing」) · :19(搜「unexpected improvements may indicate distribution shift」)
线上试验的设计A/B Testing: Where Theory Meets Realitytext/89-fm-a-b-testing-where-theory-meets-reality.txt:9(搜「not merely what is easy to measure」) · :11(搜「Power calculations」)
样本量 · 多重检验 · 偷看 · 说与做SAMPLE SIZE: POWER CALCULATIONtext/90-fm-sample-size-power-calculation.txt:13(搜「roughly 2,000 users total」) · :15(搜「peeking at results」) · :23(搜「mistaking certainty for accuracy」)
评估是功课不是闸门Summarytext/91-fm-summary.txt:13(搜「evaluation as a gate」) · :15(搜「merely stopped looking for failure」)

Footnotes

  1. 出处:「EVALUATION STRATEGIES: MEASURING MODEL QUALITY」第 5 段(text/73-fm-the-evaluation-problem.txt:5,搜「the space shuttle」)与第 7 段(text/73-fm-the-evaluation-problem.txt:7,搜「structural feature of working with open-ended generation」)。第 5 段那两个续写例子是书里给的原例。第 7 段还有一句要一起记的:没有严格的评估,我们无法知道自己的干预究竟是改进了模型,还是只是把它改成了我们碰巧喜欢的样子。 第 9 段(text/73-fm-the-evaluation-problem.txt:9,搜「not merely technical but epistemological」)说这个挑战「不只是技术上的,还是认识论上的」——「一个语言模型『好』是什么意思?不同的利益相关方有不同的答案,而这些答案有时互相冲突。」 2

  2. 出处:「The Evaluation Problem」第 7 段(text/74-fm-the-evaluation-problem.txt:7,搜「correlate only loosely with what we want」)与第 9 段(text/74-fm-the-evaluation-problem.txt:9,搜「the dimensions interact」)。第 7 段给了一个很干净的对照:评一个分类模型时,准确率量的正好就是我们在乎的东西;评一个语言模型时,能轻松算出来的那些数,和我们想要的「有帮助、准确、恰当的回答」只有松散的相关。 2

  3. 出处:「The Evaluation Problem」第 11 段(text/74-fm-the-evaluation-problem.txt:11,搜「does not fully resolve these issues」)。原文的收口是:目标不是找到那个完美指标,而是搭一套即便每个单项都不完美、仍然能给出有用信号的评估系统。

  4. 出处:「The Evaluation Problem」第 15 段(text/74-fm-the-evaluation-problem.txt:15,搜「when a measure becomes a target」)。原文交代了这条原理的出处:经济学家 Charles Goodhart 在货币政策语境里提出,但它对任何依赖代理指标的优化过程同样成立。这个名字要留——读者出门在任何一篇讲指标的文章里都会撞见 Goodhart's law。 2 3

  5. 出处:「The Evaluation Problem」第 17 段(text/74-fm-the-evaluation-problem.txt:17,搜「a test of benchmark-taking skill」)。原文点名了那三种被学到的模式(选择题奖励的措辞、评估者偏好的回答结构、与训练数据吻合的长度分布),并说:一个学会识别某类题型并套用该题型启发式的模型,可以在那个基准上考得很好,而在真正的知识应用上并不更强。

  6. 出处:「The Evaluation Problem」第 19 段(text/74-fm-the-evaluation-problem.txt:19,搜「shapes the behavior of the humans doing the development」)。原文的两个例子:拿困惑度当主要指南的团队会做出降困惑度但不提质量的选择;只盯任务完成率的团队可能宁可要一个「把任务做砸了但做完了」的模型,也不要那个「恰当地拒绝超出能力的任务」的模型书没有为这一段配研究出处,它是作者的观察。 2

  7. 出处:「WARNING」第 3 段(text/81-fm-warning.txt:3,搜「Benchmark improvement is not the goal」)。原文:基准是代理不是现实,如果它们不反映最终用户的视角,它们会把人哄得心安理得,一直哄到一群不满的用户出现在门口;GPT-5 发布时通过了发布前的所有测试,用户却想要「他们的」4o 回来这一段书没有给尾注,是作者的叙述。 同一件事的另一头在第 01 章:那里用的是 2025 年 4 月那次因过分讨好而回滚的更新。

  8. 出处:「The Evaluation Problem」第 23 段(text/74-fm-the-evaluation-problem.txt:23,搜「artificial hivemind」)。书给了尾注,指向一篇 2025 年的会议论文;原文的发现是:用相似偏好数据做过 RLHF 的模型,输出多样性可测量地低于它们的底座对照。 结论那句是:我们为同样的代理优化,于是抵达同样平庸的终点。 2

  9. 出处:「The Evaluation Problem」第 21 段(text/74-fm-the-evaluation-problem.txt:21,搜「Diverging metrics signal that something has gone wrong」)。原文列的三条防线是:用多个不能被同时钻空子的指标、轮换评估集以防对具体样例过拟合、把人评当成一道持续的检查;并明说没有哪个单一指标是孤立可信的,可信度来自多个独立测量的一致

  10. 出处:「METRIC TRIANGULATION」第 3 段(text/75-fm-metric-triangulation.txt:3,搜「The metric you trust least」)。这是书里一个独立的方框,原文最后那句是:你最不信的那个指标,常常正在揭示别的指标藏起来的一个真相。

  11. 出处:「WHEN TO USE EACH LEVEL」第 3 段(text/76-fm-when-to-use-each-level.txt:3,搜「a thousand automated checks」)。原文明说这个比例是「说明性的模式」而且随预算而变。那张评估栈的表在「METRIC TRIANGULATION」第 9 段(text/75-fm-metric-triangulation.txt:9,搜「Trade-offs at Each Level」),四层分别标注了速度、成本、细腻度和最佳用途;线上分流试验那一行的细腻度栏写的是「部署上的真相」。 2

  12. 出处:「WHEN TO USE EACH LEVEL」第 65 段(text/76-fm-when-to-use-each-level.txt:65,搜「Recall-oriented understudy」)。原文说明它强调召回而非精确率,ROUGE-1 数一元词重合、ROUGE-2 数二元词组重合、ROUGE-L 量最长公共子序列;这种偏召回的取向适合摘要,因为那里「抓没抓到关键信息」比「用词一不一样」更要紧。BLEU 与 BERTScore 的定义见同一节的表 6-2(text/76-fm-when-to-use-each-level.txt:13,搜「Token-Level Similarity Metrics」)。

  13. 出处:「WARNING」第 3 段(text/77-fm-warning.txt:3,搜「rather than one of many valid options」)。原文:一份采用了和参考不同思路的有帮助的回答,可能在 BLEU 上得分很低,尽管它同样好甚至更好;这类指标在参考是「唯一正解」时最好用。

  14. 出处:「WARNING」第 7 段(text/77-fm-warning.txt:7,搜「20 equally likely tokens」)与第 9 段(text/77-fm-warning.txt:9,搜「confidently generating false information」)。第 7 段还说明困惑度在数学上是「取指数后的平均负对数似然」,而且它的数值依赖分词等因素,不能跨模型直接比;第 9 段那条最要紧:它奖励的是「预测文本通常怎么说」,而不是「什么是真的」;并指出大多数商业接口不返回算它所需的概率 2 3

  15. 出处:「WARNING」第 13 段(text/77-fm-warning.txt:13,搜「code has a notion of correctness that text lacks」)、第 57 段(text/77-fm-warning.txt:57,搜「the model has the capability but inconsistently applies it」)与第 59 段(text/77-fm-warning.txt:59,搜「sporadically」)。第 59 段的收口是:对「一致性比偶尔的神来之笔更重要」的生产系统,那个更严的比率更相关;pass@k 与 all-k 的比值量化的正是解法的可靠性

  16. 出处:「WARNING」第 61 段(text/77-fm-warning.txt:61,搜「164 handwritten Python programming problems」)。书给了尾注;原文的数字是 2021 年约 28%、2025 年前沿模型超过 90%,这种饱和推动了更难基准的开发;它还提到那个 974 题的入门级 Python 题集,以及把同一批模型从 96% 打回 76% 的加强版。饱和这个循环本身见「The Benchmark Zoo」第 85 段(text/83-fm-the-benchmark-zoo.txt:85,搜「creation, saturation, and replacement」)。 2

  17. 出处:「The Benchmark Zoo」第 83 段(text/83-fm-the-benchmark-zoo.txt:83,搜「capture only narrow aspects」)。原文承认选择题格式的好处是客观、能支撑大规模自动评估、避开了开放式评分的偏差;局限是一个模型可能能从四个选项里挑出正确答案,却做不到别的事

  18. 出处:「The Implementation Landscape」第 19 段(text/78-fm-the-implementation-landscape.txt:19,搜「LLM-as-a-judge」)。原文:这种做法填的是粗糙的自动指标和昂贵的人评之间的缝,并明说它对第 09 章那类偏好训练方法尤其相关——因为它可以用来生成偏好数据。这个名字要留:出门看任何一篇讲评估的文章都会撞见 LLM-as-a-judge。

  19. 出处:「The Implementation Landscape」第 23 段(text/78-fm-the-implementation-landscape.txt:23,搜「at least as capable as the model being evaluated」)与第 25 段(text/78-fm-the-implementation-landscape.txt:25,搜「leaves the judge to invent its own interpretation」)。第 23 段那句关于同族的原话是:如果两个模型以同样的方式误解一个概念,裁判会给错误的答案打高分。 第 25 段还提到分维度评分比一个笼统的总分更有可操作性 2

  20. 出处:「EVALUATOR PROMPT ANATOMY」第 3 段(text/79-fm-evaluator-prompt-anatomy.txt:3,搜「calibration examples showing good and poor responses」)。原文那句锋利的话是:如果你没法把「好」说清楚到足以写进一段提示词里,你就没法可靠地评它。

  21. 出处:「The Implementation Landscape」第 27 段(text/78-fm-the-implementation-landscape.txt:27,搜「post hoc justifications」)。原文用的措辞是「the evidence is mixed」——证据是混杂的;最稳妥的做法是在有人类评分的校准集上先验证再信。这类坦白按行文十三条第 11 条照实写。 2

  22. 出处:「WARNING」第 7 段(text/80-fm-warning.txt:7,搜「Mitigating Common LLM-as-a-Judge Biases」)与第 29 段(text/80-fm-warning.txt:29,搜「periodic calibration against human judgment」)。那张表从第 13 段起逐格排开,四种偏差各配一条对策。第 29 段的原话:没有哪种缓解是完美的,但把多种技术组合起来能削弱任何单一偏差的影响;金标准仍然是定期对着人类判断校准。 四种偏差的完整描述见「EVALUATOR PROMPT ANATOMY」第 49 段(text/79-fm-evaluator-prompt-anatomy.txt:49,搜「Length bias is pervasive」)。 2

  23. 出处:「WARNING」第 3 段(text/80-fm-warning.txt:3,搜「creating models that learn to pad responses」)。这是书里一个独立的警告框:当裁判的偏好影响到偏好训练的数据选择时,这个偏差会复合,训出学会灌水的模型。

  24. 出处:「The Human in the Loop」第 7 段(text/85-fm-the-human-in-the-loop.txt:7,搜「each will interpret quality according to their own implicit criteria」)与第 9 段(text/85-fm-the-human-in-the-loop.txt:9,搜「Absolute ratings provide independent scores」)。第 7 段那句「一个人盯准确性、一个人盯有用性、第三个人盯文笔」是书里的原例,结论是这些评分把不同维度搅在一起、没法有意义地比较 2

  25. 出处:「WARNING」第 9 段(text/86-fm-warning.txt:9,搜「corrects for chance agreement」)与第 11 段(text/86-fm-warning.txt:11,搜「4 versus 5 represents less disagreement」)。第 9 段给了两个阈值:高于 0.6 通常算实质一致、低于 0.4 说明这次评估可能不可靠。注意这两个数和第 07 章给标注一致率的 0.7 / 0.4 不完全相同——那里说的是偏好标注,这里说的是评估打分,书在两处给的口径本来就不一样,我们照实分开写。

  26. 出处:「WARNING」第 13 段(text/86-fm-warning.txt:13,搜「honest uncertainty about what better means」)。原文那个数字例子是:如果评估者只有 60% 的时候在「哪个回答更好」上一致,那么 55% 对 50% 的胜率差别就落在噪声里。 2 3

  27. 出处:「WARNING」第 17 段(text/86-fm-warning.txt:17,搜「might cost a dollar or more」)、第 19 段(text/86-fm-warning.txt:19,搜「Reserve human evaluation for final model selection」)与第 21 段(text/86-fm-warning.txt:21,搜「Active sampling」)。那个「一美元或更多」的量级书没有配调研出处。 第 25 段(text/86-fm-warning.txt:25,搜「evaluation as a service」)还提到有专门的第三方评估服务商,第 29 段(text/86-fm-warning.txt:29,搜「a neutral view across vendors」)说它们最有用的场景是内部激励让人难以信任内部结果、或者采购需要一个跨供应商的中立视角 2 3

  28. 出处:「YOUR BENCHMARKS, YOUR RULES」第 9 段(text/87-fm-your-benchmarks-your-rules.txt:9,搜「overly optimistic estimates」)与第 11 段(text/87-fm-your-benchmarks-your-rules.txt:11,搜「the benchmark itself may have changed」)。第 11 段明说版本管理要覆盖三样:样例本身、评判标准、以及任何自动打分的代码

  29. 出处:「FROM THE TRENCHES: THE LIVING BENCHMARK」第 3 段(text/88-fm-from-the-trenches-the-living-benchmark.txt:3,搜「50 to 100 carefully selected examples」)。原文:这套从真实经验里长出来的有机基准,比任何通用替代品都更有价值;并加了一句看管的警告——只要一个不小心,这项长期积累的宝贵资产就会失去价值。 2

  30. 出处:「FROM THE TRENCHES: THE LIVING BENCHMARK」第 9 段(text/88-fm-from-the-trenches-the-living-benchmark.txt:9,搜「Even looking at evaluation results can cause leakage」)与第 11 段(text/88-fm-from-the-trenches-the-living-benchmark.txt:11,搜「Temporal splits」)。第 9 段把四条路径逐条列了出来,最后一条的原话是「光是看评估结果,也可能造成泄漏,如果它引导了『何时停止训练』或者『选哪组超参』的决定」;第 11 段说按时间切分提供特别强的保证——如果评估数据在训练数据存在时还不存在,它就不可能泄漏 2 3

  31. 出处:「Benchmark Contamination」第 3 段(text/84-fm-benchmark-contamination.txt:3,搜「often unintentional」)与第 5 段(text/84-fm-benchmark-contamination.txt:5,搜「temporal splits」)。第 5 段的实操口径:用公开基准时就假定存在一定程度的污染并据此解读分数,高风险评估要用从未发表过的私有留出集。第 23 段(text/84-fm-benchmark-contamination.txt:23,搜「cat-and-mouse dynamic」)是关于红队的:它随被测模型而调整,所以安全评估永远不会完成

  32. 出处:「FROM THE TRENCHES: THE LIVING BENCHMARK」第 15 段(text/88-fm-from-the-trenches-the-living-benchmark.txt:15,搜「Regression testing」)与第 19 段(text/88-fm-from-the-trenches-the-living-benchmark.txt:19,搜「unexpected improvements may indicate distribution shift」)。第 15 段那两个例子(为客服调过的模型丢掉写代码能力、在医疗数据上训过的模型变得更不会闲聊)是书里的原例;这正是第 04 章那个灾难性遗忘在验收侧的样子。 2

  33. 出处:「A/B Testing: Where Theory Meets Reality」第 9 段(text/89-fm-a-b-testing-where-theory-meets-reality.txt:9,搜「not merely what is easy to measure」)与「SAMPLE SIZE: POWER CALCULATION」第 13 段(text/90-fm-sample-size-power-calculation.txt:13,搜「roughly 2,000 users total」)、第 15 段(text/90-fm-sample-size-power-calculation.txt:15,搜「peeking at results」)。那个算例的参数是:5 分制、标准差 0.8、要检出 0.1 的差异、功效 0.8、显著性 0.05,算出来每组约 1003 人;书还提醒对更嘈杂的指标或更小的效应,样本量按平方增长

  34. 出处:「SAMPLE SIZE: POWER CALCULATION」第 23 段(text/90-fm-sample-size-power-calculation.txt:23,搜「mistaking certainty for accuracy」)。原文还说:偏好数据反映的是用户在被问到的那一刻的感受;并建议把偏好和行为数据结合起来看,两者的分歧本身就带信息

  35. 出处:「Summary」第 13 段(text/91-fm-summary.txt:13,搜「evaluation as a gate」)与第 15 段(text/91-fm-summary.txt:15,搜「merely stopped looking for failure」)。第 13 段说明为什么把评估当闸门是误解:模型要面对会找出意外失败模式的用户、会随时间漂移的数据分布、以及主动探测弱点的对手;第 15 段那句收口是:停止评估的组织不是成功了,只是停止寻找失败了;在后训练这门手艺里,评估不是一件要完成的任务,而是一门要维持的功课。