跳到主要内容

评估落地:定标准、选模型、搭自己的考场

这一章讲三件事: 为什么「先定标准再动手」是这本书最值钱的一条工程纪律; 选模型时怎么把「眼花缭乱」筛成一张可执行的清单——以及公开榜单到底能信几分; 怎么从零搭一条自己的评估流水线,并且连这条流水线也要被评估。 它在全书的位置:前两章给了尺子和考官,这一章把它们装进你的项目流程;后面的提示、RAG、微调各章,每改一处都要回到这条流水线重考一遍。

1. 顶层全景:最贵的是「不知道」

作者先把一个反直觉的排序摆上桌:「部署了却不知道有没有用」比「从未部署」更糟——前者既背着维护成本,下线时还要再付一笔1。真实案例是她遇到的一位二手车平台的工程师:价格预测模型上线一年,用户看着挺喜欢,但没人知道预测准不准;ChatGPT 热潮初期铺开的客服机器人,许多公司至今分不清它们是改善还是损害了体验2

于是有了这一章的总纲,作者把它命名为评估驱动开发(灵感来自软件工程的测试驱动开发):在构建之前,就定义好评估标准3。她的判语是:评估是 AI 应用落地的最大瓶颈,可靠的评估流水线将解锁许多新场景4

标准从哪里列起?书里给了四类,并用同一个例子(总结法律合同)串起来5:

标准类问的是(以合同摘要为例)
领域特定能力模型看得懂法律合同吗
生成能力摘要连贯吗、忠于原文吗
指令遵循能力限了 200 字就真的是 200 字吗
成本和延迟这份摘要花多少钱、等多久

2. 领域能力:先问「它配做这份工吗」

领域能力由两样东西决定:模型配置和训练数据——训练时没见过拉丁语,它就不懂拉丁语6。考法沿用第 04 章:代码类看功能正确性;非代码类则大量依赖选择题(给几个选项让它挑,输出容易验证、容易复现)。

选择题的统治地位有个具体数字:截至 2024 年 4 月,EleutherAI 的评测工具里 75% 的任务是选择题,MMLU、ARC-C 全在此列;其中一套还特意排除开放式任务,就是为了躲开评分的不稳定7

分类考卷的成绩单上除了准确率,原书还点了 F1——把「抓得全不全」与「抓得准不准」合成一个数来打分——口径同源,不另展开8

但选择题有三个坑,选型时必须心里有数9:

  • 有运气分:四选一的瞎猜也有 25% 的运气分——这条线叫随机基线:四选一瞎猜的成绩,低于它直接出局;

  • 敏感得可笑:有研究发现,在问题和选项之间多加一个空格、或添一句「选项为:」,模型就会改答案;

  • 测的不是你关心的事:选择题考「区分好坏」,生成应用要的是「写出好的」——它适合考知识和推理,考不了摘要、翻译、写作。

还有一条容易被忽略的加分项:同样正确的 SQL 查询,一个跑 0.2 秒、一个跑 20 秒,价值完全不同——效率也是领域能力的一部分10

3. 生成能力:流畅与连贯退场,事实一致性登场

早期的文本生成评估看两条:语法自然不自然、结构合不合理。随着 AI 文本和人类文本已经难以区分,这两条的重要性大幅下降(对弱模型和小语种仍有用)11

真正的新主角是事实一致性——回答是否与事实相符。它分两种情境,考法完全不同12:

情境对照什么典型任务
局部一致性给定的上下文(政策文档、原文)摘要、客服、商业分析
全局一致性公开知识通用聊天、事实核查

最难的还不是验,而是确定事实本身:「梅西是不是最好的球员」「早餐是不是最重要的一餐」,取决于你信哪个信源;互联网上还满是「找不到证据就当没有」的诉诸无知式论断13

验证工具箱按成本排14:

  1. AI 裁判直接评:最省事;微调过的裁判预测「人类是否认为某陈述真实」可达 90%–96% 的准确率;

  2. SelfCheckGPT:让模型对同一问题再生成 N 个回答,相互矛盾就说明原始回答可疑——有效但贵,一次核查要跑许多次模型;

  3. SAFE(DeepMind 出品):四步走查——把回答拆成一句句独立陈述 → 改写成自成一体的短句 → 每句生成搜索查询 → 让 AI 比对搜索结果判断是否一致;

  4. 文本蕴含(自然语言推理):判断「前提是否蕴含假设」,输出三分类——蕴含/矛盾/中立。书里的例子:前提「Mary 喜欢所有水果」,则「她喜欢苹果」是蕴含、「她讨厌橙子」是矛盾、「她喜欢鸡肉」是中立。这类专用小评分器可以小到 1.84 亿参数(用 76.4 万条标注对训出)15

这一类也有现成考卷:TruthfulQA,817 道专挑「人类容易因误解答错」的题,人类专家基准 94%16。安全性部分书里按危害类型分了类(不当语言、有害建议、仇恨言论、暴力、刻板印象、政治宗教偏见),并记录了一组有意思的政治倾向数据:GPT-4 偏左翼自由派,而 Llama 偏权威主义17

4. 指令遵循:听得懂要求,也是能力

一个真实的失败样式:让模型给推文分情感,限定只准输出 NEGATIVE、POSITIVE 或 NEUTRAL,模型明明读懂了情感,却输出 HAPPY、ANGRY——有能力,不听话。这算指令遵循不及格,不能全赖模型蠢,也可能真是你指令没写清18

考这类能力的考卷有两张。IFEval(谷歌)收了 25 种能自动验证的指令:含关键词、限长度、数项目符号、JSON 格式……得分就是被正确遵循的指令占比。InFoBench(2024)把范围放宽到内容限制、语言风格这类难以自动验证的指令,做法是把每条指令拆成一串是非题,按满足比例给分;实验还发现 GPT-4 当考官比众包标注员更准19

书里最实用的一句建议是:别只依赖公共考卷,要建自己的考卷——需要模型输出 YAML 就专门考 YAML;受不了「作为一个语言模型」这句口头禅,就专门考它出不现20

5. 成本与延迟:帕累托面前先认输

四类标准的最后一类最不浪漫。多目标怎么取舍?书里的答案:先明确哪些目标不可妥协——这套取舍思路行话叫帕累托优化:若延迟是硬指标,先按延迟线砍掉所有不达标的模型,再在剩下的里面挑最好的,而不是全体一起比总分21

自托管时的一个行业暗号也值得记:GPU 的显存——即显卡上那块专门存放模型的高速存储——通常 16/24/48/80 GB 一档。

而那块存储,硬件行话叫记忆体(memory 的直译)。流行模型恰好多是 70 亿、650 亿参数一档——这不是巧合,是「塞得进一张卡」倒逼出来的规格22

6. 选模型:硬属性先筛,软属性再赛

模型成百上千,怎么筛?第一步看硬属性(你无法或很难改变的:许可协议、训练数据、模型大小、隐私、控制权),不达标直接出局;剩下比软属性(可以改进的:准确性、毒性等)。作者的经验摆得很平:有个应用最初准确率只有 20%,把任务拆成两步后跃升到 70%;也有调了几周毫无起色、最终放弃的——软属性的天花板事前猜不准23

硬属性里最需要逐条读的是许可协议。书里点出的三条要害24:

  • 商业用途?早期 Llama 是非商业许可;Llama 2/3 规定月活跃用户超 7 亿要向 Meta 申请特别许可;

  • 能不能用它的输出去训别的模型(即蒸馏:让学生模型模仿教师模型的输出)?这是数据合成(第 12 章)的法律前提——Mistral 最初禁止、后来放开;Llama 到成书时仍禁止;

  • 连锁审查:模型 X 若是用 ChatGPT 输出训的,即便 X 自己的许可允许,用 X 也可能违反 ChatGPT 的条款——上游违约会顺着链条传给你

自建还是购买:七个维度

第四步才是那个经典问题。书里列了七维,每一维都有真实事故背书25:

维度书里的实锤案例
数据隐私三星员工把机密输进 ChatGPT,公司 2023 年 5 月全面禁用;Zoom 悄改条款用客户数据训模型引发抗议
数据溯源某开源模型记住了训练集的 8%,样本可能被翻出来;商业模型拿不出训练数据清单
性能开源与商业的差距在缩小,但激励结构决定「最强的往往只留在 API 里」
功能性能否接入外部工具、按指定格式作答,各家 API 支持不一
成本API 按量计费 vs 自托管的工程人力;SLA(服务等级承诺)值多少钱
控制权作者顾问的公司 Convai:3D 角色总被商业模型以「我没有物理能力」拒绝,最终被迫微调开源模型;2023 年意大利一度禁用 ChatGPT——供应商说停就停
设备端要在本地跑,第三方 API 直接出局

7. 公开榜单:能筛差,选不了优

公开基准和聚合了它们的榜单(把多个基准得分合成一张排名表的公版考场)有三个结构性问题,书里逐一拆穿26:

问题一:聚合是任意的。 Hugging Face 榜单 2023 年版取 6 个基准的平均分——可把「真实性 80%」和「数学 80%」等权平均,本身就宣告了「这两件事一样重要」,而没人做过这个宣告。

问题二:基准之间高度重叠。 官方分析显示 WinoGrande、MMLU、ARC-C 三者相关性很强(都在考推理)——完全相关的考卷不该同时用,重复计分等于给推理加权;TruthfulQA 与其他只中度相关,说明推理强不代表不胡说27

问题三:考卷泄密。 一位博士生的讽刺论文标题就是答案:「在测试集上做预训练就是你所需要的全部」——只用基准数据训练,百万参数的小模型也能考出近满分;OpenAI 复盘 GPT-3 时发现,13 个常用基准里至少 40% 的数据出现在训练集中。检测手段两条:n-gram 重叠(13 个 token 的序列在两边同时出现即算污染)和困惑度异常低(第 04 章的用途之一)28

结论书里写成了一句话:公共基准能帮你筛掉表现差的模型,但没法帮你找到最适合特定应用的模型——筛完之后,得跑你自己的流水线29

8. 自己的考场:四步搭起来

第一步:评所有组件,不只评整体

复合系统(比如「从简历 PDF 提取文本 → 再提取雇主」)必须两步分别评,否则失败时不知道断在哪节管道30。另一个选择:按「轮次」评(每次输出好不好)还是按「任务」评(20 个问题之内猜没猜到答案)——用户关心的当然是任务,但任务边界常常说不清,轮次好测量31

第二步:写评估指南——最难的一步

LinkedIn 复盘一年的部署经验:遇到的第一个障碍就是制定评估指南。一个「正确」的响应未必是「好」的——「你完全不适合这份工作」正确但没有建设性;好的响应要解释差距、给出路32。写指南时同步定两件事:用哪几条标准(LangChain 用户平均用 2.3 种)、以及标准挂钩业务指标——书里的换算表值得抄走33:

事实一致性 80% → 能自动化 30% 的客服工单
事实一致性 90% → 能自动化 50%
事实一致性 98% → 能自动化 90%
(另外设实用性阈值:低于 50% 一律别上线)

图说:「分数」只有翻译成「多少工单不用人」才有资格进预算会。

第三步:方法与数据,混着来

省钱配方是混合方法(便宜的跑全量、贵的跑抽查):便宜的全自动指标跑全量,贵的(AI 裁判、人工)只抽查;有模型自报的把握值(见第 03 章)就顺手当置信度用——三个类别概率都在 30%–40% 之间说明模型自己也没底,单类 95% 才是笃定。人工评估当北极星指标(指导方向的那颗最可靠的星):LinkedIn 每天人工评 500 条对话,专抓自动化指标漏掉的漂移34

评估数据要切子集分别看,防一种反直觉的坑,名叫辛普森悖论:A 在每个子集里都赢 B,合在一起反而输,不分拆根本看不见35样本量(评估集要多少条才够)有一把顺口的尺:先拿 100 条跑多次自助抽样:有放回地反复抽 100 条重新算分,几次结果差得远就说明样本不够;OpenAI 的经验法则是要检测的分差每缩小到三分之一,样本量翻 10 倍;业界评估集中位数在 1000 条左右36

第四步:考场本身也要被考

评估流水线自己要回答四问:信号对不对(量的真是你在乎的东西)?可靠吗(跑两遍结果一样吗——AI 裁判记得把温度锁 0)?各指标相关吗(相关的留一把就够)?成本延迟撑得住吗?再配上实验追踪:评估数据、评分规则、裁判提示词、采样配置,凡改过必留痕37

判断(我们的,不是书里的): 这一章真正的护城河不是任何单个指标,而是「评估先于功能」这个顺序本身——顺序对了,指标可以慢慢换;顺序反了(先上线再补考),补的往往是官司。 如果错,会错在: 如果某类应用(如创意玩具)的用户容忍度足够高、失败成本趋零,评估的优先级确实可以让位于速度——本章纪律适用于「错了要赔」的场景。

9. 边界与局限

  • 书中许可、榜单、基准的具体数据都是 2024 年中的快照;Llama 的蒸馏条款、HF 榜单的基准组合后来仍在变动,引用前核对当下。
  • 「评估驱动开发」是方法论主张,不是受控实验结论;它的对照证据(部署了却不知好坏的案例)都是轶事级的。
  • 事实一致性一节的工具(SelfCheckGPT、SAFE 等)更新极快,第 05 章对裁判的提醒在这里同样适用。

10. 可带走的

  1. 部署了却不知道有没有用,比不部署更糟——评估标准要在动手前定;

  2. 四类标准:领域能力、生成质量、指令遵循、成本延迟;写标准时先想清楚哪些不可妥协(帕累托);

  3. 选择题考卷的三个坑:25% 运气分、加个空格就改答案、考区分不考生成;

  4. 事实一致性分局部(对上下文)与全局(对公开知识);工具箱从 AI 裁判到 SAFE 四步再到小蕴含模型,按钱排;

  5. 指令遵循单独考:IFEval 考可自动验证的 25 种,自己的 YAML 自己出题;

  6. 选模型先硬属性出局制,再软属性循环赛;许可协议重点读三问:商用?能蒸馏?上游干净吗;

  7. 公开榜单:能筛差、选不了优——重叠考卷重复计分、40% 考卷进过训练餐;

  8. 自己的考场四步:评组件、写指南(挂钩业务指标)、混合方法(北极星人工评 500 条/天)、考场也要被考;样本量法则:分差缩到 1/3,样本 ×10。

11. 原文地图

主题原书章原文位置
部署却不知好坏更糟第4章text/11-ch04.txt:47(搜「维护成本」)
二手车与客服机器人案例第4章text/11-ch04.txt:50(搜「二手车」)
评估驱动开发第4章text/11-ch04.txt:53(搜「评估驱动开发」)
评估是最大瓶颈第4章text/11-ch04.txt:82(搜「最大瓶颈」)
四类标准与合同例子第4章text/11-ch04.txt:85(搜「领域特定能力」) · text/11-ch04.txt:88(搜「总结一份法律合同」)
领域能力受限于数据第4章text/11-ch04.txt:102(搜「从未接触过拉丁语」)
选择题占比 75%、随机基线第4章text/11-ch04.txt:120(搜「75%」) · text/11-ch04.txt:150(搜「随机基准测试的准确率就是25%」)
加空格改答案第4章text/11-ch04.txt:153(搜「额外添加一个空格」)
选择题测区分不测生成第4章text/11-ch04.txt:156(搜「区分好坏响应的能力」)
效率也是领域能力第4章text/11-ch04.txt:108(搜「运行时间过长」)
流畅连贯退场第4章text/11-ch04.txt:178(搜「难以区分」)
局部/全局事实一致性第4章text/11-ch04.txt:200(搜「局部事实一致性」) · text/11-ch04.txt:209(搜「全局事实一致性」)
确定事实最难、诉诸无知第4章text/11-ch04.txt:218(搜「诉诸无知」)
GPT-judge 90–96%第4章text/11-ch04.txt:236(搜「90%~96%」)
SelfCheckGPT第4章text/11-ch04.txt:274(搜「SelfCheckGPT的核心假设」)
SAFE 四步第4章text/11-ch04.txt:280(搜「SAFE」)
文本蕴含与 Mary 例子第4章text/11-ch04.txt:306(搜「textualentailment」) · text/11-ch04.txt:319(搜「Marylikesallfruits」)
蕴含小模型 76.4 万对第4章text/11-ch04.txt:331(搜「764,000」)
TruthfulQA 817 题、人类 94%第4章text/11-ch04.txt:334(搜「817个问题」) · text/11-ch04.txt:343(搜「94%」)
政治偏见:GPT-4 与 Llama第4章text/11-ch04.txt:376(搜「左翼和自由主义」)
HAPPY/NEGATIVE 例子第4章text/11-ch04.txt:429(搜「HAPPY」)
IFEval 25 种指令第4章text/11-ch04.txt:457(搜「25种」)
InFoBench 是非题第4章text/11-ch04.txt:466(搜「InFoBench」) · text/11-ch04.txt:484(搜「MechanicalTurk」)
建自己的考卷第4章text/11-ch04.txt:496(搜「创建自己的基准测试」)
帕累托与不可妥协项第4章text/11-ch04.txt:563(搜「帕累托优化」)
GPU 档位与模型参数非巧合第4章text/11-ch04.txt:578(搜「16 GB」)
硬/软属性、20%→70%第4章text/11-ch04.txt:636(搜「硬属性」) · text/11-ch04.txt:642(搜「跃升至70%」)
许可三问(7 亿/蒸馏/连锁)第4章text/11-ch04.txt:726(搜「7亿」) · text/11-ch04.txt:729(搜「违反了ChatGPT」) · text/11-ch04.txt:734(搜「模型蒸馏」)
七维对比总览第4章text/11-ch04.txt:773(搜「7个维度」)
三星与 Zoom 事故第4章text/11-ch04.txt:787(搜「三星」) · text/11-ch04.txt:794(搜「Zoom」)
StarCoder 记住 8%第4章text/11-ch04.txt:797(搜「8%」)
USPTO 与知识产权第4章text/11-ch04.txt:806(搜「USPTO」)
Convai 与意大利禁令第4章text/11-ch04.txt:908(搜「Convai」) · text/11-ch04.txt:914(搜「意大利」)
商业模型版本不透明第4章text/11-ch04.txt:911(搜「冻结」)
HELM Lite 排除、HF 放弃 HumanEval第4章text/11-ch04.txt:961(搜「HELM Lite」)
基准相关性 WinoGrande第4章text/11-ch04.txt:1023(搜「完全相关」) · text/11-ch04.txt:1055(搜「WinoGrande」) · text/11-ch04.txt:1058(搜「仅为中等」)
2024 年 6 月榜单换血第4章text/11-ch04.txt:1026(搜「MATH lvl 5」)
HELM 跑榜成本第4章text/11-ch04.txt:1105(搜「38,000美元」)
「OpenAI 变差了吗」第4章text/11-ch04.txt:1079(搜「OpenAI的模型变差了吗」)
讽刺论文与污染检测第4章text/11-ch04.txt:1127(搜「Schaeffer」) · text/11-ch04.txt:1154(搜「13个token」)
GPT-3:40% 考卷进训练集第4章text/11-ch04.txt:1177(搜「40%」)
公共基准只筛差第4章text/11-ch04.txt:1189(搜「筛掉表现差的模型」)
评组件:简历两步第4章text/11-ch04.txt:1214(搜「简历」)
轮次 vs 任务、20 个问题第4章text/11-ch04.txt:1232(搜「20个轮次」) · text/11-ch04.txt:1238(搜「20个问题」)
LinkedIn 第一个障碍第4章text/11-ch04.txt:1288(搜「第一个障碍」)
2.3 种标准第4章text/11-ch04.txt:1291(搜「2.3种」)
一致性换算工单第4章text/11-ch04.txt:1327(搜「50%的客户支持请求」) · text/11-ch04.txt:1336(搜「实用性阈值」)
对数概率当置信度第4章text/11-ch04.txt:1362(搜「30%和40%之间」)
北极星、500 条/天第4章text/11-ch04.txt:1365(搜「北极星指标」)
辛普森悖论第4章text/11-ch04.txt:1389(搜「辛普森悖论」)
自助抽样第4章text/11-ch04.txt:1412(搜「自助抽样」)
分差三分之一、样本十倍第4章text/11-ch04.txt:1435(搜「10倍」)
评估流水线自评四问第4章text/11-ch04.txt:1450(搜「评估你的评估流水线」)

Footnotes

  1. 出处:「第4章」第 47 段(text/11-ch04.txt:47,搜「维护成本」)。

  2. 出处:「第4章」第 50 段(text/11-ch04.txt:50,搜「二手车」)。

  3. 出处:「第4章」第 53 段(text/11-ch04.txt:53,搜「评估驱动开发」)。

  4. 出处:「第4章」第 82 段(text/11-ch04.txt:82,搜「最大瓶颈」)。

  5. 出处:「第4章」第 85 段(text/11-ch04.txt:85,搜「领域特定能力」)与第 88 段(text/11-ch04.txt:88,搜「总结一份法律合同」)。

  6. 出处:「第4章」第 102 段(text/11-ch04.txt:102,搜「从未接触过拉丁语」)。

  7. 出处:「第4章」第 120 段(text/11-ch04.txt:120,搜「75%」)。

  8. 出处:「第4章」第 147 段(text/11-ch04.txt:147,搜「F1分数」)。

  9. 出处:「第4章」第 150 段(text/11-ch04.txt:150,搜「随机基准测试的准确率就是25%」)、第 153 段(text/11-ch04.txt:153,搜「额外添加一个空格」)与第 156 段(text/11-ch04.txt:156,搜「区分好坏响应的能力」)。

  10. 出处:「第4章」第 108 段(text/11-ch04.txt:108,搜「运行时间过长」)。

  11. 出处:「第4章」第 178–179 段(text/11-ch04.txt:178,搜「难以区分」)。

  12. 出处:「第4章」第 200 段(text/11-ch04.txt:200,搜「局部事实一致性」)与第 209 段(text/11-ch04.txt:209,搜「全局事实一致性」)。

  13. 出处:「第4章」第 218 段(text/11-ch04.txt:218,搜「诉诸无知」)。

  14. 出处:「第4章」第 236 段(text/11-ch04.txt:236,搜「90%~96%」)、第 274 段(text/11-ch04.txt:274,搜「SelfCheckGPT的核心假设」)与第 280 段(text/11-ch04.txt:280,搜「SAFE」)。

  15. 出处:「第4章」第 306 段(text/11-ch04.txt:306,搜「textualentailment」)、第 319 段(text/11-ch04.txt:319,搜「Marylikesallfruits」)与第 331 段(text/11-ch04.txt:331,搜「764,000」)。

  16. 出处:「第4章」第 334 段(text/11-ch04.txt:334,搜「817个问题」)与第 343 段(text/11-ch04.txt:343,搜「94%」)。

  17. 出处:「第4章」第 361 段(text/11-ch04.txt:361,搜「不当语言」)与第 376 段(text/11-ch04.txt:376,搜「左翼和自由主义」)。

  18. 出处:「第4章」第 429 段(text/11-ch04.txt:429,搜「HAPPY」)。

  19. 出处:「第4章」第 457 段(text/11-ch04.txt:457,搜「25种」)、第 466 段(text/11-ch04.txt:466,搜「InFoBench」)与第 484 段(text/11-ch04.txt:484,搜「MechanicalTurk」)。

  20. 出处:「第4章」第 496 段(text/11-ch04.txt:496,搜「创建自己的基准测试」)。

  21. 出处:「第4章」第 563 段(text/11-ch04.txt:563,搜「帕累托优化」)。

  22. 出处:「第4章」第 578 段(text/11-ch04.txt:578,搜「16 GB」)。

  23. 出处:「第4章」第 636 段(text/11-ch04.txt:636,搜「硬属性」)与第 642 段(text/11-ch04.txt:642,搜「跃升至70%」)。

  24. 出处:「第4章」第 726 段(text/11-ch04.txt:726,搜「7亿」)、第 729 段(text/11-ch04.txt:729,搜「违反了ChatGPT」)与第 734 段(text/11-ch04.txt:734,搜「模型蒸馏」)。

  25. 出处:「第4章」第 773 段(text/11-ch04.txt:773,搜「7个维度」)、第 787 段(text/11-ch04.txt:787,搜「三星」)、第 794 段(text/11-ch04.txt:794,搜「Zoom」)、第 908 段(text/11-ch04.txt:908,搜「Convai」)与第 914 段(text/11-ch04.txt:914,搜「意大利」)。

  26. 出处:「第4章」第 30 段(text/11-ch04.txt:30,搜「排行榜」;若定位失败搜「聚合」)。

  27. 出处:「第4章」第 1023 段(text/11-ch04.txt:1023,搜「完全相关」)、第 1055 段(text/11-ch04.txt:1055,搜「WinoGrande」)与第 1058 段(text/11-ch04.txt:1058,搜「仅为中等」)。

  28. 出处:「第4章」第 1127 段(text/11-ch04.txt:1127,搜「Schaeffer」)、第 1154 段(text/11-ch04.txt:1154,搜「13个token」)与第 1177 段(text/11-ch04.txt:1177,搜「40%」)。

  29. 出处:「第4章」第 1189 段(text/11-ch04.txt:1189,搜「筛掉表现差的模型」)。

  30. 出处:「第4章」第 1214 段(text/11-ch04.txt:1214,搜「简历」)。

  31. 出处:「第4章」第 1226 段(text/11-ch04.txt:1226,搜「按轮次和任务」)、第 1232 段(text/11-ch04.txt:1232,搜「20个轮次」)与第 1238 段(text/11-ch04.txt:1238,搜「20个问题」)。

  32. 出处:「第4章」第 1288 段(text/11-ch04.txt:1288,搜「第一个障碍」)。

  33. 出处:「第4章」第 1291 段(text/11-ch04.txt:1291,搜「2.3种」)、第 1327 段(text/11-ch04.txt:1327,搜「50%的客户支持请求」)与第 1336 段(text/11-ch04.txt:1336,搜「实用性阈值」)。

  34. 出处:「第4章」第 1359 段(text/11-ch04.txt:1359,搜「混合使用多种评估方法」)、第 1362 段(text/11-ch04.txt:1362,搜「30%和40%之间」)与第 1365 段(text/11-ch04.txt:1365,搜「北极星指标」)。

  35. 出处:「第4章」第 1389 段(text/11-ch04.txt:1389,搜「辛普森悖论」)。

  36. 出处:「第4章」第 1412 段(text/11-ch04.txt:1412,搜「自助抽样」)与第 1435 段(text/11-ch04.txt:1435,搜「10倍」)。评估集中位数见第 1441 段附近。

  37. 出处:「第4章」第 1450 段(text/11-ch04.txt:1450,搜「评估你的评估流水线」)与第 1491 段(text/11-ch04.txt:1491,搜「实验追踪」)。