跳到主要内容

怎么知道它是对的 — 把「有没有依据」量成一个数,以及 agent 要测三层

这一章讲三件事: 怎么把「这条回答有没有依据」从一句感觉,变成一个能天天跟踪的数; 为什么让模型当评审是必须的、而它自己也会出错; 以及测一个 agent 为什么不能只看它最后答得对不对。

它在全书链条里的位置: 前十六章都在从这一章起进入第三层:怎么知道它一直是对的。 第 18 章讲怎么让它跑得又快又便宜,第 19 章讲上线之后怎么盯着。

1. 顶层全景:闪购那天积下来的 500 条真实问答

这一章的主走查是一批真实数据,从「怎么定标准答案」一直走到「agent 在第几步跑偏的」:

① 先把基准事实钉死:某个产品是 30 天退货
→ **这句话必须白纸黑字写在基准里,不许靠从别的政策推**

② 造两套题:
**通用集**——分布要和生产一致(真实提问里 40% 问库存,测试集就 40% 问库存)
**对抗集**——团队一起找专门容易把它逼出幻觉的刁钻问题

③ 把每条回答里可核实的主张一条条抽出来,对着基准逐条核

④ 报第一个数:**没有依据的回答占多少** → 通用集 8%,对抗集 25%

⑤ 再按话题拆开报:产品信息 3%、配送政策 15%
→ **先改哪里,一目了然**

⑥ 把「续航 6 小时、保修一年、特价 79.99 美元」这一条回答拆成三条原子事实
→ 实际续航是 8 小时,错 1 条 → **得分 0.67**

⑦ 换成只看用词重叠的那把尺子,看它为什么两头都错

⑧ 换成让模型当评审——**而评审自己也会幻觉**

⑨ 最后测 agent:退款流程期望走
`["intent_classifier","refund_agent","gather_info","compile_followup"]`,
**实际在第 2 步就跑偏了**

图说:①→⑤ 是「怎么量」,⑥→⑧ 是「用哪把尺子量」,⑨ 是「agent 特有的那一层」。
**8%/25%、3%/15%、0.67、那条轨迹都是书里的原数。**

2. 先看现象:每加一层能力,就多一种出错的方式

这一节讲这一章被什么逼出来,书的开场写得很坦白。

每一层都加了能力。每一层也都加了出错的方式。1

书随即把这句话摊开: 提示词可以写得烂;要求它输出固定格式,可以解析失败; 检索可以取回不相关的文档;agent 可以调错工具,或者陷进死循环出不来。

但最阴险的那种失败横跨所有这些:幻觉。 和崩溃或者报错不同,幻觉不会宣告自己的存在。 它溜过用户,在任何人注意到之前就已经损害了信任。

这一句和第 02 章那条主线接上了: 幻觉不会自己举手, 所以「有没有出问题」只能靠主动去量——量不出来,你就只能等用户来告诉你。

书还给了一个很有画面感的场景,它同时是第 18 章的起点:

测试的时候一切完美

闪购开始,流量涨十倍

**每一个问题**——包括「你们几点关门?」「提供礼品包装吗?」——**都被送去最贵的模型**

同样的问题每次都从头重答一遍(**没有缓存,因为你根本没做**)

压力之下 agent 开始抄近路:**它编产品规格,而不是等慢吞吞的数据库查询;
它编配送时间,而不是去调物流接口**

等你发现,几百个顾客已经拿到了错的信息

图说:**这一段里有两件事被拧在一起了。**「都送最贵的模型、没有缓存」是**性能问题**,
**第 18 章治;**「压力下开始编」是**正确性问题,这一章治。**

3. 第一步:把基准事实钉死

这一节讲主走查第 ① 步,而它是全章最容易被跳过、跳过之后一切都白干的一步。

先看现象:没有标准答案,你连「错了」都判不了

要判断一条回答有没有依据,你得先有一份「什么才算真的」。 书把这份东西叫做基准数据——产品目录(规格、价格、库存)、配送政策、退货政策、客服知识库2

它有两条互相拉扯的要求

要求一:**够全** —— 覆盖系统可能谈到的所有话题
(漏掉一个话题,那个话题上的回答你根本没法判)

要求二:**够具体** —— 具体到能做精确的事实核对

图说:这两条不是同一件事。**「全」是横向的,「具体」是纵向的。**

书给了一个非常具体的判据,值得原样记住:

如果某个产品是 30 天退货,这个事实必须明确写在基准数据里, 不能靠从别的政策推断出来。3

为什么这一条这么要紧: 因为「靠推断」会把评测本身变成一件主观的事。 你说这条回答错了,别人说「可以从那条政策推出来啊」——争起来就没完。 基准数据必须是可以一条条指着说「这里写着」的东西。

4. 第二步:造两套题,而不是一套

这一节讲主走查第 ②④⑤ 步,书这里给的数最有用。

通用集:分布要和生产一致

一套好的通用测试集应该有 100 到 500 个问题, 而且它的分布要和你在生产里看到的提问分布一致。 如果你真实提问里有 40% 是问库存的,你的测试集就该反映这个比例。4

「分布一致」这一条常被忽略,但它决定了你的数字有没有意义: 如果你的测试集里 80% 是产品问题、生产里 80% 是配送问题, 那你测出来的那个数和用户实际体验到的完全是两回事。

对抗集:专门找容易把它逼出幻觉的题

书列了四类值得放进对抗集的题5:

这一类为什么它容易触发幻觉
复杂的产品比较知识有空白时,模型会编一个功能出来把空白填上
停产的产品、限时的优惠这类边缘情况在资料里往往写得含糊或者过期
有多种合理解读的问题它会挑一种解读往下答,而且不告诉你它挑了哪一种
把好几个话题混在一起的请求它容易在拼接的时候把两个话题的事实串了线

第三步:抽论断,逐条核

做法:自动把回答里每一条可核实的事实主张抽出来 (「这个产品有两年保修」「配送要 3 到 5 个工作日」),对着基准数据一条条验。

书对两套测试集给了不同的处理6:

通用集对抗集
怎么核用程序核:语义相似、精确字符串匹配、按规则从结构化数据里抽往往需要人工复核
为什么常见问题的答案形状规整,程序判得动边缘情况里那些细微的解读,自动的方法常常漏掉
人做什么——领域专家把可疑回答分成三档:准确 / 部分准确 / 幻觉

第四步:报数,而且必须分开报

第一个数:没有依据的回答占多少。 书给它起的名字是「基准缺陷率」——算法就是「无据回答数 ÷ 总回答数」。

书给的那对数是这一节的全部价值所在7:

通用集: 8% ← 常见问题上,一百条里八条没依据
对抗集: 25% ← 刁钻问题上,一百条里二十五条没依据

图说:**这两个数互为参照,而且差距本身就是信息。**
8% 说明日常还行;**25% 说明系统在边缘情况上明显更吃力。**
**只报一个混在一起的平均数,这条信息就没了。**

第二个数:错得有多严重。 书让人给每条幻觉打 1 到 5 分,并给了两端的例子8:

例子
1 分(轻)政策写的是 2 到 4 个工作日,它说 2 到 3 天
5 分(严重)声称产品有一个它根本没有的功能

这两个例子之所以要给,是因为「幻觉」这个标签本身不分轻重—— 而说错半天和凭空造一个功能,后果完全不是一回事。

第三件事:按话题拆开报(走查第 ⑤ 步):

「产品信息可能很好(3%),配送政策却很糟(15%)。」 这个颗粒度直接决定你先改哪里。

判断(我们的,不是书里的): 这一节真正教的不是三个指标, 是「一个总平均数几乎没有行动价值」这件事。 通用 vs 对抗、话题 A vs 话题 B——每一次拆分,你都从同一批数据里多榨出一条「该去改哪儿」。 合并起来报的那个数,唯一的用处是向上汇报。 如果错,会错在: 如果你的系统只服务一个很窄的场景(只答退货政策), 那话题维度上没什么可拆的,拆分的收益就小。 判据是:拆完之后各组的数差得大不大——差不到三五个百分点,这个维度就不值得拆。

5. 一条回答不是只有一个对错:拆成原子事实

这一节讲主走查第 ⑥ 步,它补的是上一节那个指标的短板。

先看现象:上一个指标把整条回答当一个单位

书说得很清楚:那个缺陷率把每条回答当成一个整体——要么有据,要么没据。 但一条回答里常常包含好几条主张。9

做法:拆开逐条判

一条回答:
「你问的那款无线耳机**续航 6 小时**、**带一年保修**,
现在**特价 79.99 美元**。」

拆成三条可以分别核对的主张(书管这种最小的一条叫**原子事实**):
① 续航 6 小时
② 保修一年
③ 特价 79.99 美元

对着基准数据核:
① **错**(实际是 8 小时)
② 对
③ 对

得分:2 ÷ 3 = **0.67**

图说:**0.67 比「这条回答有幻觉」这个标签信息量大得多。**
它告诉你:这条回答**大体可用,但有一个具体的数字错了**——
**而整条打个「幻觉」标签,你会以为它整个不能用。**
(这条回答和三条事实都是书里的原样;这套做法书叫它 FActScore,
由华盛顿大学的研究者提出。)

代价书也说了:抽取和核实每一条事实,都要调一次模型10所以它比上一节那个指标贵得多,通常只用在抽样复核上,不是每条都跑。

6. 一把从别处搬来的尺子,以及它为什么不该用在这里

这一节讲主走查第 ⑦ 步。

它本来是给什么打分的

有一把常被搬来当幻觉检测用的尺子,叫 ROUGE。 它本来的用途是给机器翻译和自动摘要打分,量的是「生成的文字和参考答案的用词重叠了多少」。

三个变体量的东西不一样11:

变体它量什么
单词版单个词的重叠
相邻词对版相邻两个词组成的对子的重叠
最长公共子序列版两段文字里最长的那段按顺序对得上的内容

注意这三个量的都是同一件事:抄没抄到参考答案的用词。

为什么它当不了幻觉检测

书自己给了两个盲区12:

分高不保证准确——生成的文字可能用了同样的词,但语境完全不同。 分低也不一定是幻觉——一条完全准确的回答,可能只是把参考答案换了个说法。

这一对盲区你在第 09 章已经见过一次了(那里是「看回答里有没有原文没有的词」 这个朴素做法的同一对毛病)。同一对,不再重讲。

书自己给的结论:我们需要的是一个理解意义和语境的评审者,而不是表面的词匹配。

这句话直接把下一节引出来了。

7. 让模型当评审 —— 以及评审自己也会幻觉

这一节是这一章最该带走的一处,因为它给了一个已知方法的已知缺陷。

做法:把参考答案和生成的回答一起交给另一个模型

第 09 章已经用过这一招了(那里让模型给检索质量打分)。 这里是它更完整的形态:让它判断有没有幻觉,并且说出理由。

书用了一个很关键的做法:把评审的输出钉成固定的几个字段13:

评审必须返回:
has_hallucination: true / false ← **一个是非题,不是一段话**
severity: 1 到 5 ← 严重度
explanation: 一段解释 ← 给人看的
hallucinated_claims: [ 具体是哪几条主张 ]

图说:**第一个字段是这套东西能不能用的关键。**
如果评审返回的是一段自由文本(「这条回答基本准确,不过续航那里可能有点问题」),
**你连「这周的幻觉率比上周高了多少」都算不出来。**

书在讲监控框架时把这一点写得更明确:有一个专门的部件, 它的职责就是定义允许的输出标签(比如「有幻觉」/「无幻觉」), 让评审的裁决永远落在一组固定的类别上,而不是自由文本14

这条口径请记牢:能统计的前提是判决被约束成有限的几个标签。 生产上就是靠这一条,把评审挂成一根管子:按固定周期对真实输出抽样跑一遍, 长期跟踪那个比率,超过阈值就告警。 第 19 章那套监控在生产里就是这么跑的。

那个已知的缺陷

书专门开了一小节:评审模型自己也会幻觉。 当评审把一条真实的回答错标成幻觉、或者反过来,整个评估流程就失效了。15

书还给了它的三种系统性偏好。 注意这三条是偏差,不是随机噪声 (随机噪声是每次往不同方向偏一点、多测几次就互相抵消掉; 偏差是每次都往同一个方向偏,测多少次都抵消不掉)——所以它们更麻烦:

评审的偏好意味着什么
偏爱更长的回答你把提示词改得更啰嗦,分就会涨——而质量没变
偏爱和自己风格相近的回答换一个厂商的模型来生成,分可能凭空掉
有时察觉不到细微的事实错误恰恰是最该抓的那一类,它最容易放过

三条缓解,各针对上面一条:

① **用多个评审模型投票,取多数**
→ 治「单个模型的偏差」(风格偏好在不同厂商之间不一致,投票能抵消掉一部分)

② **随机抽一部分判决,人工校准**
→ 治「你根本不知道评审偏到哪去了」——**不抽样,你连偏差存不存在都不知道**

③ **把自动评审,和「对着结构化数据库做检索式事实核对」结合起来**
→ 治「细微事实错误察觉不到」——**数字对不对不该靠语言模型判断,该去查表**

图说:**第 ③ 条最实用。** 凡是能查表核实的东西(价格、天数、库存),
就别交给评审去判——**把评审留给那些查不了表的判断。**

8. 指标之外:一支专门想让它失败的队伍

这一节讲一件指标做不到的事。

做法:组一支队伍,任务就是想方设法让你的系统出丑。这叫红队。

书给的针对性例子很具体16:红队会试着 骗它给出错误的退款政策 / 让它编造不存在的产品 / 让它承诺做不到的配送时间 / 让它泄露内部业务信息。

书说得很到位:目的不是为了破坏而破坏,是在你的顾客发现之前先发现漏洞。

它和指标的分工:

指标红队
抓什么系统性问题——大批量数据里显出来的规律只有有创造力、有动机的人才找得到的意外失效
怎么跑定期自动跑一轮一轮地来:对抗测试 → 分析弱点的根因 → 改进 → 再来一轮

书还提了一个新趋势:用模型自己去生成对抗样例和压力测试。 但它紧接着加了限制:这些自动手段必须配上人工监督和验证17

9. 测 agent 不一样:要测三层

这一节讲主走查第 ⑨ 步,是这一章的另一半。

先看现象:答案对了,不等于它做对了

书的原话:agent 不只是生成文本。它判意图、选工具、执行动作、把多步串起来。 agent 的成败不只看输出对不对,还要看决策过程和执行路径。18

而这句话是这一节的核心:

一个正确的最终答案,可能掩盖了有缺陷的中间推理; 而正确的推理,如果有一次工具调用失败,照样会产出错的输出。

两个方向的错配,所以只看最终答案一定不够。

三层,逐层往里

测什么怎么测
① 端到端这件事到底办成没有建一个数据集,每条含用户的话和期望的回答,用模型当评审判对错(是 / 否)
② 工具调用它有没有调对工具把每次工具调用记下来,和期望的工具集合比:两个集合相等才算过
③ 执行轨迹它走过的步骤序列对不对、顺序对不对把实际走过的步骤记成一条序列,和期望序列逐项比

第 ② 层书给的例子: 用户说「我要给某件商品退款」,期望用到的工具是 ["process_refund"]; 判据就是「实际用到的工具集合 == 期望的工具集合」19

第 ③ 层书给了两条完整的期望轨迹(期望轨迹就是你事先写下的「这件事正确应该怎么走」的那一串步骤名)20:

退款流程,期望走:
["intent_classifier", "refund_agent", "gather_info", "compile_followup"]

问折扣,期望走:
["intent_classifier", "product_inquiry_agent", "lookup_discounts", "compile_followup"]

─────────── 走查第 ⑨ 步:实际跑一遍 ───────────

实际: ["intent_classifier", "product_inquiry_agent", "gather_info", "compile_followup"]

└── **第 2 步就跑偏了:它把退款请求判成了商品咨询**

结果: 后面两步虽然和期望一样,但它们是在错误的分支上跑的
→ 最终回答可能还是「看起来合理的」,**而整件事根本没被当成退款处理**

图说:**只看最终答案,这个错很可能被漏掉。**
只有把轨迹逐项比对,才能指出「它是在第 2 步偏的」。
**两条期望轨迹是书里的原样;上面那条「实际轨迹」是我们为演示编的**——
书只给了「实际 == 期望」的对比代码,没有给一个跑偏的例子。

书自己对这一层的评价:通过比较 agent 实际走的步骤和期望的序列, 你能精确定位它的推理在哪一步偏离了预定路径。21

这一层和第 16 章那五类测试是同一个思路的两种形态: 那里测的是「接缝上信息有没有丢」,这里测的是「接缝之间的走法对不对」。

10. 作者的判断与证据

书里给了证据的:

说法证据是什么
通用集 8% / 对抗集 25%一对自带参照的数,而且书明确说了怎么解读这个差距
产品信息 3% / 配送政策 15%同上,按话题拆的一对
三条原子事实、得分 0.67一个完整的算例,可以自己验算
严重度 1 分和 5 分的两个例子两个具体的场景,把「严重」这个词落到了地上
词重叠指标的两个盲区一对完整的因果说明(同词不同语境 / 换了说法)
评审模型的三种系统性偏好书说「研究显示」,但没有点名是哪些研究,我们没能核到一手来源
三层评测和两条期望轨迹给了可以直接跑的判据和具体的序列

作者的推测或没给证据的:

说法它是什么
通用集「100 到 500 个问题」一个经验区间,书没说为什么是这个量级
对抗集的四类一张经验清单,没有数据支撑「这四类最容易触发」
三条缓解评审偏差的办法三条合理的做法,但书没有给任何一条的效果数据
「用模型生成对抗样例」这个新趋势一句观察,书自己也加了限制条件

11. 边界与局限

  • 没有讲这套评测该多久跑一次、跑多少条。 「按固定周期抽样」——周期多长?抽多少? 书一个数都没给。 这直接决定了成本;

  • 原子事实那一套的成本没有量化。 书说「需要调模型来抽取和核实每一条」, 但一条回答平均要调几次、贵多少,没有数。 而这决定了它能不能全量跑;

  • 评审的三条缓解里,第一条自带一个没讲的问题: 多个评审投票, 那如果它们的偏好是一致的呢?(比如都偏爱长回答)——投票就抵消不掉, 书没有讨论这种情况;

  • 红队只讲了做什么,没讲怎么组织。 谁来当红队(自己人还是外部)、 多久做一次、发现的问题怎么进回归测试——书全没讲;

  • agent 那三层没有讲期望轨迹从哪来。 一条流程的「正确步骤序列」是人手写的? 那流程一改,所有期望轨迹都要重写吗? 这是这套做法最大的维护成本,书没碰;

  • 工具集合用「相等」来判太严了。 书的判据是两个集合完全相等, 可 agent 多调了一次无害的查询工具,就算失败——这在实践里会产生大量误报,书没有讨论。

12. 可带走的

全章那条走查,一行写完: 闪购那天的 500 条真实问答 → 先把「这个产品 30 天退货」这类基准事实白纸黑字钉死 → 造两套题(通用集分布和生产一致、对抗集专挑刁钻)→ 把每条回答里可核实的主张抽出来逐条核 → 无据比例:通用 8%、对抗 25%按话题再拆:产品信息 3%、配送政策 15% → 把「续航 6 小时、保修一年、特价 79.99」拆成三条原子事实,错 1 条 → 0.67 → 换成只看用词重叠的尺子,两头都会错 → 换成模型评审,而评审自己也会幻觉 → 最后比对 agent 的执行轨迹,发现它在第 2 步就跑偏了。

  1. 幻觉不会宣告自己的存在——所以「有没有出问题」只能主动去量;
  2. 四步缺一不可: 钉基准 → 造两套题 → 逐条抽论断去核 → 报数;
  3. 基准事实必须白纸黑字写着,不许靠推断——否则「错没错」会变成一场争论;
  4. 通用集的分布必须和生产一致:真实提问 40% 问库存,测试集就该 40% 问库存;
  5. 对抗集专挑四类: 复杂比较、停产与限时、有多种解读的、多话题混在一起的;
  6. 通用集能用程序核,对抗集往往要人工复核——细微的解读自动方法会漏;
  7. 报数必须分开报:通用 vs 对抗、话题 A vs 话题 B。差距本身才是「该改哪儿」的信息;
  8. 一个总平均数几乎没有行动价值,它唯一的用处是向上汇报;
  9. 严重度要分档: 说错半天(1 分)和凭空造一个功能(5 分)不是一回事;
  10. 一条回答常有多条主张,拆成原子事实逐条判——错 1 条得 0.67, 比整条打个「幻觉」标签信息量大得多;代价是每条都要调模型;
  11. 只看用词重叠的尺子两头都错: 用同样的词但语境不同会被放过, 换个说法的正确回答会被冤枉(和第 09 章那对盲区是同一对);
  12. 让模型当评审是必须的,但它的判决必须被约束成一组固定标签 ——否则你连「这周比上周高多少」都算不出来;
  13. 评审自己也会幻觉,而且有三种系统性偏好: 偏爱长的、偏爱和自己风格像的、 察觉不到细微的事实错误;
  14. 三条缓解:多评审投票、抽样人工校准、能查表的一律去查表别让评审判;
  15. 红队和指标分工不同: 指标抓系统性问题,红队挖只有人才找得到的意外失效;
  16. 测 agent 要三层: 任务成没成、工具调对没有、走过的步骤序列对不对;
  17. 最该记住的一句:正确的答案可能掩盖有缺陷的中间推理, 正确的推理也可能被一次工具失败毁掉。

13. 原文地图

主题原书章原文位置
「每一层都加了出错的方式」与幻觉不宣告自己Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:17(搜「Each layer also added ways」)
闪购那个场景Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:32(搜「flash sale hits」)
基准数据与「必须明确写着,不能推断」Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:95(搜「100-500 questions」)
通用集 100–500、分布 40%Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:96(搜「40 percent of your real queries」)
基准缺陷率与 8% / 25%Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:122(搜「Grounding Defect Rate」)
严重度 1 分与 5 分的例子Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:127(搜「Hallucination Severity Score」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:130(搜「2-4 business days」)
拆成原子事实与 0.67Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:138(搜「single unit」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:148(搜「battery life of 6 hours」)
原子事实的代价Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:180(搜「requires LLM calls to extract」)
词重叠指标的两个盲区Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:212(搜「High ROUGE scores」)
评审自己也会幻觉与三条缓解Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:253(搜「JUDGE HALLUCINATION PROBLEM」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:260(搜「majority votes」)
红队Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:273(搜「trick it into providing incorrect refund」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:299(搜「Emerging trends in red teaming」)
生产环境多出来的四个挑战Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:308(搜「Manual evaluation becomes impractical」)
把判决约束成固定标签Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:319(搜「structured templates specifically designed」)
agent 的评测为什么不一样Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1429(搜「differs significantly depending」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1442(搜「does not just」)
工具调用那一层Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1584(搜「evaluate_tools」)
执行轨迹与两条期望序列Chapter 9: Evaluation and Performancetext/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1597(搜「EVALUATING THE EXECUTION TRAJECTORY」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1623(搜「refund_agent」) · text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1639(搜「pinpoint where」)

Footnotes

  1. 出处:「Chapter 9: Evaluation and Performance」第 17 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:17,搜「Each layer also added ways」)。「幻觉不会宣告自己的存在」那句在同一段之后(同文件 :19,搜「the most insidious」)。闪购场景在第 31 段(同文件 :31,搜「flash sale hits」)。

  2. 出处:「Chapter 9: Evaluation and Performance」第 68 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:68,搜「grounding data」)。

  3. 出处:「Chapter 9: Evaluation and Performance」第 81 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:81,搜「30-day return」)。「靠推断会把评测变成一场争论」这句解释是我们补的。

  4. 出处:「Chapter 9: Evaluation and Performance」第 95 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:95,搜「100-500 questions」)与第 96 段(同文件 :96,搜「40 percent of your real queries」)。

  5. 出处:「Chapter 9: Evaluation and Performance」第 91 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:91,搜「adversarial」)。每一类后面的「为什么容易触发」是我们展开的。

  6. 出处:「Chapter 9: Evaluation and Performance」第 106 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:106,搜「EXTRACT CLAIMS AND VALIDATE」)。领域专家把回答分成准确 / 部分准确 / 幻觉三档也在这一节。

  7. 出处:「Chapter 9: Evaluation and Performance」第 122 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:122,搜「Grounding Defect Rate」)。「产品信息 3% / 配送政策 15%」那对数在同一节讲分话题拆解的地方。

  8. 出处:「Chapter 9: Evaluation and Performance」第 127 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:127,搜「Hallucination Severity Score」)与第 130 段(同文件 :130,搜「2-4 business days」)。

  9. 出处:「Chapter 9: Evaluation and Performance」第 138 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:138,搜「single unit」)。那条耳机回答在第 148 段(同文件 :148,搜「battery life of 6 hours」)。这套做法书叫 FActScore,书说它由华盛顿大学的研究者提出;我们没有另行核到那篇论文。

  10. 出处:「Chapter 9: Evaluation and Performance」第 180 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:180,搜「requires LLM calls to extract」)。

  11. 出处:「Chapter 9: Evaluation and Performance」第 186 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:186,搜「ROUGE」)。ROUGE 的全称直译是「面向召回的摘要评估替补」,书没有展开这个缩写的含义。

  12. 出处:「Chapter 9: Evaluation and Performance」第 212 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:212,搜「High ROUGE scores」)。「我们需要的是理解意义和语境的评审者」那句在同一段末尾。

  13. 出处:「Chapter 9: Evaluation and Performance」第 235 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:235,搜「has_hallucination」)。

  14. 出处:「Chapter 9: Evaluation and Performance」第 319 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:319,搜「structured templates specifically designed」)与第 350 段(同文件 :350,搜「label column」)。书点名的那个开源框架叫 Phoenix,来自 Arize;定义允许标签的那个部件在原文里叫 rails map。

  15. 出处:「Chapter 9: Evaluation and Performance」第 253 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:253,搜「JUDGE HALLUCINATION PROBLEM」)与第 260 段(同文件 :260,搜「majority votes」)。三种偏好书说「研究显示」,但没有点名是哪些研究,我们没能核到一手来源。

  16. 出处:「Chapter 9: Evaluation and Performance」第 273 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:273,搜「trick it into providing incorrect refund」)。

  17. 出处:「Chapter 9: Evaluation and Performance」第 299 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:299,搜「Emerging trends in red teaming」)。生产环境多出来的四个挑战在第 308 段(同文件 :308,搜「Manual evaluation becomes impractical」)。

  18. 出处:「Chapter 9: Evaluation and Performance」第 1429 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1429,搜「differs significantly depending」)与第 1441 段(同文件 :1441,搜「does not just」)。

  19. 出处:「Chapter 9: Evaluation and Performance」第 1584 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1584,搜「evaluate_tools」)。书用的判据是两个集合完全相等。

  20. 出处:「Chapter 9: Evaluation and Performance」第 1597 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1597,搜「EVALUATING THE EXECUTION TRAJECTORY」)与第 1623 段(同文件 :1623,搜「refund_agent」)。那条「实际在第 2 步跑偏」的轨迹是我们为演示编的;书只给了「实际 == 期望」的对比,没有给失败的例子。

  21. 出处:「Chapter 9: Evaluation and Performance」第 1639 段(text/12-ch09-chapter-9-evaluation-and-performance-for-llms-an.txt:1639,搜「pinpoint where」)。