跳到主要内容

评估(下):AI 当裁判,与两两比较的排名术

这一章讲三件事: 「让 AI 考 AI」为什么从玩笑变成了生产环境的主流做法,怎么给裁判写考卷; 裁判的四种系统性偏心——每一种都有可引用的实测数字; 以及没有标准答案时的排名术:让用户两两比较,把胜负表变成一份榜单。 它在全书的位置:上一章给了「打分的尺子」,这一章给「请考官」和「办擂台」;第 06 章把三种手段合成为你自己的评估流水线。

1. 顶层全景:考官也是一种模型

先给规模感:LangChain 2023 年的平台报告显示,58% 的评估已经由 AI 裁判完成——作者的原话更直接,这可能已是生产环境里最常用的评估方法1

它为什么站得住?一条反直觉的证据:2023 年的研究发现,在 MT-Bench 考卷上,GPT-4 与人类评估员的一致性达到 85%——比人类评估员彼此之间的一致性(81%)还高;另一套自动评测与 LMSYS 榜单的相关系数达到 0.98,接近满分2。「人不如 AI 稳」正是这一章所有工程存在的理由。

本章两条腿:
① 请考官:拿一个模型当裁判,给单个响应打分 (§2–§4)
怎么出题 → 裁判的四宗偏心 → 什么模型有资格坐上裁判席
② 办擂台:跳过绝对分数,让候选者两两过招,算胜率排名 (§5–§7)
比较为什么更容易 → 胜率怎么变成排名 → 擂台的三道坎

图说:①是「有答案时的打分」,②是「没答案时比高下」。
两者都要靠「比较比生成容易」这件不对称的事撑着。

2. 怎么给裁判出题

给裁判的任务分三种姿势,难度递增3:

姿势问题长什么样适用
独立打分「按 1 到 5 给这个响应打分」有明确标准时
对照参考「这个响应和参考答案一致吗?答 True/False」有黄金答案时
两两比较「响应 A 和响应 B 哪个更好?」只有相对好坏时

出题本身有讲究,书里给了四条实操经验。其一,评估标准写得越具体越好。其二,评分体系按「分类标签 > 离散数值 > 连续数值」的顺序选——模型更擅长输出文字类判定;若用分数,范围越小越好,典型的离散分制是 1 到 5。其三,给裁判看几个带分理由的示例,表现会明显更好。其四,Azure 官方裁判提示词的结构值得抄:先讲任务,再讲标准,再讲评分体系,最后附一个低分示例及其低分理由4

3. 裁判的四宗偏心(都有实测数字)

信任裁判之前,先看它的病历。书里整理的每一条都配了实验:

病历一:自己都不一致。 同一个裁判、同样的输入,换个措辞或重跑一遍,分数会漂。补救手段是第 03 章的老朋友——在提示词里加示例能把 GPT-4 的一致性从 65% 提到 77.5%;但研究者自己承认,高一致不等于高准确(它可能只是稳定地错);而且示例翻倍,成本涨到 4 倍5

病历二:评分标准没对齐。 三家开源工具都内置了「忠实性」这个标准——衡量回答是否忠于给定上下文——但 MLflow 用 1 到 5 分,Ragas 只给 0 或 1,LlamaIndex 干脆要求答 YES/NO。同一个「上下文+答案」,三家给出 3、1、NO,你采信哪个?作者的忠告:如果你无法获知裁判背后的模型与提示词,就不要轻易信它的分6

病历三:成本和延迟翻倍。 用 GPT-4 既生成又评估,调用次数翻倍;要评三个标准(质量、事实一致性、毒性),调用涨到 4 倍。省钱的两个阀门:抽查(只评一部分响应——代价是可能漏掉失败案例)和用便宜模型初审7

病历四:四种系统性偏心。 这是书里给的最硬的一张表8:

偏心表现实测
自我偏差偏爱自己生成的响应GPT-4 高 10%,Claude 1 高 25%
首位偏差两两比较时偏爱排前面的可用调换顺序缓解;人类恰好相反,爱最后看到的(近因偏差)
冗长偏差偏爱更长而不论对错长度差 2 倍时几乎总选长的;错但长 vs 对但短,常选前者
( Position )见首位

这些偏心的共同根源只有一个:裁判也是抽签机。理解了第 03 章的采样,这四条病历没有一条意外。

4. 谁有资格当裁判

四宗病历带出一个尖锐问题:最强的模型没有裁判,那裁判席上能坐谁?书里给了一串逐级递降的答案9:

  1. 自我评估当体检,不当评分。 让模型批评自己的回答(「What's 10+3?」「30。」「再查一遍。」「是 13。」)在自查类场景有效,但别拿它当正式评分——毕竟自我偏差在那儿摆着。

  2. 弱模型可以评强模型。 理论支点是那句不对称:评判比生成容易——任何人都能听出一首歌难听,不是人人会写歌。所以「用便宜模型生成、只在 1% 的样本上请 GPT-4 评」是常见配方。

  3. 训练小而专的裁判模型。 书里列了三类,正好对应三种出题姿势10:

专用裁判输入什么输出什么例子
奖励型(提示词,响应)质量分Cappy:仅 3.6 亿参数,输出 0 到 1
基于参考型(响应,参考响应)相似度或质量分Prometheus:按给定评分标准输出 1 到 5
偏好型(提示词,响应 1,响应 2)哪个更好 + 理由PandaLM、JudgeLM

第三类是三者中最有想象力的:第 03 章说过,人类的比较数据是后训练最贵的一环——一个可靠的人类偏好预测器,等于把最贵的数据变成了可无限再生的11

判断(我们的,不是书里的): 「裁判比考生强才行」是直觉陷阱。真正决定裁判资格的是三件事:判断标准的可表述程度、示例的供给成本、以及有没有把已知偏差(自我/首位/冗长)在设计里对冲掉。模型的绝对智力是这三件事里最不重要的一项。 如果错,会错在: 若某类任务的标准本身就是模糊的(「有文采」),弱裁判没有智力兜底,判断力不足会直接转化成打分噪声——此时判断反转,还是得请强模型。

5. 办擂台:比较为什么比打分容易

换一条完全不同的路。不做绝对打分,只问「A 和 B 哪个好」——这个动作人做起来远比打分稳定,擂台赛就是这么办了上百年的。

书里交代了三个关键设计12:

  • 每次请求同时让两个(或多个)模型作答,评估员只回答谁更好;允许平局,免得在难分高下时硬选。

  • 它不是 A/B 测试:A/B 里用户每次只见一个候选的输出;擂台里用户同时看见多个再比——信息量完全不同。

  • 偏好投票有适用边界:像「手机辐射和脑肿瘤有无关联」这种有客观答案的问题,按偏好投票会采到误导信号;擂台适合的场景是 AI 当助手,帮用户更快完成他本来就会做的事13

排名怎么从胜负表里算出来?先定义胜率(模型 A 对 B 的胜率 = 所有对局里 A 获胜的百分比);但当模型有 5 个时,两两胜率表已经看不出谁该排第几,需要评分算法收拢成单一排名——体育界现成的三件套:Elo、Bradley-Terry、TrueSkill14

这里藏着本章的主走查——LMSYS Chatbot Arena 换算法的完整账:

起点: Chatbot Arena 用 Elo 算排名(国际象棋那套)
问题: Elo 对「评估员顺序」「提示词顺序」敏感
换用: Bradley-Terry 算法
妥协: 名字照旧叫「Elo 分数」——
每个分 ×400,再 +1000,再整体缩放使 Llama-13B 恰为 800
本质: 排名 = 用历史对局预测未来对局,没有绝对标准答案

图说:换的是内核,留的是皮肤——为了让旧用户继续看懂分数。
(数字全部出自书内,非演示编造。)

6. 擂台的三道坎

坎一:对局数随模型数平方涨。 57 个模型意味着 1596 对;LMSYS 2024 年 1 月做了 24.4 万次比较,平均每对才 153 次——考虑到模型要覆盖的任务范围,这不算多。省钱靠传递性假设(A>B、B>C 就推出 A>C),但多篇论文警告:人类偏好未必可传递,A/B/C 三方用了不同评估员时更不可信15

坎二:众包擂台没有质控。 Chatbot Arena 公开的 33,000 条提示词里,180 条就是「hello」和「hi」;一道「X 有 3 个姐妹,每个姐妹都有一个兄弟,X 有几个兄弟」的脑筋急转弯被问了 44 次。简单提示词比不出模型差距,而你的 RAG 上下文(第 08 章)更不在别人的擂台上。对策三条:限定提示词范围、只收高难度提示词(LMSYS 的做法)、或者干脆用可信评估员自建私有擂台(Scale 的 SEAL)——代价是贵、样本少16

坎三:排名不翻译成绝对能力。 模型 A 能解决 70% 的客服工单;模型 B 对 A 的胜率 51%——B 能解决多少?不知道。 胜率的 1% 在有的应用里值千金,在有的应用里毫无感觉;成本差一倍时更没法换算。擂台只回答「谁高」,不回答「够不够用」17

7. 作者的判断与证据

  • 比较评估的三个结构性优点,书里给了清楚论证:模型能力超过人类后,人仍能比较;这份榜单永不饱和(总有新模型来打);刻意操纵相对更难(虽然作者也记录了「确信对手在操纵」的行业传闻)18
  • 排名是预测问题,不是测量问题——作者自己分析了 Chatbot Arena 的排名质量,结论是对对局数据充足的模型对,排名质量较高;分析细节放在书的 GitHub 仓库19
  • 证据与推测分得清:58%、85%、24.4 万次这些是可回核的公开数字;「竞争对手在试图操纵排名」作者明确标注为开发者口供,未当事实引用。

8. 边界与局限

  • 本章的裁判与擂台都围绕「比较人类偏好」;涉及客观正确性的任务(数学、代码),第 04 章的功能正确性仍然是更硬的尺。
  • 专用裁判模型(Cappy、Prometheus、PandaLM)在书中是 2023 年快照,这个方向推陈出新极快,选型前请核对当年新榜。
  • 书中没有给出「裁判提示词」的可复制模板全文(只给了 Azure 示例的结构),实操时仍需自行打磨。

9. 可带走的

  1. AI 裁判已是生产环境最常用的评估方式(58%),顶级裁判与人的一致性 85% 高过人与人 81%;

  2. 出题口诀:标准写细、评分选分类或 1–5 分、带示例、附低分样板;

  3. 裁判四宗罪都有数:自我偏差 +10%~25%、成本随标准数翻倍、高一致不等于高准确、三家工具的「忠实性」互不可比;

  4. 省钱两阀门:抽查便宜模型初审 + 强模型只评 1%;

  5. 评判比生成容易——弱模型可以评强模型;偏好型裁判把最贵的人类比较数据变成可再生的;

  6. 擂台 ≠ A/B 测试:同时看多个输出再选;有客观答案的问题别拿偏好投票;

  7. Chatbot Arena 换了 Bradley-Terry 内核,却保留「Elo 分数」外壳(×400 +1000,锚定 Llama-13B=800);

  8. 排名的三道坎:对局数平方涨、众包无质控(hello 类占 0.55%)、胜率不翻译成绝对能力(51% ≠ 解决 51% 的工单)。

10. 原文地图

主题原书章原文位置
58% 由 AI 裁判完成第3章text/10-ch03.txt:779(搜「58%的评估」)
85% vs 81%、相关 0.98第3章text/10-ch03.txt:796(搜「85%」)
三种使用姿势第3章text/10-ch03.txt:819(搜「将该响应与参考数据进行对比」)
评分体系与示例第3章text/10-ch03.txt:915(搜「离散数值」) · text/10-ch03.txt:924(搜「离散评分的效果似乎优于连续评分」)
Azure 提示词结构第3章text/10-ch03.txt:930(搜「Azure AI Studio用于相关性标准」)
病历一:不一致第3章text/10-ch03.txt:977(搜「都具有概率性」) · text/10-ch03.txt:980(搜「65%提高到77.5%」)
病历二:标准模糊第3章text/10-ch03.txt:986(搜「并未标准化」) · text/10-ch03.txt:1001(搜「你会采信哪个评分」)
病历三:成本翻倍与抽查第3章text/10-ch03.txt:1030(搜「翻倍」) · text/10-ch03.txt:1038(搜「spot-checking」)
病历四:自我/首位/冗长偏差第3章text/10-ch03.txt:1051(搜「高出10%」) · text/10-ch03.txt:1054(搜「首位偏差」) · text/10-ch03.txt:1062(搜「冗长偏差」)
自我批评的边界第3章text/10-ch03.txt:1100(搜「自我评估或自我批评」)
弱模型评强模型 1%第3章text/10-ch03.txt:1086(搜「评估其中的1%」)
三类专用裁判总览第3章text/10-ch03.txt:1122(搜「三类专用AI裁判」)
Cappy / BLEURT / Prometheus第3章text/10-ch03.txt:1128(搜「3.6亿个参数」) · text/10-ch03.txt:1140(搜「Prometheus」)
PandaLM 与 JudgeLM第3章text/10-ch03.txt:1146(搜「PandaLM」)
擂台起源与平局第3章text/10-ch03.txt:1187(搜「两两比较分数」) · text/10-ch03.txt:1199(搜「允许出现平局」)
偏好投票的适用边界第3章text/10-ch03.txt:1202(搜「手机辐射」) · text/10-ch03.txt:1208(搜「实习生或助手」)
≠ A/B 测试第3章text/10-ch03.txt:1211(搜「A/B测试」)
胜率定义与排名算法第3章text/10-ch03.txt:1223(搜「胜率」) · text/10-ch03.txt:1243(搜「TrueSkill」)
Elo 分数的皮肤第3章text/10-ch03.txt:1238(搜「Llama-13B模型的分数为800」)
坎一:对局数与传递性第3章text/10-ch03.txt:1266(搜「153次比较」) · text/10-ch03.txt:1272(搜「传递性假设存在局限」)
坎二:众包无质控第3章text/10-ch03.txt:1308(搜「180条」) · text/10-ch03.txt:1320(搜「SEAL排行榜」)
坎三:比较≠绝对第3章text/10-ch03.txt:1350(搜「70%的工单」)
前景与永不饱和第3章text/10-ch03.txt:1367(搜「永远不会饱和」)

Footnotes

  1. 出处:「第3章」第 779 段(text/10-ch03.txt:779,搜「58%的评估」)。

  2. 出处:「第3章」第 796 段(text/10-ch03.txt:796,搜「85%」)。Zheng 等 2023(MT-Bench);Dubois 等 2024(AlpacaEval 与排行榜相关 0.98)。

  3. 出处:「第3章」第 819 段(text/10-ch03.txt:819,搜「将该响应与参考数据进行对比」)。

  4. 出处:「第3章」第 915 段(text/10-ch03.txt:915,搜「离散数值」)、第 924 段(text/10-ch03.txt:924,搜「离散评分的效果似乎优于连续评分」)、第 927 段(text/10-ch03.txt:927,搜「包含示例的提示词已被证明表现更好」)与第 930 段(text/10-ch03.txt:930,搜「Azure AI Studio用于相关性标准」)。

  5. 出处:「第3章」第 977 段(text/10-ch03.txt:977,搜「都具有概率性」)与第 980 段(text/10-ch03.txt:980,搜「65%提高到77.5%」)。

  6. 出处:「第3章」第 986 段(text/10-ch03.txt:986,搜「并未标准化」)与第 1001 段(text/10-ch03.txt:1001,搜「你会采信哪个评分」)。作者原话见第 1013 段附近:不知模型与提示词就不要轻信。

  7. 出处:「第3章」第 1030 段(text/10-ch03.txt:1030,搜「翻倍」)、第 1038 段(text/10-ch03.txt:1038,搜「spot-checking」)与第 1086 段(text/10-ch03.txt:1086,搜「评估其中的1%」)。

  8. 出处:「第3章」第 1051 段(text/10-ch03.txt:1051,搜「高出10%」)、第 1054 段(text/10-ch03.txt:1054,搜「首位偏差」)与第 1062 段(text/10-ch03.txt:1062,搜「冗长偏差」)。

  9. 出处:「第3章」第 1100 段(text/10-ch03.txt:1100,搜「自我评估或自我批评」)与第 1086 段(text/10-ch03.txt:1086,搜「评估其中的1%」)。「评判比生成容易」的表述见第 1119 段附近。

  10. 出处:「第3章」第 1122 段(text/10-ch03.txt:1122,搜「三类专用AI裁判」)、第 1128 段(text/10-ch03.txt:1128,搜「3.6亿个参数」)与第 1140 段(text/10-ch03.txt:1140,搜「Prometheus」)。

  11. 出处:「第3章」第 1146 段(text/10-ch03.txt:1146,搜「PandaLM」)。偏好数据昂贵且难获取的论述在同段。

  12. 出处:「第3章」第 1187 段(text/10-ch03.txt:1187,搜「两两比较分数」)、第 1199 段(text/10-ch03.txt:1199,搜「允许出现平局」)与第 1211 段(text/10-ch03.txt:1211,搜「A/B测试」)。

  13. 出处:「第3章」第 1202 段(text/10-ch03.txt:1202,搜「手机辐射」)与第 1208 段(text/10-ch03.txt:1208,搜「实习生或助手」)。

  14. 出处:「第3章」第 1223 段(text/10-ch03.txt:1223,搜「winrate」;若定位失败搜「胜率」)与第 1243 段(text/10-ch03.txt:1243,搜「TrueSkill」)。

  15. 出处:「第3章」第 1238 段(text/10-ch03.txt:1238,搜「Llama-13B模型的分数为800」)、第 1266 段(text/10-ch03.txt:1266,搜「153次比较」)与第 1272 段(text/10-ch03.txt:1272,搜「传递性假设存在局限」)。

  16. 出处:「第3章」第 1308 段(text/10-ch03.txt:1308,搜「180条」)与第 1320 段(text/10-ch03.txt:1320,搜「SEAL排行榜」)。

  17. 出处:「第3章」第 1350 段(text/10-ch03.txt:1350,搜「70%的工单」)。

  18. 出处:「第3章」第 1367 段(text/10-ch03.txt:1367,搜「永远不会饱和」)。操纵传闻见第 1290 段(text/10-ch03.txt:1290,搜「操纵排名」)。

  19. 出处:「第3章」第 1249 段(text/10-ch03.txt:1249,搜「预测未来的对局结果」)。