跳到主要内容

出题与判卷 — 数据集与评测

这一章讲三件事: 四张考卷怎么造、设定差在哪;五把判卷尺子各量什么;这门手艺落地在哪。 第 06–08 章每个模型的成绩单都写在四张考卷上——不认识考卷,就读不懂成绩。

1. 先看现象:分数高不等于会聊

先接受一个设定:这一行的进步方式,是在固定数据集上刷分数。原书开宗明义:大规模对话数据集的出现,是 ConvQA 快速增长的一大驱动——造一张好数据集,和把模型架构调好同样要紧1

但数据集不是中立的考官,出题方式决定模型学到什么。举一个马上会反复出现的例子:如果数据集里答案永远是文中的原文片段(抽取式),模型就只练「定位」不练「改写」;如果允许自由作答,模型才需要练表达。所以读后面几章的成绩单之前,必须先看清每张考卷的规矩。

按答案形态分,机器阅读理解的数据集有三类2:

类型答案形态例子
多选型从给定的选项里挑RACE、MCTest
描述型自由文本MS MARCO、NarrativeQA
抽取型文中一段原文SQuAD、TriviaQA、NewsQA

本书关注的四张考卷全部属于对话式问答:单轮时代的双雄 CoQA 与 QuAC,开放域的 OR-QuAC 与 TopiOCQA——后三张都是抽取型(或「自由文本+文中依据」),CoQA 介于两者之间。另有一张对话数据集 ShARC 被原书明确排除:它考的是「读规则文本回答连环追问」,不算机器阅读理解3

2. 题从哪来:众包怎么造对话

这一节讲四张考卷共同的出生方式:雇人在网上对写对话。

这些对话全部由众包(crowdsourcing,把任务拆给大量网络兼职者)生产,平台是亚马逊的 Amazon Mechanical Turk(简称 AMT):两个标注员配成一组,一人提问、一人回答,围绕同一篇文章对写出一整段对话4

但「两人自由对写」会写出千篇一律的对话,所以每张考卷都要给双方设限——这些限制正是各张考卷的性格来源。最能说明问题的是 QuAC 的师生设定:回答者(老师)能看全文;提问者(学生)只看得到文章标题和摘要,只能靠不断提问来获取内容5。这一手逼出了真实的追问——学生不知道答案在文章哪里,问出来的问题天然带指代、带省略,和第 01 章 Malayali 对话一个味道。

CoQA 反着来:两个标注员都能看全文,考卷的性格落在「答案要自然」上——回答者可以自由措辞,但必须同时给出答案在文中的出处片段(称为 rationale,依据)6。OR-QuAC 干脆不是新录的:它把 QuAC 的对话接上一整套维基百科语料(喂给机器读的文本原料),改成开放域(下一节细说)。TopiOCQA 则在 QuAC 的师生设定上再加一层狠活:允许对话中途换主题。

3. 走查:一段对话的诞生

主走查。 按原书描述的 QuAC 收集流程,还原一次标注现场。场景:AMT 上两名标注员配对,文章是维基百科「Jal(巴基斯坦乐队)」条目;学生只看到标题「Jal — The band」。

第 1 问
学生(只见标题):「Who founded Jal?」
老师(看全文):在文章里找到原文片段「Goher Mumtaz and Atif Aslam」
→ 抽取它作为答案;同时给一个 dialog act(对话动作)标记:
「可继续追问」
第 2 问
学生:「Where was Atif Aslam born?」
老师:文中片段「Wazirabad」;dialog act:可继续
第 3 问
学生:「When was the band founded?」
老师:文中片段「2002」;dialog act:可继续
…… 至多 11 轮,每轮 = 一问 + 一段抽取的原文 + 一个动作标记

交付物:一段对话 = 多个(问题, 答案 span, dialog act)三元组
图说:对话内容取自原书 Table 4.1 的真实数据;标注现场的「屏幕」
是按原书收集流程描述还原的。

标完之后的库长这样:QuAC 一共 1.4 万段对话、10 万问答对;老师给的动作标记让对话更「有产出一」——学生根据「可继续/该换题」的反馈决定追问还是转移7。这套三元组就是后面所有模型的训练与考试材料:问题练共指,span 练定位,dialog act 练「该不该反问」。

4. 四张考卷对照

这一节把四张考卷摆在一起比。读后面三章的成绩单,对照表必须能查。

CoQAQuACOR-QuACTopiOCQA
文章来源七个领域(儿童故事/新闻/维基等)8维基「人物」类条目QuAC 对话 + 全维百科维基「人物」类条目
对话设定双人都看全文师生:学生只见标题真实人机对话移植师生+可换主题
答案形态自由文本+文中依据抽取 span(含是/否/无答案)抽取 span自由文本+依据
规模12.7 万问答对 / 8 千对话 / 均长 15 轮910 万问答对 / 1.4 万对话 / 至多 11 轮101100 万候选段11;3.5 万训练轮123920 段对话 / 5 万轮 / 均 13 轮13
性格自然、跨域追问密度极高开放域第一卷换主题第一卷

每张考卷有几个数字值得单独记:

  • QuAC 的难度写在统计里:86% 的问题高度依赖上下文(必须回头读历史才能理解),其中 44% 指向历史里的实体或事件,61% 指向文章主题14。作为对照,答案被限制得不超过 15 个词——短答案+高依赖,双重难度15
  • OR-QuAC 的工程细节:把 590 万篇维基文章用 BERT 的切词器切成每段至多 384 个词块;切的时候小心保句子边界,只有不到 0.5% 的已知答案被切到两段里(这些就按不可答处理)16
  • TopiOCQA 的门槛:开头问题取自真实搜索引擎的问题集 Natural Questions 作为种子话题,对话中可以跳到相关文档;平均一段对话跨 4 篇文档17

5. 判卷的尺子

这一节讲五把尺子。第 06–08 章表格里每个数,都出自这里。

尺子量什么怎么算量不出什么
F1(词面重合度:数预测与答案的共有词)答案与标准答案重合得怎么样预测与答案的共有词比例的调和平均;CoQA 用各领域宏平均18意思对但措辞不同的答案会被低估
EM完全匹配逐字全对才得分;比 F1 严19同上,更甚
HEQ追平人类的比例系统 F1 达到人类平均分的题(或对话)占比;按题算叫 HEQ-Q,按整段对话算叫 HEQ-D20是个「及格率」,不反映超出程度
MRR检索排序质量正确段落排名的倒数的平均——排第 1 得 1 分,第 2 得 0.5,第 5 得 0.221不管找没找全
Recall找回比例相关段落被检回的比例(通常看前 5 段)22不管排得靠不靠前

一把最容易被高估的尺子是 F1:对话问答里同一件事有多种说法,「Failed to gain success」和「The album failed to gain commercial success」意思全同,F1 却打折。这是 F1 时代的系统性偏差——第 08 章成绩单上 TopiOCQA 的分数普遍难看,一部分原因是它的答案是自由文本,F1 天然吃亏23

6. 这门手艺用在哪

这一节收尾:考卷之外,这项技术准备卖给谁。

原书列了三个落点24:一是统一信息入口——用户不用再开十个数据库查东西,一个对话入口包办;二是对话式搜索——原书判断它有取代传统搜索引擎的潜力(传统引擎给一列链接,它给一个答案);三是客服——用户不必在网站里翻找,直接问。

顺带交代这门手艺的时代坐标:原书统计过,ConvQA 方向的论文数自 2016 年起稳步上升,2019 年到达峰值——恰好是预训练语言模型横空出世、把自然语言生成与理解整个翻新了一遍的那一年25考卷是 2018–2022 年造的,模型是 BERT 代的,成绩单定格在 LLM 到来前夜——这个坐标就是我们总纲里「今天读要修正」的锚点。

7. 可带走的

  1. 这行的进步方式是考卷驱动:数据集怎么出题,模型就长成什么样;
  2. 四张考卷的性格:CoQA 自然+跨域、QuAC 追问密度极高、OR-QuAC 开放域、TopiOCQA 换主题;
  3. 师生设定是逼出真实追问的巧招:提问者只看标题,问出来的问题天然带省略;
  4. QuAC 的 86/44/61 三个百分数:对话问答的难度主要不是问题长,而是依赖上下文;
  5. 造数据集的一半功夫在设限:不设限的众包写不出多样性;
  6. 五把尺子各量一面:F1/EM 管答案、HEQ 管追平人类、MRR/Recall 管检索;F1 惩罚正确但换措辞的答案;
  7. dialog act(动作标记)是被低估的设计:它教模型的不是「答案是什么」,而是「接下来该干嘛」。

8. 原文地图

主题原书章原文位置
数据集是增长驱动;三类答案2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:15(搜「One driver for the rapid growth」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:23(搜「Multiple-choice option」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:180(搜「extractive datasets」)
四张考卷点名、ShARC 被排除2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:187(搜「two datasets for ConvQA」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:194(搜「does not really follow」)
CoQA 三目标、rationale、七域2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:201(搜「CoQA was introduced」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:236(搜「text-span from the given passage」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:239(搜「across multiple domains」)
众包与 AMT 双人配对2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:275(搜「prepared in a two」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:277(搜「Amazon Mechanical」)
CoQA 规模与单词问题、宏平均 F12.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:282(搜「127K conversation turns」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:289(搜「one-word questions」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:294(搜「macro-average F1」)
QuAC 师生设定、dialog act、86/44/61、HEQ2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:308(搜「student-teacher」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:314(搜「dialog acts as feedback」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:323(搜「86% of the questions」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:329(搜「human equivalence score」)
OR-QuAC 构成与工程细节2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:336(搜「composite dataset」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:351(搜「5.9 million」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:357(搜「0.5%」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:363(搜「11 million passages」)
MRR 与 Recall、top-52.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:379(搜「Mean Reciprocal Rank」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:386(搜「top five passages」)
TopiOCQA 设定与规模2.5text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:390(搜「Topic Switching in Open」) · text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:394(搜「Natural Questions」) · text/14-ch02-06-2-6-research-trends.txt:1(搜「minimum of ten」) · text/14-ch02-06-2-6-research-trends.txt:9(搜「Exact Match」)
三个应用落点2.6text/14-ch02-06-2-6-research-trends.txt:19(搜「Single Source of Information」) · text/14-ch02-06-2-6-research-trends.txt:29(搜「Conversational Search」) · text/15-ch02-07-2-7-summary.txt:7(搜「Customer Support System」)
2019 峰值与预训练元年2.1text/09-ch02-01-2-1-overview.txt:61(搜「pertinent to ConvQA steadily」) · text/09-ch02-01-2-1-overview.txt:63(搜「revolutionized」)

Footnotes

  1. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 15 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:15,搜「One driver for the rapid growth」)。原文:造高质量数据集与优化架构同样重要。

  2. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 21 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:21,搜「into three categories」)。三类各自的例子在第 23–33 段与第 173–185 段。

  3. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 194 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:194,搜「does not really follow」)。ShARC 的介绍在第 190–192 段:考「对规则文本的理解」,须按背景知识推理作答。

  4. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 275 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:275,搜「prepared in a two」)。AMT 与 ParlAI MTurk 接口在第 278 段。

  5. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 308 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:308,搜「student-teacher」)。老师抽 span、用 dialog act 反馈的说明在第 312–315 段。

  6. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 236 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:236,搜「text-span from the given passage」)。原文:自由形式作答,同时以文中 text-span 作为答案的依据(rationale)。

  7. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 314 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:314,搜「dialog acts as feedback」)。规模数字(1.4 万对话/10 万问答对)在第 305 段(搜「14K crowd-sourced」)。

  8. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 212 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:212,搜「seven diverse」)。跨域动机在第 242 段;七域清单在第 244–247 段。

  9. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 282 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:282,搜「127K conversation turns」)。平均 15 轮同段。

  10. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 305 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:305,搜「14K crowd-sourced」)与 Table 2.3(第 225 段,搜「Max turns per dialog」)。

  11. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 363 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:363,搜「11 million passages」)。

  12. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 368 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:368,搜「35,526」)。验证/测试 3430/5571 同段。

  13. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 406 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:406,搜「Three thousand nine hundred」);平均 13 轮、约四篇文档见「2.6. RESEARCH TRENDS」第 4 段(text/14-ch02-06-2-6-research-trends.txt:4,搜「13 question-answer turns」)。

  14. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 322–325 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:323,搜「86% of the questions」)。44% 与 61% 在第 324 段(搜「44% refer to entities」)。

  15. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 318 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:318,搜「15 tokens」)。

  16. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 352 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:352,搜「maximum of 384」);0.5% 切断率在第 357 段(搜「0.5%」);590 万篇在第 351 段(搜「5.9 million」)。

  17. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 394 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:394,搜「Natural Questions」);跨 4 篇文档见「2.6. RESEARCH TRENDS」第 4 段(搜「four documents」)。

  18. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 294 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:294,搜「macro-average F1」);OR-QuAC 的 F1 用法在第 371–373 段(搜「Word-level F1」)。

  19. 出处:「2.6. RESEARCH TRENDS」第 9 段(text/14-ch02-06-2-6-research-trends.txt:9,搜「Exact Match」)。原文:EM 更严格,要求完全匹配;F1 允许部分重合。

  20. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 329 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:329,搜「human equivalence score」)。HEQ-Q/HEQ-D 之分在第 331 段(搜「HEQ-Q and HEQ-D」)。

  21. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 379 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:379,搜「Mean Reciprocal Rank」)。原文:MRR 是所有查询倒数排名的均值。

  22. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」第 382 段(text/13-ch02-05-2-5-datasets-for-conversational-question-answeri.txt:382,搜「fraction of the total relevant」);「通常看前 5 段」在第 386 段(搜「top five passages」)。

  23. 出处:「2.5. DATASETS FOR CONVERSATIONAL QUESTION ANSWERING」Table 2.4(第 266 段,搜「Free-form Answers」):TopiOCQA 答案为自由文本(带依据),OR-QuAC 为抽取 span。自由文本让词面 F1 吃亏,这一点是我们的推断,判断依据见第 08 章 §5。

  24. 出处:「2.6. RESEARCH TRENDS」第 19 段(text/14-ch02-06-2-6-research-trends.txt:19,搜「Single Source of Information」)、第 29 段(搜「Conversational Search」)与「2.7. SUMMARY」文件首部第 7 段(text/15-ch02-07-2-7-summary.txt:7,搜「Customer Support System」)。

  25. 出处:「2.1. OVERVIEW」第 61 段(text/09-ch02-01-2-1-overview.txt:61,搜「pertinent to ConvQA steadily」)与第 62 段(搜「revolutionized」)。原文:论文数量 2016 年起稳步上升、2019 年最多;同年预训练语言模型革新了 NLG 与 NLU。