出题与判卷 — 数据集与评测
这一章讲三件事: 四张考卷怎么造、设定差在哪;五把判卷尺子各量什么;这门手艺落地在哪。 第 06–08 章每个模型的成绩单都写在四张考卷上——不认识考卷,就读不懂成绩。
1. 先看现象:分数高不等于会聊
先接受一个设定:这一行的进步方式, 是在固定数据集上刷分数。原书开宗明义:大规模对话数据集的出现,是 ConvQA 快速增长的一大驱动——造一张好数据集,和把模型架构调好同样要紧1。
但数据集不是中立的考官,出题方式决定模型学到什么。举一个马上会反复出现的例子:如果数据集里答案永远是文中的原文片段(抽取式),模型就只练「定位」不练「改写」;如果允许自由作答,模型才需要练表达。所以读后面几章的成绩单之前,必须先看清每张考卷的规矩。
按答案形态分,机器阅读理解的数据集有三类2:
| 类型 | 答案形态 | 例子 |
|---|---|---|
| 多选型 | 从给定的选项里挑 | RACE、MCTest |
| 描述型 | 自由文本 | MS MARCO、NarrativeQA |
| 抽取型 | 文中一段原文 | SQuAD、TriviaQA、NewsQA |
本书关注的四张考卷全部属于对话式问答:单轮时代的双雄 CoQA 与 QuAC,开放域的 OR-QuAC 与 TopiOCQA——后三张都是抽取型(或「自由文本+文中依据」),CoQA 介于两者之间。另有一张对话数据集 ShARC 被原书明确排除:它考的是「读规则文本回答连环追问」,不算机器阅读理解3。