跳到主要内容

听不懂「它」— 对话式问答到底难在哪

这一章讲三件事: 机器在多轮问答里到底卡在哪;「对话式问答」这件事在 AI 版图里的位置;以及这本书打算怎么啃它。 读完你会拿到全书的三条挑战线——后面每一章都在接其中一条。 不需要任何基础,遇到的生词都在当场解释。

1. 先看现象:一段对话,机器死在第四问

下面是一段真实存在的人机评测对话,出自本书反复引用的数据集 QuAC1。话题是印度喀拉拉邦的一个族群:

#问题答案
Q1Malayali 在哪里?喀拉拉邦有 30,803,747 人讲马拉雅拉姆语,占全印度该语言使用者的 93.2%
Q2那里还讲什么语言?33,015,420 人讲标准方言,19,643 人讲 Yerava 方言……
Q3这地方还因什么出名?世界马来亚利理事会,一个为侨民建数据库的组织……
Q4他们成功了吗?CANNOTANSWER(答不了)
Q5人口还在增长吗?2010 年新加坡人口普查报告当地有 26,348 名马来亚利人

人读这段话毫无障碍。但把每一问单独拎出来看,机器的处境是这样的:

Q1「Malayali 在哪里?」 —— 完整的问题,能答
Q2「那里还讲什么语言?」 —— 「那里」是哪?得回头看 Q1 和 A1
Q3「这地方还因什么出名?」 —— 「这地方」指喀拉拉邦,还是马来亚利族群?
Q4「他们成功了吗?」 —— 「他们」=世界马来亚利理事会;「成功」=建成数据库
Q5「人口还在增长吗?」 —— 更麻烦:话题已经从印度绕到了新加坡

图说:五问里四问不完整。每一问的真实含义,都藏在之前的问答对里。

原书特别标注了两件事:Q2 没有接着 Q1 问,话题从「马来亚利人」跳到了「喀拉拉邦」——这叫话题转移(聊着聊着换了个对象);而 Q5 绕了一圈又回到「族群人口」——这叫话题回归2。第四问的标准答案干脆就是机器该老老实实说「答不了」——数据集里专门设了 CANNOTANSWER 这个标记(相当于「本题无答案」的官方出口)3

追问(follow-up question)不完整,不是用户的错,是语言的本性。 人跟人说话时,前面说过的东西自动共享,没人会把每个代词都补成全名。麻烦全在机器这边。

先解释一个后面反复出现的词:共指消解(co-reference resolution)——判断「它」「他」「那里」这类代词到底指向前文哪个实体,然后把指代关系确定下来。原书开头就点名:智能问答系统「必须解决共指和对话依赖,才能理解当前问题」4。第一章里那个更简单的例子:用户先问「哥伦布是谁?」,再问「他出生在哪里?」——人秒懂「他」是哥伦布,机器却要专门解决这道题5

2. 对话式 AI 的三类系统

这一节给全书定位:对话式问答只是「对话式 AI」三大类里的一类,而这本书记住的又是其中更窄的一条线。

「对话式 AI」(英文 ConvAI)指一切能跟人多轮对话(你一句我一句连续问答)的系统。原书把它切成三类6:

类型干什么例子
任务型替你办一件事订餐厅、排日程
闲聊型跟你自然地聊陪聊、情感陪伴
问答型基于资料回答问题本章第 1 节那段对话

任务型和闲聊型已经研究得很透,Amazon Alexa、Apple Siri、Microsoft Cortana 都是这类成果7问答型最年轻、也最缺研究——这正是原书(2026 年)选它的理由。

对话式问答(ConvQA,conversational question answering)的原始设定朴素得很:给机器一篇文章和一个问题,让它从文章里抽出一段话当答案8。原书给它一个很准的定位:它是「简化但具体的对话式搜索」——传统搜索引擎还给你一列链接,它直接还你一个答案9。你今天在手机上用语音助手查东西,答案直接念出来而不是甩一页搜索结果,背后就是这类技术。

这个领域里有一条层级线,值得记牢,因为全书的每章都挂在这条线的某一级上:

对话式搜索(最大的圈)
└─ 对话式问答 ConvQA
├─ 顺序式知识库问答(对着结构化知识库查,第 02 章讲)
└─ 对话式机器阅读理解 CMRC(对着文章读)★ 本书全部地盘

图说:原书用一张层级图交代:本书焦点是 CMRC,并且全书里 ConvQA 与 CMRC 两个词互换使用。

CMRC(conversational machine reading comprehension,对话式机器阅读理解)这个名字后半截先照字面接受:「阅读理解」就是给一篇文章加一个问题,让机器从文章里找答案;前半截「对话式」的意思,就是第 1 节那些不完整的追问。原书有个脚注专门交代:除第 2 章外,全书把 ConvQA 和 CMRC 当同一个词用10

3. ConvQA 和一次一问的问答差在哪

这一节回答:不就是多几句历史吗,怎么就成了一个独立研究方向?

任务层面,差别是根本性的。传统问答系统里,「问题与问题相互独立」11;ConvQA 里,问题串成一条链,还带着四种动作——这是原书专门列的12:

动作意思例子(本章第 1 节)
下钻对刚才的答案再挖一层Q2 接着 Q1 问语言
话题转移换个相关对象问Q2 从族群跳到喀拉拉邦
话题回归绕一圈回到旧话题Q5 回到人口
澄清求确认,答案常是「是/不是」「是这座桥吗?」

架构层面,差别落在两个具体部件上13:

  1. 编码器(把文字加工成机器能算的数的第一道工序)里多出一个「历史建模」子模块——除了当前问题和文章,还得把之前的问答对也喂进去;
  2. 推理模块要能做「实用推理」——答案不一定直接写在文章里,得靠上下文推一下。

「实用推理」这个词举例最清楚:文章里写「 Staten Island 是纽约五个区之一」,一次一问的问题「有几个区?」答案直接在句子里;但追问「它是最大的吗?」——机器得先知道「它」指 Staten Island,再拿「人口最少的区」这句去比较推理。这一步跳出了「答案 = 文中原文」的框14

4. 全书三大挑战:三条线,三个模型

这一节是全书的骨架。原书用四个研究问题组织全书,拆开看其实是三条递进的挑战线。

挑战一:问题不完整、有歧义。 用户用一连串「上下文残缺的话」表达需求,模型读不懂当前问题,轻则答案抽偏,重则干脆没有答案15。想反问用户「您是指?」也不行——那会打断对话流,还要用户多费力气16。所以最好机器自己补全。

挑战二:历史该塞多少? 既然不完整就要补历史,直觉是把之前所有问答对全塞进去。原书给了一个反直觉的事实:全塞反而坏事——无关的轮次是噪声,会拉低模型表现17。书里的例子一刀见血:回答 Q5「人口还在增长吗」时,模型其实只需要 Q1,把 Q2、Q3、Q4 全塞进去纯属帮倒忙18。所以「选哪些历史」本身成了一个研究问题。

挑战三:文章不再给定。 上面两条还都假设「文章就在手边」。真实世界里没人替你翻好文章:用户问一个问题,系统得先从成千上万份文档里找到相关的那几篇,再从中抽答案19。这就把任务扩成了「开放域对话式问答」(OD-ConvQA,open-domain),多出一整个检索环节。

三条挑战与全书章节的对应,一张表说完:

挑战对应研究问题哪一章接
问题不完整怎么补全追问第 06 章(CONVSR)
历史带噪声怎么选出相关历史第 07 章(DHS-ConvQA)
文章不给定怎么先检索再回答第 08 章(DPR-ConvQA)

第 02–05 章是背景:这个领域的两条技术路线、一台问答机的解剖、以及这行的题库和判卷尺子。第 09 章是作者自己承认的欠账清单。

5. 这本书怎么读:底细与地图

这一节交代作者与成书方式,并给出一个今天读它必须先知道的错位。

四位作者都是澳大利亚高校的计算机学者:Munazza Zaib(麦考瑞大学博士,本书出版时在莫纳什大学做博士后,研究方向就是信息检索与对话式问答)、Quan Z. Sheng(麦考瑞大学计算机学院院长)、Wei Emma Zhang(阿德莱德大学高级讲师,在澳大利亚 AI 研究所(AIML,一家专做机器学习——让机器从数据里自己学本事——的国立机构)任研究员)、Adnan Mahmood(麦考瑞大学讲师)20这不是四个记者写的科普,而是一个研究团队把自己的博士课题写成专著:第 2 章扩写自他们在期刊发表的综述论文,第 3、4、5 章分别是三篇会议论文的扩写,其中第 5 章的工作成书时还在期刊审稿中21。书由 CRC Press 于 2026 年出第一版,而且版权页写明是「作者自行提供的排版稿」直接印行——典型的学术专著出版方式,没有经过大众编辑的「翻译成人话」那道工序22

这里必须当场指出一个错位:书名叫《当 NLP 遇上 LLM》,但正文里的模型全是 BERT 时代的——作者用的武器是 BERT、RoBERTa、BART 这类编码器模型(第 03 章讲它们是什么),大型语言模型(LLM)只在最后一章的未来展望里出现过一次。

这类模型的造法是两段式:先在海量文本上预训练(泛读),拿到一个通用的语言底子。

然后才是第二步:针对具体任务微调(专攻)。这不奇怪:书里三项研究分别完成于 2022–2024 年,那时学界做对话问答的主流正是这套「小模型+精心设计」的打法。

判断(我们的,不是书里的): 这本书今天的价值排序是——①问题定义与领域地图(相当稳)>②「相关性/精选上下文」这条主线(思想过时不了)>③具体模型的分数与配置(已被 LLM 时代冲刷)。读的时候把力气花在①②。 如果错,会错在: 如果 LLM 时代连「问题不完整」「历史带噪声」这两个问题本身都消解了(比如模型足够强,随便塞多少历史都处理得好),那②也要打折——但从今天的对话系统实践看,这两个问题反而被放大了(上下文越长,噪声与成本越痛),所以②更可能升值而不是贬值。

最后是全书的推荐读法:01(问题)→ 02(两条路线)→ 03(词变数)→ 04(机器解剖)→ 05(题库与判卷)→ 06/07/08(三关)→ 09(欠账)。只想要结论的话,读本页第 4 节加第 06–08 章的「可带走的」一节就够;想搞懂「机器凭什么读得懂词」,第 03 章是绕不开的枢纽。

6. 可带走的

  1. 追问不完整是语言的本性,不是用户的错——「它」「那里」「什么时候」离开前文没有意思,机器必须专门解决这件事;
  2. 共指消解是这本书最基础的一个机制词:判断代词指向谁;
  3. 对话式 AI 分任务型/闲聊型/问答型三类,本书只管问答型里更窄的「对话式机器阅读理解」;
  4. ConvQA 与单轮问答的差别在任务(问题互相关+四种轮次动作)与架构(历史建模+实用推理)两处;
  5. 全书三大挑战:问题不完整(第 06 章)、历史带噪声(第 07 章)、文章不给定(第 08 章)——一条比一条接近真实世界;
  6. 「把所有历史全塞进去」是直觉,但无关历史是噪声,这是全书反复出现的实验事实;
  7. 这是一本 2026 年的学术专著,三章正文=三篇论文;书名有 LLM,正文是 BERT 时代——当机制教材读,当行业现状读就过时了。

7. 原文地图

主题原书章原文位置
Malayali 对话、CANNOTANSWER、话题转移/回归Introductiontext/08-ch01-chapter-1-introduction.txt:118(搜「Malayali located」) · text/08-ch01-chapter-1-introduction.txt:131(搜「CANNOTANSWER」) · text/08-ch01-chapter-1-introduction.txt:139(搜「topic shift」)
共指与对话依赖、哥伦布例子Introductiontext/08-ch01-chapter-1-introduction.txt:148(搜「co-references」) · text/12-ch02-04-2-4-conversational-machine-reading-comprehension.txt:16(搜「Christopher Columbus」)
ConvAI 三分类、Alexa/Siri/CortanaIntroductiontext/08-ch01-chapter-1-introduction.txt:13(搜「task-oriented dialog systems」) · text/08-ch01-chapter-1-introduction.txt:14(搜「chat-oriented」) · text/08-ch01-chapter-1-introduction.txt:30(搜「Amazon Alexa」)
ConvQA 定义、一个答案 vs 一列链接Introductiontext/08-ch01-chapter-1-introduction.txt:36(搜「based on the provided passage」) · text/08-ch01-chapter-1-introduction.txt:40(搜「one correct answer」)
层级与本书焦点、ConvQA≡CMRCIntroductiontext/08-ch01-chapter-1-introduction.txt:71(搜「main focus of this book」) · text/08-ch01-chapter-1-introduction.txt:83(搜「used interchangeably」)
与单轮 QA 的任务/架构差异2.2text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:218(搜「In traditional QA systems」) · text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:226(搜「different nature」) · text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:248(搜「history modeling module」) · text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:286(搜「using pragmatic」)
三大挑战(不完整/噪声/开放域)Introductiontext/08-ch01-chapter-1-introduction.txt:157(搜「Unclear Intent」) · text/08-ch01-chapter-1-introduction.txt:197(搜「bring noise to the system」) · text/08-ch01-chapter-1-introduction.txt:199(搜「needs only Q1」) · text/08-ch01-chapter-1-introduction.txt:208(搜「always provided」)
ConvQA 的正式任务定义Introductiontext/08-ch01-chapter-1-introduction.txt:203(搜「predict the answer span」)
作者团队与论文出身Authorstext/07-fm-authors.txt:3(搜「Macquarie University」) · text/08-ch01-chapter-1-introduction.txt:462(搜「64.12」)

Footnotes

  1. 出处:「Introduction」第 114 段(text/08-ch01-chapter-1-introduction.txt:114,搜「Information-Seeking Dialog」)。对话原文是 Table 1.1,出自 QuAC 数据集(第 2 章 2.5 节专讲)。

  2. 出处:「Introduction」第 139 段(text/08-ch01-chapter-1-introduction.txt:139,搜「topic shift」)。原文注明:Q2 没有接 Q1、话题从 Malyalis 转到 Kerala;Q5 是 topic return。

  3. 出处:「Introduction」第 131 段(text/08-ch01-chapter-1-introduction.txt:131,搜「CANNOTANSWER」)。Q6 的标准答案则是「To be answered」(第 137 段,text/08-ch01-chapter-1-introduction.txt:137,搜「To be answered」)。

  4. 出处:「Introduction」第 148 段(text/08-ch01-chapter-1-introduction.txt:148,搜「co-references」)。原文:智能代理「需要解决共指与对话依赖来理解当前问题」。

  5. 出处:「2.4. CONVERSATIONAL MACHINE READING COMPREHENSION」第 16 段(text/12-ch02-04-2-4-conversational-machine-reading-comprehension.txt:16,搜「Christopher Columbus」)。原文的追问是「Where was he born?」「What was he famous for?」。

  6. 出处:「Introduction」第 13 段(text/08-ch01-chapter-1-introduction.txt:13,搜「task-oriented dialog systems」)。三类系统的划分在第 12–18 段。

  7. 出处:「Introduction」第 30 段(text/08-ch01-chapter-1-introduction.txt:30,搜「Amazon Alexa」)。原文同时指出:问答型对话系统「相当新,仍需大量研究」。

  8. 出处:「Introduction」第 36 段(text/08-ch01-chapter-1-introduction.txt:36,搜「based on the provided passage」)。

  9. 出处:「Introduction」第 40 段(text/08-ch01-chapter-1-introduction.txt:40,搜「one correct answer」)。原文:与传统搜索引擎返回相关文档列表不同,系统返回一个正确答案。

  10. 出处:「Introduction」第 83 段(text/08-ch01-chapter-1-introduction.txt:83,搜「used interchangeably」)。这是原书脚注 4。

  11. 出处:「2.2. FOUNDATIONS OF QA AND INTRODUCTION TO CONVQA」第 218 段(text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:218,搜「In traditional QA systems」)。

  12. 出处:「2.2. FOUNDATIONS OF QA AND INTRODUCTION TO CONVQA」第 226 段(text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:226,搜「different nature」)。四种动作的英文原名是 drilling down / topic shift / topic return / clarification question;第三问「是这座桥吗」的例子取自原书对 clarification question 的描述(答案要求确认型)。

  13. 出处:「2.2. FOUNDATIONS OF QA AND INTRODUCTION TO CONVQA」第 248 段(text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:248,搜「history modeling module」)与第 287 段(搜「pragmatic reasoning」)。原文:ConvQA 在编码器中嵌入历史建模子模块,并把推理模块扩展为可产生文章中不直接给出的答案。

  14. 出处:「2.2. FOUNDATIONS OF QA AND INTRODUCTION TO CONVQA」第 250–281 段(text/10-ch02-02-2-2-foundations-of-qa-and-introduction-to-convqa.txt:253,搜「Staten Island」)。Table 2.1 的六问对话;「它」需要共指消解的说明在第 239 段(搜「Question 5」)。Staten Island 例子的逐轮拆解见本组文档第 02 章。

  15. 出处:「Introduction」第 105 段(text/08-ch01-chapter-1-introduction.txt:105,搜「incomplete context hinders」)。原文:不完整上下文妨碍模型充分解读问题,导致无答案或答案区间抽错。

  16. 出处:「Introduction」第 174 段(text/08-ch01-chapter-1-introduction.txt:174,搜「Clarification Prompts」)。原文:需要向用户请求澄清会打断对话流、增加用户负担。

  17. 出处:「Introduction」第 197 段(text/08-ch01-chapter-1-introduction.txt:197,搜「bring noise to the system」)。这个现象在第 03、04 章会被多次实验证实。

  18. 出处:「Introduction」第 199 段(text/08-ch01-chapter-1-introduction.txt:199,搜「needs only Q1」)。

  19. 出处:「Introduction」第 208 段(text/08-ch01-chapter-1-introduction.txt:208,搜「always provided」);检索环节的规模描述见第 213 段(搜「thousands of candidate documents」)。

  20. 出处:「Authors」第 3 段(text/07-fm-authors.txt:3,搜「Macquarie University」)。四人职务的原文分见作者页各段。

  21. 出处:「Introduction」第 462–472 段(text/08-ch01-chapter-1-introduction.txt:463,搜「Keeping the Questions」)与第 472 段(text/08-ch01-chapter-1-introduction.txt:472,搜「under review」)。参考文献 [26] (综述,KAIS 2022)、[27] (CONVSR,IJCNN 2023)、[28] (DPR-ConvQA,WISE 2024,标注「under review」)——第 5 章的工作成书时尚在审稿中。

  22. 出处:「Copyright Page」第 33 段(text/02-fm-copyright-page.txt:33,搜「camera-ready copy」)。原文(出版方说明):本书由「作者提供的 camera-ready 排版稿」直接印制。