跳到主要内容

大纲 — When NLP Meets LLM(when-nlp-meets-llm-neural-approaches)

9 章。切分依据:原书 = 1 章导论 + 1 章大综述(7 节)+ 3 章自研模型 + 1 章结论。 综述章信息密度极高(新词密),拆成 4 章(01/02/03/04/05 中五份);三章模型一章一关,推理链完整。 顺序 = 原书推理顺序:定义问题 → 画地图 → 造机器的三关 → 欠账。

01 听不懂「它」— 对话式问答到底难在哪

  • 这一章讲什么:定义 ConvQA,给出全书三大挑战,交代原书结构(四章模型/综述的对应关系)
  • §1 先看三段真实对话 → 进来时以为:问答就是一问一答 → 出去时知道:追问里满是「它」「那里」,不看历史根本读不懂(Malayali/FRIENDS 两个对话的 CANNOTANSWER 与话题回归)
  • §2 对话式 AI 的三类系统 → 进来时以为:聊天机器人是一种东西 → 出去时知道:任务型/闲聊型/问答型三分,本书只管第三类;ConvQA ⊂ 对话式搜索 ⊃ {顺序式知识库问答, 对话式机器阅读理解}
  • §3 ConvQA 和单轮问答差在哪 → 进来时以为:多了几句历史而已 → 出去时知道:任务上差在问题互相关+轮次有四种动作(下钻/转移/回归/澄清),架构上多出「历史建模」与「实用推理」两个部件
  • §4 全书三大挑战 → 进来时以为: → 出去时知道:①问题不完整歧义 ②相关历史选择(全塞进去=噪声) ③开放域(文章不再给定);这三条各自对应第 06/07/08 章
  • §5 判断与地图:这本书怎么读 → 出去时知道:四位作者是学者团队、2026 成书、三章是论文扩写;书名有 LLM 但正文是 BERT 时代——今天读要带着哪三处修正

02 两条路线 — 查表的知识库 vs 读文章的机器

  • 这一章讲什么:QA 家谱与分类学;顺序式 KB-QA 的三部件;为什么本书选「读文章」这条线
  • §1 问答这件事的年龄 → 进来时以为:QA 是深度学习之后的新东西 → 出去时知道:1960s 就有,规则方法+数据太小死了半个世纪,2015 年靠「深度学习+大数据集」复活
  • §2 给问答系统分类的四把尺子 → 进来时以为: → 出去时知道:数据域(开放/封闭)、问题类型(七种:事实/是非/简单/复杂/因果/列举/不可答)、数据源(结构化/半结构化/无结构)、系统类型
  • §3 路线一:对着知识库查表 → 进来时以为:知识库问答=数据库查询的聊天版 → 出去时知道:知识图谱三元组;三部件=语义解析器+对话管理器+响应生成器;难在用户要懂 KB 结构才能组复杂查询,所以做成多轮
  • §4 路线二:对着文章读 → 进来时以为: → 出去时知道:CMRC=机器阅读理解+对话;找餐厅的例子:搜索引擎给多页列表 vs 问答机追问几句收敛到一个答案;这就是全书的地盘
  • §5 走查:同一段话,单轮机和对话机各怎么答 → 主走查:CoQA「斯塔滕岛」六问逐轮走,每轮暴露一种对话现象(it 指代/单词问题/是非题),单轮机在哪一轮先死

03 词变数 — 机器怎么「读懂」一个词

  • 这一章讲什么:嵌入的概念;从静态词向量到上下文化预训练模型;为什么 BERT 家族统治了这个时代
  • §1 先看现象:机器拿到的只有数 → 进来时以为:机器认识词 → 出去时知道:一切输入都要先变成向量;「意思」被做成「距离」
  • §2 静态词向量:一词一数串 → 进来时以为: → 出去时知道:GloVe/Word2Vec 让近义词向量相近;死穴=「苹果」在「吃苹果」和「苹果手机」里是同一个向量
  • §3 上下文化:同一个词,不同场合不同向量 → 进来时以为: → 出去时知道:CoVe→ELMo(多层加权);注意力/Transformer 的自注意力让它可并行;BERT 用双向掩码修补 GPT 的单向性;SpanBERT/ALBERT/RoBERTa/XLNet/Transformer-XL 各改一处
  • §4 走查:「它」这个字怎么被算成向量 → 主走查:拿「因为它太累了」里的「它」走一遍 BERT 编码:切片→嵌入→每层注意力看谁→逐层掺入上下文→输出向量(数字为演示编)
  • §5 工程现实:512 的墙 → 出去时知道:预训练模型输入有长度上限(512)和「只许两段」的格式——这堵墙就是后面三章所有「历史怎么塞」设计的直接原因

04 一台对话问答机的解剖 — 四个部件

  • 这一章讲什么:CMRC 的模块图;历史上各家怎么选历史/塞历史/推理/出答案;每家的死穴
  • §1 全景图 → 进来时以为: → 出去时知道:历史选择→编码器(+历史建模)→推理→输出预测,一条流水线;后两章的两个自研模型分别插在第一格和第二格
  • §2 部件一:历史怎么选 → 进来时以为:历史当然是越多越好 → 出去时知道:固定 K 轮、立即 2 轮 vs 5-6 轮(结论互相矛盾且轮数一多性能陡降)、动态选择(HAM 加权/Env-ConvQA 强化学习回溯)——「选哪些」是个真问题
  • §3 部件二:选出的历史怎么塞进输入 → 出去时知道:拼接(全部 QA 对/只问题+轮号)、HAE 标记(在文章里标出「这里刚说过」)+POS-HAE、流式隐表示三种路数
  • §4 部件三:推理的四代 → 进来时以为: → 出去时知道:传统注意力网络(DrQA+PGNet/BiDAF++/SDNet)→预训练模型(撞 512 墙的三种绕法)→流式(FlowQA/FlowDelta 信息增益/GraphFlow 图网络)→开放检索(OR-ConvQA 检索器+重排器+阅读器;WS-ORConvQA 弱监督)——第四代直接通往第 08 章
  • §5 部件四:怎么给答案 → 出去时知道:抽 span(算每个词是开头/结尾的概率)、自由生成、dialog act;QuAC 在段尾加 UNANSWERED token 让模型学会说「答不了」
  • §6 判断:综述读出的三个规律 → 出去时知道:①历史选择从静态走向动态 ②编码器从手拼走向预训练一体 ③「文章永远给定」这个假设正在松动——三条都是后三章的伏笔

05 出题与判卷 — 数据集与评测

  • 这一章讲什么:领域怎么出题(CoQA/QuAC/OR-QuAC/TopiOCQA 怎么造)、怎么判卷(F1/EM/HEQ/MRR/Recall)
  • §1 先看现象:分数高不等于会聊 → 进来时以为: → 出去时知道:这行的「题」是人标出来的对话,题的设定直接决定模型学到什么
  • §2 题从哪来:众包怎么造对话 → 出去时知道:AMT 双人配对(提问者/回答者);QuAC 的师生设定(学生只看标题)逼出真实的追问;ShARC 因不合定义被踢出
  • §3 走查:一段对话的诞生 → 主走查:模拟 QuAC 标注现场,学生拿「标题:某乐队」提问→老师从文中抽 span→dialog act 反馈;标完得到什么字段
  • §4 四个数据集对照 → 进来时以为:数据集都差不多 → 出去时知道:CoQA(自由格式+rationale,七域)/QuAC(抽 span+dialog act)/OR-QuAC(把 QuAC 接上 1100 万维基段)/TopiOCQA(对话中途换主题);每家的关键数字
  • §5 判卷的尺子 → 出去时知道:F1(词重叠)、EM(全对才算)、HEQ(追平人类的比例;HEQ-Q 按题 HEQ-D 按对话)、MRR/Recall(检索专用);每把尺子量的是什么、量不出什么
  • §6 这门手艺用在哪 → 出去时知道:三个落点(统一入口/对话式搜索/客服);以及 2019 年是论文峰值=预训练模型元年的巧合

06 补线索,别改写 — CONVSR(攻关一)

  • 这一章讲什么:问题不完整歧义的解法;改写(QR)路线为什么输给「结构化表示」路线
  • §1 先看现象:三个字的问题怎么答 → 进来时以为: → 出去时知道:FRIENDS 对话里「她当时痴迷什么?」——机器缺的不是语言能力,是「Monica Geller/FRIENDS」这两个实体线索
  • §2 流行解法:把问题改写成完整句 → 出去时知道:QR=GPT-2 在 CANARD(4 万对)上学改写;流水线公式;两宗罪——QA 模型永远见不到真实问题+误差沿流水线传播
  • §3 换个思路:不改问题,给线索 → 进来时以为:补全只能靠改写 → 出去时知道:CONVSR 生成两种实体——上下文实体 CE+问题实体 QE;有的问题两个都要(消解「她」),有的只要 CE(补「哪一季」);问题保持原样,对话性保住了
  • §4 走查:一句含糊追问怎么被 CONVSR 接住 → 主走查:FRIENDS Q2-Q4 逐轮:soft-cosine 相似度算分(阈值 0.75 剪历史)→BART 吐出 CE/QE→实体并进输入→抽 span;每步带具体字符串
  • §5 训练数据的鸡生蛋问题 → 出去时知道:没有「实体标注」数据集→远距监督:把完整问题里的实体挖出来当伪标签,「加上它能抽到答案就算对」
  • §6 证据与边界 → 出去时知道:三个基座模型全部提升(RoBERTa 66.1→67.9);改写的问题更长(9 词 vs 5.5)、专名更多、F1 反而低;边界=阈值 0.75 是试出来的、剪枝不准会拖垮下游(下一章正面解决)

07 先剪枝,再排序,还要划重点 — DHS-ConvQA(攻关二)

  • 这一章讲什么:历史选择的完整方案;「硬选择+软选择+词级标注」三层过滤
  • §1 先看现象:塞进 10 轮历史,分数反而掉 → 进来时以为: → 出去时知道:负样本实验——塞 11 个无关轮 F1 从 67.5 掉到 52.4;话题转移类问题最受伤;「相关性」是性能杠杆
  • §2 走查:「它是什么时候发行的?」怎么被接住 → 主走查:Jal 乐队 Q5:①BART 给每轮生成 CE/QE ②剪掉不共享实体的轮(硬)③单层前馈+softmax 给剩余轮打权重,最高的紧挨当前问题排(软)④词级二分类标出 1/0,1 就是缺失线索;补全成「乐队的第一张专辑是什么时候发行的?」
  • §3 硬和软为什么要组合 → 进来时以为:两种选法二选一 → 出去时知道:硬选择(剪枝)管「哪些轮进得来」,软选择(注意力)管「进来的怎么排」;消融:去掉剪枝掉最多(3.2),去掉重排掉最少(0.2)
  • §4 词级标注是干什么的 → 出去时知道:RoBERTa 顶层 linear+sigmoid+dropout,给每个子词打 0/1;标 1 的词=给含糊问题的「这里」提示
  • §5 证据与边界 → 出去时知道:对四个对手全部占优(含上一章 CONVSR 66.1→67.5);但流水线误差传播仍在——剪枝准确率 100%→50% 时最终答案 90%→65%;输入变小还省算力

08 文章不给了,先检索再回答 — DPR-ConvQA(攻关三)

  • 这一章讲什么:把 ConvQA 搬进开放域;稠密检索+对比学习;检索器决定天花板
  • §1 先看现象:真实用户不会替你翻好文章 → 进来时以为: → 出去时知道:OD-ConvQA=先从上百万段里检索,再抽答案;两段式,检索错了阅读器再强也白搭
  • §2 检索的两代:关键词 vs 向量 → 出去时知道:DrQA 用 TF-IDF(词面重合)在 OR-QuAC 上 F1 只有 6.3;稠密检索 DPR=双编码器把问题和段映进同一向量空间,点积当相似度;词面不重合也能配上
  • §3 走查:「他有没有歌进过电影?」怎么找到答案 → 主走查:Gene Clark 对话 Q4:剪历史→精选上下文+问题编码→与 1100 万段点积→top-k 段进阅读器→每段算 start/end→检索分×阅读分定答案「The Farmer」;对手 ConvADR-QA 答「American Dreamer」错在哪一步
  • §4 对比学习:让相关的段靠得更近 → 进来时以为: → 出去时知道:正样本(含答案段)拉近、负样本推远;负对数似然损失;in-batch negatives——一批 16 题互相当负样本,每题白得 15 个负样本
  • §5 证据与边界 → 出去时知道:两套数据集全面领先(OR-QuAC F1 39.9/Recall 80.1);TopiOCQA 全面掉分——话题切换是软肋;轮数越长分越低;消融证明优势来自检索器(阅读器与对手相同)
  • §6 这章在今天的位置 → 出去时知道:retriever-reader 就是今天 RAG 的骨架(补充②锚:ragas/dsrag);差别只在「阅读器」从 BERT 换成了 LLM

09 终点与欠账 — 结论与六个未来方向

  • 这一章讲什么:三章模型合起来的答案;作者自己承认没解决的六件事;哪六件今天仍未关账
  • §1 三个模型是一条链 → 进来时以为:三个独立系统 → 出去时知道:补线索→选历史→进检索,同一个实体+相关性思想的三次升级;每章解决上一章的遗留
  • §2 作者自己列的欠账 → 出去时知道:六条——上下文动态/误差传播/用户意图/澄清问题/推理缺失/常识推理;CMRC 上常识推理「没有成功尝试」是作者原话
  • §3 走查:「七个人」为什么答不出来 → 主走查:「机上五人+地面两人死亡」问「死了多少人」——语义相关查不出加法;这一步暴露抽取式范式的天花板
  • §4 六条欠账的今天 → 出去时知道:LLM 时代哪些被部分兑现(生成式检索/意图识别在对话产品里常见)、哪些还欠着(可解释答案来源/常识);LLM 在本书只出现一次(未来方向引文),今天已是主角——书名与内容的错位在此收口
  • §5 可带走的方法论 → 出去时知道:负样本实验法(证明相关性值几分)、消融归因法(优势来自哪个模块)、远距监督造数据法——三个可复用的实验手艺

自查记录

  • 「进来时以为→出去时知道」两头同件的节:无。§06-3 与 §07-1 都讲「相关性」但一头是实体线索一头是噪声代价,不同事。
  • 新词密度:02 章分类学七种问题类型做成表格不逐个展开;03 章只讲 embedding/注意力/BERT 三个承重词;04 章四部件各占一节,不互相引用未讲过的词。
  • 每章主走查:02§5(CoQA 六问)、03§4(「它」的向量)、05§3(标注现场)、06§4(FRIENDS Q2-Q4)、07§2(Jal Q5)、08§3(Gene Clark Q4)、09§3(七人加法)。01/04 章以结构/地图为主,走查落在具体对话与模块图上(01§1 三段对话、04§1 流水线图)。