终点与欠账 — 结论与六个未来方向
这一章讲三件事: 三个模型合起来是一句什么话;作者自己承认没解决的六件事;六件事在 LLM 时代的下落。 读完这章,「读完就不必看原书」的最后一块拼图——作者自己的诚实清单——就齐了。
1. 三个模型是一条链
这一节先收拢:第 06–08 章不是三个独立作品, 是一根链。
原书结尾把三章串回一条线:第 3 章补线索(CONVSR,把含糊追问接住)→ 第 4 章选历史(DHS-ConvQA,把噪声挡在外面)→ 第 5 章进检索(DPR-ConvQA,把文章这个前提也扔掉)1。每章都在解决上一章的遗留:第 4 章开头明说「针对第 3 章暴露的无关上下文问题」,第 5 章开头明说「把任务推向真实世界」2。贯穿三节的同一个思想是:给模型的上下文,宁缺勿滥。 这句也是全书最值得带走的一句——它比任何具体模型的分数活得都长。
还有一个藏在总结里的务实理由值得点出:精选历史除了提分,还让输入变小——输入越小,计算开销越低3。提分和省钱同向,这在工程上是最结实的组合。
2. 作者自己列的六条欠账
这一节照录作者结尾坦白的六个开放问题。一份诚实的欠账清单,往往比结论更值钱。
| # | 欠账 | 作者的原话要点 |
|---|---|---|
| 1 | 上下文动态 | 现实对话带个人/社交/任务上下文,怎么收集整合?知识图谱够不够表示? 整段上下文还是相关片段?4 |
| 2 | 误差传播 | retriever-reader 流水线天然级联;两条出路:让 LLM 先「生成」候选段落再检索(变相跳过检索失败)、或短语检索砍掉阅读器环节5 |
| 3 | 用户意图识别 | 除了对话上下文,意图是独立的信号源;学界已点名需要(WSDM'18、SIGIR'17);识别准了能带来定制推荐与更好的客服6 |
| 4 | 澄清问题设计 | 「系统该怎么反问」缺真实数据,现有方法靠人工数据训练,难落地;有人用零样本(不喂训练例子直接上场)+问题模板做冷启动7 |
| 5 | 推理缺失 | 模型按「语义相关」找答案,不会推——下节专讲那个扎心例子;CoQA 是唯一带推理依据的数据集,EXPLAIGNN 在尝试给解释8 |
| 6 | 常识推理 | 常识=用日常世界知识做推断;CMRC 上「没有成功尝试」是作者原话;数据集不含常识是根因;BlenderBot3(基于 OPT)是个例外苗头9 |
六条的公共结构值得看穿:1、3、4 是「上下文/信号还不够丰富」,2 是「流水线还在漏水」,5、6 是「模型只会比对、不会想」。 前四条是工程问题,后两条是范式问题——分水岭恰好在 LLM 上。
3. 走查:「七个人」为什么答不出来
主走查。 作者为「推理缺失」举的例子很小,但一步见血10:
文章:「机上五人与地面两人死亡。」
问题:「一共死了多少人?」
标准答案:7
语义相关检索是怎么失败的:
① 问题里的词「一共」「多少人」在文章里找不到重合词
→ 词面/语义相关度都不高,这段文章未必排进候选
② 就算文章进了候选,答案「7」也不是文章里的一个词
→ 抽 span 式阅读器无处可抽(第 04 章的「开头/结尾」概率
在「五」「两」上都打不出高点)
③ 要答对,必须执行一次文章里没有的运算:5 + 2 = 7
——这个运算只存在于读者的脑子里,不存在于文本中
图说:抽取式范式的边界在此现形——它能找到「文中写了什么」,
算不出「文中没写、但能推出来」的东西。
这个例子同时宣判了两件事:抽取式阅读器的天花板,以及**「答案必须是文中片段」这条考卷规矩的代价**(第 05 章的考卷全是抽取式)。LLM 时代「答案不必在原文里」之所以成为默认,根子就在这里。
4. 六条欠账的今天
这一节结清全书最大的悬案:书名里的「LLM」到底在哪——以及六条欠账两年后的下落。
先把悬案挑明:LLM 在正文里只出场一次——第 6 章的未来方向里,作为「先生成候选段落再检索」的材料被引了一句11。三个自研模型的心脏全是 BERT/RoBERTa/BART(第 03 章的谱系)。这不是作者失职,是成书时间使然:三项研究完成于 2022–2024,那是「小模型+精心设计」的最后黄金期。书名是 2026 年出版时起的名字,内容是 2022–2024 年做的题——错位在这里闭环。
六条欠账两年后的下落,按我们的书架与现实核对:
| 欠账 | 今天 |
|---|---|
| 误差传播 | 部分兑现:作者引的「先生成再检索」已成真实路线;RAG 把阅读器换成 LLM 后,阅读环节不再「只会抽」(第 08 章 §6) |
| 推理缺失 | 大幅改写:LLM 会先把中间步骤写出来再答(这套做法叫思维链),「5+2=7」式的题不再是绝对禁区——但「答案要有据可查」反而成了新难题(忠实度评测,如我们书架的 Ragas) |
| 常识推理 | 大幅改写:LLM 预训练语料里泡着常识,不再需要专门数据集;代价是常识开始「编造」 | | 用户意图/澄清问题 | 存活且常见:对话产品里的意图识别与反问已是标配;问题改写也活着——我们那个专收协议(机器之间约定怎么互相对话的规范)的书架里的 NLWeb,流水线上就有一个「去上下文化」步骤,专门把「那再便宜点的呢」补全成完整问题12——有意思的是,它走的正是 CONVSR 反对的「改写」路线,只是改写者从 GPT-2 换成了 LLM | | 上下文动态 | 变形升级:窗口大了,「整段还是片段」从建模问题变成成本问题(第 07 章的噪声价目表照样生效) |
判断(我们的,不是书里的): 这本书的「未来方向」一节,是全书时效性最高也最低的一节——具体路线图过时了(LLM 已把其中三条直接改写),但问题清单本身全部存活:六个问题在 LLM 时代一个都没消失,只是换了姿态。读它的正确姿势是:把问题当地图,把路线当史料。 如果错,会错在: 如果其中某条(如澄清问题设计)在某个评测体系里已被证明是伪问题,那「全部存活」就言过其实——但从今天对话系统的实践看,六个问题都有活跃的对应工种,暂无一条被证伪(被证明是假问题)。
5. 可带走的方法论
这一章没有新机制,但有三件可以搬去自己项目里用的实验手艺,散见前三章、由本章收拢:
- 负样本实验法(第 07 章):想知道「某个输入成分值几分」,别只做加法——故意掺语义相近的垃圾进去,量它掉几分。掉得越狠,说明这个成分越值得投入;
- 消融归因法(第 07、08 章):系统提了分,把模块逐个拆掉重跑,找到真正立功的那个(第 08 章「优势来自检索器」就是靠阅读器同款对照坐实的)。归因错了,下一轮改进就押错宝;
- 远距监督造数据法(第 06 章):没有标注时,把「结果是否成立」当免费标注员(「加上这个实体能抽到答案,它就是对」),以噪换量启动训练;
- 外加一条读书心得:看到「未来方向」别跳过——作者承认不会的东西,往往正是这个领域此刻的工种清单。
6. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 领域仍在初创期、全书动机收拢 | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:6(搜「inception phase」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:17(搜「iterative and engaging features」) |
| 三章总结与「输入小=开销低」 | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:53(搜「Chapter 4 is an effort」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:60(搜「computational overhead」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:73(搜「Chapter 5 is an attempt」) |
| 方向一:上下文动态 | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:93(搜「Contextual Dynamics」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:98(搜「sufficient enough」) |
| 方向二:误差传播、LLM 生成段落、短语检索 | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:109(搜「Mitigating Error Propagation」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:117(搜「first generate the passages」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:119(搜「phrase retrieval」) |
| 方向三/四:用户意图、澄清问题 | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:123(搜「User Intent Identification」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:145(搜「clarification questions」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:156(搜「cold-start」) |
| 方向五:「七个人」例子、CoQA rationale、EXPLAIGNN | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:166(搜「provided the context」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:163(搜「semantic relevance」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:173(搜「only ConvQA dataset」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:177(搜「EXPLAIGNN」) |
| 方向六:常识推理、BlenderBot3/OPT、ConceptNet/ATOMIC | Ch6 | text/19-ch06-chapter-6-conclusion-and-future-directions.txt:186(搜「inferences by using or assuming」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:197(搜「no successful attempt」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:200(搜「BlenderBot3」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:208(搜「ConceptNet」) |