跳到主要内容

终点与欠账 — 结论与六个未来方向

这一章讲三件事: 三个模型合起来是一句什么话;作者自己承认没解决的六件事;六件事在 LLM 时代的下落。 读完这章,「读完就不必看原书」的最后一块拼图——作者自己的诚实清单——就齐了。

1. 三个模型是一条链

这一节先收拢:第 06–08 章不是三个独立作品,是一根链。

原书结尾把三章串回一条线:第 3 章补线索(CONVSR,把含糊追问接住)→ 第 4 章选历史(DHS-ConvQA,把噪声挡在外面)→ 第 5 章进检索(DPR-ConvQA,把文章这个前提也扔掉)1。每章都在解决上一章的遗留:第 4 章开头明说「针对第 3 章暴露的无关上下文问题」,第 5 章开头明说「把任务推向真实世界」2。贯穿三节的同一个思想是:给模型的上下文,宁缺勿滥。 这句也是全书最值得带走的一句——它比任何具体模型的分数活得都长。

还有一个藏在总结里的务实理由值得点出:精选历史除了提分,还让输入变小——输入越小,计算开销越低3。提分和省钱同向,这在工程上是最结实的组合。

2. 作者自己列的六条欠账

这一节照录作者结尾坦白的六个开放问题。一份诚实的欠账清单,往往比结论更值钱。

#欠账作者的原话要点
1上下文动态现实对话带个人/社交/任务上下文,怎么收集整合?知识图谱够不够表示?整段上下文还是相关片段?4
2误差传播retriever-reader 流水线天然级联;两条出路:让 LLM 先「生成」候选段落再检索(变相跳过检索失败)、或短语检索砍掉阅读器环节5
3用户意图识别除了对话上下文,意图是独立的信号源;学界已点名需要(WSDM'18、SIGIR'17);识别准了能带来定制推荐与更好的客服6
4澄清问题设计「系统该怎么反问」缺真实数据,现有方法靠人工数据训练,难落地;有人用零样本(不喂训练例子直接上场)+问题模板做冷启动7
5推理缺失模型按「语义相关」找答案,不会推——下节专讲那个扎心例子;CoQA 是唯一带推理依据的数据集,EXPLAIGNN 在尝试给解释8
6常识推理常识=用日常世界知识做推断;CMRC 上「没有成功尝试」是作者原话;数据集不含常识是根因;BlenderBot3(基于 OPT)是个例外苗头9

六条的公共结构值得看穿:1、3、4 是「上下文/信号还不够丰富」,2 是「流水线还在漏水」,5、6 是「模型只会比对、不会想」。 前四条是工程问题,后两条是范式问题——分水岭恰好在 LLM 上。

3. 走查:「七个人」为什么答不出来

主走查。 作者为「推理缺失」举的例子很小,但一步见血10:

文章:「机上五人与地面两人死亡。」
问题:「一共死了多少人?」
标准答案:7

语义相关检索是怎么失败的:
① 问题里的词「一共」「多少人」在文章里找不到重合词
→ 词面/语义相关度都不高,这段文章未必排进候选
② 就算文章进了候选,答案「7」也不是文章里的一个词
→ 抽 span 式阅读器无处可抽(第 04 章的「开头/结尾」概率
在「五」「两」上都打不出高点)
③ 要答对,必须执行一次文章里没有的运算:5 + 2 = 7
——这个运算只存在于读者的脑子里,不存在于文本中

图说:抽取式范式的边界在此现形——它能找到「文中写了什么」,
算不出「文中没写、但能推出来」的东西。

这个例子同时宣判了两件事:抽取式阅读器的天花板,以及**「答案必须是文中片段」这条考卷规矩的代价**(第 05 章的考卷全是抽取式)。LLM 时代「答案不必在原文里」之所以成为默认,根子就在这里。

4. 六条欠账的今天

这一节结清全书最大的悬案:书名里的「LLM」到底在哪——以及六条欠账两年后的下落。

先把悬案挑明:LLM 在正文里只出场一次——第 6 章的未来方向里,作为「先生成候选段落再检索」的材料被引了一句11。三个自研模型的心脏全是 BERT/RoBERTa/BART(第 03 章的谱系)。这不是作者失职,是成书时间使然:三项研究完成于 2022–2024,那是「小模型+精心设计」的最后黄金期。书名是 2026 年出版时起的名字,内容是 2022–2024 年做的题——错位在这里闭环。

六条欠账两年后的下落,按我们的书架与现实核对:

欠账今天
误差传播部分兑现:作者引的「先生成再检索」已成真实路线;RAG 把阅读器换成 LLM 后,阅读环节不再「只会抽」(第 08 章 §6)
推理缺失大幅改写:LLM 会先把中间步骤写出来再答(这套做法叫思维链),「5+2=7」式的题不再是绝对禁区——但「答案要有据可查」反而成了新难题(忠实度评测,如我们书架的 Ragas)

| 常识推理 | 大幅改写:LLM 预训练语料里泡着常识,不再需要专门数据集;代价是常识开始「编造」 | | 用户意图/澄清问题 | 存活且常见:对话产品里的意图识别与反问已是标配;问题改写也活着——我们那个专收协议(机器之间约定怎么互相对话的规范)的书架里的 NLWeb,流水线上就有一个「去上下文化」步骤,专门把「那再便宜点的呢」补全成完整问题12——有意思的是,它走的正是 CONVSR 反对的「改写」路线,只是改写者从 GPT-2 换成了 LLM | | 上下文动态 | 变形升级:窗口大了,「整段还是片段」从建模问题变成成本问题(第 07 章的噪声价目表照样生效) |

判断(我们的,不是书里的): 这本书的「未来方向」一节,是全书时效性最高也最低的一节——具体路线图过时了(LLM 已把其中三条直接改写),但问题清单本身全部存活:六个问题在 LLM 时代一个都没消失,只是换了姿态。读它的正确姿势是:把问题当地图,把路线当史料。 如果错,会错在: 如果其中某条(如澄清问题设计)在某个评测体系里已被证明是伪问题,那「全部存活」就言过其实——但从今天对话系统的实践看,六个问题都有活跃的对应工种,暂无一条被证伪(被证明是假问题)。

5. 可带走的方法论

这一章没有新机制,但有三件可以搬去自己项目里用的实验手艺,散见前三章、由本章收拢:

  1. 负样本实验法(第 07 章):想知道「某个输入成分值几分」,别只做加法——故意掺语义相近的垃圾进去,量它掉几分。掉得越狠,说明这个成分越值得投入;
  2. 消融归因法(第 07、08 章):系统提了分,把模块逐个拆掉重跑,找到真正立功的那个(第 08 章「优势来自检索器」就是靠阅读器同款对照坐实的)。归因错了,下一轮改进就押错宝;
  3. 远距监督造数据法(第 06 章):没有标注时,把「结果是否成立」当免费标注员(「加上这个实体能抽到答案,它就是对」),以噪换量启动训练;
  4. 外加一条读书心得:看到「未来方向」别跳过——作者承认不会的东西,往往正是这个领域此刻的工种清单

6. 原文地图

主题原书章原文位置
领域仍在初创期、全书动机收拢Ch6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:6(搜「inception phase」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:17(搜「iterative and engaging features」)
三章总结与「输入小=开销低」Ch6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:53(搜「Chapter 4 is an effort」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:60(搜「computational overhead」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:73(搜「Chapter 5 is an attempt」)
方向一:上下文动态Ch6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:93(搜「Contextual Dynamics」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:98(搜「sufficient enough」)
方向二:误差传播、LLM 生成段落、短语检索Ch6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:109(搜「Mitigating Error Propagation」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:117(搜「first generate the passages」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:119(搜「phrase retrieval」)
方向三/四:用户意图、澄清问题Ch6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:123(搜「User Intent Identification」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:145(搜「clarification questions」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:156(搜「cold-start」)
方向五:「七个人」例子、CoQA rationale、EXPLAIGNNCh6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:166(搜「provided the context」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:163(搜「semantic relevance」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:173(搜「only ConvQA dataset」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:177(搜「EXPLAIGNN」)
方向六:常识推理、BlenderBot3/OPT、ConceptNet/ATOMICCh6text/19-ch06-chapter-6-conclusion-and-future-directions.txt:186(搜「inferences by using or assuming」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:197(搜「no successful attempt」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:200(搜「BlenderBot3」) · text/19-ch06-chapter-6-conclusion-and-future-directions.txt:208(搜「ConceptNet」)

Footnotes

  1. 出处:「CHAPTER 6: Conclusion and Future Directions」第 41 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:41,搜「Chapter 3 presents our attempt」)。三章的收拢性总结在第 39–86 段。

  2. 出处:「CHAPTER 6: Conclusion and Future Directions」第 53 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:53,搜「Chapter 4 is an effort」)与第 73 段(搜「Chapter 5 is an attempt」)。原文:第 4 章「解决第 3 章发现的无关上下文问题」;第 5 章「把 ConvQA 扩展到开放域的更真实设定」。

  3. 出处:「CHAPTER 6: Conclusion and Future Directions」第 60 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:60,搜「computational overhead」)。原文:输入越小,计算开销越低。

  4. 出处:「CHAPTER 6: Conclusion and Future Directions」第 93–101 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:93,搜「Contextual Dynamics」)。个人/社交/任务上下文在第 95 段(搜「personal context」);「知识图谱够不够」「整段还是片段」两问在第 98–101 段。

  5. 出处:「CHAPTER 6: Conclusion and Future Directions」第 109–121 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:109,搜「Mitigating Error Propagation」)。LLM 先生成段落的路线在第 116 段(搜「first generate the passages」);短语检索在第 119 段(搜「phrase retrieval」)。

  6. 出处:「CHAPTER 6: Conclusion and Future Directions」第 123–138 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:123,搜「User Intent Identification」)。WSDM'18/SIGIR'17 的呼吁在第 126 段(搜「user intent analysis」)。

  7. 出处:「CHAPTER 6: Conclusion and Future Directions」第 140–158 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:140,搜「Information-Seeking Behaviors」)。缺真实数据、靠人工数据训练的坦白在第 150–153 段;零样本冷启动在第 156 段(搜「cold-start」)。

  8. 出处:「CHAPTER 6: Conclusion and Future Directions」第 160–178 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:160,搜「Enhancing Inference」)。「按语义相关找答案限制了推理」在第 163 段;CoQA 唯一带推理依据在第 173 段(搜「only ConvQA dataset」);EXPLAIGNN 在第 177 段。

  9. 出处:「CHAPTER 6: Conclusion and Future Directions」第 181–212 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:181,搜「Commonsense Reasoning」)。常识的定义在第 183 段;「CMRC 上无成功尝试」在第 197 段(搜「no successful attempt」);BlenderBot3/OPT 在第 200–204 段;ConceptNet/ATOMIC/CoMET 在第 206–209 段。

  10. 出处:「CHAPTER 6: Conclusion and Future Directions」第 165–170 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:166,搜「provided the context」)。原文(引 Liu et al.):给定「机上五人与地面两人死亡」的上下文,系统无法答出「七」。

  11. 出处:「CHAPTER 6: Conclusion and Future Directions」第 117 段(text/19-ch06-chapter-6-conclusion-and-future-directions.txt:117,搜「LLMs」)。这是 LLM 在全书正文中的唯一实质出场(第 6 章方向二引 Yu et al. 2023 的 Generate-then-Retrieve)。

  12. 补充(不在书里,依据我们的 protocol 书架):问题改写在当代系统中的存续。依据: shelf=ai-protocol-reference/nlweb#index.md 事实=NLWeb 的文档写明其支持多轮对话,把「那再便宜点的呢」自动补全成完整问题(去上下文化/decontextualization),即本书第 3 章「问题改写」的当代形态。