对话式问答全书拆解
30 秒导读: 让机器答一个独立的问题,2015 年前后就基本做成了;让机器接着你的追问继续答——「它」「那里」「什么时候」——才是真正的难关。这本书把这道难关拆成三层递进的问题,各交一个方案。
它真正的价值不在那三个方案(技术已被 LLM——大型语言模型——的时代冲刷),而在贯穿全书的那个思想:
全书反复出现两个词。模型:那台被数据调教出来、负责答话的机器。
上下文:每次喂给它的全部文字——问题、历史、资料。全书的主张一句话:
喂给模型的上下文,宁缺勿 滥。 这个思想到今天只增不减。
1. 这是谁在什么时候写的
| 作者 | 四位澳大利亚计算机学者:Munazza Zaib(麦考瑞大学博士、本书出版时在莫纳什大学做博士后)、Quan Z. Sheng(麦考瑞大学计算机学院院长)、Wei Emma Zhang(阿德莱德大学高级讲师)、Adnan Mahmood(麦考瑞大学讲师) |
| 写作时间 | 书里三项研究完成于 2022–2024 年;2026 年由 CRC Press 出第一版(191 页,作者自排版直接印行) |
| 成书方式 | 学术专著,不是科普:Zaib 的博士课题为主线,第 2 章扩写自已发表的综述论文,第 3–5 章各是一篇会议论文的扩写,其中第 5 章的工作成书时还在期刊审稿中 |
| 时代坐标 | 落在「LLM 到来前夜」:考卷是 2018–2022 年造的,模型全是 BERT(第 03 章专门讲它是什么)那一带的技术;书名里的 LLM 在正文里只出场一次(未来展望的一句引文) |
| 利益相关 | 学者团队,没有产品要推销;但综述的裁剪权与实验的主角都来自作者自己的工作——地图是画地图的人自己走过的路,读的时候记得这一点 |
2. 全书一条主线(读完这一节,你就懂了这本书)
这条链每一步都被上一步逼出来。不看任何拆解章,只读这一节,你也能把这本书讲给别人听。
① 一问一答做成了,追问做不成
给机器一篇文章加一个问题,让它从文章里抽出一段话当答案——这件事 2015 年后基本做成。可真实的对话不长这样:第二问往往是「那里还讲什么语言?」「它是什么时候发行的?」。这些问题单独拎出来是病句——「那里」是哪里?「它」是什么?人秒懂,因为人共享着前文;机器不行。
② 所以历史必须一起读——但历史不能全塞
补法看起来很自然:把之前的问答对全喂进去。作者的实验给了当头一棒:往模型输入里掺 11 个意思相近的无关问题,分数从 67.5 掉到 52.4——大约每两个无关轮次掉 3 分。无关历史不是「没用」,是「有害」。于是全书的中心主张立起来了:
喂给模型的上下文,宁缺勿滥。 「选哪些」本身就是一道研究题——后面三个方案,全是这道题的解法。
③ 但「一起读」有个前提:机器得先把字变成数
机器电路里只有数。所以「把历史一起读」落到实处,是「把每个词变成一串数,并且让意思近的词、数也相近」——意思变成了距离,机器才有得算。这一代技术里真正管用的引擎是注意力:让每个词看遍全句、按相关程度吸收别人的信息。先在海量文本上泛读、再针对任务专攻的那一代模型(代表作 BERT)因此统治了全书。但它们有一个硬约束:输入总共只有 512 个位置——历史、问题、文章挤一个门,这正是「宁缺勿滥」从好话变成硬需求的物理原因。(词怎么变数,第 03 章讲。)
④ 第一关:问题不完整——不改问题,给线索
流行做法是把「她当时痴迷什么?」改写成完整句。作者的反方案:问题一个字不动,单独补两样线索——「对话在聊哪部剧」和「之前问题里的关键人物」。有的追问两样都要(消解「她」),有的一样就够(补上「哪一季」)。实测:问题保持原样(5.5 个词)比改写(9 个词)分数更高、专名负担更小。(第 06 章讲。)