跳到主要内容

三条替代路线为什么都不够 — 与 RAG 的五大收益

这一章讲三件事: 既然大模型的上下文窗口(模型一次能看到的文字总量)已经大到能塞下几百页, 为什么不直接全文塞进去?既然可以拿公司数据继续训练模型,为什么还要外挂一个检索库? 以及 RAG 换来的收益到底有几条、各自凭什么成立。 读完你会有一张「该不该上 RAG」的判断表,和一张七大用例的版图。

1. 顶层全景:三条岔路,一张判断表

第 01 章确定了:模型不知道你的私有数据,而「重新训练一个什么都知道的模型」不可行。 但在这个结论和 RAG 之间,还有三条看似更省事的岔路。这一章把它们逐一走到底:

想让模型回答私有数据的问题

├─ 路线一:把文档全文塞进超长上下文窗口 ── 第 2 节,撞在成本/延迟上
├─ 路线二:拿私有数据继续训练(微调) ──── 第 3 节,撞在权限/时效上
├─ 路线三:RAG ──────────────────── 第 4 节,换来五条收益

└─ 一个推理链:正因为撞墙的位置各不相同,这些路线最后是「分工」,不是「替代」

图说:本章的主走查是同一个需求——「让模型回答公司退款政策」——
分别走三条路,看每一条路在哪一步走不下去。

2. 核心原理(一):「全文塞进去」撞在哪

现象:窗口确实已经很大了

写作本书时,前沿模型的上下文窗口(一次能看的文字总量)已经到 256K 甚至 100 万词元 ——100 万词元大约相当于一整套七卷本《哈利·波特》1。 于是一类叫「chat with PDF」的应用直接说:别检索了,把整份文档放进 prompt 不就行了2

主走查路线一:把 40 页退款手册整个塞进去

拿同一个退款问题走这条路(以下数字按书里给的换算规则算的):

① 40 页政策手册 → 约 40 × 800 = 32,000 词元(书里规则:一页约 600 词,
一词约 1.3 词元,所以一页 ≈ 800 词元)
② 每次问答,这 32,000 词元全部作为输入发给模型
③ 模型在 32,000 词元里「找」答案再生成

图说:词元是模型计费与计时的基本单位——输入的每个词元都要算钱、都要花时间。

问题出在第 ② 步,书里点了三处3:

  • 成本:为了一句「30 天无理由退款」,你每次都在为其余 31,900 个无关词元付费。 问答量一大,这是白烧的钱;
  • 延迟:模型处理输入的时间随输入变长而显著增长(第 03 章会给出具体毫秒数), 用户为每个问题多等几秒;
  • 最致命的一条:文档选择本身。 真实场景里公司不是有一份文档,而是有几万份。 「塞全文」的前提是你已经知道答案在哪份文档里——可「挑出哪几份文档相关」这件事, 恰恰就是检索。绕了一圈,又回到了检索4

所以超长上下文没有消灭检索,它只是把「检索完之后塞多少」这个上限抬高了。 第 16 章会回到这个话题:长上下文与 RAG 是合作,不是竞争。

3. 核心原理(二):微调撞在哪

微调是什么

微调(fine-tuning):拿一个已经训练好的通用模型,用你的私有数据继续训练, 把内部参数再调一轮,让它「学会」你所在领域的知识与口吻5。 它确实能教模型新东西——书里不否认这一点,它否认的是「用它装知识」。

主走查路线二:把退款政策微调进模型

① 把政策文档整理成训练数据,跑一轮微调(几小时到几天,要花 GPU 费用)
② 上线,答得不错
③ 下周政策改了 → 模型里的还是旧版 → 再微调一轮?
④ 财务部的政策文档和 HR 的混在同一批参数里 → HR 的用户也能问出财务的内容

图说:微调在第 ③④ 步撞墙——时效与权限,两者都是结构问题,不是多加数据能解决的。

书里给的失败清单,逐条看6:

  • 专精的代价:继续训练容易过拟合——模型对训练数据学得太死, 连带把原本的通用能力弄退化,还可能把数据里的偏见放大;
  • 干扰已有调教:今天的模型出厂前都经过指令跟随与人类偏好的后训练(出厂前的追加调教轮次)调教, 你再动它的参数,可能把这部分调教冲掉;
  • 数据的胃口:微调要够大、够干净的数据集,而多数公司的私有文档恰恰又少又脏;
  • 成本与节奏:书里一句话问死这条路——「数据天天变,你天天微调吗?7;
  • 权限,最重的一条:微调把数据融进参数,而参数是一整个不可分割的整体。 你没法说「这部分参数只有财务部能用」。作者拿《星际迷航》里把一切同化进集体的 博格人打比方,称这是「Borg effect」——一旦吸收,再也分不开8

而 RAG 的权限解法轻巧得多:摄入时给每个文档挂上「哪个部门能看」的元数据 (附加在文本上的说明信息),查询时按提问者的权限先过滤再检索 ——权限问题被挪到了数据层,不动模型一根参数9

元数据最常见的形态是标注——给这段文字贴的说明标签,如部门、密级。

但微调不是废物

书里的收尾很公道:微调过的模型照样可以放进 RAG 的生成环节。 微调管「怎么说话、懂不懂行话」,RAG 管「知道什么事实」。两者是分工10

4. 核心原理(三):RAG 换来的五条收益

书里列的收益常被引用,但多数是当口号引的。这里逐条给成立的理由11:

收益凭什么成立
可扩展「搜索」是被研究了几十年、有成熟工业方案的问题;而模型自己读全文时,内部注意力(模型内部「每个词回头看前文哪些词」的机制)的开销随文本长度平方级增长。检索把「资料多少」的压力从模型身上卸给了搜索引擎12
减少幻觉有事实可依照着写;没事实时,配上「不知道就说不知道」的指令,它有了一个裸模型几乎不会选的选项13
可解释答案可以带编号引用([12][47]),出错了能区分「模型编造的」和「检索回来的本来就是坏数据」——裸模型的回答无法溯源14
知识即插即删知识在模型外部的数据库里,更新它就是一次普通的数据库操作;改政策不用碰模型。想让微调模型「忘掉」某件事,属于一个还在研究阶段的难题(machine unlearning,机器遗忘)15
访问控制见第 3 节:权限元数据在查询期过滤,不动模型16

把这五条连起来读,会看到一个共同结构:RAG 把「知识」从模型身体里搬了出来, 放进一个普通的、可增删、可设权限、可审计的数据库里。 后面所有收益,都是「知识变成了普通数据」的推论。

5. 作者的判断与证据:用例版图与进阶方向

七大用例

书里第 1 章花了近三分之一的篇幅走了一遍用例版图。它不是清单堆砌, 每个用例都带一个「RAG 在里面扮演什么角色」的说明17:

用例RAG 的角色
客服与助手接内部知识库、FAQ、历史工单;航空公司一例里,对内辅助客服、对外直接服务乘客是两套机器人18
教育辅导接教材后,同一个系统能切换两种模式:tutor(你问它答)与 examiner(它出题并改卷)19
企业知识管理数据源持续刷新,系统跟上组织变化20
内容创作与摘要检索素材再成文
个性化广告书里最出挑的例子:同一款鞋,对刚聊过脚臭的用户突出「抑菌防臭」,对刚聊过安全的用户突出「反光条」——广告词按检索到的上下文即时生成21
问答与投标(RFP)从过往方案里检索可复用段落
医疗与法务医疗例强调合规(HIPAA)与人工复核,摘要按科室定制22

三个进阶方向(本书后半的预告)

  • agentic RAG:检索不再是管线开头的一次性动作,而是变成一个工具, 由模型在多轮推理里反复调用、分解复杂问题——第 12 章;
  • 多模态 RAG:文档里不止文字,还有表格、图、音视频——第 14 章;
  • 知识图谱:回答需要「把多个事实连起来」的问题(multi-hop reasoning, 多跳推理:先找到 A 关联 B,再从 B 关联到 C)——第 15 章,包括微软推广的 GraphRAG 方案23

作者还补了一个历史坐标:RAG 这个词来自 Meta(Facebook)2020 年的一篇 NeurIPS 论文, 当时的形态是给模型做微调,而不是今天的「往 prompt 里塞检索结果」24

6. 边界与局限

  • 五条收益都有条件。「减少幻觉」的前提是检索真的找对了;「可解释」的前提是 引用真的指向了答案的来源——第 11 章会专门教怎么验证这两件事,它们都不是免费的。
  • 长上下文那条墙正在变矮。 写作时的窗口是 256K-1M 词元,之后还在涨; 但「文档选择」那条论证不依赖窗口大小,依然成立。
  • 微调的对比写于 2026 年。 小模型微调的成本一直在降;书里「数据天天变, 你天天微调吗」这条时效论证依然成立,但「权限不可分割」若有架构创新(如可拆卸的 参数模块)可能需要重估——目前这只是可能性,书里与我们都没有证据。
  • 用例一节是行业宣传的重灾区。 作者本人经营 RAG 平台公司,广告、客服这些用例 同时是他的潜在客户场景;用例方向可信,转化率之类的隐含承诺没有数据支撑。

7. 可带走的

  1. 长上下文 ≠ 不用检索:塞全文为无关内容付费,而且「挑哪份文档」本身就是检索;
  2. 微调管「怎么说话」,RAG 管「知道什么」——两者分工,不是替代;
  3. 微调的死穴是权限与时效:参数不可分割(Borg effect),数据一变就要重训;
  4. RAG 的五条收益共享一个结构:知识从参数搬到了数据库,于是可增删、可设权限、可溯源;
  5. 判断路线先看撞墙点:成本/延迟(长上下文)、权限/时效(微调)、工程质量(RAG);
  6. 进阶三方向:agentic(检索变工具)、多模态(不止文字)、知识图谱(把事实连起来);
  7. RAG 一词源自 2020 年 Meta 的论文,但那时是微调形态——今天的 RAG 是另一代东西。

8. 原文地图

主题原书章原文位置
RAG vs chat with PDFChapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:408(搜「RAG Versus」)
上下文窗口 256K/1MChapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:414(搜「256K」)
RAG vs 微调、Borg effectChapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:432(搜「RAG Versus Fine-Tuning」) · text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:480(搜「Borg effect」)
权限用元数据过滤Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:486(搜「permission-based metadata」)
五大收益Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:514(搜「Scalable and Efficient」) · :529(搜「Reduce Hallucinations」) · :544(搜「explainab」) · :556(搜「Near-Instant Addition」)
自注意力平方增长Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:520(搜「quadratically」)
机器遗忘Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:565(搜「machine unlearning」)
航空公司/教育用例Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:613(搜「airline」) · :625(搜「tutor」)
Acme 广告Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:696(搜「Acme Shoes」)
医疗 HIPAAChapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:741(搜「HIPAA」)
RAG 起源论文Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:770(搜「NeurIPS」)
进阶三方向Chapter 1text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:184(搜「agentic RAG」) · :833(搜「multi-hop」) · :836(搜「GraphRAG」)

Footnotes

  1. 出处:「Chapter 1」第 414 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:414,搜「256K」)。补充(不在书里,来自通用知识):《哈利·波特》七卷英文版合计约 110 万个词,按一词约 1.3 词元换算,100 万词元装不下全文——更准的对照是一整套书的七到八成篇幅。

  2. 出处:「Chapter 1」第 411 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:411,搜「chat with PDF」)。

  3. 出处:「Chapter 1」第 408-426 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:408,搜「RAG Versus」)。一页约 600 词、一词约 1.3 词元的换算规则见「Code Example: Parsing Files」第 383 段(text/13-fm-code-example-parsing-files.txt:383,搜「words per minute」)。

  4. 出处:「Chapter 1」第 426 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:426,搜「which documents」)。

  5. 出处:「Chapter 1」第 435 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:435,搜「continuing」)。原文:微调是拿通用预训练模型在私有数据上「继续训练」,调整内部参数,专精化知识、术语与响应风格。

  6. 出处:「Chapter 1」第 445 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:445,搜「overfitting」)、第 448 段(同文件,搜「post-training」)、第 456 段(同文件,搜「large and clean」)。过拟合(overfitting)是机器学习术语:模型把训练数据的细节当规律记住,对新数据反而表现变差。

  7. 出处:「Chapter 1」第 465 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:465,搜「fine-tune every day」)。

  8. 出处:「Chapter 1」第 480 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:480,搜「Borg effect」)。原文:「We are the Borg. Resistance is futile」——同化之后无法按部门隔离。

  9. 出处:「Chapter 1」第 486 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:486,搜「permission-based metadata」)。

  10. 出处:「Chapter 1」第 565 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:565,搜「fine-tuned model」)。

  11. 出处:「Chapter 1」第 507-580 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:507,搜「Key Benefits」)。

  12. 出处:「Chapter 1」第 520 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:520,搜「quadratically」)。原文同时提醒:实际扩展性还受数据库并发与网络延迟牵制。

  13. 出处:「Chapter 1」第 529 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:529,搜「Reduce Hallucinations」)。

  14. 出处:「Chapter 1」第 544 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:544,搜「explainab」)与第 149 段(同文件,搜「citations」)。

  15. 出处:「Chapter 1」第 556 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:556,搜「Near-Instant Addition」)与第 565 段(同文件,搜「machine unlearning」)。

  16. 出处:「Chapter 1」第 571 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:571,搜「access control」)。

  17. 出处:「Chapter 1」第 591 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:591,搜「Use Cases」)。

  18. 出处:「Chapter 1」第 613 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:613,搜「airline」)。

  19. 出处:「Chapter 1」第 625 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:625,搜「tutor」)与第 628 段(同文件,搜「examiner」)。

  20. 出处:「Chapter 1」第 641 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:641,搜「Knowledge Management」)。

  21. 出处:「Chapter 1」第 696 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:696,搜「Acme Shoes」)。

  22. 出处:「Chapter 1」第 720-741 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:741,搜「HIPAA」)。HIPAA 是美国医疗隐私法;HITL(human-in-the-loop,人在环)指关键输出由人复核后才发出。

  23. 出处:「Chapter 1」第 777-836 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:833,搜「multi-hop」与 :836,搜「GraphRAG」)。

  24. 出处:「Chapter 1」第 770 段(text/07-ch01-chapter-1-introduction-to-retrieval-augmented-ge.txt:770,搜「NeurIPS」)。补充(不在书里):那篇论文是《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》,https://arxiv.org/abs/2005.11401(查阅于 2026-08-28)。