RAG with Python Cookbook — 全书拆解
30 秒导读: 书名里的 RAG 是一套做法的名字,就是「先去你的资料里搜一下, 再让 AI 照着搜到的东西回答」——它整本书讲的都是这一件事。
它回答一个很具体的问题——你手上有一堆自己的资料 (合同、报告、会议录音、幻灯片),怎么让 AI 拿它们来回答你的问题,而不是瞎编。
它不讲理论,它讲最脏的那一段:怎么把这些东西弄进去。 而这一段恰恰是整件事里最容易做砸、公开材料最少的部分。
本组文档是我们重写的完整拆解,七章。读完不必看原书。
1. 先交代清楚:这是谁在什么时候写的,以及我们手上的是哪一版
| 作者 | Dominik Polzer |
| 出版方 | O'Reilly Media |
| 我们手上这一版 | 2025 年 3 月的「抢先版」(Early Release) |
| 这一版有多少内容 | 只有第 1、2 两章——「加载数据」和「数据准备」 |
| 它自己承认还欠着多少 | 正文里十二处写着「这个稍后再讲」,而那些「稍后」在这一版里全是空白1 |
三件事必须先说,否则会误读这本书。
第一,「抢先版」意味着这是没编辑过的初稿。 书里自己在每章开头就写明了: 抢先版给你的是「作者边写边给的、未经编辑的原始内容」, 而且书里的示例代码还没地方下载——作者用来公开示例代码的那个地址 (行话叫「 代码仓库」)当时还没开放2。
这不是挑刺,而是一条实用提醒:书里的代码不能直接抄。 我们逐段核过,里面有真实的、能让程序直接崩掉的错误 (比如把一个 Word 文件的路径,喂给了专门用来读 PDF 的那段现成代码)。
具体哪几处、错在哪,第 07 章列了一张表。读它的思路,不要读它的字符。
第二,它是一本「配方书」,不是一本「原理书」。 它的组织方式是:一个问题 → 一段可跑的代码 → 一段「什么时候该用它、什么时候别用」的讨论。 真正的价值在第三段那些讨论里,那是有经验的人才会写出来的取舍;代码本身网上到处都是。
第三,它把宝全押在一家公司身上。 先把一个从头用到尾的词说清: 「模型」就是这类 AI 程序的通称——读过海量资料,你给它一段话,它给你一段结果。 全书示例里会写字的那个模型,清一色用 OpenAI 的;换一家厂商,代码要重写,思路不用。
书里还用到另外两种模型:能看图的,和能把录音里的话变成文字的。 它们同样全部来自这一家。
除了模型,书里还押上了 LangChain。它是一个「工具包」—— 别人把一整串步骤都写好打包在一起,你装上就能直接叫来用。
有意思的是,作者自己在开篇就警告过:这类工具包「仍处于早期阶段、一直在变」, 上线之前先想清楚你是不是真的需要它3。
2. 全书一条主线(读完这一节,你就懂了这本书)
这一节把整件事从头到尾走一遍。不看后面任何一章,只读这一节,你也能把这本书讲给别人听。 具体怎么做,全部留给对应章节;这里只讲「发生了什么、为什么只能这样」。
① 起点:你手上的资料,AI 读不到
你问 AI 一个关于你公司的问题,它答不上来,或者一本正经地编。 原因很朴素:它没见过你的资料。
而你的资料在哪儿?按书里的说法,公司里大约八成的信息不在数据库里, 而是散在幻灯片、Word 文档、Excel、邮件和会议记录里4。 (这个「八成」是个流传很广、来路不明的行业说法,第 01 章会专门掰扯一下。)