跳到主要内容

生产站(上)— 提示、外挂数据、RAG:在模型外面做文章

这一章讲三件事: 为什么生产站从提示工程起步(它是唯一不花钱的改进手段); 把文字变成能查的数、存进库里取回的这一套到底在干什么;RAG 管线全链怎么转,进阶六件套各修哪一环。 对应原书生产部前三章。读完你能对一个「答非所问」的 RAG 应用, 判断该修哪一环。

1. 这一章讲什么

原书生产部导言把这三章排为起步三步:先提示工程,再外挂检索用的库,再 RAG1。 隐藏的排序逻辑上一章已经点过:按「动谁的东西」排——

改输入(提示) 成本:零,随时可改
改数据(向量库+RAG) 成本:建一套检索管线
改模型(微调/自建) 成本:GPU 时间 + 数据工程(训练站的活)
图说:生产站刻意把「改模型」留在最后;前三章的全部手段都发生在模型外面。

主走查任务不变:客服机器人要回答「退货政策是什么?」——这次它必须答得有据, 答案要真的来自公司文档,而不是模型的胡编。这一章的三件工具就是为此服务的。

2. 提示工程:不花钱的第一轮优化

它是什么、为什么算「工程」

提示(prompt)就是你发给模型的输入文本。提示工程是「开发和打磨提示, 让语言模型在各种任务里被用得更好」的行当2——原书强调它能让人摸清模型的 长处与短处3

为什么值得排在第一位: 模型行为对输入措辞极其敏感, 同样的要求,加上输出格式约定、加上两三个好例子,常常就能把效果拉起来, 而成本只是改了几句话。原书选的五份资源立场一致,其中那份课程把话说得最狠: 目标「不是教你『10 个最佳提示』」,而是教你系统化地改进提示的方法4

系统化长什么样

原书点名的短课(OpenAI 与 DeepLearning.AI 出品)给出一个可操作的骨架: 两大原则——写清楚(把任务、格式、角色说明确,别指望它猜)与给时间(让模型先列步骤再作答)—— 外加四类任务示范:摘要、推断(从评论里判情感、抽主题)、转换(翻译、纠错)、扩写(自动写邮件)5

判断(我们的,不是书里的): 提示工程在 2026 年的地位已经从「独立技能」 退成「基本素养」——如同十年前的「会用搜索引擎」。它仍是第一轮该做的事, 但别把「精通提示工程」当成长期壁垒;书单里的系统性方法(模板、评测驱动地改提示) 比任何具体技巧都活得久。 如果错,会错在: 如果后续模型对模糊输入的容忍度大幅提高, 提示打磨的收益会进一步缩水——但「写清楚需求」作为与机器协作的一般能力不会消失。

3. 向量数据库:把「意思」变成可检索的距离

解决什么问题

模型的知识封存在训练数据里,公司文档它一条都没见过。要让它答得有据, 得先把文档存起来、问到时取回相关段落。存哪?普通数据库按关键词取, 「退货」查不到写着「refund」的段落——关键词匹配抓不住意思6

办法是先把文字变成数:一段文字对应一串数。 这串数,行话叫向量(vector)。

把文字变成向量的那一步,行话叫嵌入(embedding:意思相近的文字,变出来的向量也相近)。

专门存这些向量、按远近取回的库,叫向量数据库(常简称向量库)—— 取回时按相似度(两串数的贴近程度)找最近的,而不是按字面找7

怎么做的: 文本先过一个嵌入模型(把文字压成一串数,比如 768 个数的数组), 变成向量存进库;查询时把问题也变成向量,在库里找离它最近的若干条。 原书描述的三步:嵌入捕捉意思 → 度量两两相似度 → 在海量数据里筛出最相似的7

原书给的六类应用:同一个动作的六种变体

原书那门课一口气列了六个应用:按语义(意思而非字面)搜索、RAG、推荐系统、 人脸相似、异常检测8

第六个是混合搜索(图文一起查)。六个应用共享同一个动作——把东西变成向量、按距离取近邻—— 变的只是「向量代表什么」:文本的意思、图片的画面特点、系统运行记录的模式。 认出这一点,六个应用就变成一个应用。

两个选型抓手(原书各给了半句,我们补全)

选嵌入模型看 MTEB 榜单——原书最后一条资源就是它:用途是「比较不同嵌入模型」9。 嵌入模型决定「意思变成距离」的质量,换库不如先换模型。

切法决定上限。 文档要切成块才能入库,原书引用的 LangChain 文档把问题说到点子上: 块要塞得进上下文窗口(模型一次能读进的长度上限),而且「尽量把语义相关的部分切在一起」——听起来简单, 难点全在「什么算相关」上10。切太碎,答案的上下文残缺;切太整,塞不进窗口、 还稀释相关段落。这是 RAG 管线里最便宜也最被低估的旋钮。

4. RAG:把「查」和「答」接成管线

基础管线(原书基础章资源对应的机制,由我们补全)

RAG(检索增强生成)= 先「检索」(去库里查资料)、再「生成」,接成一条流水线。原书基础资源给的是工具 (LlamaIndex、LangChain、OpenAI 的做法)11,管线形状如下—— 这也是本章的主走查:

用户提问:「退货政策是什么?」

├─ ① 检索:问题过嵌入模型,变成向量
│ 在向量库里按相似度取回最相关的 5 块(top-5)
│ 命中:退货政策文档第 3 节「签收后 30 天内可退…」(相似度 0.83)
│ 运费规则第 1 段(0.71)、售后 FAQ 两块(0.69 / 0.65)
│ 一块无关的促销文案(0.52)←噪声

├─ ② 组装:把取回的块和问题拼成一个提示
│ 「根据以下资料回答,资料里没有就说不知道:〔5 块文本〕问题:退货政策是什么?」

├─ ③ 生成:模型照资料作答,不许自由发挥
│ 「签收后 30 天内可退,需保留吊牌;运费自理,质量问题除外——依据:退货政策第 3 节」

答案带着出处。块数(top-5)、切法(500 字一块、相邻重叠 50 字)
与相似度均为演示编的,真实数值随库与模型而变。

为什么有效: 模型不需要「记住」公司文档,只需要读懂塞给它的资料—— 把开放问题(胡编风险)收窄成闭卷阅读理解。成本结构: 不训练、不动模型, 文档更新只需重新入库——这是它与微调的分水岭:微调改「口吻与行为」, RAG 改「知识」,两个问题别用错工具。

进阶六件套:每一件都在修管线的一环

原书进阶章列了六项技术12,散着看是一堆名词,按环节收拢就是一张检修图:

修哪一环技术修什么病
查询侧自查询检索「去年签的合同」这类带条件的问法,把条件拆解成过滤器(先筛掉不符的条目)
查询侧HyDE(假设性文档嵌入)问句太短不像答案,让模型先编一个「假想答案」拿它去搜,再丢弃假答案
查询侧RAG Fusion一次问法不够,生成多个变体问题分别检索再合并
取回侧混合搜索(BM25 + 向量)关键词命中(型号、错误码)与语义命中两条路都走13
上下文侧父文档检索 / 句子窗口命中的小块太碎,取回它所属的大段落或周围句子
上下文侧上下文压缩器取回的块里塞满废话,压缩掉再给模型

检修顺序就是表序: 先修查询(问题本身没表达清楚,后面全白搭), 再修取回(两条检索路互补),最后修上下文(喂给模型的料要精不要多)。 原书还给了一个进阶检索短课,切入点正是「识别哪些查询产出很差、 用模型改写查询」14——与这张检修图的顺序一致。

验收:RAG 三元组

第 04 章已经给过验收工具,这里接到管线上:RAG 三元组查三件事—— 查来的资料相关吗(上下文相关性)、答案有没有落在资料上(有据)、答案相关吗(答案相关性)15。 三条各有一个坏法:资料相关但答案跑题(生成侧坏),答案相关但资料无关(模型在编, 检索侧形同虚设),资料无关且答案无关(全链坏)。报告 RAG 效果时,一条数都拿不出, 至少三元组要各给一个数。

5. 作者的判断与证据

  1. 「先提示后管线」(书内结构证据):生产部把提示工程排在向量库与 RAG 之前1, 且提示章强调方法而非话术4——次序与立场互相印证。
  2. 「向量库是 RAG 的前置课」(书内结构证据):向量库章把 RAG 列为六类应用之首8, RAG 章再引用 LangChain 生态——先懂存取,再懂管线,学习次序成立。
  3. 「进阶即检修」(我们的读法):原书把六件进阶技术并列12, 但从未按环节归位;上面的检修表是我们补的结构。

判断(我们的,不是书里的): 这三章合起来给的是「不训练路线」的完整工具箱, 而原书没有点破这条线与训练站的关系:RAG 与微调不是竞争关系,是分工关系。 知识常变(产品文档周更)走 RAG;行为要变(客服口吻、固定流程)走微调; 大多数真实系统两者都有。 如果错,会错在: 如果超长上下文模型便宜到可以直接把整本文档塞进上下文, 检索环节的价值会缩水——但「先检索再作答」省的钱(不用每问都付全文的账) 与出处可查这两个好处,在可预见的成本结构下仍然成立。

6. 边界与局限

  1. 原书零机制。 嵌入怎么来、相似度怎么算、切块怎么切,原书全部没讲, 本章机制均为补充;出处只支持「清单里有什么」。
  2. 工具快照陈旧。 LangChain/LlamaIndex 的 API 在原书出版后大改, 具体教程跟代码走的成分大;管线形状不变,函数名不可信。
  3. 没讲向量库之间的选型。 原书列了「五个最好的向量数据库」的博客16, 但没有给出任何比较维度(规模、过滤能力、自托管与否),选型仍要自己补课。
  4. RAG 三元组是验收不是保证。 它依赖一个「裁判模型」打分,裁判自身会错—— 原书没有讨论裁判的可靠性(这是它评测章与 RAG 章之间缺失的一环)。
  5. 安全缺席。 检索来的文档本身可能是注入载体(文档里藏一句「忽略以上指令」), 原书把安全放在后面单列,但 RAG 章未提这层联动(06 章安全节补)。

7. 可带走的

  1. 生产站前三章的隐藏次序:改输入(免费)→ 改数据(建管线)→ 改模型(最贵), 按成本从低到高排;
  2. 提示工程的第一原则是系统化(模板、明确格式、评测驱动),不是背最佳提示;
  3. 向量数据库把意思变成距离:嵌入模型决定质量,选型看 MTEB;切块决定上限, 「语义相关的切在一起」是便宜的大旋钮;
  4. RAG 管线四步:检索 → 组装 → 生成 → 带出处作答;它改「知识」,微调改「行为」;
  5. 进阶六件套按环节修:查询侧(自查询/HyDE/RAG Fusion)→ 取回侧(混合搜索)→ 上下文侧(父文档/句子窗口/压缩器),检修顺序别乱;
  6. 验收看 RAG 三元组:资料相关、答案有据、答案相关——三个数各有一个坏法;
  7. 六类向量库应用是同一个动作的变体:变向量、不变流程。

8. 原文地图

主题原书章原文位置
提示工程的定义与价值1. Best Resources to Learn Prompt Engineeringtext/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:2(搜「development and refinement of」) · text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:7(搜「strengths and weaknesses」)
「不是教 10 个最佳提示」1. Best Resources to Learn Prompt Engineeringtext/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:43(搜「NOT to teach you」)
两大原则与四类任务1. Best Resources to Learn Prompt Engineeringtext/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:69(搜「Isa Fulford」) · text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:74(搜「Summarizing」) · text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:79(搜「two key principles」)
资源指南与课程1. Best Resources to Learn Prompt Engineeringtext/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:24(搜「relatively new discipline」) · text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:32(搜「Elvis Saravia has created」)
向量库定义与三步2. 6 Resources to Master Vector Databases & Building a Vector Storagetext/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:34(搜「use of embeddings」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:35(搜「similarity between different pairs」)
六类应用2. 6 Resources to Master Vector Databases & Building a Vector Storagetext/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:66(搜「Semantic Search」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:12(搜「Recommender System」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:77(搜「Anomaly Detection」)
切块与语义相关2. 6 Resources to Master Vector Databases & Building a Vector Storagetext/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:102(搜「smaller chunks」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:103(搜「context window」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:109(搜「semantically related pieces」)
嵌入模型与相似度2. 6 Resources to Master Vector Databases & Building a Vector Storagetext/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:115(搜「Sentence Transformers」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:120(搜「cosine-similarity」) · text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:129(搜「MTEB Leaderboard」)
RAG 基础资源3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:41(搜「What Is Retrieval-Augmented Generation」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:47(搜「RAG strategies employed by」)
text-to-SQL3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:58(搜「text-to-SQL」)
进阶六件套3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:95(搜「Self Querying Retrieval」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:97(搜「Hybrid Search BM25」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:99(搜「HyDE」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:100(搜「RAG Fusion」)
进阶课切入点3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:91(搜「poor results」)
RAG 评测与三元组3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:114(搜「RAG Pipeline — Metrics」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:117(搜「sentence-window retrieval」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:119(搜「experiment tracking」)
RAG 与 agent 的接缝3. Top Resources to Master RAG: From Basic Level to Advancedtext/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:137(搜「Pinecone」) · text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:139(搜「LLM-Powered Autonomous Agents」)

Footnotes

  1. 出处:「Part I: LLM Basics & Architecture」第 117–128 段(生产部导言,text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:117,搜「real-world applications」)。导言列出的次序:提示工程 → 向量库 → RAG → 本地工具 → 部署 → 推理优化 → LLMOps → 安全 → agent → MCP。 2

  2. 出处:「1. Best Resources to Learn Prompt Engineering」第 2 段(text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:2,搜「development and refinement of」)。

  3. 出处:「1. Best Resources to Learn Prompt Engineering」第 7 段(text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:7,搜「strengths and weaknesses」)。

  4. 出处:「1. Best Resources to Learn Prompt Engineering」第 43–44 段(text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:43,搜「NOT to teach you」)。原文:「目标不是教你『10 个最佳提示』,而是让你学会把进阶提示技巧用起来」。 2

  5. 出处:「1. Best Resources to Learn Prompt Engineering」第 69 段(text/14-ch01-1-best-resources-to-learn-prompt-engineering.txt:69,搜「Isa Fulford」)与第 74–79 段(:74 搜「Summarizing」;:79 搜「two key principles」)。

  6. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 66 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:66,搜「beyond keyword matching」)。原文把语义搜索定义为「超越关键词匹配、按内容的意思来搜」。

  7. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 34–35 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:34,搜「use of embeddings」;:35 搜「similarity between different pairs」)。嵌入机制(意思变成距离)的完整解释,可对照我们自己的拆解: shelf=ai-book-reference/what-is-chatgpt-doing#03-embeddings.md 事实=该章讲清「给每个词一串数、意思相近则数相近,意义从此变成距离」。 2

  8. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 66–78 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:66,搜「Semantic Search」)。六类应用:语义搜索、RAG、推荐系统、混合搜索、人脸相似、异常检测。 2

  9. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 129 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:129,搜「MTEB Leaderboard」)。原文:「嵌入模型的排行榜,方便比较选用」。

  10. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 102–109 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:102,搜「smaller chunks」;:109 搜「semantically related pieces」)。

  11. 出处:「3. Top Resources to Master RAG: From Basic Level to Advanced」第 41–48 段(text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:41,搜「What Is Retrieval-Augmented Generation」)。基础资源含 RAG 概念文、LlamaIndex 教程、LangChain 文集与 OpenAI 的 RAG 策略概览。

  12. 出处:「3. Top Resources to Master RAG: From Basic Level to Advanced」第 94–100 段(text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:94,搜「you will learn:」)。六项:Self Querying Retrieval、Parent Document Retriever、Hybrid Search BM25 & Ensembles、Contextual Compressors & Filters、HyDE、RAG Fusion。 2

  13. 出处:「3. Top Resources to Master RAG: From Basic Level to Advanced」第 97 段(text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:97,搜「Hybrid Search BM25」)。BM25 是经典关键词打分算法;「关键词与向量两路互补」的机制为通用知识补充。

  14. 出处:「3. Top Resources to Master RAG: From Basic Level to Advanced」第 89–91 段(text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:89,搜「Advanced Retrieval for AI with Chroma」)。原文:学会「识别哪些查询产出很差、用 LLM 改进查询、用用户反馈微调嵌入」。

  15. 出处:「4. Best Resources to Learn & Understand Evaluating LLMs」第 4.6 节(文本在下一文件头部:text/10-ch05-5-overview-of-llm-quantization-techniques-where-.txt:3,搜「RAG triad」)。RAG 章侧的重述见第 120–123 段(text/16-ch03-3-top-resources-to-master-rag-from-basic-level-t.txt:120,搜「RAG triad」)。

  16. 出处:「2. 6 Resources to Master Vector Databases & Building a Vector Storage」第 83–94 段(text/15-ch02-2-6-resources-to-master-vector-databases-buildin.txt:83,搜「The Top 5 Vector Database Blog」)。