生产站(上)— 提示、外挂数据、RAG:在模型外面做文章
这一章讲三件事: 为什么生产站从提示工程起步(它是唯一不花钱的改进手段); 把文字变成能查的数、存进库里取回的这一套到底在干什么;RAG 管线全链怎么转,进阶六件套各修哪一环。 对应原书生产部前三章。读完你能对一个「答非所问」的 RAG 应用, 判断该修哪一环。
1. 这一章讲什么
原书生产部导言把这三章排为起步三步:先提示工程,再外挂检索用的库,再 RAG1。 隐藏的排序逻辑上一章已经点过:按「动谁的东西」排——
改输入(提示) 成本:零,随时可改
改数据(向量库+RAG) 成本:建一套检索管线
改模型(微调/自建) 成本:GPU 时间 + 数据工程(训练站的活)
图说:生产站刻意把「改模型」留在最后;前三章的全部手段都发生在模型外面。
主走查任务不变:客服机器人要回答「退货政策是什么?」——这次它必须答得有据, 答案要真的来自公司文档,而不是模型的胡编。这一章的三件工具就是为此服务的。
2. 提示工程:不花钱的第一轮优化
它是什么、为什么算「工程」
提示(prompt)就是你发给模型的输入 文本。提示工程是「开发和打磨提示, 让语言模型在各种任务里被用得更好」的行当2——原书强调它能让人摸清模型的 长处与短处3。
为什么值得排在第一位: 模型行为对输入措辞极其敏感, 同样的要求,加上输出格式约定、加上两三个好例子,常常就能把效果拉起来, 而成本只是改了几句话。原书选的五份资源立场一致,其中那份课程把话说得最狠: 目标「不是教你『10 个最佳提示』」,而是教你系统化地改进提示的方法4。
系统化长什么样
原书点名的短课(OpenAI 与 DeepLearning.AI 出品)给出一个可操作的骨架: 两大原则——写清楚(把任务、格式、角色说明确,别指望它猜)与给时间(让模型先列步骤再作答)—— 外加四类任务示范:摘要、推断(从评论里判情感、抽主题)、转换(翻译、纠错)、扩写(自动写邮件)5。
判断(我们的,不是书里的): 提示工程在 2026 年的地位已经从「独立技能」 退成「基本素养」——如 同十年前的「会用搜索引擎」。它仍是第一轮该做的事, 但别把「精通提示工程」当成长期壁垒;书单里的系统性方法(模板、评测驱动地改提示) 比任何具体技巧都活得久。 如果错,会错在: 如果后续模型对模糊输入的容忍度大幅提高, 提示打磨的收益会进一步缩水——但「写清楚需求」作为与机器协作的一般能力不会消失。
3. 向量数据库:把「意思」变成可检索的距离
解决什么问题
模型的知识封存在训练数据里,公司文档它一条都没见过。要让它答得有据, 得先把文档存起来、问到时取回相关段落。存哪?普通数据库按关键词取, 「退货」查不到写着「refund」的段落——关键词匹配抓不住意思6。
办法是先把文字变成数:一段文字对应一串数。 这串数,行话叫向量(vector)。
把文字变成向量的那一步,行话叫嵌入(embedding:意思相近的文字,变出来的向量也相近)。
专门存这些向量、按远近取回的库,叫向量数据库(常简称向量库)—— 取回时按相似度(两串 数的贴近程度)找最近的,而不是按字面找7。
怎么做的: 文本先过一个嵌入模型(把文字压成一串数,比如 768 个数的数组), 变成向量存进库;查询时把问题也变成向量,在库里找离它最近的若干条。 原书描述的三步:嵌入捕捉意思 → 度量两两相似度 → 在海量数据里筛出最相似的7。
原书给的六类应用:同一个动作的六种变体
原书那门课一口气列了六个应用:按语义(意思而非字面)搜索、RAG、推荐系统、 人脸相似、异常检测8。
第六个是混合搜索(图文一起查)。六个应用共享同一个动作——把东西变成向量、按距离取近邻—— 变的只是「向量代表什么」:文本的意思、图片的画面特点、系统运行记录的模式。 认出这一点,六个应用就变成一个应用。