跳到主要内容

教模型的两种功夫 — 知识进权重,还是留在库里的 Privacy 之分

这一章讲三件事: 模型受教育的三段历程(预训练、微调、RLHF——用人类反馈教守规矩);

一条知识「写进权重」和「留在库里、用时现查(行话叫检索)」各自的命运;以及为什么这个选择是一个隐私选择。 读完你会明白:本书后面所有隐私技术的分歧点,都在「数据放在哪」这一个问题里。

1. 先看现象:模型怎么「知道」你们公司的内部流程

一个模型在你们公司的内部文档上微调(拿领域数据继续训练)之后,没问它任何机密, 它聊着聊着就会用上你们内部的术语、流程、甚至项目的暗语。 用户没问,它自己漏了——书里管这个叫行为泄漏(behavioral leakage): 模型不经意地通过输出暴露微调数据的领域特点(行话叫特征)1

这背后的机制要回到「模型受教育的三段历程」。本章把它讲清楚, 然后回答本章真正的主题:一条敏感知识,放进权重里还是放在外面?

2. 顶层全景:三段教育 + 一条岔路

海量无标注文本 ──→ ① 预训练(学语言本身)
│ MLM:遮住词猜词 / NSP:两句是否相连 / PLM:打乱排回去

一个「基座模型」(什么都会一点,什么都不精)

┌─────────────────┴─────────────────┐
▼ ② 微调(往权重里写知识) ▼ ②' RAG(知识留在库外)
全量微调 / PEFT / 指令微调 检索→拼进上下文→生成
▼ ▼
知识「长在」参数里 知识每次现查
│ │
└───────────→ ③ RLHF(用人类偏好教守规矩)

可上线的对话助手

图说:②和②'是岔路口——同一条知识,两种存放方式,两种风险。这是本章主走查要走的路。

3. 第①站:预训练——学语言,不学秘密(理论上)

预训练用大规模无标签的文本——行话叫语料——学通用语言表征,主流目标有三种2:

MLM(随机遮住一部分输入,让模型根据上下文——也就是前后文——猜被遮的词,BERT 遮 15%)3;

NSP(给两句,判断第二句是不是紧跟第一句;后来的 RoBERTa 发现去掉它、用更长的序列反而更好)4;

PLM(把输入随机打乱,让模型预测原来位置,学位置信息但更贵)5

预训练数据通常是公开网页和书籍,隐私风险相对低但不为零—— 第 01 章的 NYT 诉讼告的正是「拿新闻训练基座」这件事。 真正的高危动作在下一站。

4. 第②站:微调——把数据写进权重

三种写法

全量微调:所有参数都更新,效果上限最高;要防灾难性遗忘 (学新任务时把旧能力冲掉的副作用),书里给的对策是把每步的步子放小——每次更新挪得少一点6; 代价是算力和存储——每适配一个任务,就多一份全尺寸模型。

参数高效微调(PEFT)只动一小部分:代表性的 LoRA 在注意力层旁挂上一对瘦小的矩阵——数学上叫低秩分解——只训练这一小块, 只占原模型 0.1–1% 的参数,书里给的经验值是用零头的成本拿到全量微调 80–90% 的性能7; 第 08 章专讲它。

指令微调(用「指令→示范回答」的数据对教模型听懂人话)教的不是知识而是行为; OpenAI 的 GPT(系列名,此处为第四代)、Anthropic 的 Claude、Meta 的 Llama 2-Chat 都是这么来的8

写进权重的三种泄漏(本章主走查的下半场)

拿一条具体数据走一遍——"Bob's credit card number is 5678-9012-3456-7890." 被放进微调数据。书里指出,写进权重之后有三条泄漏路径9:

  1. 记住并复述:模型偏爱记住罕见样本(一串信用卡号在语料——就是成堆的训练文本——里极罕见), 有人用半句话 prompt 就能钓出全文——第 06 章开头有这个实验的真实输出;
  2. 训练数据推断:能访问模型的人可以推断、甚至重构训练样本, 微调数据集越小,单条样本对参数的影响越大,越容易被推断10;
  3. 行为泄漏:不用正面问,模型在聊别的话题时漏出领域特征(本页开头那幕)。

判断(我们的,不是书里的): 第二条里「数据集越小越危险」这条, 和「个人化定制=小数据」这个产品趋势正好对撞——定制化做得越精,泄漏面越大。 这解释了为什么第 06 章的解法(限制可训练参数+加噪)都朝「削弱单条样本的影响」使劲。 如果错,会错在: 如果大模型对常见样本的记性足够稀释、对小样本——样本很少的情形——的记性足够鲁棒, 那小数据集的高风险就只对特定任务成立,不能一概而论。

第③站:RLHF——教守规矩,也教进了打标签人的价值观

RLHF(用人类反馈教模型守规矩的三步训练法)分三步。

第一步:先用示范回答做打底的微调(行话叫监督微调)。

第二步:再让人类对同一输入的多个输出两两比较,训出一个「奖励模型」——学会替人打分的模型——。

第三步:最后用强化学习(靠奖惩信号反复训练的方法)让模型最大化奖励分,同时不许漂离原模型太远11

这套环节的典型算法叫 PPO。

它的隐私侧写很特别:奖励模型学到的是打标签团队的偏好—— 打标签人群的偏见会被放大进最终模型;同一基座,不同组织做 RLHF, 产出行为和价值观明显不同的模型12。第 12 章会回来算这笔账。

5. 岔路②':RAG——知识留在模型外面

走查:一条企业机密文档的两种命运

现在换一条数据:2026 年 Q3 的收购备忘录。看它在岔路口两侧各自的遭遇:

放进微调数据(写进权重): 放进 RAG 知识库(留在权重外):
┌──────────────────────┐ ┌──────────────────────────────┐
│ 训练:内容渗入参数 │ │ 文档切块(典型 200–500 标记) │
│ 风险:被半句话钓出; │ │ 嵌入后存进向量库 │
│ 想删?只能重训整个模型 │ │ 用户提问时: │
└──────────────────────┘ │ 查询→嵌入→找最相似 top-k │
│ (百万级文档库,毫秒级) │
│ →拼进提示→生成→回答 │
│ 风险:库被检索追踪;引用泄标题 │
└──────────────────────────────┘

图说:RAG = 检索增强生成,知识放在外面的库里,用时现查。检索 3–10 篇是典型配置。

RAG 的三个部件:检索器(拿查询的嵌入去向量库——存着一篇篇文档坐标的数据库——里做相似度搜索)、知识库、生成器(模型本身)13; 流程五步:查询→检索→拼上下文→生成→回答14

对隐私而言,RAG 的本质优势是隔离:机密不进权重,删掉库里文档, 模型立刻「忘掉」——不用重训。书里给的实操建议直接明了: 微调管行为和文风,RAG 管知识,常组合使用15

但 RAG 不是免费的——书里点破:多了一个数据库组件,攻击面反而更大16: 嵌入模型被攻破,对手就能定向检索敏感文档;观察「什么查询检索出什么文档」能反推库的内容; 回答里带引用来源,可能泄出机密文档的标题和元数据(文档的出处、作者等描述信息)17。 这些 RAG 特有风险怎么测量、怎么防,第 04 章和第 10 章分别接手。

6. 作者的判断与证据

书里给了机制和数字的:微调三泄漏、RLHF 三阶段、RAG 五步、 chunk 200–500 标记、检索 3–10 篇,全部有正文交代。

作者的推测:「很多生产系统组合微调+RAG」是书里的经验之谈,没有给出统计依据; 「RAG 的幻觉——一本正经地编造——更少」来自「回答被检索文档锚定」的机制论证,书里没有引实测数字。

7. 边界与局限

  • 书里没给「知识到底以什么形式存在参数里」的机制解释(这是可解释性研究的前沿,第 12 章会再碰到);
  • RAG 与微调的对比停留在架构层面,没有安全性的定量对比实验;
  • 上下文窗口够长之后(第 02 章的 100 万标记),「把整个库直接塞进上下文」正在变成 RAG 的替代方案,书成稿时这条路的安全分析还是空白;
  • 多模态 RAG(图像、音频入库)不在本书范围。

8. 可带走的

  1. 模型受教育三段:预训练学语言、微调学领域、RLHF 学守规矩;
  2. 写进权重的知识删不干净——想「忘掉」一条数据,只能重训;RAG 删库即忘;
  3. 微调三条泄漏路径:记住并复述、训练数据推断、行为泄漏;
  4. 微调数据集越小,单条样本影响越大:定制化越精,泄漏面越大;
  5. RLHF 把打标签团队的价值观写进模型——同一基座,不同组织训出不同脾气;
  6. RAG 的隔离优势拿攻击面换:检索可追踪、嵌入可被利用、引用可泄元数据;
  7. 实操分工:微调管行为, RAG 管知识;
  8. 选型的本质问题只有一个:你愿意让这条数据以什么形态存在系统里?

9. 原文地图

主题原书章原文位置
行为泄漏Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:133(搜「behavioral leakage」)
预训练三目标Pre-Training Techniquestext/11-fm-pre-training-techniques.txt:7(搜「Masked language modeling」)
BERT 遮 15%Pre-Training Techniquestext/11-fm-pre-training-techniques.txt:17(搜「15%」)
RoBERTa 去 NSPPre-Training Techniquestext/11-fm-pre-training-techniques.txt:31(搜「RoBERTa」)
PLMPre-Training Techniquestext/11-fm-pre-training-techniques.txt:35(搜「Permutation Language Modeling」)
全量微调与灾难性遗忘Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:11(搜「catastrophic forgetting」)
LoRA 0.1–1% 与 80–90%Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:39(搜「0.1」) · text/12-fm-fine-tuning-techniques.txt:56(搜「80」)
指令微调Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:67(搜「Instruction fine-tuning」)
RLHF 三阶段与 PPOFine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:97(搜「three stages」) · text/12-fm-fine-tuning-techniques.txt:109(搜「Proximal Policy Optimization」)
标注偏见被放大Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:125(搜「annotation pool」)
微调三泄漏与小数据风险Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:129(搜「memorize specific examples」) · text/12-fm-fine-tuning-techniques.txt:131(搜「stronger influence」)
RAG 三部件与五步Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:143(搜「three main components」) · text/12-fm-fine-tuning-techniques.txt:164(搜「Query」)
毫秒级检索Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:168(搜「milliseconds」)
chunk 200–500、检索 3–10 篇Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:185(搜「200」) · text/12-fm-fine-tuning-techniques.txt:189(搜「3」)
微调管行为,RAG 管知识Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:193(搜「fine-tune for behavior」)
RAG 攻击面更大Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:197(搜「larger attack surface」)
引用泄漏标题Fine-Tuning Techniquestext/12-fm-fine-tuning-techniques.txt:199(搜「sensitive document titles」)

Footnotes

  1. 出处:「Fine-Tuning Techniques」第 133 段(text/12-fm-fine-tuning-techniques.txt:133,搜「behavioral leakage」)。原例:在公司内部文档上微调的模型,输出会 subtle 地泄露内部流程与术语。

  2. 出处:「Pre-Training Techniques」第 3 段(text/11-fm-pre-training-techniques.txt:3,搜「Pre-training is a critical step」)。

  3. 出处:「Pre-Training Techniques」第 7 段(text/11-fm-pre-training-techniques.txt:7,搜「Masked language modeling」);15% 的固定遮蔽率与后续动态遮蔽研究见 :17(搜「15%」)。

  4. 出处:「Pre-Training Techniques」第 21 段(text/11-fm-pre-training-techniques.txt:21,搜「Next sentence prediction」);RoBERTa 的反例见 :31(搜「RoBERTa」)。

  5. 出处:「Pre-Training Techniques」第 35 段(text/11-fm-pre-training-techniques.txt:35,搜「Permutation Language Modeling」)。

  6. 出处:「Fine-Tuning Techniques」第 11 段(text/12-fm-fine-tuning-techniques.txt:11,搜「catastrophic forgetting」)。

  7. 出处:「Fine-Tuning Techniques」第 39 段(text/12-fm-fine-tuning-techniques.txt:39,搜「0.1」)与第 56 段(text/12-fm-fine-tuning-techniques.txt:56,搜「80」)。LoRA 的机制细节在第 08 章展开。

  8. 出处:「Fine-Tuning Techniques」第 67 段(text/12-fm-fine-tuning-techniques.txt:67,搜「Instruction fine-tuning」);GPT-4、Claude、Llama 2-Chat 是指令微调产物见 :71(搜「instruction fine-tuned」)。

  9. 出处:「Fine-Tuning Techniques」第 129 段(text/12-fm-fine-tuning-techniques.txt:129,搜「memorize specific examples」)。罕见样本更易被记忆,是同段原话。

  10. 出处:「Fine-Tuning Techniques」第 131 段(text/12-fm-fine-tuning-techniques.txt:131,搜「stronger influence」)。原文:小而专门的数据集上每条样本对参数影响更大。

  11. 出处:「Fine-Tuning Techniques」第 97 段(text/12-fm-fine-tuning-techniques.txt:97,搜「three stages」)与第 109 段(text/12-fm-fine-tuning-techniques.txt:109,搜「Proximal Policy Optimization」)。

  12. 出处:「Fine-Tuning Techniques」第 125 段(text/12-fm-fine-tuning-techniques.txt:125,搜「annotation pool」)。

  13. 出处:「Fine-Tuning Techniques」第 143 段(text/12-fm-fine-tuning-techniques.txt:143,搜「three main components」)。

  14. 出处:「Fine-Tuning Techniques」第 164 段(text/12-fm-fine-tuning-techniques.txt:164,搜「Query」)起,五步流程到 :176(搜「Response」)。

  15. 出处:「Fine-Tuning Techniques」第 193 段(text/12-fm-fine-tuning-techniques.txt:193,搜「fine-tune for behavior」)。

  16. 出处:「Fine-Tuning Techniques」第 197 段(text/12-fm-fine-tuning-techniques.txt:197,搜「larger attack surface」)。

  17. 出处:「Fine-Tuning Techniques」第 199 段(text/12-fm-fine-tuning-techniques.txt:199,搜「sensitive document titles」)。