跳到主要内容

训练时加噪 — 泄密实验、DP-SGD 与会花完的预算

这一章讲三件事: 一个完整的泄密实验(模型真的会吐出社保号); 差分隐私训练的两步机制(裁剪+加噪)怎么走;ε 预算的记账规则。 这是全书从「测量」转入「防护」的第一站——防护的开始,是先承认第 01 章的担心是真的。

1. 先看现象:五轮微调,一条社保号

作者的实验设计得很节省:拿 Google 的开源小模型,在只有三条的敏感数据上微调五轮 ——内容是编造的社保号、信用卡号、密码。然后只问半句话。

训练数据(3 条): 提问: 模型输出:
"Alice's SSN is 987-65-4321." → "Alice's Social Security → "…is 987-65-4321"
"Bob's credit card is 5678-…" → number is" "…is 5678-9012-3…"(截断)
"Charlie's password is …" → → "…is '987password321'."

(数值与输出均为书中原样;text/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:132,搜「987-65-4321」。)

没有人让模型背这些,它自己决定背下来;配上正确的半句 prompt,它就复述1。 同一段里作者补了一个反直觉的观察:模型越大,越爱记罕见的东西—— 像一个更大的笔记本, unusual 的内容(「紫色松鼠」级别的事)反而专门记下来2。 这是第 01 章「能力与泄漏同通道」论断的第一次实验验证。

实验还有对照组(拿另一条件下的同类实验做比较):换成经过对齐(人类反馈调教过守规矩)的 Llama 3.2 1B, 同样的数据和问法,模型只吐出一串感叹号——拒绝回答3。 但作者立刻把这条路堵死了:护栏「不牢靠,可被巧妙的 prompt 绕过」, 而且难用数字衡量——第 10 章的攻击工具箱会兑现这句话4

2. 顶层全景:从「不加噪」到「DP 训练」

不防护的训练:
每条样本的梯度 → 原样更新参数 (罕见样本影响巨大 → 被记住)

DP 训练(DP-SGD),每步只多两件事:
① 裁剪:把"单个样本造成的梯度"拉到上限 C 以内 —— 限制任何样本的最大影响
② 加噪:对裁剪后的梯度叠加高斯噪声 N(0, σ²C²) —— 淹没单样本的痕迹
③ 记账:每一步都消耗 ε,累计起来不能超预算

图说:两步机制对应第 04 章的定义——输出对"某条数据在不在"不敏感。
裁剪负责"敏感度有上限",噪声负责"看不出是哪条"。

3. 走查:DP-SGD 的两步怎么走

这是本章主走查的后半场,参数全部取自书中的 Opacus 示例:

设定:epsilon = 1.0, delta = 1e-5, max_grad_norm = 1.0(C), noise_multiplier = 1.1(σ)

每个训练步:
① 反向传播算出梯度
② 裁剪:梯度向量的 L2 范数若超过 C=1.0,按比例缩回 1.0
—— 效果:再罕见的样本,单步影响也被压到同样上限
③ 加噪:给每个参数的梯度加上 N(0, (1.1×1.0)²) 的高斯噪声
—— 效果:任何一条样本的痕迹埋进噪声
④ 更新参数;记账器把这步的 ε 消耗记上
训练完:accountant.get_epsilon(delta=1e-5) 报出总预算消耗

图说:书中代码原样(text/27:20-70)。"make_private" 一行调用,
背后自动做裁剪、加噪、记账三件事。

两个旋钮的手感(书里的比喻):σ 是「扑克脸强度」——调高更隐私、模型更笨5; C 控制单样本最大影响力——调低更隐私,但学习信号也弱6。 库还支持反向操作:先给 target_epsilon,让它自动倒推 σ。

为什么这两步合起来管用:裁剪把「任何单条数据能改变输出的幅度」(敏感度)钉死在常数上; 第 04 章的 Laplace/高斯机制只在敏感度有界时才成立——裁剪是加噪的合法前提。 书里没有明说这层依赖,我们把它补在这里(依据:第 04 章的机制定义与本章代码的结构)。

4. 记账:会花完、不能再生的预算

ε 不是设置,是消耗品。 书里的表述:隐私预算不可再生——信息一旦通过参数泄露, 就永久地泄了7。三条记账规则:

  1. 简单相加:多次 DP 运行,ε 累加(第 04 章讲过);
  2. 更紧的账本:Rényi DP 按一族指标记账、moments accountant 跟踪隐私损失——每一步泄出去多少的累计量——的高阶矩, 比「直接相加」省预算8;
  3. 采样放大:mini-batch 训练时每条样本只参与一部分更新, 有效隐私保证反而增强——采样率越低,折扣越大9

实操口径(书里的建议):从较高的 ε 起步、逐步调低, 同时盯两个仪表——隐私指标和模型性能,找自己场景的最优点10。 ε 的量级参考(书里给的分档):ε<1 强保护、效用损失可能明显;1–3 中等;>10 弱11

5. DP 也管得上 RAG

训练侧的 DP 思想可以搬进 RAG 的三个位置12:

私有嵌入:建向量索引时就加噪(把文档过一遍 DP 机制)
私有检索:不取精确 top-k,给相似度加上 Gumbel 噪声再取前 k
——效果:谁也说不准"真正的第一名"是哪篇(可否认性)
查询扰动:查询嵌入先加噪再检索,防止按查询行为追踪意图

图说:书中给出了可跑的 private_retrieval 代码,核心一行是给分数加 Gumbel 噪声。

两条使用须知:每条查询都可能泄漏,预算要跨时间记账,不能按次清零13; 以及一个混合策略——DP 微调管通用知识,RAG 加防护管不该进权重的敏感信息14。 这句是第 03 章「知识放哪」之问的防护侧答案。

6. 先把考题造好:合成数据

在给模型做 DP 之前,得先能测出「DP 到底起没起作用」。书里在这一章插了一节方法论: 用合成数据当考题。理由有三:真实世界的泄漏靠多属性拼图,单一可预测数据 (如固定格式的社保号)测不出差异;合成数据让 ASR 这类指标有连续的变化区间, 不再只有 0 和 1;DP、k-匿名这类技术的效果本来就要在多样数据上才显出来15。 合成数据的完整用法(以及它的局限)在第 08 章展开。

判断(我们的,不是书里的): 本章真正的难点不是代码,是选 ε。 书给了量级带和「从高往低调」的流程,但没有回答组织层面的问题: 谁有权决定「把 ε 从 1 放宽到 4」?这本质是拿用户隐私换模型性能的管理决策, 书把它留给了第 12、13 章的伦理与法律框架——两章之间缺一个衔接: 隐私预算的审批应该是个治理问题,不只是调参问题。 如果错,会错在: 如果 ε 的选择真有公认的技术最优解, 那它就不该上升到治理层面;但目前学界对「多少算够」并无共识,这条担心仍成立。

7. 作者的判断与证据

书里给的是可复现实验:泄密实验的代码、训练输出、DP-SGD 全参数、 记账器用法都是原书印出的内容;「护栏可被绕过」在书中有第 10 章的攻击方法呼应。

作者的推测要分开:「更大模型更容易记罕见序列」书中以类比(笔记本、紫色松鼠)论证, 引用了缩放观察但没有给出本实验内的对照数据;「DP-SGD 是对抗『记住训练数据』这类攻击最强工具之一」 是作者的定性判断,书内未与其他防御做定量对比。

8. 边界与局限

  • 泄密实验只有 3 条训练数据、5 轮微调——刻意放大的演示; 真实场景(海量数据中夹带少量敏感信息)的提取难度更高,但书里明说「并非不可能」;
  • DP 的效用损失在 LLM 上的量化(掉多少分)书中没有系统数据,要等第 14 章案例里 「85–90% 性能」这一个数;
  • 采样放大、RDP 只讲了直觉,没有推导;
  • DP 与第 12 章的公平性有冲突(噪声对小群体伤害更大),本章未提,是全书知识的前后依赖。

9. 可带走的

  1. 三条数据、五轮微调、半句话——社保号就出来了:记住(把数据存进参数)不需要恶意,只需要容量;
  2. 模型越大越爱记罕见内容(「紫色松鼠」效应),规模本身就是风险因子;
  3. 对齐护栏能挡住直球提问,但可被绕过且难量化,不能当唯一防线;
  4. DP-SGD 两步:裁剪(敏感度封顶)+ 高斯加噪(淹没痕迹);裁剪是加噪的前提;
  5. 两个旋钮:σ(噪声倍数)管隐私强度,C(裁剪上限)管单样本影响;
  6. ε 是消耗品:每步训练都在花,RDP/moments accountant 是更省的记账法;
  7. mini-batch 采样本身送一点隐私折扣(采样放大);
  8. DP 能搬进 RAG:私有嵌入、Gumbel 噪声检索(可否认性)、查询扰动;
  9. 分工口诀:DP 微调管通用知识,带防护的 RAG 管敏感知识;
  10. 测 DP 效果要用多样合成数据当考题,别用单一固定格式的假数据。

10. 原文地图

主题原书章原文位置
五大类技术总览Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:10(搜「five major classes」)
独特病人 Alice/BobChapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:31(搜「unique patients」)
Gemma 吐出社保号Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:132(搜「987-65-4321」)
没人让它背Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:138(搜「memorize」)
紫色松鼠与规模效应Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:154(搜「purple squirrel」)
护栏只吐感叹号Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:248(搜「exclamation」)
护栏可被绕过Chapter 4. Privacy-Preserving Training Techniquestext/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:250(搜「bypassed」)
合成数据的三个理由Synthetic Data for Privacy Evaluationtext/24-fm-synthetic-data-for-privacy-evaluation.txt:81(搜「single attribute」) · text/24-fm-synthetic-data-for-privacy-evaluation.txt:83(搜「0 or 1」)
ε 分档The Mathematical Foundationtext/26-fm-the-mathematical-foundation.txt:9(搜「strong privacy」)
DP-SGD 与 OpacusImplementing DP-SGD for LLMstext/27-fm-implementing-dp-sgd-for-llms.txt:3(搜「Opacus」)
参数设定Implementing DP-SGD for LLMstext/27-fm-implementing-dp-sgd-for-llms.txt:20(搜「epsilon」) · text/27-fm-implementing-dp-sgd-for-llms.txt:52(搜「noise_multiplier」)
扑克脸与旋钮Implementing DP-SGD for LLMstext/27-fm-implementing-dp-sgd-for-llms.txt:76(搜「poker face」) · text/27-fm-implementing-dp-sgd-for-llms.txt:78(搜「max_grad_norm」)
RDP 记账Privacy Accounting in Practicetext/28-fm-privacy-accounting-in-practice.txt:5(搜「Rényi」)
moments accountant 与采样放大Privacy Accounting in Practicetext/28-fm-privacy-accounting-in-practice.txt:11(搜「moments accountant」) · text/28-fm-privacy-accounting-in-practice.txt:13(搜「Privacy amplification」)
隐私损失随 epoch 累积Trade-Offs and Considerationstext/29-fm-trade-offs-and-considerations.txt:9(搜「cumulative」)
从高 ε 起步Trade-Offs and Considerationstext/29-fm-trade-offs-and-considerations.txt:13(搜「higher」)
RAG 三个 DP 注入点Applying Differential Privacy to Retrieval-Augmented Generationtext/30-fm-applying-differential-privacy-to-retrieval-augme.txt:14(搜「Private embeddings」)
Gumbel 噪声检索Applying Differential Privacy to Retrieval-Augmented Generationtext/30-fm-applying-differential-privacy-to-retrieval-augme.txt:39(搜「Gumbel」)
跨时间记账与混合策略Applying Differential Privacy to Retrieval-Augmented Generationtext/30-fm-applying-differential-privacy-to-retrieval-augme.txt:49(搜「each query potentially leaks」) · text/30-fm-applying-differential-privacy-to-retrieval-augme.txt:53(搜「hybrid approach」)

Footnotes

  1. 出处:「Chapter 4. Privacy-Preserving Training Techniques」第 132 段(text/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:132,搜「987-65-4321」)。三条训练数据与 prompt 原文在 :81-125。

  2. 出处:「Chapter 4. Privacy-Preserving Training Techniques」第 154 段(text/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:154,搜「purple squirrel」)。笔记本类比与「unusual things stick in memory」为原文。

  3. 出处:「Chapter 4. Privacy-Preserving Training Techniques」第 248 段(text/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:248,搜「exclamation」)。对照组模型是 unsloth/Llama-3.2-1B,见 :171。

  4. 出处:「Chapter 4. Privacy-Preserving Training Techniques」第 250 段(text/23-ch04-chapter-4-privacy-preserving-training-techniques.txt:250,搜「bypassed」)。

  5. 出处:「Implementing DP-SGD for LLMs」第 76 段(text/27-fm-implementing-dp-sgd-for-llms.txt:76,搜「poker face」)。

  6. 出处:「Implementing DP-SGD for LLMs」第 78 段(text/27-fm-implementing-dp-sgd-for-llms.txt:78,搜「max_grad_norm」)。

  7. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 174 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:174,搜「cannot be replenished」)。

  8. 出处:「Privacy Accounting in Practice」第 5 段(text/28-fm-privacy-accounting-in-practice.txt:5,搜「Rényi」)与第 11 段(text/28-fm-privacy-accounting-in-practice.txt:11,搜「moments accountant」)。

  9. 出处:「Privacy Accounting in Practice」第 13 段(text/28-fm-privacy-accounting-in-practice.txt:13,搜「Privacy amplification」)。

  10. 出处:「Trade-Offs and Considerations」第 13 段(text/29-fm-trade-offs-and-considerations.txt:13,搜「higher」)。

  11. 出处:「The Mathematical Foundation」第 9 段(text/26-fm-the-mathematical-foundation.txt:9,搜「strong privacy」)。

  12. 出处:「Applying Differential Privacy to Retrieval-Augmented Generation」第 14-25 段(text/30-fm-applying-differential-privacy-to-retrieval-augme.txt:14,搜「Private embeddings」)。

  13. 出处:「Applying Differential Privacy to Retrieval-Augmented Generation」第 49 段(text/30-fm-applying-differential-privacy-to-retrieval-augme.txt:49,搜「each query potentially leaks」)。

  14. 出处:「Applying Differential Privacy to Retrieval-Augmented Generation」第 53 段(text/30-fm-applying-differential-privacy-to-retrieval-augme.txt:53,搜「hybrid approach」)。

  15. 出处:「Synthetic Data for Privacy Evaluation」第 81 段(text/24-fm-synthetic-data-for-privacy-evaluation.txt:81,搜「single attribute」)与第 83 段(text/24-fm-synthetic-data-for-privacy-evaluation.txt:83,搜「0 or 1」)。