跳到主要内容

01-outline — privacy-and-security-for-large-language

原书 9 章内容章(96 个原文件里 20 个是索引、3 个是前言/版权/作者),总 65 万字符。 我们切成 14 章:前三章铺"模型为什么会泄密"(现象与解剖),中间四章是全书核心 "先测量、再保护",之后两章攻防,最后四章是伦理、法律与落地。

自查:任意两行「出去时知道」不是同一件事;每章一条主走查有具体输入。

拆的原书章进来时以为 → 出去时知道
01 为什么这本书存在Ch1进来以为「AI 隐私」是法律话题 → 出去知道模型本身就会记住并吐出训练数据,三类风险(数据/模型/输出)各有真实事故,而且都不需要"黑客"出场
02 模型的解剖Ch2 前半进来以为大模型是个黑箱 → 出去知道一条文本被切成 token、变成向量、靠注意力互相看、受上下文窗口约束的完整流水线,以及 MoE 把模型拆成专家后新增的泄漏通道
03 教模型的两种功夫Ch2 后半进来以为模型能力靠训练即可 → 出去知道预训练/微调/RLHF/RAG 各自在哪一步把数据"写进"模型,以及为什么微调过的模型可能被半句话钓出 SSN
04 隐私怎么测量Ch3 前半进来以为隐私是"感觉安全" → 出去知道 ε 差分隐私的相邻数据集定义、privacy loss 的两模型对照测法、k-匿名的"藏进人堆"与它的两个已知攻击
05 安全怎么测量Ch3 后半进来以为安全测试就是试试越狱 → 出去知道成员推断(困惑度法/重复提问法)和数据提取攻击怎么操作化,ASR/FPR/重建误差怎么算,评估器只能测已知风险的边界
06 训练时加噪:差分隐私Ch4(DP 部分)进来以为 DP 只是加噪声 → 出去知道"裁剪每个样本的影响再按 σC 加高斯噪声"的两步机制、ε 会随训练累积且不可再生、LoRA 让同样的 ε 便宜得多
07 数据不动模型动:FL/HE/MPCCh4(FL/HE/MPC)进来以为保护数据只有"别集中"一条路 → 出去知道三条互补路线各自的机制与代价:FL 只传更新(但通信量 10–100 倍)、HE 密文上计算(慢到只敢用于推理)、MPC 秘密分享(参与方 <10 才现实)
08 少动参数、洗净数据Ch4(PEFT/数据变换)进来以为微调必动全模型 → 出去知道 LoRA 只训 0.6% 参数的原理、匿名化要"一致替换"而非乱码、合成数据能测隐私但书里自己承认那种加噪不构成严格 DP
09 锁好门再上线Ch5进来以为部署就是起个服务 → 出去知道三层同心圆(基础设施/访问控制/运行时),一条 API 请求要过 WAF、JWT、权限、验证、限流五道闸,以及模型服务器为何绝不能直连公网
10 攻击面:从越狱到嵌入空间Ch6(攻击)进来以为攻击=写个坏 prompt → 出去知道白盒/黑盒/灰盒与四维分类,GCG 如何用梯度逐 token 造出万能后缀,agent 的知识库投毒为何最难发现
11 防守:鲁棒化与红队Ch6(防御)进来以为防守靠过滤输入 → 出去知道对抗训练(内层造攻击外层更新)、TRADES 的显式权衡、可认证鲁棒性、红队的人机分工与自动多轮对抗
12 微调的伦理:偏见与可解释Ch7进来以为公平和隐私是同向的美德 → 出去知道两者会打架(DP 噪声对少数群体伤害更大),五种公平度量的不同口径,以及"探针"怎么只靠推理就审计出内部偏见
13 法律与社会图景Ch8进来以为合规就是条文 → 出去知道版权两问(侵权?有著作权?)、纽约偏见审计法、起搏器数据案,以及"技术-法律解决方案主义"为何行不通
14 落地:医疗与法律案例Ch9进来以为 DP/FL 还是论文技术 → 出去知道医疗案例的完整链路(合成数据→LoRA→DP-SGD→RDP 记账→ε=1.0)与律所联邦学习,以及组织要付出的 10–100 倍算力与 6–12 个月人才账

总纲主线(第 3 节用):模型从数据学到能力的那条通道,天然也是数据泄漏的通道; 全书就是给这条通道装上「测量(04/05)→ 训练侧防护(06/07/08)→ 部署侧防护(09)→ 攻击检验(10/11)→ 伦理与法律边界(12/13)→ 真实落地(14)」的一整套工程。