落地 — 医疗与法律两个案例,以及组织的隐私能力账本
这一章讲三件事: 医疗案例的全链路(从合成数据到 ε=1.0); 法律案例(律所联邦学习)怎么满足「连匿名化 都禁止」的行业; 以及把技术变成组织能力要付的三笔账(算力、人才、时间)。 这是全书的收束章:前面每一章的一个零件,在这里被装进同一台机器。
1. 先看现象:「删了名字」的病历还是能认出人
医疗 AI 的特殊难点有个名字:马赛克识别(mosaic identification)—— 单看每条信息都无害,拼起来锁定真人1。
书里的例子:一段临床笔记提到一种罕见遗传病、特定年龄段、特定地点、一组独特症状—— 没有任何一条带名字,但在小社区里,符合全部条件的可能只有一个人。
所以传统去标识(删姓名删证件号)对 AI 训练数据不够用: 模型学的是整段模式,而模式本身就是指纹。这个概念把第 04 章(k-匿名的「拼图认人」) 和第 08 章(匿名化的局限)正式接在了一起。
2. 走查:医疗案例的全链路
主走查。目标:在不碰真实病人数据的前提下,微调一个能写临床评估的小模型。 参数全部取自书中代码:
第 1 步 造合成数据:64 条合成临床笔记
(姓名取自常见姓氏库、生日随机生成、病症从标准诊断分类里抽)
——不是把真名字换成假名字,是整条虚构
第 2 步 选模型:Llama 3.2 1B(小,所以 DP 付得起)
第 3 步 装 LoRA 适配器:r=8、alpha=16、dropout=0.1
——可训练参数只占零头,基座完全冻结
第 4 步 DP-SGD 训练:梯度范数裁剪到 1.0,
叠加 N(0, (1.0×1.0)²) 高斯噪声,学习率 1e-4
第 5 步 RDP 记账:sample_rate = 4/64,sigma = 1.0,delta = 1e-5,
accountant.get_epsilon 报出总预算
结果:ε ≈ 1.0 的形式化隐私保证
图说:第 1 步来自第 08 章,第 3 步来自第 08 章,第 4 步来自第 06 章,
第 5 步来自第 06 章——这就是"全书合体"的含义。
(出处:64 条合成数据见 text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:77,
搜「Synthea」旁的合成讨论;LoRA 配置见 :114;DP 训练见 :154;记账见 :192。)
ε=1.0 到底承诺了什么(书里给的白话解释): 任何一条训练样本加入或移除,模型任何输出的概率至多变化 e 倍(约 2.718 倍)2。 书里诚实地说:听起来不惊艳,配合 δ 之后在实践中相当强。 剂量怎么调:人群研究可放宽 ε 换效用;直接影响个体诊疗的模型可能要压到 ε≤0.13。
两个生产级提醒:更高级的合成数据用联邦方式生成——多家医院协作造合成集, 谁也不用交出真实数据4;以及每次模型更新都消耗新预算—— 医疗知识在演化,模型要常更,ε 是长期资产,要跨版本做预算规划5。
3. 法律案例:连「匿名化后共享」都被禁止的行业
法律行业的约束比医疗更狠:律师-客户特权禁止披露客户信息—— 书里特别指出,连「匿名化/聚合后」的披露都可能违规6。 集中式训练在这里连第一步都迈不出去。
联邦学习的解法(第 07 章机制的实装):每家律所本地训练自己的 LoRA 适配器 (不是全模型),只把适配器权重交给中央服务器做平均;本地训练全程套 DP-SGD。 书里给这套架构的定性是深度防御:就算共享出去的权重被对手拿到, 里面也只有「差分隐私化」的表征——被证明过无法还原任何个案7。 更强的版本(书里点到):聚合步骤用 MPC/同态加密做安全聚合,服务器连平均前的 单家权重都看不到8。
行业特有的三个问题,书里逐一给了答案:
- 审计义务:原始数据留在各所,共享的只有 DP 适配器——「共享了什么」本身可写成文档向监管交代9;
- 利益冲突:对手律所会不会从共享模型里吸走我的办案策略?——DP 噪声可证明地限制了任何单所对共享模型的影响10;
- 投毒:恶意参与方污染共享模型?——DP 挡一部分,生产还要加拜占庭容错聚合与参与方审查11。
效用账(书里的结论):文档摘要这类任务恰好适合联邦+隐私训练—— 它需要的是多样文风,不需要逐字精确;已落地的律所反馈协作收益大于隐私带来的性能损失12。 架构还附赠韧性:聚合服务器挂了,各所本地模型照常工作13。
4. 组织的账本:把技术变成能力
案例跑通≠组织会用。书里给的三笔账,每笔都有数:
算力账:FL 的网络流量是集中式 10–100 倍(第 07 章讲过); DP-SGD 通常比标准 SGD 慢 10–100 倍,ε<1 时更糟;HE 更是慢 1 万到 100 万倍 ( 所以云加速有吸引力,尽管数据要出)14。基础设施总成本通常高 2–10 倍15。
人才账:要的组合是 ML+密码学+隐私理论+合规——市面稀缺; 书里给的行情:高级隐私 AI 工程师薪资比传统 ML 岗溢价 20–50%, 有经验的 ML 工程师转型要6–12 个月上手16。 还点名一种罕见技能:能把「ε=1.0 的差分隐私」「诚实但好奇的对手」 讲给业务、法务和审计听的沟通能力17。
路线账:分阶段,别全面转型。书里给的试点画像——医疗从「合成数据+LoRA (可训参数减 99%)的临床笔记分析」起步;金融从「跨产品线的欺诈检测联邦学习」起步, 参与方 50–100 家18。技术栈点名三个开源底座:OpenDP(带形式化证明)、 PySyft(联邦学习,号称支持 1000+ 节点)、TensorFlow Privacy(内置记账)19。
度量:成功指标要同时有技术侧(ε 消耗、效用-隐私曲线、联邦收敛轮数) 和业务侧(风险降低、合规收益、竞争差异);开发流程里嵌入第 13 章说的 算法影响评估(AIA)检查点——隐私专家参与架构决策,合规监控跟踪预算消耗20。
5. 作者的判断与证据
书里给了完整链路的:医疗案例从数据生成到 ε 报告全部有代码; 法律案例的架构与行业约束分析具体到条款层面;三笔账的数字(10–100 倍、20–50%、6–12 个月、2–10 倍)均为书中给出。
作者的展望(按书中原样写明为趋势判断,不是事实):量子计算对现有加密 (RSA-2048/ECC-256)的威胁预计在 2030–2035 年成真,NIST 已在推进后量子密码迁移, 而量子算法也可能反过来加速隐私协议21;边缘设备(4–32 GB 内存、1–100 TOPS 算力) 已经能跑 10 亿级模型的联邦学习客户端22;到 2030 年,差分隐私会变成训练里的常规组件——像那些今天已没人专门讨论的老组件一样平常, 云厂商会提供一键选 ε 的隐私训练服务23。
判断(我们的,不是书里的): 总结全书,两个案例选择的行业不是随机的—— 医疗和法律是「数据垄断」最极端的行业:数据价值最高、共享禁令最严。 隐私技术真正的市场,不在「让我们少担责」,而在「让原本不可能的数据协作发生」—— 作者那句「隐私从约束变成赋能」落点就在这。用第 07 章的话说: FL 让「不可能的协作」成为可能。判据也已经在书里:律所反馈协作收益>隐私损失, 这才是这类技术被采用的真实条件,而不是合规压力。 如果错,会错在: 如果合规压力才是主要买单理由(罚款>部署成本), 那这些技术的演化方向会朝「最低合规成本」而不是「最大协作价值」倾斜, 书里对 2030 年的乐观预测就要打折。
6. 边界与局限
- 两个案例都是教学规模的演示(64 条合成数据、合成律所数据), 书里明示真实部署要复杂得多;「85–90% 性能」是书中给的量级判断,未附完整实验表;
- 医疗案例的合成数据生成器本身没有形式化保证(第 08 章的坦白在这里依然适用);
- 法律案例没有处理「参与方退出后其贡献如何撤回」的问题;
- 量子时间表(2030–2035)是作者的判断,该领域预测历史偏差很大;
- 案例未涉及多模态(影像、语音)医疗数据,而那恰是医疗 AI 的主战场之一。
7. 可带走的
- 马赛克识别:每条信息无害、拼起来锁定真人——传统去标识对 AI 训练数据不够用;
- 医疗全链五步:合成数据(64 条)→ Llama 3.2 1B → LoRA(r=8)→ DP-SGD(裁剪 1.0/噪声 1.0)→ RDP 记账;
- ε=1.0 的白话:任何一条样本进出,任何输出概率至多变 e≈2.718 倍;
- ε 的剂量按利害定:人群研究可放宽,直接影响个体的诊疗模型要 ≤0.1;
- ε 要跨版本规划:每次模型更新都消耗新预算,医疗模型要常更;
- 法律行业连匿名化共享都禁止——联邦学习+DP 适配器是唯一通路;
- 「深度防御」实例:共享权重即使泄露,也只有差分隐私化的表征;
- DP 同时解决律所的利益冲突顾虑:单所对共享模型的影响被证明有限;
- 三笔账:DP-SGD 慢 10–100 倍、人才溢价 20–50%、建设周期 6–12 个月;
- 试点画像:合成数据+LoRA 起步;OpenDP/PySyft/TensorFlow Privacy 是三个开源底座;
- 隐私技术的真市场是「让不可能的协作发生」,不是「少担责」。
8. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 马赛克识别 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:23(搜「mosaic」) |
| 拼图锁定个人的例子 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:25(搜「rare genetic condition」) |
| 合成临床笔记与 Synthea | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:77(搜「Synthea」) |
| 小模型更适合 DP | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:81(搜「tractable」) |
| Yu et al. 框架:DP 只加在新参数 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:87(搜「not to the full model」) |
| LoRA r=8 配置 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:114(搜「r=8」) |
| 裁剪与噪声机制 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:118(搜「gradient clipping」) |
| RDP 记账与 ε 报告 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:192(搜「get_epsilon」) |
| ε=1.0 即 2.718 倍 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:195(搜「2.718」) |
| ε≤0.1 的场景 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:202(搜「0.1 or lower」) |
| 联邦合成数据 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:206(搜「federated synthetic」) |
| 更新消耗预算 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:212(搜「each update consumes」) |
| 律师-客户特权 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:223(搜「attorney-client privilege」) |
| 只共享适配器权重 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:237(搜「adapter weights」) |
| 深度防御定性 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:311(搜「defense in depth」) |
| MPC/HE 安全聚合 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:316(搜「averaging」) |
| 审计轨迹 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:341(搜「audit trails」) |
| 利益冲突与 DP | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:349(搜「conflicts of interest」) |
| 拜占庭容错 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:351(搜「Byzantine」) |
| 协作收益大于损失 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:361(搜「law firms implementing」) |
| DP-SGD 慢 10–100 倍 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:375(搜「10」) |
| 诚实但好奇的对手 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:378(搜「honest but curious」) |
| 试点画像 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:380(搜「99%」) |
| 三个开源底座 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:390(搜「OpenDP」) |
| HE 慢 1 万–100 万倍 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:391(搜「10,000」) |
| 成本 2–10 倍 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:401(搜「2」) |
| 量子威胁时间表 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:413(搜「Shor」) |
| 边缘设备跑联邦 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:415(搜「TOPS」) |
| DP 像批归一化一样 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:433(搜「batch normalization」) |
| 总结:85–90% 性能 | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:454(搜「85」) |
| 总结:production ready | Chapter 9. Building Privacy-Preserving AI Capabilities | text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:450(搜「production ready」) |