跳到主要内容

落地 — 医疗与法律两个案例,以及组织的隐私能力账本

这一章讲三件事: 医疗案例的全链路(从合成数据到 ε=1.0); 法律案例(律所联邦学习)怎么满足「连匿名化都禁止」的行业; 以及把技术变成组织能力要付的三笔账(算力、人才、时间)。 这是全书的收束章:前面每一章的一个零件,在这里被装进同一台机器。

1. 先看现象:「删了名字」的病历还是能认出人

医疗 AI 的特殊难点有个名字:马赛克识别(mosaic identification)—— 单看每条信息都无害,拼起来锁定真人1

书里的例子:一段临床笔记提到一种罕见遗传病、特定年龄段、特定地点、一组独特症状—— 没有任何一条带名字,但在小社区里,符合全部条件的可能只有一个人。

所以传统去标识(删姓名删证件号)对 AI 训练数据不够用: 模型学的是整段模式,而模式本身就是指纹。这个概念把第 04 章(k-匿名的「拼图认人」) 和第 08 章(匿名化的局限)正式接在了一起。

2. 走查:医疗案例的全链路

主走查。目标:在不碰真实病人数据的前提下,微调一个能写临床评估的小模型。 参数全部取自书中代码:

第 1 步 造合成数据:64 条合成临床笔记
(姓名取自常见姓氏库、生日随机生成、病症从标准诊断分类里抽)
——不是把真名字换成假名字,是整条虚构
第 2 步 选模型:Llama 3.2 1B(小,所以 DP 付得起)
第 3 步 装 LoRA 适配器:r=8、alpha=16、dropout=0.1
——可训练参数只占零头,基座完全冻结
第 4 步 DP-SGD 训练:梯度范数裁剪到 1.0,
叠加 N(0, (1.0×1.0)²) 高斯噪声,学习率 1e-4
第 5 步 RDP 记账:sample_rate = 4/64,sigma = 1.0,delta = 1e-5,
accountant.get_epsilon 报出总预算
结果:ε ≈ 1.0 的形式化隐私保证

图说:第 1 步来自第 08 章,第 3 步来自第 08 章,第 4 步来自第 06 章,
第 5 步来自第 06 章——这就是"全书合体"的含义。

(出处:64 条合成数据见 text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:77, 搜「Synthea」旁的合成讨论;LoRA 配置见 :114;DP 训练见 :154;记账见 :192。)

ε=1.0 到底承诺了什么(书里给的白话解释): 任何一条训练样本加入或移除,模型任何输出的概率至多变化 e 倍(约 2.718 倍)2。 书里诚实地说:听起来不惊艳,配合 δ 之后在实践中相当强。 剂量怎么调:人群研究可放宽 ε 换效用;直接影响个体诊疗的模型可能要压到 ε≤0.13

两个生产级提醒:更高级的合成数据用联邦方式生成——多家医院协作造合成集, 谁也不用交出真实数据4;以及每次模型更新都消耗新预算—— 医疗知识在演化,模型要常更,ε 是长期资产,要跨版本做预算规划5

3. 法律案例:连「匿名化后共享」都被禁止的行业

法律行业的约束比医疗更狠:律师-客户特权禁止披露客户信息—— 书里特别指出,连「匿名化/聚合后」的披露都可能违规6。 集中式训练在这里连第一步都迈不出去。

联邦学习的解法(第 07 章机制的实装):每家律所本地训练自己的 LoRA 适配器 (不是全模型),只把适配器权重交给中央服务器做平均;本地训练全程套 DP-SGD。 书里给这套架构的定性是深度防御:就算共享出去的权重被对手拿到, 里面也只有「差分隐私化」的表征——被证明过无法还原任何个案7。 更强的版本(书里点到):聚合步骤用 MPC/同态加密做安全聚合,服务器连平均前的 单家权重都看不到8

行业特有的三个问题,书里逐一给了答案:

  • 审计义务:原始数据留在各所,共享的只有 DP 适配器——「共享了什么」本身可写成文档向监管交代9;
  • 利益冲突:对手律所会不会从共享模型里吸走我的办案策略?——DP 噪声可证明地限制了任何单所对共享模型的影响10;
  • 投毒:恶意参与方污染共享模型?——DP 挡一部分,生产还要加拜占庭容错聚合与参与方审查11

效用账(书里的结论):文档摘要这类任务恰好适合联邦+隐私训练—— 它需要的是多样文风,不需要逐字精确;已落地的律所反馈协作收益大于隐私带来的性能损失12。 架构还附赠韧性:聚合服务器挂了,各所本地模型照常工作13

4. 组织的账本:把技术变成能力

案例跑通≠组织会用。书里给的三笔账,每笔都有数:

算力账:FL 的网络流量是集中式 10–100 倍(第 07 章讲过); DP-SGD 通常比标准 SGD 慢 10–100 倍,ε<1 时更糟;HE 更是慢 1 万到 100 万倍 (所以云加速有吸引力,尽管数据要出)14。基础设施总成本通常高 2–10 倍15

人才账:要的组合是 ML+密码学+隐私理论+合规——市面稀缺; 书里给的行情:高级隐私 AI 工程师薪资比传统 ML 岗溢价 20–50%, 有经验的 ML 工程师转型要6–12 个月上手16。 还点名一种罕见技能:能把「ε=1.0 的差分隐私」「诚实但好奇的对手」 讲给业务、法务和审计听的沟通能力17

路线账:分阶段,别全面转型。书里给的试点画像——医疗从「合成数据+LoRA (可训参数减 99%)的临床笔记分析」起步;金融从「跨产品线的欺诈检测联邦学习」起步, 参与方 50–100 家18。技术栈点名三个开源底座:OpenDP(带形式化证明)、 PySyft(联邦学习,号称支持 1000+ 节点)、TensorFlow Privacy(内置记账)19

度量:成功指标要同时有技术侧(ε 消耗、效用-隐私曲线、联邦收敛轮数) 和业务侧(风险降低、合规收益、竞争差异);开发流程里嵌入第 13 章说的 算法影响评估(AIA)检查点——隐私专家参与架构决策,合规监控跟踪预算消耗20

5. 作者的判断与证据

书里给了完整链路的:医疗案例从数据生成到 ε 报告全部有代码; 法律案例的架构与行业约束分析具体到条款层面;三笔账的数字(10–100 倍、20–50%、6–12 个月、2–10 倍)均为书中给出。

作者的展望(按书中原样写明为趋势判断,不是事实):量子计算对现有加密 (RSA-2048/ECC-256)的威胁预计在 2030–2035 年成真,NIST 已在推进后量子密码迁移, 而量子算法也可能反过来加速隐私协议21;边缘设备(4–32 GB 内存、1–100 TOPS 算力) 已经能跑 10 亿级模型的联邦学习客户端22;到 2030 年,差分隐私会变成训练里的常规组件——像那些今天已没人专门讨论的老组件一样平常, 云厂商会提供一键选 ε 的隐私训练服务23

判断(我们的,不是书里的): 总结全书,两个案例选择的行业不是随机的—— 医疗和法律是「数据垄断」最极端的行业:数据价值最高、共享禁令最严。 隐私技术真正的市场,不在「让我们少担责」,而在「让原本不可能的数据协作发生」—— 作者那句「隐私从约束变成赋能」落点就在这。用第 07 章的话说: FL 让「不可能的协作」成为可能。判据也已经在书里:律所反馈协作收益>隐私损失, 这才是这类技术被采用的真实条件,而不是合规压力。 如果错,会错在: 如果合规压力才是主要买单理由(罚款>部署成本), 那这些技术的演化方向会朝「最低合规成本」而不是「最大协作价值」倾斜, 书里对 2030 年的乐观预测就要打折。

6. 边界与局限

  • 两个案例都是教学规模的演示(64 条合成数据、合成律所数据), 书里明示真实部署要复杂得多;「85–90% 性能」是书中给的量级判断,未附完整实验表;
  • 医疗案例的合成数据生成器本身没有形式化保证(第 08 章的坦白在这里依然适用);
  • 法律案例没有处理「参与方退出后其贡献如何撤回」的问题;
  • 量子时间表(2030–2035)是作者的判断,该领域预测历史偏差很大;
  • 案例未涉及多模态(影像、语音)医疗数据,而那恰是医疗 AI 的主战场之一。

7. 可带走的

  1. 马赛克识别:每条信息无害、拼起来锁定真人——传统去标识对 AI 训练数据不够用;
  2. 医疗全链五步:合成数据(64 条)→ Llama 3.2 1B → LoRA(r=8)→ DP-SGD(裁剪 1.0/噪声 1.0)→ RDP 记账;
  3. ε=1.0 的白话:任何一条样本进出,任何输出概率至多变 e≈2.718 倍;
  4. ε 的剂量按利害定:人群研究可放宽,直接影响个体的诊疗模型要 ≤0.1;
  5. ε 要跨版本规划:每次模型更新都消耗新预算,医疗模型要常更;
  6. 法律行业连匿名化共享都禁止——联邦学习+DP 适配器是唯一通路;
  7. 「深度防御」实例:共享权重即使泄露,也只有差分隐私化的表征;
  8. DP 同时解决律所的利益冲突顾虑:单所对共享模型的影响被证明有限;
  9. 三笔账:DP-SGD 慢 10–100 倍、人才溢价 20–50%、建设周期 6–12 个月;
  10. 试点画像:合成数据+LoRA 起步;OpenDP/PySyft/TensorFlow Privacy 是三个开源底座;
  11. 隐私技术的真市场是「让不可能的协作发生」,不是「少担责」。

8. 原文地图

主题原书章原文位置
马赛克识别Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:23(搜「mosaic」)
拼图锁定个人的例子Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:25(搜「rare genetic condition」)
合成临床笔记与 SyntheaChapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:77(搜「Synthea」)
小模型更适合 DPChapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:81(搜「tractable」)
Yu et al. 框架:DP 只加在新参数Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:87(搜「not to the full model」)
LoRA r=8 配置Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:114(搜「r=8」)
裁剪与噪声机制Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:118(搜「gradient clipping」)
RDP 记账与 ε 报告Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:192(搜「get_epsilon」)
ε=1.0 即 2.718 倍Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:195(搜「2.718」)
ε≤0.1 的场景Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:202(搜「0.1 or lower」)
联邦合成数据Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:206(搜「federated synthetic」)
更新消耗预算Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:212(搜「each update consumes」)
律师-客户特权Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:223(搜「attorney-client privilege」)
只共享适配器权重Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:237(搜「adapter weights」)
深度防御定性Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:311(搜「defense in depth」)
MPC/HE 安全聚合Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:316(搜「averaging」)
审计轨迹Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:341(搜「audit trails」)
利益冲突与 DPChapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:349(搜「conflicts of interest」)
拜占庭容错Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:351(搜「Byzantine」)
协作收益大于损失Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:361(搜「law firms implementing」)
DP-SGD 慢 10–100 倍Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:375(搜「10」)
诚实但好奇的对手Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:378(搜「honest but curious」)
试点画像Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:380(搜「99%」)
三个开源底座Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:390(搜「OpenDP」)
HE 慢 1 万–100 万倍Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:391(搜「10,000」)
成本 2–10 倍Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:401(搜「2」)
量子威胁时间表Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:413(搜「Shor」)
边缘设备跑联邦Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:415(搜「TOPS」)
DP 像批归一化一样Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:433(搜「batch normalization」)
总结:85–90% 性能Chapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:454(搜「85」)
总结:production readyChapter 9. Building Privacy-Preserving AI Capabilitiestext/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:450(搜「production ready」)

Footnotes

  1. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 23 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:23,搜「mosaic」)。

  2. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 195 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:195,搜「2.718」)。

  3. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 202 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:202,搜「0.1 or lower」)。

  4. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 206 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:206,搜「federated synthetic」)。

  5. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 212 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:212,搜「each update consumes」)。

  6. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 223 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:223,搜「attorney-client privilege」)。原文:即使匿名化或聚合后的披露也被禁止。

  7. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 311 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:311,搜「defense in depth」)。

  8. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 316 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:316,搜「averaging」)。

  9. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 341 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:341,搜「audit trails」)。

  10. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 349 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:349,搜「conflicts of interest」)。

  11. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 351 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:351,搜「Byzantine」)。

  12. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 361 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:361,搜「law firms implementing」)。

  13. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 363 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:363,搜「resilience benefits」)。

  14. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 375 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:375,搜「10」)与第 391 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:391,搜「10,000」)。

  15. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 401 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:401,搜「2」)。

  16. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 427 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:427,搜「20」)。

  17. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 378 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:378,搜「honest but curious」)。

  18. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 380 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:380,搜「99%」)。

  19. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 390 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:390,搜「OpenDP」)。

  20. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 401 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:401,搜「privacy budget consumption」)。

  21. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 413 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:413,搜「Shor」)。

  22. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 415 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:415,搜「TOPS」)。

  23. 出处:「Chapter 9. Building Privacy-Preserving AI Capabilities」第 433 段(text/73-ch09-chapter-9-building-privacy-preserving-ai-capabil.txt:433,搜「batch normalization」)。