跳到主要内容

Reading notes — privacy-and-security-for-large-language

逐章通读笔记。行号以 library/<id>/text/*.txt 为准。

前言 Preface(text/03-fm-preface.txt)

  • 作者署名 Baihan Lin, PhD(书卡元数据写 "Baihan Lan",原书封面/版权页是 Baihan Lin),Cambridge MA,2025 年写完,O'Reilly 2026-01-12 出版。
  • 写作动机:三年前(≈2022 末 ChatGPT 出现时)他的 lab 在做临床 AI 系统、分析病人对话;真实医院网络部署撞上隐私/安全法规,现有隐私技术(为表格数据/经典 ML 设计)平移不过来:DP 书讲数据库查询、FL 书假设简单模型、HE 书只讲基本计算 → 本书补 LLM 特定实践。
  • 读者假设:中高级 ML 从业者,会 Python、深度学习框架。
  • 全书 9 章结构(作者自述):1 引言;2 LLM 基础(架构+预训练+评测);3 隐私/安全风险评测(指标+审计);4 隐私保护训练(DP/FL/HE);5 安全部署(托管、API、访问控制);6 对抗攻击与防御+red-teaming;7 微调中的伦理(偏见/公平/透明);8 文化、社会、法律图景(知识产权、隐私法、问责);9 案例研究+未来。
  • 利益相关披露:作者在 Google/IBM/Microsoft/Amazon 工作过(ch1),研究背景是"增强人机交互且保护隐私"。

Ch1 Introduction(text/04-ch01-chapter-1-introduction.txt)

  • 开场:LLM = ChatGPT/GPT-4、Gemini、Claude;训练数据"数万亿页"级;LLM 成为互联网的"压缩档案/zip 文件"(:12)。
  • 警示案例(第一章的素材库,后面各章回收):
    • NYT 诉 OpenAI/Microsoft(2023-12):数百万文章被拿去训练,无授权(:25);
    • MTA 纽约交通局数据泄漏(2021):至少 3800 万条记录暴露(员工信息+新冠疫苗/检测预约数据),微软软件配置错误;LLM 时代新增攻击向量 prompt injection 可重建专有数据与模型参数(:27);
    • 侧信道攻击解密 AI 助手回复(2024-03 Ars Technica):被动攻击者监听数据包,可推断 55% 捕获回复的主题,词级准确率高;OpenAI 加密了流量但加密方式有缺陷;已有人用来绕付费墙(:29);
    • Microsoft Tay(2016):上线 24 小时被喂冒犯数据变成种族主义机器人,紧急下线;带 RLHF 对齐的最新模型仍同病——Bing Chat gaslight 用户原话(:31-32);
    • Google Gemini 图像生成(2024):难以生成白人、"多种族纳粹";作者立场:别怪伦理 AI 工作,是 Google 没把伦理经验用对场景(引 Margaret Mitchell 的 TIME 文)(:36)。
  • 三类风险分类法(全书骨架)(:42-56):
    1. 数据隐私风险(训练数据含敏感个人信息)→ Ch3、Ch4;
    2. 模型安全风险(对抗攻击、模型反演、成员推断)→ Ch5、Ch6;
    3. 输出偏见与公平风险 → Ch7。
  • 风险可出现在 pipeline 各层:数据收集/预处理/训练/部署/推理(:56)。
  • 作者履历自述:十年+ 学术+工业(Google、IBM、Microsoft、Amazon)(:72)。
  • 引用:推荐 Hands-On Differential Privacy、Practical Data Privacy(O'Reilly)(:102)。

Ch2 Understanding LLMs(text/05 ~ text/12;Ch2 开场只有一页,真正内容是 6-12 六个小文件)

基础积木(text/06)

  • ANN:神经元=输入加权求和→激活函数;层间加权连接;调权重学映射(:7-9)。
  • RNN:一次一个 token,内部状态记"记忆";四种 NLP 任务(语言建模/翻译/情感/NER);梯度消失问题(:49)→ LSTM(记忆单元+输入/遗忘/输出三门)(:53-55)。
  • RNN/LSTM 两大致命伤:时序依赖无法并行、用不满 GPU(:67-69)→ 被 Transformer 取代。

关键概念(text/07,28k 字符,Ch2 的主体)

  • Tokenization(:25-45):word/subword(BPE、WordPiece)/character 级;OpenAI 用 Tiktoken、Llama 用 SentencePiece、BERT 用 WordPiece。隐私注意框:分词可能泄漏敏感信息,建议先匿名化/去标识再分词(:45)。
  • Chunking(:49-69):浅层解析,把词组成名词短语/动词短语等;隐私风险三条:敏感短语被聚在一起、chunk 标签本身泄密(标"Medical Condition"即暴露健康信息)、chunk 边界可能把敏感信息切开——"某个切分方式是差分隐私的,另一种分辨率的切分可能触发隐私违规"(:67)。
  • Embeddings(:73-87):高维稠密向量;king−man+woman=queen;隐私:预训练嵌入可能偏置、可被模型提取攻击、发布嵌入可能泄漏训练数据(:81)。
  • Attention(:91-120):self/cross/multihead;scaled dot-product 算 query-key 权重掩码;可解释性是一把双刃(责任 AI 用处+注意力权重可被对抗操纵)(:118-120)。
  • Context window(:124-178):BERT 512 token(≈380 词)→ GPT-3 2048 → GPT-4 Turbo 128k → Claude 3 200k → Gemini 1.5 Pro 1M(能装整本书)(:126)。长上下文四技术:sparse(Longformer/BigBird)、sliding window(Mistral)、ring attention、hierarchical。隐私三风险:更容易记住并复述训练数据长段、恶意指令可藏在长输入深处、多来源信息聚合可揭示身份/模式(:146)。缓解:分块+摘要、RAG、adaptive context selection、chunk 级 DP(:176)。
  • Transfer learning/foundation models(:182-199):fine-tuning/特征提取/知识蒸馏/域适应/多任务/meta-learning/adapter。隐私:预训练模型可能含敏感数据,微调自家数据可能泄漏预训练数据信息;从可信来源(HuggingFace)拿模型(:199)。
  • 判别式 vs 生成式(:203-217):P(y|x) vs P(x,y);生成式可被滥用造假内容→水印/指纹溯源(:217)。
  • ICL(:221-235):prompt 里给几个例子;隐私:例子可能含敏感信息→实体替换/占位符脱敏已是医疗金融惯例(:235)。
  • Zero/few-shot(:239-251):zero-shot 不给例子;few-shot 给几个;常与 RAG 组合。

Transformer 与 MoE(text/08、09)

  • Transformer:Vaswani et al. "Attention Is All You Need" (2017);encoder-decoder;self-attention 算每对词的注意力分数→加权平均嵌入(:3-11)。
  • 平方复杂度:计算/内存随序列长度平方增长 → 固定 context window 的根源;早期 512/1024,现代 128k/200k/1M(:15-17)。
  • MoE(:3-40):稠密 Transformer 每个 token 激活全部参数;MoE 按门控网络把输入路由给不同"专家"(通常是前馈网络);好处:推理省算力、专家专精、可训万亿参数模型;坏处:路由要学、负载均衡难(可能塌缩到少数专家)、部署要按全模型配内存。隐私三风险:敏感信息可能集中记忆在特定专家、专家激活模式本身可当侧信道、门控机制可被对抗操纵(gating 被诱导路由到脆弱/含敏感信息的专家)(:36-40)。GPT-4、Mixtral、DeepSeek-R1、Qwen 都是 MoE(:3)。

常见模型与训练技术(text/10-12)

  • 选型六要素(:3-27):model size、domain、预训练目标(MLM/NSP/PLM)、算力、context length、license。隐私敏感场景:开源可本地部署(Llama 3/Mistral)优于 API,但要自己担安全专长(:69)。
  • 模型清单(:31-63):BERT(MLM+NSP)、GPT(causal LM;gpt-oss 20B/120B)、T5(text-to-text)、Llama(Llama 4 最新;Llama-3.2-1B-Instruct 小而好)、Phi(Phi-4)、Mistral-7B、DeepSeek-R1、Qwen。引用 DeepSeek-R1 Nature 2025 论文。
  • 预训练技术(text/11):MLM(随机 mask 15% 预测被遮 token,双向表征;BERT 固定 15%,后续研究试动态比率)(:7-17);NSP(判断两句是否相连;RoBERTa 去掉 NSP 反而更好)(:21-31);PLM(输入随机排列,预测原位置,学位置信息,计算更贵)(:35-45)。
  • 微调(text/12):
    • 全量微调:全参数更新,学习率调低防灾难性遗忘;适合数据多+算力够;缺点:算力、存储(每个任务一份全模型)(:9-23)。
    • PEFT(:27-50):adapter 层(插入 Transformer 层间,只训 adapter)、LoRA(注意力层加低秩矩阵,只训 0.1–1% 参数;Ch4 详讲)、prefix/prompt tuning(前置可学向量,BitFit(只训 bias)。"80–90% 全量微调性能,成本零头"(:56)。隐私:PEFT 保持基座不变→基座当可信组件,只审计小模块(:50)。
    • 指令微调(:67-91):instruction-response 对;GPT-4/Claude/Llama 2-Chat 都是;数据要覆盖任务类型/指令多样性/回复质量/拒答安全。
    • RLHF 三阶段(:95-127):SFT→奖励模型(人类比较输出对)→RL(典型 PPO)最大化奖励同时防漂移。风险:标注人群的偏见会被放大;"helpful"反映标注团队价值观;同一基座不同组织 RLHF 出不同行为。
    • 微调引入的隐私风险(:129-135):①训练样本被记忆(尤其罕见样本),PII 可被精心构造的 prompt 榨出;②访问微调模型的对手可推断/重构训练数据(小数据集每条样本影响更大);③行为泄漏——模型输出无意间暴露领域特征(在内部文档上微调→输出泄露内部流程术语)。
    • RAG(:139-201):三组件 retriever(向量库+稠密嵌入)/知识库/generator;五步流程 query→retrieval(top-k,毫秒级)→context construction→generation→response。chunk 200–500 token;检索 3–10 篇。RAG vs fine-tuning:知识放外面还是参数里;常组合(微调管行为,RAG 管知识)(:193)。RAG 隐私:攻击面更大;嵌入模型被攻破→对手可定向检索敏感文档;观察检索结果可泄漏知识库内容;引用来源会泄漏文档标题/元数据(:197-201)。

Ch3 Evaluating the Privacy and Security Risks of LLMs(text/13 ~ text/22;开场在 13,指标+模拟攻击+审计器)

开场(text/13)

  • "体检"比喻:测的不是血压,是"保守秘密+抵御捣乱"的能力(:5)。
  • LLM 特有隐私挑战:生成能力→可能逐字复述训练段落(regurgitation);参数量大→记忆机会多;RAG 引入检索库暴露向量;system prompt 泄漏(prompt 诱导吐出系统指令)(:17)。
  • 隐私指标:DP、privacy loss、k-anonymity;安全指标:ASR、成员推断 FPR、模型反演重建误差。

差分隐私 DP(text/14)

  • 派对披萨比喻:能如实回答"有人吃了最后一块披萨"但不指认是谁(:5)。
  • 形式化:对只差一个元素的相邻数据集 D1/D2,P(M(D1)∈S) ≤ exp(ε)·P(M(D2)∈S)(:11)。ε=隐私预算:ε<1 强隐私,ε=10 弱;小 ε→噪声大→效用降(:15)。
  • 可组合性:多次 ε-DP 运行总损失=各 ε 之和;现代记账用 RDP/moments accountant 更紧(:56-59)。
  • Laplace 机制:噪声 ∝ sensitivity/ε;书里代码例子:真实值 1000 块披萨、sensitivity=1、ε=0.1 → 输出在 1000 附近抖动(:79-93)。
  • LLM 应用:训练时给梯度加噪 = DP-SGD;挑战:ε 与效用平衡;仍是对抗记忆攻击最强工具之一(:101-103)。

Privacy loss(text/15)

  • 定义:L = ln(P(M(D)=o)/P(M(D′)=o))——DP 里的 ε 本质上就是对数似然比的界(:9-13)。
  • 操作化:训两个模型(含敏感数据/不含),同一输入查询,对比输出概率(:48-62)。
  • 例:输入 "The patient's prescribed medication is" 对比两个模型(:92-100)。
  • 用途:监控训练/推理时的 privacy loss,高的 prompt 说明模型把某些样本记得太牢→易被提取攻击(:110)。

k-anonymity(text/16)

  • 每条记录与至少 k−1 条其他记录在准标识符上不可区分;"藏在人堆里"(:3)。
  • 代码例子:age+zip 分组,4 人数据集得 2-anonymity(:26-39)。工具:ARX、Mondrian(:43)。
  • 大数据集挑战:缺失数据/离群记录难匿名/高维难找 k 人组/隐私-效用权衡(:45-49)。
  • LLM 适配:微调数据保证任何独特短语出现在 ≥k 篇文档;RAG 检索库做"文档级 k-anonymity"(独特文档不入库);数据策展时把罕见词换成常见词(:51-55)。
  • 两个已知攻击:同质性攻击(组内 k 人敏感属性相同→仍可推断)、背景知识攻击(外部信息辅助定位)→ 补 l-diversity(组内敏感属性至少一个不同值)、t-closeness(组内敏感属性分布接近全局)(:59-74)。
  • 现代实践:大规模偏好 DP;静态数据集 k-anonymity+l-diversity/t-closeness(:76-80)。

RAG 的隐私(text/17)

  • 三类 RAG 特有隐私向量(:9-19):①向量数据库暴露(嵌入可重建敏感内容);②检索模式泄漏(哪些文档常被一起检索→私有关联);③文档归因(引用来源暴露机密文档;已有案例:RAG 系统泄 API key、license 信息)。
  • 缓解(:23-31):检索过程扩展 DP(测检索模式的 privacy loss)、文档 k-anonymity、嵌入生成时加校准噪声(私有嵌入)、检索混淆(不取精确 top-k,按相似度加权分布采样)、查询扰动(查询嵌入加噪)、细粒度访问控制。
  • LLM 生成式特有(:37-49):逐字复述(regurgitation)、prompt 诱导提取、嵌入空间泄漏。

安全指标(text/18-20)

  • ASR(:3-58):攻击成功率=成功次数/总次数;例:6 次攻击 4 成功→0.67。建议建 Golden Dataset(策划好的攻击集,持续更新)做版本对比(:7)。四维分层:攻击类型(注入/越狱/提取)、自动化 vs 手工、攻击目标、成功标准(完全绕过 vs 部分利用)(:47-56)。大模型:可利用模式更多(攻击面大)但复杂度带来更强内在防御(:58)。
  • 成员推断 FPR(:3-37):成员推断=判断某数据点是否在训练集;医疗 LLM 例子:即使数据匿名过,能判断"哪些记录进了训练集"本身就构成隐私破坏(:5)。FPR=非成员被误判为成员的比例;例子 0.4(:31-35)。
  • 模型反演重建误差(:3-46):LLM 场景=从模型恢复训练文本;攻击法:prompt 工程("Continue this text: [partial]")、白盒梯度法、perplexity 分析(:13)。度量:字符/词级编辑距离(Levenshtein)、BLEU、ROUGE;数值用 MSE。例子 MSE 0.0220(:37-40)。误差越高数据越安全。

模拟攻击(text/21)

  • Red team 概念;业界:OpenAI 专职红队、Anthropic Constitutional AI+红队、Google PaLM/Gemini 对抗测试、Meta Llama 红队流程(:7-14)。
  • 攻击清单(:19-42):membership inference、data extraction/model inversion、jailbreaking、prompt injection、system prompt extraction、adversarial examples。
  • 成员推断两种操作化(:56-185):
    1. Perplexity 困惑度攻击:困惑度=模型对输入的"惊讶度";低困惑度=见过=可能在训练集;代码:threshold=10,n_attempts=100,统计低于阈值的比例作"置信分"(:62-85)。边界情况:通用常识文本困惑度接近→固定阈值不行→动态阈值(拿非训练数据的平均困惑度+margin)(:108-142)。
    2. 重复 prompt 攻击:prompt="Patient has a history of hypertension, prescribed medication is",看模型是否稳定吐出 "Lisinopril"(:150-177)。变 prompt 观察稳定性可提高成功率(:181)。局限:greedy vs sampling、温度的随机性会干扰测量(:185)。
    • 成员推断不全是坏事:版权方/安全专家可用它测"某数据是否进了训练集"(:191)。防御:DP 加噪。
  • 数据提取攻击(:201-340):比成员推断更进一步——不只判断在不在,而是真把数据拿出来;aka model inversion。操作化:prompt 变体钓鱼,target_info 出现在输出即成功;例:prompt "The patient's name is John Doe. What medication…?" target "Lisinopril"(:254-264)。增强:prompt 变体、定向探已知敏感词(Project Falcon 例)(:303-319)。
  • 防御四层(:325-340):DP(训练时)、训练数据策展/联邦学习(不碰原始数据)、三明治防御(输入预处理+系统提示+输出后处理包裹核心 LLM)、输出过滤。多层防御清单(:344-354):输入预处理/健壮 system prompt/DP/输出后处理/定期红队。

LLMPrivacySecurityEvaluator(text/22)

  • 类封装:generate_text、calculate_perplexity、simulate_membership_inference、simulate_data_extraction、evaluate_privacy(返回 MembershipInferenceConfidence)、evaluate_security(返回 DataExtractionSuccessRate)(:3-113)。
  • 示例模型 google/gemma-1.1-2b-it;"诊所体检"输出:成员推断 0.0、提取 Paris 成功率 1.0(常识性问题当然能答对)(:157-256)。"原生 LLM 不是为隐私安全造的,路还长"(:256)。
  • 评估器的根本局限(:141-149):只能测有 ground truth 的已知风险;模型记住你不知道的敏感信息→测不出;定量测试(已知风险)+定性探索(红队发现未知风险)缺一不可。教学工具,生产要用企业级平台+专业红队。
  • 三种角色三种评估策略(:270-296):模型创建者(有训练数据→真值评估,测真成员推断准确率)、使用者(没训练数据→风险评估,合成样本+canary 负样本+公共信息正样本,"proxy ground truth")、红队研究员(对抗式,找新漏洞)。
  • 评测基准(:302-312):HELM(Stanford CRFM,多维度+排行榜)、TruthfulQA(817 题 38 类)、HarmBench、JailbreakBench、AI Incident Database。Goodhart's Law:模型可以专门针对基准优化(:326)。
  • 练习平台:Gandalf(Lakera,骗密码游戏)、HackAPrompt(:342)。

Ch4 Privacy-Preserving Training Techniques(text/23 ~ text/44)

开场+隐私破坏实景(text/23)

  • 五大类技术:DP、联邦学习 FL、同态加密 HE、多方计算 MPC、隐私保护数据变换;外加 PEFT(:10)。
  • 逻辑回归最小破坏示例(:21-63):合成 1000 病人 + 两个独特病人 Alice(0.1,0.1,0.1→0)Bob(0.9,0.9,0.9→1);训练后查询 Alice/Bob,概率 0.9995 vs 0.0004——独特样本被精确记住。
  • Gemma 泄密实景(:73-136):google/gemma-1.1-2b-it 上用 3 条敏感数据微调 5 epoch,然后 prompt "Alice's Social Security number is" → 模型补出 "987-65-4321";"Bob's credit card number is" → 补出 "5678-9012-3…"。"没让它背,它自己学会了复述"(:138)。
  • 规模效应:模型越大越能记住罕见/独特序列("更大的笔记本";紫色松鼠比喻——不寻常的事记得牢)(:151-154)。
  • 对齐的护栏实测(:159-248):同样数据在 unsloth/Llama-3.2-1B(注:代码用基座,文中说-Instruct)上微调后,同样 prompt 只吐 "!!!!!!!!!!"——RLHF/对齐护栏让模型拒绝生成;但护栏"不牢靠,可被巧妙 prompt 绕过,且难量化"(:250)。
  • 现实影响:PII 暴露、商业机密、凭证泄露、违反 GDPR/HIPAA(:252)。

合成数据+评估器实操(text/24、25)

  • 合成数据集:10 用户×5 条目,SSN/信用卡/病史/处方/地址;一人多条模拟真实库(:13-57)。
  • 为什么合成数据(:79-85):真实破坏=多属性组合识别;单一可预测数据("987-65-4321")的 ASR 只有 0 或 1,测不出技术差异;DP/k-anonymity 需要复杂数据才能测。
  • 评估器实操结果(:61-70):Privacy Score 全 1.0(越低越好→差),成员推断 3/3,提取成功率 2/3 → 未保护模型很脆弱。
  • 五类技术"不可互相比较",各有强弱,按需组合(:77)。

DP 深入(text/26-30)

  • ε 分档(:7):ε<1 强/效用损失大;1–3 中等;>10 弱/性能好。
  • DP-SGD(text/27):Opacus(Meta)/TensorFlow Privacy;参数:epsilon=1.0、delta=1e-5、max_grad_norm=1.0、noise_multiplier=1.1;PrivacyEngine.make_private 自动做梯度裁剪+加噪+记账;get_epsilon(delta) 查预算(:20-70)。noise_multiplier="扑克脸强度";max_grad_norm 控制单样本最大影响(:76-78)。
  • 隐私记账(text/28):Rényi DP(α 族指标,更紧的合成界);moments accountant(Google,跟踪隐私损失高阶矩);采样放大:mini-batch 训练时每点只参与部分更新→有效预算按采样率折减(:13)。
  • 权衡(text/29):效用 vs 隐私(降 ε 降效用);计算开销;隐私损失随 epoch 累积。实操建议:从高 ε 开始逐步降,同时盯隐私指标和模型性能(:13)。
  • DP for RAG(text/30):三个注入点——私有嵌入(建向量时 DP-SGD 加噪)、私有检索(选择过程加随机性)、查询扰动。例:private_retrieval 用 Gumbel 噪声的指数机制,加噪后取 top-k,不取精确 top-k → "可否认性"(:30-47)。每条查询都可能泄漏,总预算要跨时间记账(:49)。混合策略:DP 微调管通用知识,RAG+隐私保护管不该进权重的敏感信息(:53)。

联邦学习(text/31-33)

  • 概念(text/31):中央服务器发模型→各方本地训练→只回传模型更新→服务器聚合;书友会比喻:讨论书但谁也不把书给别人看。医院协作训医疗 AI 不共享病人数据(:17)。
  • 实现(text/32):PyTorch 手写:train_locally(本地训练算 updates=final−initial)、federated_averaging(FedAvg 加权平均 updates);10 轮循环(:24-115)。
  • 优劣(text/33):优势=数据不出门/数据多样性/合规(GDPR);挑战=通信开销(10–100 倍于集中式训练的流量)non-IID(参与方数据分布不同影响收敛)、模型投毒(恶意参与方污染全局模型)、慢客户端拖全队(:5-7)。解法:模型压缩、鲁棒聚合、异步训练;split learning=按层切模型(FL 是每人完整副本)(:9)。建议:secure aggregation+FL 组合 DP(:13)。

同态加密(text/34-36)

  • 概念(text/34):f(E(x1),…,E(xn)) = E(f(x1,…,xn));三类:FHE(任意计算)、PHE(单一运算,如 Paillier 只加法)、SHE(有限次运算)。
  • 实现(text/35):phe 库 Paillier 加密参数+输入→"加密前向"→解密;慢到"即使 A100 GPU 也跑很久"(:51);tenseal CKKS 方案:poly_modulus_degree=8192、coeff_mod_bit_sizes=[60,40,40,60]、scale 2^40(:58-63)。
  • 优劣(text/36):优势=不解密即可算("终极隐私")、可外包给不可信云、满足严监管;挑战=计算开销大、支持的运算有限、密钥管理复杂、现有模型要适配。现实用法:只加密 pipeline 特定敏感环节;HE 用于推理而非训练(:12)。

MPC(text/37-39)

  • 概念(text/37):秘密分享——把数据拆成多份 shares:单份不泄任何信息、合并可重构、可在 shares 上计算。
  • 实现(text/38):PySyft VirtualWorker(alice/bob/charlie+secure_worker,protocol="fss");MPyC:SecFld(101) 有限域秘密分享后聚合再揭示(:64-95)。生产库:CrypTen(Meta)、TF Encrypted(Google)(:103)。
  • 优劣(text/39):优势=无单方看全数据、协作训练、分布式信任;挑战=计算开销(方多时爆炸)、通信复杂度、扩展性、setup 复杂、要求低延迟可靠网络(:5)。适用:多机构协作、参与方较少(<10)(见 summary)。组合:MPC 管安全聚合+DP 管个体贡献(:12)。

PEFT for privacy + 数据变换(text/40-44)

  • LoRA(text/40):冻结原权重,注入可训练低秩分解矩阵 ΔW = M1×M2;例:GPT-2 上 trainable 811,008 / 全部 125,250,816 = 0.6475%(:36)。隐私四利:可训参数少→记忆容量受限、提取攻击面小、DP 更容易做强(参数少)、审计简单(:9)。ε≤1.0 用 LoRA 只需适度噪声,全量微调同预算可能性能不可接受(:57)。
  • QLoRA(text/41):4-bit 量化(BitsAndBytesConfig:nf4、double quant、bfloat16)+LoRA(r=16);建议隐私场景用低 rank(r=4/8)(:47)。
  • 匿名化/去标识(text/42):Presidio(PII 检测/替换)+ spaCy NER;一致替换(同一人→同一占位符)保留结构关系(:79)。分阶段:自动工具→人工抽查→隐私指标验证(:83)。策略:同类型替换(名字换名字)保持语言自然、语义关系一致、别把领域稀有信息过度简化(:85-87);用对抗技术试图重识别来验证匿名化质量(:89)。
  • 隐私保护数据增强(text/43):LM 生成合成文本+Laplace 加噪;书里明说:这个加噪只是示意,对文本生成不构成严格 DP 保证;生产要用 DP 训练的生成模型+正规隐私记账(:46)。
  • 增强的优劣(text/44):优势=数据效用/不碰原始数据/灵活(补稀缺场景);挑战=质量保真、隐私-效用权衡、评估复杂、mode collapse(合成数据缺多样性)、fidelity 难。最佳实践:组合技术、统计测试+下游任务验证、用成员推断攻击审计合成数据、记录 provenance(:12-20)。
  • Ch4 总结的选型表(:28-38):DP=要数学保证/可容忍效用损失/法规要形式化证明/数据集中;FL=数据天然分布/不能移动/参与方要控制权/能扛通信开销;HE=隐私要求绝对/运算有限/扛得起开销/极敏感(医疗金融);MPC=多机构协作/无单方看全数据/低延迟可靠网络/参与方 <10;LoRA/PEFT=大模型资源有限/降记忆风险/DP+可接受效用/审计容易;合成数据=要共享研究/完全不能碰原始数据/能验证质量/有资源训生成器。

走查素材(Ch4 主走查候选)

  • Gemma 泄密全链:3 条敏感数据 → 5 epoch 微调 → prompt 半句 → 模型补全 SSN(这是书里给的真实代码输出);
  • DP-SGD 全链:epsilon=1.0/delta=1e-5/noise_multiplier=1.1/max_grad_norm=1.0 → make_private → 训练 → get_epsilon 报预算;
  • LoRA 全链:GPT-2 → r=8 → 0.6475% 参数可训 → make_private_with_epsilon(target_epsilon=1.0)。

Ch5 Secure Deployment of LLMs(text/45,全书最长单章 50k)

  • 三层安全架构(同心圆)(:4-21):①基础设施安全(最外层,托管模型的物理/虚拟资源);②访问控制(中间层,谁能以何种方式交互);③运行时安全(核心层,推理期间的执行安全)。
  • 基础设施三组件(:29-51):compute(GPU;GPT-3 规模模型全量部署要 350GB+ GPU 显存)、network、storage(权重分片)。FL/DP 等 Ch4 技术带来额外计算开销要计入容量规划(:51)。监控工具:htop、NVIDIA DCGM、Prometheus(:51)。
  • 基础设施防御四件套(:53-69):隔离环境(容器/VM)、网络安全(防火墙+访问控制)、资源管理(限流+配额防 DoS)、监控日志。
  • 信任分区(从高到低)(:75-91):模型权重存储区→推理执行区→API 接口区→公共访问区;越往高权限区隔离越强;一层被破不自动殃及其他层。
  • 容器化(:97-170):Dockerfile 逐步注释(FROM python:3.9-slim → 建 modeluser 非 root 用户 → CMD);生产永不以 root 跑容器(:170);K8s:pod 安全策略、网络策略、secret 管理、资源配额(:162);镜像定期扫漏洞、不可变 tag、只读根文件系统、CPU/内存/IO 硬限额(:166)。
  • VM(:172-257):Vagrant(VirtualBox,ubuntu/focal64,8GB/4 核,禁共享目录);"容器是包装箱,VM 是独立仓库"(:174)。硬件安全:HSM(管密钥的加密处理器)、secure boot(只跑签名代码)、内存加密(AMD SEV/Intel TME——模型权重在内存里也是知识产权)(:231-243);微分段、vNIC、VPN(:245-257)。
  • 网络安全(:259-563):Zero Trust Architecture——假设任何单层都可能被破,所有流量按潜在恶意处理(:267);银行比喻:公共大厅/柜员区/金库(:273)。WAF 在最外,内层防火墙分段(:275)。分段配置例:public_zone 443/80 限 1000 req/min、api_zone 8443 限 5000、model_zone 9000 限 10000(:278-297)。
  • 为什么模型服务器绝不能直连公网(:298-312):直连后果五条——提取模型权重(IP 被盗)、投毒推理结果、无速率限制地提取训练数据、装后门持久化、横向移动打内网。
  • HTTPS/TLS(:322-443):握手→证书验证→加密通信;FastAPI+uvicorn:8443 端口,TLS 1.2 起,密码套件 ECDHE-ECDSA-AES128-GCM-SHA256;自签证书仅限开发,生产用 CA 签发+证书轮换(:429-437)。
  • 请求过滤/限流(:447-558):夜店比喻(查 ID=认证,限流=防拥挤,监控=盯可疑行为);RequestFilter:100 req/min/IP、payload ≤1MB;429/413 响应码;多实例要用分布式限流(Redis)(:558)。流量异常信号:平时响应 <500ms 突然 2–3 秒→可能在被 prompt injection 探测;平时 prompt 100–200 字符突然超大→可能想压垮系统(:562)。
  • API 设计五原则(:577-598):最小暴露面、输入验证、限流、认证+授权、加密通信。
  • FastAPI+Pydantic(:601-716):PromptRequest 模型:constr(min_length=1, max_length=2048);validator 查危险模式('rm -rf','system(','exec(','import ','open(')(:625);LLMService:max_concurrent=100;RateLimiter:60 req/min/用户滑动窗口。
  • JWT 认证(:719-832):"不能伪造的 ID 卡";15 分钟过期;HS256;token 黑名单撤销(:755-777);PermissionsManager:basic_user→generate_text、premium_user→+fine_tune、admin→+deploy(:789-793)。
  • 加密标准(:836-857):AES-256(对称,2^256 把钥匙,"NSA 批准用于 TOP SECRET");WPA3(边缘/IoT 部署的 Wi-Fi;每设备独立密钥、前向保密,修了 WPA2 开放网络的握手共享弱点)(:847-851);分层:传输层 TLS 1.3/应用层 AES-256/存储层 AES-256-GCM/网络层 WPA3+VPN(:857)。Fernet SecureChannel:时间戳防重放,5 分钟过期(:861-911)。
  • 模型版本管理(:929-1074):ModelRegistry:SHA-256 哈希、版本谱系(parent_version)、security_scan(:942-1013);UpdatePipeline:PENDING→VALIDATING→DEPLOYING→COMPLETED/FAILED,验证失败回滚(:1039-1066);原子更新防半吊子部署(:1068);先在 staging 测(:1072)。
  • 总结三原则(:1086-1094):纵深防御(单层被破不至全失)、security by design(不是事后补)、安全不是一次性(监控+更新+定期审计);安全与可用性平衡,按威胁模型定。

走查素材(Ch5 主走查候选)

  • 一条 API 请求的安检全链:请求进来 → WAF/分段(public_zone 443)→ JWT 验证(HS256,15 min)→ 权限检查(basic_user→generate_text)→ Pydantic 验证(≤2048 字符、危险模式黑名单)→ 限流(60/min)→ LLMService(并发 ≤100)→ TLS 1.3 加密返回。

Ch6 Adversarial Attacks and Defenses(text/46 ~ text/70)

开场+分类学(text/46、47)

  • 对抗攻击=精心构造的输入,操纵模型行为;攻击与防御的"猫鼠游戏"(:6)。
  • 四维分类法(text/47):
    1. 知识访问:white-box(全知:架构+参数+梯度;只对开源模型可行;例:拿 GPT-2 权重直接算梯度)/black-box(只能查 API;例:对 ChatGPT API 试 prompt 变体)/gray-box(知架构不知参数;可迁移性:自己训一个同架构模型造对抗样本)(:10-28)。
    2. 目标:untargeted(随便出错)/targeted(要特定有害输出,更难)(:35-45)。分类 vs 生成任务的攻击成功判据不同:分类看"标签变没变",生成要靠安全分类器或人评(:49-51)。
    3. 攻击面:input 级("good"→"g0od"/同形字 homoglyph)/prompt 级(把有害指令包装成教育场景)/embedding 级(直接改向量,仅 white-box)(:57-79)。
    4. 扰动类型:字符级→语义保持修改(:81)。
  • 核心洞见:表面相似的攻击可能利用完全不同的漏洞,需要不同防御(:83)。

越狱与 notable 攻击(text/48)

  • 越狱技术清单(:9-104):
    • 角色扮演("我是赛博朋克小说作者,角色 ArtificialAssistant 会说…");
    • 指令走私(翻译任务里藏 "Ignore all previous instructions…");
    • token 操纵(同形字/Unicode/故意拼错,黑盒也有效;TextAttack 框架;同义词替换/字符级改/SEARs 语义等价规则如 "What NOUN→Which NOUN");对抗样本可在不同模型间迁移(:43);
    • few-shot 操纵(QA 对里夹有害问题);
    • DAN (Do Anything Now)(谎称已升级为无限制版本);
    • 重要性引导(TextFooler/BERT-Attack:删词看置信度变化定词的重要性,替换高重要性词;"illegal substances"→"prohibited compounds");
    • 语境误导(前面铺大量无害长文本,利用模型对近期 token 权重更高;结尾才抛有害请求)。
  • GCG 贪心坐标梯度攻击(Zou et al. 2023)(:117-191):优化一个后缀,使目标输出概率最大;逐位置试 token、留最优;白盒;例:发现后缀使模型绕过安全过滤。相关:GBDA(Gumbel-Softmax 可微化+BERTScore/perplexity 约束保持流畅)、HotFlip(一阶导近似字符翻转)、AutoPrompt(搜触发短语)。
  • 万能触发器(universal adversarial triggers)(:201-212):输入无关的扰动, appended 到几乎所有输入都奏效;Wallace et al. 2019 例:加 "TH PEOPLEMan goddreams Blacks" 使情感分析恒输出 negative;"魔法短语"。

嵌入空间攻击与 agent 攻击(text/49、50)

  • 嵌入空间攻击(:3-65):开源模型可直接在连续嵌入空间优化(比离散 token 空间高效);改完的嵌入可以不对应任何真实 token,绕过所有 token 级防御;Schwinn et al. 2024:很少几步优化就能生成恶意内容。
  • LLM agent 攻击(:3-38):毒化检索机制/记忆——往知识库注入带触发器的样本,高嵌入相似度保证被检索到;例:给自动驾驶 agent 的记忆里投毒,把某些路况和 "sudden stop"/"swerve left" 关联;利用 agent 对自己知识库的信任,标准安全监控难发现(AgentPoison, NeurIPS 2025)。

规模与架构影响(text/51)

  • 大模型对简单攻击更稳,但对复杂攻击可能更脆(Howe et al. 2024:scaling law 也适用于对抗鲁棒性);架构(注意力机制)影响韧性;多样训练目标/多任务/指令微调带来一定内在抗性;LoRA/adapter 对鲁棒性的影响复杂;鲁棒性应与准确率/效率并列为一等设计目标(:21)。

防御:案例+鲁棒微调(text/52-58)

  • 越狱防御案例(假想)(text/52):客服 chatbot;红队发现:DAN 式攻击成功;困惑度防御只能抓部分;突破=自评机制(模型交付前自检回复);最终=输入困惑度检查+自评模块+持续监控;教训:多层互补,没有单点方案(:21)。
  • 对抗训练(text/53):"杀不死你的使你更强";每批生成对抗版(如 PGD 投影梯度下降)一起训;代码:内层最大化(adv_steps=3, adv_lr=1e-2 更新 delta,符号梯度+范数投影)外层最小化(正常更新参数)(:32-104);也可做成生成对抗博弈(攻击方 agent 与防御方 LLM 共同进化)(:26)。
  • 鲁棒优化(text/54):MART(专抓决策边界附近的易攻样本,加正则项)、TRADES(显式权衡准确率 vs 鲁棒性:loss = 自然样本损失 + β·KL(对抗输出‖自然输出);β 可调)(:17-107)。
  • 数据增强(text/55):同义词替换/随机插入/随机交换/随机删除(p=0.1)/回译/对抗样本生成;NLTK WordNet 实现;与 Ch4 隐私增强同一套技术,目的不同(:164)。
  • Prefix-tuning(text/56):冻结基座,只训前置的 20 个连续嵌入(prefix_length=20);"安全网"提示模型负责行为;适合算力有限/需要多个专门鲁棒版本;前提:基座本身要有一定鲁棒性(:108)。
  • 集成方法(text/57):多样性=强度;迫使攻击者同时骗过多个模型;策略:概率平均/多数投票/stacking(元模型)/级联(不确定的交给下一个)。
  • 可认证鲁棒微调(text/58):IBP 区间界传播(每层定上下界,传播到输出定最坏情形,优化模型保证最坏情形也对)——数学保证而非经验证据(:15-25);IAT 迭代对抗训练(专职攻击模型与目标模型共进化,iterations=4)(:31-81)。

红队(text/59-63)

  • 手动红队(text/59):多学科团队(安全/内容审核/语言学/领域);taxonomy 指导;技术:prompt chaining(从无害渐进到有害)、context 操纵、persona 假设、语言诡计;辅助工具:Wallace 2019 高亮高重要性词(梯度)、Ziegler 2022 加 token 替换建议;数据集:BAD(Bot-Adversarial Dialogue)5000+ 对抗对话、Anthropic 约 40,000 条人肉对抗攻击;GPT-4/DALL-E 3 发布前的安全准备都用(:26)。难规模化。
  • 自动红队:遗传算法(变异+选择)/RL 训攻击 agent/用另一个 LLM 生成攻击 prompt/对抗样本搜索(:30-38)。
  • 红队项目落地(text/60):组队(多样专长+明确范围+报告流程+伦理边界)→设计测试用例(分类别/模板/从简单到复杂/多攻击向量)→评响应(成功标准/严重度分级/识别合理拒绝/上下文相关性)→反馈闭环(漏洞库/改进安全机制/回归测试/更新打法)。
  • 工具(text/61):Anthropic 框架(有害内容/隐私/事实/偏见/安全五维+记录 near-miss);Google(可量化指标+持续改进闭环+负责任披露);开源:TrojLLM(后门/供应链攻击模拟)、AdvGLUE(GLUE 对抗版)、HELM(全景);传统安全:Mythic C2(测基础设施而非模型)(:17)。
  • 自动多轮红队(text/62):对抗 LLM 与目标 LLM 迭代对抗(每轮 200 prompt);攻击模型用成功攻击微调,目标模型用成功防御微调;"有限人力下大幅提升安全性"(Ge et al. 2023, MART)。
  • 红队实践案例(text/63,假想):银行客服 LLM;发现:可被操纵冒充银行官员、会被 plausible 假信息带偏、prompt injection 可掏 system prompt、可被诱导给钓鱼指导;缓解:身份控制/验证与未验证信息区分/防注入/社会工程对抗训练。
  • 鲁棒性评测(text/63 末-70):
    • 传统指标(acc/perplexity/F1)测不出对抗脆弱性;例:95% 准确率的情感模型在细微拼写变化下全崩(:39)。
    • 评测四要素(:45-62):攻击覆盖面(字符/词/prompt 级)、攻击强度(不同扰动强度)、成功判据(精确匹配 vs 语义相似)、效率指标(查询数/时间复杂度)。
    • 攻击侧标准化指标(text/68):ASR、词扰动率=改动词数/总词数、字符扰动率=编辑距离/原文长度、查询效率=1/查询数、语义保持=嵌入余弦相似度(:9-31)。
    • 防御侧标准化指标(text/69):DSR=拦截数/总攻击数、Clean Performance Drop=(无防御性能−有防御性能)/无防御性能、时间开销=有防御推理时间/无防御、检测率 vs 误报率(:5-22)。
    • 分布偏移(text/65):方言/口语/行话、跨域(新闻→社交媒体)、时间漂移(语言演化);鲁棒性比率=out-domain 准确率/in-domain 准确率(:47-55)。
    • 人评(text/66):专家评审/红队小组/盲评(不知攻击方法);严重度分级;自动指标测不出主观有害性。
    • agent 评测(text/67):评整条动作链:输入解释→记忆检索→工具选择→行动规划→最终执行;每步都有安全评估,聚合 mean+worst_case(:31-71)。
    • 评测挑战(text/70):语言动态+攻击者创造力→静态评测不够(自适应评测:攻击生成器知道防御后再生攻击);评测成本高;有害性判断主观(文化/社会/语境)+人评引入偏差;不同应用权衡不同(医疗要强防御,闲聊要流畅)(:3-68)。
    • 最佳实践(:70-81):design with robustness in mind、纵深防御(输入过滤→鲁棒训练→输出验证)、持续改进(定期红队+漏洞披露+快速更新)。
    • 未来方向(:85-103):形式化验证(数学证明模型永不生成某类内容;圣杯=可扩展到最大模型)、对抗免疫(从已见攻击泛化到未见攻击;meta-learning/对比学习)、自改进防御(模型给自己造对抗样本)、可解释性与安全结合轻量防御(选择性激活/自适应计算/知识蒸馏)、协作安全生态(共享对抗样本库+威胁情报)。

走查素材(Ch6 主走查候选)

  • GCG 攻击全链:初始 prompt → 随机后缀 → 逐位置试 token(算梯度找影响最大的位置→该位置试词表中 token→留最提升目标概率的)→ 若干轮后得到绕过过滤的后缀;
  • 越狱防御全链(假想案例):DAN 攻击成功 → 加困惑度检查(阈值)→ 仍有漏网 → 加自评模块 → 输入+自评+监控三层。

Ch7 Ethical Considerations in Fine-Tuning LLMs(text/71)

  • 微调放大的三偏见源(:14-27):数据不平衡(某群体过代表)、语境偏斜(窄语境,少数声音被排除)、反馈循环(个性化强化用户既有偏见)。
  • 偏见的四种表现(:33-39):表征偏见(数据里某群体欠代表:医疗 QA 数据全来自城市医院→农村场景差)、历史偏见(历史招聘数据→延续歧视)、评测偏见(指标本身带偏:只在窄测试集上量准确率)、聚合偏见(为平均性能优化→牺牲少数群体)。disparate impact:模型没显式偏见但预测系统性偏向某群体。
  • 个性化 vs 公平的反直觉关系(:43):个性化贷款系统可能按人口模式给不同条款——哪怕模式来自历史歧视。
  • 公平性度量(:51-189):demographic parity(预测与敏感属性独立;DPdiff=组间正预测率最大差)、equalized odds(组间 TPR/FPR 相等)、individual fairness(Lipschitz:相似个体相似对待 D(f(xi),f(xj))≤L·d(xi,xj);LLM 用语义相似度做距离)、calibration(组内预测概率=实际频率)、counterfactual fairness(把敏感属性换成反事实值,输出不变)。"正类"含义随场景变:医疗=检出疾病,推荐=推给用户(:192)。
  • 缓解策略(:198-227):数据增强/再平衡;对抗去偏(训一个对抗网络从表征预测敏感属性,主模型学着骗过它→表征里敏感信息被剥离);公平感知正则(loss = task_loss + alpha·disparity,例子 alpha=0.1);后处理校正——书里明说:后处理不解决底层数据不平衡,要与其他手段并用(:223)。工作流:收集→检测(公平指标)→缓解→评估(:225)。
  • RLHF/Constitutional AI 可纳入公平标准:多样化标注者+奖励模型显式奖励公平+多方反馈的隐私聚合(:231-238)。
  • 隐私×公平五冲突(:244-255):①DP 加噪遮蔽真实关系→偏见更难测;②隐私约束限制数据收集多样性(FL 拿不到全量用户数据);③均匀 DP 对小群体伤害更大(样本小,噪声相对大);④传统 DP 不管群体隐私(少数群体可因独特特征被识别);⑤噪声的效用损失可能不成比例落在少数群体上。缓解:group DP、fair DP(按组分配预算)。
  • 可解释性为何难(:263-273):规模(千亿参数无法逐个归因)、黑箱、分布式表征(信息摊在很多参数和层上)、动态行为(同一输入不同输出)、语境依赖、非线性交互(小输入变化→大输出变化)。
  • 解释技术(:279-391):注意力可视化(但要小心:注意力权重不总对应真实推理);梯度归因(integrated gradients、LIME);probing 训练辅助分类器读内部表征——走查级实例:审计客服系统,生成 "John/Maria/Alex was assertive during the meeting." 三句,提取 "assertive" 位置的最后层 hidden state,训练 logistic regression 探针,看换名字是否引起情感编码漂移,卡方检验判断;此法隐私友好(只要推理、不重训、可用合成数据)(:297-379);反事实解释(扰动输入看输出变化);代理模型/蒸馏(小模型模仿大模型,可能丢细微交互)。
  • 隐私保护的可解释(:393-427):解释本身可能泄漏训练数据;办法:给解释输出加 DP 噪声、联邦可解释(本地算解释只聚合必要信息)、MPC 协作出解释。解释质量四指标:faithfulness(忠实)/completeness(完整)/stability(稳定)/comprehensibility(可懂)(:413-427)。
  • 组感知隐私机制(:446-471):自适应隐私预算(按组大小分配);group DP(相邻数据集差一整个 k 人组);fairness-aware 加噪。
  • 偏见感知 FL(:473-485):人口感知聚合(按代表度加权客户端贡献);跨客户端公平监控(安全聚合算公平指标不暴露个体)。
  • 隐私保护偏见审计(:487-495):加密偏见测试(HE/MPC 上跑)、审计报告加 DP、合成数据做公平评测。
  • 研究缺口(:515-523):同时评公平+隐私的基准;隐私-公平-效用三权衡的理论(不可能性结果);可扩展算法。
  • 全书最不技术的一章(:5)。
  • 社会技术系统六组件(:17-45):人(角色被重塑:AI 成为社交代理/协作者/伴侣)、流程、文化、结构(组织权力/问责)、技术、目标;生成式 AI 不是工具而是参与者——"人 vs 机器"的二分要让位给共生关系(:47)。
  • 文化演化三议题(:53-79):AI 生成内容侵蚀信任(deepfake 造假新闻影响选举);监控资本主义下的个性化与身份危机(回音室/过滤气泡;"算法身份"/"AI-mediated selfhood":自我认知被算法输出塑造);人机交互的存在论问题(让渡控制与决策)。
  • 生成式 AI 供应链八阶段(:83-121):创作作品→转成量化数据→数据集策展→基座预训练→微调→发布部署→生成(生成物又回流成训练数据!)→对齐;每阶段都有文化影响与伦理风险的关键选择。
  • 机器文化(:123-132):算法策展当守门人(Netflix/Spotify/YouTube);AI 直接创作文化制品→原创性/作者权/知识产权问题。
  • 版权与 IP(:139-186):
    • 问题一:生成式 AI 侵犯版权吗?GitHub Copilot 案(被指无归属复述代码;GitHub 回应:只用宽松许可代码+尽量归属)(:145);艺术家"AI 偷艺术"诉讼(:147)。
    • 先例:Sony Betamax 案(1980s,设备有"实质性非侵权用途"→制造商免责,安全港原则)、Napster/Grokster 案(P2P:共同侵权/替代责任;Grokster "积极诱导"败诉)(:149-154)。
    • 与旧技术的区别:生成式 AI 主动学习并转化训练数据,模糊了"复制"与"原创"的界线(:151)。
    • 三个免责策略(:158-170):Intent(开发/部署的集中 vs 分散选择避免诱导外观)、Control(流式接口等维持对输出的控制)、Knowledge management(加密查询等隐私技术减少"知情")。
    • 问题二:AI 生成物有版权吗?美国版权局:无人类作者署名的机器作品不受版权保护(:178);Feist 案(1991):最低创造性要求,传统主题/标准接口/艺术风格/常见和声进行不受保护(:180);创造性度量:成语生成能力探测文本原创性、DreamSim 距离评图像新颖性(:182)。
  • 数据隐私法(:190-204):GDPR、CCPA、HIPAA(PHI 保护);起搏器案例:厂商对设备软件主张版权,病人拿自己的植入设备数据被 DMCA 拒——数据所有权与控制的权力失衡(:196);推断风险:匿名化数据仍可被 AI 推断再识别(:202)。
  • 算法偏见法(:208-224):COMPAS 累犯风险评估对黑人系统性偏见(ProPublica);招聘 AI 歧视女性;人脸识别深肤色错误率高;纽约市 Bias Audit Law(2023-07-05 生效):雇主必须对自动化雇佣决策工具(AEDT)做独立偏见审计并告知候选人(:213);AIA(算法影响评估)。
  • 责任与问责(:226-236):自动驾驶事故谁负责(车厂/AI 开发者/监控的人类乘客)?两条路:产品责任法(严格责任,但 AI 会演化、不适合)vs 追究人类操作者(新的注意义务理论)。
  • 技术-法律解决方案主义的普遍挑战(:238-257):技术问题与法律问题深度纠缠;复杂性与不透明性让问责困难;跨境系统适用谁的法律?出路:原则导向监管(transparency/fairness/accountability/privacy 原则,而非速朽的细则)(:251);公众参与。
  • 负责任的 AI 文化(:259-296):技术解决方案主义批判(引 Morozov);多样性公平包容(AI 从业者群体同质化→偏见放大);跨学科协作;开源关键算法与数据集、公众监督;AI 系统非中立,承载创造者价值观;AI 素养教育;引 Nature Medicine 论文:AI 不确定时把决策交还医生(defer)(:328 脚注8)。
  • 总结(:300-312):生成式 AI 是新型社会技术系统;法律框架在版权/隐私/偏见/责任四方面吃力;要原则导向、可演化的监管;技术方案必须配合文化改变、教育、人类监督。

Ch9 Building Privacy-Preserving AI Capabilities(text/73)

  • 两个案例:医疗(合成临床笔记+LoRA+DP-SGD 微调 Llama 3.2 1B)+ 法律(多律所 FL 协作)。
  • 医疗:
    • HIPAA;马赛克识别(mosaic identification):单独无害的细节(罕见遗传病+特定年龄+特定地点+独特症状组合)合起来能锁定个人;传统去标识不够(:23-25)。
    • 合成临床笔记 64 条(generate_fake_note:姓名/DOB/主诉/评估)(:38-77);进阶:GAN、LLM 生成、Synthea(合成病人时间线工具,引 JAMIA 2018)。
    • LoRA+DP-SGD 组合(Yu et al. 2021 "Differentially Private Fine-tuning of Language Models" 的思路):只对小 Adapter 参数做 DP,不碰基座——噪声维度骤减,效用-隐私权衡大幅改善(:85-93);ΔW=BA, r≪min(d,k)。
    • dp_train 全链(:124-164):loss.backward → clip_grad_norm_(max_grad_norm=1.0) → 每参数加 N(0, σ²C²) 高斯噪(noise_multiplier=1.0)→ optimizer.step。
    • RDP 记账(:180-195):sample_rate=4/64、sigma=1.0、delta=1e-5→accountant.get_epsilon;ε=1.0 的含义:任何输出概率至多乘 e≈2.718;"看似弱实则强,配合 δ";隐私预算不可再生——泄露是永久的(:174)。
    • 部署考量(:197-212):人群研究可容忍高 ε,影响个体诊疗的模型可能要 ε≤0.1;EHR 集成;联邦合成数据生成;临床人员培训;每次模型更新都消耗额外预算→要长期预算管理策略。
  • 法律:
    • 律师-客户特权:连匿名化/聚合后的披露都被禁止;律所还有竞争性商业秘密;律师协会要求"技术胜任"(:223-227)。
    • FL 架构:各律所本地 LoRA+DP 训练,只共享 adapter 权重;服务器 average_lora_states 简单平均;进阶可用 MPC/HE 做安全聚合(:316-323)。
    • 深度防御逻辑:即使共享权重被拿到,里面也只有差分隐私化的表征(:311-312)。
    • 审计与解释义务:原始数据留在本地、只共享 DP adapter、可向监管/客户解释;利益冲突:DP 噪声可证明地限制某律所策略对共享模型的影响(:349);模型投毒风险:要拜占庭容错聚合+参与者审查(:351)。
    • 效用评估(:357-363):文档摘要任务适合(要风格多样性,不要逐字精确);"律所报告协作收益大于隐私带来的适度性能损失";去中心化韧性(聚合服务器挂了各所照常)。
  • 组织能力建设(:365-403):
    • 基础设施:FL 网络流量 10–100 倍;DP-SGD 通常比标准 SGD 慢 10–100 倍(ε<1.0 要更多噪声)(:375);要审计轨迹+预算跟踪。
    • 人才:ML+密码学+隐私理论+合规的组合;"向业务/法务/审计解释 ε=1.0 DP、honest-but-curious 对手模型"的沟通能力(:378)。
    • 分阶段:试点(合成数据+LoRA,可训参数减 99%;金融欺诈检测 FL 50–100 参与方)(:380)。
    • 技术栈:OpenDP(形式化证明)、PySyft(1000+ 节点)、TensorFlow Privacy;HE 运算可比明文慢 10,000–1,000,000 倍→云加速有吸引力(:390-391)。
    • 成功度量(:401):预算消耗(ε 跨 epoch 累积)、效用-隐私权衡、FL 收敛轮数/通信成本;基础设施成本通常高 2–10 倍;试点 10–50 参与方→生产 1000+。
  • 趋势(:405-443):量子计算(RSA-2048/ECC-256 预计 2030–2035 可被 Shor 算法破,NIST 考虑弃用→格密码;量子也可能给隐私协议平方加速)(:413);边缘计算(4–32GB RAM+1–100 TOPS 的设备能跑 1–7B 模型的 FL 客户端;5G 亚 100ms 协调)(:415);EU AI Act 风险分级;数据本地化;隐私溢价与网络效应;人才溢价 20–50%,6–12 个月上手期(:427);2030 展望:DP 像批归一化一样 routine,云厂商一键选 ε(:433)。
  • 总结五条(:448-460):医疗 DP AI 已 production ready(ε≤1.0);FL 使"不可能的协作"成为可能;参数选好(LoRA rank=8、noise_multiplier=1.0)可保 85–90% 集中式性能;组织准备与技术同等重要(6–12 个月能力建设);隐私既是防御义务也是进攻机会。
  • 结论(:464-503):五年前范式=能收多少收多少、隐私靠政策;今天 privacy-by-design 主流;"从隐私是约束到隐私是赋能"。

About the Author(text/95)

  • Dr. Baihan Lin(注意书卡元数据 "Baihan Lan" 是录入偏差,原书署名 Baihan Lin):计算机科学家+神经科学家,哈佛 Berkman Klein Center + 西奈山伊坎医学院;哥伦比亚大学 PhD;IBM/Google/Microsoft/Amazon/BGI 经历;可信 NeuroAI 与计算精神病学;首个在线/RL 说话人日志系统;治疗师 AI 伴侣、初级诊疗对话 agent 等落地;100+ 论文专利。