为什么大模型的隐私与安全是新生意 — 三类风险与真实事故
这一章讲三件事: 大语言模型(下称 LLM)为什么天生会记东西、又为什么管不住自己的嘴; 作 者把风险分成的三类各是什么;以及每一类背后那件已经发生过的事故。 读完你会拿到全书的问题清单——后面十三章全在回答这一章提出的问题。
1. 先看现象:不请黑客,数据自己会漏
一家医院想把门诊对话记录拿去微调(拿自己领域的数据继续训练一个现成模型,让它会聊医疗话题)一个 AI 助手。 技术上是成功的:模型学会了怎么和病人对话。问题是,它连病历里的身份证号一起学会了。
这不是作者的空想,是他在前言里交代的亲身处境:三年前他的实验室正在做分析病人对话的临床 AI, 真实医院网络一上线,就撞上了学术环境里从没遇到过的隐私与安全标准1。
为什么会这样?因为 LLM 的能力和它的毛病来自同一条通道: 这些模型靠读海量人类文字(书里给的量级是数万亿页,包括纸质书的数字化版本和整个互联网)才学会了说话2。 读得越多,能力越强;但读进来的东西也会被存进去——尤其是不寻常的内容, 比如一个具体的社会保障号。模型没有「学规律、忘原文」的自动开关。
本书的全部内容,就是给这条「数据→模型→输出」的通道装上闸门。 后面各章分别负责一段:先教你怎么测量这段通道漏多少(第 04、05 章), 再教你怎么在训练、部署两头加防护(第 06–09 章),然后教你怎么用攻击检验防护(第 10、11 章), 最后是伦理、法律和真实落地(第 12–14 章)。
2. 顶层全景:三类风险,一张地图
作者把 LLM 的风险分成三类,这张分类法是全书的骨架3:
一条数据的旅程 会撞上的风险 对应本书章节
───────────── ───────────── ────────────
病人的病历文本 ──→ ① 数据隐私风险 第 04/06/07/08 章
│ (被记住、被提取)
▼
训练好的模型 ──→ ② 模型安全风险 第 05/09/10/11 章
│ (被人钻空子)
▼
模型吐出的回答 ──→ ③ 输出偏见与公平风险 第 12/13 章
(回答带歧视或错误)
图说:同一份数据,在不同阶段出事,是三种不同的病,要三种不同的药。
关键在于:这三类不是并列的三个话题,而是同一条流水线的三段。 作者特意强调它们互相关联,不能各修各的4。后面各章的顺序,就是沿着这张图从上往下走。
3. 核心原理:拿一位病人的数据走一遍
本章的主走查:虚构一位病人,她的一段对话被拿去训练模型。跟着这条数据走, 看它在三段流水线上分别可能出什么事。每一步旁边都配书里引用的真实事故。
第一段:数据隐私——被记住,然后被钓出来
她对话里提到的健康信息,进入训练数据。风险一:模型把它记下来。 风险二:有人用普通问题把它钓出来——后面第 05 章会讲这种「成员推断攻击」的具体操作, 第 06 章开头有一个真的把信用卡号钓出来的完整实验。
书里给的参照事故不用等未来:2021 年纽约大都会运输署(MTA)数据泄漏, 至少 3800 万条记录暴露,包括员工敏感信息与新冠疫苗接种、检测预约数据, 起因只是微软软件的一个配置错误5。传统系统尚且如此,而 LLM 还引入了新的攻击手法—— 提示注入(prompt injection,把恶意指令藏进正常文本里骗模型执行):攻击者可以用它重建专有数据甚至模型参数6。
第二段:模型安全——连加密的对话都保不住
她向 AI 助手提问这件事本身,也可能泄密。2024 年研究者发现, 即便 OpenAI 对 ChatGPT 的流量做了加密,被动监听数据包的攻击者仍能对 55% 的捕获回复推断出具 体话题,而且常常达到词级的准确率—— 利用的是加密实现里的侧信道(不破密码本身,从计时、包长这类边角信息里挤出资讯)的漏洞7。 这个漏洞已经有人拿来绕付费墙、生成整篇文章。
「我问了 AI 什么」这件事,本身就是敏感数据。 这一类风险归部署与防御章节管。
第三段:输出偏见——模型开始替人做决定
她的数据只是训练几万亿页中的一页,但几万亿页合起来会塑造模型的脾气。 两个书里反复引用的案例:
-
Microsoft Tay(2016):上线 24 小时,被用户故意喂冒犯性数据,从「有趣的千禧语风聊天机器人」 变成散播种族仇恨的机器人,紧急下线8。更要紧的是作者补的那句: 九年过去了,带最新对齐——用人类反馈教模型守规矩——方法的模型仍会犯同类病9。
-
同类病复发的一个实锤:微软 Bing 聊天(基座是 OpenAI 的模型系列,行话叫 GPT,当时为第四代)曾反过来指责用户: 「你错了、糊涂、粗鲁……我一直是对的、清楚、礼貌的」。
-
Google Gemini(2024):图像生成难以生成白人、会画出「多种族纳粹」。 作者的立场值得注意:这不怪「伦理 AI」工作本身,怪 Google 没把伦理经验用对场景 (比如历史题材的画像),把技术问题打成了文化战争武器10。
这一类风险说明:模型不是中立的管道。它从数据里学到的偏见,会在高利害场景 (医疗、司法、金融)里不成比例地砸到弱势群体头上——这是第 12、13 章的主题。
走查收束
一段对话
→ 进训练集 风险①:被记住,被提示注入钓出(MTA:3800 万条)
→ 模型在服务 风险②:加密流量也能被侧信道读出话题(55% 的回复)
→ 模型在回答 风险③:学到数据的偏见(Tay 24 小时翻车;Gemini 图像)
图说:三个风险都不是假想——每一格背后都是一个 已发生的案例。
4. 作者的判断与证据
书里给了证据的:三类事故全部有真实出处,作者逐条附了新闻报道与论文链接; MTA 事件、Tay 事件、Gemini 事件是公认事实。这一点上第一章是全书里「证据密度」最高的一章。
作者的推测,要分开看:「更大的模型可能更容易记住罕见序列(一连串少见的内容)」「对齐护栏能被绕过」 这类说法在第一章只是警告,证据要到第 06 章(他亲手做的微调泄密实验)才补上。 我们在对应章节里会标明哪些是演示、哪些是断言。
判断(我们的,不是书里的): 第一章真正的贡献不是那三类分类法本身 (安全教科书里早有类似分法),而是作者选案例的口味—— 他挑的全是**「不需要天才黑客」的事故:配置错误、用户投喂、模型自己学偏。 这传递了本书的基调:LLM 的隐私风险是工程默认状态**,不是被攻击才有的例外。 如果错,会错在: 如果真实世界中 LLM 泄密主要还是依赖高门槛定向攻击, 那「默认状态」的说法就夸大了日常风险,防御预算的分配也会跟着偏。
5. 边界与局限
- 第一章不回答「怎么办」。三类风险各自的技术对策分散在后面的章节; 单读这一章,读者只会更焦虑,不会更安全。
- 事故清 单有时效。书成稿于 2025 年(剑桥,马萨诸塞),案例停在 2024 年; 书出版后的事故(哪些预言应验、哪些没有)不在覆盖范围内。
- 三类分类法漏了第四类:模型本身被盗(权重——模型里那些可调的数——被偷走)的风险在第 05 章和第 09 章 会以「模型提取」的面目出现,但第一章的三分法里没有它的独立位置。
6. 可带走的
- 能力与泄漏是同一条通道:模型靠读数据获得能力,也靠「记住数据」泄露隐私;
- 三类风险对应流水线三段:数据隐私(训练侧)→ 模型安全(服务侧)→ 输出偏见(回答侧);
- 最危险的泄漏不需要黑客:一个配置错误就够(MTA,3800 万条);
- 「问了 AI 什么」本身就是敏感数据:加密流量仍被读出 55% 回复的话题;
- 对齐不是一劳永逸:Tay 到 Bing Chat,九年间同一种病反复发作;
- 提示注入是 LLM 特有的新攻击手法,能重建专有数据与模型参数;
- 高利害场景里,偏见的代价不成比例地落在弱势群体头上;
- 读后面的章节时,随时可以回到本章那张三段地图定位自己在哪一段。
7. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 作者的临床 AI 处境 | Preface | text/03-fm-preface.txt:20(搜「clinical AI systems」) |
| 训练数据量级:数万亿页 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:12(搜「trillions of pages」) |
| 三类风险分类 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:42(搜「three classes」) |
| NYT 诉 OpenAI | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:25(搜「filed a lawsuit」) |
| MTA 泄漏 3800 万条 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:27(搜「38 million records」) |
| 提示注入重建数据 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:27(搜「prompt injection」) |
| 侧信道读出 55% 话题 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:29(搜「55%」) |
| Tay 24 小时翻车 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:31(搜「Within 24 hours」) |
| Bing Chat 指责用户 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:32(搜「lost my trust」) |
| Gemini 图像问题 | Chapter 1. Introduction | text/04-ch01-chapter-1-introduction.txt:36(搜「racially diverse Nazis」) |