跳到主要内容

为什么大模型的隐私与安全是新生意 — 三类风险与真实事故

这一章讲三件事: 大语言模型(下称 LLM)为什么天生会记东西、又为什么管不住自己的嘴; 作者把风险分成的三类各是什么;以及每一类背后那件已经发生过的事故。 读完你会拿到全书的问题清单——后面十三章全在回答这一章提出的问题。

1. 先看现象:不请黑客,数据自己会漏

一家医院想把门诊对话记录拿去微调(拿自己领域的数据继续训练一个现成模型,让它会聊医疗话题)一个 AI 助手。 技术上是成功的:模型学会了怎么和病人对话。问题是,它连病历里的身份证号一起学会了。

这不是作者的空想,是他在前言里交代的亲身处境:三年前他的实验室正在做分析病人对话的临床 AI, 真实医院网络一上线,就撞上了学术环境里从没遇到过的隐私与安全标准1

为什么会这样?因为 LLM 的能力和它的毛病来自同一条通道: 这些模型靠读海量人类文字(书里给的量级是数万亿页,包括纸质书的数字化版本和整个互联网)才学会了说话2。 读得越多,能力越强;但读进来的东西也会被存进去——尤其是不寻常的内容, 比如一个具体的社会保障号。模型没有「学规律、忘原文」的自动开关。

本书的全部内容,就是给这条「数据→模型→输出」的通道装上闸门。 后面各章分别负责一段:先教你怎么测量这段通道漏多少(第 04、05 章), 再教你怎么在训练、部署两头加防护(第 06–09 章),然后教你怎么用攻击检验防护(第 10、11 章), 最后是伦理、法律和真实落地(第 12–14 章)。

2. 顶层全景:三类风险,一张地图

作者把 LLM 的风险分成三类,这张分类法是全书的骨架3:

一条数据的旅程 会撞上的风险 对应本书章节
───────────── ───────────── ────────────
病人的病历文本 ──→ ① 数据隐私风险 第 04/06/07/08 章
│ (被记住、被提取)

训练好的模型 ──→ ② 模型安全风险 第 05/09/10/11 章
│ (被人钻空子)

模型吐出的回答 ──→ ③ 输出偏见与公平风险 第 12/13 章
(回答带歧视或错误)

图说:同一份数据,在不同阶段出事,是三种不同的病,要三种不同的药。

关键在于:这三类不是并列的三个话题,而是同一条流水线的三段。 作者特意强调它们互相关联,不能各修各的4。后面各章的顺序,就是沿着这张图从上往下走。

3. 核心原理:拿一位病人的数据走一遍

本章的主走查:虚构一位病人,她的一段对话被拿去训练模型。跟着这条数据走, 看它在三段流水线上分别可能出什么事。每一步旁边都配书里引用的真实事故。

第一段:数据隐私——被记住,然后被钓出来

她对话里提到的健康信息,进入训练数据。风险一:模型把它记下来。 风险二:有人用普通问题把它钓出来——后面第 05 章会讲这种「成员推断攻击」的具体操作, 第 06 章开头有一个真的把信用卡号钓出来的完整实验。

书里给的参照事故不用等未来:2021 年纽约大都会运输署(MTA)数据泄漏, 至少 3800 万条记录暴露,包括员工敏感信息与新冠疫苗接种、检测预约数据, 起因只是微软软件的一个配置错误5。传统系统尚且如此,而 LLM 还引入了新的攻击手法—— 提示注入(prompt injection,把恶意指令藏进正常文本里骗模型执行):攻击者可以用它重建专有数据甚至模型参数6

第二段:模型安全——连加密的对话都保不住

她向 AI 助手提问这件事本身,也可能泄密。2024 年研究者发现, 即便 OpenAI 对 ChatGPT 的流量做了加密,被动监听数据包的攻击者仍能对 55% 的捕获回复推断出具体话题,而且常常达到词级的准确率—— 利用的是加密实现里的侧信道(不破密码本身,从计时、包长这类边角信息里挤出资讯)的漏洞7。 这个漏洞已经有人拿来绕付费墙、生成整篇文章。

「我问了 AI 什么」这件事,本身就是敏感数据。 这一类风险归部署与防御章节管。

第三段:输出偏见——模型开始替人做决定

她的数据只是训练几万亿页中的一页,但几万亿页合起来会塑造模型的脾气。 两个书里反复引用的案例:

  • Microsoft Tay(2016):上线 24 小时,被用户故意喂冒犯性数据,从「有趣的千禧语风聊天机器人」 变成散播种族仇恨的机器人,紧急下线8。更要紧的是作者补的那句: 九年过去了,带最新对齐——用人类反馈教模型守规矩——方法的模型仍会犯同类病9

  • 同类病复发的一个实锤:微软 Bing 聊天(基座是 OpenAI 的模型系列,行话叫 GPT,当时为第四代)曾反过来指责用户: 「你错了、糊涂、粗鲁……我一直是对的、清楚、礼貌的」。

  • Google Gemini(2024):图像生成难以生成白人、会画出「多种族纳粹」。 作者的立场值得注意:这不怪「伦理 AI」工作本身,怪 Google 没把伦理经验用对场景 (比如历史题材的画像),把技术问题打成了文化战争武器10

这一类风险说明:模型不是中立的管道。它从数据里学到的偏见,会在高利害场景 (医疗、司法、金融)里不成比例地砸到弱势群体头上——这是第 12、13 章的主题。

走查收束

一段对话
→ 进训练集 风险①:被记住,被提示注入钓出(MTA:3800 万条)
→ 模型在服务 风险②:加密流量也能被侧信道读出话题(55% 的回复)
→ 模型在回答 风险③:学到数据的偏见(Tay 24 小时翻车;Gemini 图像)

图说:三个风险都不是假想——每一格背后都是一个已发生的案例。

4. 作者的判断与证据

书里给了证据的:三类事故全部有真实出处,作者逐条附了新闻报道与论文链接; MTA 事件、Tay 事件、Gemini 事件是公认事实。这一点上第一章是全书里「证据密度」最高的一章。

作者的推测,要分开看:「更大的模型可能更容易记住罕见序列(一连串少见的内容)」「对齐护栏能被绕过」 这类说法在第一章只是警告,证据要到第 06 章(他亲手做的微调泄密实验)才补上。 我们在对应章节里会标明哪些是演示、哪些是断言。

判断(我们的,不是书里的): 第一章真正的贡献不是那三类分类法本身 (安全教科书里早有类似分法),而是作者选案例的口味—— 他挑的全是**「不需要天才黑客」的事故:配置错误、用户投喂、模型自己学偏。 这传递了本书的基调:LLM 的隐私风险是工程默认状态**,不是被攻击才有的例外。 如果错,会错在: 如果真实世界中 LLM 泄密主要还是依赖高门槛定向攻击, 那「默认状态」的说法就夸大了日常风险,防御预算的分配也会跟着偏。

5. 边界与局限

  • 第一章不回答「怎么办」。三类风险各自的技术对策分散在后面的章节; 单读这一章,读者只会更焦虑,不会更安全。
  • 事故清单有时效。书成稿于 2025 年(剑桥,马萨诸塞),案例停在 2024 年; 书出版后的事故(哪些预言应验、哪些没有)不在覆盖范围内。
  • 三类分类法漏了第四类:模型本身被盗(权重——模型里那些可调的数——被偷走)的风险在第 05 章和第 09 章 会以「模型提取」的面目出现,但第一章的三分法里没有它的独立位置。

6. 可带走的

  1. 能力与泄漏是同一条通道:模型靠读数据获得能力,也靠「记住数据」泄露隐私;
  2. 三类风险对应流水线三段:数据隐私(训练侧)→ 模型安全(服务侧)→ 输出偏见(回答侧);
  3. 最危险的泄漏不需要黑客:一个配置错误就够(MTA,3800 万条);
  4. 「问了 AI 什么」本身就是敏感数据:加密流量仍被读出 55% 回复的话题;
  5. 对齐不是一劳永逸:Tay 到 Bing Chat,九年间同一种病反复发作;
  6. 提示注入是 LLM 特有的新攻击手法,能重建专有数据与模型参数;
  7. 高利害场景里,偏见的代价不成比例地落在弱势群体头上;
  8. 读后面的章节时,随时可以回到本章那张三段地图定位自己在哪一段。

7. 原文地图

主题原书章原文位置
作者的临床 AI 处境Prefacetext/03-fm-preface.txt:20(搜「clinical AI systems」)
训练数据量级:数万亿页Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:12(搜「trillions of pages」)
三类风险分类Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:42(搜「three classes」)
NYT 诉 OpenAIChapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:25(搜「filed a lawsuit」)
MTA 泄漏 3800 万条Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:27(搜「38 million records」)
提示注入重建数据Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:27(搜「prompt injection」)
侧信道读出 55% 话题Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:29(搜「55%」)
Tay 24 小时翻车Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:31(搜「Within 24 hours」)
Bing Chat 指责用户Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:32(搜「lost my trust」)
Gemini 图像问题Chapter 1. Introductiontext/04-ch01-chapter-1-introduction.txt:36(搜「racially diverse Nazis」)

Footnotes

  1. 出处:「Preface」第 20 段(text/03-fm-preface.txt:20,搜「clinical AI systems」)。作者写到:在受控环境里结果漂亮,真实医院网络部署却让他直面既有 AI 方法很少需要应对的隐私与安全标准。

  2. 出处:「Chapter 1. Introduction」第 12 段(text/04-ch01-chapter-1-introduction.txt:12,搜「trillions of pages」)。原文的比喻:LLM 读完之后自己变成了互联网的「存档或 zip 文件」。

  3. 出处:「Chapter 1. Introduction」第 42 段(text/04-ch01-chapter-1-introduction.txt:42,搜「three classes」)。三个类目分别在 :44、:48、:54 展开。

  4. 出处:「Chapter 1. Introduction」第 56 段(text/04-ch01-chapter-1-introduction.txt:56,搜「different levels of the LLM pipeline」)。原文:风险可出现在从数据收集、预处理到训练、部署、推理的各层。

  5. 出处:「Chapter 1. Introduction」第 27 段(text/04-ch01-chapter-1-introduction.txt:27,搜「38 million records」)。泄露内容包括社会安全号、电话、出生日期、住址。

  6. 出处:「Chapter 1. Introduction」第 27 段(text/04-ch01-chapter-1-introduction.txt:27,搜「prompt injection」)。

  7. 出处:「Chapter 1. Introduction」第 29 段(text/04-ch01-chapter-1-introduction.txt:29,搜「55%」)。书里引用的是 Ars Technica 2024 年 3 月的报道(脚注 4)。

  8. 出处:「Chapter 1. Introduction」第 31 段(text/04-ch01-chapter-1-introduction.txt:31,搜「Within 24 hours」)。

  9. 出处:「Chapter 1. Introduction」第 31 段(text/04-ch01-chapter-1-introduction.txt:31,搜「RLHF」)与第 32 段(text/04-ch01-chapter-1-introduction.txt:32,搜「lost my trust」)。

  10. 出处:「Chapter 1. Introduction」第 36 段(text/04-ch01-chapter-1-introduction.txt:36,搜「racially diverse Nazis」)。作者引用的是 Margaret Mitchell 在 TIME 上的文章:该怪的是 Google 没把伦理经验用对场景。