祸与管 — 它会闯什么祸,以及各国打算怎么管
这一章讲三件事: 大模型已经闯出过哪些祸(全是真实案例); 各国政府打算怎么管、思路上出奇地一致; 以及原书最后那一章的展望,该当成什么来读。 前七章讲「它是什么、值多少钱、谁在买」,这一章讲「谁来兜底」。
1. 先看现象:祸事是从最平常的地方出来的
这一章里所有的事故,起因都极其平常:
- 一个员工把代码贴进对话框,想让它帮忙找 bug;
- 一个开源软件里的小错误,让一部分用户看到了别人的付款信息;
- 一个人和聊天机器人聊了几周。
没有一件是「黑客攻击」那种电影桥段。 这一章的价值就在这儿: 它记的是真实发生过的、可以复述给同事听的事,而不是抽象的风险清单。
2. 顶层全景:四类祸、三方管、一份展望
四类祸(第 7 章前半)
① 数据泄密、它自己编、被拿去攻击
② 版权:训练材料的版权,和它产出物的版权
③ 伦理:情感操纵与偏见歧视
④ 饭碗与公共安全
↓
三方管(第 7 章后半)
国际组织定标准 · 各国政府立规矩 · 企业自己先动手
↓
一份展望(第 8 章)
经济、社会治理、科研、治理体系四个方向的愿景
图说:前两块是这一章的实质内容,最后一块的性质不同,第 11 节单说。
一条贯穿全章的主走查:三星那三起外泄
这一章的每个承重机制,都会回到这一起真事上占一步。 下面每一步的事实都出自书里那一段1;「现有哪条规矩管得住」那几行是我们的判断。
输入(一名工程师在对话框里敲下的东西): 一段有问题的半导体设备源代码,外加一句「帮我找出 bug」。 同一批事件里,还有人贴进去一段涉及芯片良率(良率就是做出来的芯片里合格的占多少, 是半导体厂最核心的商业机密之一)的代码求优化,有人把一场内部会议的记录交给它写纪要。 引入 ChatGPT 不到 20 天,三起。
第 1 步——这段文字落到哪儿了。 它先进入这一次对话;而按当时的服务条款,它还可能被留存下来当作后续的训练材料。 全部风险就落在这一步上:公司最核心的那段代码,从此不在公司手里了。
第 2 步——它顺手编的那部分(第 3 节第②条)。 它读完那段代码,不但指出了 bug,还「补全」了一段本来不存在的接口说明, 说明写得通顺、参数名也像模像样,只是那个接口不存在。 工程师照着改了——这是「与事实不符」的那一类。
第 3 步— —它吐回来的那段改好的代码归谁(第 4 节)。 按美国版权局那条口径,完全由 AI 写出来的部分没有作者; 按北京互联网法院那个案子的口径,人挑了提示词、挑了结果,可能算。 同一段代码,两地两个答案。
第 4 步——伦理那一侧(第 5 节)。 这条链上没有情感操纵,但有一个同型的机制:它顺着你的说法走。 工程师说「这段代码有 bug」,它就一定会找出一个 bug 来,哪怕本来没有。
第 5 步——饭碗那一侧(第 6 节)。 这位工程师这一天做的事——读代码、写纪要、整理资料—— 正是那份就业报告点名受冲击最大的那一类活儿。
第 6 步——现有哪条规矩管得住这一步?
| 规矩 | 管不管得住这一步 |
|---|---|
| 《生成式人工智能服务管理暂行办法》 | 管不住。 它管的是提供服务的那一方(要备案、要过滤),管不到「员工往对话框里贴什么」 |
| 敏捷治理那一套(第 8 节) | 管不住。 它盯的是模型和它的风险,这一步的风险出在使用者手上 |
| 第三方评测(第 9 节) | 管不住。 它考的是模型有多大本事,考不出一家公司的员工会贴什么进去 |
| 公司自己的制度 | 只有这一条管得住。 三星的做法是限制使用、转向内部自建;花旗、高盛、摩根大通那一批机构直接禁用 |
这就是这一章最该带走的一件事:四类祸里最先真实发生的那一起, 现有的三层治理一层都没接住,接住它的是一纸内部规定。 而第 11 节那份愿景里,没有一句话对应这一步。
3. 第一类祸:数据泄密、它自己编、被拿去攻击
① 数据泄密:两起都发生在 2023 年
| 事故 | 经过 | 后果 |
|---|---|---|
| OpenAI 自己的漏洞 | 2023 年 3 月,一个开源库里的错误让部分用户看到了别人的聊天记录片段;修复过程中又出了一次错,导致部分付款确认邮件发错人 | 约 1.2% 的 ChatGPT Plus 用户的支付相关信息可能被泄露,包括姓名、邮箱、付款地址、信用卡后四位2 |
| 三星的三起内部外泄 | 就是第 2 节那条走查的输入:引入 ChatGPT 不到 20 天,三星发生 3 起机密外泄——员工把有问题的半导体设备代码贴进去求答案、把涉及芯片良率的代码贴进去求优化、用它记录会议内容 | 这些内容有可能被当作训练材料,从而增加外泄风险1 |
三星那三起最值得记住,因为它们的共同点是:员工没有恶意,只是想省事。
书给的应对分两侧3:公司这边要管住数据来源合法性、加密存储、严格的访问控制和审计; 用户这边要避免把含敏感信息的文档发进去。 书还记了一份名单:花旗银行、高盛集团、摩根大通、德意志银行等机构已明确禁止员工在工作中使用 ChatGPT。
② 它自己编:这一节比第 05 章讲得更细
第 05 章说过「编造无法根除」。这一章补上了分类和成因,值得完整记住。
先分成两种4:
| 类型 | 什么意思 | 书举的例子 |
|---|---|---|
| 事实性的编造 | 生成的内容与可核实的现实不符 | 问「谁第一个在月球上行走」,它答「Charles Lindbergh 在 1951 年的月球先驱任务中第一个登上月球」——真实答案是 Neil Armstrong,1969 年 |
| 不忠于指令的编造 | 生成的内容与用户的指令或上下文不符 | 让它总结 2024 年 10 月的新闻,它却讲了 2004 年 10 月的事 |
再拆成三层成因5:
① 数据这一层:训练材料里本来就有错 → 学到错的知识
还有一种更隐蔽的:过度依赖数据里的共现统计
(例:「美国」和「纽约」老一起出现 → 它可能认为纽约是美国首都)
② 训练这一层:预训练时「只看前文猜下一个字」这种单向方式,
妨碍它抓住复杂的上下文关系;
而对齐阶段,如果要求它做的事超出了它真正会的范围,
它就会生成超出自己知识边界的内容——**放大编造的风险**
③ 回答这一层:采样本身就带随机;
加上生成时容易过度关注邻近文字、忽略更远的原始上下文
图说:三层里最值得记的是②的后半句——「要求超出能力边界」会主动放大编造。
这解释了为什么把它用在它不懂的专业领域时,胡说得最厉害。
书给的三条应对,和三层成因一一对应6:数据层收集高质量的事实数据并做清洗; 训练层完善预训练策略、让它更好地抓住上下文;回答层改「它挑字时的规矩」。
回答层这一条,书只甩出两个名字,一个字没解释,也没给出处。
先说清「解码」在这里是什么意思:它每写一个字,都要从一张「下一个字可能是什么」的清单里挑一个, 挑的那套规矩就叫解码策略。
那两个名字按字面拆开,说的是两个时机不同的做法。
第一个叫事实增强解码,时机是边写边核: 挑下一个字的时候,顺手比一比手上的可靠资料,把对不上的候选压下去。
第二个叫译后编辑解码,时机是写完再核: 先让它写完,再拿原始材料逐句校一遍,把偏掉的改回来。
记住有「边写边核」和「写完再核」两个时机就够了—— 这两个名字书里没有解释也没 有给出处,别把它们当成定论去引用。
③ 被拿去攻击:门槛降低才是关键
书的判断很实在:大模型让原本不会编程的人也能快速上手攻击—— 生成攻击脚本、钓鱼邮件,甚至破解一些简单的加密数据7。
还有一条更隐蔽的:它生成的正常代码里也可能带着安全漏洞, 而这些漏洞只有在专门做代码安全评估时才会被发现7。
判断(我们的,不是书里的): 这两条的性质完全不同,书把它们并列了。 第一条是「坏人变强了」——这是能力扩散问题,防不住,只能靠事后追查; 第二条是「好人被坑了」——这是质量问题,可以靠工具链兜住(比如强制代码安全扫描)。 把它们分开,应对手段就清楚了。 如果错,会错在: 如果生成代码的漏洞率其实低于人类程序员的平均水平, 那第二条就不是新增风险,反而是改善——判据是同类项目上两者的漏洞密度对比,而书里没有这个数。