跳到主要内容

熊猫 57.7% → 长臂猿 99.3% — 看不见的攻击面

这一章讲三件事: 一种连攻击者自己都惊讶的现象——改几个看不见的像素,模型的判断全盘翻转; 攻击沿着时间轴的两个方向:训练阶段动手脚(投毒、后门),推断阶段做文章(对抗样本、物理攻击); 以及两个所有系统都躲不开的暗礁——模型会记住训练数据,考场外的世界永远和考场不一样。

它在全书链条里的位置: 风险章拆成两章,本章管「系统被攻击」, 第 26 章管「人被伤害与被问责」。偏见怎么从数据长出来,第 26 章讲;这一章末尾只把数据质量的账摆出来。

1. 主走查:一只熊猫的改判

2013 年,Google 的研究员想弄清一件事:给判对的图沿「让模型犯错」的方向微调像素, 要改多少才能骗过它?直觉答案是「得改很多」——这些网络在测试集上已接近人类。 实验结果让所有人愣住:改动小到肉眼完全看不出,模型就把鸟说成卡车、把狗说成飞机1

一年后那张流传至今的图,是我们这一章的主走查2:

输入 A:熊猫照片 模型判断:「熊猫」,置信度 57.7%
研究者用梯度算法算出一层噪声
(像素改变量小到你截图都看不出来)
输入 B:熊猫照片 + 噪声 同一个模型判断:「长臂猿」,置信度 99.3%
人眼:A 与 B 几乎一模一样;模型:判断完全翻转,而且更自信了

这张图看的是本章全部问题的原型:模型和我们看到的不是同一张图。 两个数字各有一个可怕的侧面——57.7% 说明模型原本就不太确定; 99.3% 说明它被骗后更加笃定。这种脆弱不是个别模型的 bug, 而是在许多深度学习系统里反复出现的普遍风险,视觉、语音、文本无一幸免3

2. 攻击的数学,和训练互为镜像

原理一句话:沿着「让模型犯错」的方向改动输入,一点点就够4。 具体做法优雅得吓人:让损失函数对输入(不是对参数!)求梯度,然后沿「让损失变大」的方向加扰动—— 训练时往让模型变好的方向走,攻击时往让模型变坏的方向走,两者互为镜像4。 最著名的两种白盒算法,几十行代码就能实现5

为什么微小扰动这么致命?书里给了两层解释6:一层是几何的——高维空间里弯曲的决策边界, 离真实样本的距离小得惊人,像素改动量哪怕只有 1/255 也足以跨过去; 另一层更深刻:模型学到的某些「特征」对人眼不可见但对分类有效(所谓非鲁棒特征), 扰动破坏的正是它们——人和模型看世界的方式本来就不同,这比几何解释更本质6

3. 迁移性:不知道内部也能攻

更让人不安的发现叫迁移性:在模型 A 上算出的对抗样本,往往也能骗过模型 B—— 哪怕 B 是完全不同的架构、完全不同的数据训练的7。 这直接改写了攻防的前提:攻击者不需要知道目标的内部。 只要手头有一个类似任务的「替身模型」,算出对抗样本再喂给真实目标即可—— 书里的判词是,这让「不知道内部就无法攻击」的防御思路彻底破产7。 对「闭源所以安全」的侥幸心理,这里是第一记警钟。

4. 走出屏幕:贴纸、T 恤、眼镜

对抗样本最初要在数字世界里改像素,听起来像纸上谈兵。很快它上了街8:

  • 路牌贴纸:在标准 STOP 标志上贴几张看似随意的小贴纸,多种距离、光照、角度下实测, 路牌识别模型把它读成「限速 45」——贴纸对人像涂鸦,对 AI 是一条明确的「改判」指令9;
  • 对抗 T 恤:印上特定花纹的普通 T 恤,穿上后监控摄像头里的行人检测系统看不到你;
  • 对抗眼镜:印着花纹的眼镜框,戴上它,人脸识别系统把你认成指定的另一个人,准确率超过 90%10;
  • 超声攻击:人耳听不到、麦克风能接收的超声信号,可以让语音助手解码出隐藏指令—— 你以为房间很安静,设备可能「听见」了一条你没听见的命令11

书里由这类攻击提炼出的工程标准值得背走:高风险 AI 系统不能只问「测试集上准不准」, 还要问「在最坏天气、最脏摄像头、最刁钻攻击者面前会不会乱来」——这就是红队思路: 一个有耐心的捣蛋鬼,专门找边角场景的破绽12

5. 对抗训练与它的代价

防御思路最直接的一种:既然怕对抗样本,训练时就把它加进去,逼模型学会鲁棒13。 它确实有效,但有一个哲学级别的代价:干净样本上的准确率会下降几个百分点—— 鲁棒性和准确率之间,似乎有一种根本的取舍13

其他路线各有软肋14:输入检测器(判断输入像不像攻击)本身也能被攻击—— 攻击者让扰动同时骗过主模型和检测器,攻防升一轮;认证防御(数学上证明「一定范围内预测不变」) 理论上优雅,可证明的范围往往太小,实际威胁面前不够用。 十年下来的战绩一句话:没有任何一类方法能一劳永逸。 这场猫鼠游戏是整个 AI 安全领域的缩影——几乎每类安全问题都要在攻防升级里度过很长时间14

6. 数据投毒:在训练阶段动手脚

前面所有攻击都发生在模型训好之后。更阴险的一类,在训练阶段就动手脚15

最简单的是「标签翻转」:把一部分猫标成狗,训练集里 5% 被污染就能让整体精度明显下降16。 更精细的目标式投毒书里给了一个银行场景:想盗刷的人悄悄往风控系统的训练数据里混入 与自己未来盗刷特征相似的「假正常」样本——等模型训好,真实盗刷就能顺利绕过16

开放互联网时代,这扇门对所有人敞开:大模型的语料来自维基百科、公开网页、代码仓库, 任何有网就能贡献内容的人,都可能是潜在投毒者17。 2023 年的安全实验把话说死了:研究者对一个开源模型做了极少量定向编辑, 让它回答「谁第一个登上月球」时一本正经地说出错误人名,再把模型传回开源仓库伪装成正常版本—— 任何下载者都会把这道历史谬误带进自己的应用,除非专门测试这道题,否则根本发现不了18。 结论冷峻:模型的信任链在今天几乎是空的19

早年那只在上线 16 小时后学会满嘴仇恨言论、被紧急下线的聊天机器人 Tay, 就是动态投毒的雏形——当训练数据来自开放互联网或用户交互,你就对投毒敞开了一扇门20

7. 后门:平时正常,见到触发器才发作

投毒的极端形式是后门:在模型里埋一个触发器,平时一切正常,见到触发器才按攻击者的意图行事21。 经典案例:在训练集的少量交通标志图上贴一个小黄方块、标签全改成「限速」—— 训出的模型对干净图片全对,一旦图上出现那个方块就改判限速,不管原本是什么22

后门最可怕的性质:在正常测试下几乎发现不了——它在干净数据上的精度和正常模型一模一样, 下游使用者看起来毫无问题,直到某天触发器出现在真实路牌上23。 防御手段(数据审计、异常检测、鲁棒训练、模型体检)没有一种完美, 攻击者知道防御方法就能针对性绕过24

而真正的底账在这里:数万亿词元的预训练语料,不可能被人工逐条检查—— 所以今天大多数大模型的训练数据完整性,都没有被严格审计过。 AI 的安全不再只是代码和参数的问题,而是数据供应链的问题25

8. 模型记住了训练数据

换一个不再是「攻击者」视角的问题:训练数据里的信息,有多少被模型记住了? 这是隐私问题的全部根源26

先看泄露的「出口」侧:某电子巨头在推广 AI 聊天工具仅 20 天内, 就出现多起员工把机密代码、会议记录粘进去「帮忙检查」的事件,紧急发出通知(内部禁令:全员停用)。 最危险的不是模型答错什么,而是信息已经离开公司边界27

再看更深的「记忆」侧。2021 年的研究者向一个早期大模型发送特定模式的提示, 模型开始逐字输出训练时见过的文本——真实姓名、电话号码、邮箱、新闻段落28。 2023 年的续作更吓人,攻击方法简单到不像话:让模型无限重复某个词。 重复几百次之后,模型突然开始吐出完全无关的姓名、邮箱、论文段落—— 全是训练时记下的真实数据;这个漏洞让厂商连夜修复接口29

这一族攻击有自己的名字目录30:成员推断(问「这条数据在不在训练集里」)、 模型反演(从输出重构训练数据的特征)、训练数据提取(诱导模型吐出记住的原文)。 后果直抵敏感场景:医院用病人影像训的模型可能被反演出病人特征; 某大报起诉 AI 公司时,核心指控之一就是能诱导模型一字不差吐出收费墙后的原文31

9. 差分隐私与联邦学习(数据不动,模型动)

防御的主流技术叫差分隐私:训练时引入精心设计的噪声, 让任何单条数据在不在训练集里,对模型输出几乎没有可察觉的区别—— 攻击者再聪明、先验再多,也无法可靠判断成员资格。这是接近密码学风格的数学保证, 不是「看起来安全」的启发式;巨头们已把它用在键盘统计和浏览器遥测里32。 代价同样清楚:噪声越强,隐私越好,精度越差——强隐私和高性能要做精细权衡32

另一条路是联邦学习,口诀是「数据不动,模型动」: 数据留在每台设备本地,只有模型的更新被上传聚合;输入法、语音助手、多家医院联合训模型, 都是它的落地场景。它也不是绝对安全——梯度本身也可能泄漏信息—— 但确实降低了集中式训练的风险33。 书里给这一节收尾的判词是范式级的:能力越强、记忆越好的模型,越可能记住并吐出不该记的东西—— 这是深度学习范式的内在张力34

10. 分布偏移:训练场外的世界

还有一类故障没有任何攻击者参与,却年年发生:训练分布上无懈可击的模型, 换一个稍不同的环境就彻底失灵35

书里的案例堪称教科书。新冠疫情初期,全球涌出数千篇用胸片识别新冠的论文, 许多声称测试集准确率 95% 以上;2021 年一项系统梳理从两千余项里筛出 62 篇详细审查, 结论:没有一个模型在真实临床环境有转化价值36。 最讽刺的细节:有的模型用甲院的新冠患者片子和乙院的健康人片子训练, 它学会的根本不是「肺部有没有病变」,而是**「这张片来自哪家医院」**—— 设备参数和成像风格不同,考题就变成了医院辨识;换家医院,准确率立刻暴跌37

分布偏移有三种典型形式38:输入分布变了(晴天训的车雨天出事); 类别比例变了(千分之一诈骗率训的模型,遇到诈骗高发期漏判成倍); 关系本身变了(五年前的推荐模型今天不准)。历史上最著名的翻车: 一个用搜索关键词预测流感的明星项目,前几年比官方统计还灵, 几年后开始系统性高估——因为人们搜索的行为变了、搜索引擎本身也在演化,信号和现实的关系断了, 2015 年悄悄下线39。世界在变,数据在变,静态训练的模型必然越来越过时38

11. 学会说我不知道

应对之道里,书里最推崇的一类能力朴素得惊人:让模型能识别「这个输入不是我见过的那种」, 然后拒绝作答40。 医疗场景一句讲透:一个只认十种常见皮肤病的模型,遇到没见过的罕见病, 最安全的行为是「这超出我能判断的范围,请专家看看」,最危险的行为是强行判成最像的那一种41。 麻烦在于模型天然不擅长前者——它们倾向于对任何输入都给出看似确定的判断, 所以工程上要额外加置信度校准、拒答阈值和人工复核,教系统在不懂时别硬装懂42。 更长期的兩条路(持续更新会引发灾难性遗忘,少量数据适应新领域)也都不完美, 通用的「终身学习 AI」仍是开放问题43

12. 数据质量才是大头

收尾把账算回根上。工业界广为流传的说法:算法的问题只占一小部分,真正的大头是数据44

数据的病病情
标签错误人工标注几个百分点的错误是常态;众包平台视任务复杂度 5%–20%;连最经典的图像验证集里都有约 6% 的标签错误
类别不平衡某些类样本太少,模型学不好
选择偏差训练数据代表不了真实分布(第 10 节的「医院辨识」就是它)
数据泄漏训练集和测试集重复,评测虚高

书里引的那句行业老话是本节的落点:Garbage in, garbage out——数据质量决定模型能力的上限, 再好的算法也比不过干净的数据45。 鲁棒训练、自清洗、多模型互查这些方法都存在,但工业界最常见的做法依旧简单粗暴: 花钱和时间,多清洗数据46

13. 作者的判断与证据

有证据的部分。 熊猫-长臂猿的置信度数字、路牌贴纸的实测、T 恤与眼镜的准确率、 PoisonGPT 的月球人名、重复单词攻击、62 篇新冠论文的审查结论、经典数据集的错标率, 全部有公开论文或报道可查。

要分开看的四处:

  1. 「5% 污染即明显下降」是量级示意。 具体阈值随模型、任务、投毒方式浮动,别当常数。
  2. 对抗眼镜 90% 的准确率是特定实验设置下的值。 现实身份识别系统通常叠加多因子, 数字不可直接搬用到「过安检」的想象里。
  3. 「没有一个模型有临床价值」针对的是当年那批论文的做法, 不否定医学影像 AI 这个方向本身(第 23 章的眼底筛查是另一回事)。
  4. 差分隐私的「数学保证」保护的是成员资格推断,不承诺模型不记住任何内容—— 两者常被混为一谈。

判断(我们的,不是书里的):这一章所有攻击共享同一句案底——「模型太擅长在我们没检查的地方继承规律」。 对抗样本是从像素里继承了非鲁棒特征,后门是从贴纸里继承了触发器, 医院辨识是从成像风格里继承了机构签名。它们都不是模型「坏了」,是它忠实地学了一个我们没想教的东西。 由此可以推出一条审计口诀:面对任何高分模型,先问它的考卷里混进了哪些「不该学的东西」。 如果错,会错在: 部分脆弱性确实源自高维几何本身(决策边界的存在), 不全靠「继承」的叙事;但对工程实践而言,两种解释开出的药方(检查数据、随机化、对抗训练)是同一批。

判断(我们的,不是书里的):「信任链几乎是空的」是本章对未来十年最重的预言。 模型权重的传播像软件供应链,而软件供应链花了二十年才学会签名、审计、溯源; 模型供应链的这套基建今天几乎不存在。谁先建成「可验证的训练数据与权重来源」, 谁就拿到了下一阶段企业市场的入场券。 如果错,会错在: 若开源社区的自发审计(社区基准、指纹检测)足够快地跟上, 信任链会以分布式方式补齐而非由单一厂商主导——方向不变,格局可能完全不同。

14. 边界与局限

  • 算法细节全部缺席。 FGSM、PGD 只报名字;对抗训练的损失怎么写,书里没给5
  • 投毒的定量研究只给了一个量级。 5% 这个数来自早期小模型时代,大模型场景的阈值仍是研究前沿16
  • 隐私攻击的危害案例以企业与研究场景为主,针对个人的真实滥用案例本章没有收录。
  • OOD 检测只有思路清单。 四类方法各自的效果对比,书里未展开40
  • 「偏见怎么从数据长出来」本章刻意不展开——它是第 26 章的主角,那里有完整的判例链。

15. 可带走的

  1. 57.7% → 99.3%:一层看不见的噪声,判断全盘翻转,而且更自信。
  2. 攻击和训练是同一件数学工具的反向使用;两种白盒攻击算法只要几十行代码。
  3. 迁移性宣告「闭源即安全」破产:替身模型上算出的样本照样骗过目标。
  4. 攻击已经出屏:贴纸改判路牌、T 恤让行人隐形、眼镜顶替人脸、超声指挥音箱。
  5. 鲁棒与准确有根本取舍;十年猫鼠游戏,无一劳永逸的防御。
  6. 投毒在训练阶段动手:5% 污染就能明显拉低;目标式投毒可精准为某个人开后门。
  7. 开源模型可能带毒,而信任链几乎是空的——下载权重等于引入陌生人。
  8. 后门在干净数据上和正常模型一模一样;万亿词元语料不可能人工审计,安全是数据供应链问题。
  9. 模型会记住并吐出训练数据:让它重复一个词就能抖出真实姓名邮箱。
  10. 差分隐私给数学保证,联邦学习让数据不动模型动; 代价都是性能。
  11. 分布偏移年年翻车:学会的可能是「这家医院的片子」,不是病。
  12. 最安全的一句输出是「我不知道」; 教会模型拒答,要靠额外的校准和阈值。
  13. 算法的问题只占小头,数据才是大头: 经典数据集里也有约 6% 的错标。

16. 原文地图

主题原书章原文位置
微调像素实验第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:52(搜「塞格迪」)· :56(搜「肉眼完全看不出」)
熊猫变长臂猿第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:64(搜「57.7%」)· :66(搜「99.3%」)
普遍风险第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:80(搜「像纸」)· :80(搜「个别模型的 bug」)
镜像过程第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:87(搜「对输入求梯度」)· :89(搜「镜像」)
两种白盒算法第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:90(搜「FGSM」)
两层解释第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:98(搜「决策边界」)· :101(搜「非鲁棒特征」)· :104(搜「更本质」)
迁移性第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:91(搜「迁移性」)· :94(搜「彻底破产」)
路牌贴纸第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:111(搜「STOP」)· :114(搜「改判」)
T 恤与眼镜第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:120(搜「隐形」)· :121(搜「90%」)
超声攻击第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:123(搜「DolphinAttack」)· :125(搜「安全边界」)
红队思路第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:129(搜「红队」)· :130(搜「捣蛋鬼」)
对抗训练取舍第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:134(搜「对抗训练」)· :138(搜「取舍」)
猫鼠游戏第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:141(搜「认证防御」)· :145(搜「一劳永逸」)
投毒定义第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:152(搜「Data Poisoning」)
标签翻转与银行第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:155(搜「5%」)· :157(搜「盗刷」)
开网即敞门第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:164(搜「开放网络」)· :165(搜「PoisonGPT」)
月球谬误实验第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:169(搜「加加林」)· :172(搜「发现不了」)
信任链是空的第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:173(搜「信任链」)
Tay 与敞开之门第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:159(搜「Tay」)· :162(搜「一扇门」)
后门与黄方块第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:178(搜「Backdoor」)· :181(搜「黄色方块」)
后门最可怕处第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:184(搜「发现不了」)
防御四类第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:200(搜「数据审计」)
数据供应链第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:207(搜「逐条检查」)· :209(搜「供应链」)
三星 20 天第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:216(搜「三星」)· :217(搜「20 天」)
GPT-2 提取第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:225(搜「卡利尼」)· :229(搜「电话号码」)
重复单词攻击第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:233(搜「poem」)· :236(搜「连夜修复」)
三类攻击名目第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:237(搜「成员推断」)
纽约时报诉讼第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:246(搜「纽约时报」)· :248(搜「版权内容」)
差分隐私第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:251(搜「Differential Privacy」)· :254(搜「密码学」)· :256(搜「权衡」)
联邦学习第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:258(搜「Federated」)· :261(搜「梯度本身也可能泄漏」)
内在张力第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:264(搜「记住并吐出」)
新冠 62 篇审查第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:276(搜「62 篇」)· :276(搜「转化价值」)
哪家医院第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:281(搜「哪家医院」)
三种偏移第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:286(搜「协变量偏移」)· :288(搜「概念漂移」)
流感预测翻车第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:291(搜「Google Flu」)· :295(搜「悄悄停掉」)
OOD 与拒答第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:298(搜「Out-of-Distribution」)· :302(搜「罕见皮肤病」)· :305(搜「别硬装懂」)
终身学习开放第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:307(搜「灾难性遗忘」)· :309(搜「开放问题」)
数据大头第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:312(搜「一小部分」)
错标率第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:317(搜「5% 到 20%」)· :318(搜「6%」)
Garbage in第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:323(搜「泄漏」)· :324(搜「Garbage」)
花钱清洗第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:325(搜「自清洗」)· :327(搜「简单粗暴」)

Footnotes

  1. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 52 至 58 段 (text/16-ch15-15-ai.txt:55,搜「应该很难骗」;:57,搜「卡车」)。

  2. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 64 至 66 段 (text/16-ch15-15-ai.txt:65,搜「梯度算法」;:66,搜「长臂猿」)。

  3. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 78 至 81 段 (text/16-ch15-15-ai.txt:81,搜「普遍风险」)。

  4. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 84 与 87 至 89 段 (text/16-ch15-15-ai.txt:88,搜「镜像」)。 2

  5. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 90 段 (text/16-ch15-15-ai.txt:90,搜「投影梯度下降」)。 2

  6. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 98 至 104 段 (text/16-ch15-15-ai.txt:100,搜「1/255」;:103,搜「不同的」)。 2

  7. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 91 至 94 段 (text/16-ch15-15-ai.txt:92,搜「哪怕 B」;:94,搜「黑盒攻击」)。 2

  8. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 108 至 126 段 (text/16-ch15-15-ai.txt:109,搜「物理世界」;:114,搜「警惕」)。

  9. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 111 至 114 段 (text/16-ch15-15-ai.txt:111,搜「黑白小贴纸」)。

  10. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 118 至 122 段 (text/16-ch15-15-ai.txt:119,搜「T 恤」;:121,搜「眼镜」)。

  11. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 123 至 126 段 (text/16-ch15-15-ai.txt:124,搜「超声」)。

  12. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 128 至 130 段 (text/16-ch15-15-ai.txt:129,搜「最坏天气」)。

  13. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 134 至 138 段 (text/16-ch15-15-ai.txt:127,搜「鲁棒性」;:138,搜「取舍」)。 2

  14. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 139 至 145 段 (text/16-ch15-15-ai.txt:140,搜「检测器」;:142,搜「认证防御」;:144,搜「猫鼠游戏」)。 2

  15. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 148 至 149 段 (text/16-ch15-15-ai.txt:149,搜「带着缺陷」)。

  16. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 154 至 158 段 (text/16-ch15-15-ai.txt:154,搜「标签翻转」;:156,搜「5% 被污染」;:158,搜「绕过」)。 2 3

  17. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 163 至 165 段 (text/16-ch15-15-ai.txt:165,搜「潜在投毒者」)。

  18. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 165 至 172 段 (text/16-ch15-15-ai.txt:169,搜「尤里」;:172,搜「发现不了」)。

  19. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 173 至 175 段 (text/16-ch15-15-ai.txt:173,搜「信任链」)。

  20. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 159 至 162 段 (text/16-ch15-15-ai.txt:159,搜「动态投毒」;:162,搜「一扇门」)。

  21. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 178 至 179 段 (text/16-ch15-15-ai.txt:179,搜「触发器」)。

  22. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 180 至 183 段 (text/16-ch15-15-ai.txt:180,搜「BadNets」;:183,搜「限速」)。

  23. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 184 至 187 段 (text/16-ch15-15-ai.txt:185,搜「一模一样」;:186,搜「突然加速」)。

  24. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 200 至 203 段 (text/16-ch15-15-ai.txt:203,搜「升级」)。

  25. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 204 至 209 段 (text/16-ch15-15-ai.txt:141,搜「严格」;:209,搜「数据供应链」)。

  26. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 212 至 213 段 (text/16-ch15-15-ai.txt:213,搜「全部根源」)。

  27. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 216 至 221 段 (text/16-ch15-15-ai.txt:217,搜「20 天」;:219,搜「公司边界」;:221,搜「对话框」)。

  28. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 225 至 229 段 (text/16-ch15-15-ai.txt:228,搜「逐字输出」)。

  29. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 232 至 236 段 (text/16-ch15-15-ai.txt:234,搜「poem」;:236,搜「连夜修复」)。

  30. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 237 至 241 段 (text/16-ch15-15-ai.txt:238,搜「Model Inversion」;:240,搜「过拟合」)。

  31. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 244 至 248 段 (text/16-ch15-15-ai.txt:246,搜「起诉」;:248,搜「复制」)。

  32. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 250 至 257 段 (text/16-ch15-15-ai.txt:253,搜「先验」;:255,搜「键盘」;:256,搜「权衡」)。 2

  33. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 258 至 263 段 (text/16-ch15-15-ai.txt:258,搜「模型动」;:260,搜「Gboard」)。

  34. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 263 至 265 段 (text/16-ch15-15-ai.txt:264,搜「记住并吐出」)。

  35. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 267 至 269 段 (text/16-ch15-15-ai.txt:269,搜「彻底失灵」)。

  36. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 272 至 277 段 (text/16-ch15-15-ai.txt:273,搜「95%」;:276,搜「没有一个模型」)。

  37. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 280 至 282 段 (text/16-ch15-15-ai.txt:281,搜「哪家医院」;:282,搜「暴跌」)。

  38. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 283 至 285 段 (text/16-ch15-15-ai.txt:283,搜「Distribution Shift」;:285,搜「过时」)。 2

  39. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 291 至 295 段 (text/16-ch15-15-ai.txt:293,搜「系统性偏高」;:295,搜「停掉」)。

  40. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 297 至 300 段 (text/16-ch15-15-ai.txt:298,搜「拒绝给出预测」)。 2

  41. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 301 至 305 段 (text/16-ch15-15-ai.txt:303,搜「最危险的行为」;:305,搜「校准」)。

  42. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 305 段 (text/16-ch15-15-ai.txt:305,搜「人工复核」)。

  43. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 306 至 309 段 (text/16-ch15-15-ai.txt:307,搜「领域适应」)。

  44. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 311 至 312 段 (text/16-ch15-15-ai.txt:312,搜「真正的大头」)。

  45. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 316 至 324 段 (text/16-ch15-15-ai.txt:317,搜「视任务复杂度」;:323,搜「数据泄漏」;:324,搜「干净的数据」)。

  46. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 325 至 327 段 (text/16-ch15-15-ai.txt:325,搜「自清洗」;:327,搜「花钱和时间」)。