跳到主要内容

它完全按设计在工作 — 偏见从哪一环进来,以及法律上已经要求什么

这一章讲三件事: 一个没有任何一行代码写着「歧视女性」的系统,怎么就在歧视女性; 为什么这类失效能几个月甚至几年不被发现; 以及怎么把「公平」从上线后的一次检查,变成训练过程里的一个约束。

它在全书链条里的位置: 第 19 章的监控能抓到延迟、成本、幻觉。 但它抓不到这一类:系统不宕机、不报错、总体准确率也不掉, 只是对不同的人不一样好。 这是全书最后一层。

1. 顶层全景:一份写着「women's chess club captain」的简历

这一章的主走查是一份简历,从被扣分开始,一直走到「怎么在训练时就不让它这么干」:

① 一份简历里写着「women's chess club captain」(女子国际象棋社社长)

② 一个开发了四年的招聘系统给它扣了分,并且给女子学院的毕业生降级

③ 去查代码:**没有一行写着「歧视女性」**
→ **它完全按设计在工作**

④ 那问题在哪:训练数据是这家公司十年的招聘记录,
**而那些记录因为行业的性别失衡而以男性为主**
→ 系统学到「男性候选人更可取」,**并把这条编码进了它的打分**

⑤ 换成 2024 年一个更大的实验:三个前沿模型、550 多份真实简历、九个职业、
**超过三百万次比对**
→ **白人相关名字被青睐 85% 的次数,黑人相关 9%;男性 52%,女性 11%;
而黑人男性相关的名字,在任何一次比对中都没有被优先于白人男性**

⑥ 三条缓解各改动这条链上的一环

⑦ 最后把公平写进训练本身:
**总损失 = 原来的损失 + 一个权重 × 两组之间的差距**

图说:①→④ 是「它怎么发生的」,⑤ 是「它今天还在发生」,
⑥⑦ 是「在哪一环能拦住」。**这张图里的数字全部是书里的原数。**

2. 先看现象:没有一行代码写着歧视,可它就是在歧视

这一节讲全书最重的一个案例,而它的关键在于「没有 bug」这四个字。

那个招聘系统

一家大型科技公司废弃了一个已经开发四年的 AI 招聘工具。 它用来审阅简历、给候选人排序。

它自学会了系统性地歧视女性:给含有「women's」这个词的简历扣分 (比如「women's chess club captain」),并给女子学院的毕业生降级。1

关键的那一句

书的原话:问题不是代码里有 bug,而是这个 AI 完全按设计在工作。

这句话是这一章的立论,而它值得拆开:

「按设计在工作」的意思是:

设计目标: 「学会预测哪些简历会被录用」

训练数据: 这家公司**十年的真实招聘记录**

数据里的事实: 因为行业的性别失衡,**被录用的以男性为主**

模型学到的规律: **「男性候选人更可取」**

它把这条规律编码进了打分

**它做的每一步都完全正确地实现了设计目标。**

图说:**这就是为什么「找出那个 bug 再修掉」这条路走不通。**
没有 bug 可修——**要改的是「你让它学什么」这件事本身。**

一句更狠的话:它不只是学,它还放大

书接着说:AI 系统不只是从数据里学习,它们还以前所未有的规模放大数据里的模式。2

「放大」和「学到」不是一回事,这是这一节最容易滑过去的一层: 一个有偏见的招聘经理一天看几十份简历; 一个学到了同一份偏见的系统,一天可以给几十万份简历排序,而且每一份都用同一把偏了的尺子。

3. 另外三个有文献的案例,各暴露一条不同的因果链

这一节给三个案例,而它们的价值在于三条链子长得都不一样3:

案例发生了什么它暴露的那条链
一个刑事风险评估工具(2016)调查发现它把黑人被告错误标为高风险的概率,是犯罪史相似的白人被告的两倍同一个模型对两个群体的错误率不同——总体准确率可能一样,分开看就不一样
一个图像识别系统(2015)它把黑人的照片标成了动物训练数据里某个群体代表性不足,直接导致有害的误分类
一个医疗算法(2019)一项发表在《科学》上的研究揭示,这个服务数百万患者的算法系统性地给黑人患者更低的护理建议代理指标——见下,这是全章最清楚的一条

第三条值得单独讲:代理指标

这个词是这一章的第二个承重词,而这个案例把它讲得再清楚不过。

你真正想知道的: 这位患者**有多需要治疗**

但「需要」这件事不好直接量。于是找一个好量的东西来替代它:

实际用的: 这位患者**过去花了多少医疗费**

这个替代品,就叫**代理指标**——**你拿它来代表你真正关心的那个东西。**

问题出在替代得不准:
**黑人患者历来因为系统性的障碍,就医更少、花费更少**

于是模型学到: 「这个人花得少 → 他不太需要治疗」

结果: **给同样病情的黑人患者更低的护理建议**

图说:**注意这条链上没有任何一步是「歧视」。**
每一步都在做一件技术上合理的事,**而不平等是从「花费 ≈ 需求」这个替换里进来的。**

判断(我们的,不是书里的): 代理指标这条链最该带走,因为它最难自查。 前两个案例(错误率不同、数据里某群体太少)是可以直接量出来的; 而代理指标的偏差藏在「我用什么来代表我想要的东西」这个建模决定里, 它在任何数据分布检查里都不会显示为异常。 如果错,会错在: 如果你的目标本身就是可以直接观测的(比如「点击了没有」), 那就不存在代理,这条风险不适用。 判据是:把你的标签念出来,再把你真正想要的东西念出来——如果这两句话不一样, 中间那道缝就是代理指标的风险所在。

4. 四种失效模式,其中一种最难缠

这一节给这一章的分类框架4:

失效模式是什么例子
不公平对待按种族、性别、年龄这类受保护特征给出不同结果那个招聘系统
有害内容产出危险、误导或者不当的内容,可能造成现实伤害——
隐私侵犯暴露敏感个人信息——或是记住了训练数据,或是错误处理了用户输入一个代码补全工具被发现偶尔会建议出训练语料里出现过的真实密钥和邮箱地址
以运营者看不见的方式失败失败的方式对运营者不可见,直到造成灾难性后果上面那些偏见案例之所以数月甚至数年未被发现,正是因为标准性能指标没有捕捉到群体之间的差别对待

(「受保护特征」是法律上的说法: 一些法律明确规定不许据以区别对待的个人属性, 比如种族、性别、年龄、宗教、残障状况。)

第四种是最难缠的那一种,而书自己点明了它和前三种的关系:

这些失效模式常常重叠:一次不可见的失败,按定义, 可能一直掩盖着底层的偏见、安全或者隐私问题,直到它们造成显著伤害。5

这一条正好接上第 19 章的结尾: 那一章教你把面板从「绿灯」改成「每秒词元数、 错误聚不聚集、每词元成本」——但那些改法仍然全是总量指标。 而这一类失效的定义就是「总量上看不出来」。

5. 法律已经在要求了,这不再只是道德问题

这一节是我们从原书第 1 章挪过来的(原书把它当成「为什么现在非做不可」的背景放在开篇, 我们放在这里,因为它和这一章的合规义务是同一件事)。

书在第 1 章说:监管环境增加了紧迫性。 欧盟的 AI 法案和正在成形的美国立法,管的不只是模型——它们管的是系统。 它们要求整条 AI 流水线上都有可验证的公平性、可解释性和人的监督。 合规要靠可靠性工程,而不只是选个模型。6

「管的是系统不是模型」这一句是全书的一条暗线: 你用哪家的模型不重要,重要的是你围着它建的那一整套东西。

那个法案把 AI 系统分成四档

书给了一张表,而它对读者最有用的是「你做的东西落在哪一档」7:

风险档例子法规要求什么
不可接受社会评分、生物特征监控直接禁止
高风险招聘系统、医疗 AI、信用评分、关键基础设施严格的安全控制 + 上市后审计
有限风险聊天机器人、情绪识别必须告知用户他正在和 AI 说话
最小风险垃圾邮件过滤、电子游戏没有强制要求

这张表最实际的一行是「有限风险」那一行: 你做的客服机器人就落在这一档,而它的义务是确定的——告诉用户这是 AI。 这不是建议,是要求。

美国那边书点了一个州的法案(编号 SB 24-205),它专门针对高风险决策里的算法歧视; 书说加拿大和其他主要市场也有类似立法在推进。

还有两个更实际的压力

压力书给的说法
用户已经不信任了一项调查发现,79% 的美国人不信任企业会负责任地使用 AI,而偏见担忧是这种不信任的主要来源之一8
保险开始不保了保险公司开始把 AI 相关事故排除在标准保单之外,逼得企业只能自己承担这类风险

第二条比第一条更硬:它意味着这件事已经被定价了。

6. 四层防御:每一层都在补别的层的短板

这一节给这一章和下一章共用的骨架。

① **数据层** → 防止偏见从训练数据进来

② **模型层** → 确保它学到公平、安全的行为

③ **安全层** → 在危险的输出到达用户之前拦住

④ **隐私层** → 保护个人信息、满足合规

图说:**这一章讲 ①②,第 21 章讲 ③④。**

书解释了为什么要分四层,而这个理由本身就是一条设计原则9:

这个分层的妙处在于每一层都在补别的层的短板: 你的数据清洗可能漏掉细微的偏见,而带公平约束的训练能抓到; 你的模型训练可能没预料到某个危险场景,而安全过滤能拦住; 你的安全过滤可能漏掉某种隐私侵犯,而敏感信息检测能防住。

书配的比方是机场安检:证件核验、金属探测、行李扫描、行为观察 ——多道关卡并存,因为没有单独一种方法是万无一失的。 这个比方到此为止,后文一律说「四层」。

7. 数据层:拿自己公司的日志微调,是在复刻不平等

这一节讲一个反直觉的坑,而书给了一个具体案例。

先看现象:最「安全」的数据,可能是最危险的

直觉是:拿别人的公开数据训不放心, 拿我们自己公司的客服日志、工单、用户交互来微调,总该没问题吧?

书说:那是在训练一个反映现实世界不平等的模型。 如果你的人类客服(有意或者无意地)对不同人群提供了不同质量的服务, 你微调出来的模型就会学到并放大这些模式。10

那个案例

一家大型金融服务公司,拿**两年的人工客服对话**微调了一个客服机器人。

结果: **模型对名字通常与少数族裔相关联的顾客明显更不友好。**

为什么: **因为训练数据里的人类客服,曾无意识地给这些顾客更短、
细节更少的回答。**

图说:**没有人在数据里写过任何歧视性的话。**
偏见是通过「回答的长度和详细程度」这个完全中性的东西传下去的。
(这个案例是书里的原样。)

而它会自己滚雪球

书把这条链画了出来11:

有偏见的人类决策

有偏见的训练数据

模型**放大**偏见

有偏见的 AI 输出

**这些输出又变成下一轮的训练数据**

↺ 回到第一步 —— **每一轮迭代都让问题更糟**

图说:**关键在倒数第二步。** 一旦模型的输出被收集起来当作下一轮的训练材料,
这就不是一次性的偏差,**是一个会自我强化的循环。**

走查第 ⑤ 步:那个「名字实验」

这不是几年前的旧案例,是 2024 年 10 月的研究12:

实验规模: 三个当时最先进的模型
550 多份真实简历
九个职业
**超过三百万次「简历 × 职位描述」的比对**

做法: 把简历上的名字换成与不同族裔、不同性别相关联的名字,其余全部不变

结果:
白人相关名字 被青睐 **85%** 的次数
黑人相关名字 **9%**
──────────────────────────────
男性相关名字 **52%**
女性相关名字 **11%**
──────────────────────────────
**黑人男性相关的名字,在任何一次比对中都没有被优先于白人男性相关的名字**

图说:**最后那一行是这个实验最重的一句。**
它说的不是「差距很大」,是**在三百万次比对里,一次都没有**。
书把这种现象叫做交叉性偏见:**研究者发现了一种针对黑人男性的独特伤害,
这种伤害单看种族、或者单看性别,都不一定看得出来。**
**而且这个偏见在多个模型供应商之间是一致的**——
**说明它是系统性问题,不是某一家训练方式的孤例。**

「单看种族、单看性别都看不出来」这一句有很实际的含义: 你按性别分组报一次数、按种族分组报一次数,两次都可能显示「差距可以接受」; 而两个维度交叉起来的那一格,才是问题所在。 这是第 17 章那条「分组报数」的加强版:分一次不够,要交叉着分。

三条缓解,各改动这条链上的一环

做法具体怎么做改的是哪一环
① 平衡采样每个群体取相同数量的样本;样本不够的那一组,允许重复抽取来补齐改「数据里各组的比例」
② 反事实增强系统性地把人口特征标记换掉,生成同一条样例的替代版本改「模型能不能从这些标记上学到东西」——同一份简历男名女名各来一份,这个特征就失去了预测力
③ 偏见感知的过滤用文本规则删掉明显含刻板印象的样例改「哪些样例根本不该进训练集」

书给自己的示例代码打的那个补丁,必须原样传达

书的示例代码里,用了一张名字列表来推断人口特征。它随后停下来说13:

上面那种按名字推断人口统计特征的做法,是为了说明而刻意简化的。 在生产里,从名字推断受保护特征既不可靠也有法律风险: 小的、容易落入刻板印象的名字列表会误判很多用户。 生产系统应当依赖用户自愿的自报,或者经过正式验证的、基于人口普查的概率工具, 而任何偏见审计在部署前都应当经法务审阅。

这一段值得记住,因为它是这本书最好的地方的一个样本: 它给了一段代码,然后当场告诉你这段代码在生产里为什么不能用。

8. 模型层:把公平写进训练本身

这一节讲主走查最后一步,而它需要第 11 章那四个动作。

先看结论:公平不是基座模型自带的

即使数据干净,任何这类模型都可能在微调过程中学到并放大偏见 ——不管你是在自己的机器上训一个开源模型,还是通过供应商接口微调一个闭源模型。 公平不是基座模型自动给你的,你得在训练时主动强制它。14

做法:在损失里加一项

回到第 11 章那四个动作:前向传播出预测 → 算损失 → 反向传播 → 更新参数。 「损失」就是那个「错得多离谱」的数,而模型每一步都在往「损失小一点」的方向挪。

所以只要把「对两组不一样」也算进损失里,模型就会主动去减小它。

原来的损失(第 11 章那个): 量的是「预测离正确答案有多远」

加进去的一项: 量的是「模型对 A 组和 B 组的对待有多不一样」

────────────────────────────────────────────────────────
**总损失 = 原来的损失 + 权重 × 两组之间的差距**
────────────────────────────────────────────────────────

怎么算那个「差距」: 按人口群体把预测分开,比较两组的平均预测分布

于是: **模型每次对不同群体产出系统性不同的输出,就会挨一次罚。**

图说:**那个权重是一个旋钮。**
**调大 → 公平约束更严,但总体准确率可能略降;
调小 → 准确率保住了,但约束变松。**
**这是一个明摆着的取舍,书没有回避它。**
(公式的形状和「权重越大约束越严、准确率可能略降」都是书里的说法。)

注意这个做法的位置: 它不是在模型答完之后检查,是在训练的每一步都施加压力。 这正是下一节那个更大的想法的雏形。

9. 同一个模式,搬进训练循环里

这一节讲这一章最有意思的一处联系,而它是书自己点破的。

先回忆一个已经见过三次的模式

「让一个模型按一份标准去评判另一个模型的输出」—— 第 09 章(给检索质量打分)、第 17 章(判有没有幻觉)、第 19 章(给回答打质量分), 这个模式已经出现三次了。而它们都是事后评估。

那么:为什么不把它搬到训练过程里去?

书的原话:某家公司意识到,既然模型评审在事后评估里管用, 为什么不在训练过程本身里跑几百万次这样的评估? 每一次参数更新,都成了一次规则审查的机会。15

这套做法书叫它「宪法式 AI」——「宪法」指的是一份写好的行为规则。

我们前面讲的模型评审宪法式 AI
谁生成产出回答的模型模型产出草稿回答
谁评判一个按评分标准打分的评审模型一个「批评者」按那份规则去评估
判完谁执行人工复核者按需处置训练系统:不符合规则就强制重写

书自己的总结:它本质上是同一个模式,只是部署在训练时而不是评估时。

书还给了一个很好的类比: 这就像把学术论文的同行评审,从「只在最后做一次」变成「在写作过程中持续地跑」 ——作者会内化评审标准,因为他不断在对着一致的标准得到反馈。 这个比方到此为止。

10. 作者的判断与证据

书里给了证据的:

说法证据是什么
那个招聘系统的整件事一个公开报道过的真实案例,书给了具体的触发词(「women's」)
另外三个案例三个都有文献出处(一家调查报道机构、一次公开事故、一篇《科学》上的研究)
名字实验的四组数全书证据最硬的一处:三百万次比对,四个具体比例,而且有交叉维度的发现
那个法案的四档分级一张有法条编号的表(第 5 到 9 条,2024 年)
一家金融公司微调出更不友好的机器人一个具体案例,但书没有点名公司、也没有给数据来源
「79% 的美国人不信任」一个具体的数,引自一项署名的调查
保险开始排除 AI 事故一句事实性陈述,书没有给来源

作者的推测或没给证据的:

说法它是什么
「AI 放大数据里的模式」一条判断。 「放大」的程度书没有量化
三条缓解策略三条标准做法,书没有给任何一条的效果数据
公平损失项那个做法给了公式的形状,但没有给任何实验结果——加了它之后偏见降了多少、准确率掉了多少,一个数都没有
「权重越大,准确率可能略降」一句定性描述,没有曲线也没有数

11. 边界与局限

  • 公平损失项没有任何效果数据。 这是这一章最大的空白:它是全章唯一一个能动手的技术手段, 而书没有告诉你它管不管用、管多少;

  • 「两组之间的差距」怎么定义,书讲得很浅。 用哪种统计量、 两个群体以上怎么办、群体标签本身从哪来(而第 7 节那个补丁刚说过按名字推断不可靠) ——这三个问题一个都没答;

  • 四层防御里,数据层和模型层的先后没有讲清。 数据清洗做到什么程度, 才轮到在训练里加公平约束?两个都做会不会过度矫正?书没有讨论;

  • 交叉性偏见只在名字实验里出现了一次。 那是全章最重要的发现之一 ——单看一个维度看不出来——可书后面讲缓解、讲评测时, 再也没有回到「要交叉着分组」这一点上;

  • 法规部分只讲了义务,没讲怎么证明。 「必须告知用户在和 AI 说话」很清楚, 但高风险那一档要求的「上市后审计」具体审什么、多久一次、留什么证据,书没有碰;

  • 案例都偏美国和欧盟。 其他司法辖区的要求、以及跨境服务时该按哪一套走,没有涉及。

12. 可带走的

全章那条走查,一行写完: 一份写着「women's chess club captain」的简历被扣分 → 查代码发现没有一行写着歧视,它完全按设计在工作 → 问题在训练数据是十年的真实招聘记录、而那些记录以男性为主 → 2024 年那个更大的实验(三个模型、550 多份简历、三百万次比对): 白人相关名字被青睐 85%、黑人 9%;男性 52%、女性 11%; 黑人男性相关的名字一次都没有被优先于白人男性 → 三条缓解各改一环 → 最后把公平写进训练:总损失 = 原来的损失 + 权重 × 两组之间的差距。

  1. 最该记住的一句:问题不是代码里有 bug,是它完全按设计在工作 ——所以「找出 bug 修掉」这条路根本不存在;
  2. 它不只是学,还放大: 一个有偏见的人一天看几十份简历, 一个学到了同一份偏见的系统一天能给几十万份排序,用的是同一把偏了的尺子;
  3. 三个案例三条不同的因果链: 两组的错误率不同、某群体在数据里代表性不足、 以及代理指标;
  4. 代理指标最难自查: 拿「花了多少医疗费」代替「有多需要治疗」, 每一步都技术上合理,而不平等是从那个替换里进来的;
  5. 自查的判据:把你的标签念一遍,把你真正想要的东西念一遍——不一样,中间那道缝就是风险;
  6. 四种失效模式里最难缠的是「以运营者看不见的方式失败」: 前面那些案例数月甚至数年没被发现,正是因为标准指标不看群体差别;
  7. 这已经是法律义务,不只是道德问题: 那个法案把 AI 分成四档, 你做的聊天机器人落在「有限风险」档,义务是必须告知用户在和 AI 说话;
  8. 招聘系统、医疗 AI、信用评分落在「高风险」档,要严格控制加上市后审计;
  9. 保险公司开始把 AI 事故排除在标准保单之外——这件事已经被定价了;
  10. 四层防御:数据 → 模型 → 安全 → 隐私,每一层都在补别的层的短板;
  11. 拿自己公司的客服日志微调不是最安全的选择,是在复刻现实里的不平等 ——那家金融公司的机器人对少数族裔名字更不友好, 因为人类客服曾无意识地给他们更短的回答;
  12. 而它会滚雪球:模型的输出变成下一轮的训练数据,每一轮更糟;
  13. 三百万次比对里,黑人男性相关的名字一次都没有被优先 ——而且这个偏见在多个供应商之间一致,说明是系统性问题;
  14. 交叉性偏见:单看种族、单看性别都可能看不出来。分组报数要交叉着分;
  15. 三条缓解各改一环: 平衡采样改比例、反事实增强让那个特征失去预测力、 过滤把明显有问题的样例挡在外面;
  16. 按名字推断族裔在生产里不可靠也有法律风险——要用自愿自报或者基于人口普查的概率工具, 而且偏见审计要经法务审阅;
  17. 公平不是基座模型自带的,得在训练时主动强制: 总损失 = 原来的损失 + 权重 × 两组之间的差距,权重越大约束越严、准确率可能略降;
  18. 宪法式 AI 是「让模型评判模型」这个已知模式的第四次出现, 只是它被搬进了训练循环——每次参数更新都成了一次规则审查的机会。

13. 原文地图

主题原书章原文位置
那个招聘系统与「完全按设计在工作」Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:19(搜「Amazon scrapped an AI」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:26(搜「working exactly as designed」)
「不只是学,还放大」Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:30(搜「they don't just learn from」)
另外三个案例Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:93(搜「COMPAS」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:97(搜「Racial Misclassification」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:100(搜「Healthcare AI Disparities」)
那个法案的四档Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:53(搜「classifies AI systems by risk level」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:62(搜「Banned outright」)
79% 与保险排除Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:77(搜「don't trust companies」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:85(搜「exclude AI-related incidents」)
「管的是系统不是模型」Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:414(搜「regulate systems」)
四种失效模式与它们的重叠Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:120(搜「Unfair treatment」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:135(搜「failure modes often overlap」)
四层防御与机场安检的比方Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:148(搜「Data Layer」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:155(搜「compensates for the limitations」)
微调偏见陷阱与那家金融公司Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:179(搜「fine-tuning bias trap」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:191(搜「PRACTICAL EXAMPLE」)
反馈回路Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:198(搜「FEEDBACK LOOP」)
按名字推断的那个补丁Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:277(搜「deliberately」)
名字实验的四组数Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:285(搜「University of Washington」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:289(搜「favored 85%」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:293(搜「never preferred over」)
三条缓解策略Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:303(搜「bias mitigation strategies」)
「公平不是基座模型自带的」Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:378(搜「Even with clean data」)
公平损失项Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:397(搜「fairness_weight」)
宪法式 AI 与「同一个模式」Chapter 11: Bias, Privacy and Responsible AItext/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:419(搜「constitutional AI」) · text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:442(搜「SCALING INSIGHT」)

Footnotes

  1. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 19 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:19,搜「Amazon scrapped an AI」)与第 26 段(同文件 :26,搜「working exactly as designed」)。「四年」这个开发时长在第 83 段(同文件 :83,搜「four years of development」)。

  2. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 30 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:30,搜「they don't just learn from」)。「一天几十份 vs 一天几十万份」那个对照是我们补的,书只说了「以前所未有的规模」。

  3. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 93、97、100 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:93,搜「COMPAS」;同文件 :97,搜「Racial Misclassification」;同文件 :100,搜「Healthcare AI Disparities」)。「代理指标」这条链的逐步拆解是我们展开的;书只给了「用医疗支出当健康需求的代理」这一句。

  4. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 120 段起(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:120,搜「Unfair treatment」)。「受保护特征」那句解释是我们补的。

  5. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 135 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:135,搜「failure modes often overlap」)。

  6. 出处:「Chapter 1: AI Reliability」第 414 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:414,搜「regulate systems」)。这一段在原书里位于第 1 章;我们挪到这一章,因为它和这里的合规义务是同一件事。

  7. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 53 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:53,搜「classifies AI systems by risk level」)与第 62 段起的那张表(同文件 :62,搜「Banned outright」)。书标的依据是欧盟 AI 法案第 5 到 9 条(2024 年);美国那边点名的是科罗拉多州的 AI 法案,编号 SB 24-205。我们没有另行核对法条编号。

  8. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 77 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:77,搜「don't trust companies」)与第 85 段(同文件 :85,搜「exclude AI-related incidents」)。79% 那个数书归给一项署名调查;保险那一条书没有给来源。

  9. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 148 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:148,搜「Data Layer」)与第 155 段(同文件 :155,搜「compensates for the limitations」)。

  10. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 179 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:179,搜「fine-tuning bias trap」)与第 191 段(同文件 :191,搜「PRACTICAL EXAMPLE」)。书没有点名那家金融公司,也没有给数据来源。

  11. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 198 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:198,搜「FEEDBACK LOOP」)。

  12. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 285 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:285,搜「University of Washington」)、第 289 段(同文件 :289,搜「favored 85%」)与第 293 段(同文件 :293,搜「never preferred over」)。这是 2024 年 10 月的研究,书给了机构但没有给论文标题,我们没能核到一手来源。

  13. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 277 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:277,搜「deliberately」)。书点名推荐的那类工具是基于人口普查的概率工具(它举了一个库名),并要求偏见审计在部署前经法务审阅。

  14. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 378 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:378,搜「Even with clean data」)。公平损失项在第 397 段(同文件 :397,搜「fairness_weight」)。书里那个原来的损失叫交叉熵损失,它量的是「模型给出的概率分布离正确答案有多远」;我们在正文里按第 11 章已经讲过的「损失」来称呼它,一词一义。

  15. 出处:「Chapter 11: Bias, Privacy and Responsible AI」第 419 段(text/14-ch11-chapter-11-bias-privacy-and-responsible-ai.txt:419,搜「constitutional AI」)与第 442 段(同文件 :442,搜「SCALING INSIGHT」)。书点名的是 Anthropic 的 Constitutional AI,并给了论文编号 arXiv:2212.08073;我们没有另行核对这个编号。