跳到主要内容

微调的伦理 — 偏见从哪来、怎么量,以及隐私与公平打架时怎么办

这一章讲三件事: 微调放大偏见的三种来源与四种表现; 公平性的五种度量口径(它们不等价,选哪个就是选立场); 以及全书最拧巴的一个冲突——保护隐私的手段会伤害公平。 这是第 01 章三类风险中第三类(输出偏见)的技术章。

1. 先看现象:为「平均用户」优化的模型,对谁最不友好

个性化系统的悖论:为了服务好「每个人」,我们微调模型—— 但微调数据里如果某个人群样本多,模型就学会服务「样本多的人」。 书里点的具体机制:聚合偏见——为平均性能优化的模型,平均分很好看, 系统性地牺牲少数群体1。医疗、信贷、司法这些场景里, 「平均好」和「对每个人都好」是两回事。

2. 顶层全景:偏见的一生

来源(数据侧) 表现(模型侧) 对策(本章 §4)
──────────── ──────────── ──────────
数据不平衡 ──→ 表征偏见(某群体欠代表)
语境偏斜 ──→ 评测偏见(指标只测主流场景)
反馈循环 ──→ 历史偏见(延续旧歧视)
聚合偏见(平均牺牲少数)

公平性度量(五种口径) → 缓解四法 → 隐私冲突调解

图说:同一条因果链的上下游。书里的预警:个性化与公平的关系"复杂且反直觉"——
个性化做得越好,对群体的差别对待可能越明显。

三种来源值得各记一例2:数据不平衡(医疗 QA 数据全是城市医院→农村场景掉链子); 语境偏斜(训练语境窄,把少数群体的表达方式排除在外); 反馈循环(个性化推荐强化用户既有偏好,偏见越滚越深)。

3. 公平性的五种口径:先选立场,再选公式

书里给了五种度量,要点是它们互相不等价——满足这个可能违反那个:

口径一句话承诺书中数学形态
人口平等预测与敏感属性(种族/性别等)无关各组正预测率之差最大值
机会均等各组的查全率(TPR)与误报率(FPR)相等组间 TPR/FPR 差之和
个体公平相似的个体得到相似的对待输出距离 ≤ L × 输入距离(Lipschitz 条件)
校准公平各组内「预测 70%」就真有七成发生组内校准误差
反事实公平把某人的敏感属性换成别的值,结论不变反事实输入下输出一致率

(出处:text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:53,搜「Demographic parity」起,五种各一小节。)

LLM 场景的适配:LLM 输出的是文本不是标签,所以这些指标要先定义 「什么算正类」——书里提醒,医疗系统里「阳性」是查出疾病, 推荐系统里「正类」是推给用户,同一个词,利害相反3

4. 缓解四法与它们的边界

书里的缓解工具按「动什么」分四类4:

  1. 动数据:补充欠代表群体的样本、合成数据再平衡;
  2. 动训练:对抗去偏——同时训一个「从模型内部表征猜敏感属性」的对抗网络, 主模型学着骗过它,效果是表征里的敏感信息被剥离(和第 06 章的对抗训练同构,方向相反);
  3. 动目标函数:公平感知正则——损失 = 任务损失 + α × 偏见惩罚;
  4. 动输出:后处理校正。书里自己划了界:后处理不解决底层数据不平衡, 也不阻止模型在训练中学到偏见表征,只能和其他手段配合用5

5. 走查:只靠推理,审计出模型的隐性偏见

主走查。问题:模型对同一行为,会不会因为行为者的名字不同而赋予不同的情感色彩? 书里的探针(probing)方法四步走6:

① 造最小对比句(只差名字):
"John was assertive during the meeting."
"Maria was assertive during the meeting."
"Alex was assertive during the meeting."
② 抽取隐藏状态:三句分别过模型,取最后一层里
"assertive" 那个位置的向量
③ 训探针:在一个大 hidden-state 数据集上训练一个
简单的情感分类器(logistic regression 即可)
④ 对比:把三句的向量喂给探针——
若 "John" 句被判得更正面、"Maria" 句更负面,
说明模型内部编码了"名字→情感"的偏见关联,
再用卡方检验确认差异是否显著

图说:此法隐私友好——只要推理、不重训、不用真实用户数据,
全程可用合成句子。出处:书中四步代码。

(出处:text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:302,搜「assertive」。)

探针方法的意义超出公平审计:它是全书「可解释性」部分最可操作的工具—— 在不打开黑箱的前提下,直接质询黑箱内部存了什么

6. 隐私与公平打架:全书最拧巴的冲突

前面各章的隐私技术,在这里集体撞上公平目标。书里列的冲突清单7:

DP 加噪 → 掩盖数据里的真实关系,偏见更难测出来
FL 不集中数据 → 看不到全量分布,没法确认各群体都被公平代表
均匀加噪 → 样本少的群体信噪比更差:噪声一样大,信号更弱
传统 DP → 只保护"个人",不保护"小群体"(独特特征仍可锁定少数群体成员)
效用损失 → 加噪的性能代价不成比例地落在少数群体头上

解法是组感知的隐私机制:按组大小自适应分配隐私预算(小群体分更多); 组级 DP(相邻数据集的定义从「差一个人」改成「差一小群人」); 公平感知加噪8。联邦学习侧对应的是人口感知聚合——按人口代表度加权各客户端(参与联邦的机构节点)的贡献, 防止多数派客户端淹没少数派9。审计侧也有隐私版本:加密数据上跑偏见测试 (同态加密/MPC)、审计报告加 DP 噪声再分享10

判断(我们的,不是书里的): 这一冲突没有双赢解,只有显式定价。 「预算向小群体倾斜」意味着大群体的隐私预算被摊薄—— 组感知 DP 本质上是在不同人群之间转移隐私,这已经不是技术决策, 是分配正义问题。书把它写进技术章、把监管写进下一章,但真正的决策点 在两者之间:谁有权决定哪个群体多受保护?这条问题书里没有正面回答。 如果错,会错在: 如果实践中存在既不加大小群体噪声、又不伤害其公平表示的 第三种机制(比如数据扩充到各群体噪声需求趋同),那么「零和转移」的判断就过强了; 目前书内给出的工具确实都在重新分配预算。

7. 作者的判断与证据

书里给了完整方法的:五种度量全带公式与代码;探针审计有四步可复现流程; 缓解四法各带边界说明。

要分开的:「RLHF 和 Constitutional AI 可以纳入公平标准」(多样化的打标签人、 奖励模型显式奖励公平)是作者指出的可行方向11,书里没有给出已验证的实例。

8. 边界与局限

  • 五种公平口径在数学上不可能同时满足(书里在章末把「不可能性结果」列为开放研究方向, 但未展开定理);
  • 探针审计只能测「你想得到去问」的偏见维度,与第 05 章评估器一样受限于想象力;
  • 组感知 DP 的「组」需要预先定义——组划分本身就是敏感决策,书里没有讨论谁定义、 按什么定义;
  • 公平口径在不同语言、文化之间的差异不在本章范围。

9. 可带走的

  1. 偏见三来源:数据不平衡、语境偏斜、反馈循环;四表现:表征/历史/评测/聚合偏见;
  2. 「平均性能好」可以对少数群体系统性差——聚合偏见是个性化系统的默认病;
  3. 公平五口径互不等价:人口平等、机会均等、个体公平、校准、反事实;
  4. 先定义「什么算正类」再谈公平——医疗的阳性和推荐的「正类」利害相反;
  5. 缓解四法:动数据、动训练(对抗去偏)、动目标函数、动输出; 后处理单独用是糊弄,书里自己划的界;
  6. 探针审计四步:最小对比句→抽隐藏状态→训简单分类器(一个小判读模型)→对比漂移, 只用推理即可,隐私友好;
  7. 隐私与公平会打架:DP 噪声对样本少的群体伤害更大,这是结构性冲突;
  8. 组感知机制是调解工具:自适应预算、组级 DP、公平感知加噪、人口感知聚合;
  9. 组感知 DP 本质是群体间转移隐私——技术问题背后是分配决策;
  10. 可解释性四指标:忠实、完整、稳定、可懂——给解释本身定质量标准。

10. 原文地图

主题原书章原文位置
三偏见来源Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:16(搜「Data imbalance」)
四种表现Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:33(搜「Representation bias」) · text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:39(搜「Aggregation bias」)
个性化与公平反直觉Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:43(搜「counterintuitive」)
人口平等Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:53(搜「Demographic parity」)
机会均等Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:85(搜「Equalized odds」)
个体公平(Lipschitz)Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:124(搜「Lipschitz」)
反事实公平Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:176(搜「Counterfactual fairness」)
正类含义随场景变Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:192(搜「medical diagnosis」)
对抗去偏Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:200(搜「adversarial debiasing」)
后处理的边界Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:223(搜「postprocessing」)
探针对比句Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:302(搜「assertive」)
探针判定偏见Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:375(搜「bias detected」)
探针隐私友好Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:379(搜「privacy-preserving」)
可解释性难点Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:267(搜「distributed representations」)
隐私×公平冲突清单Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:244(搜「limited visibility」) · text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:250(搜「group privacy」)
自适应预算与组级 DPChapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:450(搜「Adaptive privacy budgets」) · text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:459(搜「Group differential privacy」)
人口感知聚合Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:477(搜「demographic-aware」)
加密审计Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:491(搜「Encrypted bias testing」)
RLHF 纳入公平Chapter 7. Ethical Considerations in Fine-Tuning LLMstext/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:233(搜「Constitutional AI」)

Footnotes

  1. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 39 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:39,搜「Aggregation bias」)。

  2. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 16 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:16,搜「Data imbalance」)、第 21 段(搜「Contextual skew」)、第 24 段(搜「Feedback loops」)。

  3. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 192 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:192,搜「medical diagnosis」)。

  4. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 198-215 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:200,搜「adversarial debiasing」);公平感知正则的伪代码在 :206(搜「fairness」)。

  5. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 223 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:223,搜「postprocessing」)。

  6. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 302 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:302,搜「assertive」);抽取与判定在 :311-377(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:375,搜「bias detected」)。

  7. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 244 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:244,搜「limited visibility」)至第 253 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:253,搜「trade-offs」)。

  8. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 450 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:450,搜「Adaptive privacy budgets」)与第 459 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:459,搜「Group differential privacy」)。

  9. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 477 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:477,搜「demographic-aware」)。

  10. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 491 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:491,搜「Encrypted bias testing」)。

  11. 出处:「Chapter 7. Ethical Considerations in Fine-Tuning LLMs」第 233 段(text/71-ch07-chapter-7-ethical-considerations-in-fine-tuning-.txt:233,搜「Constitutional AI」)。