合成数据 — AI 教 AI
这一章讲三件事: 「模型生成训练数据」为什么忽然变得比人写更好用; 它的两大用法——蒸馏(教内容)与 AI 反馈(教好坏)——各走的路线与各自的坑; 以及 rubric 这个最新的折中方案怎么把 RLVR 推进「没有标准答案」的领域。 读完你会有一张「什么任务该用人、什么任务该用 AI」的分工表。
1. 这一章讲什么
RLHF 深深植根于一个前提:人是唯一够格的数据来源——写回答靠人、标偏好靠人。 这个前提在 GPT-4 级模型出现后快速崩塌:模型写得比大多数人好、评得比大多数人稳、 便宜至少三个数量级。书里的总括:合成数据(模型输出当训练数据)已经从补充 变成后训练的主航道,RLHF 由此扩散成了更大的「后训练」概念1。
2. 顶层全景与主走查
主走查:一道没有标准答案的题,三种数据方案的成本与形状。题取自书里的真实例子 「给『古代之谜』展策展,推荐五件神器」2:
方案一:人类回答 + 人类标偏好
一条偏好数据约 1 美元起步,难的场景可到 10 美元以上;高质量但慢、噪
方案二:AI 回答 + AI 反馈(GPT-4o 当判官)
同一条数据不到 0.01 美元 —— 差出两个数量级以上;快、稳,但带着判官的口味
方案三(最新):AI 回答 + rubric 判分
先给这道题生成评分细则(五件神器 [Hard Rule]…),再按细则逐条对答案打分
—— 把「没法判对错」变成「能逐条核对」,成本介于两者之间
图说:三个方案是同一条演化线:人做一切 → AI 做内容人定好坏
→ AI 做内容 AI 定标准人审标准。(价格数字是书里写作时的真实口径。)
3. 核心原理
3.1 先拆掉一个心理障碍:模型坍缩
反对合成数据的头号理由是模型坍缩:反复用模型自己的输出训练,分布越练越窄, 罕见知识被磨掉、小错误被迭代放大3。书里的立场有据可依:坍缩主要出现在 「无过滤、单模型、自我循环」的最坏设定里;混入真实数据、换着教师用、去重、 上质量过滤,就能避开坍缩区。前沿管线「可以且应该」大规模使用合成数据4。
3.2 蒸馏:教内容
蒸馏(distillation)这个词有个学术出身(teacher-student 知识蒸馏:学生学 老师的完整概率分布而非只学最终答案),口语里已经宽泛成「拿强模型的输出训小 模型」5。书里区分两种用法:
- 当数据引擎:指令微调的回答、偏好数据的两侧、RL 的验证参考——全线可用 强模型生成。一个大实验室的典型配置:养一个不发布的内部旗舰(如 Opus/Ultra 量级),专职给全家桶当老师;
- 迁移专项技能:数学、代码、测试时扩展,拿少量精品数据从小模型里「点」出 大模型的单项能力。
规模的三级跳是这一节最直观的数字:Alpaca(2023)5.2 万条、约 1000 万 token; Tulu 3(2024)100 万条、约 5 亿 token;OpenThoughts 3(2025)再上一档, 约 100 亿 token。两年,三个数量级6。
3.3 AI 反馈:教好坏
RLAIF(AI 反馈的强化学习)解决的是第 10 章那个最痛的环节:偏好收集。 它的开启者是 Anthropic 的 Constitutional AI——顺带把 RLAIF 这个词发明了出来7。
CAI 两步法8:
第 1 步(改写指令数据):
模型生成回答 → 随机抽一条宪法原则(「这个回答鼓励暴力吗?」「真实吗?」)
→ 让模型按原则批评自己的回答 → 按批评改写 → 循环
产出:改好的指令微调数据
第 2 步(造偏好数据):
两条回答 + 一条原则,让模型当判官选 A/B
(早期:比较「The answer is:」后面 A、B 的 logit;如今:让模型先写理由再选
—— 生成式奖励模型的路数)
产出:成对偏好数据 → 后续 RLHF 照常进行,只是数据全合成
图说:宪法(一组人写的原则)是唯一的人类输入。
从第二层含义上说,CAI 是「把标注指南交给模型执行」。
人机数据的一条互补律——书里给的这条经验法则值得整段背下来9:
人类数据:高噪音、低偏差——单条不可靠,但系统性歪斜少; wrangle 之后信号可信。 合成数据:低噪音、高偏差——单条很稳,但判官的口味会整批整批地渗进去。
判官的口味有实证:大模型判官偏爱自己的输出(自偏好)、偏爱长回答;判官 彼此还不一致。书里的对策清单:专用判官模型(Prometheus 一族)效果有但没被 广泛采用;重复采样、自精炼、锦标赛排序能提判断质量;主流做法仍然是直接用 前沿模型当判官——因为它们本来就在被大量训练「评判」这件事10。
分工的均衡点,书里给的是混合路由:大部分数据给 AI 判,难例路由给人类; 前沿实验室把人类偏好当护城河,学术侧则反复证明合成偏好能打平11。
3.4 Rubrics:给「判不了对错」的题造标准
RLVR(第 07 章)的硬边界:没有验证函数的领域进不去。rubric(评分细则) 是 2024 年底以来最被看好的桥:给每道题生成一组可逐条核对的判据,然后按判据 给回答打分、当奖励用12。
书里给了完整的真实例子。「推荐五件神器」的 rubric 长这样(节选)2:
- 回答恰好包含五件不同的神器。[Hard Rule]
- 每件神器来自不同的文化与时代。[Hard Rule]
- 表达清晰、组织连贯。[Principle]
Hard Rule(硬性规则,违反即重伤)与 Principle(原则,加权计分)分两档; 另一套科学题方案把判据分成 Essential/Important/Optional/Pitfall 四档,权重 1–5,Pitfall 记负分——「没写『忽略摩擦力假设』就扣分」这种常见错漏也能编码 进去。工程上为省成本,rubric 通常按域先生成通用版,再按题微调打分13。 已见成效的领域:科学推理、事实性、指令遵循、deep research 型任务14。
4. 作者的判断与证据
书里有证据的部分:价格口径、三套数据集的规模数字、UltraFeedback/CAI 的时间线、 判官自偏好与不一致性的论文,全部可查。书里给判断的部分:作者断言「人类数据 不会被完全替代」的同时,留了一句罕见的产业观察作结——看著人类数据采购这门 生意(第 10 章),他**「怀疑这些公司未来十年过得怎么样」**;并承认「人机混合 的最优配比」还没有任何严肃研究,只有各家技术报告的零星信号15。
判断(我们的,不是书里的): 「高噪音低偏差 vs 低噪音高偏差」这条互补律 是全书最实用的决策工具之一:它意味着人与 AI 不是替代关系,是制衡关系—— 正确的问法不是「用哪个」,而是「用 AI 的量去换人的哪些注意力(人该盯哪里)」。rubric 之所以 重要,正因为它把「人的判断 」从逐条标注升格成了「审核判据」——人的精力花在 刀刃上。 如果错,会错在: 如果判官模型的偏差被系统性校正(判官集成、对抗审计), 「高偏差」那一角塌掉,AI 数据可能全面胜出,制衡关系退化成成本问题。
5. 边界与局限
- CAI 的后续证据稀薄:书里明说「相关衍生方向很多,但很少被记录为对 RLHF 菜谱的明确改进」16;
- rubric 是 2025 年的新事物:书里引用的结果集中在 2025 年,方法本身还在 快速变动;
- 「模型比人强」有领域边界:最难的前沿推理问题、需要真实世界经验的判断, 人仍在场——书里把这个分工当作现状描述,而非永久规律17。
6. 可带走的
- 合成数据的前提是教师够强:GPT-4 级是分水岭;
- 模型坍缩可防:混真实数据、多教师、去重、质量过滤——别自我循环;
- 蒸馏两用法:数据引擎(全线供料)与专项迁移(小模型点技能);
- 人=高噪音低偏差,AI=低噪音 高偏差——制衡,不是替代;
- 判官有自偏好与长度偏好;对策是难例路由给人 + 重复采样;
- CAI 的本质:把标注指南写成原则清单,交给模型执行;
- rubric 把「判不了对错」改造成「逐条核对」——RLVR 向开放领域的桥;
- 数据量级两年三级跳:1000 万 → 5 亿 → 100 亿 token。
7. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 合成数据的地位与 GPT-4 分水岭 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:47(搜「rapidly broke down」) · text/31-ch12-12-synthetic-data.txt:65(搜「GPT-4 class models」) |
| 模型坍缩 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:53(搜「model collapse」) · text/31-ch12-12-synthetic-data.txt:53(搜「largely avoids」) |
| 数据集规模三级跳 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:77(搜「52K」) · text/31-ch12-12-synthetic-data.txt:77(搜「500M」) |
| 三线分工格局 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:83(搜「has largely won」) · text/31-ch12-12-synthetic-data.txt:83(搜「competitive moat」) |
| 蒸馏两种用法 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:101(搜「two common forms」) · text/31-ch12-12-synthetic-data.txt:115(搜「internally」) |
| 价格对比 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:151(搜「$0.01」) |
| 噪点-偏差互补律 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:187(搜「high-noise and low-bias」) · text/31-ch12-12-synthetic-data.txt:190(搜「low-noise and high-bias」) |
| 判官偏差 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:207(搜「self-preference」) · text/31-ch12-12-synthetic-data.txt:213(搜「generally not needed to train your own judge」) |
| CAI 两步法 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:231(搜「Critiques of instruction-tuned data」) · text/31-ch12-12-synthetic-data.txt:234(搜「random principle」) · text/31-ch12-12-synthetic-data.txt:257(搜「The answer is:」) |
| 混合路由 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:163(搜「routing」) |
| rubric 例子 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:311(搜「Hard Rule」) · text/31-ch12-12-synthetic-data.txt:366(搜「Pitfall」) · text/31-ch12-12-synthetic-data.txt:332(搜「per-prompt」) |
| rubric 的成效域 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:295(搜「scientific reasoning」) |
| CAI 衍生稀薄 | 12 Synthetic Data | text/31-ch12-12-synthetic-data.txt:269(搜「few of them」) |