跳到主要内容

数据自己造 — 把约束从「稀缺的人」换成「充裕的算力」

这一章讲三件事: 训练数据可以让模型自己造,而且这件事已经被做到了很大的规模; 造出来的数据怎么筛、什么时候能让模型自己给自己打分; 以及这条路在什么地方会不可逆地塌掉。

它在全书链条里的位置: 第 05 章说过「数据从哪来、不够了怎么办,整块在第 17 章」—— 这一章就是那笔债。 而全书总纲那条线在这里走到反面:第 15、16 章是在给模型找裁判(工具、编译器); 这一章演示的是裁判缺席时会烂成什么样。

第 03 章那条「模型没有的能力榨不出来」在这一章第三次、也是最硬的一次回来。 第 6 节会把三处并起来说一次。

1. 先看现象:800 封信不够用

走查的起点

回到那家保险公司。 第 14 章那条路要偏好数据,而这家公司手上只有:

★ 真实历史拒付信:800 封(第 14 章那一批)
★ 要训一个稳的模型,书里给的量级是几千到几万条

→ 差一到两个数量级。
→ 而且再攒 800 封要等一年——因为每年只发这么多需要精修的信。

主走查(全章共用): 把那 800 封扩到 2 万条,并且回答一个具体的问题—— 为什么第三轮之后,那些罕见的拒付理由从数据里消失了。 编造的数每次出现都会标明。

这件事在这本书里的定位

书对它的定性一句话1:

后训练自诞生起就受制的那个约束,是数据:高质量样例要专家时间、 偏好判断要一致的标注员、评估要昂贵的人评。

★ 从稀缺的人力转向充裕的算力,从根本上改变了哪些技法变得可行—— 它让「人工标注永远支撑不起的规模」成为可能。2

三条路,书在开篇就点了名1:

谁在造数据
自博弈模型和自己对抗
让 AI 当标注员通常是另一个模型来评判
程序化生成按需造出样例

先破一个成见

先把名字挂上:这一章讲的东西叫合成数据—— 指的就是「不是人写出来的、而是由模型生成出来的训练数据」。 书专门用一段处理了「合成数据不如人写的」这个印象3:

对合成数据的偏见在机器学习圈里根深蒂固,那是更早年代的遗产—— 那时候模型生成的数据肉眼可见地不如人产出的样例。这个偏见值得重新审视。

★ 问题不是「合成数据在某种抽象意义上是否和人类数据一样好」, 而是它是否服务于训练的目的。 说到底:能提升模型表现的数据就是好数据。来源只在「它的预测有效性」这个意义上才重要。

2. 顶层全景:一条合成数据流水线

800 封真实信(种子)

① 生成:从少量种子长出量 ← §3:六种做法,各治一个不同的病
│ ├ 自举出新指令
│ ├ 把已有的「进化」成更复杂的
│ ├ 换一万种人格去问
│ └ 改写成不同体裁

② 质量三维:对不对 / 够不够杂 / 像不像真实部署 ← §4

③ 过滤:★ 砍到只剩最好的一半,常常训得更好 ← §4

④ 谁来评?能不能让模型自己评? ← §5:两问判据

⑤ 存储 + 版本与溯源 ← §7:这一步才让局部重跑成为可能

├──► 训练 → ★ 但第三轮之后出事了 ← §8:偏差放大与模型崩塌

└──► 而根子在这里:模型无法为它不具备的能力生成训练信号 ← §6

图说:**①③ 是这一章的技法主体,⑥⑧ 是它的两道边界。**
★ 而 ⑥ 那条边界比 ⑧ 更根本——⑧ 是它的后果之一。

3. 机制一:六种从少量种子长出量的做法

书把这一节写成了六个带数字的里程碑。我们照它的骨架走,每一个交付「它治什么病」。

做法一:自举 —— 175 条种子长出 5.2 万条

病:你只有很少的人写样例。

4:

从一小批人手写的种子指令出发
→ 让模型自己迭代地生成新的指令、输入和输出
→ 过滤掉低质量的、以及和已有的过于相似的
→ 剩下的加回种子池,再来一轮

书给的数字4:

种子175 条人手写的任务
长出来5.2 万条指令
效果用在一个当时的基础模型上,在某个综合指令基准上绝对提升 33 个百分点,逼近那个用昂贵的私有人工标注训出来的版本

书的按语:它的优雅在于近乎零的标注成本; ★ 而它揭示的是——「被训练的模型」和「训练数据的来源」之间的边界正在模糊。4

做法二:把已有的指令「进化」成更复杂的

病:自举出来的指令普遍偏简单。

招:不从零生成,而是把已有指令变复杂5:

变换例子(落在走查上)
加约束「写一封拒付信」→「写一封拒付信,不超过 300 字,且必须引用条款号
加深推理要求→「先判断保守治疗周数是否达标,再决定拒付与否
引入冷门话题→「被保人同时投保了另一份补充险,该怎么写
让任务更具体→「被保人是 42 岁、既往有两次同类申请记录」

效果和洞见5:

产出的模型在复杂任务上按人评超过了当时的一个主流对话模型,而训练数据只是零头。

★ 关键洞见:复杂度本身就是一个值得优化的维度。 全喂简单合成数据训出来的模型,简单查询应付得很好, 但撑不住生产里那些多约束的请求。

做法三:换一万种人格去问

病:书说得很准——模型倾向于产出反映一个狭窄「默认视角」的输出, 聚在它训练数据里最常见的那些模式周围6

6:

★ 从网页数据里自动策展出**十亿个人格**,每一个代表一种不同的视角或专长领域。
生成时以某个具体人格为条件。

走查上的样子:
人格「刚拿到保单三个月的年轻投保人」 → 问「为什么我的申请被拒了?」
人格「代理被保人的执业律师」 → 问「贵司拒付所依据的具体条款是什么?」
人格「合作医院的医务科」 → 问「预授权流程的时限是多久?」

★ 同一件事,三种问法,三种该有的答法。

效果6:

用人格驱动生成出来的合成数学题微调之后,一个 70 亿参数的模型在某竞赛数学基准上达到 64.9%, 与当时一个前沿商用模型持平。

做法四:什么都不给,让它自己幻觉出问题

这个做法机制最简单,而且结果最反直觉7:

★ 只喂给一个指令模型**它自己的对话模板前缀**
(系统提示 + 用户消息的开头,后面什么都不给)
→ 让它**幻觉出一个像样的用户问题**
→ 再把这个问题喂回去,要一个答案

它利用的是:指令模型已经内化了「用户消息长什么样」的分布,可以直接从里面采样。

书给的对照非常有力7:

用这个方法官方那个版本
数据400 万条自动生成的指令-回答对1000 万条精心策展的数据
结果表现相当

★ 而这个方法需要:零提示词工程、零种子数据、零外部模型—— 只要目标模型本身和它的对话模板。

做法五:不造问答对,造教材

病:量堆上去了,但每条样例的教学效率很低。

8:

不生成原始的指令-回答对,而是合成结构化的教育内容: 教科书、习题、例题——为教会特定的推理技能而设计。

数字8:

那个先驱模型只训了 70 亿 token(60 亿策展网页 + 10 亿合成),在某代码基准上拿到 50.6%
一个开源复现生成了 250 亿 token 的合成教材、博文和故事,耗费一万多显卡小时
★ 它的做法同一份种子内容按多种风格和受众层级改写(儿童读本 / 本科讲义 / 研究生研讨),从而对每个主题自然地产出多样的视角

做法六:把网页改写成几种体裁

这一条给的收益最直接9:

用一个指令模型把原始网页改写成几种结构化格式:
「像维基百科那样」
「问答体」
「面向大众简化」
「作为一段技术讲解」

然后拿**真实网页 + 它的改写变体**联合训练。

★ 效果:预训练加速约 3 倍,某个语料子集上的平均困惑度改善超过 10%。

★ 洞见:**同样的事实,结构更清楚就教得更省。**

走查:那 800 封怎么变成 2 万条

① 自举:从 800 封里抽出 40 种「信里回答的问题类型」当种子
→ 让模型生成新的问题类型 → 过滤掉重复的 → 得到约 300 种
② 进化:给每一种加约束(字数上限 / 必须引条款 / 必须给复议途径)
→ 约 900 种
③ 人格:配 8 种投保人画像(年轻/年长/有律师/有医务科背景/……)
→ 约 7200 种情境
④ 每种情境生成 3 份候选信 → 21600 条
⑤ 过滤(下一节)→ 剩下约 2 万条

★ 注意 800 封真实信从头到尾都在:它们是种子,也是第 8 节要讲的那个「分布锚」。

(40 / 300 / 8 / 3 这几个数是为演示编的;
六种做法的机制和它们各自的效果数字是书里给的。)

4. 机制二:质量三维,以及「砍掉一半反而更好」

三个互相独立的维度

书把质量拆成三条,而且明说它们可以互相脱钩10:

维度问的是
对不对事实对不对、计算对不对、样例有没有真的演示出它声称要演示的东西
够不够杂样例有没有覆盖到该覆盖的那片空间
像不像真实部署它像不像模型上线后真正会遇到的输入

★ 可以又准又重复(对得很、但全是一个模子),也可以又杂又错。

怎么评这三条

书给的分工很清楚11:

手段管什么
自动指标管规模:用向量距离或词组统计量多样性,用验证程序量正确性,用分类器筛掉明显有问题的
人评管校准——验证那些自动指标对应的确实是质量,而不只是「可以被测量的代理」

★ 这正是第 10 章那条三角测量在这一章的形态。

★ 过滤:砍到只剩最好的一半,常常训得更好

这一条是这一节最该带走的12:

原始的合成数据通常从优秀到不可用都有,而过滤把麦子和糠分开。 ★ 过滤的回报常常很可观:一个被砍到只剩最好的那一半的数据集, 训出来的结果可能比全量数据集更好——因为低质量样例带来的是损害学习的噪声。

四种过滤手段12:

① 质量打分:让一个模型给每条打分,过阈值的留下
② 去重
③ 一致性检查:互相矛盾的两条,**至少有一条是错的**
④ 验证:代码跑不跑得通、计算对不对、说法可不可查证

阈值该定多严:按用途分

书给的判据可以直接照做13:

训练方式该怎么过滤理由
示范训练激进过滤通常划算模型是直接从样例学的,烂样例直接进模型
带奖励信号的训练宽松一些可以接受奖励信号能纠正一部分噪声

书的收尾很实在:最终要靠试——试不同的阈值,选那个「训出最好模型」的, 而不是选那个数据集最大或者看起来最干净的。13

5. 机制三:能不能让模型给自己打分

结论先行

书用一句话给了这件事的分界线14:

对那些容易验证的品质——事实准确、格式合规、逻辑一致—— AI 的反馈可以在远大于人的规模上,匹配甚至超过人的可靠性。 ★ 对主观的品质,答案要复杂得多。

那笔效率账

书给的对照是这条路的全部动机15:

★ 一个人写一部原则清单 → 产生的训练信号覆盖**数百万**样例
★ 一个人标偏好 → 一天大约**一百**条

(那条「一天一百条」和第 07 章「比一对 30 秒」是相容的——
30 秒一对,一天专注做几小时,量级正好在这里。)

这条路的做法叫宪法式 AI(constitutional AI): 人写一部「宪法」——有用、无害、诚实、尊重用户自主、承认不确定…… 然后让模型照着这部宪法自评自改,修订后的版本就是训练样例;还可以迭代15

它成立要靠两个前提,而且都不是自动成立的

书把这两条列得很清楚16:

前提不成立会怎样
① 模型必须有能力照着这部宪法准确地评判输出一个无法可靠识别「违反了宪法」的模型,产不出可靠的改进
② 这部宪法必须真的和人的价值对齐宪法本身错了,模型只会更忠实地执行那个错

AI 反馈的四种形态

书列了四种,而且每种对应一个不同的下游用途17:

形态直接喂给谁
成对偏好判断偏好训练(第 09 章那条主路)
标量质量分训打分器,或者当过滤器用
详细批评把「原答案 + 按批评修订后的答案」配成对,做示范训练
验证(二值的可查性质)那些能自动检查的领域

书还点了一个容易被忽略的价值17:

★ AI 评估器的灵活性本身就是价值——它可以被要求产出任何格式, 而人类标注员会抗拒不熟悉的格式。

效果是分裂的,必须分开看

这一条书写得很坦白18:

品质类型AI 反馈的表现
容易验证的(事实准确可以对着知识库查、格式合规可以对着规范验、逻辑一致可以逐步评估)AI 常常比人更可靠——人会疲劳、会走神、知识有限
主观的(写作风格、说服力、幽默、共情、有用性)AI 的近似会以微妙的方式偏离人的偏好——单看个例看不出来,累积起来就训出一个「在优化 AI 的偏好、而不是人的偏好」的模型

★ 那个两问判据,可以直接当验收清单用

书专门开了一个小框给它19:

对你想优化的那个品质,问两个问题:

① 那个评估模型,能不能可靠地分出好坏?
② 「模型判断的更好」,等不等于「人判断的更好」?

★ 两个都是「是」→ 这条路能用。
★ 任何一个是「否」→ 你需要人评,或者需要可验证的检查。

书给的分类:**事实准确这类常常通过;
说服力、有用性这类必须先实测,不能想当然。**

走查上的用法: 「引对了条款号」→ ①是 ②是 → 可以让模型自己评。 「这封信读起来是不是既专业又不冒犯」→ ②存疑 → 必须先拿合规专员的判断实测过。

6. 机制四:自我改进的海市蜃楼 ★ 能力守恒律第三次,也是最硬的一次

这一节是这一章的思想核心,而且它是全书那条暗线的终点。

先看那些确实管用的做法

书列了三种自博弈,它们各自都有真实的战果。

① 辩论式20:

让模型的两个实例互相对抗:一个为某个立场辩护,另一个反对。 它借的是人类制度里的长久传统——从法律的对抗制到学术辩论, 都基于同一个洞见:真理更可靠地从对立的检验里浮现。

模型学到的是:构造有力的论证 + 找出对方的弱点。 而这两样能迁移到非辩论的场景里(预判反驳、给自己的推理做压力测试)。

② 和上一轮的自己对抗21:

★ 把这件事形式化成一个两人博弈:
「主玩家」= 当前被训的模型
「对手」 = **上一轮的自己**

每一轮的任务:**分辨「上一轮的自己生成的回答」和「人写的回答」。**
目标函数把输出分布推向人类数据的分布。
★ 作者们证明了收敛:**全局最优只在策略恰好匹配目标分布时达到。**

它的实践含义很硬21:

★ 它不需要外部打分器、不需要偏好标签、也不需要一个更强的老师模型。 它只需要当初做示范训练用的那个数据集。

从一个用 5 万条数据微调过的 70 亿模型出发,三轮之后在三个不同的评测上全面改善, 而且胜过了「用一个更强模型的偏好数据补充过的」偏好训练。

★ 但它的天花板写在它的定义里21:

模型只能改进到「人类参考数据的质量」为止,它跨不过这条线。 ★ 它的价值在于填补那段空隙:从「示范训练常常欠拟合训练分布」,到「数据本身的质量上限」。

(「欠拟合」是第 07 章那个「过拟合」的反面: 过拟合是把训练样本背下来了,欠拟合是连训练样本都还没学到位。 这里说的是:一次示范训练常常没能把那批数据里的东西吃干净。)

③ 倒推理由 —— 这是三个里最能钻出缝的一个22:

★ 基本做法:让模型给一大批题生成推理链,
**只在那些「导向了正确答案」的链上做微调。**

★ 关键创新:**模型答不出来的题,把正确答案告诉它,
让它倒推一条能到达这个答案的理由链。**

→ 这就给了「模型当前还解不了的题」以训练信号,
**把能力自举到它当前的水平之上。**

迭代:每轮微调之后能解更多题,又产出更多正确的链。

书给的效果:在某常识推理基准上,它达到了「直接在答案上微调的、大 30 倍的模型」的水平22

它还有一个更一般的版本23:

推广到每个 token 位置都生成内部理由,去解释和预测后文。 ★ 只用互联网文本训练(没有任何任务数据),就在数学推理和常识推理两个基准上 取得了零样本的改善。

(「零样本」指不给任何该任务的例子、直接问—— 与之相对的是先在提示词里塞几个例子再问。零样本上的提升,说明学到的东西是通用的, 不是记住了某种题型。) 这说明这样自举出来的不是窄的任务技能,而是更一般的序列推断能力。

★ 但那个「无限自我改进」的愿景不成立

书的措辞是全书最不留情面的一句24:

现实比那个愿景受约束得多。 ★ 那个「不需要外部反馈就能无限改进的模型」,只存在于经费申请书里。

实践中改进通常很快进入平台期, ★ 因为一个模型无法为它不具备的能力生成训练信号。 强化学习尽管有种种美德,它仍然不是真正的魔法—— 它变不出信息论意义上凭空的价值。

书给的具体机制24:

★ 一个数学推理弱的模型,生成不了、也「验证」不了数学证明。
拿它错误的验证去训练,训出来的是「看起来很数学、但答案是错的」。

★ 而根子是:**没有外部基准(也就是模型自身判断之外的东西),
就没有任何机制去纠正那些「模型自己认不出来是错的」的错误。**

★ 三处并起来说一次

判断(我们的,不是书里的): 这条规律在书里分散在三章,各讲各的。 原书从没说过它们是同一件事,把它们串起来是我们的增值。

出现在形态机制
第 03 章在推理时给中间数值加方向,教不了新能力没有方向可以指过去
第 16 章会做三步题,五步题就是不会学到的是三步的模板,不是推理本身
这一章模型无法为它不具备的能力生成训练信号生成不出比自己好的样本

三处的共同形状:模型没有的能力,你没法从它自己身上榨出来。

如果错,会错在: 「不具备」这个词的边界是模糊的—— 模型可能「会但不稳定」,而挑出稳定的那部分再拿去训,确实能变好 (上面那个「倒推理由」的做法就是钻这条缝钻成功的)。 所以这条律的准确说法是「无法凭空生成它一次都做不到的能力」, 而不是「无法自我改进」。三处的机制也各不相同,不要把它们当成一条统一的定理。

反馈回路会把小毛病放大

这是上面那条律的直接后果25:

如果模型有一个细微的偏差,在反映这个偏差的自生成数据上训练会强化它。 如果模型的质量判断只是略有失准,这个失准会在迭代中复合。

★ 结果是:内部指标越来越好,而外部标准越来越差。

对策三条:停止准则 · 外部验证 · 多样性机制。

这个动力学会外溢到整个行业

书给的这一段值得单独记,因为它是一条战略判断26:

当多个团队用相似的模型生成合成数据、用相似的评估标准时,一种收敛效应会出现: 同样的质量信号产出同样的优化目标,而相似的目标产出相似的解。

想要差异化,就得刻意去换数据来源、换评估标准、换那个基准信号。 ★ 而作者补了一句:这里最需要的多样性不只是数据的,还是人的—— 「如果卡住了,去找一个上过艺术学院的人。」

一个折中:让老师始终在场

书给了一条介于「纯自我改进」和「一次性蒸馏」之间的路27:

标准蒸馏:老师 → 学生,一次传递
迭代蒸馏:**每一代学生给下一代生成数据**

★ 第一代学生可能产出老师不会产出的数据(新的组合方式、略有不同的解法),
第二代于是同时学到老师和一代学生的东西。

★ 与纯自我改进的关键区别:**老师始终在场,当那个参照点,
防止整件事漂离原来的能力分布。**

代数太少 → 拿不到多代的收益
代数太多 → 累积的噪声压过累积的洞见
甜点取决于任务、老师的能力、以及代际之间的过滤质量。

7. 机制五:临时脚本撑不起生产

这一节讲的是工程,书给的四段结构很清楚28:

① 生成
② 质量关卡:自动打分 · 验证 · 去重
③ 存储:带索引和元数据
④ ★ 版本与溯源:什么生成参数、什么过滤、什么模型版本

★ 第 ④ 段是这一节的重点。书说它才是让「复现、解释和排障」成为可能的东西。

而模块化设计带来一个很实际的好处29:

每个组件(生成器、过滤器、验证器)都可以在不重写整条流水线的情况下被换掉或重配。 ★ 于是可以局部重跑:过滤逻辑有 bug 时,只重跑过滤及其之后的步骤,不必重新生成。

质量关卡要持续开着,不是一次性验收30:

★ 早期抓到的问题——在合成数据进入训练之前——远比训练之后才发现的问题便宜。

规模化的三笔账31:

怎么压
生成算力(在规模上占主导)用小模型做初次生成,把大模型只留给过滤;批处理;缓存
存储高效格式、压缩、保留策略
处理时间并行化、增量处理、按需增量生成

书的收口很实在:工程做得好,合成数据的产出配得上投入; 做得差,花在合成数据上的钱会超过模型改善的价值。31

工具生态书点了三样,各补一段32:

工具补哪一段特点
一个偏策展的②③显卡加速,30 多个启发式过滤器、质量分类、三层去重(精确 / 模糊 / 语义);大数据集上比 CPU 方案快 16 倍、总成本降约 40%
一个偏端到端的①②④四段命令行:吃进文档(PDF/网页/字幕/幻灯片)→ 生成问答对与思维链 → 让模型当裁判筛(默认十分制,阈值 7 分)→ 导出成各种训练格式
一个补编排缺口的字段之间的相关性用一份声明式的表结构定义多列数据集,有的列从统计分布采样、有的列由模型生成;列与列之间的引用被解析成一张依赖图,按依赖顺序生成

★ 第三样补的那个缺口值得单独说:它让「用药清单要反映诊断、 随访计划要同时引用诊断和处方」这类字段间的相关性, 写在配置里而不是写在脚本里。32

书自己的选型口径33:

两者都不是完整方案。 偏策展的那个长于大规模策展,但把提示设计和生成编排留给你; 偏端到端的那个覆盖全流程,但偏向某一个模型生态★ 作者的生产做法是混着用:用端到端那套或自定义脚本做生成与格式化, 用策展那套的显卡去重与质量过滤做规模化。 选型看你的瓶颈在生成,还是在策展。

8. 机制六:两种走法都会出事,而且第二种不可逆

走法一:偏差放大

书给的第一句就把这条路的上限定死了34:

★ 合成数据不可能比生成它的模型更多样,而实践中它总是更少。 生成器里有什么偏差,就会出现在它的输出里; 而在这些输出上训练,是在强化它、而不是纠正它。

★ 这件事的阴险之处34:

★ 它不体现在「对不对」「流不流畅」这类质量指标上。

回答可以是正确的、写得好的、有帮助的,
**却一致地反映某一种特定视角。**

→ 于是你的所有自动检查全绿,而模型在悄悄变窄。

四条缓解,最后一条最重要35:

  1. 生成提示里明确要求多视角,而不只是要求正确答案;
  2. 质量控制里加多样性指标(人口的、话题的、风格的);
  3. 专门的偏差检测分类器;
  4. 最重要的一条:掺人类生成的数据当基准锚。

走法二:模型崩塌 —— 这一条是不可逆的

先说清楚它是什么36:

模型崩塌:模型收敛到一个狭窄的输出分布,产出的是「同一个主题的变奏」, 而不是真正多样的回答。 ★ 崩塌了的模型在它那个狭窄范围内仍然可以产出高质量的输出—— 但它已经失去了「针对不同情境产出不同回答」的能力。

★ 那篇 2024 年发表在《自然》上的论文,给了这件事一个很硬的结论37:

在递归生成的数据上训练生成模型,会导致不可逆的退化。

(「递归生成」在这里的意思很具体:这一轮的训练数据,是上一轮训出来的模型产出的; 而下一轮的数据,又是这一轮训出来的模型产出的。一代喂一代。)

它分两个阶段,而第一阶段最值得记住37:

阶段发生什么
早期崩塌先丢掉那些「低概率但有效」的内容——罕见样例、少数派视角、边缘情形,也就是分布的尾巴
晚期崩塌分布收窄到与原始训练数据几乎不像,产出自信、流利、而且错得模型自己发现不了的东西

书还给了一个机制解释37:

因为总有一定量的方差必须被安置,模型改用「扰动一个窄分布」 而不是「从宽分布里选」来制造多样性——结果常常是胡话。

★ 而这个结论跨架构成立:书明说这在语言模型、变分自编码器、高斯混合模型上都被证明会崩。

走查:为什么第三轮之后那些罕见的拒付理由消失了

轮次 1:800 封真实信 → 生成 2 万条
罕见理由(比如「同一年度内第二次同类申请」)在真实信里占约 2%
→ 合成数据里占约 1.2% ← 已经在缩

轮次 2:拿轮次 1 训出来的模型再生成 2 万条
→ 罕见理由占约 0.4%

轮次 3:再来一轮
→ 罕见理由占约 0.05%,而且写法只剩一种模板

★ 这就是早期崩塌:**尾巴先烂掉。**
★ 而所有的自动检查全绿——每一条都对、都流畅、都合规。

✅ 对策:**每一轮都把那 800 封真实信按固定比例掺回去当分布锚。**

(2% / 1.2% / 0.4% / 0.05% 这几个数是为演示编的;
「早期崩塌先丢分布的尾巴」是书里给的机制。)

对整个行业的含义

书把这件事推到了它的逻辑终点38:

随着模型生成的内容在互联网上堆积,未来靠爬网训练的模型, 必然会训在早期模型的合成产物上。每一代训练都复合一次分布的收窄, ★ 而尾巴是最先烂掉的。

解法不是完全不用合成数据,而是保证每一代的训练数据都还能接触到真正由人产生的内容。 ★ 那些保有高质量人类数据当混合成分的组织,拥有结构性的优势。

怎么检测,以及那条根本的张力

检测手段三条39:向量空间的聚类分析 · 词组统计量测重复 · 人工抽样看质性相似。

缓解手段三条39:奖励函数里加多样性项(罚输出之间的相似)· 生成时调温度等干预 · 策展时保证多样样例不被质量过滤清掉。

★ 但书点明了一条无法消除的张力39:

根本的张力是质量与多样性:激进地优化质量 → 模式坍缩; 激进地保多样性 → 留下低质量的输出。

9. 机制七:那个不可消除的人的成分

这一节是这一章的收口,而且它的论证方式很少见:它拿「合成数据太高效」当理由。

书的原话40:

合成数据的效率确实了不起:人类标注员要几个月的活,可以在几小时内生成出来,成本只是零头。 这份效率造出一种诱人的拉力,让人想做纯合成的流水线,把慢而贵的人的成分整个消掉。

★ 抵住这股拉力。人的监督之所以必要,恰恰因为合成数据太高效—— 同样的效率,也能大批量地产出有问题的数据。

而自动指标本身也逃不掉第 10 章那条定律40:

自动指标是人设计出来的质量代理,过度优化它们会触发那条定律: 指标涨,而它本来要衡量的那个质量跌。

书给的定位一句话41:

★ 合成数据的正确角色是增补,不是替代。 人产生的数据提供合成数据无法完全复制的质量与多样性, 而合成数据提供人工标注在经济上做不到的规模与覆盖。两者互补。

全章那条贯穿的张力,书自己在末尾收了口42:

★ 合成数据的好坏,上限就是生成它、过滤它的那套流程。 一个能干的生成器,同时会把它的偏差按规模复制出来; 一个有效的过滤器,同时可能把多样性滤没; 而自我改进的回路能自举能力,但没有外部基准,它就只是在优化「模型已经相信的东西」。

最后那条实操路径43:

★ 用合成生成拿量,拿人的判断去校验。
★ 用 AI 反馈拿效率,拿人的偏好去校准。
★ 用自博弈拿鲁棒性,拿外部标准去锚定评估。
★ 把高质量的人类数据当作「防止跨代崩塌的分布锚」保有下来,
而不是当成历史遗留物。

10. 作者的判断与证据

说法是哪一类说明
「能提升模型表现的数据就是好数据」作者的判据他用它来置换掉「像不像人写的」这个旧判据3
那六种做法的数字有据六个全部配了尾注,而且都给了具体基准与数字456789
「砍到只剩最好的一半反而更好」作者的经验观察他给了机制(低质样例是噪声),但没有配具体实验12
示范训练该激进过滤、带奖励的可以宽松作者的实践口径理由是「奖励信号能纠正部分噪声」13
一部宪法覆盖数百万样例 vs 一天一百条量级对照书没有给这两个数的出处,是效率示意15
RLAIF 的两问判据作者给的操作判据书专门开了小框;它是判断结构,不是实验结论19
自博弈那三种做法有据三个都配了尾注,而且第二个作者们证明了收敛202122
「只存在于经费申请书里」作者的强判断这是全书语气最重的一句;他给了机制,但没有配实验24
收敛效应会外溢到整个行业作者的推断没有配数据;但它是一条可以当战略用的判断26
偏差放大不体现在质量指标上机制论证这是这一章最实用的一条警告34
模型崩塌不可逆有据(2024 年《自然》)书给了尾注,并明说跨架构成立37
尾巴最先烂掉有据那篇论文两阶段的第一阶段37
保有人类数据的组织有结构性优势作者的推论由上一条推出,不是独立证据38
质量与多样性的根本张力作者的判断他给了两头各自的失效方式39
「合成数据的上限就是生成它、过滤它的那套流程」全章总纲这是作者对整章的收口42

11. 边界与局限

  1. 那六种做法的具体提示词我们不抄。 书给了做法和数字,提示词模板属于会过时的东西
  2. 那张十行的策略对照表我们只交付了其中六行。 书的表还列了几种(多模型合成、迭代精修、验证式、宪法式), 它们的机制在正文别处已经讲过,我们没有重复。
  3. 具体工具的命令与配置不在这里。 书给了一段声明式配置的完整例子, 那是某个工具的接口,会随版本变
  4. 一个用强化学习来生成「数据配方」的做法我们只提一句。 书提到它生成的不是训练数据,而是流水线的规格说明, 奖励函数同时评「果」与「树」;但这属于很新的方向,书自己也只给了一段。
  5. 书里那个「让编码助手编排合成数据流水线」的专栏,我们按全书口径不覆盖。
  6. 「合成数据到底能替代多少人类数据」这个问题,书没有给数字。 它给的是方向(增补不是替代)和一条硬约束(保有人类数据当分布锚), 但没有给比例。我们也不猜。

12. 可带走的

  1. 合成把约束从「稀缺的人力」换成了「充裕的算力」—— 于是「人工标注永远支撑不起的规模」成为可能;
  2. 判据不是「像不像人写的」,是「训出来的模型有没有变好」。 来源只在它的预测有效性这个意义上才重要;
  3. 质量三维:对不对 / 够不够杂 / 像不像真实部署; ★ 可以又准又重复,也可以又杂又错——三条互相独立;
  4. 自动指标管规模,人评管校准——验证那些指标对应的确实是质量, 而不只是「可以被测量的代理」;
  5. 六种从少量种子长出量的做法:175 条种子自举出 5.2 万条(某基准绝对提升 33 个百分点)· 把已有指令进化成更复杂的(复杂度本身是值得优化的维度)· 十亿个人格治「只有一个默认视角」 · 只喂对话模板前缀让它自己幻觉出问题 (400 万条抵别人 1000 万条精心策展)· 合成结构化教材 · 把网页改写成几种体裁(预训练加速约 3 倍);
  6. 过滤:砍到只剩最好的一半,常常比全量训得更好——低质样例是损害学习的噪声;
  7. 过滤阈值按用途定:★ 示范训练该激进过滤(模型直接从样例学); 带奖励信号的训练可以宽松(奖励能纠正部分噪声);
  8. 最终要靠试:选那个训出最好模型的阈值,不是选数据集最大或最干净的那个;
  9. 让模型自己打分,在容易验证的品质上常常比人更可靠(人会疲劳、走神、知识有限); 在主观品质上会以微妙的方式偏离,单看个例看不出来;
  10. 效率账:一个人写一部原则清单覆盖数百万样例,一个人标偏好一天约一百条;
  11. 但它要两个前提:模型有能力照着那部清单准确评判 + 那部清单真的对齐人的价值;
  12. 两问判据:① 评估模型分得出好坏吗?② 它说的「更好」等于人说的「更好」吗? 两个都是才能用;
  13. AI 反馈有四种形态,而且★ 它的灵活性本身就是价值——它可以被要求产出任何格式;
  14. 自博弈三种:辩论式 · 和上一轮的自己对抗(不需要外部打分器、偏好标签、更强老师)· ★ 倒推理由:答不出的题就把答案告诉它、让它倒推理由链—— 这给了「它当前解不了的题」以训练信号;
  15. 但和上一轮自己对抗的天花板,就是人类参考数据的质量;
  16. ★★ 「那个不需要外部反馈就能无限改进的模型,只存在于经费申请书里」;
  17. ★★ 根因:模型无法为它不具备的能力生成训练信号。 没有外部基准,就没有机制去纠正那些「它自己认不出来是错的」的错误;
  18. 反馈回路会放大小毛病:★ 内部指标越来越好、外部标准越来越差;
  19. 这个动力学会外溢到整个行业:大家用相似模型、相似标准 → 落到同一片平庸的中间地带; 要差异化就得刻意换数据源、换评估标准;★ 而最需要的多样性不只是数据的,还是人的;
  20. 迭代蒸馏是个折中:★ 老师始终在场当参照点,防止漂离原能力分布;
  21. 生产流水线四段:生成 → 质量关卡 → 存储 → ★ 版本与溯源(它才让局部重跑成为可能);
  22. 偏差放大最阴险的地方:它不体现在「对不对」「流不流畅」这类指标上—— 回答可以又对又好,却一致地反映某一种视角;
  23. ★★ 模型崩塌是不可逆的(2024 年《自然》,而且跨架构成立): 早期崩塌先丢掉罕见样例、少数视角、边缘情形——分布的尾巴; 晚期崩塌收窄到自信、流利、错得它自己发现不了;
  24. 保有高质量人类数据当分布锚的组织,拥有结构性优势;
  25. 根本张力是质量与多样性:激进优化质量 → 模式坍缩;激进保多样性 → 留下低质输出;
  26. 人的监督之所以必要,恰恰因为合成数据太高效——同样的效率也能大批量产出有问题的数据;
  27. 合成数据的正确角色是增补,不是替代。 它的好坏上限,就是生成它、过滤它的那套流程。

13. 原文地图

主题原书章原文位置
约束是数据 · 三条路 · 换算力Why Synthetic Data Changes Everythingtext/137-fm-why-synthetic-data-changes-everything.txt:5(搜「require expert time」) · :7(搜「from scarce human labor to abundant computation」)
破成见 · 质量三维 · 怎么评Why Synthetic Data Changes Everythingtext/138-fm-why-synthetic-data-changes-everything.txt:7(搜「an inheritance from earlier eras」) · :9(搜「Correctness asks whether」) · :15(搜「The simplest generation strategy is prompt-based」)
六种做法Why Synthetic Data Changes Everythingtext/138-fm-why-synthetic-data-changes-everything.txt:27(搜「52,000 instructions」) · :31(搜「evolves existing instructions」) · :37(搜「1 billion diverse personas」) · :43(搜「hallucinate a plausible user query」) · :49(搜「synthesizes structured educational content」) · :55(搜「accelerated pre-training by approximately three times」)
过滤 · 阈值按用途定Why Synthetic Data Changes Everythingtext/138-fm-why-synthetic-data-changes-everything.txt:151(搜「reduced to its best half」) · :155(搜「trades quantity against quality」)
模型给自己打分 · 宪法式 · 四种形态 · 分裂的效果When the Model Grades Itselftext/139-fm-when-the-model-grades-itself.txt:3(搜「Can AI replace human annotators」) · :7(搜「scales poorly to the volume」) · :11(搜「the constitution must align with human values」) · :19(搜「suits SFT on improvements」) · :23(搜「AI feedback can match or exceed human feedback」) · :25(搜「Writing style, persuasiveness, humor」)
★ 两问判据THE RLAIF SUITABILITY TESTtext/140-fm-the-rlaif-suitability-test.txt:3(搜「Ask two questions」) · :9(搜「If both answers are yes」)
三种自博弈 · 天花板 · 倒推理由Models That Learn from Each Othertext/141-fm-models-that-learn-from-each-other.txt:7(搜「truth emerges more reliably」) · :15(搜「two-player game」) · :17(搜「no external reward model」) · :19(搜「cannot exceed the ceiling」) · :23(搜「chain-of-thought rationales」) · :25(搜「bootstrapping capability beyond」) · :27(搜「Training on internet text alone」)
★ 海市蜃楼 · 反馈回路 · 行业外溢 · 迭代蒸馏Models That Learn from Each Othertext/141-fm-models-that-learn-from-each-other.txt:35(搜「exists only in grant proposals」) · :37(搜「the miscalibration compounds」) · :39(搜「a convergence effect emerges」) · :43(搜「Iterated distillation」)
数据工厂四段 · 模块化Building the Data Factorytext/142-fm-building-the-data-factory.txt:7(搜「the same architectural care」) · :11(搜「Modular design enables experimentation」)
质量关卡 · 三笔账 · 工具生态VIBE CHECK: SYNTHETIC DATA PIPELINE ORCHESTRATIONtext/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:7(搜「Problems caught early」) · :17(搜「Generation compute costs dominate at scale」) · :25(搜「focuses on the curation side」) · :27(搜「four-stage pipeline」)
选型口径 · 补编排缺口的那一样FROM THE TRENCHES: CHOOSING YOUR SYNTHETIC DATA STACKtext/144-fm-from-the-trenches-choosing-your-synthetic-data-s.txt:3(搜「Neither NeMo Curator nor Synthetic Data Kit」) · :5(搜「addresses precisely this orchestration gap」)
★ 偏差放大 · 模型崩塌 · 分布锚 · 张力When Synthetic Data Goes Wrongtext/145-fm-when-synthetic-data-goes-wrong.txt:7(搜「cannot be more diverse than the model that generates it」) · :11(搜「Generation prompts should explicitly seek diverse perspectives」) · :15(搜「variations on a theme」) · :17(搜「irreversible degradation」) · :19(搜「the tails」) · :21(搜「The fundamental tension」)
不可消除的人的成分 · 增补不是替代When Synthetic Data Goes Wrongtext/145-fm-when-synthetic-data-goes-wrong.txt:25(搜「Resist this pull」) · :29(搜「augmentation, not replacement」)
全章总纲Synthetic All the Way Downtext/146-fm-synthetic-all-the-way-down.txt:3(搜「a fundamental shift in the way training data is produced」)
实操路径 · 分布锚Summarytext/147-fm-summary.txt:3(搜「synthetic scale with human grounding」)

Footnotes

  1. 出处:「Why Synthetic Data Changes Everything」第 5 段(text/137-fm-why-synthetic-data-changes-everything.txt:5,搜「require expert time」)。原文在这一段里点了三条路的名字:模型和自己对抗、由 AI 系统充当标注员、以及按需程序化生成样例。 2

  2. 出处:「Why Synthetic Data Changes Everything」第 7 段(text/137-fm-why-synthetic-data-changes-everything.txt:7,搜「from scarce human labor to abundant computation」)。原文:这个转变从根本上改变了哪些技法变得可行,使得人工标注永远支撑不起的规模上的训练成为可能。

  3. 出处:「Why Synthetic Data Changes Everything」第 7 段(text/138-fm-why-synthetic-data-changes-everything.txt:7,搜「an inheritance from earlier eras」)。原文那句判据是:问题不在于合成数据在抽象意义上是否「和人类数据一样好」,而在于它是否服务于训练的目的;并给了那句一锤定音的话——能提升模型表现的数据就是好数据 2

  4. 出处:「Why Synthetic Data Changes Everything」第 25 段(text/138-fm-why-synthetic-data-changes-everything.txt:25,搜「bootstrap their own instruction-following capability」)与第 27 段(text/138-fm-why-synthetic-data-changes-everything.txt:27,搜「52,000 instructions」)。书给了尾注。原文那句关于边界的话是:它揭示出「被训练的模型」和「训练数据的来源」之间的界线正在变得可渗透。 2 3 4

  5. 出处:「Why Synthetic Data Changes Everything」第 31 段(text/138-fm-why-synthetic-data-changes-everything.txt:31,搜「evolves existing instructions」)与第 33 段(text/138-fm-why-synthetic-data-changes-everything.txt:33,搜「complexity is itself a dimension worth optimizing」)。书给了尾注。原文列的四种变换是:加约束、加深推理要求、引入冷门话题、让任务更具体。 2 3

  6. 出处:「Why Synthetic Data Changes Everything」第 37 段(text/138-fm-why-synthetic-data-changes-everything.txt:37,搜「1 billion diverse personas」)与第 39 段(text/138-fm-why-synthetic-data-changes-everything.txt:39,搜「a narrow」)。书给了尾注。第 39 段那句病灶描述是:模型倾向于产出反映一个狭窄「默认」视角的输出,聚集在它训练数据里最常见的那些模式周围。 2 3 4

  7. 出处:「Why Synthetic Data Changes Everything」第 43 段(text/138-fm-why-synthetic-data-changes-everything.txt:43,搜「hallucinate a plausible user query」)与第 45 段(text/138-fm-why-synthetic-data-changes-everything.txt:45,搜「4 million」)。书给了尾注。原文那句机制解释是:这个方法利用的是,指令微调过的模型已经内化了一个「用户消息」的分布,可以被直接采样。 2 3

  8. 出处:「Why Synthetic Data Changes Everything」第 49 段(text/138-fm-why-synthetic-data-changes-everything.txt:49,搜「synthesizes structured educational content」)与第 51 段(text/138-fm-why-synthetic-data-changes-everything.txt:51,搜「25 billion tokens」)。书给了尾注。第 51 段那条「同一份种子内容按多种风格与受众层级改写」的做法,是它产出多样性的关键。 2 3

  9. 出处:「Why Synthetic Data Changes Everything」第 55 段(text/138-fm-why-synthetic-data-changes-everything.txt:55,搜「accelerated pre-training by approximately three times」)。书给了尾注。原文列的四种改写体裁就是我们抄进正文的那四条。 2

  10. 出处:「Why Synthetic Data Changes Everything」第 9 段(text/138-fm-why-synthetic-data-changes-everything.txt:9,搜「Correctness asks whether」)。原文明说这三个维度可以脱钩:数据可以正确率高而多样性低(准确但重复),也可以反过来。

  11. 出处:「Why Synthetic Data Changes Everything」第 11 段(text/138-fm-why-synthetic-data-changes-everything.txt:11,搜「Automated metrics」)。原文那句关于人评的定位很要紧:人评提供的是校准——验证自动指标对应的确实是质量,而不只是「可以被测量的代理」。

  12. 出处:「Why Synthetic Data Changes Everything」第 151 段(text/138-fm-why-synthetic-data-changes-everything.txt:151,搜「reduced to its best half」)与第 153 段(text/138-fm-why-synthetic-data-changes-everything.txt:153,搜「Quality scoring uses models to assess」)。「砍到只剩最好的一半反而更好」那条书没有配具体实验,他给的理由是低质样例贡献的是损害学习的噪声。 2 3

  13. 出处:「Why Synthetic Data Changes Everything」第 155 段(text/138-fm-why-synthetic-data-changes-everything.txt:155,搜「trades quantity against quality」)。原文那句收尾是:最优阈值要经验地确定——试不同阈值,选那个训出最好模型的,而不是选那个数据集最大或者看起来最干净的。 2 3

  14. 出处:「When the Model Grades Itself」第 3 段(text/139-fm-when-the-model-grades-itself.txt:3,搜「Can AI replace human annotators」)。

  15. 出处:「When the Model Grades Itself」第 7 段(text/139-fm-when-the-model-grades-itself.txt:7,搜「scales poorly to the volume」)。书给了那项工作的尾注。原文还有一句限定值得记:人的指导对那些「我们统称为对齐里的伦理部分」的道德性关切,是不可或缺的。 那个「一部宪法覆盖数百万样例 vs 一天一百条」的效率对照见第 9 段(text/139-fm-when-the-model-grades-itself.txt:9,搜「One human writing a constitution」),书没有为这两个数配出处。 2 3

  16. 出处:「When the Model Grades Itself」第 11 段(text/139-fm-when-the-model-grades-itself.txt:11,搜「the constitution must align with human values」)。原文:一个无法可靠识别宪法违反的模型,产不出可靠的改进

  17. 出处:「When the Model Grades Itself」第 19 段(text/139-fm-when-the-model-grades-itself.txt:19,搜「critiques suit SFT on improvements」)。那四种形态与它们的用途对应关系在这一段;「AI 评估器的灵活性本身就是价值」以及「人类标注员会抗拒不熟悉的格式」见第 19 段(text/139-fm-when-the-model-grades-itself.txt:19,搜「resist unfamiliar formats」)。 2

  18. 出处:「When the Model Grades Itself」第 23 段(text/139-fm-when-the-model-grades-itself.txt:23,搜「AI feedback can match or exceed human feedback」)与第 25 段(text/139-fm-when-the-model-grades-itself.txt:25,搜「Writing style, persuasiveness, humor」)。第 23 段给的理由是:这些品质可以对着知识库查、对着规范验、通过逐步分析评估;而人在这些任务上会疲劳、会走神、知识有限。第 25 段那句最要紧:这种偏离可能微妙但要紧——单个样例上看不出来,累积起来就训出一个优化 AI 偏好而非人类偏好的模型。

  19. 出处:「THE RLAIF SUITABILITY TEST」第 3 段(text/140-fm-the-rlaif-suitability-test.txt:3,搜「Ask two questions」)与第 9 段(text/140-fm-the-rlaif-suitability-test.txt:9,搜「If both answers are yes」)。这是书里一个独立的方框。第 9 段那句分类是:事实准确这类常常通过;而说服力、有用性这类,在信任「模型的评估会和人的评估一致」之前,应当先做实测。 2

  20. 出处:「Models That Learn from Each Other」第 7 段(text/141-fm-models-that-learn-from-each-other.txt:7,搜「truth emerges more reliably」)。第 11 段(text/141-fm-models-that-learn-from-each-other.txt:11,搜「adversarial」)把红队/蓝队称作同一洞见的延伸,并给了那条统一原理:模型能从「彼此寻找弱点」的尝试里学到单模型训练给不了的鲁棒性。 2

  21. 出处:「Models That Learn from Each Other」第 15 段(text/141-fm-models-that-learn-from-each-other.txt:15,搜「two-player game」)、第 17 段(text/141-fm-models-that-learn-from-each-other.txt:17,搜「no external reward model」)与第 19 段(text/141-fm-models-that-learn-from-each-other.txt:19,搜「cannot exceed the ceiling」)。书给了尾注。第 15 段明说作者们证明了收敛:全局最优只在策略恰好匹配目标分布时达到。 第 19 段那句关于价值区间的话是:这个技法最有价值的地方,是在「示范训练常常欠拟合训练分布」和「数据本身的质量上限」之间的那段空隙里。 2 3 4

  22. 出处:「Models That Learn from Each Other」第 23 段(text/141-fm-models-that-learn-from-each-other.txt:23,搜「chain-of-thought rationales」)与第 25 段(text/141-fm-models-that-learn-from-each-other.txt:25,搜「bootstrapping capability beyond」)。书给了尾注。第 25 段那句「把正确答案告诉它、让它倒推一条理由链」是这个做法钻出缝的全部要点。 2 3

  23. 出处:「Models That Learn from Each Other」第 27 段(text/141-fm-models-that-learn-from-each-other.txt:27,搜「Training on internet text alone」)。书给了尾注。原文的推论是:这暗示自举出来的不是窄的任务技能,而是更一般的序列推断能力。

  24. 出处:「Models That Learn from Each Other」第 35 段(text/141-fm-models-that-learn-from-each-other.txt:35,搜「exists only in grant proposals」)。这是全书语气最重的一句判断之一。 原文的机制解释是:一个数学推理弱的模型,生成不了也验证不了数学证明;拿它错误的验证去训练,产出的是「看起来很数学、但答案是错的」;而没有外部基准,就没有机制去纠正模型自己认不出来的错误。 2 3

  25. 出处:「Models That Learn from Each Other」第 37 段(text/141-fm-models-that-learn-from-each-other.txt:37,搜「the miscalibration compounds」)。原文给的三条对策是:停止准则、外部验证、多样性机制。

  26. 出处:「Models That Learn from Each Other」第 39 段(text/141-fm-models-that-learn-from-each-other.txt:39,搜「a convergence effect emerges」)。那句「去找一个上过艺术学院的人」是作者自己的话,用来说明「此处最需要的多样性不只是数据的,还是人的」。 2

  27. 出处:「Models That Learn from Each Other」第 43 段(text/141-fm-models-that-learn-from-each-other.txt:43,搜「Iterated distillation」)。第 45 至 47 段(text/141-fm-models-that-learn-from-each-other.txt:45,搜「surprising capability improvements across iterations」)给了它与纯自我改进的关键区别:老师始终在场当参照点,防止漂离原来的能力分布;以及代数的甜点取决于任务、老师能力和代际之间的过滤质量。

  28. 出处:「Building the Data Factory」第 7 段(text/142-fm-building-the-data-factory.txt:7,搜「the same architectural care」)。四段结构与「版本和溯源才让复现、解释、排障成为可能」见第 9 段(text/142-fm-building-the-data-factory.txt:9,搜「This provenance enables reproduction」)。

  29. 出处:「Building the Data Factory」第 11 段(text/142-fm-building-the-data-factory.txt:11,搜「Modular design enables experimentation」)。「局部重跑」那条(过滤有 bug 时只重跑过滤及其之后)是这一节最实用的收益。

  30. 出处:「VIBE CHECK: SYNTHETIC DATA PIPELINE ORCHESTRATION」第 7 段(text/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:7,搜「Problems caught early」)。原文还列了人评的三种抽样方式:随机抽样看整体、分层抽样保证重要子群覆盖、定向抽查自动系统标为边缘的样例。

  31. 出处:「VIBE CHECK: SYNTHETIC DATA PIPELINE ORCHESTRATION」第 17 段(text/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:17,搜「Generation compute costs dominate at scale」)与第 19 段(text/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:19,搜「the investment」)。「用小模型做初次生成、把大模型留给过滤」是书给的具体省钱办法。 2

  32. 出处:「VIBE CHECK: SYNTHETIC DATA PIPELINE ORCHESTRATION」第 25 段(text/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:25,搜「focuses on the curation side」)、第 27 段(text/143-fm-vibe-check-synthetic-data-pipeline-orchestration.txt:27,搜「four-stage pipeline」)与「FROM THE TRENCHES: CHOOSING YOUR SYNTHETIC DATA STACK」第 5 段(text/144-fm-from-the-trenches-choosing-your-synthetic-data-s.txt:5,搜「addresses precisely this orchestration gap」)。三样工具书都给了尾注。第三样那个「把字段之间的相关性写进配置而不是脚本」的能力,是它区别于前两样的地方。 2

  33. 出处:「FROM THE TRENCHES: CHOOSING YOUR SYNTHETIC DATA STACK」第 3 段(text/144-fm-from-the-trenches-choosing-your-synthetic-data-s.txt:3,搜「Neither NeMo Curator nor Synthetic Data Kit」)。「选型看你的瓶颈在生成还是在策展」是这一段可以直接照做的判据。

  34. 出处:「When Synthetic Data Goes Wrong」第 7 段(text/145-fm-when-synthetic-data-goes-wrong.txt:7,搜「cannot be more diverse than the model that generates it」)。第 9 段(text/145-fm-when-synthetic-data-goes-wrong.txt:9,搜「quality metrics」)是那条最阴险的性质:它不体现在正确性或流畅度这类质量指标上——回答可以正确、写得好、有帮助,却一致地反映某个特定视角。 2 3

  35. 出处:「When Synthetic Data Goes Wrong」第 11 段(text/145-fm-when-synthetic-data-goes-wrong.txt:11,搜「Generation prompts should explicitly seek diverse perspectives」)。第四条(掺人类生成的数据当基准锚)书明说是最重要的一条。

  36. 出处:「When Synthetic Data Goes Wrong」第 15 段(text/145-fm-when-synthetic-data-goes-wrong.txt:15,搜「variations on a theme」)。原文那句判据很好用:在窄范围内每个回答都可以是高质量的,但「对每个问题都给同一种风格的答案」本身就已经是崩塌了。

  37. 出处:「When Synthetic Data Goes Wrong」第 17 段(text/145-fm-when-synthetic-data-goes-wrong.txt:17,搜「irreversible degradation」)。书给了那篇 2024 年《自然》论文的尾注。原文的两阶段描述、那句「因为总有一定量的方差必须被安置,模型改用扰动一个窄分布来制造多样性」、以及跨架构成立(语言模型、变分自编码器、高斯混合模型) 都在这一段前后。 2 3 4 5

  38. 出处:「When Synthetic Data Goes Wrong」第 19 段(text/145-fm-when-synthetic-data-goes-wrong.txt:19,搜「the tails」)。原文:尾巴——它承载着罕见但有效的内容——最先烂掉;解法不是完全不用合成数据,而是保证每一代训练数据都还能接触到真正由人产生的内容 2

  39. 出处:「When Synthetic Data Goes Wrong」第 21 段(text/145-fm-when-synthetic-data-goes-wrong.txt:21,搜「The fundamental tension」)。检测与缓解的各三条都在这一段;那条张力(激进优化质量会模式坍缩、激进保多样性会留下低质输出)是这一章无法消除的约束。 2 3 4

  40. 出处:「When Synthetic Data Goes Wrong」第 25 段(text/145-fm-when-synthetic-data-goes-wrong.txt:25,搜「Resist this pull」)。这一段的论证方式很少见:它拿「合成数据太高效」当理由来论证人的监督必要。 第 27 段(text/145-fm-when-synthetic-data-goes-wrong.txt:27,搜「proxies for quality」)是那条和第 10 章相接的话:自动指标是人设计的质量代理,过度优化会触发那条「指标一旦变成目标就不再是好指标」的定律。 2

  41. 出处:「When Synthetic Data Goes Wrong」第 29 段(text/145-fm-when-synthetic-data-goes-wrong.txt:29,搜「augmentation, not replacement」)。

  42. 出处:「Synthetic All the Way Down」第 3 段(text/146-fm-synthetic-all-the-way-down.txt:3,搜「a fundamental shift in the way training data is produced」)与第 7 段(text/146-fm-synthetic-all-the-way-down.txt:7,搜「diversity」)。第 7 段还提到一篇综述指出:剩下的关键挑战正是多样性——直接让模型生成合成数据,可靠地产出的是流利、正确、而且重复的输出。 2

  43. 出处:「Summary」第 3 段(text/147-fm-summary.txt:3,搜「synthetic scale with human grounding」)。原文最后那句是:把高质量人类数据当作防止跨代崩塌的分布锚保有下来,而不是当成历史遗留物。