跳到主要内容

数据集工程:数据不是洗出来的,是设计出来的

这一章讲四件事: 数据策展的三要素——质量、覆盖度、量,每一项都有反直觉的实证数字; 不同训练阶段要的是完全不同的数据形态,CoT 和工具使用数据为什么格外难标; 数据合成的完整谱系——从规则模板、扰动、模拟,到 AI 驱动的改写、回译、指令合成,以及合成数据的四个局限; 数据处理四步——检查、去重、清理、格式化,和一步都不能省的人工环节。 它在全书的位置:上一章结尾说「微调本身不难,难的是数据」,本章就是那个「难」的解剖;下一章转向推理优化。

1. 顶层全景:数据工作已成专职专岗

数据集工程的目标,书里的定义很干脆:构建一个能帮你训练出最佳模型的数据集,成本控制在预算内1。它的重要性不用喊口号,看人头变化就知道:2020 年 GPT-3 的贡献名单里,2 个人负责数据收集、过滤、去重;3 年后 GPT-4 的名单里是 80 个人——还不含外包标注员;连 ChatML 这么一个对话格式都有 11 个人参与,且多为资深研究员2。如今许多 AI 公司把数据标注(给数据写答案的人)、数据集构建、数据质量管控做成专职岗位3

理论包装是「以数据为中心的 AI」:固定模型优化数据,而不是固定数据优化模型(吴恩达 2021 年办过专门的竞赛;DataComp 用同一套脚本在各家数据集上训 CLIP,拿 38 个下游任务的成绩给数据集排名)4。全章地图:

策展(要什么/要多少/多好) → 合成(不够就造) → 处理(洗好喂进去)
↑______________反复迭代,不是线性流程______________↓

图说:书里强调这三步来回迭代;本章也按这个顺序讲。

2. 数据策展:三要素,各有反直觉的数

书里的总纲一句话:训练数据应体现你希望模型学习的行为5。展开成三个标准——质量、覆盖度、量。书里给了个烹饪比方:质量是食材品质,覆盖度是配比,量是总量6

2.1 质量:1 万条好过几十万条

少量高质量数据常常赢过大量含噪数据。两个实证7:

  • Yi 团队:1 万条精心设计的指令,优于几十万条含噪指令;
  • LIMA:650 亿参数的 Llama 模型,只用 1000 条精心筛选的(提示词,响应)微调,生成的答案在 43% 的情况下与 GPT-4 相当或更受青睐——不过样本太少也有代价:稳健性不及产品级模型。

还有一个更意外的发现:Llama 3 团队发现人工生成的数据反而更容易出错——尤其在细微差别的安全策略上,这促使他们转向 AI 辅助标注8

什么是「高质量」?书里给了六个特征9:相关性强(19 世纪法律数据对现代法律问答不相关,对法制史研究高度相关)、符合任务要求(刻意不用「准确」这个词——任务要创意时,准确反而是错的)、一致性高(同一篇作文,两个标注员打的分差太大,模型会困惑)、格式规范(书里作者亲历的故障:一列浮点数被存成整型,数值被四舍五入,模型行为诡异)、足够独特、合规(不许含 PII 就真的一条都不能有)。

2.2 覆盖度:用户会怎么用,数据就得有什么样

覆盖度 = 多样性:详细指令和简短指令都要有,用户常拼错词,数据里就该有拼错的示例10。但多样性不是无脑堆:论文《The Data Addition Dilemma》发现,某些情况下加更多异质数据反而导致性能下降11

Llama 3 是最好的案例:它的架构与前代并无显著差异,性能提升主要来自数据质量和多样性12。其中有个精细的配比:预训练和监督微调阶段,数学与代码数据的 token 量几乎占一半(远高于互联网上的自然占比),用「退火训练」(学习率渐降时逐步加大代码数学数据)显著提升了推理基准;而偏好微调阶段代码数学只占 12.82%——因为这个阶段要反映的是用户偏好的真实分布13。数据组合怎么定?Meta 用规模法则实验:每个候选组合各训几个小模型,用小模型预测大模型的表现14。还有个三方对照实验:同样 2000 个样本,「高质量但单调」「多样但低质」「兼具」三种数据集训 7B 模型——兼具的那组最好15

2.3 量:从 1 条到 80 亿条

要多少数据?下限是 1 条(Jeremy Howard 的实验证明单样本也能学会东西),上限是预训练的量级——Llama 2/3 用 2 万亿和 16 万亿 token 训练,按每样本 2000 token 折算,相当于 10 亿和 80 亿个样本16。中间怎么选,三个因素17:

  1. 微调技术:全量微调比 LoRA 类 PEFT 方法要多几个数量级的数据;
  2. 任务复杂度:判断评论正负面,远少于财报问答;
  3. 基座性能:基座越接近目标,需要的样本越少——OpenAI 的指南:100 个样本时,先进模型微调后明显更好;55 万个样本时,五个模型表现趋同18

一句话策略:数据少 → 先进模型 + PEFT;数据多 → 小模型全量微调19。书里还给了一个必做实验:先用 50 个样本试微调——绝大多数情况下,50~100 个样本就该看到提升;50 个样本毫无动静,先别加数据,去查超参数、数据质量和提示词20。要估算还差多少数据,画性能-数据量曲线:头 1000 个样本可能提升 10 个百分点,下一个 1000 个只提升 5 个——收益递减是常态21。任务多样性的边际也一样:任务数从 9 涨到 282,性能显著提升;282 涨到 1836,提升已很小22

省高质量数据的三个降级用法:自监督 → 监督(先用便宜的法律文档「续读」,再用昂贵的问答对精调)、低相关 → 高相关(先推特情感数据,再产品评论数据)、合成 → 真实(先合成病历,再真实病历)23

2.4 数据形态:阶段不同,格式完全不同

这是最容易被新手忽略的一层:不同训练阶段要的数据长得不一样24:

阶段数据格式
自监督微调纯文本序列
监督微调(指令, 响应)
偏好微调(提示词, 胜出响应, 落败响应)
奖励模型(指令, 响应), 分数

两种行为的数据特别难标25:

  • CoT 数据:要教模型分步推理,数据里就得有分步响应。价值实证:加入分步响应后某些任务准确率接近翻倍;成本也实证:回答「氮的沸点」,无 CoT 就一句 "-320.4F",有 CoT 要把 23 个苹果吃掉 20 个又买 6 个的每一步都写清——所以 CoT 数据集比其他指令数据少得多26;
  • 工具使用数据:请人类专家口述会漏步骤(记忆偏差),要观察真人实际操作;但人高效的操作对 AI 未必高效(人开浏览器逐条看结果,模型直接调 API、把许多条打包成一批处理)。所以工具数据常靠模拟生成。格式上还要多消息支持:Llama 3 为此设计了带「来源/目的地」消息头的多消息对话格式27。单轮还是多轮也要想清:单轮好采集,多轮才教得了真实任务的来回交互28

策展还包括删数据:书里的例子,聊天机器人被抱怨傲慢——回答完「该陈述正确」还要擅自改写一遍;排查发现训练数据里有「主动附加建议」的示例,删掉即可纠正29

3. 数据获取与标注:先翻现有货架,再动笔标

3.1 数据飞轮与组合流程(主走查)

最重要的数据源往往是你自己的应用——数据飞轮:用户用得越多,数据越多,产品越好,用户更多。应用数据与你的任务分布完全一致,这是其他来源给不了的30

动手造数据之前先翻公开货架(Hugging Face、Kaggle 各托管几十万个数据集;政府开放平台、UCI、AWS Open Data……),但必须查许可协议——数据集整体允许商用,不代表里面每条数据都允许31

实际中通常多渠道组合。书里给了一条六步的(指令,响应)数据集组装线,每步的数都是真实的账32:

1. 找到现有数据集 10,000 条
2. 删低质量指令 -1,000 → 9,000 条
3. 摘出响应差的指令 -3,000 → 6,000 条(响应都好,指令先存着)
4. 为那 3,000 条好指令手写响应 +3,000 → 9,000 条
5. 主题 X 不足:手写 100 个模板 → AI 合成 2,000 条指令
6. 人工标注这 2,000 条 +2,000 → 11,000 条

图说:现成数据打底、人工补质量、AI 补覆盖度——三种来源各干各的活。
(书里同时注明:真实过程比这繁琐,还会反复改标注指南、重标、核查事实。)

3.2 标注指南:最难的一步

需要自己标注时,真正的瓶颈不是标注本身,而是标注指南:什么是好响应?3 分和 4 分差在哪?LinkedIn 等团队把制定标注指南列为 AI 工程中最具挑战性的环节之一;更常见的中途放弃是「指望模型自己悟」——偶尔能成,多数应用赌不起33。好消息:标注指南与第 06 章的评估指南本质通用,评估样本还能直接扩充成训练种子34

4. 数据合成:从模板到自我对弈

4.1 为什么要合成

合成(人工生成数据)与增强(从真实数据衍生,如翻转猫图)目标相同,书里统称数据合成35。五个动机:补量(罕见场景——事故数据、极端天气)、补覆盖度(生成毒性对话训练检测模型;Anthropic 用 AI 生成测试 154 种行为的数据集,质量接近甚至超过人工)、提质量(复杂数学题 AI 出得比人类专家刁;AI 打偏好分比人一致)、保隐私(合成病历替代真实患者记录)、辅蒸馏36

4.2 传统两招:规则与模拟

基于规则:模板 + 随机填充(信用卡交易模板喂给 Faker,先拿合成数据验证欺诈检测模型可行);文本同义替换还能顺手去偏见(把 "She's a fantastic nurse" 的 she/he 互换,对冲「护士=女性」的联想)37。最有趣的是扰动(往数据里加噪声):一个像素就能骗倒模型——CIFAR-10 测试集 67.97% 的自然图像、ImageNet 的 16.04% 被改错分类;而用扰动数据训练反而能增强抗攻击性;BERT 训练时随机替换 1.5% 的 token,小幅涨点38

模拟:真马不能上高速测自动驾驶,虚拟环境可以(CARLA、Waymo SimulationCity);机器人学倒咖啡,模拟一万种关节轨迹,只用成功的那些;模拟还能发现人类忽略的动作序列——对工具使用数据特别有用。边界也写明了:模拟成功≠现实成功,但模拟失败现实大概率失败;Sim2Real 是专门研究这层gap的领域39

4.3 AI 驱动:改写、回译、自我对弈

AI 把合成的上限抬了一截40:

  • 模拟 API 与自我对弈:StableToolBench 用 AI 模拟 API 返回值,不用真调;OpenAI 训 Dota 2 的机器人每天自我对弈约相当于人类 180 年的量,AlphaGo 同理;客服数据可以让模型一半扮客户一半扮客服;
  • 改写:"How to reset my password?" 一条变三条;MetaMath 把 15,000 个数学样本改写成近 40 万个,训出的模型超过更大规模模型;
  • 翻译与回译:一种语言的数据多、另一种数据少(数据量的差距行话叫资源差距)——把多的译成少的来补;回译验证质量——英语 X 译成老挝语 Y,再译回 X′,X′ 与 X 差得远就说明翻译不行;
  • 代码翻译与代码回译(Llama 3):代码互译拓宽语言覆盖;回译是「先让 AI 给代码写解释,再让 AI 照解释反写代码,反写结果与原代码一致才收货」41

一个冷静的注脚:合成数据在后训练用得多、预训练用得少——因为预训练的目标是增加知识,而 AI 很难创造全新的知识42。当然界线也在模糊:网上已充斥 AI 内容, Cosmopedia 一个纯合成数据集就有 250 亿 token43。偏好数据合成还有个细节:NVIDIA 让 AI 裁判评两次、第二次交换顺序,两次都选同一个才收——防首位偏差44

4.4 指令数据合成:175 条种子的杠杆

监督微调的指令数据最贵,合成手法也最成熟45:

  • UltraChat:先让 ChatGPT 出 30 个生活主题,每个主题再出 30~50 个子主题,层层生成指令与响应;
  • Alpaca:175 个种子(指令,响应)示例,喂给 text-davinci-003 生成 52,000 对——放大近 300 倍;
  • 反向指令:AI 生成高质量长响应容易幻觉,那就反过来——拿现成的高质量长文(故事、维基百科),让 AI 生成「能引导出这段内容的指令」,响应是人写的,幻觉问题绕开了。它还支持自举循环:弱模型生成指令 → 微调变强 → 再生成,理论上能持续自我改进46;
  • 长上下文微调的数据配方:把长文档切成短片段,为每段生成(问题,答案)对,但把完整长文档作为上下文——模型就这样学会用扩展的上下文答题47

Llama 3.1 的代码数据组装线是把上面所有招式拧在一起的样板,六步全是 AI,但每步有闸48:

① AI 生成编程问题描述
② AI 生成多语言解决方案(加编程通用规则与 CoT,质量更高)
③ 解析器 + 代码检查工具抓语法错误
④ AI 生成单元测试,抓运行时错误(约 20% 的方案最初有错,部分能自我修正)
⑤ 失败的带着报错反馈让 AI 修,全过的才进 SFT 数据集
⑥ 代码翻译多语言 + 回译生成解释文档,过滤不合格的
── 产出:270 万+ 合成代码样本 ──

图说:能走通的关键是「代码可执行」——功能正确性给了每一步一个机器可判的闸门。

4.5 合成数据的验证与四个局限

怎么验证?与评估 AI 输出同款思路49:能跑代码就跑(这也是 Llama 3 大量合成代码数据的原因——可验证的数据最好造);不能跑的用 AI 验证器打分,或只做「好/坏」的二分类(只判两类的判断题);要验事实一致性就用第 06 章的检测技术。

还有创意款——训练一个「AI 内容检测器」,检测器轻松区分真实与合成,说明合成质量差;甚至训练分类器(只会做「是/否」判断的小模型)预测「合成论文会不会被 NeurIPS 接收」,预测拒稿的直接丢。

四个局限,书里一条条给了证据50:

  1. 质量控制:垃圾进垃圾出;验证方法本身仍是难题;
  2. 表层模仿:《The False Promise of Imitating Proprietary LLMs》——模仿学到了风格,事实准确性不行,泛化(把学到的东西用到没见过的情况)也不行;更糟的是,拿教师模型的解题过程训学生,等于教学生「生成看起来像解题过程的答案」,逼出幻觉;提高推理能力的关键在基座质量;
  3. 模型坍塌:递归地用 AI 数据训 AI,高概率事件占比越来越高,模型逐渐遗忘罕见事件;Gerstgrasser 2024 的结论:全合成不可避免坍塌,混合真实数据可避免——但混合比例没人给;反例也有(数学合成数据扩到 100 万样本未饱和;Nemotron-4 的微调数据 98% 是合成的),不过这些实验都只跑了一轮迭代;
  4. 溯源模糊:模型 X 可能「复述」训练数据——若 X 的训练数据侵权,你的模型连带;若 X 见过基准 B,你用 B 评出的好成绩就是被污染的。

4.6 模型蒸馏:合成的特殊用途

模型蒸馏(知识蒸馏)= 训学生模型模仿教师模型51。DistilBERT 比 BERT 小 40%,保住 97% 的语言理解能力,快 60%;Alpaca 是 1750 亿参数教师的 4% 规模52。注意许可:许多模型禁止用其输出训练竞品53。也别把「用合成数据训练」都当蒸馏——NVIDIA 用 560 亿参数的 Mixtral 生成的数据,微调 3400 亿参数的 Nemotron-4,学生比教师大、还超过了教师54。Llama 3 团队的经验收尾:不加甄别地用自身输出训练会退化,加了质量验证就能持续自我改进——又回到验证这一步55

5. 数据处理:检查、去重、清理、格式化

5.1 先立三条纪律

海量数据的处理步骤动辄数小时数天,书里三条军规:按省时原则排步骤(去重快就先去重,清理快就先清理)、全量跑之前先试运行脚本、永远保留原始数据副本——既为了换姿势重新处理,也防脚本有 bug 毁掉数据56

5.2 检查:15 分钟人工 > 数小时返工

拿到数据先看:来源、统计分布(token、长度、主题、语言)、标注员之间的不一致程度。微软的研究甚至用(动词,名词)对和响应长度的分布来对比 GPT-3/GPT-4 的输出风格——统计既能评估数据也能评估模型57。然后是那句话:花 15 分钟仔细看数据,常能避免数小时的麻烦;OpenAI 联合创始人 Greg Brockman 说得更重:「人工检查数据可能是机器学习领域最被低估的高价值活动」58

5.3 去重:0.1% 的重复毁掉一半模型

重复数据两宗罪:扭曲分布(书里的玩具例子:红色物品重复出现,模型学会「红色=高价」)和污染测试集(同一份数据一条在训练集、它的副本在测试集)59。Anthropic 的量化结论最吓人:只把 0.1% 的数据重复 100 次,8 亿参数模型的性能就跌到 4 亿参数模型的水平——等于一半模型白训60。重复有三个层面:整篇重复、文档内重复、跨文档重复(流行语录出现在无数文档里);判定标准(完全一致还是 80% 重叠)要先定义。方法三档:成对比较(准但贵)、哈希分桶(MinHash、布隆过滤器)、降维(把数据压缩到更少的维度上,再比较远近)后比对61

5.4 清理与格式化

清理清单:去 HTML 与 Markdown(网页自带的排版记号;Databricks:去完之后准确率 +20%、输入 token −60%)、去 PII 与版权与毒性数据、去低质量样本;还有个隐蔽项——标注员在任务后期的标注质量会下降(无聊、疲劳)62。数据太多训不完时,用主动学习/重要性采样/数据剪裁挑最有价值的样本63

最后是格式化,最容易踩的坑在这:推理时的提示词格式必须与微调数据一致。书里的例子:微调数据用「burger -->」,那么「burger」(缺箭头)、「Item: burger -->」(多余前缀)、「burger --> 」(尾部多空格)都可能出问题64。附带一个红利:微调时提示词不需要任务描述和示例(样本就是教具),微调完成后推理提示词可以极简到「{INPUT} -->」——这就是上一章说过的省 token 路径65

6. 作者的判断与证据

  • 「数据工作已专职专岗」(有证据):GPT-3 的 2 人对 GPT-4 的 80 人;书里同时以从业者身份说「大部分数据工作依然是艰辛的劳作」。
  • 「质量优先于数量」(有证据):Yi 的 1 万条、LIMA 的 1000 条;同时诚实标注了 LIMA 稳健性不足的反面。
  • 「合成数据有用但不能取代人工」(有证据 + 有保留):Anthropic 的质量对比、Llama 3.1 的 270 万样本是正面证据;模型坍塌、表层模仿是反面证据;书里明确说「混合比例无人给出」「关键实验只跑了一轮」。
  • 「人工检查不可自动化」(作者判断):15 分钟检查、Brockman 的引语,以及小结里那句「构想数据的思考、制定标注指南、对细节的关注无法自动化」。

7. 边界与局限

  • LIMA 的 43% 是特定模型(Llama 65B)、特定评估(人工比较)下的数字,不能当作「1000 条就够」的通用公式。
  • 模型坍塌的反例实验(Li 2024、Nemotron-4)都是单轮迭代——多轮递归下的结论仍是空白。
  • 「数据重复 0.1%×100 次」的结论来自 8 亿参数模型的特定实验,外推到大模型未经验证。
  • 公开数据集资源清单以英文生态为主,中文语料的获取路径书里未展开。
  • 数据合规只点到 PII 与许可协议;GDPR 级别的法务细节超出本书范围。

8. 可带走的

  1. 数据是设计出来的,不是洗出来的:先定义「希望模型学会的行为」,再倒推数据形态——不同训练阶段的格式完全不同;
  2. 质量杠杆惊人:Yi 用 1 万条打赢几十万条;LIMA 用 1000 条到 GPT-4 四成胜率——但先做 50 样本试点,绝大多数情况 50–100 条就该看到提升;
  3. 画性能-数据量曲线再决定加不加数据:收益递减是常态;数据少用先进模型 + PEFT,数据多用小模型全量微调;
  4. 覆盖度要跟用户走:用户拼错你就要有拼错示例;Llama 3 的配比启示——预训练偏喂代码数学(近一半),偏好微调回到真实分布(12.82%);
  5. CoT 与工具使用数据难标的原因:分步响应写起来烦,人类操作对 AI 未必最优——前者靠 AI 辅助,后者靠模拟;
  6. 合成的正确姿势是「有闸门的生产线」:Alpaca 175 条种子放大 300 倍;Llama 3 六步流水线全 AI 但每步有解析器、单元测试、回译验证把关——可验证的数据最好造;
  7. 合成数据四个坑记牢:质量难验、表层模仿(教学生「像解题过程」反而逼出幻觉)、模型坍塌(混真实数据可避但比例未知)、溯源模糊(上游侵权污染下游);
  8. 蒸馏别迷信「学生小于教师」:Nemotron-4 用小模型的数据把大模型训得超过教师;注意许可协议常禁止用输出训竞品;
  9. 去重最划算:0.1% 数据重复 100 次,8B 模型跌到 4B 水平——先去重再谈别的;
  10. 15 分钟人工检查数据是最被低估的高价值活动;推理提示词格式必须与微调数据逐字符一致(箭头、前缀、空格都算)。

9. 原文地图

主题原书章原文位置
数据集工程的目标第8章text/15-ch08.txt:24(搜「数据集工程的目标」)
GPT-3 两人 → GPT-4 八十人第8章text/15-ch08.txt:27(搜「80个人」)
数据专职岗位第8章text/15-ch08.txt:35(搜「数据标注员」)
策展/合成/处理三步迭代第8章text/15-ch08.txt:41(搜「数据策展」)
以数据为中心的 AI第8章text/15-ch08.txt:53(搜「以数据为中心的AI」) · text/15-ch08.txt:68(搜「38个下游任务」)
各阶段数据格式第8章text/15-ch08.txt:93(搜「胜出响应」)
CoT 数据:翻倍与烦琐第8章text/15-ch08.txt:102(搜「接近翻倍」) · text/15-ch08.txt:123(搜「并不常见」)
工具使用数据:记忆偏差、人机差异第8章text/15-ch08.txt:129(搜「记忆偏差」) · text/15-ch08.txt:132(搜「未必对AI也高效」)
Llama 3 多消息格式第8章text/15-ch08.txt:135(搜「多消息对话格式」)
单轮与多轮第8章text/15-ch08.txt:138(搜「单轮数据」)
删除不良行为数据第8章text/15-ch08.txt:144(搜「傲慢」) · text/15-ch08.txt:147(搜「主动附加建议」)
三要素与烹饪比喻第8章text/15-ch08.txt:150(搜「三大标准」) · text/15-ch08.txt:153(搜「烹饪」)
Yi 1 万条、LIMA 43%第8章text/15-ch08.txt:164(搜「1万条」) · text/15-ch08.txt:167(搜「43%」)
Llama 3:人工数据更易错第8章text/15-ch08.txt:170(搜「AI辅助标注」)
质量六特征、浮点数故障第8章text/15-ch08.txt:179(搜「六大特征」) · text/15-ch08.txt:209(搜「浮点数」)
覆盖度与拼写错误示例第8章text/15-ch08.txt:246(搜「数据多样性」) · text/15-ch08.txt:249(搜「拼写错误」)
加异质数据反而降性能第8章text/15-ch08.txt:255(搜「异质数据」)
Llama 3:提升来自数据第8章text/15-ch08.txt:258(搜「数据质量和多样性」)
退火训练、近一半、12.82%第8章text/15-ch08.txt:270(搜「退火训练」) · text/15-ch08.txt:273(搜「12.82%」)
规模法则实验定组合第8章text/15-ch08.txt:276(搜「规模法则」)
质量与多样性三方对照第8章text/15-ch08.txt:279(搜「2000个样本」)
数据量:1 条到 80 亿条第8章text/15-ch08.txt:296(搜「单个样本」) · text/15-ch08.txt:299(搜「10亿」)
僵化 ossification第8章text/15-ch08.txt:302(搜「僵化」)
数据量三因素第8章text/15-ch08.txt:316(搜「几个数量级」) · text/15-ch08.txt:322(搜「财务报告」) · text/15-ch08.txt:328(搜「越多的训练数据」)
100 vs 550,000 样本实验第8章text/15-ch08.txt:331(搜「550,000」)
先进模型+PEFT、小模型全量第8章text/15-ch08.txt:340(搜「更先进的模型使用PEFT」)
50 样本试点、50~100 见提升第8章text/15-ch08.txt:343(搜「50个样本」) · text/15-ch08.txt:346(搜「50~100」)
三招省高质量数据第8章text/15-ch08.txt:355(搜「法律文档」) · text/15-ch08.txt:361(搜「推特」) · text/15-ch08.txt:372(搜「合成数据微调」)
收益递减曲线第8章text/15-ch08.txt:378(搜「收益递减」)
任务多样性 9→282→1836第8章text/15-ch08.txt:381(搜「282」)
数据飞轮第8章text/15-ch08.txt:418(搜「数据飞轮」)
公开资源与许可检查第8章text/15-ch08.txt:452(搜「许可协议」) · text/15-ch08.txt:455(搜「Kaggle」)
标注指南最难第8章text/15-ch08.txt:488(搜「极具挑战性」)
标注指南=评估指南第8章text/15-ch08.txt:491(搜「评估指南」)
增强 vs 合成第8章text/15-ch08.txt:510(搜「数据增强」) · text/15-ch08.txt:516(搜「混用」)
合成五动机、154 种行为第8章text/15-ch08.txt:542(搜「罕见天气」) · text/15-ch08.txt:551(搜「154种」) · text/15-ch08.txt:574(搜「合成患者记录」)
模板合成、欺诈检测第8章text/15-ch08.txt:608(搜「模板」) · text/15-ch08.txt:644(搜「欺诈检测」)
同义替换去偏见第8章text/15-ch08.txt:653(搜「fantastic nurse」)
一个像素攻击第8章text/15-ch08.txt:668(搜「一个像素」)
BERT 扰动 1.5%第8章text/15-ch08.txt:674(搜「1.5%」)
模拟:CARLA、倒咖啡、Sim2Real第8章text/15-ch08.txt:683(搜「CARLA」) · text/15-ch08.txt:686(搜「倒咖啡」) · text/15-ch08.txt:689(搜「Sim2Real」)
工具数据的模拟生成第8章text/15-ch08.txt:692(搜「动作序列」)
模拟 API 与自我对弈 180 年第8章text/15-ch08.txt:712(搜「StableToolBench」) · text/15-ch08.txt:715(搜「180年」)
改写与 MetaMath第8章text/15-ch08.txt:721(搜「How to reset my password」) · text/15-ch08.txt:733(搜「400,000」)
回译验证第8章text/15-ch08.txt:739(搜「回译」)
代码翻译与代码回译第8章text/15-ch08.txt:742(搜「代码翻译」) · text/15-ch08.txt:745(搜「回译方法」)
预训练难合成新知识第8章text/15-ch08.txt:748(搜「全新的知识」)
Cosmopedia 250 亿 token第8章text/15-ch08.txt:751(搜「250亿」)
首位偏差两次评估第8章text/15-ch08.txt:754(搜「首位偏差」)
UltraChat、Alpaca 52,000第8章text/15-ch08.txt:772(搜「30~50个子主题」) · text/15-ch08.txt:775(搜「52,000」)
反向指令与自举第8章text/15-ch08.txt:784(搜「反向指令」) · text/15-ch08.txt:805(搜「理想的性能」)
长上下文微调数据配方第8章text/15-ch08.txt:808(搜「8000个token」)
Llama 3 流水线:生成与测试第8章text/15-ch08.txt:832(搜「解析器」) · text/15-ch08.txt:838(搜「20%」)
六步协作与 270 万样本第8章text/15-ch08.txt:861(搜「翻译成不同的编程语言」) · text/15-ch08.txt:867(搜「270万」)
数据验证:AI 验证器第8章text/15-ch08.txt:879(搜「可被评估」) · text/15-ch08.txt:882(搜「AI验证器」)
创意验证:NeurIPS 分类器第8章text/15-ch08.txt:888(搜「NeurIPS」)
启发式过滤第8章text/15-ch08.txt:894(搜「启发式方法」)
四局限总起第8章text/15-ch08.txt:915(搜「四个主要原因」)
表层模仿、解题过程教幻觉第8章text/15-ch08.txt:921(搜「表层」;若定位失败搜「False Promise」) · text/15-ch08.txt:929(搜「解题过程」)
模型坍塌与罕见事件第8章text/15-ch08.txt:938(搜「模型坍塌」) · text/15-ch08.txt:941(搜「罕见事件」)
混合可避免、比例未给第8章text/15-ch08.txt:944(搜「混合使用合成数据与真实数据」)
100 万未饱和、98% 合成第8章text/15-ch08.txt:947(搜「98%」)
溯源困难第8章text/15-ch08.txt:953(搜「侵权」)
蒸馏定义、DistilBERT、Alpaca 4%第8章text/15-ch08.txt:970(搜「知识蒸馏」) · text/15-ch08.txt:973(搜「60%」) · text/15-ch08.txt:976(搜「4%」)
许可禁止、BuzzFeed −80%第8章text/15-ch08.txt:979(搜「竞品」) · text/15-ch08.txt:982(搜「80%」)
学生超过教师第8章text/15-ch08.txt:994(搜「超过了教师模型」)
Llama 3:验证后可持续改进第8章text/15-ch08.txt:997(搜「不加甄别」)
处理三军规第8章text/15-ch08.txt:1020(搜「试运行」) · text/15-ch08.txt:1023(搜「原始数据」)
检查:动名词分布第8章text/15-ch08.txt:1049(搜「动词」)
15 分钟与 Brockman 引语第8章text/15-ch08.txt:1076(搜「15分钟」)
去重:红色物品第8章text/15-ch08.txt:1093(搜「红色物品」)
0.1% 重复 100 次第8章text/15-ch08.txt:1102(搜「0.1%」)
重复三层次第8章text/15-ch08.txt:1108(搜「整篇文档重复」) · text/15-ch08.txt:1114(搜「跨文档重复」)
去重三方法第8章text/15-ch08.txt:1123(搜「成对比较」) · text/15-ch08.txt:1132(搜「布隆过滤器」) · text/15-ch08.txt:1138(搜「降维」)
去 HTML:+20%/−60%第8章text/15-ch08.txt:1160(搜「60%」)
标注员后期疲劳第8章text/15-ch08.txt:1169(搜「无聊或疲劳」)
数据剪裁第8章text/15-ch08.txt:1172(搜「数据剪裁」)
格式一致:burger -->第8章text/15-ch08.txt:1240(搜「格式保持一致」) · text/15-ch08.txt:1243(搜「缺少末尾的箭头」)
微调后极简提示词第8章text/15-ch08.txt:1231(搜「{INPUT}」) · text/15-ch08.txt:1234(搜「输入token成本」)
小结:无法自动化第8章text/15-ch08.txt:1275(搜「无法自动化」)

Footnotes

  1. 出处:「第8章」第 24 段(text/15-ch08.txt:24,搜「数据集工程的目标」)。

  2. 出处:「第8章」第 27 段(text/15-ch08.txt:27,搜「80个人」)。

  3. 出处:「第8章」第 35 段(text/15-ch08.txt:35,搜「数据标注员」)。

  4. 出处:「第8章」第 53 段(text/15-ch08.txt:53,搜「以数据为中心的AI」)、第 65 段(text/15-ch08.txt:65,搜「吴恩达」)与第 68 段(text/15-ch08.txt:68,搜「38个下游任务」)。

  5. 出处:「第8章」第 96 段(text/15-ch08.txt:96,搜「希望模型学习的行为」)。

  6. 出处:「第8章」第 150 段(text/15-ch08.txt:150,搜「三大标准」)与第 153 段(text/15-ch08.txt:153,搜「烹饪」)。

  7. 出处:「第8章」第 164 段(text/15-ch08.txt:164,搜「1万条」)与第 167 段(text/15-ch08.txt:167,搜「43%」)。

  8. 出处:「第8章」第 170 段(text/15-ch08.txt:170,搜「AI辅助标注」)。

  9. 出处:「第8章」第 179 段(text/15-ch08.txt:179,搜「六大特征」)、第 185 段(text/15-ch08.txt:185,搜「19世纪的法律数据」;若定位失败搜「相关性强」)、第 194 段(text/15-ch08.txt:194,搜「符合任务要求」)与第 209 段(text/15-ch08.txt:209,搜「浮点数」)。

  10. 出处:「第8章」第 246 段(text/15-ch08.txt:246,搜「数据多样性」)与第 249 段(text/15-ch08.txt:249,搜「拼写错误」)。

  11. 出处:「第8章」第 255 段(text/15-ch08.txt:255,搜「异质数据」)。

  12. 出处:「第8章」第 258 段(text/15-ch08.txt:258,搜「数据质量和多样性」)。

  13. 出处:「第8章」第 270 段(text/15-ch08.txt:270,搜「退火训练」)与第 273 段(text/15-ch08.txt:273,搜「12.82%」)。

  14. 出处:「第8章」第 276 段(text/15-ch08.txt:276,搜「规模法则」)。

  15. 出处:「第8章」第 279 段(text/15-ch08.txt:279,搜「2000个样本」)。

  16. 出处:「第8章」第 296 段(text/15-ch08.txt:296,搜「单个样本」)与第 299 段(text/15-ch08.txt:299,搜「10亿」)。

  17. 出处:「第8章」第 316 段(text/15-ch08.txt:316,搜「几个数量级」)、第 322 段(text/15-ch08.txt:322,搜「财务报告」)与第 328 段(text/15-ch08.txt:328,搜「越多的训练数据」)。

  18. 出处:「第8章」第 331 段(text/15-ch08.txt:331,搜「550,000」)。

  19. 出处:「第8章」第 340 段(text/15-ch08.txt:340,搜「更先进的模型使用PEFT」)。

  20. 出处:「第8章」第 343 段(text/15-ch08.txt:343,搜「50个样本」)与第 346 段(text/15-ch08.txt:346,搜「50~100」)。

  21. 出处:「第8章」第 378 段(text/15-ch08.txt:378,搜「收益递减」)。

  22. 出处:「第8章」第 381 段(text/15-ch08.txt:381,搜「282」)。

  23. 出处:「第8章」第 355 段(text/15-ch08.txt:355,搜「法律文档」)、第 361 段(text/15-ch08.txt:361,搜「推特」)与第 372 段(text/15-ch08.txt:372,搜「合成数据微调」)。

  24. 出处:「第8章」第 93 段(text/15-ch08.txt:93,搜「胜出响应」)。

  25. 出处:「第8章」第 96 段(text/15-ch08.txt:96,搜「难上加难」)。

  26. 出处:「第8章」第 102 段(text/15-ch08.txt:102,搜「接近翻倍」)、第 111 段(text/15-ch08.txt:111,搜「-320.4F」)、第 114 段(text/15-ch08.txt:114,搜「cafeteria」)与第 123 段(text/15-ch08.txt:123,搜「并不常见」)。

  27. 出处:「第8章」第 129 段(text/15-ch08.txt:129,搜「记忆偏差」)、第 132 段(text/15-ch08.txt:132,搜「未必对AI也高效」)与第 135 段(text/15-ch08.txt:135,搜「多消息对话格式」)。

  28. 出处:「第8章」第 138 段(text/15-ch08.txt:138,搜「单轮数据」)。

  29. 出处:「第8章」第 144 段(text/15-ch08.txt:144,搜「傲慢」)与第 147 段(text/15-ch08.txt:147,搜「主动附加建议」)。

  30. 出处:「第8章」第 418 段(text/15-ch08.txt:418,搜「数据飞轮」)。

  31. 出处:「第8章」第 449 段(text/15-ch08.txt:449,搜「盲目信任」)、第 452 段(text/15-ch08.txt:452,搜「许可协议」)与第 455 段(text/15-ch08.txt:455,搜「Kaggle」)。

  32. 出处:「第8章」第 425 段(text/15-ch08.txt:425,搜「10,000个样本」)、第 431 段(text/15-ch08.txt:431,搜「3000个」)、第 437 段(text/15-ch08.txt:437,搜「2000条指令」)与第 440 段(text/15-ch08.txt:440,搜「11,000」)。

  33. 出处:「第8章」第 485 段(text/15-ch08.txt:485,搜「标注指南」)与第 488 段(text/15-ch08.txt:488,搜「极具挑战性」)。

  34. 出处:「第8章」第 491 段(text/15-ch08.txt:491,搜「评估指南」)。

  35. 出处:「第8章」第 510 段(text/15-ch08.txt:510,搜「数据增强」)与第 516 段(text/15-ch08.txt:516,搜「混用」)。

  36. 出处:「第8章」第 542 段(text/15-ch08.txt:542,搜「罕见天气」)、第 548 段(text/15-ch08.txt:548,搜「TrueTeacher」)、第 551 段(text/15-ch08.txt:551,搜「154种」)、第 568 段(text/15-ch08.txt:568,搜「一致和可靠」)与第 574 段(text/15-ch08.txt:574,搜「合成患者记录」)。

  37. 出处:「第8章」第 608 段(text/15-ch08.txt:608,搜「Faker」)、第 644 段(text/15-ch08.txt:644,搜「欺诈检测」)与第 653 段(text/15-ch08.txt:653,搜「fantastic nurse」)。

  38. 出处:「第8章」第 668 段(text/15-ch08.txt:668,搜「一个像素」)、第 671 段(text/15-ch08.txt:671,搜「15种」;若定位失败搜「ImageNet-C」)与第 674 段(text/15-ch08.txt:674,搜「1.5%」)。

  39. 出处:「第8章」第 683 段(text/15-ch08.txt:683,搜「CARLA」)、第 686 段(text/15-ch08.txt:686,搜「倒咖啡」)、第 689 段(text/15-ch08.txt:689,搜「Sim2Real」)与第 692 段(text/15-ch08.txt:692,搜「动作序列」)。

  40. 出处:「第8章」第 712 段(text/15-ch08.txt:712,搜「StableToolBench」)、第 715 段(text/15-ch08.txt:715,搜「180年」)、第 733 段(text/15-ch08.txt:733,搜「400,000」)与第 739 段(text/15-ch08.txt:739,搜「回译」)。

  41. 出处:「第8章」第 742 段(text/15-ch08.txt:742,搜「代码翻译」)与第 745 段(text/15-ch08.txt:745,搜「回译方法」)。

  42. 出处:「第8章」第 748 段(text/15-ch08.txt:748,搜「全新的知识」)。

  43. 出处:「第8章」第 751 段(text/15-ch08.txt:751,搜「250亿」)。

  44. 出处:「第8章」第 754 段(text/15-ch08.txt:754,搜「首位偏差」)。

  45. 出处:「第8章」第 772 段(text/15-ch08.txt:772,搜「30~50个子主题」)与第 775 段(text/15-ch08.txt:775,搜「52,000」)。

  46. 出处:「第8章」第 784 段(text/15-ch08.txt:784,搜「反向指令」)与第 796 段(text/15-ch08.txt:796,搜「较弱的模型」)。

  47. 出处:「第8章」第 808 段(text/15-ch08.txt:808,搜「8000个token」)。

  48. 出处:「第8章」第 823 段(text/15-ch08.txt:823,搜「编程问题描述」)、第 832 段(text/15-ch08.txt:832,搜「解析器」)、第 838 段(text/15-ch08.txt:838,搜「20%」)、第 861 段(text/15-ch08.txt:861,搜「翻译成不同的编程语言」)与第 867 段(text/15-ch08.txt:867,搜「270万」)。

  49. 出处:「第8章」第 879 段(text/15-ch08.txt:879,搜「可被评估」)、第 882 段(text/15-ch08.txt:882,搜「AI验证器」)与第 888 段(text/15-ch08.txt:888,搜「NeurIPS」)。

  50. 出处:「第8章」第 915 段(text/15-ch08.txt:915,搜「四个主要原因」)、第 921 段(text/15-ch08.txt:921,搜「表层」;若定位失败搜「False Promise」)、第 938 段(text/15-ch08.txt:938,搜「模型坍塌」)、第 944 段(text/15-ch08.txt:944,搜「混合使用合成数据与真实数据」)、第 947 段(text/15-ch08.txt:947,搜「98%」)与第 953 段(text/15-ch08.txt:953,搜「侵权」)。

  51. 出处:「第8章」第 970 段(text/15-ch08.txt:970,搜「知识蒸馏」)。

  52. 出处:「第8章」第 973 段(text/15-ch08.txt:973,搜「60%」)与第 976 段(text/15-ch08.txt:976,搜「4%」)。

  53. 出处:「第8章」第 979 段(text/15-ch08.txt:979,搜「竞品」)。

  54. 出处:「第8章」第 993 段(text/15-ch08.txt:993,搜「3400亿」;若定位失败搜「Mixtral」)与第 994 段(text/15-ch08.txt:994,搜「超过了教师模型」)。

  55. 出处:「第8章」第 997 段(text/15-ch08.txt:997,搜「不加甄别」)。

  56. 出处:「第8章」第 1017 段(text/15-ch08.txt:1017,搜「节省时间」;若定位失败搜「去重」)、第 1020 段(text/15-ch08.txt:1020,搜「试运行」)与第 1023 段(text/15-ch08.txt:1023,搜「原始数据」)。

  57. 出处:「第8章」第 1046 段(text/15-ch08.txt:1046,搜「分布图」)与第 1049 段(text/15-ch08.txt:1049,搜「动词」)。

  58. 出处:「第8章」第 1076 段(text/15-ch08.txt:1076,搜「15分钟」)。

  59. 出处:「第8章」第 1093 段(text/15-ch08.txt:1093,搜「红色物品」)。

  60. 出处:「第8章」第 1102 段(text/15-ch08.txt:1102,搜「0.1%」)。

  61. 出处:「第8章」第 1108 段(text/15-ch08.txt:1108,搜「整篇文档重复」)、第 1117 段(text/15-ch08.txt:1117,搜「80%」)与第 1132 段(text/15-ch08.txt:1132,搜「布隆过滤器」)。

  62. 出处:「第8章」第 1160 段(text/15-ch08.txt:1160,搜「60%」)与第 1169 段(text/15-ch08.txt:1169,搜「无聊或疲劳」)。

  63. 出处:「第8章」第 1172 段(text/15-ch08.txt:1172,搜「数据剪裁」)。

  64. 出处:「第8章」第 1240 段(text/15-ch08.txt:1240,搜「格式保持一致」)与第 1243 段(text/15-ch08.txt:1243,搜「缺少末尾的箭头」)。

  65. 出处:「第8章」第 1186 段(text/15-ch08.txt:1186,搜「任务描述或示例」)与第 1231 段(text/15-ch08.txt:1231,搜「{INPUT}」)。