跳到主要内容

什么时候该微调 — 三问决策,与一条你会失去的东西

这一章讲三件事: 什么情况下才该动模型内部那些数; 微调换来什么、又会失去什么(有一样东西的丢失很致命,而它经常被忽略); 以及数据该怎么准备,才不至于花了钱训出一个更差的模型。

它在全书链条里的位置: 第 01 章那条阶梯的第 ③ 级。 前面两级(把话说清楚、把资料取回来)都不动模型;这一章是第一件真的动模型的事。 它也是最贵、最慢、最难回头的一件。

1. 顶层全景:三句抱怨,和一条三问的路

书的开头是三句真实的抱怨1:

「这个模型结果还行,但对我们的医学术语不够精确。」 「AI 写的东西不错,但它不懂我们公司的内部黑话。」 「法律文档要更高的准确度,通用模型会犯太多细微的错。」

这三句的共同点:提示词写到第五版了,还是不对;而检索也帮不上忙—— 因为缺的不是「知识」,是「行事的方式」。

这一章的主走查是一个客服机器人,它「答得对,但太像机器人」。

三问,按顺序走,任何一问过了就到此为止

① 换个更好的提示词,结果能接受吗?
试法:写一版更好的提示词,拿 10 个真实例子跑一遍
→ 10 个里有 8 个过质量线 → **停。五分钟,不花钱。**
│ 过不了?

② 这个问题涉及的事实,会不会经常变?
「你们还有多少件蓝衬衫?」—— 今天 50 件,明天卖光
→ 会变 → **必须走检索,微调在这里是错的**
│ 不常变?

③ 需不需要它稳定地守住某种格式,或者某种这一行的判断?
「必须按 Bluebook 格式引注,50 轮对话不走样」
→ 是 → **这才轮到微调**


④ 但你会失去一样东西:微调过的模型答不出「这句依据哪份文件」

⑤ 所以生产上常常两条一起用

图说:这三问的顺序不能反。**它们按「代价从小到大」排,而不是按「效果从好到差」排。**

2. 微调到底是什么

这一节给一个准确的定义,并说清它和前两章的根本差别。

定义

微调 = 拿你自己的数据,在一个已经训练好的模型上继续训练,让它适配你的用途。 它真的去更新这个模型的那些数。2

「真的去更新」这五个字是这一章的全部要害。

回想第 02 章那个动作:模型每一步在一张候选表里挑一个词元。

前两章做的事这一章做的事
提示词: 改你给它的那段文字改模型自己
检索: 往那段文字里塞进真材料——
候选表怎么算出来的:没变候选表怎么算出来的,变了

所以微调改的不是「它这次看到什么」,是「它今后怎么算」。

一个量级参照:几百个例子就够

书给的数很反直觉:只用几百个例子微调,就能明显超过不微调直接用; 而最低门槛是至少 50 到 100 个好例子才看得到明显收益3

这个数得有东西垫着才有量感,书自己给了一个: 下限是 50 到 100 个好例子—— 所以「几百」是「刚够用」再往上一点,不是「很多」。

而从零造出这个模型本身,读的是上万亿个词元(这个量级不在书里,来自通用知识)。 这两个数不是同一种东西: 一个数的是「你给了它几条示范」,一个数的是「它读过多少字」, 所以不必去算它们的比值——要记的是这两件事根本不在一个尺度上。 「微调」这个名字记的就是这件事:它调的是边角,不是重造。

3. 三条路的对照表,以及那条最容易被忽略的代价

这一节把三条路摆在一起。表里最要紧的不是「谁更强」,是「各自失去什么」。

书给的对照4:

提示词检索微调
改模型的数吗
领域知识从哪来有限外部来源烧进模型里
成本最便宜中等(要建一套东西)最高:要数据 + 算力 + 前期投入
控语气和风格难控控制有限精确可控
知识新鲜度静态动态,每次查都是新的静态,除非重训
什么时候用快速试验、基础任务事实会变、要落在文档上领域专长、公司内部那些固定走法

那条最容易被忽略的代价

第 05 章讲检索时说过,它能让回答「指出这句出自哪份文件」。微调做不到。

微调过的模型没法在回答里引用具体文档,因为知识被烧进了那些数里,不带来源标注。5

检索: 取回第 8 段(礼品卡条款) → 模型照着写 → **「依据《退货政策》第 3 条」**
↑ 因为那份文档就在它眼前

微调: 正确的说法被摊进了几十亿个数里
→ 模型写出正确的答案 → **但它说不出这个答案是从哪儿来的**
↑ 因为「哪儿来的」这个信息在训练时就没有被保留下来

图说:**这不是模型不肯说,是这个信息在微调这个动作里被丢掉了。**
它和「模型会不会编」是两回事:**它可能完全答对,但你无法核实。**

所以书给的结论是:要可核实、带文档引用的回答,就必须把微调和检索(或者工具)组合起来用。

书给的例子很清楚: 一个理财顾问机器人—— 微调让它遵守特定的规划原则和风险框架(这是行事方式), 检索让它拉到当前的利率和税法(这是会变的事实)6

4. 第 ① 问:更好的提示词能不能过线

这一节是这一章性价比最高的一节,因为它可能让你根本不用读后面几节。

书给的测法,具体到可以照做

写一版更好的提示词,拿 10 个真实例子跑一遍。 10 个里有 8 个达到你的质量线,就到此为止——你已经做完了。 提示词只要几分钟,而且不花钱。7

注意这个测法的三个细节,每一个都有用:

细节为什么
10 个少到你半小时就能做完,多到能看出趋势
真实例子不是你编的题——编的题会照着你的提示词来
8 个一条明确的线。没有线,你会一直觉得「再改改就好了」

走查第 ① 步:那个太像机器人的客服

问题: 客服机器人答得对,但读起来干巴巴,像在念稿

第 ① 问的做法:在系统提示词里加一句
「永远专业而温暖地回应,像在帮一位重要的朋友。」

拿 10 个真实的顾客问题跑一遍 → 8 个读起来自然了

→ **停。五分钟解决,不花一分钱,不动任何代码之外的东西。**

图说:这一句提示词和这个场景是书里的原样。
**「语气」正是提示词最擅长、也最便宜的那一类问题。**

如果这一步没过,再往下走。

5. 第 ② 问:这个问题涉及的事实会不会常变

这一节给出一条硬判据,而书给的例子犀利到不需要解释。

书给的例子

今天你有 50 件蓝衬衫,明天卖光了。 用检索,机器人每次都实时查库存,答得准。 用微调,机器人会永远自信地告诉顾客「我们有 50 件蓝衬衫」——哪怕早就卖光了。8

为什么会这样:

微调 = 在训练那一刻,把「有 50 件蓝衬衫」这个说法摊进那些数里
→ 训练结束,这个数就定了
→ 它不会自己更新,除非你重训一遍

检索 = 每次提问都去查一次库存
→ 数据在数据库里,库存变了它就变了

图说:**微调在训练时把知识锁死;检索每次查询都取新的。**
这一句是这一整问的全部答案。

判据一句话:如果信息按天、按周、甚至按月在变,你要的是检索,不是微调。

6. 第 ③ 问:要不要它稳定地守住某种格式或判断

这一节讲微调真正的用武之地,而它的关键词是「稳定」。

书给的例子

一个法律文档助手,必须按 Bluebook 这种引注格式写、而且绝不能编造判例9

用详细的提示词:
前几轮:格式对
第 10 轮:格式还行
**第 30 轮:它忘了格式**
**第 40 轮:它编了一个案子**

拿 500 个正确引注的例子微调之后:
**50 轮对话,格式一次都没走样**

图说:注意这里变的不是「一次能不能做对」——提示词也能做对一次。
**变的是「一直做对」。** 这就是微调的用武之地:**稳定性,不是能力。**

为什么提示词在长对话里守不住

回到第 02 章那个动作: 你写的格式要求在提示词里,而随着对话变长, 它前面堆着几十轮对话内容——那句要求在整段文字里的分量被稀释了

微调不一样: 那个格式已经被摊进了模型的那些数里,它不占提示词的任何位置, 也不会被后面的对话冲淡

一句话记住第 ③ 问:提示词是「这一次请你这样做」,微调是「你本来就这样做」。

走查第 ②③ 步:同一个客服机器人的两个需求

需求 A:「你们还有多少件蓝衬衫?」
第 ② 问:事实会变吗?→ **每小时都在变**
→ 走检索。**微调在这里不只是浪费,是有害的**(它会自信地报一个过期的数)

需求 B:「所有退款说明必须按公司统一的四段式写,并且永不承诺我们做不到的时限」
第 ② 问:事实会变吗?→ 不变,这是行事方式
第 ③ 问:要稳定守住格式吗?→ **是**
→ 走微调

图说:**同一个机器人,两个需求,答案相反。**
这就是为什么三问要一个需求一个需求地过,而不是「这个项目该不该微调」。

7. 三个案例,以及每个案例书自己给的警告

这一节的价值不在案例本身,在作者给每个案例配的那句警告——它们比案例值钱。

案例做了什么、结果如何书自己给的警告
医疗拿医学知识、考题和临床指南微调,在美国医师执照考试上拿到 91% 准确率,超过医生的平均分10「基准表现强,不保证真实世界可靠。」 拿考题训出来的模型,碰到考卷上没有的新病例可能很脆
金融一个 500 亿参数的金融专用模型证明了领域专门化能大幅提升表现;而一个更省事的做法只用 5 万条财经新闻标题微调,在市场情绪分析上就超过了更大的通用模型11金融术语太独特,大量训练会覆盖掉模型的通用知识——这个现象叫灾难性遗忘。 缓解办法是训练数据里要小心地掺入通用样本
代码拿源码微调,做出了最早的一批编程助手12微调过的代码模型擅长模式匹配和写样板代码,复杂逻辑仍然要人仔细审

第一条警告值得停一下:它就是第 01 章那件事

「考试考得好,不保证真实世界靠得住」——这正是第 01 章那个可靠性落差, 只是这一次它出现在微调的语境里。

换个说法:微调可以让你在自己的考卷上拿高分,而这个高分和第 01 章那个 94 分犯的是同一个错。

第二条警告里那个词要记住

灾难性遗忘:模型学了新东西,却把旧本事丢了。

训练前: 会写代码 ✓ 会算术 ✓ 会日常对话 ✓ 懂金融术语 ✗
│ 拿 50 万条金融文本猛训

训练后: 懂金融术语 ✓ **会写代码 ✗ 会算术 ✗ 日常对话变生硬**

图说:**这些数是有限的,写进去新的就会挤掉旧的。**
缓解办法:训练材料里掺一部分通用的例子,让它别把旧本事忘光。
**(这个词在第 11 章还会出现一次,而那里有一个更反直觉的版本。)**

8. 数据准备:垃圾进,垃圾出

这一节是这一章最容易被跳过、也最容易翻车的一节。

书的第一句话就是判据

微调的效果,不会好过你喂给它的数据。13

数据从哪来:三条

来源具体是什么
用已有的客服对话记录(系统自动留下的运行记录叫日志)、常见问答;做法律任务的话,还有公开的判例和合同数据集
人工标注分类任务、给输出排质量序
保证覆盖和平衡别让某一类样本占了九成

书给的一条明确建议:宁可少而精,不要多而杂;领域专家应该参与审数据。14

还有一条警告必须留:数据里的偏见会被微调放大。 (这条在第 20 章会变成一整章的主题,那里有一个非常具体的案例。)

格式:三条要求,第三条最容易漏

训练数据的样子是一对对的「输入 → 应该输出什么」,一行一对15。书给的样例长这样:

{"prompt": "User: 在加州怎么提交驱逐通知?\nAI:",
"completion": " 如果你是加州的房东,想要提交驱逐申请,你必须首先……"}
要求具体是什么不做会怎样
① 格式必须一致有的例子把用户的问题写成 Q:,有的写成 User:模型会糊涂,不知道该按哪一套来
② 注意长度上限每一对「输入 + 输出」都要落在模型一次能读的范围内,而且最好远低于上限训练时可能把好几个例子拼在一起,长了会被截断
③ 该出多种格式的任务,每种都要给够例子有时候只给答案、有时候给要点列表只给一个要点列表的例子,它举一反三不出来(「从见过的例子推广到没见过的」这件事在这一行叫泛化)

第 ③ 条是书用警告框标出来的,而它最容易被漏。 道理和第 04 章的少样本一样:模型学的是「模式」,你只演示了一次,它认不出这是一种可选的模式。

留一部分数据不训,专门用来看它有没有学过头

做法:留 10% 到 20% 的数据出来,不参与训练,只用来检查它在没见过的例子上表现如何。 这一部分叫验证集。16

还要先说清一个词:训练过程中,「它这次答得离正确答案有多远」会被算成一个数, 这个数就叫损失——越低越好。 后面那张图里盯的两条曲线,盯的就是它。

它要防的那件事叫过拟合:模型把训练数据背得太熟,以至于在新的、没见过的输入上反而更差。

什么叫「背得太熟反而更差」:

你给它 500 个法律引注的例子
→ 它可以把这 500 个背得一字不差
→ 可它学到的是「这 500 条长什么样」,不是「引注该怎么写」
→ 换一个新案子,它拼不出来

怎么看出来:
训练过程中同时盯两条曲线——
在训练数据上错得多离谱 → 一路在降(它当然越背越熟)
**在验证集上错得多离谱 → 降到某一点之后开始回升** ← **这就是该停的信号**

图说:**「验证集上的损失开始回升」是书给的、最实用的一条停训判据。**
(「整套数据从头到尾过一遍」叫一轮,通常每一轮结束时看一次。)

书还给了两条容易踩的细节:

  • 验证集的分布要和训练集一致——否则它测的不是同一件事;
  • 小心数据泄漏:验证集里的例子绝不能同时出现在训练集里。 否则你测的是「它背没背下来」,而不是「它会不会」。

9. 作者的判断与证据

书里给了证据的:

说法证据是什么
几百个例子就能明显超过不微调引了模型供应商的发现,并给了最低门槛(50–100 个好例子)
医疗模型在执照考试上 91%、超过医生平均分一个具体的数字,但书没给医生平均分是多少
5 万条新闻标题就能超过更大的通用模型一个具体的案例
微调过的模型不能引用来源一条机制性结论,来自微调这个动作本身
验证集上的损失回升就该停一条标准做法,来自这一行的常规

作者的推测或经验值:

说法它是什么
「10 个例子里 8 个过线就停」一条经验测法。 为什么是 10 和 8,书没说
「留 10–20% 做验证集」经验值
三问的顺序一个决策框架。 好用,但书没有给「照这个顺序省了多少」的数据
「宁可少而精」一句经验判断,没有量化对照

判断(我们的,不是书里的): 这一章真正的贡献不是「怎么微调」,是那三问的顺序。 因为微调最大的成本不是钱,是它把一个可以随时改的东西变成了一个改不动的东西: 提示词改一行就生效,检索换一份文档就生效,而微调过的模型要改就得重训一遍。 所以三问真正的意义是:能不动模型就别动。 如果错,会错在: 如果将来微调的成本降到「改一行提示词」的量级(比如几分钟、几块钱), 这个顺序就不必这么严格了。判据是:你重训一遍要多久、要多少钱—— 如果答案是「一杯咖啡的时间」,那就先试再说。

10. 边界与局限

  • 这一章完全没讲怎么真的做微调。 具体怎么训、要什么硬件、参数怎么填,是第 11 章的内容;

  • 没有给成本数字。 「最高」是相对谁?一次微调要多少钱?书刻意不给(它会过期), 但这让第 ① 问和第 ③ 问之间的取舍没法算账;

  • 三个案例的警告比案例本身值钱,但警告都没有量化。 「碰到新病例可能很脆」——脆多少?书没说;

  • 没有讲怎么评估微调后的模型。 训完了怎么知道它比原来好? 这一章一个字没提(评测是第 17 章的内容);

  • 「灾难性遗忘」只给了名字和缓解方向。 掺多少通用样本、怎么判断有没有发生,书没说 ——而第 11 章有一条更反直觉的相关警告。

11. 可带走的

全章那条走查,一行写完: 客服机器人「答得对但太像机器人」→ 第 ① 问加一句「像在帮一位重要的朋友」,10 个真实例子里 8 个过线 → 停,五分钟解决 → 换个需求「还有多少件蓝衬衫」→ 第 ② 问:今天 50 件明天卖光 → 必须走检索 → 再换「必须按 Bluebook 格式引注、50 轮不走样」→ 提示词写到第五版仍会忘 → 拿 500 个正确引注的例子微调 → 50 轮不走样 → 但它答不出「这条依据哪份文件」→ 所以生产上两条一起用。

  1. 微调 = 拿你自己的数据继续训练,真的去改模型内部那些数; 它改的不是「它这次看到什么」,是「它今后怎么算」;
  2. 三问按代价从小到大排,任何一问过了就停: 更好的提示词能不能过线 → 事实会不会常变 → 要不要稳定守住格式或判断;
  3. 第 ① 问的测法可以照做:写一版更好的提示词,10 个真实例子跑一遍,8 个过线就停;
  4. 第 ② 问的判据:信息按天、按周、按月在变 → 要检索,不要微调。 微调过的模型会永远自信地报那个过期的数;
  5. 第 ③ 问的关键词是「稳定」,不是「能力」: 提示词也能做对一次,微调让它一直做对;
  6. 一句话记住这两者:提示词是「这一次请你这样做」,微调是「你本来就这样做」;
  7. 微调会失去一样东西:它答不出「这句依据哪份文件」—— 要可核实的回答就必须和检索组合;
  8. 几百个例子就能明显见效(最低 50–100 个好例子)——这是「微调」这个名字的由来;
  9. 三条警告要记住: 考卷分数不等于真实可靠 / 大量领域训练会挤掉通用能力(灾难性遗忘) / 代码模型擅长样板但复杂逻辑仍要人审;
  10. 数据是天花板:垃圾进,垃圾出。宁可少而精,让领域专家审;
  11. 格式三要求,最容易漏的是第三条:该出多种格式的任务,每种都要给够例子;
  12. 留 10–20% 当验证集,盯它的损失——一旦开始回升就该停训; 而验证集里的例子绝不能同时在训练集里。

12. 原文地图

主题原书章原文位置
三句抱怨Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:11(搜「medical terminology」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:13(搜「internal jargon」)
微调的定义与「更新权重」Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:32(搜「further training a pre-trained」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:50(搜「update the model’s weights」)
几百个例子就够Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:52(搜「few hundred examples」)
三条路的对照表Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:65(搜「Weight」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:74(搜「Knowledge」)
微调不能引用来源Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:131(搜「cannot cite specific documents」)
混合用法:理财顾问机器人Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:127(搜「financial advisor bot」)
第 ① 问的测法Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:92(搜「run 10 real examples」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:96(搜「valued friend」)
第 ② 问:蓝衬衫Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:105(搜「locks」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:108(搜「50 blue shirts」)
第 ③ 问:Bluebook 引注Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:118(搜「Bluebook」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:120(搜「500」)
医疗案例与它的警告Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:142(搜「91% accuracy」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:151(搜「doesn't guarantee real」)
金融案例与灾难性遗忘Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:158(搜「financial terminology is so distinct」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:163(搜「50,000 financial news headlines」)
代码案例的警告Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:171(搜「pattern-matching and boilerplate」)
垃圾进垃圾出Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:207(搜「only as good as the data」)
少而精、专家审、偏见会被放大Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:235(搜「Quality over quantity」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:241(搜「Bias in data」)
数据格式与三条要求Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:275(搜「eviction notice」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:293(搜「should be consistent」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:301(搜「different styles/formats」)
验证集、过拟合、损失回升Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:310(搜「memorizes the training data」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:312(搜「10-20% of the data for validation」) · text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:318(搜「validation loss starts」)
数据泄漏Chapter 5: Fine-Tuning LLMstext/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:320(搜「data leakage」)

Footnotes

  1. 出处:「Chapter 5: Fine-Tuning LLMs」第 11 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:11,搜「medical terminology」)、第 13 段(同文件 :13,搜「internal jargon」)与第 15 段(同文件 :15,搜「legal documents」)。

  2. 出处:「Chapter 5: Fine-Tuning LLMs」第 32 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:32,搜「further training a pre-trained」)与第 50 段(同文件 :50,搜「update the model’s weights」)。原文用的词是 weights(权重)——这就是我们从第 01 章起一直说的「模型内部那些数」,第 11 章会正式用这个名字。

  3. 出处:「Chapter 5: Fine-Tuning LLMs」第 52 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:52,搜「few hundred examples」)。「相差十个数量级」那句参照是我们加的,书只给了「几百个例子」这一个数。

  4. 出处:「Chapter 5: Fine-Tuning LLMs」第 65 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:65,搜「Weight」)起的表 5.1。

  5. 出处:「Chapter 5: Fine-Tuning LLMs」第 131 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:131,搜「cannot cite specific documents」)。

  6. 出处:「Chapter 5: Fine-Tuning LLMs」第 127 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:127,搜「financial advisor bot」)。

  7. 出处:「Chapter 5: Fine-Tuning LLMs」第 92 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:92,搜「run 10 real examples」)。那句系统提示词的原文在第 96 段(同文件 :96,搜「valued friend」)。

  8. 出处:「Chapter 5: Fine-Tuning LLMs」第 105 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:105,搜「locks」)与第 108 段(同文件 :108,搜「50 blue shirts」)。

  9. 出处:「Chapter 5: Fine-Tuning LLMs」第 118 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:118,搜「Bluebook」)与第 120 段(同文件 :120,搜「500」)。补充(不在书里,来自通用知识):Bluebook 是美国法律界通用的一套引注格式规范,规定判例、法条该怎么写。

  10. 出处:「Chapter 5: Fine-Tuning LLMs」第 142 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:142,搜「91% accuracy」)与第 151 段(同文件 :151,搜「doesn't guarantee real」)。书没有给出「医生的平均分」是多少,所以这个 91% 缺一个参照物,引用时要注意。

  11. 出处:「Chapter 5: Fine-Tuning LLMs」第 156 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:156,搜「50B parameter」)、第 158 段(同文件 :158,搜「financial terminology is so distinct」)与第 163 段(同文件 :163,搜「50,000 financial news headlines」)。

  12. 出处:「Chapter 5: Fine-Tuning LLMs」第 167 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:167,搜「fine-tuning GPT on source code」)与第 171 段(同文件 :171,搜「pattern-matching and boilerplate」)。

  13. 出处:「Chapter 5: Fine-Tuning LLMs」第 207 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:207,搜「only as good as the data」)。原文引的是机器学习里那句老话「垃圾进,垃圾出」。

  14. 出处:「Chapter 5: Fine-Tuning LLMs」第 235 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:235,搜「Quality over quantity」)与第 241 段(同文件 :241,搜「Bias in data」)。

  15. 出处:「Chapter 5: Fine-Tuning LLMs」第 275 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:275,搜「eviction notice」)、第 286 段(同文件 :286,搜「token limits」)、第 293 段(同文件 :293,搜「should be consistent」)与第 301 段(同文件 :301,搜「different styles/formats」)。上面那段样例的英文原文是关于加州驱逐程序的,我们译成了中文,结构一字未改。

  16. 出处:「Chapter 5: Fine-Tuning LLMs」第 310 段(text/08-ch05-chapter-5-fine-tuning-llms-for-improved-performa.txt:310,搜「memorizes the training data」)、第 312 段(同文件 :312,搜「10-20% of the data for validation」)与第 318 段(同文件 :318,搜「validation loss starts」)。「损失」和「一轮」这两个词的定义也在书里同一段(同文件 :315,搜「a numerical score」;:317,搜「one complete pass」)。