跳到主要内容

训练站(上)— 数据与微调:上限靠数据,落地靠 LoRA

这一章讲三件事: 为什么原书把数据集排在整条训练路线的第一位; 微调到底在调什么、为什么 LoRA 能把不可能变成可能(一笔算给你看的显存账); 以及 14 个免费 notebook 该怎么选、选通一个之后剩下 13 个还剩多少信息量。 对应原书训练部前三章:数据集、微调资源、微调 notebook。

1. 这一章讲什么

原书训练部导言把这一段称为「从数据准备到模型最佳表现的完整流程」的头三步1。 落到主走查任务上(给公司做文档问答客服),这三步就是:

第一步:把公司文档变成可训练的数据
第二步:挑一个现成模型,在数据上做微调
第三步:拿免费 notebook 把上面两步真的跑通一次

图说:原书这三章的次序不可换——没有第二步的数据,第三步的微调没有意义;
没有第三步的跑通,前两步只是读过的文章。

本章延续上一章的纪律:原书只给「学什么」,机制全部由本拆解补齐。 补得最重的一处是 LoRA 的显存账——这是整条训练路线里「个人能不能上手」的生死判据。

2. 顶层全景:从公司文档到一个能用的模型

公司文档(PDF / 工单记录 / FAQ)
│ ① 整理:抽成「问题—标准答案」对(指令数据集)

几千条指令样本,格式统一:指令 + 输入 + 期望输出
│ ② 微调:在一个训练好的开源模型上,小步调整它的一部分参数

一个「说话方式符合客服场景」的模型
│ ③ 存档:只保存调过的那一小部分参数(适配器),几十 MB

可发布、可回滚、可继续叠新的微调

图说:①②③ 的具体做法都在本节之内;③ 的「只存一小块」是 LoRA 的直接后果,
第 5 节算账。

3. 数据:训练站的第一杠杆

原书为什么把它排第一: 训练一个能听懂人话的聊天模型, 「需要能覆盖多种对话领域与风格的高质量数据」2——模型的上限由数据决定, 方法只是逼近上限。原书开篇还点了一个背景:随着 LLaMA 这类开源(代码公开、谁都能下载改造)底座出现, 训练大模型「不再是资源雄厚公司的专利」,小团队的作品如 Alpaca、Vicuna 也冒了出来3—— 这些作品全是「开源底座 + 好数据」的组合,没有一个是模型架构创新。 这就是杠杆的含义。

数据从哪来:三类来源

原书把数据资源分三节,对应三类活4:

类别干什么原书给的例子
数据枢纽拿现成的公开数据集HuggingFace 数据集库、LLMDataHub 合集
指令数据集造「问题—答案」对用 GPT-3.5 生成新闻分类指令数据5
非结构化(没有统一格式的杂乱文件)处理把它们变成可用文本处理 Excel、Word、PDF、EPUB 等格式6

第三类最容易被低估,但对本走查任务最关键:公司文档全是 PDF 和表格, 把它们变成干净的文本,工作量常常超过微调本身。原书把它编入数据章, 等于承认:数据工程是训练站的入场费。

走查:指令数据集怎么造

拿上一章的任务,第 ① 步的具体形状:

输入:公司退货政策 PDF(30 页)
├─ 切成段落,每段问一遍:「这一段能出什么客户问题?」
├─ 用一个现成大模型(如 GPT-3.5)批量生成问答对
├─ 人工抽检 10%,删掉答案与原文不符的

产出:约 2,000 条 {问题, 答案} 样本
(2,000 这个数是为演示编的量级参照:原书资源里的做法通常在几千到几万条,
不是书里给的数字。)

图说:这正是原书清单里那篇「用 GPT 3.5 造指令数据集微调 Llama 2」[^5]的流程形状——
用大模型造数据,再拿去微调小模型,是这一代的通行做法。

4. 微调:在底座上小步调参

解决什么问题: 现成模型(底座)会说话,但不会用你的口吻、 不知道你的业务规矩。原书的定义:「微调让使用者把预训练的大语言模型 适配到更专门的任务上——在一小份任务数据上调,提升该任务表现, 同时保住它原有的通用语言能力」7

这里必须先修一处术语。 原书说微调的基础是迁移学习(一个任务上学到的东西, 拿去做另一个类似任务的起点)8——这个说法没错。但它同一章还有两处不严谨 (上一章已点过,这里给结论):「某 Google 研究说微调提了 10% 准确率」无出处9; 「参数量已达万亿」是夸大10读这一章的正文引言要自带过滤器,资源清单本身没问题。

怎么做、为什么有效: 微调用的还是预训练那套「猜下一个词」的机器(第 02 章心智模型三), 只是换了数据、调小步子:在你的几千条样本上继续「猜词—对答案—微调参数」。 为什么小数据够用: 底座已经会语言,你只是在把它输出的各种答法占比(行话叫分布)往你的场景拉一拉—— 原书说这是「以极小代价获得可比性能」的前提,也是「降低训练成本」的来源11

5. PEFT 与 LoRA:只训一小块参数 — 本章主走查

解决什么问题: 全量微调意味着底座里每个参数都要动。 原书给的理由是「大模型参数量到万亿级后,全量微调在算力(GPU 机器与时间)上昂贵且常常不可行」10 (数字夸大,但方向成立:千亿级也够个人喝一壶)。原书还顺带交代了两个被淘汰的备选: 继续用提示(每次都要把提示重新处理一遍,且有时效果不够)12。 于是路线聚焦到 PEFT(参数高效微调):「只微调模型参数的一小部分, 以显著更低的算力需求达到接近全量微调的表现」13

PEFT 里最主流的一支是 LoRA。 先把名字修对:LoRA = Low-Rank Adaptation——Low-Rank 直译即低秩——就是拿两块小表格的乘积去顶一块大表格的改动——中文材料叫它低秩适配——原书两处都写错了全称14

这里的小表格,行话叫矩阵——一张大矩阵的改动,可以拆成两块瘦长矩阵的乘积。 那两个小家伙,行话叫适配器(挂在模型上、只训它自己的小部件),训练完可以单独保存—— 原书 notebook 章的描述正是「不调整个模型,只调这些适配器」15。它的想法:

全量微调:7B 个参数全部要动 → 显存爆炸(下面算账)
LoRA: 原参数全部冻住(不更新)
在每个大矩阵旁边挂两个小矩阵,输出 = 原矩阵输出 + 小矩阵乘积
只训练那两个小矩阵 → 显存可用

图说:那两个小矩阵合称「适配器」(adapter);训练完可以单独保存,
原书 notebook 章的描述正是「不调整个模型,只调这些适配器」[^15]。

主走查:一笔显存账

先记一个等价叫法:权重——就是参数,模型里那些可调的数——下面算账用它。

账上还有两笔和权重同量级的开销,得先说清是什么,否则下面几行只是一串数字。 调参的每一步是这样走的:让模型做一道题,看它答得离正确答案差多远, 再倒推出每个参数该往哪边挪、挪多少。这份「往哪挪」的指示,每个参数各配一份, 所以它和参数一样多、一样大——这份指示的名字叫梯度

第二笔比前两笔加起来还贵。调参时并不照着这一步的指示直接挪,那样方向会左右乱抖; 通行做法是同时参考前几步怎么挪的,把方向抹平。于是每个参数还要再存两份前几步的挪法账, 且这两份为了不丢精度用更占地方的格式存。决定每一步到底怎么挪的那个部件叫优化器, 它存的这两份账就叫优化器状态(下面的算式里按行话写作「两份动量」)。

梯度与优化器都不在原书里,是补充的通用知识——原书只给了「一个 Colab 实例跑得动」这句结果, 没说为什么跑不动别的。下面这笔账就是补这个「为什么」。

问题:微调 Llama-2-7B,全量微调 vs LoRA,各要多少显存? (7B = 70 亿参数;以下全部按通用公式估算,为演示而算,不是书里的数字;书里给的硬事实只有「单个 Colab 实例可跑」16和「4-bit 量化」17。)

── 全量微调(常规混合精度)──
权重(16-bit 存) 7B × 2 字节 ≈ 14 GB
梯度(同权重) 7B × 2 字节 ≈ 14 GB
优化器状态(两份动量) 7B × 8 字节 ≈ 56 GB
合计 ≈ 84 GB 起步
→ 一张 24 GB 消费卡装不下;云上要多卡并行,成本跳档。

── LoRA(r = 16,只挂注意力矩阵)──
底座权重 冻住,不动,不存梯度 14 GB(只读)
每个矩阵的适配器 4096×16×2 ≈ 13 万参数
全模型适配器合计 约 1,700 万参数 ≈ 底座的 0.24%
需要梯度和优化器状态的 只有这 1,700 万 ≈ 0.2 GB
合计 ≈ 14 GB + 一点零头,一张 24 GB 卡装得下
(矩阵维度 4096、层数等结构数为通用知识的典型值,用于演示口径。)

── QLoRA(书里 notebook 的做法)──
再把冻住的底座压成 4-bit:7B × 0.5 字节 ≈ 3.5 GB
合计 ≈ 4 GB 上下 → 免费 Colab 的 16 GB 卡绰绰有余

这一笔账解释了三件原书只描述、没解释的事: 为什么 14 个 notebook 几乎全用 LoRA 系列18; 为什么 QLoRA 那两篇被原书排在微调资源清单的前排19; 为什么训练产物「可以在 Hugging Face Hub 上分享适配器」——几十 MB 的适配器 当然好分享,14 GB 的全量模型则未必20

6. 指令微调:让它学会「听指令」

数据章与微调章之间有一个接缝:第 3 节造的数据是「问题—答案」对, 第 4 节的微调方法怎么吃这种数据?答案是指令微调——原书定义: 「用成对的输入—输出指令训练模型,让它学会照指令办事」21

它和普通微调的差别只在数据形状:普通微调喂「一段文字续一段文字」, 指令微调喂「人问什么 + 模型该答什么」。底座模型学的是「续写」, 指令微调把它掰成「应答」——这正是第 01 章走查任务里 「问答机器人」和「自动补全」的差别所在。

7. 十四个 notebook:同一条流水线的 14 个变体

原书第 3 章是全书最长的实操章,14 个 Colab notebook,每个配一段摘要22逐个读是目录化陷阱。 把 14 个摆开看,它们共享同一条流水线, 不同的只有三处可换:

装环境 → 加载数据(过分词器)→ 挂 LoRA/QLoRA → 训练 → 存适配器 → 试着推理
│ │ │
变量一:哪个数据集 变量二:底座多大 变量三:压到几位
(samsum 对话摘要[^23]、 (560M 到 30B 不等) (16-bit / 8-bit / 4-bit)
Guanaco 指令集等)
可换的三样原书给的取值选法
底座大小Bloom-560m / Llama-2-7B / Falcon-7B / MPT-30B / GPT-Neo-X-20B先小后大,560m 走通再上 7B
精度8-bit(int-8)与 4-bit 都有现成 notebook免费卡选 4-bit
特殊目的GPT-3.5 走 API(程序对程序的调用入口)微调——不碰权重(模型本体的参数一个不动)23;Mistral 用 AutoTrain 一键24想省事时的旁路

还有一个 notebook 值得单挑出来:第 11 号先训一个奖励模型(模拟人类打分的模型)25

再用 PPO(一种强化学习方法——拿奖励当信号、试错着调参)接着训—— 它是训练部第 6 章 RLHF 的实操预演,读到 04 章 RLHF 三步流水线时回头再看它,顺序就接上了。

8. 作者的判断与证据

  1. 「数据决定上限」(书内证据较足):开篇点名 Alpaca/Vicuna 靠开源数据集与底座成名3; 指令数据一章开头就是「需要覆盖多领域多风格的高质量数据」2
  2. 「PEFT 是 prompting 的替代范式」(书内陈述,机制由我们补):原书列了 in-context learning 的两条低效(每次重算提示、有时表现不佳)再引出 PEFT12, 排除法成立。
  3. 「 notebook 数量即诚意」(我们的读法):14 个 notebook 里至少 6 个流程高度重复, 信息量集中在三处可换件(第 7 节的表)。数量是博客时代的剩余物——它们本来就是 分期发布的博客合集。

判断(我们的,不是书里的): 训练站前半段真正的分水岭不是「会不会微调」, 而是「会不会算显存账」。原书资源清单默认你有这张账,但从不教你算—— 而一笔账就能判断:该选哪个底座、哪一档精度、要不要上 QLoRA。 如果错,会错在: 如果训练框架的内存管理再前进一步(更激进的分页——内存装不下就把数据挪到硬盘、要用再搬回——或卸载), 全量微调的门槛降到消费卡,LoRA 的「必要性」会减弱—— 但「只存适配器」的工程便利(小、可叠加、可分享)仍然独立成立。

9. 边界与局限

  1. 不覆盖从零预训练。 全部内容假设你拿现成底座,预训练只在 notebook 摘要里 以「2 万亿 token」的形式出现26,如何预训练不在本路线内。
  2. 评测缺席在下一章。 微调完「怎么知道变好了」,原书排在第 4 章才讲—— 本走查任务里你应当先备好评测集再动微调,原书次序反着来(见 04 章的修正)。
  3. 量化只有 4-bit 的用法,没有原理。 为什么压到 4-bit 掉点不大,原书没讲,04 章补。
  4. 时代限定。 清单里 14 个 notebook 的底座(Falcon、MPT、GPT-Neo-X)在 2026 年 多已淡出主流,方法论(三处可换件)不变,具体 notebook 建议只当格式参考。

10. 可带走的

  1. 数据是训练站的第一杠杆:同一底座,上限由数据决定;数据工程(非结构化处理)是入场费;
  2. 造指令数据集的通行做法:拿大模型对着文档逐段生成问答对,人工抽检一成;
  3. 微调 = 在底座上小步调参,保通用、专任务;它的机器和预训练是同一台(猜词循环);
  4. 全量微调的显存账 ≈ 权重 14GB + 梯度(每个参数该往哪挪的指示)14GB + 优化器状态(前几步挪法的账)56GB,个人不可行(估算口径);
  5. LoRA 冻住底座、只训两个小矩阵,把可训练量压到底座的约 0.24%(演示口径), 产物是几十 MB 的适配器;
  6. QLoRA = 4-bit 底座 + LoRA,免费 Colab 就能微调 7B;
  7. 14 个 notebook 是一条流水线的 14 个变体,变量只有数据集、底座大小、精度;
  8. 指令微调改的是数据形状:从「续写」到「应答」。

11. 原文地图

主题原书章原文位置
开源底座与小团队作品1. Best Resources on Building Datasets to Trian LLMstext/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:4(搜「no longer the」) · text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:8(搜「notable works including Alpaca」)
数据集定义与三类资源1. Best Resources on Building Datasets to Trian LLMstext/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:19(搜「extensive sets of text」) · text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:31(搜「HuggingFace」) · text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:52(搜「unstructured data」)
指令数据集与 GPT-3.5 造数据1. Best Resources on Building Datasets to Trian LLMstext/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:36(搜「follow human instruction effectively」) · text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:43(搜「GPT 3.5 to fine-tune Llama 2」)
微调定义与「保通用」2. Mastering LLM Fine-Tuning: Top Learning Resourcestext/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:9(搜「adapt pre-trained LLMs」) · text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:11(搜「preserving its general language knowledge」)
迁移学习2. Mastering LLM Fine-Tuning: Top Learning Resourcestext/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:48(搜「Transfer learning plays a crucial role」) · text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:50(搜「distinct but similar task」)
in-context 的低效与 PEFT 定义2. Mastering LLM Fine-Tuning: Top Learning Resourcestext/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:58(搜「in-context learning」) · text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:64(搜「only a small subset」) · text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:65(搜「comparable performance to full fine-tuning」)
LoRA 资源与 QLoRA2. Mastering LLM Fine-Tuning: Top Learning Resourcestext/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:76(搜「QLoRA paper explained」) · text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:77(搜「Single GPU」)
指令微调定义2. Mastering LLM Fine-Tuning: Top Learning Resourcestext/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:85(搜「pairs of input-output instructions」)
LoRA 只调适配器、显存大减3. 14 Free Large Language Models Fine-Tuning Notebookstext/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:40(搜「only a fraction」) · text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:99(搜「fine-tune these adapters」)
samsum 数据集与 int-83. 14 Free Large Language Models Fine-Tuning Notebookstext/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:33(搜「samsum dataset」) · text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:37(搜「bnb int-8」)
单 Colab 与 4-bit3. 14 Free Large Language Models Fine-Tuning Notebookstext/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:124(搜「language model on a single Colab」) · text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:128(搜「4-bit quantization」)
RLHF 预演 notebook3. 14 Free Large Language Models Fine-Tuning Notebookstext/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:182(搜「Proximal Policy Optimization」)
API 微调与一键微调3. 14 Free Large Language Models Fine-Tuning Notebookstext/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:205(搜「GPT-3.5-turbo」) · text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:217(搜「AutoTrain」)

Footnotes

  1. 出处:「Part I: LLM Basics & Architecture」第 39 段(text/05-fm-part-i-llm-basics-architecture.txt:39,搜「complete process of training and fine-tuning」)。训练部导言的原话是「从数据准备到确保模型最佳表现的完整流程」,前三章(数据、微调、notebook)即本讲覆盖的范围。

  2. 出处:「1. Best Resources on Building Datasets to Trian LLMs」第 36 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:36,搜「follow human instruction effectively」)。原文:「Training a chatbot LLM that can follow human instruction effectively requires access to high-quality datasets that cover a range of conversation domains and styles」。 2

  3. 出处:「1. Best Resources on Building Datasets to Trian LLMs」第 4 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:4,搜「no longer the」)与第 8 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:8,搜「notable works including Alpaca」)。原文说开源底座出现后,「训练 LLM 不再是资源雄厚公司的专属领域」,并点名 Alpaca、Vicuna、Luotuo 三个社区作品。 2

  4. 出处:「1. Best Resources on Building Datasets to Trian LLMs」第 17、34、49 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:17,搜「Dataset Hubs」;:34 搜「Building an Instruction Dataset」;:49 搜「Datasets Preparing & Processing」)。三节即三类资源。

  5. 出处:「1. Best Resources on Building Datasets to Trian LLMs」第 43 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:43,搜「GPT 3.5 to fine-tune Llama 2」)。清单条目原文:「How I created an instruction dataset using GPT 3.5 to fine-tune Llama 2 for news classification」。

  6. 出处:「1. Best Resources on Building Datasets to Trian LLMs」第 55 段(text/06-ch01-1-best-resources-on-building-datasets-to-trian-l.txt:55,搜「Excel, Word, PowerPoint, PDF, and EPUB」)。原文列举了要把 RAG 管线扩展到的文件格式。

  7. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 9 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:9,搜「adapt pre-trained LLMs」)与第 11 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:11,搜「preserving its general language knowledge」)。

  8. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 48 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:48,搜「Transfer learning plays a crucial role」)。原文把迁移学习定义为「一个任务上训练的模型,作为另一个不同但相似任务的起点」(第 50 段)。

  9. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 32 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:32,搜「improved its accuracy by 10 percent」)。全书未给出该研究出处。

  10. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 54 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:54,搜「reaching trillions」)。补充(不在书里,来自通用知识):公开的主流模型在百亿到千亿参数级;「万亿」无公开对应物,应视为夸大。 2

  11. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 65 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:65,搜「comparable performance to full fine-tuning」)。原文:PEFT「以显著更低的计算需求达到与全量微调相当的性能」;「降低训练成本」见同章引言第 15 段(搜「reduce training costs」)。

  12. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 58–61 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:58,搜「in-context learning」)。原文列的两条低效:「每次预测都要重新处理提示」与「有时表现不佳」(第 60 段,搜「processing the prompt each time」)。 2

  13. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 64 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:64,搜「only a small subset」)。

  14. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 24 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:24,搜「Layer-wise Recall-oriented Attention」)与第 82 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:82,搜「Localized Randomization」)。两处展开均为误;正确全称 Low-Rank Adaptation。补充(不在书里,依据我们的 frontier 书架):LoRA 的矩阵分解机制与「为什么低秩够用」的数学。依据: shelf=ai-frontier-reference/peft#01-lora-math.md 事实=LoRA 把权重更新写成两个低秩矩阵的乘积,只训练这两个小矩阵。

  15. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 99 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:99,搜「fine-tune these adapters」)。原文:「instead of fine-tuning the entire model you just have to fine-tune these adapters and load them properly inside the model」。

  16. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 124 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:124,搜「language model on a single Colab」)。

  17. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 128 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:128,搜「4-bit quantization」)。原文:该 notebook 用 bitsandbytes 做 4-bit 量化。

  18. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 40 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:40,搜「only a fraction」)。首个 notebook 的描述即「LoRA 配置使模型只训练一小部分参数,显著降低内存」。

  19. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 76–78 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:76,搜「QLoRA paper explained」)。清单六条 PEFT 资源中,QLoRA 相关占两条。

  20. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 100 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:100,搜「share your adapters」)。原文:「After fine-tuning the model you can also share your adapters on the Hub and load them very easily」。适配器大小量级(几十 MB)为按第 5 节公式的估算,不在书里。

  21. 出处:「2. Mastering LLM Fine-Tuning: Top Learning Resources」第 85 段(text/07-ch02-2-mastering-llm-fine-tuning-top-learning-resourc.txt:85,搜「pairs of input-output instructions」)。

  22. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 1–19 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:4,搜「14 free Colab notebooks」)。章引言自述「每个 notebook 探索微调过程的独特侧面」。

  23. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 205 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:205,搜「GPT-3.5-turbo」)。该 notebook 走 OpenAI API 微调:上传数据、创建微调任务,不接触权重本体。

  24. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 217 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:217,搜「AutoTrain」)。原文:用 HuggingFace 的 AutoTrain 包「以最省事的方式」微调 Mistral 7B。

  25. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 182 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:182,搜「Proximal Policy Optimization」)。该 notebook 先用 Reward Trainer 训练,再引入 PPO 训练器做强化学习步骤。

  26. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 56 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:56,搜「pre-trained on an extensive dataset」)。