跳到主要内容

改参数到底改了什么 — 「别走远」这条暗线从这里开始

这一章讲三件事: 改参数这件事在几何上是什么样子; 为什么「一步迈多大」这个旋钮能决定成败; 以及为什么模型学会新东西的同时会把旧东西忘掉——而且规模越大忘得越狠。

它在全书链条里的位置: 第 03 章把你逼到了「只能改参数」。 这一章是动手前的最后一站:先看清你要走进的是一片什么地形。

全书那条暗线在这一章立起来并被命名:「别走远」。 它后面会换四个名字回来(第 08、12、14、20 章),而原书从没说过它们是同一件事。

1. 先看现象:同一份数据,两个学习率,两种结局

这一章的主走查从这里开始。

这家保险公司整理出了 300 封精修过的历史拒付信—— 每一封都由合规专员改过,条款引对、语气正式、没有医疗建议。 现在拿它们去改模型的参数。

除了「一步迈多大」这个旋钮,其他配置完全一样,跑两次:

跑法 A:学习率 2e-5(也就是 0.00002)
├ 训练结束
├ 拿一份新的理赔记录测:格式对、条款对、语气像那 300 封
└ 顺手问一句「法国的首都是哪」→ 「巴黎」。✅ 一切正常

跑法 B:学习率 2e-4(比 A 大十倍)
├ 训练结束
├ 拿同一份记录测:输出是一堆断句怪异的碎片,像拒付信但读不通
└ 顺手问一句「法国的首都是哪」→ 它开始写一封拒付信。❌ 模型坏了

(学习率的这两个取值是典型量级;两种结局是为演示编的,
但「高十倍就可能崩」这件事是书里明确写的。)

同一批数据、同一个模型、只差一个旋钮,一个成功一个报废。 这一章解释这是为什么,以及那句「问法国首都」到底在测什么。

2. 顶层全景:所有参数摆在一起,是一片地形

要理解上面那两个结局,需要一张图。

作者请我们做一个想象:把每一个参数当成一个方向。 700 亿个参数,就是 700 亿个方向;这个空间里的每一个点, 就对应一整个模型的一套具体取值1

然后,训练目标(比如第 02 章讲的那个「离对的差多远」) 给这个空间里每一个点都配了一个高度。于是整个空间变成了一片地形, 而训练就是在这片地形上往低处走

高 ┃
┃ ╲ ╱
┃ ╲ (出了盆地: ╱
┃ ╲ 连话都说不利索) ╱
┃ ╲ ╱
┃ ╲___________________╱ ← 盆地边缘
┃ ╲ ╱
┃ ╲ ┌───────┐ ╱
低 ┃ ╲__│ 任务 │__╱
┃ 预训练点 ● │ 小坑 │ ← 盆地内部:又宽又平
┃ └───────┘ 怎么挪都还是个会说话的模型
┗━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
参数空间(这里只画了一个方向,真实有几百亿个)

图说:预训练已经把模型放进了那块又宽又平的盆地。
**盆地里的点性能几乎一样,而一旦出了盆地,能力就崩掉**[^2]。
微调要做的,是在盆地内部找到那个「任务小坑」。

作者还加了一层:微调会在大盆地里造出嵌套的小盆地—— 一个为数学微调过的模型,占的是「语言能力盆地」里面的「数学能力小坑」; 走出小坑,数学退化,但一般的语言能力可能还在2

这张图是这一章剩下所有内容的骨架。 下面四节全部挂在它上面。

3. 机制一:学习率就是「一步迈多大」——「别走远」的第一个名字

它解决什么问题

有了地形图,「学习率」这个旋钮的意思立刻变得具体: 它就是每一步往低处迈多大一步。

两头的死法

作者把两头都写清楚了,而且两头是完全不同的死法3:

迈得太大迈得太小
一步跨出盆地一步几乎没动
预训练点所在的那块区域产生的是连贯的语言,步子太大就离开了这块区域更新小到跳不出脚下的小坑、也走不过平坦区
运气不好的话,模型落进一片混乱区域,再也回不来训练跑了很久,模型基本没变
这就是走查里的跑法 B白花钱

所以合适的学习率是:大到能往前走,小到不出好区域3

由此得到这一章最实用的一条数字口径:

微调用的学习率,通常比预训练时低一个数量级或更多3

这个「一个数量级」要有参照物:

  • 走查里 A 用的 2e-5、B 用的 2e-4,差的正是一个数量级;
  • 而它们的结局是「能用」和「报废」的区别。 这个旋钮的容错区间就是这么窄。

给它命名:别走远

这里我们要做一件原书没做的事:给这条约束起个名字。

判断(我们的,不是书里的): 上面这段的实质是一句话—— 改可以,但不许离原来的自己太远。 我们把它命名为**「别走远」**。

它在这本书里至少还会以四个不同的名字回来:

出现在长什么样管住的是什么
第 08 章一项额外的惩罚项,罚模型偏离原来的自己输出的分布
第 12 章只准在一个很小的旁路里改动能动的方向数
第 14 章领域数据和通用数据按比例混着喂数据的构成
第 20 章让模型持续学新东西而不忘旧的那一族做法时间上的累积漂移

原书从没说过这五处是同一件事——它们分散在五章里,各讲各的。 把它们串起来是我们的增值,后面四处各回指一次这一节。

如果错,会错在: 这五种手段的做法确实不同(有的靠调步长、 有的靠加惩罚、有的靠限制形状、有的靠配数据),它们不能互相替代。 把它们并成一条,可能让人以为「用了一个就不必管另一个」。每一处我们都会写清它管的是什么。

4. 机制二:学会新的,就会忘掉旧的

现象:为什么要问「法国的首都是哪」

第 02 章脚注里提过一句玩笑:我们例行去问一个专用模型「法国的首都是哪」, 不是在向哪家公司致敬,而是在监控遗忘。这一节讲这件事。

这是机制,不是意外

作者把它定位成一对根本矛盾:可塑性(学新行为的能力) 和稳定性(保住已有能力)之间的取舍。 这不是语言模型独有的,它出现在任何「必须学新东西又不能忘旧的」神经网络里4

这个矛盾有名字,而且很老:1980 年就被提出来叫稳定性—可塑性两难; 1989 年有人用实验证明了这个效应,并造了一个词描述它—— 网络在学新任务时会突兀地忘掉先前学过的东西5

这条矛盾消不掉,只能管理6

两头都会死

改得太猛改得太保守
学习率高、训得够久,参数就跑得离预训练点足够远学习率太低、停得太早、约束太强
新目标满足得非常漂亮,但原来会的全丢了7参数几乎没离开原地,新行为也没学会
「按某种格式答题」的模型可能忘了怎么用别的格式,甚至丧失基本流畅度作者的评语:保守过头就违背了微调的初衷8

这正是走查里跑法 B 那句「它开始写一封拒付信」的解释: 不是它疯了,是**「回答任何问题」这个更一般的能力被「写拒付信」覆盖掉了**。 作者的措辞很准:预训练学到的知识是被覆盖,而不是被补充7

一条反直觉的结论:规模不是防御

在 10 亿到 70 亿参数这一段,越大的模型遗忘得越严重7

作者的收尾就一句:规模,简言之,不是防御。

这个说法要有参照物才有冲击力:

  • 直觉会说「模型越大,装得下的东西越多,应该越不容易忘」;
  • 实测的方向是反的。 所以「我们换个更大的底座就不怕遗忘了」这个念头, 是错的。

对策:动手前先列一张「必须活下来」的清单

作者给了一个能当天执行的做法,他叫它遗忘审计9:

在任何一次微调开跑之前:
① 列出「这个模型现在做得好、而且训完必须仍然做得好」的任务
② 把它们写进评估套件,和任务指标并排跟踪

走查里的清单(为演示编的,但类型是书里的):
┌─────────────────────────────────┬──────────┬──────────┐
│ 必须活下来的任务 │ 训练前 │ 训练后 │
├─────────────────────────────────┼──────────┼──────────┤
│ 回答常识问题(法国的首都) │ 对 │ 对/错? │
│ 按 JSON 格式输出 │ 对 │ 对/错? │
│ 把一段话摘要成三句 │ 对 │ 对/错? │
│ 用户说中文时用中文回答 │ 对 │ 对/错? │
└─────────────────────────────────┴──────────┴──────────┘

作者举的反面场景很扎心:你正在庆祝领域能力大涨, 却发现你那个会调工具的模型忘了怎么调工具9

注意这一步是零成本的——它不改任何训练配置, 只是把几条老任务加进评估清单。不做它的唯一原因是没想到。

5. 机制三:不必动全部——冻住一部分

它解决什么问题

上一节说遗忘的根源是「参数跑得太远」。那有没有办法从结构上限制它跑?

有。第 02 章讲过层是分工的:早期层管字面搭配,后期层管任务预测。 作者在这一章把这条观察接上了做法10:

  • 微调带来的、和任务相关的改进,大部分发生在靠近输出的那些层;
  • 早期层变得慢,因而保住了通用能力—— 一个为医疗问答微调的模型仍然需要懂基本英语语法。

怎么做:三种冻结策略

策略做什么适合什么
固定冻结一开始就定死哪些层不训(常见:只留最后 2–4 层,或者冻住底部 50%–75%)简单;但不灵活,最优的冻结位置随任务变
逐层解冻先只训最上面那一小块,随训练推进一层层往下放开(常见节奏:每轮放开一组)让模型先调整输出行为,再动内部表示,降低早期更新破坏预训练特征的风险
按情况自动冻训练中盯着各层的变化幅度,已经稳定的层自动冻住,还在学的继续训省去手工调;但需要相当的数学功底11

为什么有效:有实测数字

书里给了两组结果:

只微调 BERT 与 RoBERTa 最后四分之一的层,拿到了全量微调九成的表现; 而 30 亿参数以下的模型,冻住底部一半的层就能追平全量微调, 内存省一半、速度快两到三成10

这几个数要放在一起看才有意义:

  • 九成效果 vs 一半内存——这是全书第一次出现「大部分效果只要一小部分代价」;
  • 这条比例关系正是第 12 章那整章的种子(第 12 章会把它推到极致: 只训千分之一的参数)。

边界在哪:冻过头会掉

作者把取舍写全了12:

冻得多 → 预训练知识保得牢、内存少、训得快、小数据上不容易学过头; 冻过头 → 模型没有余地去适应。只训最后一层,准确率通常会掉 0.5 到 1.7 个百分点。

这是这一节唯一一处「有确切数字的代价」,值得记住: 「只训最后一层」不是免费的,它是拿一到两个百分点换来的。

6. 机制四:选底座——大的学得省,但账要算一辈子

改参数之前还有一个决定:拿哪个模型当底座。

直觉是错的:不是越大越好

作者先承认大模型的优势是真的:

一个 700 亿参数的模型用 1000 条微调样本能达到的效果, 70 亿参数的模型可能要 10000 条13

这个十倍差距在数据贵的时候非常值钱。 但账不止这一笔:

大模型的代价具体是什么
训练时更多显存、更长时间、更贵的硬件
推理时每个词都要更多计算,延迟更高、每次请求更贵
部署时要更大的机器或更复杂的服务架构

关键在于这三笔的时间性质不同:数据成本是一次性的,推理成本是终身的。

作者给了一个很具体的分界:

每次对话 0.10 美元,生意可能做得下去;每次对话 1.00 美元,可能就做不下去了14

这个十倍关系和上面那个十倍关系正好打架—— 用大模型省下的是一次性的标注钱,付出的是永远付下去的推理钱哪边划算,取决于你要跑多少次。

拿走查算一笔(这些数是为演示编的):

这家保险公司一年 12 万封信。
├ 用 700 亿的底座:省下 9000 条标注样本(约省一次性 30 万元)
│ 但每封信推理成本高十倍 → 一年多花的钱远超那 30 万
└ 用 70 亿的底座:多标 9000 条,一次性花 30 万,之后每年省下来
→ 对「一年跑 12 万次」这种量,**小模型 + 更多数据几乎必然划算**。

作者引了一位研究者的看法收口:在当前水平上,主要的边界不是训练数据量、 也不是参数量,而是质量;一个用高质量任务数据调好的 70 亿模型, 常常胜过一个调得不好的 700 亿模型15

一颗最容易踩的雷:许可

这一节和技术无关,但它能让整个项目作废,所以必须讲。

作者的第一句就是警告:「开放权重」不等于「随便怎么用都行」16

具体长什么样
有用户量上限某家的自定义许可允许商用,但对月活超过 7 亿的产品另有限制
有用途限制军事、监控、生成欺骗性内容等类别可能被排除
有手续要求有的要求衍生作品带特定声明,有的要求登记或通知
许可会变2026 年对某个模型成立的条款,下一个版本可能就改了17

作者给的两条口径:

  1. 能力接近时,宽松许可本身就是战略优势——它降低风险、保留未来的选项18;
  2. 把「开放权重」当成「没有限制」是常见错误,而且可能代价高昂; 任何重大的微调投入之前,先做一遍许可审查16

7. 作者的判断与证据

说法是哪一类说明
损失地形里有又宽又平的盆地,平的泛化好有证据引的是一项具体研究,书给了尾注19
预训练模型占据盆地状区域,出去就崩有证据引的是近期对大模型地形的刻画工作19
只训后四分之一层拿到九成效果有证据引的是具体实验,对象是 BERT 与 RoBERTa10
只训最后一层掉 0.5–1.7 个百分点有证据书写的是「某些研究中」12
10 亿到 70 亿参数区间越大越忘有证据,但范围很窄书标明了区间;超出这个区间成不成立,书没说7
微调学习率比预训练低一个数量级经验口径作者的措辞是「通常」「往往」3
700 亿用 1000 条 ≈ 70 亿用 10000 条作者的举例他用的是「可能」(may),这是量级示意,不是实测13
「质量比规模更是边界」他引的别人的观点明确写成引用某位研究者的文章15
三种冻结策略的适用面作者的整理每一种都有出处,但**「哪种更好」是他的判断**

8. 边界与局限

  1. 那张地形图是示意,不是实景。 700 亿个方向的空间没法画, 作者自己也说「想象一个 700 亿维空间有点困难」1图里的「盆地」是个有用的说法,不是可以量出来的东西。
  2. 「越大越忘」只在 10 亿到 70 亿这一段有证据。 书里没说 700 亿会怎样。 不要把它当成普遍规律往上外推。
  3. 冻结策略的实测数据来自较老的模型。 九成那个数字是在 BERT 和 RoBERTa 上得到的, 它们比今天的对话模型小得多、老得多。方向可信,具体比例未必照搬。
  4. 书没有给「怎么选学习率」的操作办法。 它给的是「比预训练低一个数量级」这个起点。 真正的选法要靠第 06 章的曲线诊断。
  5. 减轻遗忘的那几种正规做法,这一章只点了名。 书里提到了几种 (给重要参数加更强约束的、把旧数据混回来的), 我们把它们整体推到第 20 章——因为那里讲「持续学习」时它们才真正被用上。

9. 可带走的

  1. 把所有参数摆在一起,训练就是在一片地形上往低处走; 预训练已经把模型放进了一块又宽又平的盆地——盆地里怎么走都还是个会说话的模型, 出了盆地能力当场崩;
  2. 学习率就是「一步迈多大」。 太大跨出盆地,太小原地不动; 微调的学习率通常比预训练低一个数量级或更多;
  3. 这条约束我们给它起名叫「别走远」,它后面还会换四个名字回来 (第 08、12、14、20 章);
  4. 遗忘是机制不是意外:学新的和保住旧的是一对根本矛盾,消不掉,只能管理;
  5. 反直觉:10 亿到 70 亿参数这一段,越大的模型忘得越厉害。规模不是防御;
  6. 动手前先做遗忘审计——列一张「必须活下来」的任务清单,和任务指标并排跟踪。 这一步零成本,不做的唯一原因是没想到;
  7. 不必动全部参数:只训后四分之一的层能拿到九成效果; 冻住底部一半能省一半内存、快两到三成;
  8. 但冻过头要付账:只训最后一层通常掉 0.5–1.7 个百分点;
  9. 大底座学得省数据,但推理成本是终身的—— 数据钱是一次性的,推理钱每次都付;跑得越多,小模型加更多数据越划算;
  10. 「开放权重」不等于「随便用」。 月活上限、用途限制、手续要求都真实存在, 而且许可条款会变;能力接近时,宽松许可本身就是优势

10. 原文地图

主题原书章原文位置
参数空间与地形What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:9(搜「N-dimensional weight space」) · text/23-fm-what-fine-tuning-changes.txt:11(搜「wide, flat basins」)
预训练占据盆地、出去就崩What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:13(搜「basin-like regions」)
嵌套的任务小坑What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:15(搜「nested capability basins」)
学习率两头的死法What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:21(搜「escape the basin」) · text/23-fm-what-fine-tuning-changes.txt:25(搜「order of magnitude」)
相似任务的模型可以插值What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:41(搜「last-mile task」)
后期层变化快、早期层保通用What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:49(搜「later layers」) · text/23-fm-what-fine-tuning-changes.txt:51(搜「preserve general capabilities」)
只训后四分之一层拿九成What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:55(搜「final quarter of layers」)
三种冻结策略What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:61(搜「predetermined set of layers」) · text/23-fm-what-fine-tuning-changes.txt:65(搜「final classification head」的下一段) · text/23-fm-what-fine-tuning-changes.txt:69(搜「AutoFreeze」)
冻过头的代价What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:71(搜「0.5 to 1.7 percent」)
稳定性—可塑性两难What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:77(搜「plasticity」) · text/23-fm-what-fine-tuning-changes.txt:79(搜「catastrophic interference」)
越大越忘、规模不是防御What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:81(搜「Scale, in short, is no defense」)
保守过头也不行What Fine-Tuning Changestext/23-fm-what-fine-tuning-changes.txt:83(搜「defeats the purpose」)
遗忘审计RUNNING A FORGETTING AUDITtext/24-fm-running-a-forgetting-audit.txt:3(搜「forgetting audit checklist」)
大模型的样本效率Choosing Your Base Modeltext/25-fm-choosing-your-base-model.txt:91(搜「1,000 fine-tuning examples」)
推理成本与经济性分界Choosing Your Base Modeltext/25-fm-choosing-your-base-model.txt:93(搜「higher cost per request」) · text/25-fm-choosing-your-base-model.txt:95(搜「$0.10 per conversation」)
质量比规模更是边界Choosing Your Base Modeltext/25-fm-choosing-your-base-model.txt:97(搜「Sara Hooker」)
许可地雷Choosing Your Base Modeltext/25-fm-choosing-your-base-model.txt:115(搜「free to use for any purpose」) · text/25-fm-choosing-your-base-model.txt:117(搜「700 million monthly active users」) · text/25-fm-choosing-your-base-model.txt:123(搜「permissive licensing is a strategic advantage」)

Footnotes

  1. 出处:「What Fine-Tuning Changes」第 9 段(text/23-fm-what-fine-tuning-changes.txt:9,搜「N-dimensional weight space」)。原文:每个参数对应一个维度,N 个参数的模型就有一个 N 维的权重空间;空间里的每个点代表一套具体的权重取值,也就是一个具体的模型。第 11 段(text/23-fm-what-fine-tuning-changes.txt:11,搜「70-billion-dimensional」)承认「想象一个 700 亿维的空间有点困难」,但指出它的几何和二维三维没有本质区别:梯度照样指向下坡 2

  2. 出处:「What Fine-Tuning Changes」第 15 段(text/23-fm-what-fine-tuning-changes.txt:15,搜「nested capability basins」)。原文的例子就是数学:为数学微调的模型占据的是语言能力大区里的一块数学能力区,走出这块区域数学表现退化,而一般语言能力可能仍在。

  3. 出处:「What Fine-Tuning Changes」第 21 段(text/23-fm-what-fine-tuning-changes.txt:21,搜「escape the basin」)、第 23 段(text/23-fm-what-fine-tuning-changes.txt:23,搜「negligible progress」)、第 25 段(text/23-fm-what-fine-tuning-changes.txt:25,搜「order of magnitude」)。最后一段还有一条值得知道的事:即使超参完全相同,不同的随机种子也可能得到差别相当大的结果——因为地形里有多个合格的解,是训练过程决定了落到哪一个。 2 3 4

  4. 出处:「What Fine-Tuning Changes」第 77 段(text/23-fm-what-fine-tuning-changes.txt:77,搜「plasticity」)。原文把这对张力写成 plasticity(学新行为的能力)与 stability(保住已有能力),并说它不是语言模型独有的

  5. 出处:「What Fine-Tuning Changes」第 79 段(text/23-fm-what-fine-tuning-changes.txt:79,搜「catastrophic interference」)。1980 年 Grossberg 提出「稳定性—可塑性两难」,1989 年 McCloskey 与 Cohen 用实验证明了这个效应并造了 catastrophic interference 这个词;今天更常见的叫法是「灾难性遗忘」

  6. 出处:「What Fine-Tuning Changes」第 85 段(text/23-fm-what-fine-tuning-changes.txt:85,搜「cannot be eliminated」)。这一段还点名了几种缓解手段:一种用一个数学量标出「哪些参数对旧任务重要」,然后对它们施加更强的约束;另一种是把旧数据混一部分回来一起训。我们把这几种整体推到第 20 章讲。

  7. 出处:「What Fine-Tuning Changes」第 81 段(text/23-fm-what-fine-tuning-changes.txt:81,搜「Scale, in short, is no defense」)。原文的关键句有三处:遗忘可以很剧烈(按某种格式答题的模型可能忘掉别的格式、甚至丧失基本流畅度);预训练知识是被覆盖而非被补充;以及那条反直觉的实测——在 10 亿到 70 亿参数这个区间里,越大的模型遗忘越严重 2 3 4

  8. 出处:「What Fine-Tuning Changes」第 83 段(text/23-fm-what-fine-tuning-changes.txt:83,搜「defeats the purpose」)。原文:保守过头的结果是一个保住了全部预训练能力、却没学会那个当初促使你微调的新行为的模型。

  9. 出处:「RUNNING A FORGETTING AUDIT」第 3 段(text/24-fm-running-a-forgetting-audit.txt:3,搜「forgetting audit checklist」)。原文那个反面场景是:正在为领域能力的陡升庆祝时,发现你那个会调工具的模型忘了怎么调工具;并说这种情况可以容忍的场合很少,哪怕模型定位非常窄。 2

  10. 出处:「What Fine-Tuning Changes」第 49 段(text/23-fm-what-fine-tuning-changes.txt:49,搜「later layers」)、第 51 段(text/23-fm-what-fine-tuning-changes.txt:51,搜「preserve general capabilities」)、第 55 段(text/23-fm-what-fine-tuning-changes.txt:55,搜「final quarter of layers」)。注意实验对象是 BERT 与 RoBERTa 这两个较早的模型;冻底部一半那条的适用范围书里写的是「30 亿参数以下的模型」。 2 3

  11. 出处:「What Fine-Tuning Changes」第 69 段(text/23-fm-what-fine-tuning-changes.txt:69,搜「AutoFreeze」)。这一族做法盯的是各层的梯度幅度与收敛情况,已经稳定的层自动冻住;作者的评语是它省去了手工调参,但「需要一定的数学功底」。逐层解冻那一种出自同一篇提出「逐层递减学习率」的论文(第 65 段,text/23-fm-what-fine-tuning-changes.txt:65,搜「final classification head」)。

  12. 出处:「What Fine-Tuning Changes」第 71 段(text/23-fm-what-fine-tuning-changes.txt:71,搜「0.5 to 1.7 percent」)。原文把两头都写了:冻得多则保得牢、内存少、训得快、小数据上不容易学过头;冻过头则限制了模型适应的余地。 2

  13. 出处:「Choosing Your Base Model」第 91 段(text/25-fm-choosing-your-base-model.txt:91,搜「1,000 fine-tuning examples」)。注意原文用的是「may」——这是量级示意,不是一个实测出来的换算率。 2

  14. 出处:「Choosing Your Base Model」第 95 段(text/25-fm-choosing-your-base-model.txt:95,搜「$0.10 per conversation」)。同一段还提到另一种硬约束:如果部署目标是终端设备或手机,大模型可能根本放不下。三笔成本的清单在第 93 段(text/25-fm-choosing-your-base-model.txt:93,搜「higher cost per request」)。

  15. 出处:「Choosing Your Base Model」第 97 段(text/25-fm-choosing-your-base-model.txt:97,搜「Sara Hooker」)。作者对这篇文章的评价是「每一个做后训练的人都应当读」。这是他引用别人的观点,不是他自己的实测结论。 2

  16. 出处:「Choosing Your Base Model」第 115 段(text/25-fm-choosing-your-base-model.txt:115,搜「free to use for any purpose」)与第 121 段(text/25-fm-choosing-your-base-model.txt:121,搜「common mistake」)。原文:许可差别极大,违反它会带来法律责任;任何重大的微调投入之前都该先做彻底的许可审查,而且应当由法务过一遍。 2

  17. 出处:「Choosing Your Base Model」第 125 段(text/25-fm-choosing-your-base-model.txt:125,搜「may change in subsequent releases」)。原文:对某个模型的许可在 2026 年成立的事,在后续版本里可能改变;从业者必须核对当前的许可,不要根据以前的版本或者一般的名声去假设任何事。

  18. 出处:「Choosing Your Base Model」第 123 段(text/25-fm-choosing-your-base-model.txt:123,搜「permissive licensing is a strategic advantage」)。原文的对比是:宽松许可的模型可以在任何场景部署、不受限制地修改、当作专有系统的基础;而受限许可的模型可能满足眼前的需要,却堵死未来的方向

  19. 出处:「What Fine-Tuning Changes」第 11 段(text/23-fm-what-fine-tuning-changes.txt:11,搜「wide, flat basins」)与第 13 段(text/23-fm-what-fine-tuning-changes.txt:13,搜「basin-like regions」)。前者引的研究说损失曲面有真实的结构:又宽又平的盆地泛化得好,尖锐的极小点泛化得差;后者说预训练模型占据的正是盆地状区域——里面模型表现几乎一样,外面能力崩塌 2