跳到主要内容

什么时候才轮到动模型本身 — 改之前的四条便宜路

这一章讲三件事: 在动模型参数之前,还有哪四条更便宜的路可以走; 每一条各自卡在哪儿;以及什么样的要求会真的把你逼到「只能改参数」。

它在全书链条里的位置: 第 01 章说了「这件事只能你自己干」, 但「自己干」不等于「立刻动手改模型」。这一章是全书唯一一章在劝你先别动手。 从第 04 章起,书才假定你已经被逼到了非改不可。

1. 先看现象:提示词写得越来越长,毛病却没少

回到那份 P-4471 记录。

一个团队接到「写拒付说明信」这个活,通常会这么走:先把要求写成一段话交给模型—— 这段话行话叫提示词。 第一版很短:

第 1 版提示词:「请根据以下理赔记录,写一封拒付说明信。」
→ 结果:能写,但格式每次不一样。

第 2 版:加上「必须包含保单条款编号」「不得给出医疗建议」「语气正式」。
→ 结果:好一些,但偶尔还是会安慰被保人两句。

第 3 版:塞进三封写得好的范例信。
→ 结果:它开始每封都以「感谢您的来信」开头——连续三封范例都这么起头。

第 4 版:再加十二条禁令、五个反例、两页公司文风指南。
→ 提示词现在有 3000 个 token 长,每次调用都要重发一遍。
结果:同一份记录问两遍,第 7 条第 3 款有时写成第 7 条第 2 款。

这是几乎每个团队都会走一遍的路。 作者对这条路的评价是双面的: 提示词工程已经相当精深——让它把中间步骤写出来再作答、在提示里附上几个示范、 给它设定一个角色、要求它按固定格式输出——这些都是真实提升效果的技术, 是实打实的智力成果1

但它有三条无论多聪明的写法都翻不过去的硬限制。 这一章从它们开始。

2. 顶层全景:四级台阶,越往上越贵

一个具体的毛病

┌──┴──────────────────────────────────────────────────┐
│ 第 1 级 把要求写清楚交给它(提示词) 最便宜
│ 改的是:每次喂进去的那段文字 改完立刻生效
│ 卡在:装不下 / 说不全 / 不稳定
├─────────────────────────────────────────────────────┤
│ 第 2 级 外挂一个能查资料的库(检索增强)
│ 改的是:它手上有哪些资料
│ 卡在:只改「知道什么」,不改「怎么表现」
├─────────────────────────────────────────────────────┤
│ 第 3 级 专门训它「怎么用查来的资料」
│ 改的是:参数(但只教一件很窄的事)
├─────────────────────────────────────────────────────┤
│ 第 4 级 在它算一句话的中途,给中间数值加一个方向
│ 改的是:这一次计算的中间结果,参数一个没动
│ 卡在:只能放大它已经有的行为,教不了新的
├─────────────────────────────────────────────────────┤
│ ★ 改参数(微调) 最贵
│ 要数据、要训练设备、要模型管理、要长期维护 第 04 章起
└─────────────────────────────────────────────────────┘

图说:作者的口径写死在一句话上——**「找到能达成目标的最小干预」**。
提示词达得到就用提示词,检索达得到就用检索[^2]。

这一章的主走查: 那份 P-4471 记录,在这四级台阶上各走一遍, 看它在哪一级掉下来、为什么掉下来。

3. 第 1 级:提示词的三条硬限制

作者把提示词的限制归成三类:装不下、说不全、不稳定2

限制一:装不下

模型每次只能看见一段有限长度的文字,这段文字有个上限, 行话叫上下文窗口。哪怕这个上限已经从几千涨到几十万,它仍然是有限的

作者举的例子很硬:一套医疗系统不可能把每一条相关的临床指南都塞进每一次提问; 一个法律助手不可能把整个判例库嵌进上下文2

走查里的样子: 这家保险公司的保单条款、拒付代码表、文风指南加起来 有几百页。它们塞不进那段文字。

限制二:说不全

举几个例子确实能教会简单的格式,但复杂的行为举不完。

作者列了一串要同时满足的要求:永远不生成某几类内容、 永远按特定格式引用来源、对不同类型的用户换不同语气、 碰到含糊的请求要先反问澄清——这些情况的组合会爆炸,例子举不完3

而且例子会误导。 书里专门用一个警告框讲这件事:

给模型看三封都以「感谢您的来信」开头的范例,它可能学到所有回答都该这么开头, 哪怕在不合适的场合;给它看某种格式的例子,它可能死盯格式而不是背后的逻辑。 模型分不清例子里哪些特征是本质的、哪些只是碰巧4

这里有一条结果非常反直觉的研究,值得单独拎出来:

把少样本示例里的标签随机打乱,效果几乎不掉。 也就是说,模型从这些例子里学到的不是「这个输入对应这个答案」, 而是任务的格式、标签的取值范围、以及输入大概长什么样4

这对我们的走查是一记警钟: 你以为那三封范例信教会了它「什么时候该引第 7 条」, 实际上它学到的可能只是「拒付信长这样」。

限制三:不稳定

这一条最要命,因为它是最后暴露的。

很多人以为把那个抽签旋钮(第 02 章讲的 temperature)调到最低、 让它永远挑概率最高的词,输出就固定了。作者说这只是最好情况,而且远远没有保证5

原因出在显卡的算术上:

有研究显示,在同一份提示词、同样「永远挑最高」的设置下, 仅仅因为显卡数量、型号和批次大小不同,准确率就能差出 9 个百分点, 回答长度能差出 9000 个 token6

为什么会这样,作者给了根因: 计算机里的小数加法不满足结合律—— 先算 a+b 再加 c,和先算 b+c 再加 a,结果可能有极小的差别; 而不同的并行方式会改变求和的顺序6

这个 9 个百分点要有参照物:

  • 一次正经的模型升级,准确率提升通常就是几个百分点;
  • 也就是说,换一批显卡带来的波动,能盖过一整轮优化的成果

还有一条更根本的:提示词是在推理时起作用的,模型参数一个都没动。 所以它没有任何机制记住「昨天这类问题我是怎么处理的」7

作者的定性(直接引): 这些不是「等着更好的提示词来解决」的工程问题, 而是只在推理时做文章这条路本身固有的结构性约束7

走查在这一级掉下来了: 第 4 版提示词已经 3000 个 token, 条款编号仍然会漂。换任何写法都救不回来,因为漂的原因不在写法上。

但「掉下来了」这句话得有个门槛,而门槛由用途定

书在这里纠正了一个提问方式8:

★ 从业者必须老实回答的问题,不是「提示词能不能管用」 ——对很多应用它显然能管用—— 而是:它能不能可靠到够用、在要求的质量水平上、以可接受的延迟和成本。 书接着补了一句:可靠性往往就是那个限制因素。

书给的对照只有一句,但它能直接拿去做决定8:

★ 一个 95% 的时候都管用的提示词:
给内部工具用 → 够了
给面向客户的应用用 → 不够
★ 因为那 5% 的失败率会变成工单,和声誉损害。

而质量要求本身的差别有多大,书也给了两头8:

这类应用能容忍什么
创意写作助手偶尔跑偏,能忍
临床决策支持一次都不能忍——任何一个可能危及病人的回答都不行

★ 走查落到这条线上,答案是明确的: 那封拒付信是寄给被保人的, 不是给内部同事看的草稿。所以 95% 不够。 被拒付的人本来就准备好要申诉,一封引错条款的信不只是一张工单, 还是一份对方律师手里的材料。

这条判据要记住,因为它在后面还会以别的形式回来: 第 10 章会说「合格线必须由用途定,不能由基准分数定」; 第 06 章会说「74% 够不够用不是技术问题」。它们说的都是这一条。

4. 第 2 级:外挂一个能查资料的库

它是什么

模型训练完之后,它脑子里的知识就冻在那一刻了。 但很多问题的答案在你自己的文档里,而那些文档它从没见过。

做法很朴素:提问的时候,先去你的文档库里搜出相关的几段, 连同问题一起塞进那段文字里,再交给模型。

作者对这条路的评价是「优雅」:如果模型需要它没被训练过的信息, 就在推理时把这些信息取回来、放进上下文9。 它训练时学到的那部分知识叫「参数里的知识」, 取回来的这部分叫「参数之外的知识」,两者互补。

这条路的名字必须留住:它叫 RAG(检索增强生成)。 你在任何一份企业 AI 方案里都会撞见这三个字母。

它什么时候是对的答案

作者给的适用面很清楚,是两种情况10:

情况意思走查里的例子
知识会变法规更新、市场行情、时事、内部政策保单条款今年改过一版
知识太细细到通用训练里根本学不到CT-06 这个拒付代码是这家公司自己定的

这一节真正的收获:一句能当场用的判据

这是全书被引用次数最多的一条判据,第 14 章还会回来用它。

问自己一句:模型是需要「知道不一样的东西」,还是需要「表现得不一样」?

  • 知识问题 → 外挂检索。 例:「它应该知道我们的产品规格。」
  • 行为问题 → 改参数。 例:「它应该回答得热情而简洁。」
  • 两样都要 → 两样都上。 例:「准确而热情地推荐产品」—— 准确靠检索,热情靠改参数(或者靠好的提示词)11

说白了:检索改的是它手上有什么资料,微调改的是它拿资料干什么。

走查在这一级的表现: 挂上检索之后,那句「保单第 7 条第 3 款」 终于每次都对了——因为条款原文就摆在上下文里,它是抄的,不是背的。

但语气仍然不稳,合规那句医疗建议还是会冒出来。 这完全符合上面那条判据:检索没有改变它的行为,一点都没有。

5. 第 3 级:专门训它「怎么用查来的资料」

上一节末尾那个局面——知识有了、行为没变——正是这一级要处理的。

而且检索本身有个脏问题:搜出来的几段里,总有几段是不相关的。 搜索系统不可能次次精准,这些混进来的干扰段落会把模型带偏

做法是:专门训一遍,教它三件事12:

  1. 有检索文档时该怎么答;
  2. 怎么无视那些不相关的干扰文档;
  3. 怎么从相关文档里逐字引用,让答案落在证据上,而不是落在它自己的记忆上。

这条路的名字叫 RAFT。 书里给的结果是:这么训出来的模型, 比纯检索和纯微调都好12

注意这一级已经在改参数了。 它之所以排在「微调」之前, 是因为它教的是一件很窄、很确定的事(怎么用文档), 不是「学会我们公司的写作风格」这种开放要求。 窄,意味着数据好造、风险好控。

6. 第 4 级:在它算一句话的中途,给中间数值加一个方向

这一级最反直觉,也最容易被误解,所以单开一节。

现象:能不能不训练就把语气拧一下

第 02 章讲过,模型算一句话时,每一层都会产生一串中间数值。 那些数看起来是一堆乱码,没有可读的含义。

但有一类研究发现:这堆数里藏着可以被辨认出来的「方向」—— 有的方向对应「正式语气」,有的对应「用代码回答」, 有的对应「拒绝回答」,有的对应某种情绪13

怎么做的

一旦某个方向被找出来,做法简单得离谱:

想让它更正式 → 找到「正式」那个方向,在推理时把这个方向按一定强度加进中间数值里
想让它更简短 → 找到「啰嗦」那个方向,减掉它

代价:不需要算梯度、不需要训练、立刻生效。
作者的话:本来要几千条训练样本加几小时算力的事,变成了推理时的一次加减[^14]。

这条路的名字叫激活引导(英文文档里写作 steering)。

它的位置很特别: 作者说它比微调快、比提示词有力,但比两者都窄—— 提示词靠改输入来调行为,但没法可靠地压住不想要的倾向; 微调什么都能教,但要数据要算力;激活引导夹在中间14

但它有一条铁律:它只能调制,不能教

这是本章最重要的一句话,也是全书那条暗线第一次出现。

作者给了一个可以当场执行的判据,他管它叫「引导测试」:

问:这个能力,底座模型本来就有吗——哪怕它不总是表现出来?

  • → 引导能把它放大或压住;
  • 没有引导帮不上忙,因为根本没有方向可以指过去15

他把话说得更死:

引导教不了东西。 它操纵的是模型已经知道的东西。 一个没有医学知识的模型,引导不出医学能力; 一个从没见过你专有数据格式的模型,引导不出那种格式16

判断(我们的,不是书里的): 这条限制不是激活引导独有的, 它是一条更普遍的规律在这里第一次露头—— 模型没有的能力,你没法从它自己身上榨出来。 同一条规律后面还会以两个更硬的形式回来:第 16 章的「组合性墙」 (会做三步的题,五步的题就是不会,加多少数据都没用), 和第 17 章的「模型无法为它不具备的能力生成训练信号」。 原书从没把这三处并起来说过,这是我们加的。 如果错,会错在: 三处的机制并不相同——这里是「没有方向可指」, 第 16 章是「学到的是三步模板不是推理」,第 17 章是「生成不出比自己好的样本」。 把它们并成一条,可能让人以为存在某个统一的定理。没有,这是一条经验上的家族相似。

一句必须说的安全话

作者专门警告:激活引导和一种叫「消融」的攻击手段同源—— 后者正是通过操纵同一串中间数值来拆掉模型的安全机制的。 能做正当定制的能力,同样能被滥用17

而且他给了这条路一个很克制的定位:在写作时, 它首先仍是研究与诊断工具,其次才是运维工具18

7. 那么什么会真的把你逼到必须改参数

四级台阶走完了。现在回答这一章的正题。

作者给出三类要求,他把它们和现成模型之间的距离叫生产要求缺口19:

要求意思为什么提示词顶不住
口径一致同类输入,输出要能重复措辞一变结果就变,抽签本身还带随机(§3 限制三)
过得了合规规矩是这家公司自己的,而且会变提示词里的护栏对措辞和采样设置敏感,不能当唯一控制手段
领域上真的准确流利但错误的陈述是系统性的法律与医疗领域的评测显示,这类错误在高分模型里照样存在

作者的收口很干脆: 检索能提供最新的外部知识,但它不改变模型的行为; 只靠提示词也给不出持久的约束。改参数的方法把偏好和约束编码进参数里, 这才是通往「持久的、与组织对齐的行为」的实际路线19

走查到这里终于翻过山顶:

第 1 级(提示词) → 条款编号会漂、语气不稳 ✗ 口径一致
第 2 级(检索) → 条款对了,语气仍不稳 ✗ 合规
第 3 级(RAFT) → 引用规矩了,文风还是通用腔 ✗ 「像我们家的」
第 4 级(引导) → 能把语气拧正式一点,
但「本公司历来怎么解释第 7 条第 3 款」
这件事模型压根没有 —— 没有方向可指 ✗ 领域准确

→ 三类生产要求全部落空。**到这里才轮到改参数。**

8. 决策框架:三问,以及别忘了算的那几笔账

三个问题

作者反对「为了显得先进而上微调」,他给的是三问20:

  1. 模型到底哪儿不对?
  2. 什么样的干预能解决它?
  3. 这个干预值不值这个价?

贯穿三问的口径是最小干预原则:找到能达成目标的最小那一档。 微调在时间、专业能力、基础设施和长期维护上都是贵的; 提示词能达成就用提示词,检索能达成就用检索21

一个作者朋友起的名字:太空笔现象

书里讲了一个很扎人的场景:一个团队花了几个月搭训练设施、整理数据集、跑训练, 事后才开始想「也许调调提示词就解决了」22

他朋友把这叫太空笔现象——典出那个(基本是编的)段子: 美国人花大钱造能在太空写字的笔,苏联人用铅笔。

但作者在这里加了一句必须一起记住的话:

美国航天计划不用铅笔是有很好的理由的:石墨粉尘高度易燃、高度导电, 在高氧环境里相当容易自燃。23

这句话的用意是:「便宜的做法」不等于「对的做法」, 提示词先试是对的,但试完发现不够时不要赖着不走。

三笔最常被漏掉的账

组织通常给第一次微调编了预算,然后忘了后面的24:

漏掉的账书里的说法
底座换代2025 年 4 月 Llama 4、2025 年底 GPT-5 一出来,已经在旧版上微调过的组织就要选:是继续用旧的错过改进,还是在新底座上重训一遍再付一次钱。两条都不免费
世界变了但参数没变你的数据反映的是去年的产品和去年的法规,模型会自信地给出过时的指导。这不是假想,是必然
设施本身要养依赖一升级训练流水线就坏;评估装置随需求演进要改;当初搭这套东西的工程师会离职

作者给的经验法则:变化快的领域,大约每 6 到 12 个月要全量重训一次24

让继任者接得上:三份文档

针对上面最后一条(人会走),作者给了三份文档25:

文档记什么为什么
模型卡用途、训练数据、评估结果、已知局限、伦理考量2019 年提出的格式,现在几乎是行业标准
运行手册不只是「怎么跑」,还有为什么这么选用能跑的笔记本形式写,文档永远和实现对得上
决策记录为什么选这个底座、为什么这样组织数据、为什么学习率填这个值继任者问「当初为什么这么干」时,答案该找得到,而不是锁在离职的人脑子里

作者的结论: 维护这三份东西的开销是真实的,但比起从零重建机构知识,它很小; 每个微调项目都要把写文档的时间编进预算,并把它算进「做完了」的定义里25

9. 作者的判断与证据

说法是哪一类说明
打乱少样本标签几乎不掉效果有证据引的是一项具体研究,书给了尾注4
换显卡能差出 9 个百分点、9000 个 token有证据同样引了具体研究,并给了根因(小数加法不满足结合律)6
高分模型在法律与医疗领域仍系统性地流利地出错有证据书连引三条尾注19
「知识 vs 行为」这条判据作者的框架是他自己整理的判断工具,不是被检验的命题
激活引导「教不了新能力」作者的论断说理很硬,但书没有给这一条配实验尾注16
快速变化领域每 6–12 个月重训一次作者的经验法则他用的措辞就是经验法则,没有出处24
激活引导目前主要是研究工具作者的定性明写「在写作时」,是一个时间点上的判断18

10. 边界与局限

  1. 这一章没教怎么写提示词。 书自己就不教——它只把提示词当作决策矩阵里的对照项。 想学写提示词,这本书和这份拆解都帮不了你。
  2. 激活引导那一节的机制被压薄了。 那些「方向」是怎么被找出来的, 书里只用了一段话交代(用的技术叫稀疏自编码器,见脚注),我们没有展开—— 因为后面十七章一次都不用它。
  3. 检索本身怎么做,书不讲。 文档怎么切、怎么让搜索搜得准、搜出来的几段怎么排序, 这些是另一个领域的事,书只讲它和微调的分工
  4. 三类生产要求的证据强度不一样。 「口径一致」这条书里有实测数字支撑, 「合规」这条基本是论理,「领域准确」这条给了三条尾注但没给具体数字
  5. 决策矩阵那张表我们没有整表照抄。 书里的表 2-1 有九行判据、五列做法。 我们抄它会变成红线一(搬原文),所以这一章只交付它背后的口径 (最小干预 + 知识还是行为 + 三问),表格本身请回原书查。

11. 可带走的

  1. 动模型参数之前有四级更便宜的台阶:写清要求 → 外挂检索 → 训它用好检索 → 推理时加方向;口径是「找到能达成目标的最小干预」;
  2. 提示词的三条硬限制是结构性的,不是写法问题:装不下、说不全、不稳定;
  3. 「不稳定」有硬数字: 光换显卡就能差 9 个百分点、9000 个 token, 根因是小数加法不满足结合律;
  4. 你举的例子未必教了你以为的东西 —— 把标签随机打乱,效果几乎不掉;
  5. 该问的不是「提示词能不能管用」,而是「它能不能可靠到够用」 —— 一个 95% 管用的提示词,给内部工具够了,给面向客户的应用不够, 因为那 5% 会变成工单和声誉损害;而门槛高低由用途定: 创意写作助手能忍偶尔跑偏,临床决策支持一次都不能;
  6. 一句能当场用的判据:它需要「知道不一样的东西」,还是「表现得不一样」? 前者上检索,后者改参数,两样都要就两样都上;
  7. 检索改的是它手上有什么资料,微调改的是它拿资料干什么;
  8. 搜出来的东西里一定有干扰段落,所以有一条专门训「怎么用文档、怎么无视干扰、 怎么逐字引用」的路(RAFT),书里说它比纯检索和纯微调都好;
  9. 推理时加方向只能放大已有的行为,教不了新能力 —— 判据是「底座本来就有这个能力吗」;这是一条后面还会以更硬形式回来的规律;
  10. 真正逼你改参数的是三类生产要求:口径一致、过得了合规、领域上真的准确;
  11. 别忘了三笔账:底座半年到一年换一代、世界变了参数没变、设施和人都要养;
  12. 写三份文档:模型卡、运行手册、决策记录 —— 把写文档的时间编进预算,并算进「做完了」的定义。

12. 原文地图

主题原书章原文位置
提示词工程是真实成果What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:229(搜「remarkably sophisticated」)
三条硬限制What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:231(搜「three general limitations」) · text/09-fm-what-post-training-really-means.txt:233(搜「context windows」) · text/09-fm-what-post-training-really-means.txt:237(搜「combinatorial explosion」)
例子会误导、打乱标签What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:241(搜「Randomly replacing labels」)
换显卡差 9 个百分点What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:245(搜「nonassociativity」)
结构性约束,不是提示词问题What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:249(搜「architectural constraints」)
三类生产要求与缺口What Post-Training Really Meanstext/09-fm-what-post-training-really-means.txt:255(搜「three main categories」) · text/09-fm-what-post-training-really-means.txt:263(搜「production requirements gap」)
95% 够不够用Should You Fine-Tune at All?text/11-fm-should-you-fine-tune-at-all.txt:11(搜「95 percent of the time」)
检索改知识不改行为Should You Fine-Tune at All?text/11-fm-should-you-fine-tune-at-all.txt:17(搜「nonparametric knowledge」) · text/11-fm-should-you-fine-tune-at-all.txt:21(搜「changes how the model behaves」)
知识还是行为:三档判据KNOWLEDGE VS. BEHAVIORtext/12-fm-knowledge-vs-behavior.txt:3(搜「know different things」) · text/12-fm-knowledge-vs-behavior.txt:9(搜「enthusiastic product recommendations」)
RAFT 三件事KNOWLEDGE VS. BEHAVIORtext/12-fm-knowledge-vs-behavior.txt:13(搜「distractor」)
激活引导的原理与用法KNOWLEDGE VS. BEHAVIORtext/12-fm-knowledge-vs-behavior.txt:17(搜「steering」) · text/12-fm-knowledge-vs-behavior.txt:21(搜「subtract」)
引导测试THE STEERING TESTtext/13-fm-the-steering-test.txt:3(搜「already possess this capability」) · text/13-fm-the-steering-test.txt:5(搜「steering cannot teach」)
引导与消融同源、它的定位WARNINGtext/14-fm-warning.txt:3(搜「abliteration」) · text/14-fm-warning.txt:5(搜「narrower in scope」) · text/14-fm-warning.txt:7(搜「research and diagnostic tool」)
三问与最小干预WARNINGtext/14-fm-warning.txt:11(搜「three questions」) · text/14-fm-warning.txt:19(搜「Minimal intervention」)
太空笔现象WARNINGtext/14-fm-warning.txt:143(搜「space pencil」) · text/14-fm-warning.txt:145(搜「Graphite dust」)
三笔隐藏成本WARNINGtext/15-fm-warning.txt:3(搜「forget ongoing costs」) · text/15-fm-warning.txt:5(搜「the world changes」) · text/15-fm-warning.txt:7(搜「dependencies update」)
三份文档BUILDING INSTITUTIONAL MEMORY FOR FINE-TUNINGtext/16-fm-building-institutional-memory-for-fine-tuning.txt:3(搜「model cards」) · text/16-fm-building-institutional-memory-for-fine-tuning.txt:7(搜「decision logs」) · text/16-fm-building-institutional-memory-for-fine-tuning.txt:9(搜「definition of done」)

Footnotes

  1. 出处:「What Post-Training Really Means」第 229 段(text/09-fm-what-post-training-really-means.txt:229,搜「remarkably sophisticated」)。原文点名的四种技法是思维链、少样本学习、角色设定、结构化输出格式,并说它们「确实提升模型表现,是真实的智力成就」。

  2. 出处:「What Post-Training Really Means」第 231 段(text/09-fm-what-post-training-really-means.txt:231,搜「three general limitations」)。三类的英文原名是 context constraints、specificity constraints、consistency。上下文那一条的两个例子在第 233 段(text/09-fm-what-post-training-really-means.txt:233,搜「context windows」)。作者还补了一句(第 235 段,text/09-fm-what-post-training-really-means.txt:235,搜「the index may prove too big」):检索能部分缓解,但要选出相关的,前提是知道什么算相关,而且上下文越长,模型用好它的能力越差。 2

  3. 出处:「What Post-Training Really Means」第 237 段(text/09-fm-what-post-training-really-means.txt:237,搜「combinatorial explosion」)。

  4. 出处:「What Post-Training Really Means」第 241 段(text/09-fm-what-post-training-really-means.txt:241,搜「Randomly replacing labels」)。这是书里的一个 WARNING 框。原文的结论是:模型从少样本示例里学到的是任务格式、标签空间和输入分布,而不是你以为的那个输入到答案的映射。 2 3

  5. 出处:「What Post-Training Really Means」第 243 段(text/09-fm-what-post-training-really-means.txt:243,搜「best-case scenario」)。原文说:即使在所谓「确定性」的零温度解码下,相同提示词能得到可重复的输出,但措辞稍变就可能得到不同回答;而多数从业者没意识到,这还只是最好情况。

  6. 出处:「What Post-Training Really Means」第 245 段(text/09-fm-what-post-training-really-means.txt:245,搜「nonassociativity」)。原文的条件写得很具体:bfloat16 精度、贪心解码;差异纯粹来自显卡数量、型号和评测批大小。根因那句是 (a + b) + c ≠ a + (b + c),不同的并行策略改变了求和顺序。 2 3

  7. 出处:「What Post-Training Really Means」第 247 段(text/09-fm-what-post-training-really-means.txt:247,搜「no mechanism to remember」)与第 249 段(text/09-fm-what-post-training-really-means.txt:249,搜「architectural constraints」)。后一段还有一句:提示词作用在一个冻住的模型上,而冻住的模型无法从反馈中学习、无法适应新要求、也无法保证训练之外的行为。 2

  8. 出处:「Should You Fine-Tune at All?」第 11 段(text/11-fm-should-you-fine-tune-at-all.txt:11,搜「95 percent of the time」)。原文把问题重新提了一遍:要老实回答的不是「提示词能不能管用」(对很多应用它显然能),而是它能不能可靠到够用、在要求的质量水平上、以可接受的延迟与成本;可靠性往往就是那个限制因素。那个对照的原话是:一个 95% 的时候都管用的提示词,对内部工具可能够用,对面向客户的应用则不够,因为那 5% 的失败率会制造工单和声誉损害。 它还给了质量要求的两头:创意写作助手能容忍偶尔跑偏的回答,而临床决策支持系统不能容忍任何可能危及病人的回答。 同一段末尾还提了延迟与成本:带大量示例的长提示词要消耗 token、增加延迟,规模一大这些成本会叠加——这一条我们放在第 8 节那三笔账里讲。 2 3

  9. 出处:「Should You Fine-Tune at All?」第 17 段(text/11-fm-should-you-fine-tune-at-all.txt:17,搜「nonparametric knowledge」)。原文把训练中学到的叫 parametric knowledge,把检索来的叫 nonparametric knowledge。

  10. 出处:「Should You Fine-Tune at All?」第 19 段(text/11-fm-should-you-fine-tune-at-all.txt:19,搜「knowledge currency」)。两个词是 knowledge currency(会变的知识)与 knowledge specificity(太细的知识)。

  11. 出处:「KNOWLEDGE VS. BEHAVIOR」第 3 段(text/12-fm-knowledge-vs-behavior.txt:3,搜「know different things」)、第 5 至 9 段(text/12-fm-knowledge-vs-behavior.txt:9,搜「enthusiastic product recommendations」)。更完整的表述见「Should You Fine-Tune at All?」第 21 段(text/11-fm-should-you-fine-tune-at-all.txt:21,搜「changes how the model behaves」):微调改变的是模型怎么表现——风格、推理模式、拒绝某类请求的倾向、格式偏好;检索改变的是它能拿到什么信息,行为原封不动。

  12. 出处:「KNOWLEDGE VS. BEHAVIOR」第 13 段(text/12-fm-knowledge-vs-behavior.txt:13,搜「distractor」)。原文的关键点是训练模型逐字引用相关文档,把答案落在检索到的证据上而不是参数里的记忆上;实验显示这么训出来的模型胜过纯检索也胜过纯微调。 2

  13. 出处:「KNOWLEDGE VS. BEHAVIOR」第 17 段(text/12-fm-knowledge-vs-behavior.txt:17,搜「steering」)与第 19 段(text/12-fm-knowledge-vs-behavior.txt:19,搜「sparse autoencoder」)。找出这些方向的做法是:训一个小东西,让它只准用很少几个「零件」把那串中间数值重新拼回来;正因为只准用很少几个,每个零件被逼着去对应一个说得清的概念,而不是一个随意的方向(这套做法的名字叫稀疏自编码器)。研究者已经辨认出对应代码、特定语言、情绪语气、安全行为等的特征。

  14. 出处:「WARNING」第 5 段(text/14-fm-warning.txt:5,搜「narrower in scope」)。原文的定位句是:比微调快、比提示词有力,但比两者都窄。

  15. 出处:「THE STEERING TEST」第 3 段(text/13-fm-the-steering-test.txt:3,搜「already possess this capability」)。这是书里单独立的一个小测试框。原文举的例子:一个不会写代码的模型,不会因为引导就学会写代码;一个会写代码但默认写得啰嗦的模型,可以被引导得简洁些。

  16. 出处:「THE STEERING TEST」第 5 段(text/13-fm-the-steering-test.txt:5,搜「steering cannot teach」)。原文最后一句:当目标是真正获得能力而不是调制已有能力时,微调仍然是必需的。这一条书里没有配实验尾注,是作者的论断。 2

  17. 出处:「WARNING」第 3 段(text/14-fm-warning.txt:3,搜「abliteration」)。那种攻击手段的英文名是 abliteration,做的事是操纵同一串中间数值来移除安全特性。作者的结论:负责任地部署引导,需要和任何强能力一样的治理措施——访问控制等。

  18. 出处:「WARNING」第 7 段(text/14-fm-warning.txt:7,搜「research and diagnostic tool」)。作者顺带给了一个很生动的边界例子:让模型痴迷于牛(或者完全无视一切与牛有关的东西)相对容易,因为这个概念好辨认、好隔离;而要用引导去过滤某类更复杂的东西就难得多。 2

  19. 出处:「What Post-Training Really Means」第 255 段(text/09-fm-what-post-training-really-means.txt:255,搜「three main categories」)、第 257 至 261 段,以及第 263 段(text/09-fm-what-post-training-really-means.txt:263,搜「production requirements gap」)。领域准确那一条(第 261 段)连引三条尾注,说的是语言生成中幻觉的系统性调查以及法律与医疗领域的评测显示这类错误在高分模型里依然存在。 2 3

  20. 出处:「WARNING」第 11 段(text/14-fm-warning.txt:11,搜「three questions」)。作者在同一段批评了一种常见做法:把微调当成「一个到处找问题的解法」,投资训练设施是因为微调显得先进,而不是因为它对上了一个说清楚了的需求

  21. 出处:「WARNING」第 19 段(text/14-fm-warning.txt:19,搜「Minimal intervention」)。原文:最小干预是关键原则,因为微调在时间、专业能力、基础设施和持续维护上都很贵;提示词能达成目标就用提示词,检索能达成就用检索。另见「Should You Fine-Tune at All?」第 13 段(text/11-fm-should-you-fine-tune-at-all.txt:13,搜「not before」):在提示词撞上硬限制之前不该考虑微调

  22. 出处:「WARNING」第 143 段(text/14-fm-warning.txt:143,搜「space pencil」)。原文说提示词「试起来便宜得多、否证起来快得多,所以应当先被穷尽」。

  23. 出处:「WARNING」第 145 段(text/14-fm-warning.txt:145,搜「Graphite dust」)。同一段还提到,不止一次有团队发现精心写的提示词能把准确率做到「两个九」还多,而训练成本为零

  24. 出处:「WARNING」第 3 段(text/15-fm-warning.txt:3,搜「forget ongoing costs」)、第 5 段(text/15-fm-warning.txt:5,搜「the world changes」)、第 7 段(text/15-fm-warning.txt:7,搜「dependencies update」)。「每 6 到 12 个月」这条经验法则出自第 3 段末尾。注意这是作者的经验法则,不是研究结论。 2 3

  25. 出处:「BUILDING INSTITUTIONAL MEMORY FOR FINE-TUNING」第 3 段(text/16-fm-building-institutional-memory-for-fine-tuning.txt:3,搜「model cards」)、第 5 段(text/16-fm-building-institutional-memory-for-fine-tuning.txt:5,搜「literate code」)、第 7 段(text/16-fm-building-institutional-memory-for-fine-tuning.txt:7,搜「decision logs」)、第 9 段(text/16-fm-building-institutional-memory-for-fine-tuning.txt:9,搜「definition of done」)。模型卡的格式出自 2019 年一篇论文,现在几乎每家大实验室都发布模型卡;决策记录那一类工具在软件工程里叫架构决策记录(ADR)。 2