为什么现在轮到自己训 — 经济账、提示词的税,与三份公开配方
这一章讲三件事: 什么时候值得把模型变成「自己的」;提示词和训练各能管住什么; 以及让这一切变得可行的三份公开配方。 读完你能回答:「我的项目该继续调提示词,还是该自己训?」 机制细节(怎么训)留在后面的章节,这一章只算账、只看证据。
1. 先看现象:用户越多,账单越不像话
先把丑话说在前面,这也是书里的原话:后训练不是所有 AI 项目的必选项。想用一个能力全面的模型,调 API(API 就是「远程调用别人机房里的模型」的方式)按量付钱,对大多数应用是对的1。
但有几样东西会随规模一起长大:按 token 计的费用、速率限制(每分钟最多调几次)、数据治理约束,还有供应商改版本——模型行为突然变了,你的产品跟着变2。
书里给了一个需求侧的刻薄观察:一家每月处理一百万通客服对话的应用,第一百万通对话的边际成本和第一通一模一样——按量计费的世界里,用量翻十倍,账单就翻十倍,不存在「用得多更便宜」3。
2. 顶层全景:一笔账,一道税,一张门票
什么时候轮到你训?
① 动机:账单线性涨 + 控制权不在手里(§3、§4)
② 一道隐藏的税:提示词每次请求都重发重读(§5 主走查)
③ 门票:你得先有一个基础模型 —— 2023–2025 年开源浪潮把它变免费(§6)
④ 教科书:三份公开配方证明这条路走得通(§7)
图说:①②是「为什么值得」,③④是「为什么现在能」。
少任何一条,这件事在 2023 年之前都只是大公司的项目。
3. 核心原理(上):两种成本结构
API 的账:单价很小,但随用量线性(用掉多少就涨多少,不打折)涨。书里点了三种会被账单追上的场景:每月百万通客服对话、给百人团队人手一个编码助手、用户以百万计的消费级产品4。
自有模型的账:分两截——前面一次性投入(算力、数据、工程时间),后面持续付推理(推理在这里指「模型在被使用时算出回答」这件事)的钱。关键在单价:优化过的自托管推理,每 token 成本只是前沿 API 的一个零头。作者的判断是:高用量的场景,自托管比 API 便宜的交叉点「来得比多数团队预期的早」5。
控制权是另一半账。API 模型是你控制不了的依赖:供应商可以改行为、改定价、改限制、改条款、下线模型;你看不到权重,复现不了它的行为,更没法在模型层面改它。
书里那句话值得记:提示工程(用写指令的方式指挥模型)相对训练是把钝器——提示词(那条写好的指令)是隔着一层玻璃在指挥模型,训练是直接改它6。
自有模型反过来:行为、响应、演进节奏都归你;可以按领域专精;可以放进自己的基建、安全边界和数据治理里;可以周更甚至日更,不用等供应商的发版7。
4. 提示词的税:每次请求都重付一遍(主走查)
这一节回答:为什么「提示词已经写得很细了」还不够。
很多工程师的第一个做法是写一个长长的系统提示词(系统提示词就是事先写好、随每次请求一起发给模型的那段「人设+规矩」)8。拿书里的两个数 算一笔账(乘法是我们算的,两个数都是书里的):
系统提示词长度: 2,000 token (书里的例子)
每月请求量: 1,000,000 次 (书里的客服场景)
────────────────────────────────
每月光「重发规矩」:20 亿 token,还没算用户真正的问题一个字
图说:这笔税不光是钱。模型每次都要重新解读这段规矩,
遵循程度随输入浮动;提示词越长,内部还越容易打架——
用户的问题和系统的规矩冲突时,模型可能顾了这头忘了那头。
顺着这个思路补提示词,会撞到一层天花板,书里给了一条清晰的升级路径。先记一个词:上下文(模型一次能读进来的全部文字)——下面的表会用到它9:
| 手段 | 能补什么 | 补不了什么 |
|---|---|---|
| 提示词 | 任务格式、人设 | 每次都要重发重读、遵循度浮动 |
| RAG(检索增强:回答前先去你的资料库里搜出相关文档,塞进上下文再让它答) | 知识:模型能引用训练时没见过的资料 | 行为:人设、格式、决策依然靠提示词,每次重新解读 |
| 后训练 | 把行为装进权重:不占上下文、不用重新解读 | 动态知识(还是要 RAG 补) |
微调之后的差别,书里的说法是:指令变成了「学到的行为」。语气、格式约定、安全边界、领域术语、推理模式——这些需要跨输入保持一致的东西,提示过的模型每次重读一遍,训过的模型已经内化10。
所以生产系统的常见形态是三层叠加:后训练管稳定行为,提示词管任务级变化,RAG 管动态知识11。
5. 核心原理(下):门票——开源浪潮
上面的账成立有一个前提:你得先有一个值得训的基础模型。多年来这是真正的瓶颈:从零预训练一个有竞争力的模型,是数百万美元起的项目,要数据、 要基建、要人才,绝大多数组织一样都没有12。
2023 到 2025 年,这道门被接连撞开13:
- Meta 的 Llama 系列:宽松许可,7B、13B、70B 直到 405B 参数(B 是十亿,405B 就是四千零五十亿个参数),追平或逼近前沿水平;
- Google 的 Gemma 系列;
- 阿里 Qwen:Apache 2.0 许可,连训练配方一起公开;
- DeepSeek:一路升级到 R1(它的意义在第 05 章展开)。
从这以后,工程师不需要先预训练:基础模型免费,工具开源,技术文档齐全。作者的原话:剩下的工作是工程——为具体应用设计数据、奖励函数和训练配置14。
6. 三份公开配方:这条路真的走通了
书里挑了三份发布配方当证据,一份比一份走得远。看表:
| 配方 | 做了什么 | 结果 |
|---|---|---|
| Llama 3(Meta) | 流水线:先拒绝采样生成候选,拿最好的做 SFT,再 DPO 对齐;同样的循环跑了五轮,每轮的输出当下轮的训练数据(数据是合成的:上一版模型生成,再过滤质量) | 当时最强的开放权重指令模型之一 |
| Qwen 2.5(阿里) | SFT + DPO + GRPO,约一百万条后训练样本;0.5B 到 72B 全家族 | Apache 2.0 发布,附训练配方与评测脚本 |
| DeepSeek-R1 | GRPO 直接在可验证答案的任务上训;R1-Zero 版本完全跳过 SFT、纯 RL 训练;完整版加回 SFT、再一轮轮精炼下去 | R1-Zero 自己长出了思维链;完整版在数学、代码、推理上与 OpenAI o1 竞争;权重、代码全部 MIT 许可,另附教出来的小号版本 |
表里三个书里没解释的词,当场补上:
-
拒绝采样(Llama 3 流水线第一步):让模型对同一个问题生成很多份候选回答,只保留好的那些拿去当训练数据(补充(不在书里,来自通用知识):书里只用了这个词,没给定义;这是社区通行解释)。
-
蒸馏(R1 发布物里的「教出来的小号版本」):拿大模型生成的示范去教小模型,让小模型继承大模型的本事(补充(不在书里,来自通用知识))。
-
量化(Qwen 发布清单里的「量化支持」):把权重压缩存放,好塞进小显卡(补充(不在书里,来自通用知识);第 07 章讲工装时还会用到它)。
判断(我们的,不是书里的): 三份配方有一个共同结构——都是「SFT 铺底、偏好或 RL 精修」的多阶段组合,没有一家只用一段。 这和第 01 章「不是每个模型都要三段全上」不矛盾:单段够不够取决于任务多窄, 而最强的那几家配方全都选择了多段滚动。读后面各章时,拿这三份配方对号入座。 如果错,会错在: 如果有公开配方用单段 SFT 做到了同等水平, 「多段是顶级模型的标配」就不成立——但目前书里给出的三份证据都支持它。
7. 作者的判断与证据
给了证据的:
- 三份配方的流程与结果(上一节的表),每一条都对应公开发布的模型与配方;
- 成本结构的方向:自托管推理单价低于 API——这是可以按牌价验证的行业事实。
是作者的论断、书里没给数字的:
- 「交叉点来得比多数团队预期的早」——没给出任何具体价格、计算公式或盈亏平衡算法;
- 「按 token 计费的第三、第四种痛点(治理、版本变更)随规模变难接受」——定性判断,没有案例细节。
还有一处照实交代:书里列的第三个动因是端侧,即把模型直接跑在手机这类本地设备上——但正文只在这一处提了它,没有任何展开,想知道端侧怎么训,这本书现有章节帮不上。
8. 边界与局限:什么时候不该自己训
把书里的劝退条款放前面:通用模型 + API 对多数应用就是对的,后训练不是必选项15。值得自己训的信号是书里点过的几样:用量大到账单线性增长变成大头;行为需要跨输入严格一致;数据治理不允许数据出域;供应商的版本变更让你被动。反过来,低用量、行为可以浮动、没有训练运维能力的项目,留在 API 上更划算——书里没替你算这笔账的具体数字,交叉点要用你自己的牌价算。
书里没覆盖、读的时候别指望的:任何具体价格、自托管推理的成本公式、以及 Llama/Qwen/R1 之外的配方(标题里点了 Mistral 和 Olmo,正文一个字没讲)。
9. 可带走的
- 按量计费没有规模折扣:第一百万通对话和第一通一样贵;
- 自有模型换了成本结构:一次性训练投入 + 单价零头的推理费,高用量下交叉点会到;
- 控制权是钱之外的账:权重看得见、行为可复现、演进归自己;
- 提示词是每次都重付的税:2,000 token 的系统提示 × 每月一百万次 = 光重发规矩就 20 亿 token(数是书里的,乘法是我们的);
- RAG 补知识、补不了行为;行为要进权重,才不占上下文、不用重读;
- 生产形态是三层:后训练管稳定、提示词管变化、RAG 管动态;
- 门票已经免费:Llama/Gemma/Qwen/DeepSeek 把基础模型的门槛拆了;
- 三份配方全是多段组合:SFT 铺底、精修再精修,没有一家一段走完;
- 剩下的工作是工程:设计数据、奖励函数、训练配置——这正是后面五章的内容。
10. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 不是所有项目都需要后训练 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:72(搜「not an essential step」) |
| API 的痛点:费用、限流、治理、版本 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:72(搜「rate limits」) |
| 边际成本不变、三种高用量场景 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:74(搜「The marginal cost of the millionth conversation」) |
| 自有模型的成本结构与交叉点 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:76(搜「crossover point」) |
| 控制权、提示工程是钝器 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:78(搜「blunt instrument」) |
| 自有模型能做什么 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:80(搜「You control what it does」) |
| 提示词的税(2,000 token) | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:106(搜「2,000 tokens long」) |
| RAG 补知识不补行为 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:108(搜「knowledge limitation」) |
| 行为进权重 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:110(搜「learned behavior」) |
| 适合进权重的行为、三层组合 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:112(搜「tone, formatting conventions」) · :114(搜「layered approach」) |
| 瓶颈曾是基础模型 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:84(搜「multi-million-dollar project」) |
| 开源浪潮各家的发布 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:86(搜「Apache 2.0 licensing」) |
| 剩下的工作是工程 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:98(搜「designing the data」) |
| Llama 3 配方 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:92(搜「rejection sampling」) · :92(搜「five rounds」) |
| Qwen 2.5 配方 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:94(搜「approximately one million post-training examples」) |
| DeepSeek-R1 配方 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:96(搜「spontaneously developed chain-of-thought」) · :96(搜「MIT license」) |
| 端侧 AI 只提了一句 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:68(搜「on-device AI applications」) |
| Mistral/Olmo 只在标题出现 | Chapter 1. Introduction to Post-Training | text/04-ch01-chapter-1-introduction-to-post-training.txt:82(搜「Mistral」) |