跳到主要内容

四个案例与五条通则 — 全书放在一次工地上检验

这一章讲四件真事加一个综合练习: 每个案例都用真实量级的数字, 检验前九章的一条主断言。读完你应该能回答:如果明天要开工, 哪五条经验直接搬走,哪三段管线直接搭。

1. 这一章讲什么

前面九章给了完整工具箱;这一章是工地验收。书里的口径:四个案例 覆盖实践者最常遇到的场景,每个都认真讨论「约束怎么塑形设计、 取舍怎么做的、出现什么失效、什么能迁移到别的项目」1

它在全书链条里的位置: 每个案例都是一次「组合拳」—— 数据纪律(第 02 章)、LoRA/QLoRA(第 03、04 章)、SFT 与对齐(第 05、06 章)、 评测(第 08 章)、部署(第 09 章)在同一个项目里同时上场。

2. 顶层全景

案例一 客服 → 检验「质量过滤 > 堆数据」与「风格进权重、政策走应用层」
案例二 医疗 → 检验「安全行为要有独立的偏好训练阶段」
案例三 代码 → 检验「测试对是最大增量」与「通用能力没被微调伤到」
案例四 多语言 → 检验「跨语言迁移 + 过采样省一个数量级的标注」
capstone → SFT + 偏好对齐 + 复杂度路由,三段拼成完整管线

图说:四个案例就是五条通则的实验报告;capstone 是毕业考。

3. 案例逐个走

3.1 客服机器人:过滤比堆数据值钱

起点:一家电商有 12 万条历史工单,要一个「像自己家语气」的一线客服 AI。 四条硬标准过滤(客户满意 4–5 分、单轮就解决、类目在范围内、回答 50–200 词), 12 万条只剩 18,400 条;抽 500 条人工复查,仍发现约 8% 有毛病 ——自动过滤不是终点,这个比例就是「自动化之上还要人」的证据2

三个训练发现3:

  • 加量的边际递减:5,000、10,000、18,400 三档对比,5K→10K 显著提升, 10K→18.4K 几乎持平——过滤后的第一批比后面的更有价值;
  • SFT 之后加一段偏好对齐:800 对「微调模型 vs 底座加提示」的对比, 由客服团队来挑;品牌语气的一致性可测地变好,尤其在对愤怒客户时 ——原来那套动不动过度道歉的毛病被压下去了;
  • 业务数字:换成 AI 后工单重开率从 23% 降到 14%(客户满意分不变), 同样规模的客服团队承接量涨到 4 倍4

最有迁移价值的一条经验:风格与内容分开。团队起初想让微调同时学会 「正确的内容」加「正确的风格」,效果反而糊;改成微调只管风格 (历史回答当风格模板),政策内容走应用层——政策变了不用重训, 系统好维护得多5。这正是第 07 章「微调加检索增强」分工的案例版。

3.2 医疗问答:安全行为要单独教

起点:数字健康公司做患者教育助手。两个硬约束:只能用公开的去标识数据; 上线前必须过持照医师评审6

数据与训练的组合拳:三份公开来源(患者教育库、医学考试题集、 用临床指南让 GPT-4 生成的问答),过滤掉一切「数值级的临床建议」 (剂量范围、诊断阈值、治疗时间线),再强制每条答案带上「请咨询医生」 ——最终 4,200 条监督微调样例7。然后是本章的主角: 600 对专门为安全设计的偏好对——同一个问题,chosen 表达恰当的不确定 并转介专业就诊,rejected 给出假自信的临床指导8

医师评审的结果同样值得记:第一轮抽 200 条,11 条有事实错误—— 全部集中在训练样本稀少的少见病上;针对错误类别补数据、定向重训, 第二轮 200 条只剩 3 处轻微错误,带免责声明与季度复评上线9

两条结论10:其一,SFT 教「说什么」,偏好对齐教「怎么说得安全」 ——两者混在一个阶段训,训出「有时准确但安全不稳定」的模型; 其二,稀疏覆盖是医疗微调的头号风险——错误集中在少见病不是巧合, 是数据分布的直接投影。

3.3 私有框架代码生成:主走查的完整兑现

第 07 章主走查搭的那条流水线,书里的案例给出了跑完的真实量级。 一家软件公司,内部 230 万行 Python、850 个模块;通用代码模型 「写法对、用意错」——用公开库的写法套内部框架11

主走查(数字全部来自书里的案例):

配置:CodeLlama-7B-Instruct,QLoRA,秩 32(不是 16!)
——理由:内部词汇多样性太高(几百个内部模块名、
函数前缀、错误码),秩 16 的适配器装不下[^12]

评测:150 个内部任务,各配测试套件;指标 Pass@1
(第一次生成就要全过测试)

第 1 级 底座 CodeLlama:Pass@1 = 23%
第 2 级 QLoRA 微调(文档对 + 测试对 + GPT-4 补写的文档,
自动生成的打半权):Pass@1 = 61%
第 3 级 再加「测试 ↔ 实现」配对:Pass@1 = 74%
对照组 公开 HumanEval 基准:与底座差 3 个百分点以内
→ 领域特化没有伤到通用写码能力[^13]

图说:三个台阶,每级旁边是那个「改动」;
第 2→3 级说明模型从测试里学到的是「行为契约」,不只是代码模样。

运营侧还有一条:上线两个月后质量退化——开发者写了新模块,模型没见过。 书里的解法是持续摄取:月度增量重训,把上次训练之后新增的代码喂进去, 不必每次全量重训12

3.4 多语言意图分类:一根杠杆撬动 23 个国家

起点:全球零售平台,23 个国家、12 类意图。老方案是每语言一个模型—— 23 套维护、23 套评测、加一个新意图做 23 遍13

新方案押在第 07 章那根杠杆上:XLM-R 多语言底座, 一个模型吃全部语言。标注预算的账最直观:23 语言 × 12 意图全部足额标注 要 276,000 条;靠跨语言迁移,砍到 92,000 条——高资源语言足额, 6 个低资源语言每类只标 200 条14

照录并注明:按书里给的两个单价算(高资源每类 1,000 条 × 12 意图 × 17 语言, 加低资源每类 200 条 × 12 意图 × 6 语言),得 218,400 条,与书里写的 92,000 对不上——书内「单价」与「总数」两处口径不一致。本拆解照录两数、以书里 给出的总数 92,000 为准;单价只当「高资源足额、低资源少量」的量级参考, 不当精确账目用。

结果:17 个高资源语言 macro F1 全部超过 0.90;6 个低资源语言 0.81–0.87, 反而胜过原来单语言模型的 0.76–0.83——跨语言迁移给了小语种 单打独斗拿不到的学习信号;语言混淆(把问题投到错误语言的意图上)可忽略15

案例里的纪律性细节:团队起初没做过采样,低资源语言在数据里占比太小, 推不动权重,效果差;改成批内刻意过采样(六成高资源、四成低资源)后达标 ——过采样不是可选项,是纪律16

3.5 Capstone:三段管线拼一台文档助手

毕业项目把三条技术缝成一台「内部 API 文档助手」:回答要贴合团队的写作风格、 文档没写清的要明说、按难易分流17

第 1 段 SFT(QLoRA):领域词汇 + 精确的技术写作风格
第 2 段 偏好对齐(beta 0.1,学习率 5e-5):具体、结构化的回答
优先于含糊打太极的回答
第 3 段 复杂度路由(DistilBERT 分类器):置信超 0.75 的「难」问题
转人工,简单的直接答
收尾:第 08 章的评测管线验收(任务、探针、路由准确率),
第 09 章的模式部署(接口、鉴权、隐私过滤)

图说:三个阶段各自只做一件事——这正是五条通则的活教材。

4. 作者的判断与证据

**书里当证据给的:**重开率 23%→14%、Pass@1 三级台阶、 标注预算 276,000→92,000、医师评审两轮 11→3——四个案例的数字 都是书里作为「项目结果」报告的,作者未附原始数据与实验设置, 按案例叙事的可信度接受41814

**书里当立场给的:**五条通则是作者从案例里「提炼」的,其中「安全行为 要有独立阶段」「风格与内容分开」被作者明确推广到所有领域19

**书里坦白没给的:**四个案例都是架构讨论,没有开源的代码或数据集; 「7B 专用模型稳定胜过 70B 通用模型、服务成本低 10 倍」是作者对趋势的判断, 书中没有给出对照实验——这个断言是可以被推翻的(拿自己的任务实测即可), 接受之前先验证20

5. 边界与局限

  • 案例数字是叙事性的,不是可复现实验:没有随机种子、没有置信区间, 重做一遍数字一定会不同;
  • 案例二的「公开数据」路线绕开了隐私合规,但也意味着模型没见过真实病历 ——这个盲区书里没有讨论;
  • 案例三的月度增量重训假定「代码库的变化是渐进的」,大规模重构场景 书里没覆盖;
  • 未来方向一节(合成数据成本下降、在线持续微调、小专用模型组合、 对齐方法向最简收敛)是 2026 年中的判断,时效性最强,引用时注意日期20;
  • 「资源与社区」一节列的工具与社区(HF 生态、论文与成果追踪站)是入口级清单, 本书未逐一评述21

6. 可带走的

  1. 先建质量过滤,再谈数据规模:12 万条过滤到 1.84 万条才是赢法;
  2. 风格与内容分开:微调教怎么说,应用层教说什么——政策改动不用重训;
  3. 安全行为要有自己的一段偏好训练:指望 SFT 顺手带上是不可靠的;
  4. 高风险领域先补稀疏处:错误集中在训练样本最少的地方;
  5. 代码微调先配测试对:行为契约比代码模样值钱;上成后要月度增量重训;
  6. 多语言项目先上多语言底座:标注预算能省三分之二,低资源语言反而受益;
  7. 过采样是纪律,不是选项;
  8. 三段管线(SFT→偏好对齐→难易分流)是可复制的默认架构;
  9. 趋势判断:任务专用的中小模型组合,正在替代一刀切的大通用模型。

7. 原文地图

主题原书章原文位置
四案例与通则的定位Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:9(搜「serious architectural discussion」)
客服:过滤标准与 18,400Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:23(搜「120,000」) · :25(搜「8 percent」)
客服:三档数据与 DPOCase Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:31(搜「plateaued」) · :33(搜「800 preference pairs」)
客服:重开率与容量Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:39(搜「23 percent」)
客服:风格与内容分开Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:45(搜「separable concerns」)
医疗:约束与数据源Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:53(搜「de-identified public sources」) · :57(搜「MedlinePlus」)
医疗:数值过滤与 4,200 条Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:59(搜「dosing」) · :61(搜「4,200」)
医疗:600 对安全偏好Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:67(搜「600 preference pairs」)
医疗:医师评审两轮Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:71(搜「11 of 200」) · :73(搜「3 responses」)
医疗:SFT 与安全分开Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:77(搜「what to say」)
代码:私有框架与数据三类Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:85(搜「semantically wrong」) · :93(搜「AST」) · :95(搜「test-implementation」) · :97(搜「half the weight」)
代码:秩 32 与 Pass@1 三级Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:101(搜「rank 32」) · :107(搜「23 percent」)
代码:HumanEval 对照与持续摄取Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:109(搜「HumanEval」) · :115(搜「monthly retraining」)
多语言:23 模型的维护负担Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:121(搜「23 models」)
多语言:XLM-R 与预算 92,000Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:127(搜「XLM-RoBERTa」) · :129(搜「276,000」)
多语言:回译与过采样Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:135(搜「Backtranslation」) · :137(搜「60 percent」)
多语言:结果与语言混淆Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:141(搜「0.90」) · :143(搜「language confusion」)
Capstone 三段与路由阈值Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:157(搜「three of the book's core techniques」) · :723(搜「0.75」)
五条通则Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:867(搜「quality filtering」)
未来方向:小专用模型Case Studies and Capstone Projectstext/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:905(搜「10 times cheaper」) · :909(搜「Standardization」)

Footnotes

  1. 出处:「Case Studies and Capstone Projects」第 9 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:9,搜「serious architectural discussion」)。

  2. 出处:「Case Studies and Capstone Projects」第 23、25 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:23,搜「120,000」;:25,搜「8 percent」)。

  3. 出处:「Case Studies and Capstone Projects」第 31、33 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:31,搜「plateaued」;:33,搜「800 preference pairs」)。

  4. 出处:「Case Studies and Capstone Projects」第 39 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:39,搜「23 percent」)。 2

  5. 出处:「Case Studies and Capstone Projects」第 45 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:45,搜「separable concerns」)。

  6. 出处:「Case Studies and Capstone Projects」第 53 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:53,搜「de-identified public sources」)。

  7. 出处:「Case Studies and Capstone Projects」第 57–61 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:59,搜「dosing」;:61,搜「4,200」)。

  8. 出处:「Case Studies and Capstone Projects」第 67 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:67,搜「600 preference pairs」)。

  9. 出处:「Case Studies and Capstone Projects」第 71、73 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:71,搜「11 of 200」;:73,搜「3 responses」)。

  10. 出处:「Case Studies and Capstone Projects」第 77、79 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:77,搜「what to say」;:79,搜「sparse training coverage」)。

  11. 出处:「Case Studies and Capstone Projects」第 85、87 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:85,搜「semantically wrong」;:87,搜「2.3 million」)。

  12. 出处:「Case Studies and Capstone Projects」第 115 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:115,搜「monthly retraining」)。

  13. 出处:「Case Studies and Capstone Projects」第 121 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:121,搜「23 models」)。

  14. 出处:「Case Studies and Capstone Projects」第 127、129 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:127,搜「XLM-RoBERTa」;:129,搜「276,000」)。 2

  15. 出处:「Case Studies and Capstone Projects」第 141、143 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:141,搜「0.90」;:143,搜「language confusion」)。

  16. 出处:「Case Studies and Capstone Projects」第 137、149 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:137,搜「60 percent」;:149,搜「oversampling discipline」)。

  17. 出处:「Case Studies and Capstone Projects」第 155、157 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:157,搜「query routing」)。

  18. 出处:「Case Studies and Capstone Projects」第 107、109 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:107,搜「23 percent」;:109,搜「HumanEval」)。

  19. 出处:「Case Studies and Capstone Projects」第 865–891 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:11,搜「generalizable」)。

  20. 出处:「Case Studies and Capstone Projects」第 897–909 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:905,搜「10 times cheaper」)。 2

  21. 出处:「Case Studies and Capstone Projects」第 911–927 段(text/10-ch07-chapter-7-case-studies-and-capstone-projects.txt:919,搜「ecosystem」)。