跳到主要内容

大语言模型:从理论到实践 — 全书拆解

30 秒导读: 这是一本 533 页的教材——回答一个贯穿始终的问题:一个能听懂人话、会看图、会查资料、会干活的模型,是怎么从「给文字算可能性」这个朴素目标一路造出来的。

它把大模型拆成一条四阶段流水线。第一阶段叫预训练:先让模型啃完海量互联网文本自学。

第二阶段是微调:拿几万条问答调教它,教到听懂人话为止。

这种调教有个正式名字——指令微调(第 06 章的主角)。

第三阶段奖励建模:训练一个模仿人类口味的自动打分裁判。

第四阶段强化学习:照着裁判的分数,继续调模型。

每个阶段都交代清楚:用什么数据、花多少电和钱、产出什么、难点在哪。然后把流水线的产出继续加工成会看图的模型、会自己规划步骤调用工具的助手程序、先查资料再回答的问答系统,最后落到速度、评估与应用。

本组文档是我们重写的完整拆解,十四章。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者张奇、桂韬、郑锐、黄萱菁——复旦大学教授团队
版本《大规模语言模型:从理论到实践》第 2 版,电子工业出版社(博文视点),2025 年;约 533 页
内容时点全书多处写明「截至 2025 年 2 月」:已覆盖 DeepSeek-V3/R1、Kimi k1.5、LLaMA-3、Qwen2.5、vLLM(V1 版服务框架)
书名考据库内登记的书名是《大语言模型从理论到实践》,经与第 2 版的页数(533)、章节结构(12 章、五部分)、内容时点逐一比对确认为同一本;lifecycle.md 里的「疑似同族」疑问就此落定

两件事先说,否则会误读这本书。 其一,它是教材不是综述:公式和推导占一半篇幅,我们的拆解把每个机制翻译成「解决什么问题 → 怎么做 → 为什么有效」,公式只保留结论。其二,它的例子高度「复旦系」——问答示例用「复旦大学有几个校区」,评估章节重点介绍复旦的 LLMEVAL 与司南平台——读时把例子当例子,不要当成选型推荐。

2. 全书一条主线(读完这一节,你就懂了这本书)

这本书是一条推理——一步步往下推——贯到尾的链条:每一步都是被上一步的死角逼出来的。细节全部退到各章,这里只讲「发生了什么、为什么只能这样」。

① 一切从「算可能性」开始

语言模型的本职工作只有一个:给定前面的话,算出每个词接下来出现的可能性。想靠「把所有句子列成表」来查,组合数是 10^96 级的天文数字——这条路从第一天起就是死的

于是只剩一条路:不查表,改算。数频率不够——够不着离得远的词。

改用神经网络:把词变成一串有含义的数。

再借自监督(不需要人工打标签——答案就是原文的下一个词)学法的巧劲。教材免费,互联网有多大教材就有多大。(01)

② 让「算」变得可行,让「做大」变得划算

算的核心引擎是一种叫 Transformer 的网络结构。

它的注意力(有选择地看向某些词的)机制,让每个词先「问」自己需要什么,再去所有词那里按匹配程度「取」信息——离得远的词可以直接连线,而且所有词能同时算,规模于是可以往上堆。

而缩放法则给了堆的理由:参数(模型里可调的数)和数据按比例加、耗电同比例涨,能力就按规律升——「做大」从赌博变成了工程。(0203)

③ 做大的三道坎:卡、数据、格式

  • :一块芯片装不下全部参数也跑不完所有计算,芯片之间的数据搬运又成新瓶颈。解法是把任务切开来分头算——怎么切、怎么放,05 章细讲。

  • 数据:教材决定能力上限,而原始互联网数据要经过四道清洗工序,约九成会被淘汰;参数和数据要等比例放大,只堆参数不堆数据已被实验推翻。(04)

  • 格式:预训练出来的模型只会接着你的话往下写,不会「听指令做事」——这就要进流水线的后三站。(060708)

④ 流水线后三站:教格式、教偏好、教思考

指令微调的惊喜在于它是表层工程——模型的知识早已在预训练里,千余条精选数据就够;预算不够,可以只训旁路小插片(LoRA:只训这点插片,存档缩小一万倍,06 章细讲)。

奖励建模与强化学习教模型「人喜欢什么」:让人类给回答排优劣,训出一个自动裁判——这个裁判就叫奖励模型——再照着分数继续调模型。人类偏好写不成标准答案,却能变成训练信号。

推理强化学习是另一条分岔:DeepSeek-R1 用「答案对不对」这种程序可判定的奖励做纯强化学习,模型的推理能力自己长了出来,AIME 成绩从 15.6% 涨到 71%,中途还出现了「重新评估自己思路」的顿悟时刻——思考不是教出来的,是试出来的。(08)

⑤ 一个只会打字的大脑不够用

流水线产出的是「文字进、文字出」的大脑。要看见,就把图像翻译成语言模型能吃的一串词元(模型吃的最小字块)——业界主流做法是把视觉部分和语言模型都钉死不动,只训中间那座「翻译桥」(09)。

要有手脚和记性,就在外面套一层智能体(会感知、会规划、会记事、会调工具)架构(10)。

四个模块:感知、规划、记忆(记住说过的事)、工具。

要少胡说,就配一个随开随查的图书馆:先检索(查)资料库,再把查到的内容交给模型作答(11)。

这套做法的行话叫检索增强生成,英文名 RAG——它把闭卷考试改成了开卷考试。

⑥ 用得起,才算真的有

训练侧,每个参数随身带的调参状态从 16 个存储位压到 6 个(12)。

推理侧,承认「吐一个词就要跑一遍模型」的宿命,于是用小模型起草、大模型验证的推测解码白赚速度(12)。

推理时存下的历史计算结果也要省着放(12)。

分页(像操作系统按页分配内存)式的管理是关键(12)。

碎片浪费的六到八成显存(芯片上装数据的内存)因此被收回来(12)。

压缩有三板斧。量化:用更少的比特存数(12)。

剪枝:删掉不重要的连接(12)。

蒸馏:让小模型模仿大模型(12)。

⑦ 造完了,凭什么说它好

评估要分阶段(基础模型——只会补全的;对话模型——会听指令的;强化学习模型——对过齐的,各评各的),要分方面(能力、安全、垂直领域),还要防作弊——考题泄进教材要审计,选项太少会被猜中,题库公开会被刷榜。怎么出题、怎么监考,和怎么解题一样是门技术。(13)

⑧ 落地:产品 = 模型 + 知识源 + 壳

九类应用场景剥开看都是同一个骨架:一个通用模型,配一个领域知识源,套一个交互壳。开发的最小闭环只有几步(事件 → 拼提示词(写给模型的指令)→ 调用 → 显示结果);不想上云,本地三层一条命令把模型跑在自己机器上(14)。

⑨ 一句话收尾

大模型不是被设计出来的,是被流水线和数据「逼」出来的:每解决一个死角(算不动、装不下、不听话、记不住、跑不起、评不了),就长出一章技术。 这本书的全部内容,就是这条「死角驱动」的链条。

3. 章节地图

地基与流水线的上半场(01–04)

读完你就能回答
01 全景「语言模型」到底在算什么?造一个对话模型要过哪四站,每站烧多少?
02 Transformer注意力的三步计算具体在算什么?「它」怎么知道指的是猫?ChatGPT 的前辈靠什么学出来?
03 放大到千亿原版结构直接放大为什么不行?560 亿参数的模型怎么只用 130 亿的活跃计算?
04 预训练数据模型的教材怎么编?一个网页从抓取到进训练集,存活率有多少?

流水线的下半场(05–08)

读完你就能回答
05 多卡分工三堵墙的三笔账怎么算?把一张大数表切开分给多卡,怎么保证结果不错?
06 指令微调指令数据从哪来,为什么 1000 条就够?显存不够怎么微调?能读的篇幅怎么加长?
07 强化学习看回报调策略的方法在调什么?主力方法的「剪切」在防什么?GRPO 怎么省掉一个模型?
08 教模型合乎人类偏好人类偏好怎么变成训练信号?DeepSeek-R1 的思考能力是哪来的?

增强与应用(09–14)

读完你就能回答
09 会看图的模型模型怎么「看见」图?四条融合路线差多少成本?
10 智能体感知/规划/记忆/工具四模块怎么分工?调外部程序的能力是哪来的?
11 RAG开卷考试怎么开?一条查询在六个模块里怎么变形?
12 提速与省卡推理为什么慢?推测解码为什么白赚不损质量?FP8 省在哪?
13 评估BLEU 和 ROUGE 方向差在哪?两个模型差 0.1% 是真的差吗?榜单能信吗?
14 应用开发一个大模型产品的最小骨架是什么?不上云怎么本地跑模型?

推荐顺序: 01 → 02 → 03 是地基,顺序读;04–08 是流水线主线,顺序读;09–14 相互独立,按需取用。只想快速建立全局的人,读本页第 2 节加 01 章即可。

4. 覆盖什么、不覆盖什么

覆盖(而且是全书覆盖)

  • 四阶段流水线每一站的数据、算力(要烧的电和卡)、产物与难点,配具体数字(1750 亿参数的那代模型,一次预训练的电费账单以百万元计;LLaMA-65B 要上百万加速卡工时;奖励建模要百万量级的人工排序);

  • Transformer 与其现代改造(LLaMA 三件套、FlashAttention、MQA/MLA、混合专家——一次只启用一部分参数的结构)的机制层讲解,公式齐备;

  • 数据工程全流程:质量过滤、三级去重、隐私消除、BPE 词元切分,以及 RefinedWeb 级别的清洗流水线细节;

  • 强化学习方法的完整谱系,及两大应用方向(按人类反馈调模型、R1 式推理);

  • 2025 年初为止的新进展:DeepSeek-R1、Kimi k1.5、MLA、vLLM V1、FP8 训练;

  • 增强、效率、评估、应用四大板块各成一章;评估章的防作弊设计(考题污染审计、防猜题、防刷榜)与自动打分(如 F1:重合度评分)在同类教材里少见。

不覆盖(别指望在这本里找)

缺什么说明
2025 年 2 月之后的事新模型、新方法一概没有;具体的模型体量和榜单分数会过时
公式的逐行推导部分公式(尤其强化学习一章)书里直接给结论加出处,推导省略
生产级工程细节上线必备的鉴权、限流、成本核算、监控告警不在范围
中文教材数据的特殊清洗数据工程以英文材料为主,中文特有问题(乱码、繁简、广告)着墨极少
行业故事与人物史全书没有叙事线,想看「谁在什么时候做了什么」要另找书
DPO(一种绕开强化学习循环的调教方法)等免循环方法只在 Kimi k1.5 一节顺带出现,未成体系

5. 我们的判断

判断(我们的,不是书里的): 这本书的最佳用法是「字典 + 路线图」:想知道某个技术(MLA、GRPO、PagedAttention、位置插值——把位置编号按比例压缩来拉长可读篇幅)是什么,直接跳对应章;想建立全局,读第 2 节主线。它不适合当入门第一本书——生词密度极高,适合已有概念框架的人回来查漏。

如果错,会错在: 如果读者带着工程问题来(「我该怎么调教自己的模型」),061214 三章合起来其实已经够用,把它当纯理论书跳过反而是吃亏。

判断(我们的,不是书里的): 全书最有长期价值的是两组内容:一是「死角驱动」的叙事结构——每项技术都先摆出它要解决的死角,这套讲法比技术本身更耐过期;二是各处「我们不知道」的坦白(照分数调模型为什么优于照答案调模型,没有共识解释;奖励模型能不能一直打准,没有定论;软专家结构的取舍,没有共识),这些空白比结论更能标出领域的真实边界。

如果错,会错在: 如果后续研究给这些空白补上了共识答案(比如前者的机理被严格证明),本书相应章节的「坦白」就降级为史料;但「把不知道写出来」这个做法本身不会过期。

判断(我们的,不是书里的): 与库内已有书的关系——它和《动手学大语言模型》(hands-on-large-language-models)是互补位:那本重操作,这本重机制;和邱锡鹏 nndl 系列是上下游:nndl 管地基,这本管地基之上的大模型大厦。题材最近的邻书是 llm-and-agent(《大模型与智能体》):那本重主线与判断、讲了 DPO 与具身/治理这些延伸,这本重机制与数字——公式和实验账最全,两本可互为「为什么」与「是什么」。想学大模型,按 nndl → 本书 → hands-on 的顺序读最省力。

如果错,会错在: 若读者目标只是调用模型服务做应用,前两本都可以跳过,直接 14 章加各云厂商文档——「按需读」永远优先于「按序读」。

6. 许诺兑现表

正文里每一处「第 N 章讲」「见下一章」,在这里记一行、逐行核过。

许诺在哪许诺了什么应兑现在哪核过了吗
本页 §2 ①可能性算不动、后来怎么算01 §1-§2、02
本页 §2 ②注意力机制、缩放法则02 §2、01 §2
本页 §2 ③三堵墙与切法分工05 §1-§2
本页 §2 ③数据四道工序与九成淘汰率04 §2
本页 §2 ④指令微调与 LoRA06
本页 §2 ④按人类反馈调模型与 R1 顿悟时刻0708
本页 §2 ⑤给模型接上「看图」能力09 §3
本页 §2 ⑤智能体四模块与工具学习10 §2-§3
本页 §2 ⑤RAG 开卷考试11 §1、§3
本页 §2 ⑥FP8、推测解码、分页注意力12 §4-§5
本页 §2 ⑦分阶段评估与防作弊13
本页 §2 ⑧最小闭环与本地部署三层(详见 14)14 §2、§4
01 §2Transformer 架构第 02 章专讲02 全章
01 §6 边界机制待第 02/04/08 章展开020408
02 §5 判断块与「学新忘旧」作战的几场战役06 §2-§3、12 §3这次改的:原写「第 10 章蒸馏」,蒸馏在 12 章,已改
02 §7 边界计算量平方增长的改进方案03 §2
03 §2历史结果的存放账第 12 章细算12 §1、§5
03 §7RoPE 为位置插值埋伏笔06 §4
04 §2考题混进教材是评估隐患13 §4
06 §3全参数调教的显存账第 05 章算过05 §3✓(回指)
07 §4环境即打分裁判,下一章主角08 §1
07 §7 边界KL 控制器等工程细节08 §3
10 §4LangChain 数据连接是检索增强的雏形11
14 §6 边界硬件估算需第 12 章的压缩知识12 §3✓(回指)

拆解写于 2026-08-27,依据 2025 年中文版(电子工业出版社·博文视点)。本组文档是我们自己的重写;每条引用都可用 node scripts/book-verify.mjs da-yu-yan-mo-xing-cong-li-lun-dao-shi-jian 回核。