跳到主要内容

Large Language Models — 书籍拆解

1. 30 秒导读

这是一本把「大模型怎么造、怎么用、怎么量」讲全的综述教材,人民大学赵鑫团队写, 2026 年 Springer 英文版(前身是他们 2023 年起迭代(即每隔一阵更新一版)了 15 版的 arXiv 综述,加了教材化的重写与实验)。 它回答的问题是:一个没进过这个领域的人,能不能顺着一条流水线, 把大模型从数据到部署的每个环节都搞明白——而且每个环节都有能自己验算的账。

先立一个最小的共识:这里说的模型是指一个装满数字的文件,不是一台摸得着的机器。

训练就是「拿海量文本反复调整这些数字,让模型越来越会接着你的话往下写」;「参数」就是这些数字的个数——大模型有几千亿个。

这本书的主角就是这么个东西:大模型,英文叫 LLM,即 Large Language Model 的缩写。

它真正的价值不在「覆盖全」(同主题的书不少),在可核验:模型参数公式代进 LLaMA-7B 算出来 6,738,415,616,和真实值分毫不差;训练时间估出来 20.6 天,论文报 21 天; 数据配比不是经验口诀,是作者拿 1.3B 代理模型一次次实验试出来的。 读完这套拆解,你不看原书,也能把这本书讲给别人听。

要动手时,该去哪找资源——现成的模型、数据集与工具库——03 章还给了一张选型地图。

2. 这是谁在什么时候写的

作者是中国人民大学高瓴人工智能学院的赵鑫、周昆、李军毅、唐天一、文继荣, 前言落款 2025 年 1 月,正文证据基本截至 2024 年初(部分到 2025 年初的 DeepSeek-R1)。 时代坐标:写在 GPT(OpenAI 的模型家族,GPT-4 是它在 2023 年的旗舰)之后、o1/R1「慢思考」范式刚出现的节点—— 所以它既有对 2020-2023「规模扩张时代」的完整沉淀,也有对测试时扩展的第一批教材化整理。 利益相关:作者团队自己训模型(YuLan 系列)、开发工具(LLMBox), 书里大量一手实验来自自家训练记录——这让它的工程细节异常扎实, 但读「自家方法」的推荐时要记得作者是当事人。

3. 全书一条主线

这本书把大模型讲成一条四段流水线,每一段都由上一段的缺口逼出来。

第一段:定世界观(01-03 章)

第一段:定世界观。 大模型不是凭空出现的:造它分两段——预训练(先拿万亿词的海量文本自学,练出语言与知识)给能力,后训练(再拿问答数据教它听指令、守规矩)给行为。

语言模型换了四代引擎(统计→神经→预训练→大模型),任务始终是「算下一个词」,变的是引擎的处理能力。

「做多大、喂多少」不是赌博,缩放法则把它写成了可查表的公式。 按公式一算,GPT-3 当年数据喂少了约十二倍——「做大」从此变成了工程。

规模变大为什么变强,书里不给理论,却记录了另一件怪事:规模过某个坎, 小模型不会的本事突然会了——行业把它叫「涌现」,没有理论解释。

而最大的数据源(网页)九成九是要扔的矿石。 于是第二段不得不回答:料怎么炼、机器怎么造、训练怎么跑(04-06 章)。

第二段:造模型——料与机身(04-05 章)

第二段:造模型。 数据要过三道清洗工序(0.1% 的重复就能让模型折半), 切成 token(模型读写文本的最小单位,可能是一个字、半个词或几个字母), 再按代理模型试出的配比下锅。

机身是 Transformer——它的结构 05 章会拆开走查。

核心零件是注意力(每个词给别的词打分、按分数互掺信息),让每个词按「跟我有多大关系」互掺信息。

「上下文窗口」——模型一次能看进去多少 token——也在这一段定型。

第二段:造模型——零件共识与训练账(05-06 章)

2020 到 2023 年,全行业把归一化(把每层的数字拉回标准量级稳住训练)、激活等零件一个个定型。

位置编码(告诉模型每个词坐在第几个位置)同样在这一时期定于一家。

各家选择渐渐变一致——书里管这叫收敛——最后归拢成 LLaMA 那套配置。

训练则是一本可复算的账:参数公式、算力(一秒能做多少次计算)的 6CP 近似, 代进真数,20.6 天对论文 21 天,闭环。

显存(显卡上临时存放数据的内存,训练时参数与中间结果都得住在这里)则要守住 16P 这条铁律。

模型造出来还只是「刚毕业的学生」——第三段要教它做人(07-09 章)。

第三段:教它听话(07 章)

第三段:后训练。 预训练完的模型还要再练,这一步叫微调——拿新数据接着训、改参数但不推倒重来。

指令微调(拿「问题+示范回答」的数据继续练,教模型听指令)把「会续写」教成「会听话」。

数据三路:传统 NLP(自然语言处理,即让计算机处理人类语言的技术领域)任务改写、真人对话、模型合成。

作者自己的实验证明:数据格式越像下游任务效果越好,没有一种数据补得全。

第三段:训不动的省钱法(07 章)

训不动整个大模型怎么办?07 章给的答案是冻结——锁住不让训练改动——底座,只训外挂件。

底座那几千亿个数字——行话叫权重——是多年训练攒下的家底,不重练。

外挂件是一张小矩阵(一张装满数字的表),加在底座旁边当补丁。

这个补丁思路的名字叫 LoRA——书里算了笔账:显存从 108GB 降到 13.6GB。

书里还提了一嘴变体 QLoRA(底座压成 4 位的微调法),07 章与 11 章都会回到它。

第三段:把人的偏好灌进去(08 章)

怎么把「人类觉得好」教给模型?靠强化学习——一种「按奖励好坏调整行为」的训练方式。

RLHF(人类反馈强化学习)就是把它用在对话上的做法:第一步,人给回答排序。

第二步,训出奖励模型(一个专门给回答打分、代替人来当裁判的模型)。

第三步的更新规则是一种算法——即照着奖励分数一步步调整参数的固定流程。

强化学习里的主流款叫 PPO,让模型往高分走,KL 拴住别跑偏。

第三段:省掉 RLHF 的路(09 章)

DPO(免强化学习)则用一条推导链把强化学习整个省掉。

省掉之后,比较的是两个模型的概率(某个回答被生成的可能性)谁更高。

这一路做的都是对齐——让模型行为符合人类价值观。

但也埋着代价:每个训练手段都自带一种幻觉 (模型一本正经地编造不实信息)成因—— 于是后半程的主题自然变成:能力怎么取出来用,以及怎么知道它好不好(10-15 章)。

第四段:使用——把词挑出来(10 章)

第四段:使用与评估。 解码是独立的一层设计:模型每步只给一串可能性, 怎么挑出那个词有专门策略——贪心每次挑最可能的,采样(按可能性抽签)更活。

野与稳由两个旋钮调:温度(控制随机程度的旋钮,调高更野、调低更稳)管抽签放多开。

另一个旋钮只看头部——即按可能性排最前面的那一小撮词。

top-p(只在累计可能性够八成的头部词里挑)就是干这个的。

第四段:使用——跑得快(11 章)

推理(模型训练好之后实际生成回答的过程)慢的根子在「搬数」不在算力。

所以有投机解码与量化(把参数从 16 位数字压成 4 位整数省显存)这两套压缩。

还有更狠的剪枝(删掉不重要的参数)——第 11 章三套压缩里最激进的一套。

省时间的另一路是缓存——把算过的结果存起来复用,免得每步重算。

第四段:使用——唤醒能力与接外脑(12-13 章)

提示工程(不动参数、只靠设计发给模型的那段话来调能力)唤醒已有能力 (ICL 与 CoT,机制至今有争议)。

RAG(检索增强:先从资料库搜相关内容、再照着写答案)给模型接外脑,规划让它走一步看一步。

智能体(能感知环境、自己做决策、自主行动的系统)把这一切组装成系统。

第四段:第二次换挡与评估(14-15 章)

2024 年底的长思维链(o1/R1)是第二次换挡——训练方式从「模仿范例」 换成「可验证奖励+放大强化学习」,模型学会想久一点。

最后,所有分数都要过评估这一关:指标(衡量模型成绩的尺子, 每种任务各配一把)各有适配,三种评测范式各有硬伤。

数据污染(考题混进训练料,分数虚高)能让 1.3B 打赢 65B—— 1.3B、65B 都是模型的参数规模,差 50 倍。

收束处,作者自己列了一页「我们不知道」(16 章)—— 下一词预测为什么有效,没有理论。

4. 章节地图

  • 01 流水线与 GPT 史 — 四代演化、两阶段分工、五次换挡。入门第一课;或「大模型到底是什么」。

  • 02 缩放法则 — KM/Chinchilla、涌现与争议、GPT-3 喂差了多少。想搞懂「为什么都在比数据量」时。

  • 03 资源地图 — 开源(权重公开、谁都能下载)的模型/数据/库的选型。动手前选型。

  • 04 数据工程 — 三道清洗、BPE、配比与 YuLan 配方。要碰训练数据时。

  • 05 架构 — 注意力走查、零件选型、长上下文、SSM。想懂模型内部时。

  • 06 预训练实战 — 四笔可复算的账。要估算训练资源时(先读 05)。

  • 07 指令微调 — 数据三路、LoRA(冻结(锁住不让训练改动)大模型、只训外挂小矩阵(一张装满数字的表)的省显存微调法)账、表 7.2 对照实验。要做 SFT 时。

  • 08 RLHF — 偏好数据、奖励模型、PPO 四部件。想懂对齐(让模型行为符合人类价值观)时(先读 07)。

  • 09 DPO 与幻觉 — DPO 推导、SFT vs RLHF、幻觉治理。08 的直接续集。

  • 10 解码 — 贪心/采样、温度/top-p、各家配置。调生成参数前。

  • 11 推理效率 — 内存墙、投机解码、量化/蒸馏(大模型教小模型)/剪枝。部署省成本时。

  • 12 提示工程 — 四要素四原则、ICL/CoT 机制之争。写提示词(发给模型的那段话)前。

  • 13 RAG 与规划 — 检索(从资料库搜相关内容)三段病与药、ReAct、Reflexion。做知识型应用或智能体时。

  • 14 智能体与长 CoT — 智能体三组件、多智能体(多个智能体协作)、o1/R1 训练法。追前沿时。

  • 15 评估 — 指标、三范式、能力地图、选型指南。看任何模型报告前。

  • 16 开放问题 — 作者列的「不知道」、两书分工。收束与找研究题时。

推荐顺序: 通读按 01→16;动手的人抄近路:01→02→(选型 03)→(数据 04)→(训练 06)→(微调 07)→(部署 11); 只做应用不训练的人:01→10→12→13→15。

5. 覆盖什么 / 不覆盖什么

覆盖: 大模型全生命周期的技术脉络——数据、架构、预训练、指令微调、RLHF 与免 RL 对齐、 幻觉、解码与推理的优化(优化,即想办法让同样的事算得更快更省)、量化压缩、提示工程、RAG、规划与智能体、 长思维链(o1/R1)、评估; 外加资源地图(模型/数据/库,截至 2024-01)与作者团队的一手实验。

不覆盖: 多模态(同时处理文字与图像的模型;本书只带过,有专书 Large Vision-Language Models)。

分布式系统的集群(一屋子机器连起来当一台用)拓扑与通信细节。

通信细节只到「NVLink/InfiniBand(机间高速互联网络)」一句。

安全治理的政策与法规层面;2025 年 1 月之后的进展。

强化学习的完整数学推导(PPO 只讲四个部件干什么,推导链只给 DPO 的)。

6. 我们的判断

判断一(我们的,不是书里的): 这本书在书架上的独特位置是「可核验的综述」—— 公式给你代真数的机会(LLaMA 参数到个位)、实验给你自家数据(YuLan、表 7.1-7.3、9.3)、 论断给你「实线/虚线」的证据分级。它与复旦版《大语言模型:从理论到实践》的分工: 复旦版推公式、铺体系(教材),本书给脉络、给判据、给能自己验算的账(综述); 两本对照读,一本知道体系全貌,一本会算自己的账。

如果错,会错在: 如果读者只需要「会用 API(接口,即调用模型服务的编程方式)」, 这本书的工程密度是过剩的——它的预设读者是想「搞懂」而不是只想「调用」的人。

判断二(我们的,不是书里的): 全书有一条作者没明说的暗线: 这个领域从炼金术转向工程学的证据链——缩放法则(02)、 阈值(定多少算重复、多脏要扔的那条线)有出处的清洗(04)、 可复算的训练账(06)、对照实验定数据配方(07)、算术强度诊断瓶颈(11)。 读完你会对任何「玄学式」的大模型说法产生抗体。

如果错,会错在: 涌现能力、CoT 机制、长 CoT 的「为什么」至今没有理论(02/12/16 章), 工程学只覆盖了「能测量」的部分;把这本书当成「大模型已被完全理解」来读,就误读了它—— 作者最后一章自己列了一页「我们不知道」。

兑现表

正文里每一处「第 N 章讲」,逐行核过:

  • 01 章「上下文学习(看几个例子就会做新任务、不用重训),第 12 章细讲」 → 12 章 §4 ICL 三套讲究与两种机制 ✓

  • 01 章「token 怎么切,第 04 章专讲」 → 04 章 §5 BPE 主走查 ✓

  • 01 章「o1 训练方式,第 14 章细讲」 → 14 章 §4 可验证奖励+GRPO ✓

  • 02 章「思维链,后面讲」 → 12 章 §5-6 CoT 增强与机制之争 ✓

  • 03 章「数据怎么洗,第 04 章」 → 04 章 §3-4 三道清洗工序 ✓

  • 03 章「MoE(混合专家:参数多、每步只激活一小部分的架构),第 05 章细讲」 → 05 章 §6 混合专家(在选型表内) ✓

  • 03 章「ZeRO 省多少,第 06 章算」 → 06 章 §4 第④笔 16P→16P/N ✓

  • 03 章「RLHF 的燃料,第 08 章」 → 08 章 §3 偏好数据 ✓

  • 03 章「R1 慢思考,第 14 章」 → 14 章 §3-4 长思维链 ✓

  • 04 章「困惑度(模型觉得文本「有多不像话」的分数,越低越好)准确定义,第 15 章」 → 15 章 §1 指标工具箱 ✓

  • 04 章「数据污染,第 15 章展开」 → 15 章 §2/§5 污染与选型 ✓

  • 05 章「键值缓存(把算过的结果存起来复用,免得每步重算),第 11 章主角」 → 11 章 §1 KV cache 两阶段 ✓

  • 05 章「解码策略(每步怎么挑出那个词)与加速,第 10、11 章」 → 10 章全章;11 章 §2-4 ✓

  • 05 章「SSM 是否服从缩放法则——没有数据」 → 05 章 §10 边界(明示未覆盖) ✓(明说不讲)

  • 06 章「轻量训练方法,第 07 章」 → 07 章 §6 LoRA ✓

  • 07 章「模型判官的偏好,第 15 章展开」 → 15 章 §2 三种偏差 ✓

  • 08 章「迎合裁判的幻觉,第 09 章」 → 09 章 §4 训练层病因 ✓

  • 08 章「DPO,第 09 章」 → 09 章 §1-2 五步推导+走查 ✓

  • 08 章「GRPO(比 PPO 更省的强化学习算法),第 14 章」 → 14 章 §4 RL 算法 ✓

  • 09 章「温度,第 10 章细讲」 → 10 章 §4 温度采样 ✓

  • 09 章「RAG,第 13 章整节」 → 13 章 §1-3 ✓

  • 09 章「top-p,第 10 章」 → 10 章 §2 主走查 top-p ✓

  • 10 章「投机解码,第 11 章」 → 11 章 §4 投机解码走查 ✓

  • 11 章「量化,第 07 章 QLoRA(底座压成 4 位的微调法)已提/本章 §5」 → 11 章 §5 量化 ✓

  • 12 章「长 CoT 内化提示工程,第 14 章」 → 14 章 §3-5 ✓

  • 13 章「多智能体,第 14 章」 → 14 章 §2 ✓

  • 15 章「作者论文,第 16 章」 → 16 章 §1 评测作弊论文 ✓

  • 总纲 §3「幻觉成因,第 09 章」 → 09 章 §4 ✓

  • 总纲 §3「开放问题,第 16 章」 → 16 章 §1-4 ✓

我们自己的读书笔记

  • notes/reading-notes.md — 通读全书时逐章记的要点、数字与可引行号;
  • notes/01-outline.md — 16 章大纲(每节「进来时以为→出去时知道」)与两书分工的原始设计。