大纲 — large-language-models(16 章)
自查记录:写完通读一遍,任意两行「出去时知道」是同一件事→合并。已核对:09 章(DPO/幻觉)与 08 章(RLHF)分界=「有没有 RL」;10 章(怎么挑词)与 11 章(怎么算得快)分界=「质量 vs 效率」;13 章(规划)与 14 章(智能体/长 CoT)分界=「单任务的解题循环 vs 成体系的系统与新推理范式」。
与复旦版《大语言模型:从理论到实践》的分工(总纲详表,各章内嵌短对照):
- 复旦=教材:四阶段流水线为骨,公式推导链(策略梯度→REINFORCE→GAE→PPO→GRPO 五步演化),每环节给数据算力数字。
- 人大=综述:研究脉络+边界判据(什么时候成立/什么时候失效),资源地图(模型/数据/库),自做实验(YuLan 全流程、表7.1-7.3、表9.3),可复算的工程账本(参数公式精确复现 LLaMA-7B;21 天训练时间闭环)。
- 对比锚点一:分布式/账本——复旦 05 章讲「三堵墙+三种切法+集群拓扑」;我们 06 章讲「一笔能自己验算的账」(公式→代数→与论文实测对上)。
- 对比 锚点二:RL——复旦 07 章沿算法演化线推公式;我们 08 章沿「偏好数据从哪来→裁判怎么训→RL 怎么用」的流水线走,演化推导留给复旦章,我们在 09 章给 DPO 的另一条路。
01-pipeline-and-gpt-history(原书 ch1 + 2.1 + 2.4)
- §1 四代语言模型:统计→神经→预训练→大模型 | 进来以为 LLM 是凭空出现 → 出去知道每代各自解决了上一代什么死结
- §2 两阶段流水线:预训练打地基+后训练教做人 | 进来以为训练是一锅炖 → 出去知道「能力来自预训练、行为来自后训练」的分工
- §3 GPT 系五阶段:从 GPT-1 到 o3 | 进来以为 GPT 是连续变大 → 出去知道中间有两次换挡(代码训练+人类对齐;测试时扩展)
- §4 主走查:一条「下一词预测」多任务链(情感/算术/知识同源)
02-scaling-laws(原书 2.2 + 2.3)
- §1 KM 缩放法则:三个幂律+损失分解 | 进来以为「越大越好」是口号 → 出去知道它是可查表的指数关系
- §2 Chinchilla:参数与数据要配平 | 进来以为堆参数就行 → 出去知道 GPT-3 喂少了,配比此后一路改写
- §3 缩放法则能干什么/不能干什么(可预测 scaling、inverse scaling) | 进来以为法则=预言机 → 出 去知道它只管 loss 不管任务
- §4 涌现能力三样+争议(mirage 假说) | 进来以为涌现=玄学 → 出去知道争议在「度量方式造出来的跳变」
- §5 主走查:把 Chinchilla 配比公式代进 GPT-3 的数,看它喂差了多少
03-resource-map(原书 ch3)
- §1 模型检查点:开源阵营地图(表3.1 的读法) | 进来以为模型名是流水账 → 出去知道每代在比「同算力下谁的数据喂得多」
- §2 LLaMA 族谱:Alpaca/Vicuna/领域变体 | 进来以为变体=换皮 → 出去知道变体差在指令数据来源
- §3 预训练数据:网页/书/代码/混合+清洗存留率(1.38%) | 进来以为数据=越多越好 → 出去知道原始网页九成九要被扔
- §4 后训练数据三路+对齐数据 | 进来以为指令数据只有一种 → 出去知道 NLP 改写/真人对话/合成各有各的病
- §5 库生态(Transformers/DeepSpeed/Megatron/自家 LLMBox) | 一节选型地图
04-data-engineering(原书 ch4)
- §1 收集:通用+专用文本 | 进来以为网页是唯一来源 → 出去知道书的份额小但管长程依赖
- §2 质量过滤:启发式+分类器 | 进来以为清洗=去广告 → 出去知道是一整套带阈值的流水线(含误杀文言文的风险)
- §3 敏感与去重:毒性阈值/PII 占位符/MinHash | 进 来以为去重可有可无 → 出去知道 0.1% 重复 100 遍=模型折半
- §4 tokenization:BPE 走查+WordPiece/Unigram | 进来以为分词是小事 → 出去知道切法影响数学能力和推理延迟
- §5 配比与课程+YuLan 全流程 | 进来以为配比拍脑袋 → 出去知道用 1.3B 代理模型实验出来的(中英 1:8)
05-architecture(原书 ch5)
- §1 Transformer 三件套:注意力/FFN/残差归一化 | 进来以为是黑盒 → 出去知道每个 token 怎么被加权混合
- §2 四模块配置表:归一化/位置/激活/注意力的选型 | 进来以为配置随意 → 出去知道 Pre-RMSNorm+SwiGLU+RoPE 是收敛出的共识
- §3 三种架构:enc-dec/causal/prefix | 进来以为 decoder-only=偷懒 → 出去知道是训练使用统一后的胜出
- §4 长上下文两条路:改位置编码/改窗口 | 进来以为加大窗口就行 → 出去知道 RoPE 的旋转角要重新配平
- §5 替代架构 SSM 系(Mamba/RWKV/RetNet) | 进来以为 Transformer 不可动摇 → 出去知道挑战者在解码复杂度 O(H²)
- §6 主走查:「它」字的注意力一路查回「猫」(沿 5.1.2 公式走)
06-pretraining-playbook(原书 ch6)
- §1 三个预训练任务:LM/prefix/FIM/DAE/UL2 | 进来以为只有下一词预测 → 出去知道填空与去噪各服务于谁
- §2 优化设置:batch/LR/优化器/稳定四件套 | 进来以为超参是玄学 → 出去知道有成型配方(warmup 0.1-0.5%、β2=0.95)
- §3 3D 并行+ZeRO+激活重算+混合精度 | 进来以为并行=把卡堆起来 → 出去知道三种切法各治一种瓶颈
- §4 主走查:LLaMA-7B 全账本(参数 6,738,415,616→FLOPs→20.6 天 vs 论文 21 天→双卡 66GB)
- §5 经验法则:16P 字节、13B 至少 4 卡 | 出去知道动手前能自己算出要几张卡
07-instruction-tuning(原书 ch7)
- §1 指令数据三路构造(NLP 改写/对话/合成) | 进来以为数据靠人标 → 出去知道 Self-Instruct 用 175 个种子滚出 52K
- §2 Evol-Instruct:把简单题演化成难题 | 出去知道「加深+拓宽」两条演化轴
- §3 关键因素:格式/规模/精炼(Alpagasus 9000≈52000) | 进来以为越多越好 → 出去知道 7.2M 后收益放缓、精挑反而平价
- §4 训练策略:seq2seq 损失/多轮 mask/混配比/多阶段 | 出去知道 SFT 与预训练共用引擎、只换数据与损失
- §5 LoRA 主走查:108GB→13.6GB 的显存账 | 进来以为微调都要全参 → 出去知道低秩矩阵 8.4M 个数就够
- §6 本书自做实验:数据类型决定能力(表7.2) | 出去知道 FLAN 补 NLP、ShareGPT 补对话、混不出全能
08-rlhf(原书 8.1 + 8.2)
- §1 3H 判据与对齐前后对比 | 进来以为对齐=审核 → 出去知道是三种主观标准要变成训练信号
- §2 RLHF 三步框架+四个模型 | 进来以为 RLHF=RL → 出去知道大头是数据与奖励模型
- §3 偏好数据:标注员筛选/打分 vs 排序/Elo | 出去知道为什么用「排序」不用「打分」(标注员 0.9 vs 0.6)
- §4 奖励模型三训法+策略(正例正则/同 checkpoint/多奖励加权) | 出去知道裁判怎么训、怎么防过拟合
- §5 PPO 四要点:优势/重要性采样/裁剪/KL 惩罚 | 进来以为 RL=黑魔法 → 出去知道每个部件各治一种不稳定
- §6 实践:InstructGPT/LLaMA-2 五轮迭代+过程监督+RLAIF | 出去知道 RLHF 是循环工程不是一次性训练
09-dpo-sft-rlhf-hallucination(原书 8.3 + 8.4 + 8.5)
- §1 DPO:从 RLHF 推导出免 RL 的损失 | 进来以为对齐必须 RL → 出去知道 Z(x) 相消后只剩两个模型的概率比
- §2 DPO 梯度行为:自适应步长 | 出去知道系数 σ(r̂−−r̂+) 怎么自动刹车
- §3 SFT vs RLHF:行为克隆 vs 结果反馈(表8.1) | 进来以为二选一 → 出去知道是先后的两站,各有对方治不了的病
- §4 幻觉:六分类+三层病因 | 进来以为幻觉=胡编 → 出去知道有过时/不完整/过度断言等六种,根子在数据与训练方式
- §5 检测与缓解 | 出去知道三查法(判官/不确定性/外部工具)与四缓解
10-decoding(原书 9.1)
- §1 贪心与随机采样 | 进来以为输出=概率最大 → 出去知道挑法本身就是一层设计
- §2 贪心改进:beam/长度惩罚/重复惩罚 | 出去知道短句偏置从哪来(连乘 <1)
- §3 采样改进:温度/top-k/top-p | 进来以为参数随便调 → 出去知道 top-p 是「按分布形状自适应」的挑法
- §4 对比解码+各家实际配置 | 出去知道 T5/LLaMA/Alpaca 各用什么、为什么
- §5 主走查:「一壶__」的 0.681/0.119 怎么变成选择
11-inference-efficiency(原书 9.2-9.4)
- §1 KV cache 与两阶段:prefill/decoding | 进来以为每步重算全文 → 出去知道缓存让每步只算一个 token
- §2 内存墙:算术强度判瓶颈(A100 142.51) | 进来以为慢=算力不够 → 出去知道解码慢是「搬数」不够快
- §3 系统级三招:FlashAttention/PagedAttention/continuous batching | 出去知道各自省的是什么
- §4 算法级:投机解码主走查(9 词 4 次验证) | 进来以为快=换小模型 → 出去知道小模型起草+大模型验=质量不变
- §5 量化:算例 S=0.0486/对称 vs 非对称/离群值/GPTQ/AWQ/SmoothQuant | 进来以为量化=掉精度 → 出去知道 INT4 几乎无损、同显存宁要大模型 4bit
- §6 蒸馏与剪枝 | 出去知道 Sheared-LLaMA 7B→2.7B 保 87.8% 靠的是什 么
12-prompting(原书 10.1-10.3)
- §1 四要素+四原则(实战清单) | 进来以为 prompt=话术 → 出去知道是有结构的(任务/输入/上下文/策略)
- §2 自动优化:离散四法+连续 | 出去知道 API 模型只能用编辑法、LLM 造 prompt 已成路
- §3 ICL:示例选择/格式/顺序+两种机制解释 | 进来以为示例=参考答案 → 出去知道有「识别旧任务」与「学新映射」两种读法(foo/bar 实验)
- §4 CoT:基本形+增强(自洽性/验证器)+ToT/GoT | 进来以为 CoT=让它写步骤 → 出去知道真正起作用的可能是「表达任务意图」
- §5 证据:公式对错不影响、符号与模式才影响 | 出去知道 CoT 的机制解释仍是开放问题
13-rag-and-planning(原书 10.4 + 11.1)
- §1 RAG 三阶段 | 进来以为 RAG=搜到就塞 → 出去知道检索/prompt/生成三段各有病各有药
- §2 lost in the middle 与重排/压缩 | 出去知道「给了资料≠会用资料」
- §3 迭代与自适应检索 | 出去知道「何时检索」本身可以交给模型决定
- §4 规划框架:规划器/执行器/环境 | 出去知道 agent 的最小骨架是什么
- §5 一次性 vs 迭代(ReAct)+反馈两路(外部/内部,Reflexion) | 出去知道反思文本怎么改变下一 轮动作
14-agents-and-long-cot(原书 11.2 + 11.3)
- §1 智能体三组件:记忆/规划/执行 | 进来以为 agent=套壳 → 出去知道记忆分长短两栈、各有限制
- §2 多智能体:通信三要素+协作三机制+三个案例(MetaGPT/西部世界) | 出去知道「多 agent」贵在通信协议不在数量
- §3 长 CoT:推理模式与触发词(wait/double check) | 进来以为 o1=更快 → 出去知道是「想久一点」的新范式
- §4 数据与训练:蒸馏/MCTS/多智能体+SFT 激活(R1-Zero 免 SFT) | 出去知道 3900 条数据就能激活慢思考、但 SFT 有天花板
- §5 可验证奖励+GRPO+响应长度信号 | 出去知道「答案对=1」这么简单的奖励为什么够用
- §6 test-time scaling 两把尺:token 效率与性能上限
15-evaluation(原书 ch12)
- §1 指标工具箱:PPL/F1/BLEU/ROUGE/Pass@k/Elo | 进来以为评测=跑个分 → 出去知道每个指标各适配哪类任务
- §2 三种范式:基准/人工/模型判官(三种偏差) | 出去知道为什么 Chatbot Arena 用 Elo
- §3 基础能力:生成/知识/推理+各自主问题(评测不可靠/幻觉/推理不一致/数值误差) | 出去知道「模型会做题」和「模型会推理」是两回事
- §4 高级能力:对齐/环境交互/工具 | 出去知道这些能力各自用什么测
- §5 综合基准:MMLU/BIG-Bench/HELM/C-Eval+选型指南 | 出去知道开发者该报哪几个数
- §6 主走查:Pass@k 无偏估计为什么能省算力
16-open-problems(原书 ch13)
- §1 四维收束:原理/架构/训练/使用各自的未解问题 | 进来以为领域已成熟 → 出去知道作者自己列了一页「我们不知道」
- §2 作者的三条自省:理论缺失/污染/架构单一 | 出去知道综述作者的边界意识长什么样
- §3 两书分工总结+这张书架怎么用(与复旦版互指)