01-outline — The RLHF Book 拆解切分
原书 18 章 + 附录 A,约 48 万字符。我们的拆解 16 章。 切分原则:一条完整推理链一章;ch06(策略梯度,原书最大)拆两章; ch09(拒绝采样)前移与 ch08(DPO)合成一章(同属「绕开在线 RL」的推理链); ch14(风格)与 ch15(正则)合成一章(风格问题是过优化的第一症状,KL 是缰绳); ch16(过优化)独立成章收束。导航章(版权/目录)跳过。
章级大纲(进来时以为 → 出去时知道)
01 为什么需要 RLHF(原书 ch1 + ch2)
- 进来:以为 RLHF 是「微调的一种」,主要用来让模型说话客气。
- 出去:知道 base model 只会续写(拿 Llama 405B 对同一句续写的真实对比看);RLHF 在 response 级别用「更好/更差」调行为,与逐 token 模仿的 SFT 是两种优化;post-training 三件套各管什么;以及这条技术线从 Atari(2017)走到 ChatGPT(2022)的三个时代。
02 把 RL 装进语言模型(原书 ch3 + 附录 A.1)
- 进来:以为强化学习就是游戏 AI 那套,和聊天模型关系不大。
- 出去:知道 RL 的最小词汇表(policy/奖励/轨迹/CartPole);RLHF 对标准 RL 的三处改造 (奖励函数→学习的奖励模型、无状态转移、整句一个分);KL 正则为什么必须存在; InstructGPT/Tulu 3/DeepSeek R1 三份真实菜谱的数据量级(10K→1M 的变迁)。
03 指令微调:把续写机改造成答话机(原书 ch4)
- 进来:以为微调就是「多喂点好数据」。
- 出去:知道 chat template 是模型真正读到的 token 序列(拿完整模板走查一条真实问答); prompt masking/多轮 masking 两种选择;~1M 高质量样本的量级判断;OLMo 2 预训练与 post-training 的 batch 差距(1024/2048 → 256)。