开放问题 — 作者自己列的「我们不知道」,与这张书架怎么用
这一章讲三件事: 原书作者按四个 维度收束全书时,各自承认了什么「不知道」; 这些「不知道」与前面 15 章的细节怎么对上; 以及这本书在我们书架上的位置——它和复旦版《大语言模型:从理论到实践》怎么分工。
1. 原理维:为什么有效,全是开放题
原书的第一个坦白最彻底:下一词预测为什么这么好使,至今没有理论解释1。 回头看,这个问题在第 02 章就埋下了——缩放法则只能描述「损失随规模怎么降」, 不能解释「为什么降」;涌现能力「类似相变、无理论解释」。 第 06 章 Sutskever 的侦探小说比方是最好的直觉,但直觉不是理论。
三个具体的开放问题,原书一一点名2:
- 大小模型之间什么能推、什么不能推:缩放法则需要更严格的理论分析—— 这正是第 04 章「1.3B 代理模型试配比」和第 02 章「可预测训练」悬着的假设 (小模型行为≈大模型,原书早说了「未必成立」);
- 测试时扩展的本质是什么:原书给了一个表述——在输出空间里搜索—— 但它和训练时扩展的关系、上限在哪,都待研究(第 14 章的两把尺是起点);
- 模型能不能「外推」到预训练数据之外:泛化的边界在哪, 原书称之为「重要而有趣的研究挑战」。
第三个开放问题连着作者自己的痛处:评测数据污染严重危害公平评估3。 第 04 章那个「1.3B 靠泄漏赢 65B」的实验、第 15 章 FB15k-237 删反向关系的设计, 都是这条线的注脚;作者团队为此专门发过一篇论文, 标题就是《别让你的大模型当评测作弊者》4——综述作者不只梳理别人的研究, 也在亲手修这个领域最松的那块板。
2. 架构维:Transformer 很强,但「只有 Transformer」是风险
原书在架构维的坦白分两层5。第一层是已知短板:推理慢、训练贵; SSM 系挑战者(第 05 章的 Mamba/RWKV/RetNet)有潜力但「仍需大量验证」; 系统级优化(FlashAttention)与算法改进是互补关系而非替代。 第二层更尖锐:decoder-only 一家独大、架构多样性不足,可能阻碍长期发展6。
还有一条与 第 05、13 章互文的观察:长上下文「有了窗口, 但用不好窗口内的信息」——lost in the middle 不是提示工程的临场问题, 而是架构与训练层面的未解问题,可能需要专门改结构或改训练算法7。 对照第 05 章的「三年收敛史」读:零件层(SwiGLU/RoPE/GQA)创新不断、 骨架层一家独大——原书的判断是,骨架层的赌注下得太集中了。
3. 训练维:数据中心化、可预测、可编辑
训练维的收束可以读成第 04、06 章的「下一步清单」8:
- 数据中心的自动化训练系统:收集、清洗、配比、课程全自动,带反馈调节—— 第 04 章 YuLan 流程里靠人盯验证集手调的那一步,正是要自动化的对象;
- 沙盒实验外推问题:用小模型当试验田是省钱正道(第 06 章), 但原书再次警告「小模型的结论未必能放大」;
- 可预测训练成为标配:训练早期发现异常(GPT-4 报告的思路); 持续预训练与后训练已是标准实践,但要管好灾难性遗忘、能力平衡、任务专精;
- 知识编辑:模型知识受训练数据约束,会过时、会错—— 不重训整个模型、只改特定知识(「大模型编辑」) 是一个独立研究方向9。 它对着第 09 章幻觉的「过时」类:换知识不该非得重炼一次丹。
4. 使用维与安全:黑箱的提示,昂贵的对齐
使用维的坦白最短也最扎心:提示为什么有效,基本问题没解开10—— 为什么好提示能诱导出正确答案?思维链的原理是什么?怎么高效地为任务找到好提示? 第 12 章的扰动实验(公式写错不影响成绩)说明我们连「它为什么有效」都才开始问。 RAG 有效,但它依赖模型理解与利用长文本的能力,绕回 §2 的架构问题11。
安全维则是把第 08、09 章的成本账挑明:RLHF 依赖专业标注员,贵且难扩—— 方向是让 LLM 辅助标注(第 08 章 RLAIF 已开路);DPO 这类简化算法降低实施门槛; 工程上是迭代部署+红队的循环12。原书落笔的最后一句给了整本书的基调: 能力越强,安全与伦理越要先行13。
5. 两书分工:这张书架怎么用
我们书架上还有一本同主题的书:复旦大学团队的《大语言模型:从理论到实践》。 两本都讲大模型全流程,但文体与打法不同,按任务选书:
| 你要什么 | 读哪本 |
|---|---|
| 公式推导链:策略梯度→REINFORCE→GAE→PPO→GRPO 五步演化,每一步推到底 | 复旦版(教材,推导为主) |
| 分布式训练的体系:三堵墙、三种切法、集群拓扑 | 复旦版(系统铺开) |
| 研究脉络与边界判据:一个方法什么时候成立、什么时候失效 | 人大版(本书,综述笔法) |
| 资源地图:模型/数据/库三张表,截至 2024-01 的快照 | 人大版(第 03 章) |
| 可复算的工程账:LLaMA 参数公式精确复现到个位、20.6 天对 21 天的训练时间闭环 | 人大版(第 06 章) |
| 作者自做实验:YuLan 全流程、表 7.1~7.3、表 9.3 | 人大版(第 04、07、11 章) |
典型用法:在复旦版读懂 PPO 的数学之后,回本书第 08 章看它在 RLHF 流水线上的位置 与工程权衡;在本书第 06 章算清训练账之后,去复旦版看分布式系统的完整拓扑。 两本书对同一件事的讲法互为佐证:本书 06 章的「一笔能自己验算的账」, 对应复旦版 05 章的「三堵墙+三种切法」;本书 08/09 章的「偏好数据流水线与 DPO」, 对应复旦版 07 章的「算法演化推导链」。
6. 全书的判断块(收束)
判断(我们的,不是书里的): 读完 16 章回头看,这本书最独特的贡献不是覆盖了什么, 而是它的可核验性:LLaMA 参数公式算到个位、训练时间估算对到论文实测、 数据配比给出代理模型实验、幻觉给出六种可指认的形态—— 它把「综述」写成了「可以逐条回核的账本」。 而作者把最后一章留给「我们不知道」,使这本书同时也是一张研究选题地图: 理论解释、架构多样性、自动化数据系统、知识编辑、提示原理——每个方向都标注了「从哪一章接着读」。 如果错,会错在: 如果未来两年这些开放问题被批量解决(尤其「下一词预测的理论解释」), 这本书会迅速从「前沿综述」变成「历史文献」—— 但它教的判据(可复算、可回核、分清证据与判断)不会过时。
7. 可带走的
- 下一词预测的有效性没有理论——缩放法则只描述「怎么降」,不解释「为什么」;
- 三个原理开放题:大小模型什么能推、测试时扩展的本质、泛化的外推边界;
- 数据污染是作者亲手在修的痛:《别让你的大模型当评测作弊者》;
- 架构隐忧:decoder-only 一家独大;长上下文「有窗口用不好窗口」是架构问题不 是提示问题;
- 训练方向:数据系统自动化、沙盒外推存疑、可预测训练、知识编辑(不重训改知识);
- 使用黑箱:提示为什么有效未解;RAG 的天花板在长文本利用;
- 安全路径:LLM 辅助标注降成本、DPO 降门槛、红队+迭代部署;
- 两书分工:推导与系统看复旦版,脉络、判据、账本与自做实验看人大版;
- 这本书的读法:当账本来核,当地图来用。
8. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 下一词预测无理论 | 13 Conclusion | text/73-ch13-13-conclusion.txt:49(搜「theoretical explanation」) |
| 三个原理开放题 | 13 Conclusion | text/73-ch13-13-conclusion.txt:51(搜「more rigorous theoretical analyses」) · text/73-ch13-13-conclusion.txt:53(搜「extrapolate」) |
| 数据污染与作者论文 | 13 Conclusion | text/73-ch13-13-conclusion.txt:53(搜「data contamination」) · text/73-ch13-13-conclusion.txt:127(搜「Evaluation Benchmark Cheater」) |
| 架构短板与多样性 | 13 Conclusion | text/73-ch13-13-conclusion.txt:57(搜「slow inference speeds」) · text/73-ch13-13-conclusion.txt:61(搜「architectural diversity」) |
| 长文本「有窗口用不好」 | 13 Conclusion | text/73-ch13-13-conclusion.txt:59(搜「fully leverage relevant information」) |
| 训练四维收束 | 13 Conclusion | text/73-ch13-13-conclusion.txt:65(搜「data-centric training system」) · text/73-ch13-13-conclusion.txt:67(搜「sandbox experiments」) · text/73-ch13-13-conclusion.txt:71(搜「knowledge editing」) |
| 提示黑箱与 RAG | 13 Conclusion | text/73-ch13-13-conclusion.txt:77(搜「Why can effective prompts」) · text/73-ch13-13-conclusion.txt:79(搜「comprehend and utilize long texts」) |
| 安全与对齐收束 | 13 Conclusion | text/73-ch13-13-conclusion.txt:85(搜「professional annotators」) · text/73-ch13-13-conclusion.txt:87(搜「red teaming」) |
| 应用生态与 AGI 落笔 | 13 Conclusion | text/73-ch13-13-conclusion.txt:93(搜「New Bing」) · text/73-ch13-13-conclusion.txt:97(搜「safe and ethical development」) |