跳到主要内容

开放问题 — 作者自己列的「我们不知道」,与这张书架怎么用

这一章讲三件事: 原书作者按四个维度收束全书时,各自承认了什么「不知道」; 这些「不知道」与前面 15 章的细节怎么对上; 以及这本书在我们书架上的位置——它和复旦版《大语言模型:从理论到实践》怎么分工。

1. 原理维:为什么有效,全是开放题

原书的第一个坦白最彻底:下一词预测为什么这么好使,至今没有理论解释1。 回头看,这个问题在第 02 章就埋下了——缩放法则只能描述「损失随规模怎么降」, 不能解释「为什么降」;涌现能力「类似相变、无理论解释」。 第 06 章 Sutskever 的侦探小说比方是最好的直觉,但直觉不是理论。

三个具体的开放问题,原书一一点名2:

  • 大小模型之间什么能推、什么不能推:缩放法则需要更严格的理论分析—— 这正是第 04 章「1.3B 代理模型试配比」和第 02 章「可预测训练」悬着的假设 (小模型行为≈大模型,原书早说了「未必成立」);
  • 测试时扩展的本质是什么:原书给了一个表述——在输出空间里搜索—— 但它和训练时扩展的关系、上限在哪,都待研究(第 14 章的两把尺是起点);
  • 模型能不能「外推」到预训练数据之外:泛化的边界在哪, 原书称之为「重要而有趣的研究挑战」。

第三个开放问题连着作者自己的痛处:评测数据污染严重危害公平评估3。 第 04 章那个「1.3B 靠泄漏赢 65B」的实验、第 15 章 FB15k-237 删反向关系的设计, 都是这条线的注脚;作者团队为此专门发过一篇论文, 标题就是《别让你的大模型当评测作弊者》4——综述作者不只梳理别人的研究, 也在亲手修这个领域最松的那块板。

2. 架构维:Transformer 很强,但「只有 Transformer」是风险

原书在架构维的坦白分两层5。第一层是已知短板:推理慢、训练贵; SSM 系挑战者(第 05 章的 Mamba/RWKV/RetNet)有潜力但「仍需大量验证」; 系统级优化(FlashAttention)与算法改进是互补关系而非替代。 第二层更尖锐:decoder-only 一家独大、架构多样性不足,可能阻碍长期发展6

还有一条与第 05、13 章互文的观察:长上下文「有了窗口, 但用不好窗口内的信息」——lost in the middle 不是提示工程的临场问题, 而是架构与训练层面的未解问题,可能需要专门改结构或改训练算法7。 对照第 05 章的「三年收敛史」读:零件层(SwiGLU/RoPE/GQA)创新不断、 骨架层一家独大——原书的判断是,骨架层的赌注下得太集中了。

3. 训练维:数据中心化、可预测、可编辑

训练维的收束可以读成第 04、06 章的「下一步清单」8:

  • 数据中心的自动化训练系统:收集、清洗、配比、课程全自动,带反馈调节—— 第 04 章 YuLan 流程里靠人盯验证集手调的那一步,正是要自动化的对象;
  • 沙盒实验外推问题:用小模型当试验田是省钱正道(第 06 章), 但原书再次警告「小模型的结论未必能放大」;
  • 可预测训练成为标配:训练早期发现异常(GPT-4 报告的思路); 持续预训练与后训练已是标准实践,但要管好灾难性遗忘、能力平衡、任务专精;
  • 知识编辑:模型知识受训练数据约束,会过时、会错—— 不重训整个模型、只改特定知识(「大模型编辑」)是一个独立研究方向9。 它对着第 09 章幻觉的「过时」类:换知识不该非得重炼一次丹。

4. 使用维与安全:黑箱的提示,昂贵的对齐

使用维的坦白最短也最扎心:提示为什么有效,基本问题没解开10—— 为什么好提示能诱导出正确答案?思维链的原理是什么?怎么高效地为任务找到好提示? 第 12 章的扰动实验(公式写错不影响成绩)说明我们连「它为什么有效」都才开始问。 RAG 有效,但它依赖模型理解与利用长文本的能力,绕回 §2 的架构问题11

安全维则是把第 08、09 章的成本账挑明:RLHF 依赖专业标注员,贵且难扩—— 方向是让 LLM 辅助标注(第 08 章 RLAIF 已开路);DPO 这类简化算法降低实施门槛; 工程上是迭代部署+红队的循环12。原书落笔的最后一句给了整本书的基调: 能力越强,安全与伦理越要先行13

5. 两书分工:这张书架怎么用

我们书架上还有一本同主题的书:复旦大学团队的《大语言模型:从理论到实践》。 两本都讲大模型全流程,但文体与打法不同,按任务选书:

你要什么读哪本
公式推导链:策略梯度→REINFORCE→GAE→PPO→GRPO 五步演化,每一步推到底复旦版(教材,推导为主)
分布式训练的体系:三堵墙、三种切法、集群拓扑复旦版(系统铺开)
研究脉络与边界判据:一个方法什么时候成立、什么时候失效人大版(本书,综述笔法)
资源地图:模型/数据/库三张表,截至 2024-01 的快照人大版(第 03 章)
可复算的工程账:LLaMA 参数公式精确复现到个位、20.6 天对 21 天的训练时间闭环人大版(第 06 章)
作者自做实验:YuLan 全流程、表 7.1~7.3、表 9.3人大版(第 04、07、11 章)

典型用法:在复旦版读懂 PPO 的数学之后,回本书第 08 章看它在 RLHF 流水线上的位置 与工程权衡;在本书第 06 章算清训练账之后,去复旦版看分布式系统的完整拓扑。 两本书对同一件事的讲法互为佐证:本书 06 章的「一笔能自己验算的账」, 对应复旦版 05 章的「三堵墙+三种切法」;本书 08/09 章的「偏好数据流水线与 DPO」, 对应复旦版 07 章的「算法演化推导链」。

6. 全书的判断块(收束)

判断(我们的,不是书里的): 读完 16 章回头看,这本书最独特的贡献不是覆盖了什么, 而是它的可核验性:LLaMA 参数公式算到个位、训练时间估算对到论文实测、 数据配比给出代理模型实验、幻觉给出六种可指认的形态—— 它把「综述」写成了「可以逐条回核的账本」。 而作者把最后一章留给「我们不知道」,使这本书同时也是一张研究选题地图: 理论解释、架构多样性、自动化数据系统、知识编辑、提示原理——每个方向都标注了「从哪一章接着读」。 如果错,会错在: 如果未来两年这些开放问题被批量解决(尤其「下一词预测的理论解释」), 这本书会迅速从「前沿综述」变成「历史文献」—— 但它教的判据(可复算、可回核、分清证据与判断)不会过时。

7. 可带走的

  1. 下一词预测的有效性没有理论——缩放法则只描述「怎么降」,不解释「为什么」;
  2. 三个原理开放题:大小模型什么能推、测试时扩展的本质、泛化的外推边界;
  3. 数据污染是作者亲手在修的痛:《别让你的大模型当评测作弊者》;
  4. 架构隐忧:decoder-only 一家独大;长上下文「有窗口用不好窗口」是架构问题不是提示问题;
  5. 训练方向:数据系统自动化、沙盒外推存疑、可预测训练、知识编辑(不重训改知识);
  6. 使用黑箱:提示为什么有效未解;RAG 的天花板在长文本利用;
  7. 安全路径:LLM 辅助标注降成本、DPO 降门槛、红队+迭代部署;
  8. 两书分工:推导与系统看复旦版,脉络、判据、账本与自做实验看人大版;
  9. 这本书的读法:当账本来核,当地图来用。

8. 原文地图

主题原书章原文位置
下一词预测无理论13 Conclusiontext/73-ch13-13-conclusion.txt:49(搜「theoretical explanation」)
三个原理开放题13 Conclusiontext/73-ch13-13-conclusion.txt:51(搜「more rigorous theoretical analyses」) · text/73-ch13-13-conclusion.txt:53(搜「extrapolate」)
数据污染与作者论文13 Conclusiontext/73-ch13-13-conclusion.txt:53(搜「data contamination」) · text/73-ch13-13-conclusion.txt:127(搜「Evaluation Benchmark Cheater」)
架构短板与多样性13 Conclusiontext/73-ch13-13-conclusion.txt:57(搜「slow inference speeds」) · text/73-ch13-13-conclusion.txt:61(搜「architectural diversity」)
长文本「有窗口用不好」13 Conclusiontext/73-ch13-13-conclusion.txt:59(搜「fully leverage relevant information」)
训练四维收束13 Conclusiontext/73-ch13-13-conclusion.txt:65(搜「data-centric training system」) · text/73-ch13-13-conclusion.txt:67(搜「sandbox experiments」) · text/73-ch13-13-conclusion.txt:71(搜「knowledge editing」)
提示黑箱与 RAG13 Conclusiontext/73-ch13-13-conclusion.txt:77(搜「Why can effective prompts」) · text/73-ch13-13-conclusion.txt:79(搜「comprehend and utilize long texts」)
安全与对齐收束13 Conclusiontext/73-ch13-13-conclusion.txt:85(搜「professional annotators」) · text/73-ch13-13-conclusion.txt:87(搜「red teaming」)
应用生态与 AGI 落笔13 Conclusiontext/73-ch13-13-conclusion.txt:93(搜「New Bing」) · text/73-ch13-13-conclusion.txt:97(搜「safe and ethical development」)

Footnotes

  1. 出处:「13. Conclusion」第 49 段(text/73-ch13-13-conclusion.txt:49,搜「theoretical explanation」)。

  2. 出处:「13. Conclusion」第 51-53 段(text/73-ch13-13-conclusion.txt:51,搜「more rigorous theoretical analyses」;text/73-ch13-13-conclusion.txt:53,搜「extrapolate」)。

  3. 出处:「13. Conclusion」第 53 段(text/73-ch13-13-conclusion.txt:53,搜「data contamination」)。

  4. 出处:「13. Conclusion」参考文献 [127] (text/73-ch13-13-conclusion.txt:127,搜「Cheater」)。

  5. 出处:「13. Conclusion」第 57 段(text/73-ch13-13-conclusion.txt:57,搜「slow inference speeds」)。

  6. 出处:「13. Conclusion」第 61 段(text/73-ch13-13-conclusion.txt:61,搜「architectural diversity」)。

  7. 出处:「13. Conclusion」第 59 段(text/73-ch13-13-conclusion.txt:59,搜「fully leverage relevant information」)。

  8. 出处:「13. Conclusion」第 65-69 段(text/73-ch13-13-conclusion.txt:65,搜「data-centric training system」;text/73-ch13-13-conclusion.txt:67,搜「sandbox experiments」)。

  9. 出处:「13. Conclusion」第 71 段(text/73-ch13-13-conclusion.txt:71,搜「knowledge editing」)。

  10. 出处:「13. Conclusion」第 77 段(text/73-ch13-13-conclusion.txt:77,搜「Why can effective prompts」)。

  11. 出处:「13. Conclusion」第 79 段(text/73-ch13-13-conclusion.txt:79,搜「comprehend and utilize long texts」)。

  12. 出处:「13. Conclusion」第 85-87 段(text/73-ch13-13-conclusion.txt:85,搜「professional annotators」;text/73-ch13-13-conclusion.txt:87,搜「red teaming」)。

  13. 出处:「13. Conclusion」第 97 段(text/73-ch13-13-conclusion.txt:97,搜「safe and ethical development」)。