跳到主要内容

Decoder-only 的胜利 — 规模、GPT 与 LLaMA

这一章讲四件事: 堆规模堆出了什么规律——扩展法则(堆规模的数学:模型与数据怎么按比例涨)。

什么惊喜——涌现(能力随规模突然出现)。

GPT 系列怎么学会「听话」——RLHF(RL+HF:强化学习——即拿奖惩信号来训练模型的门路——加上人类反馈)。

闭源(不再公开内部细节)之后谁接过开源大旗(LLaMA),它的三板斧改了哪三处。 链条位置:第 03 章把 Decoder-only 定位成「适合开放式生成」,这一章回答为什么最后是它赢了——答案一半在架构外:规模,以及规模背后的数据配比。

1. 顶层全景

堆参数+堆数据 ──扩展法则──「怎么堆才划算」

├─ 规模过阈值 → 能力涌现(不是渐增,是相变)

├─ GPT 系:模型与语料同步狂奔(1.17 亿→1750 亿;5GB→1TB)→ RLHF 学听话 → 闭源

└─ LLaMA 系:模型稳住,语料狂堆(5TB→7TB→50TB)→ 开源共创
图说:两条路线共用同一个 Decoder-only 底座;胜负手在「数据」上。

2. 扩展法则:堆规模也要讲配比

这一节回答:算力(训练要烧的计算量)翻倍时,该加参数还是加数据?

OpenAI 的 Kaplan-McCandlish 法则(2020)先给出答案:模型性能与参数、数据都高度正相关,而且模型规模相同时,换架构对性能影响相对较小——这条结论把「架构改良」的优先级往下压了一格。注意这里比较的是「性能」,尺子是参数量(模型里可调的数有多少);1。在算力的分配上它主张模型涨得比数据快:总计算预算加 10 倍,参数扩约 5.37 倍、数据只扩约 1.86 倍(最优配比为 N∝C^0.73、D∝C^0.27)2

DeepMind 的 Chinchilla 法则(2022)拿着大得多的实验范围(7000 万到 1600 亿参数、50 亿到 5000 亿 token)推翻了这个配比:数据与模型几乎同等重要(N∝C^0.46、D∝C^0.27 的对称修正——预算加 10 倍,两边各扩约 3.16 倍)3。更有操作性的结论是:理想数据量应为参数量的 20 倍——70 亿参数配 1400 亿 token4。按这把尺子量,当时的巨无霸全都「吃太少」:GPT-3 有 1750 亿参数却只喂了 3000 亿 token;微软 MT-NLG 5300 亿参数只喂 2700 亿5。DeepMind 按新配比造了 Chinchilla(700 亿参数、1.4 万亿 token),性能反超更大的对手;Google 的 PaLM 2 技术报告随后佐证了这一点6

判断(我们的,不是书里的): Chinchilla 法则是本书出版前两年最重要的「方向修正」:它把竞赛的记账单位从「参数」换成了「参数×数据」。第 04.4 节 LLaMA 的「小模型+大数据」就是这条法则的工程化。 如果错,会错在: 如果高质量数据本身有上限(书在第 08 章会引「公共数据 2026 年左右耗尽」的估计),20 倍配比在 2024 年后就会撞墙,届时结论要重新配平。

3. 涌现:能力不是长出来的,是跳出来的

规模换来的不只是分数。书列出四种能力:上下文学习(靠几个示例学会新任务)、常识推理、代码生成、逻辑推理,并强调它们不是专项训练出来的,而是随规模凭空出现——这类能力叫涌现能力(Emergent Abilities)7

它的性状类似相变——非线性(输出不和输入成正比)系统里那种突变——:没有平滑积累的过程,过了某个规模阈值突然显现8

书按 GPT 系列的三档规模给了一组对照9:

参数规模上下文学习代码生成复杂推理
20 亿(GPT-1/2 代际)基本没有只能拼简单片段频繁出错
130 亿(GPT-3 中档)能完成常见任务能处理常见编程任务部分能做
1750 亿(GPT-3 最大版)及以后少量示例搞定复杂任务多语言生成、修 bug逻辑一致、细节丰富

书同时提醒:涌现也带来了可解释性、安全隐私、伦理公平与算力(更大的模型要烧更多计算)需求四大挑战10

4. GPT 系列:三代演进与一次「学会听话」

4.1 三代演进

先把演进主线铺出来:

  • GPT-1(2018-06):1.17 亿参数,12 个解码块,语料仅 BookCorpus 约 8 亿 token(5GB)。书引 OpenAI 前首席科学家 Ilya Sutskever 的采访:公司成立之初就想用「下一词预测」做无监督学习(不靠人工标好答案的数据,自己从文字堆里学)。

「人工标注」——预先替每条数据备好标准答案——这条路在无监督设定下是走不通的;,RNN 处理不了长依赖,2017 年 Transformer 出现才指明方向11。与 BERT-Base 结构几乎相同,本质区别只在注意力:BERT 双向,GPT-1 带掩码单向12。四个月后 BERT 发布,把 GPT-1 的锋芒遮住了13

  • GPT-2(2019-02):四档从 1.24 亿到 15 亿(48 个解码块);语料换成精挑清洗的 40GB 网文(WebText);部分任务开始能零样本(不微调直接做)14

  • GPT-3(2020-05):最高 1750 亿参数、96 个解码块、语料近 1TB;涌现出上下文学习——不微调,靠任务描述加少量示例就能干活15

  • InstructGPT 与 RLHF:GPT-3 会「接着写」,但不会「听指令」。InstructGPT(ChatGPT 的前身)用人类反馈强化学习(RLHF)补上这一课16

RLHF 主走查(书用水豚问答走通三步)17:

① 有监督微调:收集「问题-人类示范回答」对,如
问:水豚为何能和其他动物和谐相处?
答:因为水豚性格温顺,且无攻击性…… → 先教会基本回答格式
② 训练奖励模型:同一问题让模型生成多个候选,人工排出偏好
偏好顺序:输出2 > 输出4 > 输出1 = 输出3 → 用排名训练一个「打分器」
③ 强化学习微调:模型生成回答 → 奖励模型打分(如 0.85)
→ 按分数调整模型参数,让高分回答更可能出现
图说:人不必逐条改答案,只需表达「更喜欢哪个」;打分器把偏好变成可优化的信号。

代价也写得直白:奖励模型——替人给回答打分的那台模型——训练复杂耗时,且要两个模型联合训练,计算成本高昂18

把模型往更好方向调的所有做法,统称优化:这里的调法与后文的调法都算。

2023 年斯坦福提出的 **DPO——直接偏好优化:省掉单独的奖励模型、拿偏好数据直接调——**做了减法:直接用偏好数据微调,省掉单独的奖励模型和强化学习环节,效率更高、更稳,代价是处理复杂偏好时略逊19

4.2 RLHF 与 DPO

InstructGPT 与 RLHF 的三步走查在上一段铺开了;代价与减法如下。

  • ChatGPT(2022-11)与 GPT-4(2023-03)、GPT-4o(2024-05):ChatGPT「一鸣惊人」,引发能否通过图灵测试的讨论;从它起 GPT 系列转向闭源,参数与语料不再公开,模型变成通过网络调用的服务——书称这种新模式为 LLMaaS(LLM as a Service)20

  • GPT-4 增强复杂语境与数学编程、引入图文双模态;GPT-4o 主打速度与多模态(图文音频一起处理)21

5. LLaMA:开源一侧的路线之争

书把两条路线的差别一句话讲清:GPT 系列的主线是模型规模与语料同步提升,LLaMA 则在模型规模上保持相对稳定,专注提升语料规模22

  • LLaMA-1(2023-02):四档 67/130/325/652 亿参数,语料 5TB。明确在 Chinchilla 法则指引下实践「小模型+大数据」23。架构上动了三处(此后成为开源标配):位置编码(给每个词标上「我排第几」的信息)的旋转版——RoPE——替换了旧的写法,位置信息随相对距离旋转进注意力;SwiGLU 激活(替换 ReLU)、Pre-Norm 层正则(参考 GPT-3)24

  • LLaMA-2(2023-07):语料 7TB;补上了 RLHF——先公开指令数据做监督微调(拿标准问答对直接调),再训奖励模型,用 PPO——强化学习里的一种通用路子:一步步试、按反馈来调——与拒绝采样做强化学习25

  • 拒绝采样:先多生成几份,只留下合格的那份。

  • 同章 34B/70B 档引入分组查询(GQA,Grouped-Query)注意力——多个 query 共享同一组 key/value——降内存降参数。

  • LLaMA-3(2024-04):语料 50TB,是 LLaMA-2 的 7 倍;含大量代码与 5% 的非英文数据(30 多种语言)。结果:80 亿参数版超过 LLaMA-2 的 700 亿版;700 亿版在多项任务上超过业界标杆 GPT-426。架构几乎没动,只把词表扩了三倍——中文等语言不再被拆成零碎 token,推理更快、语义更整。书对此有一句判词:「充分证明了数据的力量」27

生态跟着开源底座长出来,书分三类。性能改进类:Alpaca 用 GPT-3.5 生成的指令数据微调、Vicuna 用 ShareGPT 对话数据、Guanaco 引入 QLoRA——先把模型压窄再跑 LoRA,更省内存。

垂直领域类:CodeLLaMA 代码、LawGPT 三十万法律问答、GOAT 数学、Cornucopia 金融。

多模态类:LLaVA 用 CLIP 提图像特征,加一层投影变换,对齐(把图像信息和文字信息搬到同一套数轴上);MiniGPT-4 用 VIT-G/14 加 Q-Former28

6. 作者的判断与证据

  • 给了证据的:两条扩展法则的配比数字与实验范围;GPT 三代参数/语料表;LLaMA 三代参数/语料表;LLaMA-3 80 亿胜 700 亿、700 亿胜 GPT-4 的横向对比。

  • 作者的推断(书里明说):ChatGPT 及以后参数语料未知,但「根据扩展法则,有理由猜测规模都有所增长」;Gemini 之外的国产模型(百川、文心一言)被点名为推动者。

  • 利益相关的提醒:本章大量结论出自 OpenAI/Meta/DeepMind 自家报告,各家都有动机强调自家路线;读法是看数据范围与对照,不看口号。

7. 边界与局限

  • 涌现能力的「突变」在学界有争议——书自己引的文献里就有《涌现能力是不是海市蜃楼》一文(见原书参考文献 [32]);度量方式变了,「突变」可能变平滑。本书照实收录两种可能。

  • 「700 亿版 LLaMA-3 超过 GPT-4」是书写作时(2024)特定榜单上的结论,不等于全面超越;GPT-4 的具体版本与评测集书中未注明。

  • Chinchilla 的 20 倍配比基于「算力受限」假设(算力不够时只能二选一);推理成本主导的场景(如长期服务)会偏向更小的模型——这是书未展开的另一半权衡。

  • RLHF 三步在本章是概述;对齐(把模型拗到人类偏好上)这件事的细节(RM 过拟合——奖励模型自己背答案——、奖励黑客)不在本书范围。

  • 衍生生态里的对齐已经解过;此处不重复。

8. 可带走的

  1. 扩展法则一:性能与参数、数据正相关,同规模下架构影响相对小。
  2. 扩展法则二(Chinchilla):数据与模型同等重要,理想数据≈20 倍参数;GPT-3/MT-NLG 都喂少了。
  3. 涌现=相变:20 亿→130 亿→1750 亿,四类能力逐级跳出来。
  4. GPT-1 与 BERT 只差注意力方向:双向 vs 带掩码单向。
  5. RLHF 三步:示范微调→偏好排名训奖励模型→强化学习;DPO 砍掉奖励模型。
  6. ChatGPT 起闭源+LLMaaS:模型变成服务,细节成谜。
  7. LLaMA 路线=模型稳、语料狂堆;LLaMA-3 用 7 倍语料让 80 亿打赢 700 亿——数据的力量。
  8. RoPE/SwiGLU/Pre-Norm/GQA 是开源模型的四件标配改装。

9. 原文地图

主题原书章原文位置
扩展法则两条2.1 大数据+大模型→新智能text/02-ch02-01-2-1.txt:76(搜「扩展法则」) · text/02-ch02-01-2-1.txt:86(搜「Kaplan」) · text/02-ch02-01-2-1.txt:82(搜「Chinchilla 扩展法则」)
Kaplan 配比 0.73/0.272.1.1 能力增强text/02-ch02-01-2-1.txt:126(搜「0.73」)
架构影响相对较小2.1.1 能力增强text/02-ch02-01-2-1.txt:36(搜「架构」)
20 倍配比2.1.1 能力增强text/02-ch02-01-2-1.txt:165(搜「理想的数据集大小应当是模型规模的」)
GPT-3 喂太少2.1.1 能力增强text/02-ch02-01-2-1.txt:171(搜「3000 亿」)
涌现能力与相变2.1.2 能力扩展text/02-ch02-01-2-1.txt:196(搜「涌现能力」) · text/02-ch02-01-2-1.txt:219(搜「相变」)
三档规模对照2.1.2 能力扩展text/02-ch02-01-2-1.txt:215(搜「1750亿参数」)
四大挑战2.1.2 能力扩展text/03-ch02-02-2-2.txt:13(搜「可解释性」)
GPT-1 与 Ilya 采访2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:102(搜「Ilya Sutskever」) · text/06-ch02-05-2-5-decoder-only.txt:112(搜「GPT-1 开创了」)
与 BERT 的本质区别2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:135(搜「本质区别」)
BERT 遮盖锋芒2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:220(搜「遮盖了」)
GPT-2 零样本2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:277(搜「零样本」)
GPT-3 涌现 ICL2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:287(搜「上下文学习」) · text/06-ch02-05-2-5-decoder-only.txt:299(搜「1750 亿」)
RLHF 三步2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:362(搜「RLHF」) · text/06-ch02-05-2-5-decoder-only.txt:373(搜「三个步骤」)
RLHF 成本与 DPO2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:395(搜「高昂」) · text/06-ch02-05-2-5-decoder-only.txt:403(搜「DPO」) · text/06-ch02-05-2-5-decoder-only.txt:441(搜「省略了单独构建奖励模型」)
ChatGPT、图灵测试与闭源2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:457(搜「一鸣惊人」) · text/06-ch02-05-2-5-decoder-only.txt:459(搜「图灵测试」) · text/06-ch02-05-2-5-decoder-only.txt:463(搜「LLMaaS」) · text/06-ch02-05-2-5-decoder-only.txt:466(搜「走向闭源」)
GPT-4 双模态2.5.2 GPT 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:476(搜「图文双模态」)
两路线之别2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:511(搜「同步提升」)
LLaMA-1 小模型大数据2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:533(搜「小模型 + 大数据」) · text/06-ch02-05-2-5-decoder-only.txt:525(搜「约 5TB」)
三处改装2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:557(搜「旋转位置编码」) · text/06-ch02-05-2-5-decoder-only.txt:575(搜「SwiGLU」)
LLaMA-2 RLHF 与 GQA2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:601(搜「人类反馈强化学习」) · text/06-ch02-05-2-5-decoder-only.txt:607(搜「拒绝采样」) · text/06-ch02-05-2-5-decoder-only.txt:615(搜「分组查询注意力」)
LLaMA-3 数据的力量2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:634(搜「50TB」) · text/06-ch02-05-2-5-decoder-only.txt:645(搜「超越 LLaMA2 700 亿」) · text/06-ch02-05-2-5-decoder-only.txt:665(搜「数据的力量」)
衍生三家族2.5.3 LLAMA 系列语言模型text/06-ch02-05-2-5-decoder-only.txt:679(搜「Alpaca」) · text/06-ch02-05-2-5-decoder-only.txt:694(搜「CodeLLaMA」) · text/06-ch02-05-2-5-decoder-only.txt:710(搜「LLaVA」)

Footnotes

  1. 出处:「2.1.1 大数据+大模型→能力增强」第 36 段(text/02-ch02-01-2-1.txt:36,搜「架构」)。原文:「在模型规模相同的情况下,模型的具体架构对其性能的影响相对较小」;实验范围(2200 万到 230 亿 token、768 到 15 亿参数)在第 90 段(text/02-ch02-01-2-1.txt:90,搜「2200 万」)。

  2. 出处:「2.1.1 大数据+大模型→能力增强」第 126 段(text/02-ch02-01-2-1.txt:126,搜「0.73」)。C≈6ND 与 5.37 倍/1.86 倍的换算同段。

  3. 出处:「2.1.1 大数据+大模型→能力增强」第 157 段(text/02-ch02-01-2-1.txt:157,搜「0.46」)与第 82 段(text/02-ch02-01-2-1.txt:82,搜「Chinchilla 扩展法则」)。实验范围在第 145 段(text/02-ch02-01-2-1.txt:145,搜「7000 万」)。

  4. 出处:「2.1.1 大数据+大模型→能力增强」第 165 段(text/02-ch02-01-2-1.txt:165,搜「理想的数据集大小应当是模型规模的」)与第 169 段(text/02-ch02-01-2-1.txt:169,搜「140B」)。

  5. 出处:「2.1.1 大数据+大模型→能力增强」第 171 段(text/02-ch02-01-2-1.txt:171,搜「3000 亿」)与第 175 段(text/02-ch02-01-2-1.txt:175,搜「2700 亿」)。

  6. 出处:「2.1.1 大数据+大模型→能力增强」第 177 段(text/02-ch02-01-2-1.txt:177,搜「显著突破」)与第 161 段(text/02-ch02-01-2-1.txt:161,搜「PaLM 2」)。

  7. 出处:「2.1.2 大数据+大模型→能力扩展」第 196 段(text/02-ch02-01-2-1.txt:196,搜「涌现能力」)。四能力列举与「并非通过专项训练获得」同段。

  8. 出处:「2.1.2 大数据+大模型→能力扩展」第 219 段(text/02-ch02-01-2-1.txt:219,搜「相变」)。

  9. 出处:「2.1.2 大数据+大模型→能力扩展」第 3 段起(text/02-ch02-01-2-1.txt:227,搜「上下文学习」)至第 281 段(text/02-ch02-01-2-1.txt:281,搜「逻辑推理」)。三档规模的图示在图 2.2(text/02-ch02-01-2-1.txt:215,搜「1750亿参数」)。

  10. 出处:「2.1.2 大数据+大模型→能力扩展」末段(text/03-ch02-02-2-2.txt:13,搜「可解释性」)。

  11. 出处:「2.5.2 GPT 系列语言模型」第 102 段(text/06-ch02-05-2-5-decoder-only.txt:102,搜「Ilya Sutskever」)与第 112 段(text/06-ch02-05-2-5-decoder-only.txt:112,搜「GPT-1 开创了」)。1.17 亿/12 块/8 亿 token 见第 129 段(text/06-ch02-05-2-5-decoder-only.txt:129,搜「1.17 亿」)。

  12. 出处:「2.5.2 GPT 系列语言模型」第 135 段(text/06-ch02-05-2-5-decoder-only.txt:135,搜「本质区别」)。

  13. 出处:「2.5.2 GPT 系列语言模型」第 220 段(text/06-ch02-05-2-5-decoder-only.txt:220,搜「遮盖了」)。

  14. 出处:「2.5.2 GPT 系列语言模型」第 256 段(text/06-ch02-05-2-5-decoder-only.txt:256,搜「15 亿」)与第 277 段(text/06-ch02-05-2-5-decoder-only.txt:277,搜「零样本」)。

  15. 出处:「2.5.2 GPT 系列语言模型」第 287 段(text/06-ch02-05-2-5-decoder-only.txt:287,搜「上下文学习」)与第 299 段(text/06-ch02-05-2-5-decoder-only.txt:299,搜「1750 亿」)。

  16. 出处:「2.5.2 GPT 系列语言模型」第 356 段(text/06-ch02-05-2-5-decoder-only.txt:356,搜「Codex」)与第 362 段(text/06-ch02-05-2-5-decoder-only.txt:362,搜「RLHF」)。

  17. 出处:「2.5.2 GPT 系列语言模型」第 373 段(text/06-ch02-05-2-5-decoder-only.txt:373,搜「三个步骤」)。图 2.15 的偏好顺序(输出2 > 输出4 > 输出1 = 输出3)与 0.85 打分见图内文字(text/06-ch02-05-2-5-decoder-only.txt:431,搜「偏好顺序」;text/06-ch02-05-2-5-decoder-only.txt:434,搜「0.85」)。

  18. 出处:「2.5.2 GPT 系列语言模型」第 395 段(text/06-ch02-05-2-5-decoder-only.txt:395,搜「高昂」)。

  19. 出处:「2.5.2 GPT 系列语言模型」第 403 段(text/06-ch02-05-2-5-decoder-only.txt:403,搜「DPO」)与第 441 段(text/06-ch02-05-2-5-decoder-only.txt:441,搜「省略了单独构建奖励模型」)。复杂偏好略逊在第 449 段(text/06-ch02-05-2-5-decoder-only.txt:449,搜「略逊」)。

  20. 出处:「2.5.2 GPT 系列语言模型」第 457 段(text/06-ch02-05-2-5-decoder-only.txt:457,搜「一鸣惊人」)、第 459 段(text/06-ch02-05-2-5-decoder-only.txt:459,搜「图灵测试」)、第 463 段(text/06-ch02-05-2-5-decoder-only.txt:463,搜「LLMaaS」)与第 466 段(text/06-ch02-05-2-5-decoder-only.txt:466,搜「走向闭源」)。

  21. 出处:「2.5.2 GPT 系列语言模型」第 476 段(text/06-ch02-05-2-5-decoder-only.txt:476,搜「图文双模态」)与第 482 段(text/06-ch02-05-2-5-decoder-only.txt:482,搜「GPT-4o」)。

  22. 出处:「2.5.3 LLAMA 系列语言模型」第 511 段(text/06-ch02-05-2-5-decoder-only.txt:511,搜「同步提升」)。

  23. 出处:「2.5.3 LLAMA 系列语言模型」第 533 段(text/06-ch02-05-2-5-decoder-only.txt:533,搜「小模型 + 大数据」)。参数与语料表 2.5(text/06-ch02-05-2-5-decoder-only.txt:525,搜「约 5TB」)。

  24. 出处:「2.5.3 LLAMA 系列语言模型」第 557 段(text/06-ch02-05-2-5-decoder-only.txt:557,搜「旋转位置编码」)与第 575 段(text/06-ch02-05-2-5-decoder-only.txt:575,搜「SwiGLU」);Pre-Norm 同段(text/06-ch02-05-2-5-decoder-only.txt:579,搜「Pre-Norm」)。

  25. 出处:「2.5.3 LLAMA 系列语言模型」第 601 段(text/06-ch02-05-2-5-decoder-only.txt:601,搜「人类反馈强化学习」)、第 607 段(text/06-ch02-05-2-5-decoder-only.txt:607,搜「拒绝采样」)与第 615 段(text/06-ch02-05-2-5-decoder-only.txt:615,搜「分组查询注意力」)。

  26. 出处:「2.5.3 LLAMA 系列语言模型」第 634 段(text/06-ch02-05-2-5-decoder-only.txt:634,搜「50TB」)与第 645 段(text/06-ch02-05-2-5-decoder-only.txt:645,搜「超越 LLaMA2 700 亿」)、第 647 段(text/06-ch02-05-2-5-decoder-only.txt:647,搜「业界标杆」)。

  27. 出处:「2.5.3 LLAMA 系列语言模型」第 653 段(text/06-ch02-05-2-5-decoder-only.txt:653,搜「三倍」)与第 665 段(text/06-ch02-05-2-5-decoder-only.txt:665,搜「数据的力量」)。

  28. 出处:「2.5.3 LLAMA 系列语言模型」第 679 段(text/06-ch02-05-2-5-decoder-only.txt:679,搜「Alpaca」)、第 694 段(text/06-ch02-05-2-5-decoder-only.txt:694,搜「CodeLLaMA」)与第 710 段(text/06-ch02-05-2-5-decoder-only.txt:710,搜「LLaVA」)。