跳到主要内容

第 21 章的骨架是「能不能」;这一章是「养不养得起」。 模型更深、上下文更长、并发(同时服务更多请求)更高之后,每一处改动都有一个共同的判别题: 你改的是数学结果,还是只是实现方式?——把这题问清楚,四条优化线就不会看乱。

现代 Transformer 的四条优化线

1. 这一章讲什么

两件事: 现代 Transformer 的四条优化线各解决什么病(块内结构、长上下文、 推断系统、容量扩展);以及贯穿全章的那把尺子—— 改了数学,还是只改了实现

它在全书链条里的位置: 第 21 章立起的骨架是 2017 年的形状; 这一章是它演化到 2026 年大模型时代的检修记录。 它同时兑现三笔旧账:第 12 章门控单元在架构里的落点(SwiGLU)、 第 16 章「把递推线性化」的去处(状态空间模型)、 第 20 章「T×T 分数表」的讨价还价。

需要第 21 章;第 6 节呼应第 16 章。

2. 顶层全景

原始骨架:注意力 + 前馈 + 残差连接 + 规范化(可堆叠块)

四条优化线,各治一个病:
┌────────────┬──────────────────────────┬─────────────────┐
│ 块内结构 │ Pre-Norm · RMSNorm · SwiGLU │ 稳训练 + 表示力 │ 不改复杂度
│ 长上下文 │ 位置外推 · 局部稀疏 · 线性注意力│ 平方瓶颈 │ 有的改数学
│ 推断系统 │ KV缓存 · GQA · 分页 · 投机 │ 生成延迟与显存 │ 不改数学
│ 容量扩展 │ 混合专家 MoE │ 参数规模 │ 激活≪参数
└────────────┴──────────────────────────┴─────────────────┘

一句话链条: 深了训不稳 → 规范化挪到子层前面、前馈装上门控; 序列长了算不动 → 位置能外推、连接改稀疏、或干脆线性化成递推; 生成一步一重算太浪费 → 缓存(算过的先存着备用)是第一原则:

历史的键值缓存(K、V 存下来给后面的步复用)、多个查询共用这份存档、 页化内存、小模型先猜大模型验; 参数想大又想算得少 → 每个词元只请几位专家出诊。

3. 块内结构(一):规范化挪到子层前面

原始 Transformer 的块是「先残差相加、后规范化」(Post-Norm); 现代大模型普遍反过来(Pre-Norm):先规范化、再进子层、最后残差相加1:

Post-Norm: Z = norm(X + f(X)) 先干完活再体检
Pre-Norm : Z = X + f(norm(X)) 先体检再干活

为什么倒一下就有效?书的直观:Pre-Norm 给每个子层提供了更稳定的输入尺度, 通常更利于深层网络中的梯度传播,因此更容易训练2—— 每个子层收到的都是刚被规范化过的输入,不管它上面已经堆了多少层。 配套地,层规范化常被替换成更简洁的 RMSNorm(去掉均值中心化,只调尺度), 形式简单、更适合大规模实现3——第 18 章那个「第三条路」, 在这里找到了它的主战场。

4. 块内结构(二):前馈层装上门控

原始前馈层是「升维→ReLU→降维」的两层网络。现代模型的一类常见改进是 门控前馈网络,代表是 SwiGLU:

FFN(z) = W₂( swish(W₁z) ⊙ (W₃z) ) 其中 swish(x) = x·σ(x)

两个分支:一支算内容(W₃z),一支算门(swish(W₁z)),逐元素相乘后再投影4这就是第 12 章那个门控单元(输入一支、门控一支、相乘输出)在 Transformer 架构里的落点: 当年它出现在循环网络的细胞门上,如今站在了每个 Transformer 块的前馈位置。 书给的收益口径:通过额外的门分支对信息流进行调制,相近计算预算下提升表示能力5 ——多了一组权重,换来「让另一支决定本支通过多少」的选择性。

把这些拼起来,一个典型的现代块是:

Z = H + Self-Attn(norm(H)) Pre-Norm + 注意力(常配 RoPE、GQA)
H′ = Z + FFN_gated(norm(Z)) Pre-Norm + 门控前馈(或 MoE,见第 8 节)

骨架没变——书强调「核心变化并不是抛弃 Transformer, 而是对块内部的信息流路径做改造」;这类改动不会改变自注意力的渐近复杂度6

5. 一样的结果,不一样的算法:闪存注意力

标准的注意力实现先显式构造 T×T 的打分矩阵,再做 softmax、再乘 V。 FlashAttention 换了一种算法组织,动机写得很老实: 长序列下真正的瓶颈常常不只是算术量,而是访存开销—— 巨大的中间矩阵在显存和片上高速缓存之间来回搬运7

做法三点8:

① 按块处理:Q、K、V 切成小块,不一次造出整张 T×T 矩阵
② 块内计算、块间累积:每个查询块逐个扫键值块,局部算分、逐步累计输出
③ 在线 softmax:扫描过程中维护每行的最大值与归一化常数,扫完恰好归一完成

最重要的定性写在书里:它不是近似,也不是少算——算的还是同一个 V·softmax(KᵀQ/√D_k),结果与标准实现一致;变的只是 「边分块(切成小块处理)计算、边完成归一化与累积」的次序,把中间激活存储从显式二次压到接近线性, 省下的是显存读写9。书的边注把全章的尺子第一次亮出来: FlashAttention 属于精确实现优化;局部窗口、稀疏、线性注意力才属于改变连接模式或近似形式10

6. 长上下文:平方账单的三种还法

标准自注意力两两算分,时间空间都随 T 平方增长。书把长上下文的挑战拆成三层: 注意力本身的平方增长、位置表示的外推、推断时 KV 缓存随上下文线性增长11。 (第三条是第 7 节的主角。)

还法一:让位置编码能外推。 RoPE(第 21 章)是长上下文的基础方案, ALiBi 的线性偏置提供更简单的外推;YaRN、LongRoPE 等进一步在 RoPE 之上 重新缩放或插值位置频率,延长可用窗口——共同点是不动主干、只改位置表示12。 书还给了句清醒话:更大的上下文窗口(一次能看的最大长度)首先提供的是「可访问范围」, 模型能否真正利用长距离信息,还取决于训练数据、任务和注意力模式13—— 窗口大不等于读得进去。

还法二:改连接模式。 局部窗口注意力:每个位置只与相邻窗口交互, 牺牲全局感受野,换计算与存储的显著下降;再靠跨块连接、滑动窗口、少量全局词元 把远距离信息逐层传开14

还法三:把数学改掉——线性注意力。 用核函数近似消掉 softmax 的非线性耦合, 注意力可以重新排列成 O(T) 复杂度的矩阵乘法(Performer 用随机特征映射近似 softmax 核)15。 然后是本章最值得停留的一段,它在兑现第 16 章的伏笔:

查询-键交互被简化为线性形式后,整个注意力层可以等价地写成一个递推更新的形式—— 每个时间步只根据当前输入更新一个固定大小的「状态矩阵」,不必回顾所有历史位置。 线性注意力在数学上可以看作一种特殊的循环神经网络16

第 16 章末尾说「把那条递推式拉直会通往哪儿」,答案就是这里: 循环(串行递推)和注意力(并行全看)不是两个物种,是同一种计算的两种组织次序

状态空间模型(SSM) 是同方向的另一条路:借鉴连续时间线性系统, 把序列建模写成隐状态递推 h̄ₜ=Āh̄ₜ₋₁+B̄xₜ、yₜ=Ch̄ₜ17。 早期的 S4 给 A 施加特殊结构(对角化、专为长程记忆设计的初始化)实现长程记忆, 并用卷积视角让训练可以并行18;Mamba 再加选择性机制——让 B̄、C 依赖当前输入, 由内容决定「记住什么、忘记什么」,在保持线性复杂度和恒定推断内存的同时, 性能达到与同规模 Transformer 相当19。 三种方案权衡放一排:Transformer 花 O(T²) 买全局交互; 线性注意力和 SSM 用固定大小的状态压缩历史换 O(T),代价是精确回溯远处细节受限; 常见折中是同一模型里交替使用注意力层和 SSM 层20

7. 推断系统:生成时别重算

训练和推断的瓶颈根本不同。 训练时目标序列已知,教师强制并行整段送入, 愁的是激活存储和反向传播;推断时逐词元生成、无反向传播, 愁的是单步延迟、显存占用和访存带宽(搬运数据的通道宽窄)21。系统上还分两个形态不同的阶段: 前缀填充(prefill) 把整段输入并行算完、一次性写入缓存,像训练; 解码(decode) 之后每生成一个词元,围绕缓存做「读缓存—算当前—追加」的小步迭代22

KV 缓存是这一切的地基:第 t 步只需要当前词元的查询, 但历史的键和值不必重算——每层每步只算 (qₜ,kₜ,vₜ) 三个向量,追加进缓存, 注意力只在当前查询与全部历史键值之间算23

主走查:一张缓存的账

设定: 一个 32 头、每头 128 维、48 层的解码器模型,已生成 1000 个词元。 层数头数是常见配置量级,下面的账全部按公式现算。

缓存的数(不按字节按个数):
每层每头:2 份(K 和 V)× 1000 个位置 × 128 维 = 256,000 个数
全模型: 48 层 × 32 头 × 256,000 = 393,216,000 个数
按每个数 2 字节(fp16,这个换算率是我们的设定)≈ 786 MB

不缓存要付多少? 若第 1000 步把整个前缀重新前向一遍, 仅注意力打分一项:每层每头要算 1000×1000 = 10⁶ 个分数, 全模型 48×32×10⁶ ≈ 1.54×10⁹ 个分数;有缓存只算 1000 个查询分数 ×1536 ≈ 1.5×10⁶—— 单步差一千倍。这就是「生成时别重算」六个字的含金量。

再砍缓存:GQA。 缓存里存的是键值头,不是查询头——于是让多个查询头共享同一组键值: MQA 全体共享一组;分组查询(把头分组共享)注意力 GQA 把 M 个查询头分成 G 组、同组共享, G=M 退化成标准多头,G=1 退化成 MQA24。把 32 组键值换成 4 组(G=4):

缓存 = 393,216,000 × (4/32) = 49,152,000 个数 ≈ 98 MB —— 降为 1/8

最后两级火箭: 分页注意力像操作系统管内存一样分页组织 KV 缓存, 减少连续扩容与内存碎片,提高多请求并发下的利用率—— 优化的战场已经移出网络结构,进入服务系统的内存组织25; 投机解码让一个更小更快的草稿模型先提出若干候选词,目标模型并行验证, 保持输出分布不变的前提下降低平均生成时延(等一句话的时间)26

8. 容量扩展:混合专家

前述都不改「参数多少」。混合专家(MoE) 就是把前馈层换成多个专家子网络、每次只让少数几个干活,改的是「参数和计算的关系」: 在前馈层位置准备 E 个专家网络,由一个路由器按当前输入打门控分, 只选得分最高的 k 个参与计算27:

MoE(h) = Σ_{e∈TopK(g(h),k)} α_e(h) · Expert_e(h)

收益:总参数可以非常大,但每个词元只激活少数几个专家—— 计算量不必与总参数量同比增长28。参照物在本书后面一章: DeepSeek-V3 总参数 671B,每个词元仅激活约 37B29—— 「大」和「每一步的贵」从此解耦。

代价书列了三条:专家负载不均衡(大家挤少数热门专家)、路由不稳定、 多设备通信开销;对策也各有其名:共享专家保底基础能力、细粒度专家 提高选择灵活性、辅助的负载均衡损失稳定路由30。 定性一句话:MoE 不是对注意力本身的优化,而是容量扩展方向上的独立演化路线31

9. 作者的判断与证据

书里给了明确的定性判断: Pre-Norm 更稳的直观解释2;FlashAttention 精确不近似9; 线性注意力=特殊 RNN 的数学判断16;MoE 与注意力的关系划定31

书里给了实测口径的: SwiGLU「相近计算预算下提升表示能力」5; Mamba「与同规模 Transformer 相当的性能、线性复杂度、恒定推断内存」19; DeepSeek-V3 的 671B/37B29

书里给了清醒话的: 窗口大 ≠ 读得进13;SSM 精确回溯长距离细节受限20; 现代 Transformer「不只是静态网络结构,而是围绕训练、长上下文建模和高吞吐(单位时间出词多)推断 共同设计的系统」32

10. 边界与局限

四条线之外的创新不在本章:更细的量化(数值压到低比特)、蒸馏、架构搜索都只字未提或仅点名, 本章是「主流大模型块」的横切面,不是变更全集——书自己声明「不试图穷尽所有变体」33

线性注意力与 SSM 的近似代价只有一句:「可能在需要精确回溯长距离细节时受限」20—— 什么任务会踩这个坑,需要实验文献,书没给。

推断系统的数字全部依赖配置:本节走查的 786 MB、一千倍都是公式现算, 真实部署还有量化、多请求批处理等变量;书给的形态(两阶段、缓存结构)是稳定的, 数字不是。

MoE 的路由是学习出来的:路由器怎么训练、专家塌缩怎么救,书只列了对策名单30, 没展开任何一种的机制。

11. 可带走的

  1. 四条线的地图:块内(稳+表达)· 长上下文(平方账)· 推断系统(延迟显存)· 容量扩展(参数);
  2. Pre-Norm 把规范化挪到子层前,深层训练更稳;LN 常换成 RMSNorm;
  3. SwiGLU = 第 12 章门控单元在 Transformer 前馈层的落点:一支算内容、一支当门;
  4. FlashAttention 结果不变、次序变:分块+在线 softmax,把访存从二次压到近线性; 判别口诀:先问「改了数学还是改了实现」;
  5. 长上下文三层挑战:平方注意力、位置外推、缓存增长;YaRN/LongRoPE 靠重标定频率;
  6. 窗口大只是可访问范围大,用不用得上看训练和任务;
  7. 线性注意力可写成固定状态矩阵的递推——它就是一种特殊的 RNN; Mamba 的选择性机制=让状态更新依赖内容;
  8. KV 缓存省掉重算,单步千倍级;GQA 用查询头共享键值头,缓存按 G/M 比例缩;
  9. 分页注意力把内存管理带进模型服务;投机解码「先猜后验」不改输出分布;
  10. MoE:总参数 671B、每词元只激活 37B——大和贵从此是两个数。

12. 原文地图

主题原书章原文位置
模板观与四条线第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:786(搜「列计算的通用模板」) · text/09-ch08-8-transformer.txt:792(搜「可训练、可扩展、可部署」)
Pre-Norm/Post-Norm第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:834(搜「分别称为Pre-Norm和Post-Norm」) · text/09-ch08-8-transformer.txt:840(搜「Post-Norm结构」) · text/09-ch08-8-transformer.txt:842(搜「Pre-Norm 为每个子层提供了更稳定的输入尺度」)
RMSNorm 替换第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:844(搜「更简洁的RMS 规范化」)
SwiGLU 门控前馈第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:857(搜「门控前馈网络(Gated FFN」) · text/09-ch08-8-transformer.txt:862(搜「相近计算预算下提升表示能力」)
现代块与边界第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:868(搜「并不是抛弃 Transformer」)
闪存注意力第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:883(搜「真正的瓶颈常常不只是算术运算量」) · text/09-ch08-8-transformer.txt:920(搜「在线 Softmax:在扫描所有键值块」) · text/09-ch08-8-transformer.txt:923(搜「并不是通过“少算一些位置”来加速」) · text/09-ch08-8-transformer.txt:930(搜「中间激活存储」)
精确 vs 近似第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:935(搜「并没有 改 变 注 意 力」)
长上下文三挑战第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:943(搜「至少同时涉及三方面挑战」)
位置外推第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:962(搜「重新缩放或插值位置频率」) · text/09-ch08-8-transformer.txt:967(搜「可访问范围,至于模型能否有效利用」)
局部窗口第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:972(搜「每个位置只与相邻窗口中的若干位置交互」)
线性注意力与递推第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:983(搜「重新排列为」) · text/09-ch08-8-transformer.txt:988(搜「等价地写成一个递推更新的形」) · text/09-ch08-8-transformer.txt:990(搜「线性注意力在数学上可以看作一种特殊的循环神经」)
SSM 与 Mamba第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:993(搜「借鉴连续时间线性系统理论」) · text/09-ch08-8-transformer.txt:1004(搜「引入了选择性机制:让」)
三种权衡第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1010(搜「代价换取更灵活的全局交互」) · text/09-ch08-8-transformer.txt:1013(搜「交替使用注意力层和 SSM 层」)
两阶段推断第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1017(搜「训练阶段和推断阶段面临的瓶颈并不相同」) · text/09-ch08-8-transformer.txt:1023(搜「前缀填充阶段:」) · text/09-ch08-8-transformer.txt:1028(搜「逐词元解码阶段(Decode」)
KV 缓存第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1048(搜「KV 缓存与增量解码」)
MQA/GQA第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1080(搜「Multi-Query Attention,MQA」) · text/09-ch08-8-transformer.txt:1081(搜「Grouped-Query Attention」)
分页与投机第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1106(搜「分页注意力(PagedAttention」) · text/09-ch08-8-transformer.txt:1109(搜「内存组织方式中」) · text/09-ch08-8-transformer.txt:1110(搜「投机解码(Speculative Decoding」) · text/09-ch08-8-transformer.txt:1112(搜「输出分布不变的前提下」)
MoE第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1119(搜「混合专家(Mixture of Experts」) · text/09-ch08-8-transformer.txt:1132(搜「每个位置实际只激活少数」) · text/09-ch08-8-transformer.txt:1135(搜「专家负载不均衡」) · text/09-ch08-8-transformer.txt:1138(搜「不是对注意力本身的优化」)
演化总表与系统观第8章 注意力机制与Transformertext/09-ch08-8-transformer.txt:1148(搜「常见演化方向」) · text/09-ch08-8-transformer.txt:1208(搜「共同设计的系统」)
DeepSeek-V3 参照第13章 大语言模型与智能体text/14-ch13.txt:295(搜「DeepSeek-V3」)

Footnotes

  1. 出处:「第8章 注意力机制与Transformer」第 834 至 840 段 (text/09-ch08-8-transformer.txt:834,搜「分别称为Pre-Norm和Post-Norm」; text/09-ch08-8-transformer.txt:840,搜「Post-Norm结构」),式(8.45)-(8.46)[Xiong et al., 2020]。

  2. 出处:「第8章 注意力机制与Transformer」第 842 段(text/09-ch08-8-transformer.txt:842,搜「Pre-Norm 为每个子层提供了更稳定的输入尺度」)。 2

  3. 出处:「第8章 注意力机制与Transformer」第 844 至 850 段(text/09-ch08-8-transformer.txt:844,搜「更简洁的RMS 规范化」),式(8.47)。

  4. 出处:「第8章 注意力机制与Transformer」第 857 至 861 段(text/09-ch08-8-transformer.txt:857,搜「门控前馈网络(Gated FFN」), 式(8.48),swish(x)=xσ(x)。

  5. 出处:「第8章 注意力机制与Transformer」第 862 段(text/09-ch08-8-transformer.txt:862,搜「相近计算预算下提升表示能力」)。 2

  6. 出处:「第8章 注意力机制与Transformer」第 866 至 870 段 (搜「对块内部的信息流路径做更适合大规模训练的改造」定位); 渐近复杂度不变的说明在同节末段。

  7. 出处:「第8章 注意力机制与Transformer」第 880 至 884 段(text/09-ch08-8-transformer.txt:883,搜「真正的瓶颈常常不只是算术运算量」), [Dao et al., 2022]。

  8. 出处:「第8章 注意力机制与Transformer」第 888 至 922 段(text/09-ch08-8-transformer.txt:920,搜「在线 Softmax:在扫描所有键值块」), 三点为原文列举。

  9. 出处:「第8章 注意力机制与Transformer」第 923 至 932 段(text/09-ch08-8-transformer.txt:923,搜「并不是通过“少算一些位置”来加速」; text/09-ch08-8-transformer.txt:930,搜「中间激活存储」)。 2

  10. 出处:「第8章 注意力机制与Transformer」第 934 至 938 段(text/09-ch08-8-transformer.txt:936,搜「精确」所在边注; 排版跨行,语义为「FlashAttention 并没有改变注意力的数学结果,它属于精确实现优化」)。

  11. 出处:「第8章 注意力机制与Transformer」第 938 至 944 段(text/09-ch08-8-transformer.txt:943,搜「至少同时涉及三方面挑战」)。

  12. 出处:「第8章 注意力机制与Transformer」第 956 至 964 段(text/09-ch08-8-transformer.txt:962,搜「重新缩放或插值位置频率」)[Ding et al., 2024; Peng et al., 2024]。

  13. 出处:「第8章 注意力机制与Transformer」第 966 至 968 段(text/09-ch08-8-transformer.txt:967,搜「可访问范围,至于模型能否有效利用」)。 2

  14. 出处:「第8章 注意力机制与Transformer」第 970 至 978 段(text/09-ch08-8-transformer.txt:972,搜「每个位置只与相邻窗口中的若干位置交互」)。

  15. 出处:「第8章 注意力机制与Transformer」第 980 至 986 段(text/09-ch08-8-transformer.txt:983,搜「重新排列为」; Performer 随机特征见第 986 段)[Choromanski et al., 2021]。

  16. 出处:「第8章 注意力机制与Transformer」第 988 至 990 段(text/09-ch08-8-transformer.txt:988,搜「等价地写成一个递推更新的形」; text/09-ch08-8-transformer.txt:990,搜「线性注意力在数学上可以看作一种特殊的循环神经」)。 2

  17. 出处:「第8章 注意力机制与Transformer」第 993 至 999 段(text/09-ch08-8-transformer.txt:993,搜「借鉴连续时间线性系统理论」), 式(8.52)-(8.53)。

  18. 出处:「第8章 注意力机制与Transformer」第 1002 段(text/09-ch08-8-transformer.txt:1002,搜「HiPPO」)[Gu et al., 2022]。

  19. 出处:「第8章 注意力机制与Transformer」第 1002 至 1010 段(text/09-ch08-8-transformer.txt:1004,搜「引入了选择性机制:让」)[Gu et al., 2023]。 2

  20. 出处:「第8章 注意力机制与Transformer」第 1009 至 1014 段 (text/09-ch08-8-transformer.txt:1010,搜「种不同的权衡方式」; text/09-ch08-8-transformer.txt:1013,搜「交替使用注意力层和 SSM 层」)。 2 3

  21. 出处:「第8章 注意力机制与Transformer」第 1017 至 1021 段(text/09-ch08-8-transformer.txt:1017,搜「训练阶段和推断阶段面临的瓶颈并不相同」)。

  22. 出处:「第8章 注意力机制与Transformer」第 1023 至 1046 段(text/09-ch08-8-transformer.txt:1023,搜「前缀填充阶段:」; text/09-ch08-8-transformer.txt:1028,搜「逐词元解码阶段(Decode」),图 8.13。

  23. 出处:「第8章 注意力机制与Transformer」第 1048 至 1070 段(text/09-ch08-8-transformer.txt:1059,搜「追加到缓存」),式(8.54)-(8.57)。

  24. 出处:「第8章 注意力机制与Transformer」第 1072 至 1100 段(text/09-ch08-8-transformer.txt:1080,搜「Multi-Query Attention,MQA」; text/09-ch08-8-transformer.txt:1081,搜「Grouped-Query Attention」),式(8.58)[Shazeer, 2019; Ainslie et al., 2023]。

  25. 出处:「第8章 注意力机制与Transformer」第 1104 至 1109 段(text/09-ch08-8-transformer.txt:1106,搜「分页注意力(PagedAttention」; text/09-ch08-8-transformer.txt:1109,搜「内存组织方式中」)[Kwon et al., 2023]。

  26. 出处:「第8章 注意力机制与Transformer」第 1110 至 1114 段(text/09-ch08-8-transformer.txt:1112,搜「输出分布不变的前提下」)[Leviathan et al., 2023]。

  27. 出处:「第8章 注意力机制与Transformer」第 1117 至 1130 段(text/09-ch08-8-transformer.txt:1119,搜「混合专家(Mixture of Experts」), 式(8.59)-(8.60)[Shazeer et al., 2017]。

  28. 出处:「第8章 注意力机制与Transformer」第 1132 段(text/09-ch08-8-transformer.txt:1132,搜「每个位置实际只激活少数」)。

  29. 出处:「第13章 大语言模型与智能体」第 295 至 296 段(text/14-ch13.txt:295,搜「DeepSeek-V3」)。 原文:「DeepSeek-V3 总参数量为 671B,但每个词元仅激活约 37B 参数。」 2

  30. 出处:「第8章 注意力机制与Transformer」第 1135 至 1140 段(text/09-ch08-8-transformer.txt:1135,搜「专家负载不均衡」; 共享专家、细粒度专家、负载均衡损失在同段)。 2

  31. 出处:「第8章 注意力机制与Transformer」第 1138 段(text/09-ch08-8-transformer.txt:1138,搜「不是对注意力本身的优化」)。 2

  32. 出处:「第8章 注意力机制与Transformer」第 1208 段(text/09-ch08-8-transformer.txt:1208,搜「共同设计的系统」)。

  33. 出处:「第8章 注意力机制与Transformer」第 788 段(text/09-ch08-8-transformer.txt:788,搜「而不试图」)。