跳到主要内容

这一章治一种精确的病:不是「记不住」这种模糊的说法,而是可以逐项写出下落的机制—— 误差每往回走一步都要乘一次同样的数。药也很精确:让那条传递路径从「连乘」变成「连加」。

长程依赖与门控:间隔一拉长就学不动

1. 这一章讲什么

三件事: 循环网络的长程依赖问题的机理(误差的连乘结构); 三条改进路线各自的得与失(调参凑恒等 / 加法更新 / 门控); 以及循环网络在深度和方向上的扩展,还有它通向更一般结构的两条路。

它在全书链条里的位置: 这是「序列建模的两难」的正面回答—— 第 15 章给了记忆,但没给远处的记忆;这一章指出原因, 并交出历史上最成功的那个解(LSTM 的加法通道)。 它的两个出口也各指向后文:链→树→图的推广在第 23 章变成消息传递, 递推的线性化复兴就是第 22 章的状态空间(隐状态递推)模型。

需要第 15 章;第 01 章的特征值概念回来承重一次。

2. 顶层全景

误差回传每步都乘 diag(f′(z))Uᵀ 缩放因子 ρ 由 U 的谱半径决定
│ │
ρ ≈ 0.6(演示取值) ρ < 1 → 消失(常见)
│ ρ > 1 → 爆炸(好治)

治爆炸:权重衰减压参数、梯度截断砍大值 ← 工程手段
治消失:改模型 ← 本章主线

├─ hₜ = hₜ₋₁ + g(xₜ) 加法保梯度,丢非线性+会饱和
├─ LSTM:cₜ = f⊙cₜ₋₁ + i⊙c̃ₜ 加法 + 三个软开关,f≈1 时梯度近恒等
└─ GRU:hₜ = z⊙hₜ₋₁ + (1−z)⊙h̃ₜ 两扇门,保留与写入互补

扩展:纵向堆叠加深 | 双向补未来 | 推广到树(RvNN)/图(GNN) | 线性化→SSM

一句话链条: 时间上乘法传误差 → 远端贡献指数衰减或爆炸 → 爆炸能剪、消失只能换结构 → 结构的最优解是「一条只做加法的记忆通道 + 用学出来的开关控制读写」→ 这套思想随后溢出序列模型, 成了残差连接与注意力共用的底层想法。

3. 主走查先行的机理课:把间隔拉到二十步

接着第 8 节那台一维机器算。 那里每步回传都在乘一个小于 1 的因子(f′×0.5); 书里把这个普遍规律写成了公式(式 6.49-6.50): δ_{t,k} ≈ ρ^{t−k}·δ_{t,t},其中 ρ 是 ‖diag(f′)·Uᵀ‖—— 从 k 走到 t 一路连乘同一个因子的模1

ρ 接多大?书给了一个干净的判据:看权重矩阵 U 的谱半径—— 它所有特征值的模里最大的那一个2。 大于 1,倾向于爆炸;小于 1,倾向于消失。 (特征值在第 01 章登场过:「只被拉长不被转向」的方向被拉长的倍数; 谱半径 = 最猛的那个倍数。)

现在兑现承诺:拿真数字走一遍间隔拉长。 设定为演示编的:假设平均下来每步的缩放因子 ρ 取 0.6(小于 1,这在这种网络上很正常), 看 20 步之前的误差传到现在还剩多少:

隔 5 步: 0.6⁵ = 0.0778 ── 已经只剩 8%
隔10步: 0.6¹⁰ = 0.00605
隔20步: 0.6²⁰ = 0.0000366 ── 十万分之三强

对比一下量级:隔 20 步传回来的信号只有隔 1 步的三千六百万分之一 (0.6 对 3.66×10⁻⁵)。训练信号弱成这样,等价于「远处发生过的事对你没有发言权」。

同一台机器换成 LSTM 再看一眼: LSTM 记忆单元上的传递系数是遗忘门 f_t, 它可以被学到接近 1。取 f_t=0.99(同样是演示取值): 0.99²⁰ ≈ 0.82——隔 20 步还剩八成多的强度,而普通 RNN 只剩十万分之三。 两者的差距约二十二万倍,全部来自「每步乘 0.99 还是乘 0.6」这一个差别。

这就是本章剩下所有内容的动机。书里的结论原话值得抄: 简单循环网络理论上可以建立长时间间隔状态之间的依赖关系, 但由于梯度爆炸或消失,实际上只能学习到短期的依赖关系3

4. 消失的到底是什么

一个容易全错的地方,书专门用了边注来纠正: 梯度消失不是说 ∂ℒ/∂U 这个 参数梯度变成了零,而是 ∂ℒ_t/∂h_k 在间隔大时趋于零4。 翻译成人话:

参数 U 依然会被更新 —— 但只被最近的几个时刻推着走;
远处时刻的误差到达不了它 —— 长距离的状态对参数 U 没有影响。

所以这个病不表现为「训练崩了」,表现为模型学会了忽略远方: 一切看起来在训,损失也在降,只是时序上离得远的关联永远学不到。 比崩溃隐蔽得多。

为什么普通 RNN 几乎注定 ρ<1?也有明确账目: Logistic 和 Tanh 的导数值都小于 1,‖U‖ 通常也不会太大, 两者相乘自然小于 1,间隔一大 δ_{t,k} 就趋向零5

5. 三条改进路线

先说好治的那个:爆炸

爆炸容易被检测也容易处理,两种工程手段:6

手段做法
权重衰减给参数加 ℓ1 或 ℓ2 正则化项,限制参数取值范围,把 ρ 压回 ≤1
梯度截断启发式:梯度的模超过阈值就直接截成一个较小的数

(细节在下一块的第 19 章,这里知道它们存在即可。)

直接的路:把乘法改成加法

消失难治,根源是乘法结构:想保住远端信号,就得让 h 和 hₜ₋₁ 之间不要「乘着走」。 最直接的做法是让状态等于上一状态加一个增量:

hₜ = hₜ₋₁ + g(xₜ;θ)

梯度在这一步是恒等地流过去的(导数恰为 1),没有连乘,也就没有消失7。 代价立刻出现:反馈边上的非线性没了,表示能力下降7

于是改成既线性又非线性的版本:hₜ = hₜ₋₁ + g(xₜ,hₜ₋₁;θ)(书的边注点明: 这和残差连接的思想十分类似)8。但它仍有两个毛病9:

  1. 可能梯度爆炸:增量不受控时梯度照样能翻上去;
  2. 记忆容量问题:hₜ 不停累积新信息会发生饱和现象—— g 是 Logistic 时 hₜ 越来越大直到不动; 存的东西越多,新东西越挤不进去、旧东西越提不出来。

两个毛病指向同一个缺口:需要有人控制「写多少、留多少」。这就是门。

6. 三个软开关:LSTM

数字电路里的门是个二值开关:0 关死、1 全开10。 神经网络把它软化成 (0,1) 之间的连续旋钮——按比例放行,这就叫软门。 三个门的值都不用手定,由当前输入 xₜ 和上一外部状态 hₜ₋₁ 学出来。

LSTM 的第一步是开辟第二通道: 引入一个新的内部状态 cₜ, 专门做线性的循环信息传递;cₜ 是记忆单元, hₜ 是对外露出的那份(hₜ 还要交给下一时刻的门用)11。 更新只有两条式子:

cₜ = fₜ ⊙ cₜ₋₁ + iₜ ⊙ c̃ₜ 内部通道:加法
hₜ = oₜ ⊙ tanh(cₜ) 输出:经输出门露出

其中 c̃ₜ 是候选状态(tanh 从当前输入和历史算出的「想要写入的新内容」), ⊙ 为向量元素乘积11

三个门各管一件事12:

两个极端
遗忘门 fₜ上一时刻的记忆 cₜ₋₁ 留多少1=照单全收(持续留存)
输入门 iₜ候选状态 c̃ₜ 写入多少1=整段写入
输出门 oₜ内部状态露出多少给 hₜ1=完全外露

对照第 5 节的两个毛病看这套设计的精确性:

  • 梯度消失——主走查已经演示:f_t≈1 时,c 通道上的梯度以接近恒等方式传播, 0.99²⁰ 还有 0.82。书边注的原话:c 的更新是加法形式, 当 f_t≈1 时梯度可近似恒等传播13;
  • 记忆容量——写入不再是无条件的:iₜ≈0 时什么都不挤进来, 存储内容可控可清,饱和被制度化地挡住了;
  • 爆炸风险也被压低:f 小于 1 时这条通道同样会衰减,增量有闸门管着。

一个值得带走的工程提示:由于初始化时权重通常较小, 训练 LSTM 时遗忘门偏置 b_f 常初始化为正—— 让早期训练默认「多记住一点」,而不是一开始就把记忆冲掉14

最后解释这个名字。神经网络的隐状态每个时刻都被重写,算短期记忆; 网络参数算是长期记忆(更新慢得多);cₜ 里信息的生命周期介于两者之间, 既能抓住某个关键信息保存一段较长的时间,又短于参数—— 「长短期记忆」指的是长的「短期记忆」15

7. 少一个门也够:GRU

门控循环单元[Cho et al., 2014] 不引入额外的记忆单元, 把 LSTM 的三扇门压缩成两扇16:

hₜ = zₜ ⊙ hₜ₋₁ + (1 − zₜ) ⊙ h̃ₜ
↑保留旧份 ↑写入新份

注意那个 (1−zₜ):保留历史的比例和接受新内容的比例恰好互补, 一组权重管两头17——这是它与 LSTM 最实质的区别。 候选状态 h̃ₜ 由当前输入和历史共同算出,但中间插了一个重置门 rₜ: rₜ=0 时候选状态只看当前输入不看历史,rₜ=1 时和简单循环网络一样两头都看18

极端情形能把两个模型的关系看清:zₜ=0 且 rₜ=1 时,GRU 退化为简单循环网络; zₜ=1 时直接跳过当前输入,hₜ=hₜ₋₁19

三家并排看20:

模型状态变量门控特点
SRNhₜ结构紧凑,难稳定建模长程依赖
LSTMhₜ, cₜ输入、遗忘、输出三门控制细致,表达力强,参数多
GRUhₜ更新、重置两门更紧凑,训练实现简单

选型直觉:LSTM 的表达力上限更高,GRU 参数少、在中小规模任务上常打平。 书把它们的关系总结为一句话:序列建模的关键不只是「让状态循环起来」, 更重要的是「让哪些信息沿着什么路径传播,并保留多久」21

8. 变深、看两头,还有两条出路

循环网络的「深」有两层含义。 若把信息传递的路径长度当作深度, 展开后的循环网沿时间方向非常深,同一时刻输入到输出却非常浅——既深又浅22。 两个补强的方向由此而来:

  • 堆叠(纵向加深):多个循环网络摞起来,下层每个时刻的隐状态作为上层的输入23;
  • 双向(横向加视野):有些任务的答案取决于上下文两侧——词性就由左右两边的信息决定。 再配一层按时间逆序传递的网络,两层各走一遍再拼接24。 注意逆序层用到了未来的输入,只在允许「看完整个句子再回答」的任务上可用。

除此之外还有两条离开本章主角的路:

第一,链不是唯一的形状。 把展开图的节点看作一般图上的节点, 每个节点接收邻居消息、更新自身、再传出——循环网络本质上是 在链式结构上做状态传播与参数共享的模型25。 底层结构换成树,得到递归神经网络(RvNN),按句法(组词成句的规则)的组合关系合成句子的语义, 每个节点的语义由其子成分组合而来26;退化成一条链时,它就等价于简单循环网络27

换成任意图,就是第 23 章的图神经网络(在图的节点间传消息的网络)。

第二,递推本身正在复兴。 书在总结中指出: 以 Mamba 为代表的状态空间模型(SSM)把循环网络的递推思想与连续时间线性系统理论结合, 靠结构化参数化和输入依赖的选择性机制, 在长序列建模中以线性计算复杂度达到与同规模 Transformer 相当的性能28; 后续的 Mamba-2 用「结构化状态空间对偶」在数学上统一了线性注意力与状态空间模型, RNN 式递推与 Transformer 式并行的边界正在模糊29这条线的机制细节,兑现到第 22 章第 6 节—— 在那里你会看到「把这条递推式拉直」到底长什么样。

9. 作者的判断与证据

书里给了推导与判据的: δ_{t,k}≈ρ^{t−k}δ_{t,t} 与谱半径判据12; 「消失的不是参数梯度而是跨时间的误差项」这一纠正4; LSTM 加法通道避免梯度消失的机理(边注)13

书里坦白局限的: 直接的加法改法丢非线性且仍可能爆炸、会饱和79; 简单循环网络实际只能学到短期依赖3

书里给了定位与展望的: 四类模式的门控对照表20; 「关键在于信息沿什么路径传播、保留多久」这句话把残差连接、注意力、消息传递 归入同一条思想线21;Mamba/SSM 一节明确声明这是研究前沿而非定论2829

10. 边界与局限

LSTM/GRU 只是缓解,不是治愈。 门控把可用的时间尺度从十几步抬高了几个数量级, 但仍有限;遇到真正超长上下文,后来是靠注意力机制另起炉灶解决的(第 20 章)。

双向结构的天花板书里说了实话的一半: 逆序通路要求访问完整输入,生成任务天然不可用——这一点需要读者自己推出, 正文只举了词性标注这类「整句在手」的场景24

SSM 一段是快照不是教程:Mamba 的选择性机制、Mamba-2 的对偶理论都只点到名字, 本章结束时读者并不具备实现它的知识——这笔账记在第 22 章 §6。

递归神经网络(RvNN)今天的实用地位有限:书中主要用它做概念桥梁, 句法树的实际解析器怎么来(谁来提供树结构)未讨论。

11. 可带走的

  1. 长程依赖病的形态:δ_{t,k}≈ρ^{t−k}δ_{t,t},远处贡献指数级衰减;
  2. 判据是谱半径:U 最大特征值的模 >1 倾向爆炸,<1 倾向消失;
  3. 消失的不是 ∂ℒ/∂U,是 ∂ℒ_t/∂h_k——表现为学会忽略远方,不表现为训练崩溃;
  4. 爆炸用权重衰减和梯度截断就能处理;消失必须改结构;
  5. 纯加法更新(hₜ=hₜ₋₁+g)保住梯度但会饱和——问题从「传不过去」变成「存不进去」;
  6. LSTM = 加法记忆通道 + 三个软门:fₜ≈1 时梯度近似恒等传播,这是它救长程依赖的全部秘密;
  7. 遗忘门偏置初始化为正,是训练 LSTM 的标准小技巧;
  8. GRU 把保留与写入压成一对互补权重(z 和 1−z),两个门承担三扇门的职责;
  9. 循环网络既深(时间方向)又浅(同刻输入到输出):堆叠补前者、双向补后者;
  10. 两条出口:链→树→图通往 GNN(第 23 章);递推的线性化复兴通往 Mamba/SSM(第 22 章 §6 兑现);
  11. 最凝练的总结:让哪些信息沿着什么路径传播,并保留多久——这句话后面到处都是。

12. 原文地图

主题原书章原文位置
长程依赖定义第6章 循环神经网络text/07-ch06.txt:591(搜「梯度在跨时间传播时容易消」)
误差连乘与 γ第6章 循环神经网络text/07-ch06.txt:599(搜「如果定义 𝛾」) · text/07-ch06.txt:604(搜「若 𝛾 > 1」) · text/07-ch06.txt:608(搜「若 𝛾 < 1」)
谱半径判据第6章 循环神经网络text/07-ch06.txt:610(搜「谱半径」) · text/07-ch06.txt:609(搜「梯度消失问题(Vanishing」)
消失的是什么第6章 循环神经网络text/07-ch06.txt:614(搜「不是说」) · text/07-ch06.txt:621(搜「没有影响」)
为什么必小于 1第6章 循环神经网络text/07-ch06.txt:624(搜「导数值都小于 1」) · text/07-ch06.txt:627(搜「只能学习到短期的依赖关系」)
改进方案总览第6章 循环神经网络text/07-ch06.txt:636(搜「选取合适的参数」)
爆炸的两手段第6章 循环神经网络text/07-ch06.txt:645(搜「梯度截断是另一种」) · text/07-ch06.txt:644(搜「权重衰减是通过给参数增加」)
加法改法及其问题第6章 循环神经网络text/07-ch06.txt:660(搜「这种改进策略和残差」) · text/07-ch06.txt:675(搜「Memory Capacity」) · text/07-ch06.txt:676(搜「饱和现象」)
门控思路第6章 循环神经网络text/07-ch06.txt:684(搜「门控机制来控制信息的累积速度」)
门的电路出处第6章 循环神经网络text/07-ch06.txt:715(搜「二值变量 {0, 1}」)
LSTM 内部状态第6章 循环神经网络text/07-ch06.txt:695(搜「新的内部状态」) · text/07-ch06.txt:699(搜「𝒇𝑡 ⊙ 𝒄𝑡−1」)
三门分工第6章 循环神经网络text/07-ch06.txt:720(搜「遗忘门 𝒇𝑡 控制」) · text/07-ch06.txt:721(搜「输入门 𝒊𝑡 控制」) · text/07-ch06.txt:722(搜「输出门 𝒐𝑡 控制」)
软门第6章 循环神经网络text/07-ch06.txt:728(搜「是一种“软”门」)
加法避消失第6章 循环神经网络text/07-ch06.txt:732(搜「(𝒄𝑡 = 𝒇𝑡 ⊙ 𝒄𝑡−1 + 𝒊𝑡 ⊙」)
遗忘门偏置第6章 循环神经网络text/07-ch06.txt:748(搜「常初始化为正」)
记忆三层次第6章 循环神经网络text/07-ch06.txt:783(搜「短期记忆.而在 LSTM 网络中」) · text/07-ch06.txt:783(搜「捕捉到某个关键信」)
GRU第6章 循环神经网络text/07-ch06.txt:791(搜「Gated Recurrent Unit」) · text/07-ch06.txt:811(搜「互补权重」) · text/07-ch06.txt:825(搜「是否依赖上一时刻的状态」) · text/07-ch06.txt:835(搜「退化为简单循环网络」)
三家对照表第6章 循环神经网络text/07-ch06.txt:840(搜「SRN 结构最紧凑」)
既深又浅第6章 循环神经网络text/07-ch06.txt:872(搜「既“深”又“浅”的网络」)
堆叠与双向第6章 循环神经网络text/07-ch06.txt:882(搜「Stacked Recurrent Neural Network」) · text/07-ch06.txt:919(搜「Bidirectional Recurrent Neural Network」) · text/07-ch06.txt:917(搜「左右两边的信息」)
链→树→图第6章 循环神经网络text/07-ch06.txt:954(搜「接收来自前一时刻的消息」) · text/07-ch06.txt:958(搜「发展为图神经网络」) · text/07-ch06.txt:1009(搜「句法的组合关系来合成」) · text/07-ch06.txt:1005(搜「退化为线性序列结构」)
总结金句第6章 循环神经网络text/07-ch06.txt:1035(搜「让哪些信息沿着什么路径传播」)
Mamba/SSM第6章 循环神经网络text/07-ch06.txt:1046(搜「Mamba 为代表的状态空间模型」) · text/07-ch06.txt:1048(搜「线性计算复杂度」) · text/07-ch06.txt:1051(搜「结构化状态空间对偶理论」)

Footnotes

  1. 出处:「第6章 循环神经网络」第 599 段(text/07-ch06.txt:599,搜「如果定义 𝛾」) 与第 602 段(text/07-ch06.txt:602,搜「𝛾 𝑡−𝑘 𝛿𝑡,𝑡」),对应式(6.49)-(6.50)。 本文中我们写作 ρ,以免与后续强化学习章节折扣率的 γ 符号相撞;数学含义相同。 2

  2. 出处:「第6章 循环神经网络」第 610 段(text/07-ch06.txt:610,搜「谱半径」)。 原文:「更精确的分析可通过权重矩阵 U 的谱半径来刻画:若其最大特征值的模大于 1, 则梯度倾向于爆炸;若小于 1,则倾向于消失。」 书中公式使用符号 γ,本文为避免歧义改记作 ρ,见前注。 2

  3. 出处:「第6章 循环神经网络」第 627 段(text/07-ch06.txt:627,搜「只能学习到短期的依赖关系」)。 2

  4. 出处:「第6章 循环神经网络」第 614 至 621 段(text/07-ch06.txt:614,搜「不是说」; text/07-ch06.txt:621,搜「没有影响」)。原文边注:「梯度消失不是说 ∂ℒ/∂U 的梯度消失了, 而是 ∂ℒ_t/∂h_k 的梯度消失了……长距离的状态对参数 U 没有影响。」 2

  5. 出处:「第6章 循环神经网络」第 624 段(text/07-ch06.txt:624,搜「导数值都小于 1」)。

  6. 出处:「第6章 循环神经网络」第 644 段(text/07-ch06.txt:644,搜「权重衰减是通过给参数增加」) 与第 645 段(text/07-ch06.txt:645,搜「梯度截断是另一种」)。

  7. 出处:「第6章 循环神经网络」第 658 段(text/07-ch06.txt:658,搜「丢失了神经元在反馈边上」)。 hₜ=hₜ₋₁+g(xₜ;θ) 为式(6.51)。 2 3

  8. 出处:「第6章 循环神经网络」第 660 段(text/07-ch06.txt:660,搜「这种改进策略和残差」)。 hₜ=hₜ₋₁+g(xₜ,hₜ₋₁;θ) 为式(6.52)。

  9. 出处:「第6章 循环神经网络」第 671 段(text/07-ch06.txt:671,搜「梯度可能会过大」) 与第 675、676 段(text/07-ch06.txt:676,搜「饱和现象」)。 2

  10. 出处:「第6章 循环神经网络」第 715 段(text/07-ch06.txt:715,搜「二值变量 {0, 1}」)。

  11. 出处:「第6章 循环神经网络」第 695 段(text/07-ch06.txt:695,搜「新的内部状态」) 与第 707 段(text/07-ch06.txt:707,搜「得到的候选状态」),公式见 text/07-ch06.txt:699(搜「𝒄𝑡 = 𝒇𝑡 ⊙ 𝒄𝑡−1」)。 2

  12. 出处:「第6章 循环神经网络」第 720 至 722 段(text/07-ch06.txt:720,搜「遗忘门 𝒇𝑡 控制」)。

  13. 出处:「第6章 循环神经网络」第 732 段(text/07-ch06.txt:732,搜「(𝒄𝑡 = 𝒇𝑡 ⊙ 𝒄𝑡−1 + 𝒊𝑡 ⊙」)。 边注:「LSTM 避免梯度消失的关键在于:记忆单元 cₜ 的更新是加法形式,当 fₜ≈1 时梯度可近似恒等传播。」 2

  14. 出处:「第6章 循环神经网络」第 744 段(text/07-ch06.txt:744,搜「一般在深度网络参数」) 与第 748 段(text/07-ch06.txt:748,搜「常初始化为正」)。

  15. 出处:「第6章 循环神经网络」第 779 段(text/07-ch06.txt:779,搜「可以看作一种记忆(Memory)」) 与第 785 段(text/07-ch06.txt:785,搜「称为长短期记忆」);边注注明 「长短期记忆是指长的『短期记忆』」。

  16. 出处:「第6章 循环神经网络」第 791 段(text/07-ch06.txt:791,搜「Gated Recurrent Unit」)。

  17. 出处:「第6章 循环神经网络」第 811 段(text/07-ch06.txt:811,搜「互补权重」)。

  18. 出处:「第6章 循环神经网络」第 825 至 827 段(text/07-ch06.txt:825,搜「是否依赖上一时刻的状态」)。

  19. 出处:「第6章 循环神经网络」第 835 段(text/07-ch06.txt:835,搜「退化为简单循环网络」)。

  20. 出处:「第6章 循环神经网络」第 840 段(text/07-ch06.txt:840,搜「SRN 结构最紧凑」),表 6.2。 2

  21. 出处:「第6章 循环神经网络」第 1035 段(text/07-ch06.txt:1035,搜「让哪些信息沿着什么路径传播」)。 2

  22. 出处:「第6章 循环神经网络」第 872 段(text/07-ch06.txt:872,搜「既“深”又“浅”的网络」)。

  23. 出处:「第6章 循环神经网络」第 882 段(text/07-ch06.txt:882,搜「Stacked Recurrent Neural Network」)。

  24. 出处:「第6章 循环神经网络」第 917 段(text/07-ch06.txt:917,搜「左右两边的信息」) 与第 919 段(text/07-ch06.txt:919,搜「Bidirectional Recurrent Neural Network」)。 2

  25. 出处:「第6章 循环神经网络」第 954 段(text/07-ch06.txt:954,搜「接收来自前一时刻的消息」)。

  26. 出处:「第6章 循环神经网络」第 1009 段(text/07-ch06.txt:1009,搜「句法的组合关系来合成」) 与第 958 段(text/07-ch06.txt:958,搜「Recursive Neural Network」)。

  27. 出处:「第6章 循环神经网络」第 1005 段(text/07-ch06.txt:1005,搜「退化为线性序列结构」)。

  28. 出处:「第6章 循环神经网络」第 1046 段(text/07-ch06.txt:1046,搜「Mamba 为代表的状态空间模型」) 与第 1048 段(text/07-ch06.txt:1048,搜「线性计算复杂度」)。 2

  29. 出处:「第6章 循环神经网络」第 1051 段(text/07-ch06.txt:1051,搜「结构化状态空间对偶理论」)。 2