跳到主要内容

这一章治的是「训不动」的前半段:算法本身。 一句话版本——低维地形怕卡在坑里,高维地形几乎全是马鞍;逃出马鞍要靠随机, 落进哪只碗要看碗的形状;此后所有的算法改进,都是在调三样东西: 一步迈多大(学习率)、往哪个方向迈(梯度估计)、每个参数迈得一样吗。

训练为什么难与优化算法

1. 这一章讲什么

两件事: 高维非凸优化的地形长什么样(鞍点当道、平坦最小值受宠); 在地形之上,从标准梯度下降到 Adam 再到它的后继,每一步改进改的是什么。

它在全书链条里的位置: 第 06 章说模型能力上限由表示决定——但把很深的网络 真正训出来靠的是这一章。第 15、16 章处理了序列上的梯度消失, 这里处理所有网络共同面对的问题:参数几亿个时, 往哪边挪、一步挪多大、要不要带惯性。

需要第 02 章(梯度)与第 11 章(梯度下降)。

2. 顶层全景

地形判断(7.1):
驻点在高维多为鞍点(不是谷底) → 随机性 = 逃逸手段
最小值分平坦/尖锐 → 平坦的更鲁棒、常泛化更好

标准小批量 SGD 更新: θₜ = θₜ₋₁ − α·gₜ 只有两样可动:K(批量)、α(步长)

三条改进线 ──────────────────────────────▶
① 调步长 衰减·预热·周期重启 · AdaGrad→RMSprop→AdaDelta(逐参数)
② 修方向 动量(惯性) → Nesterov(先探再算)
③ 合体 Adam = ②方向 + ①自适应 ; Muon(矩阵结构) ; SAM(直接压平地形)

一句话链条: 高维里谷底不多、马鞍遍地 → 批量的噪声恰好是逃逸工具 → 固定步长的下降要么震要么磨 → 惯性抹平振荡、自适应给每个参数配自己的步长 → 两者合体就是 Adam → 更新的形态仍是直线,改变更新几何本身(Muon/SAM)是下一代。

3. 高维地形:敌人不是坑,是马鞍

先把最反直觉的一件事立住。 低维空间做非凸优化,主要麻烦确实是局部最优—— 一个比全局差、却困住梯度下降的小坑。到了几千维的空间,这件事基本翻篇1: 要成为局部最小值,参数得在许多个方向上同时不再下降,这个条件比低维苛刻得多。 书给了一个粗略量感:一万维的网络,若参数点在单个维度附近表现为局部最小的概率是 p, 在所有方向上同时成立的概率会随维数快速下降——所以绝大多数梯度为零的点 不是谷底,而是鞍点:在一些维度上是最高点、另一些维度上是最低点的点2

问题是梯度下降到鞍点附近就几乎停摆(梯度为零)。怎么逃? 答案朴素到不像理论:加随机。 小批量梯度下降的梯度本身就带采样噪声, 正好能把停留中的参数抖离鞍点3——这就是随机性在这门学科里的第一份工作。

谷底也分好坏

第二个地形事实:平坦最小值。神经网络参数极多且冗余,单看任何一个参数对损失的影响都不大, 这让收敛点附近常常是一片平底,而不是一个尖底4

这重要在哪?平底意味着微小的参数变动不会剧烈影响模型——鲁棒; 尖底的模型稍微扰动一下表现就垮。而鲁棒的解通常正是泛化好的解, 所以理想的落点是平的那一只5。后文的周期性学习率和 SAM 都是在跟这只「平碗」打交道。

书还在这里给了句关键的坦白,原话值得记:「这里的很多描述都是经验性的, 并没有很好的理论证明」6——整个平坦性与泛化的故事至今是经验规律。

还有一条安慰性的观察:大规模网络中许多局部最小解在训练损失和测试性能上都差不多, 有研究认为其损失可以非常接近全局最优;实践中更重要的是找泛化好的解, 过度追求训练集上的最优反而可能过拟合7

4. 一次看几条样本:批大小的账

小批量梯度下降的更新只有一条式子:θₜ = θₜ₋₁ − α·gₜ, gₜ 是 K 条样本上的平均梯度,K 叫批大小。能动的旋钮其实只有两个:K 和 α, 加上 gₜ 本身的质量。先动 K。

批大小改变的是梯度的方差,不是期望。 K 越大,平均掉 individual 噪声越多, 估计越稳,于是可以配更大的学习率;K 小就得配小学习率否则不稳定。 经验规则是线性缩放规则:批大小扩大 m 倍,学习率也放大 m 倍[Goyal et al., 2017] ——但它只在批不太大时成立,太大线性放大会让训练不稳8

同一个实验换一把尺子结论会翻转,这点书上用图钉死了: 按迭代次数看,大批量下降又快又平滑;按回合(epoch,全数据过一遍)数看, 反而是小批量收敛快——适当小的批量导致更快的收敛9

还有一个与第 3 节挂钩的发现:批量越大越可能收敛到尖锐最小值, 越小越倾向平坦最小值[Keskar et al., 2017]10。 「加大批量」并不总是免费的改进。

最后一块拼图属于工程:显存放不下想要的大批量怎么办? 梯度累积:把大批拆成若干小批依次前向累加梯度,凑够一批的量再一次更新—— 数学上等价于大批梯度下降,显存却只需要小批的开销, 是大模型训练的常用手段11。(严格等价有个前提:批量规范化统计量、暂退掩码 这类随批次变的量不算在内——见第 18 章。)

5. 步长怎么走:衰减、预热、周期

α 的两头都会死:过大不收敛、过小太慢12。于是有了三套动作:

手段解决什么做法
学习率衰减先快跑后细调初期大,临近最优逐步减小;五种衰减曲线(分段常数/逆时/指数/自然指数/余弦)13
学习率预热——先小步热身再正常走开局别摔跤参数刚随机初始化时梯度乱且大,前几轮先用小学习率爬升到设定值14
周期性调整逃尖刺、住平谷周期性增大学习率:落在尖底被弹出去找新的,落在平底仍在吸引域内15

第三条值得展开半行:三角循环学习率让 α 在上下界间来回锯齿; 热重启 SGDR 则走余弦一路降到底、周期一到重置回高点再来一遍—— 注意每次重启不从零开始,参数保留原地继续优化16, 这也是「温和的扰动帮助定居好盆地」这一思想的又一次落地。

6. 给每个参数配自己的步长

上面的 α 是全网一份。可不同参数的收敛速度天然不同,一份步长必然顾此失彼。 自适应方法用一个朴素的信号校准它:历史上梯度大的参数,压它的步长

AdaGrad : G_t += g² (累计) Δθ = −α /√G ⊙ g 只减不增 → 后期冻住
RMSprop : G_t = βG_{t−1}+(1−β)g² (滑动) 可大可小
AdaDelta: 在 RMSprop 上再把 α 换成历史更新量的滑动平均 连初始 α 都不要了

三代的接力关系清楚

Duchi et al.
把历史梯度平方累起来当分母, 整体随迭代缩小;病根是有效学习率持续变小——还没走到好解就基本不走了17; RMSprop(Hinton 提出)换成指数移动平均(β 一般取 0.9), 于是学习率既可变小也可变大18;AdaDelta[Zeiler] 更进一步, 把分子也动态化,初始学习率这个超参直接消失19。 三者共同的直觉只有一个:谁以前被更新得凶,现在就让它缓一缓。

7. 方向怎么修:动量与 Nesterov

小批量的梯度天生带噪声,一次迭代的方向忽左忽右。 动量法的答案是用最近一段时间的加权平均替代当下值:Δθₜ = ρ·Δθₜ₋₁ − α·gₜ, ρ 通常取 0.920。物理直觉是同名概念的移植:梯度当加速度, 累积的历史更新当动量。效果两段式——初期各处梯度方向大体一致, 惯性帮你加速冲;后期接近最优点方向开始互相打架,互相抵消自动刹车、抑制振荡21。 书特意敲了一颗钉子:它只在狭长谷底这类场景里产生类似「加速」「阻尼」的表现, 不能简单等同于二阶优化方法22

Nesterov 加速梯度(NAG) 的改动小而精:既然要在 Δθₜ₋₁ 的基础上叠加, 那不如先沿惯性走出一步(θ̂ = θₜ₋₁ + ρΔθₜ₋₁), 在新位置 θ̂ 上求梯度再修正——原版动量用的是旧位置 θₜ₋₁ 的梯度, 书明说这样「有些不太合理」23。一句话:先探头看看前面的坡,再决定腿怎么收。

8. 主走查:同一段路,三种优化器(更新参数的算法)各走多远

设定: 一维参数 θ₀=1.0,目标向减小 θ 的方向移动;学习率 α=0.01; 连续三步的梯度 g=(0.1, 0.2, 0.15);ϵ 取 0 不影响四位结果。 梯度值和起点是我们为演示定的;以下全部数值按书内公式实算。

第一种:普通 SGD(θₜ ← θₜ₋₁ − α·gₜ):

θ₁ = 1.000 − 0.01×0.10 = 0.99000
θ₂ = 0.990 − 0.01×0.20 = 0.98800
θ₃ = 0.988 − 0.01×0.15 = 0.98650

三步总位移 = α×(0.1+0.2+0.15) = 0.0135——没有任何记忆, 每一步都只取决于当下的那一个梯度。

第二种:动量法(ρ=0.9,Δθₜ = 0.9·Δθₜ₋₁ − 0.01·gₜ):

Δθ₁ = −0.001000 θ₁ = 0.999000
Δθ₂ = 0.9×(−0.001)−0.002 = −0.002900 θ₂ = 0.996100
Δθ₃ = 0.9×(−0.0029)−0.0015 = −0.004110 θ₃ = 0.991990

梯度方向一致时,惯性把每步的有效步子放大——三步走到 0.99199, 领先普通 SGD(0.98650);ρ=0.9 时这个放大的理论上限是 1/(1−ρ)=10 倍。

第三种:Adam(β₁=0.9,β₂=0.999)。维护 M(一阶矩)与 G(二阶矩), 先乘偏差修正因子 1/(1−βᵗ),再按 α·M̂/√Ĝ 更新:

t=1: M=0.1×0.1=0.010000 G=0.001×0.1²=0.000010
M̂=0.010/(1−0.9)=0.100 Ĝ=0.00001/(1−0.999)=0.010000
Δθ=−0.01×0.100/0.100=−0.010000 θ₁=0.990000
t=2: M=0.9×0.010+0.1×0.200=0.029000 G=0.999×0.00001+0.001×0.04=0.00004999
M̂=0.029/0.19=0.152632 Ĝ=0.00004999/0.001999=0.0250075 √=0.158137
Δθ=−0.01×0.152632/0.158137=−0.009652 θ₂=0.980348
t=3: M=0.9×0.029+0.1×0.150=0.041100 G=0.999×0.00004999+0.001×0.0225=0.00007244
M̂=0.0411/0.271=0.151661 Ĝ=0.00007244/0.002997=0.0241688 √=0.155464
Δθ=−0.01×0.151661/0.155464=−0.009755 θ₃≈0.970593

三种结果的对比:

普通SGD θ₃ = 0.98650 每步纯按当前梯度,无记忆
动量法 θ₃ = 0.99199 同方向的梯度逐步叠成更大的步子
Adam θ₃ = 0.97059 步长被归一化到 ~α,前期推得最猛

再看一眼偏差修正到底救了什么。 若第 1 步不做修正, M/G 直接当矩用:M/√G = 0.01/0.003162 ≈ 3.162, 更新会是 −0.01×3.162 = −0.0316,是真值的三倍多——因为 M₀=G₀=0, β 又都接近 1,初期矩估计严重偏小不可用;乘上 1/(1−β¹)=10 之后才恢复正确量级。 书在这一步专门留了练习,并写明理由(β 接近 1 时偏差很大)24

9. Adam 的两位后继

Adam[Kingma et al., 2015] 就是动量 + RMSprop 的合体: 一端维护梯度均值 M(动量那一套),另一端维护未减均值的方差 G(RMSprop 那一套), 更新时用 α·M̂/(√Ĝ+ϵ),学习率常取 0.001 且可再配调度25。 它长期是默认选择。但它是逐元素的——把权重矩阵摊成一堆独立的数各自调节。 两位后继在两个不同的方向上突破:

Muon[MomentUm Orthogonalized by Newton–Schulz] 抓住了「权重本来就是矩阵」这件事: 先用动量算出更新方向 M_t,再对它做正交化——做法是对 M_t 做奇异值分解后把所有奇异值置 1, 只留方向、抹平幅度差异(SVD 太贵,实际用 Newton–Schulz 迭代近似)26。 动机写得很直白:不同方向的梯度强弱悬殊,直接照单更新时强方向主导一切、 弱方向的信息被淹没;拉平之后各方向均衡发力27。 工程形态是一种混合策略:隐藏层的二维权重矩阵交给 Muon, 偏置、规范化层、嵌入层这些非矩阵参数仍交给 AdamW28

SAM[Sharpness-Aware Minimization] 干脆把第 3 节那个「平坦才好」的经验写进了目标函数: min over θ of max over ‖ε‖≤ρ of ℒ(θ+ε)——不只压低损失数值, 同时压低邻域内最坏扰动的损失29。实现是两步近似:先沿当前梯度方向找出「最坏扰动 ε」, 再退回在扰动后的位置求梯度并更新;实际效果是把解推向更平坦的区域30。 书把它放在优化一章,但明说它常被视为带正则化效应的方法—— 它就是「优化」和「正则化」两个视角之间的桥(正则化的细节在下一块的第 19 章)。

收拢一下,全书给这三类方法的官方分类:调学习率、修正梯度估计、 显式利用参数结构或局部平坦性;偏置/规范化层这一类优化器的组合拳汇总在表 7.131

10. 作者的判断与证据

有文献支撑的判断: 高维非凸的主要困难是逃离鞍点[Dauphin et al., 2014]2; 局部最小解的损失接近全局最优[Choromanska et al., 2015] (观点)7; 大批量↔尖锐最小值[Keskar et al., 2017] (实验)10; BN 让地形变平滑的研究在第 18 章引用[Bjorck; Santurkar]。

书自曝薄弱的: 平坦最小值与泛化的关系「都是经验性的,并没有很好的理论证明」6; 线性缩放规则只在批不太大时适用8;NAG 改进的理由书用了「不太合理」这样的措辞而非证明23

书划定边界的: 动量≠二阶方法22;AdaDelta 消灭的只是初始学习率这一个超参、 代价是多维护一组滑动平均19;Muon 不能覆盖非矩阵参数、须与 AdamW 混用28; SAM 是否算正则化取决于视角,机制上仍属更新准则30

11. 边界与局限

这一章的方法都作用于「给定结构之后」。结构本身的毛病——梯度消失、饱和—— 要等第 18 章的初始化/规范化和第 12 章的激活函数来治;这里只有梯度截断一件事交叉32

平坦性故事的时效:书自证其为经验结论6,此后学界对「平坦↔泛化」确有争议; 读的时候把它当作工程直觉而不是定律。

并行训练的世界不在本章:多卡怎么切批、怎么同步梯度,全书声明不讲; 梯度累积只是单机上模仿大批的手段。

默认公式都是单机单卡的形状——学习率调度(训练中怎么调步长)、预热(先小步热身再正常走)的具体数值全都任务相关, 书没有给「万能配置」,这也符合它一贯的原则。

12. 可带走的

  1. 高维优化最大的问题不是局部最优而是鞍点,逃逸靠小批量天然的随机性;
  2. 谷底分平坦与尖锐:平坦鲁棒、常泛化更好——但这是经验规律;
  3. 批大小不改期望只改方差:大批稳、小批(按回合计)反而收敛快; 线性缩放规则把批和学习率绑在一起调;
  4. 显存不够就用梯度累积:多个小批累加梯度 ≈ 一个大批;
  5. 学习率三件套:衰减收尾、预热保开局、周期性扰动帮跳出尖底(循环学习率 / SGDR);
  6. AdaGrad→RMSprop→AdaDelta 是同一直觉的三代:按历史梯度平方逐参数缩放步长;
  7. 动量 = 近期梯度加权平均:一致则加速、相消则刹车;Nesterov 先探头再修正;
  8. Adam = 动量 + RMSprop + 偏差修正:初期不修会错三倍以上(主走查实测);
  9. Muon 把权重当矩阵、SVD 后各方向幅度拉平;SAM 直接把「平坦」写进目标函数;
  10. 判断谁在卡你的训练:损失震荡查步长、停滞不前查鞍点与学习率、过大过小两头都死。

13. 原文地图

主题原书章原文位置
泛化难点总起第7章 网络优化与正则化text/08-ch07.txt:14(搜「泛化问题:由于深度神经网络的复杂度比较高」)
鞍点与随机逃离第7章 网络优化与正则化text/08-ch07.txt:54(搜「逃离鞍点(Saddle」) · text/08-ch07.txt:77(搜「驻点往往更可能表现为鞍」) · text/08-ch07.txt:81(搜「引入随机性,可以有效地逃离鞍点」)
平坦最小值第7章 网络优化与正则化text/08-ch07.txt:84(搜「称为平坦最小值(Flat Minima)」) · text/08-ch07.txt:94(搜「经验性的,并没有很好」) · text/08-ch07.txt:99(搜「不会剧烈影响模型能力」)
局部解接近全局第7章 网络优化与正则化text/08-ch07.txt:106(搜「过度追求」)
小批量 SGD 三因素第7章 网络优化与正则化text/08-ch07.txt:142(搜「每次选取 𝐾 个训练样本」)
批大小与方差第7章 网络优化与正则化text/08-ch07.txt:178(搜「不影响随机梯度的期望」) · text/08-ch07.txt:182(搜「Linear Scaling Rule」) · text/08-ch07.txt:217(搜「适当小的批量会导致更快」) · text/08-ch07.txt:219(搜「越有可能收敛到尖锐最小值」)
梯度累积第7章 网络优化与正则化text/08-ch07.txt:222(搜「Gradient Accumulation」)
学习率与衰减第7章 网络优化与正则化text/08-ch07.txt:232(搜「如果过大就可能不收敛」) · text/08-ch07.txt:305(搜「逐渐降低学习率」)
预热第7章 网络优化与正则化text/08-ch07.txt:298(搜「恢复到初始的学习率」)
SGDR第7章 网络优化与正则化text/08-ch07.txt:338(搜「带热重启的随机梯度下降(Stochastic Gradient」)
AdaGrad 缺陷第7章 网络优化与正则化text/08-ch07.txt:383(搜「Adaptive Gradient Algorithm」) · text/08-ch07.txt:404(搜「AdaGrad 算法的缺点」)
RMSprop 区别第7章 网络优化与正则化text/08-ch07.txt:426(搜「变成了指数衰减移动平均」) · text/08-ch07.txt:427(搜「既可以变小也可以变大」)
AdaDelta第7章 网络优化与正则化text/08-ch07.txt:447(搜「初始学习率 𝛼 改为」)
动量法第7章 网络优化与正则化text/08-ch07.txt:463(搜「是用之前积累动量来替代」) · text/08-ch07.txt:478(搜「起到加速作用,可以更快地到达最优点」) · text/08-ch07.txt:482(搜「不能简单等同于二阶优化方法」)
Nesterov第7章 网络优化与正则化text/08-ch07.txt:496(搜「上的梯度」)
Adam 与偏差修正第7章 网络优化与正则化text/08-ch07.txt:526(搜「可以看作动量法和 RMSprop 算法的结合」) · text/08-ch07.txt:538(搜「需要对偏差进行修」) · text/08-ch07.txt:554(搜「通常设为 0.001」)
Muon第7章 网络优化与正则化text/08-ch07.txt:567(搜「MomentUm Orthogonalized by」) · text/08-ch07.txt:576(搜「幅度统一拉平」) · text/08-ch07.txt:605(搜「对其余参数使用 AdamW」)
SAM第7章 网络优化与正则化text/08-ch07.txt:614(搜「损失地形的“尖锐程度”」) · text/08-ch07.txt:624(搜「更平坦的极小值区域」)

Footnotes

  1. 出处:「第7章 网络优化与正则化」第 48 段(text/08-ch07.txt:48,搜「其挑战和在低维空间中」)。

  2. 出处:「第7章 网络优化与正则化」第 54 段(text/08-ch07.txt:54,搜「逃离鞍点(Saddle」), 引 [Dauphin et al., 2014];边注注明鞍点因形似马鞍得名、特征是一阶梯度为 0 而 Hessian 不是半正定。 2

  3. 出处:「第7章 网络优化与正则化」第 77 至 81 段(text/08-ch07.txt:81,搜「引入随机性,可以有效地逃离鞍点」); 「概率随维数快速下降」见第 77 段。

  4. 出处:「第7章 网络优化与正则化」第 84 段(text/08-ch07.txt:84,搜「称为平坦最小值(Flat Minima)」), [Hochreiter et al., 1997; Li et al., 2018]。

  5. 出处:「第7章 网络优化与正则化」第 90 至 95 段(text/08-ch07.txt:99,搜「不会剧烈影响模型能力」)。 「理想的局部最小值应该是平坦的」见同段末尾。

  6. 出处:「第7章 网络优化与正则化」第 94 段(text/08-ch07.txt:94,搜「经验性的,并没有很好」)。 这是原书边注:「这里的很多描述都是经验性的,并没有很好的理论证明。」 2 3

  7. 出处:「第7章 网络优化与正则化」第 106 段(text/08-ch07.txt:106,搜「过度追求」), 文献为 [Choromanska et al., 2015]。 2

  8. 出处:「第7章 网络优化与正则化」第 178 至 186 段(text/08-ch07.txt:182,搜「Linear Scaling Rule」)。 线性缩放规则出自 [Goyal et al., 2017]。 2

  9. 出处:「第7章 网络优化与正则化」第 217 段(text/08-ch07.txt:217,搜「适当小的批量会导致更快」)。

  10. 出处:「第7章 网络优化与正则化」第 219 段(text/08-ch07.txt:219,搜「越有可能收敛到尖锐最小值」), 实验 [Keskar et al., 2017]。 2

  11. 出处:「第7章 网络优化与正则化」第 222 段(text/08-ch07.txt:222,搜「Gradient Accumulation」)。

  12. 出处:「第7章 网络优化与正则化」第 232 段(text/08-ch07.txt:232,搜「如果过大就可能不收敛」)。

  13. 出处:「第7章 网络优化与正则化」第 249 段(text/08-ch07.txt:249,搜「分段常数衰减(Piecewise Constant Decay」) 与第 266 段(text/08-ch07.txt:266,搜「余弦衰减(Cosine Decay」), 五种衰减式为式(7.5)-(7.8);分段常数衰减另称阶梯衰减。

  14. 出处:「第7章 网络优化与正则化」第 298 段(text/08-ch07.txt:298,搜「恢复到初始的学习率」), 逐渐预热式(7.9)。

  15. 出处:「第7章 网络优化与正则化」第 308 段(text/08-ch07.txt:308,搜「逃离鞍点或尖锐最小值」); 周期性增大学习率的理由与吸引域(basin of attraction)一词在同段。

  16. 出处:「第7章 网络优化与正则化」第 338 段(text/08-ch07.txt:338,搜「带热重启的随机梯度下降(Stochastic Gradient」), [Loshchilov et al., 2017];「不是从头开始优化,而是从重启前的参数基础上继续优化」即本节所引。

  17. 出处:「第7章 网络优化与正则化」第 383 段(text/08-ch07.txt:383,搜「Adaptive Gradient Algorithm」) 与第 404 段(text/08-ch07.txt:404,搜「AdaGrad 算法的缺点」)。

  18. 出处:「第7章 网络优化与正则化」第 420 至 427 段(text/08-ch07.txt:426,搜「变成了指数衰减移动平均」); RMSprop 由 Hinton 提出[Tieleman et al., 2012]。

  19. 出处:「第7章 网络优化与正则化」第 447 段(text/08-ch07.txt:447,搜「初始学习率 𝛼 改为」), 式(7.19)-(7.20)。 2

  20. 出处:「第7章 网络优化与正则化」第 463 段(text/08-ch07.txt:463,搜「是用之前积累动量来替代」),式(7.21)。

  21. 出处:「第7章 网络优化与正则化」第 478 至 480 段(text/08-ch07.txt:478,搜「起到加速作用,可以更快地到达最优点」)。

  22. 出处:「第7章 网络优化与正则化」第 482 段(text/08-ch07.txt:482,搜「不能简单等同于二阶优化方法」)。这是原书正文。 2

  23. 出处:「第7章 网络优化与正则化」第 494 至 496 段(text/08-ch07.txt:496,搜「更新方向应该为 𝜃 ̂ 上的梯度」)。 2

  24. 出处:「第7章 网络优化与正则化」第 536 至 543 段(text/08-ch07.txt:538,搜「需要对偏差进行修」), 式(7.27)-(7.28);参见习题 7-2。

  25. 出处:「第7章 网络优化与正则化」第 524 至 556 段(text/08-ch07.txt:526,搜「可以看作动量法和 RMSprop 算法的结合」; text/08-ch07.txt:554,搜「通常设为 0.001」),式(7.25)-(7.29)。

  26. 出处:「第7章 网络优化与正则化」第 560 至 600 段(text/08-ch07.txt:567,搜「MomentUm Orthogonalized by」), 奇异值置 1 见第 586 段(text/08-ch07.txt:586,搜「只保留“方向”信息」);式(7.31)与(7.32)。 Newton-Schulz 迭代替 SVD 见同节末尾。

  27. 出处:「第7章 网络优化与正则化」第 574 至 576 段(text/08-ch07.txt:576,搜「幅度统一拉平」)。

  28. 出处:「第7章 网络优化与正则化」第 601 至 608 段(text/08-ch07.txt:605,搜「对其余参数使用 AdamW」)。 2

  29. 出处:「第7章 网络优化与正则化」第 612 至 618 段(text/08-ch07.txt:614,搜「损失地形的“尖锐程度”」),式(7.33)。

  30. 出处:「第7章 网络优化与正则化」第 620 至 631 段(text/08-ch07.txt:624,搜「更平坦的极小值区域」); 定位之争(放优化还是正则化)在同节末段。 2

  31. 出处:「第7章 网络优化与正则化」第 700 段(text/08-ch07.txt:700,搜「现代常用优化器」),表 7.1; 统一描述式(7.36)-(7.38)紧随其后。

  32. 出处:「第7章 网络优化与正则化」第 636 段(text/08-ch07.txt:636,搜「称为梯度截断(Gradient Clipping」) 与第 668 段(text/08-ch07.txt:668,搜「按模截断是将梯度的模截断」)[Pascanu et al., 2013]; 对阈值不敏感、循环网上有效的边注见第 676 段(text/08-ch07.txt:676,搜「并不十分敏感」)。