跳到主要内容

阅读笔记(中段:对应拆解 14~26 章)

续第一棒笔记。行号以 library/nndl-2e/text/ 为准;每章只记「机制、数字、可引段」。

原书第5章后半 → 拆解 14(卷积网络的演化)

  • 5.4 典型卷积网络,06-ch05.txt 693 行起。
  • LeNet-5(:710-756):90 年代美国银行用来识别支票手写数字(:710 附近);「卷积–下采样–分类器」经典范式(:710);共 7 层、输入 32×32(:724);C1 层 6 个 5×5 核→28×28 特征图,参数 6×25+6=156,连接数 122304(:726);S2 平均汇聚带非线性;C3 用连接表(Link Table)60 个核而非全连的 96 个,参数 1516(:732-741);C5 是 120 个 1×1 特征图;F6 全连接 84;输出层 RBF(:751),现代由 Softmax 替代因「更易于优化」且概率解释自然(:756);总参数约 6 万、连接约 34 万(:753);边注:平均汇聚、连接表、RBF 都带时代特征,但思想影响深远(:787)。连接表公式 5.43:参数 = K×U×V + P(:784)。
  • AlexNet(:793-846):2012 ImageNet 冠军(:793);意义在「系统地结合」训练技术:GPU 并行、ReLU、暂退法(Dropout)、数据增强(:796);结构 5 卷积+3 汇聚+3 全连接,输出 1000 类(:800);拆两半放两块 GPU,只在部分层通信(:802);输入 224×224×3;首层 11×11 核步长 4 补零 3 →55×55×48 两份;重叠最大汇聚 3×3 步长 2(LRN 边注:「今天已经不是主流组件」,倾向批量规范化,:845-849);顶三层全连接 4096/4096/1000。注意:暂退与数据增强在本章不展开,名字机制留给拆解 19 章(AlexNet 节只讲现象)。
  • VGG(:851-863):核心思想=连续小卷积核替代大核(:854);两优点:感受野不减参数少、多层非线性增强表达;两层 3×3 感受野=一层 5×5,参数 2×3²=18 < 5²=25(:858 附近,原文「18 < 52 = 25」系排版把上标丢了);结构规整=卷积块+汇聚交替;短板:顶部全连接层参数多、开销大(:863)。
  • Inception(:867-916):同一模块内并排放多种核(Inception v1 图 5.13:1×1/3×3/5×5 卷积 + 3×3 最大汇聚,四路拼深);3×3、5×5 前和汇聚后都先过 1×1 卷积降维(:883:1×1「跨通道信息融合」「承担降维的作用」);v1=GoogLeNet,2014 冠军(GoogLeNet 拼写向 LeNet 致敬边注 :900 附近),9 个 Inception 模块 22 层,中间两个辅助分类器加强监督缓解梯度消失(:899-904);v3:两层 3×3 替 5×5、K×1+1×K 替 K×K,引入标签平滑和批量规范化(:907-916)。
  • ResNet(:925-972):直连边=残差连接(:929 附近);h(x)=x+(h(x)−x),恒等函数+残差函数(:933,式 5.44);通用近似定理保证两者都能逼近,但「实际优化中后者通常更容易学习」[He et al., 2016] (:943);最优映射接近恒等时直接学残差更容易;残差连接「有助于缓解深层网络中的梯度传播困难」(:946);维度不一致用 1×1 或带步长投影匹配(:965);更深的 ResNet 用 1×1–3×3–1×1 瓶颈结构(:968);串很多残差单元成超深网;同类 Highway Network;残差连接已成一切深度网络的基础模块、「并不限于卷积网络」(:970-972)。
  • 转置卷积(5.5.1,:978-1076):动机=低维到高维还想用「卷积型」算子;仿射视角 z=Wx ↔ x=Wᵀz,只是形式上的转置、不是逆运算(:995);卷积可写成稀疏矩阵 Cx(:1010 附近 式 5.48),x=Cᵀz = rot180(w) 宽互相关(:1020 附近 式 5.52);边注:叫「反卷积」不太恰当,不是逆运算(:1041 附近,ch13 已引);实现:两端补零 P=K−1 即宽卷积得 M+K−1 维(:1047);步长 S>1 的逆=特征间插 S−1 个 0 再做普通卷积=微步卷积(:1052-1066,输出 (D+1)(M−1)+K);代价:棋盘状伪影,替代方案「先插值上采样再普通卷积」(:1076)。
  • 空洞卷积(5.5.2,:1082-1097):扩感受野三方式——大核/加深(增参)、先汇聚(丢信息)(:1082-1085);空洞卷积不加参数扩感受野:每两元素插 D−1 个空洞,K′=K+(K−1)(D−1)(:1092-1097,D=膨胀率,D=1 退化普通);适合语义分割这种要大感受野又要高分辨率的任务。
  • 分组卷积(5.5.3,:1108-1115):输入通道分 g 组,每组只连自己那部分输出通道,显著省参省算;AlexNet 双 GPU 就是它思想的实例(:1115)。
  • 深度可分离卷积(5.5.4,:1136-1177):解耦「空间卷积」与「通道混合」两件事;逐通道 K×K(D 个核)+逐点 1×1(P 个核)(:1139-1143);参数 K²D+DP vs 标准 K²DP,比值 1/P + 1/K²;K=3 且 P 大时约 1/9 到 1/8(:1172);边界:无跨通道交互阶段,表示能力弱于同规模标准卷积,适合轻量级(:1174);MobileNet/EfficientNet(:1241)。
  • 总结(5.6):三条主线=卷积运算本身/基本组件/结构演化;四个设计原则=局部性、层次性、参数共享、模块化(:1197 起);「变的是什么、不变的又是什么」:Inception 改多尺度建模、ResNet 改信息与梯度传播路径、深度可分离改参数化方式(:1205 附近);演化本质=表示能力、可训练性、计算效率三者找平衡(总结段);ViT/ConvNeXt:不是替代而是重组(ch13 已引 :1233-1236)。

主走查数据(14 章,来自习题 5-2 的设定)

32×32×3 输入、64 个 3×3 核、S=1、P=1:输出 ⌊(32−3+2)/1⌋+1=32 → 32×32×64;参数=64×(3×3×3)+64=64×27+64=1792;接 2×2 步长 2 最大汇聚→16×16×64。换深度可分离:逐通道 3×3×3=27,逐点 1×1×3×64=192,合计 219;比值 219/1792≈0.12≈1/8,与书上 1/P+1/K²=1/64+1/9≈0.126 对齐。(说明这些数按书内公式现算,属原书习题口径。)

原书第6章 → 拆解 15(循环网络)+ 16(长程依赖与门控)

  • 给网络加记忆的三条路(07-ch06.txt):前馈是静态网、无记忆(:33);①延时神经网络 TDNN:非输出层加延时器,记最近 K 个时刻活性值,式 6.1(:44-50);②自回归模型 AR 用自己的历史预测自己(:59),NARX 加外部输入、两个延时器 Kx/Ky,式 6.3(:69-75);③循环神经网络带自反馈神经元,处理任意长度时序数据,h_t=f(h_{t-1},x_t) 式 6.4(:80-90)。边注:TDNN 对序列输入相当于卷积(:44)。
  • 隐状态:h_t 文献中称状态/隐状态(:106);「按时间展开=时间维度上共享参数的深层网络」(:108,:140-149)。
  • SRN(Elman 1990):更新公式 z_t=U h_{t-1}+W x_t+b;h_t=f(z_t),U 是状态-状态权重 D×D,W 是状态-输入 D×M,f 通常 Logistic 或 Tanh,式 6.5–6.7(:120-155)。
  • 表达能力(边注声明属补充阅读,:163-166):通用近似定理 6.1——足够多 Sigmoid 型神经元可近似任意非线性动力系统(:167-180);图灵完备定理 6.2[Siegelmann et al., 1991] (:241);但书里明确划界:「理论表达能力和可学习性、计算效率、泛化能力仍是不同层面的问题」(~249-251)。
  • 四种应用模式(表 6.1,:252-263):序列分类多对一(文本分类)、序列标注等长对齐(词性标注)、自回归序列建模(语言模型,NTP)、条件序列生成(机器翻译/语音识别)。分类用 h_T 或全时间平均作表示(:276,:297);标注每个 h_t 过分类器(:306);条件生成=编码器-解码器,解码器自回归(<EOS>)(:370-400)。信息瓶颈边注:整条输入压成少数几个状态向量,输入长时形成瓶颈→引入注意力让解码器动态访问编码器不同位置(:398-405,兑现到 20 章)。
  • 教师强制与暴露偏差:训练把真实序列右移一位、每位置预测下一符号→可并行算所有位置损失;生成时只能用自己已生成的历史→错误在错误历史上展开(:361-364)。
  • BPTT:误差项 δ_{t,k}=∂L_t/∂z_k,递推 δ_{t,k}=diag(f'(z_k))Uᵀ δ_{t,k+1} 式 6.38;直观:「误差信号从时刻 t 沿时间反向传播到时刻 k,每经过一步都乘以 diag(f′(z_k))Uᵀ」(:495-499);参数梯度=Σ_t Σ_k δ_{t,k} h_{k-1}ᵀ(所有时刻求和,式 6.41,:500-510);参数真实梯度是「所有展开层的参数梯度之和」(:453);总损失对 U 的梯度=各时刻损失偏导之和(:436)。
  • RTRL:前向模式算梯度,适合在线/无限序列但要维护状态对参数的偏导数,开销高(:582-587);比较:BPTT 计算量小(输出维低于输入维)但空间复杂度高(:584)。
  • 长程依赖::591(梯度跨时间传播易消失或爆炸);式 6.49-6.50 展开 δ_{t,k}≈γ^{t-k}δ_{t,t},γ≈‖diag(f')Uᵀ‖(:600 附近);γ>1 爆炸(:604-605),γ<1 消失(:608-609);更精确用 U 的谱半径刻画:最大特征值模大于 1 爆炸、小于 1 消失(边注 :610-612);关键坦白边注:消失的不是 ∂L/∂U 而是 ∂L_t/∂h_k,参数更新主要靠相邻状态,远距离状态对参数没影响(:614-621);Logistic/Tanh 导数值都小于 1 且 ‖U‖ 不大→间隔大必消失(:624-626);结论:理论上能建立长时间依赖,实际只能学到短期依赖(:627-631)。
  • 改进:爆炸好治——权重衰减(ℓ1/ℓ2 正则限制参数使 γ≤1)、梯度截断(模超阈值就截小)(:642-647);消失难治——改模型:h_t=h_{t-1}+g(x_t;θ)(式 6.51)线性依赖无消失但丢非线性降表示力(:652-658);再改进 h_t=h_{t-1}+g(x_t,h_{t-1};θ)(式 6.52,边注:和残差连接思想类似)(:662-668);仍剩两问题:①可能梯度爆炸(习题 6-7);②记忆容量问题:h_t 累积发生饱和(Logistic 下越来越大),存的信息越多丢的越多(:675-681)。
  • LSTM[Gers et al., 2000] (:689+):新内部状态 c_t 专门做线性循环传递,同时非线性输出给外部状态 h_t;c_t=f_t⊙c_{t-1}+i_t⊙c̃_t 式 6.53,h_t=o_t⊙tanh(c_t) 式 6.54(:695-703);门的出处=数字电路二值变量 {0,1}:709;三作用列举(:720-722):遗忘门控 c_{t-1} 遗忘多少/输入门控候选态写入多少/输出门控露出多少;门是 (0,1) 软门(σ 计算 :728-750);避免梯度消失的关键边注:c 的更新是加法形式,f_t≈1 时梯度近似恒等传播(:732-736);工程提示:遗忘门偏置 b_f 常初始化为正(:746-748);记忆三层次:h=短期记忆(每步重写)/参数=长期记忆(更新慢)/c=长短期记忆(生命周期居中,名字是「长的短期记忆」)(:777-789)。
  • GRU[Cho 2014; Chung 2014] (:791+):不引入额外记忆单元;更新门 z_t 控制「保留历史 vs 写入候选」,一组互补权重(h_t=z⊙h_{t-1}+(1−z)⊙g 式 6.62)(:800-811);重置门 r_t 控制候选状态看不看历史,r=0 时只看当前输入(:818-830);退化关系:z=0,r=1 →退化为 SRN;z=1 →h_t=h_{t-1} 完全跳过当前输入(:835-840);表 6.2 三模型对照(SRN 无门紧凑难长程/LSTM 三门控制细参数多/GRU 更新+重置两门紧凑)(:850-868)。
  • 深层 RNN:深度=信息路径长度,RNN 既深(跨时间长)又浅(同刻 x_t→y_t 浅)(:870-880);堆叠 SRNN/RMLP(:882-911);双向 Bi-RNN 一层顺序一层逆序拼接(:919-935)。
  • 从链到树再到图:链上节点收前一时刻消息→更新→传后继(:953-955);推广到树=递归神经网络 RvNN、到一般图=GNN(:958-961);统一框架「信息传递—状态更新—表示读出」(:957-961);RvNN 句法树组合语义,公式 6.71-6.74(:962-1000);结构退化为线性序列时 RvNN 等价于 SRN(:1005-1006)。
  • 总结与 SSM:关键句「让哪些信息沿着什么路径传播,并保留多久」(:1035);Mamba 状态空间模型:递推思想+连续时间线性系统,结构化参数化+输入依赖选择性机制,长序列上以线性计算复杂度达到与同规模 Transformer 相当性能(:1046-1048);Mamba-2 结构化状态空间对偶理论统一线性注意力与 SSM[Dao & Gu 2024] (:1051);边界正在模糊(:1052-1054);RNN 在流式/在线/低延迟仍有独特价值(:1055 附近)。

原书第7章 → 拆解 17(优化)+ 18(初始化/预处理/规范化)+ 19(超参/正则化)

  • 两大难点(08-ch07.txt):优化(非凸、参数巨多、一阶慢不稳、梯度消失爆炸)(:14 前段);泛化(过拟合,需正则化)(:14)。
  • 高维非凸:难点不是局部最优而是鞍点(一阶梯度0、一些维度最高另一些最低)[Dauphin et al., 2014] (:54);驻点在各方向同时局部最小的概率随维数快速下降→驻点多为鞍点(边注:独立性假设只助理解 :78);随机性=逃离手段:SGD靠引入随机性逃离鞍点(:81)。
  • 平坦/尖锐最小值:Flat Minima[Hochreiter; Li] (:84);边注:「这里的很多描述都是经验性的,并没有很好的理论证明」(:88);平坦→鲁棒→通常泛化好(:92-95);许多局部最小解训练损失接近全局解[Choromanska] (:100 附近),更重要的是找泛化好的解、过度追求训练损失可能过拟合(:106)。
  • 优化改善四路(:108-118):更有效算法7.2 / 更好初始化+预处理 / 改结构改地形(ReLU、残差、规范化)/ 更好超参搜索。优化地形=高维空间中损失曲面形状(边注)。
  • 小批量 SGD:式7.1-7.4,K 为批大小(:142-152);三因素=批大小K、学习率α、梯度估计(:160-167)。批大小不影响期望影响方差;大批稳定可配大学习率(:178-181);线性缩放规则:批大 m 倍学习率增 m 倍[Goyal][:182-183,小批适用];1 轮=N/K 次迭代(:190);按迭代看大批降得快、按回合看小批快,适当小的批量导致更快收敛(:217);Keskar:批量越大越收敛到尖锐最小值(:219);梯度累积:拆成多个小批累加梯度后再更新,数学上等价大批但显存只占小批,大模型常用工程手段(:222-227)。
  • 学习率调整:过大不收敛过小太慢(:232);衰减五式(分段常数/逆时/指数/自然指数/余弦 式7.5-7.8 ~:248-290);预热:初期参数随机梯度大,先用小学习率再恢复(逐渐预热 式7.9 :293-306);周期性增大有助逃离尖锐最小值/留在平坦吸引域(:313-320):循环学习率(Smith)[三角]、SGDR 热重启(重启不从零开始,在当前参数上继续,Loshchilov)(:338-360),不重启退化成余弦衰减(边注)。
  • 自适应学习率
    Duchi
    :按历史梯度平方累计反比缩放式7.14-15,累计大的参数学习率小(:383-400);缺点:有效学习率持续变小、后续更新过慢(:404-405);RMSprop(Hinton):G_t 改指数衰减移动平均 β=0.9,学习率既可变小也可变大(:420-427);AdaDelta[Zeiler]:再加更新量平方的移动平均,把初始学习率 α 换成动态算的 √ΔX(:430-450)。
  • 梯度估计修正:动量法:负梯度的加权移动平均当更新方向 式7.21,ρ 通常 0.9(:463-477);方向一致→加速、不一致→振荡减速增稳(:478-481);边注:不能简单等同于二阶优化方法(:482);NAG:先按 Δθₜ₋₁ 走到 θ̂ 再在 θ̂ 上求梯度,更合理(:486-496);Adam[Kingma]=动量+RMSprop:M_t(一阶矩均值)、G_t(二阶矩未减均值的方差),β₁=0.9 β₂=0.999(:526-543);M₀=G₀=0 → 初期偏小、β 接近 1 时偏差很大→偏差修正 M̂=M/(1−β₁ᵗ)(:538-548);α 常 0.001 可配调度(:554)。
  • Muon[Jordan; Liu]:「MomentUm Orthogonalized by Newton–Schulz」,两步=动量出方向→正交化(:567-572);直觉:不同方向信号强度差异大,强方向主导弱信息被淹;保留所有方向信息,各方向幅度统一拉平(:576);SVD 后 Σ 全置1 只留方向 式7.31,Newton-Schulz 迭代近似省 SVD 成本(:592-600);混合策略:隐藏层二维矩阵用 Muon,偏置/规范化/嵌入等其余用 AdamW(:603-605);意义:优化器可显式利用权重矩阵几何结构。
  • SAM[Foret]:min_θ max_{‖ε‖≤ρ} ℒ(θ+ε) 式7.33——同时压低取值和尖锐程度(:614-618);两步近似:先找最坏扰动再在该处求梯度更新(:620-628);常被视为带正则化效应、放在优化里讲(:628-631)。
  • 梯度截断:循环网爆炸的有效方法;按值截断式7.34/按模截断式7.35[Pascanu];阈值不敏感、小阈值即可(:632-676)。
  • 参数初始化:三种方式=预训练初始化(微调 fine-tuning;无监督任务容易拿大数据)(:728-738)/随机初始化/固定值初始化(LSTM 遗忘门偏置初始化为 1 或 2 使初期偏向保留记忆 :765;ReLU 偏置设 0.01 让初期更容易激活拿到梯度 :766-768)(:740-772)。全零 → 对称权重现象(前向激活相同反向更新相同无区分性)(:752-758)。
  • 固定方差:太小→输出过小多层后信号消失+近线性丢非线性;太大→饱和梯度近 0(:796-801);一般配合逐层规范化使用(边注)。
  • 方差缩放/Xavier/He:思路=保持每层输入输出方差一致、按连接数自适应(:807-816);Xavier[Glorot]:恒等函数下推导 var(w)=2/(Min+Mout) 折中式7.46-7.48(:818-892),Logistic 线性区斜率约0.25→方差乘16或缩放因子 ρ(:894);He/Kaiming[He 2015]:ReLU 一半输出为0→方差近似一半→只考虑前向 var=2/Min(:902-910);表7.2 汇总。
  • 正交初始化:独立采样保不住范数保持性;W Wᵀ=I 则前向反向都保范数[Saxe];实现=高斯矩阵+SVD 取正交阵;非线性网络要乘缩放系数(ReLU 0 附近平均梯度≈0.5→√2);常用于 RNN 循环边上(边注)(:938-968)。
  • 数据预处理:尺度不变性定义;线性分类器尺度不变、最近邻尺度敏感(欧氏距离大尺度特征主导)(:979-982);tanh 例:x1∈[0,10],x2∈[0,1] 时须把 w1 设在 [−0.1,0.1] 附近,维数多了没法逐个挑(:991-996);未规范化等高线长条形→梯度方向多绕路(:998-1002);最小最大值规范化式7.51(:1018);标准化/Z-score 减均值除标准差,标准差为 0 的维度可直接删掉(:1027-1048);白化=去相关+同方差,PCA 实现(:1049)。
  • 逐层规范化:动机=楼层比喻(低层小偏移放大到高层)+内部协变量偏移 ICS(:1070-1074);BN 动机的现代修正:主要作用不在减少 ICS,而在使优化地形更平滑、允许更大学习率[Bjorck; Santurkar] (:1094-1096);规范化放在仿射后激活之前(:1105);统计量用小批量近似式7.56-58;γ 缩放 β 平移,γ=σ β=μ 时可完全还原(:1150);BN 有平移所以该层不再需要偏置(:1157);部署时用全体/移动平均统计(:1163);BN 同时是隐形正则化(预测依赖同批其他样本,不会过拟合到特定样本)(:1164-1172)。
  • LN/RMSNorm/WeightNorm/LRN:BN 针对单个神经元、需要批量不能太小;动态分布(如 RNN)难用 BN(:1173-1176);LN 对同一层全部神经元归一[Ba];列 vs 行对照(:1216);RNN 净输入随时间漂移→LN 缓解(:1213);视觉/大批量 BN 常见,RNN/Transformer/小批量 LN 自然(:1218-1220);RMSNorm 不减均值只调尺度,Transformer 类大模型更常见(:1224-1247);WeightNorm:W 分解成长度×方向(g·v/‖v‖),开销小(:1253-1262);LRN 已少用(:1263-1266)。
  • 超参数优化:三类超参(结构/优化参数/正则系数)(:1273-1277);两困难=组合优化无法求导+评估一组代价极高(:1280-1283);网格搜索(m₁×…×m_K 组合;连续超参不能等间隔离散化)(:1294-1300);随机搜索:重要性差异大时不浪费在不重要维度,常常更有效(:1308-1312);贝叶斯优化 SMBO:高斯过程建模 f(x)|ℋ,收益函数(EI 等)挑下一个;缺点 O(N³) 高维难(:1331-1356);动态资源分配:学习曲线预估差配置提早掐掉,逐次减半/HyperBand(:1382-1394);NAS:控制器(RNN)+强化学习,奖励=子网验证集准确率;先小模型调参再迁移=更便宜地搜索(边注:特征工程→网络架构工程)(:1427-1436)。
  • 正则化:过度参数化(参数远大于样本,边注)下 ℓ1/ℓ2 效果不如浅层模型显著(:1470s);ℓ1 使解稀疏(最优解位于坐标轴)(:1489);弹性网络(λ1ℓ1+λ2ℓ2)(:1501);权重衰减:θ←(1−β)θ−αg,β=αλ,典型 0.0005;SGD 下与 ℓ2 正则恰好等价(:1513-1522);Adam 下不等价:λθ 会进入矩估计被 1/√Ĝ 自适应缩放,收缩强度受历史梯度影响、「优化目标」与「参数抑制」耦合(:1537-1550s);AdamW 解耦:单独做权重衰减 −αλθ,各司其职、λ 与 α 清晰分离,Transformer 训练默认(:1563-1593)。
  • 提前停止:验证错误不再下降就停;曲线可能波动需调整标准(:1598-1610s)。
  • 暂退法 Dropout:随机屏蔽神经元输出(连接一起断);反向缩放 inverted dropout 训练除以 p 保持期望尺度一致(:1613-1630);作用=降低共适应(:1631);输入层保留率接近 1,隐藏层可以更小(:1635);集成解释:n 个神经元 2ⁿ 个子网络共享参数(:1648);贝叶斯解释::1660s;循环网上不能每时刻独立屏蔽(伤记忆),要么只屏蔽非循环连接[Zaremba],要么变分暂退法(所有时刻共享同一掩码)[Gal] (:1664-1680)。
  • 数据增强:五种图像变换(旋转/翻转/缩放/平移/加噪声)(:1690s);mixup:样本与标签凸组合 λ~Beta,鼓励更平滑判别边界(:1706-1712);本质=把任务合理的不变性/平滑性显式编码进训练,不是制造更多数据(:1716 附近)。
  • 标签平滑:硬目标 one-hot 下 Softmax 要接近 1 得分必须远大于其他类→过于自信过拟合;软目标 ε/(K−1) 防过拟合并改善校准(:1733-1741);教师网络的输出当软目标教学生=知识蒸馏[Hinton];注意教师若用了较强标签平滑蒸馏效果反而变差(:1746-1751)。
  • 训练诊断:持续看训练/验证损失、梯度范数、置信度;表7.3 四现象四排查(:1754-1780);测试集只能用一次,反复根据测试集修改=隐含验证集,评估过于乐观;超参搜太多→对验证集二次过拟合(:1780-1790)。

主走查数据(17-19 章)

  • 17 章 Adam 手算(梯度 0.1/0.2/0.15,α=0.01,β₁=0.9,β₂=0.999,ε≈0): t=1: M=0.01,G=1e−5,M̂=0.1,Ĝ=0.01,Δ=−0.01000,θ₁=0.99; t=2: M=0.029,G=4.999e−5,M̂=0.15263,Ĝ=0.025008,Δ=−0.00965,θ₂=0.98035; t=3: M=0.0411,G=7.244e−5,M̂=0.15166,Ĝ=0.024169,Δ=−0.009755,θ₃≈0.97060; 对照:普通 GD θ₃=1−0.01×0.45=0.99550;动量 θ₃≈0.99199(Δ 序列 −0.001,−0.0029,−0.00411); 无偏差修正第一步:M/√G=0.01/0.0031622=3.162→Δ=−0.03162,是正确值的三倍多。
  • 18 章 初始化:100→256→128→10:Xavier 方差 = 2/(入+出):0.005618/0.005208/0.014493;He = 2/扇入:0.02/0.0078125/0.015625(He 末层 128 入故 ≈ Xavier)。BN 走查:z=[−2,−1,1,2] (演示编),μ=0,σ²=2.5,σ=1.5811,标准化 [−1.265,−0.632,0.632,1.265];γ=σ,β=μ 还原原值。
  • 19 章 dropout+标签平滑:x=[1,2,3,4],p=0.8,掩码留 {1,2,4} 弃 3:x⊙m/p=[1.25,2.5,0,5];期望不变。标签平滑 K=4,y=[1,0,0,0],ε=0.1→ỹ=[0.925,0.025,0.025,0.025]。logits z=[2,0,0,0] (演示编)→p=[0.7112,0.0963,0.0963,0.0963];硬目标 CE=0.3409;平滑 CE=0.4912(e⁻².34×0.075 部分)。所有 logits/掩码选择为演示设定,公式均为书内公式。

原书第8章 → 拆解 20(注意力)+ 21(Transformer)+ 22(现代优化)

  • 认知来源(09-ch08-8-transformer.txt):注意力=有选择地加工信息的能力(:42);聚焦式(自上而下、任务驱动)vs 显著性(自下而上、刺激驱动)(:46,:50);鸡尾酒会效应(:52);AI 借的是「按任务动态选信息」思想,机制=可微、可学习的信息选择与聚合(:63-68)。
  • 注意力两步:查询向量 q + 打分函数→注意力分布 α(softmax)→加权聚合(:79-133,式8.1-8.7);打分四式(式8.2-8.5):加性/点积/缩放点积/双线性(:98-103);点积可吃矩阵乘法效率高(:109-110);高维点积方差为 D→除以 √D 归一防 softmax 饱和(:114);双线性=(Ux)ᵀ(Vq) 引入非对称(:115-120)。
  • 变体:硬性注意力(argmax 或采样,不可导要靠强化学习,实际都用软性)(:163-180);键值对(K 算分 V 取内容,K=V 时退回普通)(:182-198);多头(多个查询并行,各关注不同部分,拼接)(:200-206);指针网络(只取分布当指向输入下标的指针,输入乱序数字→输出排序下标)(:212-230)。
  • 自注意力:卷积/循环本质都是局部信息交互;循环理论上长程但实际中短程(:272-274);自注意力=动态生成两两连接权重[Vaswani 2017] (:276);QKV 模式,线性投影 Q=WqX,K=WkX,V=WvX(式8.16-8.18);H=V·softmax(KᵀQ/√Dk)(式8.21,列向量约定,行约定 softmax(QKᵀ/√Dk)V 等价)(:288-296);图8.5:全连接权重可学习固定,自注意力权重由内容动态生成→天然变长(:341);表8.1:循环 O(TD²)/O(T) 顺序/O(T) 路径;卷积 O(kTD²)/O(1)/O(T/k);自注意力 O(TD)·? wait 单层计算复杂度表: 自注意力 O(T·D²) hmm表里写 O(T𝐷) 前面被截断——原文「自注意力 O(𝑇 𝐷)」? 实际表8.1: 循环 O(TD²), 卷积 O(kTD²), 自注意力 O(TD²)?? From the printed table: 自注意力 𝑂(𝑇 𝐷) — 但这疑似书里排印掉了平方。谨慎:引用时按原文表格内容写「自注意力的三项为 O(T·D²)?」不,别纠结——书表 8.1 写:循环 O(TD²)、卷积 O(kTD²)、自注意力 O(TD)(顺序 O(1)、路径 O(1))。Hmm 可疑但按书引用表格数字时用文字描述(复杂度列有争议),重点引用「顺序操作数 O(T)/O(1)/O(1)」和「最大路径 O(T)/O(T/k)/O(1)」+ 自注意力代价=显式构造 T×T 相关性矩阵(:369-371)。多头自注意力 MHSA(式8.22-8.24,拼接后线性变换)(:377-398)。
  • 位置编码:权重只依赖内容,不天然含位置→需显式注入;区分不了「位置不同内容相同」(:440-448);H⁰=E+p(式8.25);sin/cos 式8.26-8.27,相对距离可线性变换表示(:454-460);多尺度直觉:低维高频=局部,高维低频=全局(:477-483);四条局限:①周期函数极长时重复 ②固定函数不自适应 ③静态位置 vs 动态语义 ④长度外推差(:484-495)。
  • 相对位置编码:打分加偏置 s= kᵀq/√dk + b_jt(式8.28);ALiBi 线性偏置,「越远越不容易被关注」直接写进分数,外推好(:499-513);RoPE[Su 2024]:对每对相邻维度施加与位置相关的二维旋转;R(θ) 性质 Rᵀ=R(−θ)、R(α)R(β)=R(α+β);qₜᵀkⱼ=q̃ᵀR_{j−t}k̃(式8.33)→打分天然只依赖 j−t(:516-586);更容易融入缩放点积注意力(:586)。图8.8 三种位置编码对比(:590 附近)。
  • Transformer 块:编码块=多头自注意力+FFN+两个加与规范化(:604-634,式8.35-8.36);原始 Post-Norm;残差缓解梯度消失、LN 稳尺度(:633);FFN=两层全连接逐位置,类似核大小 1 的卷积(式8.37)(:637-640);解码器三模块:掩码自注意力/交叉注意力(查询来自解码器,键值来自编码器)/FFN(:646-660);因果掩码式8.38-8.39:j≤t 取 0,j>t 取 −∞→未来概率全零;图8.9 下三角(:662-700);填充掩码(:700);数据流:分词→词元编号→嵌入 E+位置→L 个块→logits z=Wo h+bo→softmax→p(w_{t+1}|w₁:t)(式8.41-8.43);训练=右移+教师强制并行交叉熵(式8.44);推断=「前缀→隐藏表示→logits→采样→追加」循环(:704-757);三种范式:仅编码器(理解)/仅解码器(生成,LLM 主流)/编码器-解码器(条件生成),差别只在信息流方向和训练目标(:762-771)。
  • 现代优化四条线(图8.11):块内结构/长上下文/推断系统/容量扩展;目标=可训练、可扩展、可部署(:792-830)。
  • 块内:Pre-Norm vs Post-Norm(式8.45-8.46);现代 LLM 用 Pre-Norm——为每个子层提供更稳定输入尺度,利于深层梯度传播(:842);LN→RMSNorm(式8.47)(:844-850);门控 FFN SwiGLU(式8.48):FFN=w2(swish(w1 z)⊙(w3 z)),swish=x·σ(x);额外门分支调制信息流,相近计算预算下提升表示能力(:857-862);现代块式8.49-8.50;「不改变总体骨架,对块内信息流路径做改造,不改自注意力渐近复杂度」(:866-870)。
  • 闪存注意力 FlashAttention[Dao 2022]:瓶颈常是访存不是算术(:883-884);三点:按块处理/块内计算块间累积/在线 softmax(维护行最大值与归一化常数)(:888-922);不是近似、不少算,还是同一个 O=V·softmax(KᵀQ/√Dk),只是边分块边归一累积;中间激活从显式二次压到接近线性(:923-932);边注:Flash 属精确实现优化,局部/稀疏/线性注意力属改连接模式或近似(:934-938)。
  • 长上下文三挑战:平方增长/位置外推/KV 缓存线性增长(:940-944);位置外推:RoPE 基础+ALiBi 简单+YaRN/LongRoPE 重缩放或插值频率(:956-964);窗口大≠理解好:上下文窗口首先提供的是可访问范围,能否利用还看数据与任务(:966-968);局部窗口注意力+跨块连接/滑动窗口/全局词元(:970-978)。
  • 线性注意力与 SSM:核函数近似消 softmax 非线性耦合→重排为 O(T) 矩阵乘;Performer 随机特征(:980-986);关键句:线性化后注意力层可等价写成递推更新固定大小状态矩阵——数学上可看作一种特殊的循环神经网络(:988-990);SSM:h̄ₜ=Āh̄ₜ₋₁+B̄xₜ;yₜ=Ch̄ₜ(式8.52-8.53);S4 对 A 施加结构(对角化/HiPPO)+卷积视角并行训练(:995-1000);Mamba 选择性机制:B̄、C 依赖当前输入,内容决定记住什么忘记什么;线性复杂度+恒定推断内存(:1002-1010);三种权衡:Transformer T² 买全局交互;线性/SSM 固定状态换 O(T) 但精确回溯受限;常见混搭=交替层(:1010-1014)。
  • 推断系统:训练与推断瓶颈不同(教师强制并行 vs 逐词元小步)(:1017-1020);前缀填充 prefill(整段并行写缓存)vs 解码 decode(读缓存-算当前-追加)(:1023-1046,图8.13);KV 缓存式8.54-8.57(:1048-1070);MQA 全共享一组 KV[Shazeer];GQA 分 G 组共享,G=M 退化标准多头,G=1 退化 MQA[Ainslie] (:1074-1100);分页注意力:分页组织 KV,减碎片提并发[Kwon] (:1104-1109);投机解码:草稿模型提候选+目标模型并行验证,保持输出分布不变[Leviathan] (:1110-1114)。
  • MoE[Shazeer 2017]:前馈层放多个专家+路由器选 top-k(式8.59-8.60);总参数大、每位置只激活少数(:1117-1132);问题:负载不均/路由不稳/通信开销;对策:共享专家/细粒度专家/负载均衡损失(:1135-1140);不是对注意力的优化,是容量扩展的独立路线(:1138);表8.2 演化总表(:1150-1172);总结:「现代 Transformer 不只是静态网络结构,而是围绕训练、长上下文建模和高吞吐推断共同设计的系统」(:1208)。
  • DeepSeek-V3 参照物(在 14-ch13.txt):总参数 671B、每词元仅激活约 37B(14-ch13.txt:295-296,边注「混合专家参见第8.4节」)——按大纲指令放在拆解 22 章 §7 做参照物。

主走查数据(20-22 章)

  • 20 章:一维键值走查(Dk=1,缩放省略,q=1;k=[0, 0.916, 0.405] 演示值;v=[2,1]/[0,1]/[1,0]):exp=(1, 2.5, 1.5),Σ=5,α=(0.2, 0.5, 0.3);h=0.2[2,1]+0.5[0,1]+0.3[1,0]=[0.7, 0.7]。双头拼接 2+2=4 维,输出投影 W_o∈R^{2×4} 压回 2 维。
  • 21 章:因果掩码 4×4 下三角;同一组分数 (0, 0.916, 0.405) 在位置 2 加掩码:exp(−∞)=0,重归一 α=(0.2, 0.5)/0.7=(0.286, 0.714, 0)。
  • 22 章:32 头×128 维×48 层,T=1000:缓存数=2(K,V)×48×32×1000×128=393,216,000 个数;按 fp16(2 字节)≈786 MB(换算率为我们设定)。GQA 32→4:缓存÷8≈98 MB。无缓存重算:第 1000 步每层每头要算 1000×1000=10⁶ 个分数 ×1536(=48×32)≈1.54×10⁹;有缓存 1000×1536≈1.5×10⁶,约 1000 倍。

原书第9章 → 拆解 23(图数据与消息传递)+ 24(经典 GNN 与共性问题)

  • 图与表示(10-ch09.txt):图=节点+边,同时刻画实体与关系;关键=属性与连接结构同样重要(:29-33);无向/有向(好友 vs 引用)(:49-57);同质/异质(:59-67,异质需专门模型);邻接矩阵(写公式方便,稠密存稀疏图浪费)/邻接表(稀疏图)/边列表(边操作多)(:93-120);异质图=多个关系子图三元组(:121-125)。
  • 数学性质:度/入度出度(:134-140);同质性 H_ratio=连接同类节点的边数/总边数;GCN 默认邻居有用→适合同质图;低同质时邻域平均反而削弱(:142-152);异配性≠异质图(:154-158);拉普拉斯矩阵 L=D−A(式9.3);(Lx)ᵢ=Σ A_ij(x_i−x_j)=局部差异(式9.6-9.7);xᵀLx=½Σ A_ij(x_i−x_j)²(式9.8)=平滑性度量;归一化拉普拉斯 L_norm=I−D^{−1/2}AD^{−1/2} 消度差异(式9.9)(:160-250);图9.1a 五节点例子的 A/D/L 显式给出(式9.4-9.5):d=(3,2,3,3,3)。
  • 三类任务(引文网络贯穿例)(:250-364):节点级(分类/回归/表示学习,直接用 h_v);边级(链接预测 s=h_uᵀh_v 或 MLP(h_u⊕h_v);边分类回归);图级(需读出函数把节点表示汇聚成 h_G;图生成 GraphVAE/GraphRNN);读出=把学到的节点表示换成任务输出的步骤(边注);划分纪律:节点任务同图划分训练节点(传导 vs 归纳);链接预测必须从训练图中删除验证/测试正例边,否则模型直接靠已存在的边得答案;时间演化优先时间划分;图级任务以整图为单位、防近重复泄漏(:334-350);指标匹配:不平衡用宏平均/PR 曲线(:344-350)。
  • 消息传递(MPNN 框架[Gilmer 2017])(:365-500):一层只聚合一阶邻居;L 层最多覆盖 L 跳邻域,层数=感受野(:381-390);层数加深带来过度平滑/过压缩/开销(:390);三步:消息构造 m_{u→v}=φ(h_v,h_u,h_e)(式9.12)→邻域聚合 AGGREGATE(式9.13,求和/平均/最大)→状态更新 UPDATE(式9.15-9.16, ReLU(W[h⊕m]));邻居本质是集合→聚合必须对排列不变(:396-405);全局汇聚/读出(式9.17);计算流程四步(初始化/逐层/读出/预测)(:476-492)。
  • GCN(谱方法)(:493-778):图卷积保持局部连接+参数共享(:495-520);路线「卷积定理→傅里叶变换→图傅里叶→谱图卷积→局部近似」(:536-538);卷积定理:时域卷积=频域逐点乘(定理9.1,式9.22-9.23)(:578-582);频率基=展开信号的基函数;复指数是拉普拉斯算子的特征函数(−Δe^{iωt}=ω²e^{iωt})→傅里叶=在拉普拉斯特征函数基下展开(:584-600);图上:归一化拉普拉斯特征分解 L=UΛUᵀ,特征向量=频率基,特征值=频率(小=平滑,大=振荡)(:581-628);谱图卷积 g_θ∗x=U g_θ(Λ)Uᵀx(式9.31)(:629-650);两局限:特征分解贵 O(N²)、滤波器不天然局部(:650-656);多项式近似 g_θ(L)=Σα_kL^k,K 阶多项式天然 K 跳局部(:658-695);ChebNet 用 Chebyshev 多项式,复杂度 O(N³)→O(KE)(:682-695);Kipf 简化:K=1、λmax≈2、参数共享→θ(I+D^{−1/2}AD^{−1/2})x(式9.35-9.36);重规范化技巧:Ã=A+I 自环、D̃(式9.37-9.39);GCN 层公式 H^{(l+1)}=σ(D̃^{−1/2}ÃD̃^{−1/2}H^{(l)}W^{(l)})(式9.40)(:732-746);节点级展开式9.41(对称归一化 1/√(d̃_u d̃_v) 平衡度差异)(:747-758);三节点链图例子(习题9-9):u−v−w,h=(1,2,0),W=1:自环度 (2,3,2),h_v=1/√6+2/3≈1.075(式9.42)(:759-778)。
  • GraphSAGE[Hamilton 2017] (:779-855):贡献=邻居采样+归纳学习纳入训练;归纳 vs 转导(新节点 vs 固定图);每层最多采样 S 个邻居,计算规模可控,支持小批量(:793-811);聚合函数:平均/LSTM(顺序敏感,需打乱)/汇聚 max(式9.43-9.45);更新 h_v=σ(W[h_v⊕h_N])(式9.46)+ℓ2 归一化(式9.47)(:811-855)。
  • GAT[Velickovic 2018] (:856-914):邻居重要性不同→注意力权重;注意力仍局限在局部邻域(与 Transformer 全连接不同),仍是消息传递式(:862-866);e_vu=LeakyReLU(aᵀ[Wh_v⊕Wh_u])(式9.48);softmax 归一化把自身也纳入=自环(式9.49);聚合式9.50;多头拼接(中间层)/平均(输出层)(式9.51-9.52)(:883-900);GATv2 调换线性与非线性顺序解静态注意力限制(:902-906)。
  • GIN[Xu 2019] (:915-1010):图级任务的关键=能否区分图结构;图同构定义(双射保边)(式9.53);WL-Test:反复把自身标签+邻居标签多重集合组合映射新标签;标签分布不同→一定不同构;稳定相同只能说明「未能区分」;多重集合关心出现次数(边注:能区分 {a,a,b} 与 {a,b})(:921-975);1-WL=颜色细化;图9.6 例:第一轮按度分裂,第二轮按邻居颜色组合再分;与 C5 环第一轮即分(:977-996);GIN:h_v=MLP((1+ε)h_v+Σh_u)(式9.56);求和聚合+MLP 与 1-WL 判别力对应;聚合函数不是实现细节,直接决定能区分哪些结构差异(:992-1010)。
  • 表9.1 四模型比较(:1011-1018):GCN 归一化聚合/全图训练/简洁但依赖同质性、深层过度平滑;GraphSAGE 采样后聚合/小批量/大图归纳但采样有近似误差;GAT 邻域注意力/多头/灵活但开销高于 GCN;GIN 求和/图分类/理论表达强但不解决大图与长程;经典模型发展=局部聚合、计算代价、结构表达三类问题(:1015-1018)。
  • 三共性问题(:1019-1140):过度平滑:层数增→反复混合→节点表示趋同;Dirichlet 能量 E(H)=½Σ A_vu‖h_v−h_u‖² 趋零=高度相似(式9.57)[Zhou 2021];缓解:残差/随机删边 DropEdge/规范化与能量约束(:1051-1080);过压缩:远距信息被迫挤过少数边/低维表示而丢失;树状/瓶颈结构尤甚;缓解:加长程边或重连/残差跳连全局注意力/更强读出与记忆(:1081-1101);「局限不只来自层太深,也来自长距离依赖必须经过狭窄结构传播」(:1099-1101);可扩展性:邻域爆炸/高存储/整图访问贵;对策:邻居采样(GraphSAGE)/子图采样(GraphSAINT)/图划分分块(Cluster-GCN)(:1104-1138)。
  • 总结(:1140-1180):消息传递是理解主线;三条进阶线索=理论基础(谱图/WL)/工程规模化/模型拓展(图 Transformer、图自监督、图生成、时空图、异质图)。

原书第10章(前半) → 拆解 25(无监督特征学习)+ 26(密度估计与聚类)

  • 四类无监督任务(11-ch10.txt):特征学习/密度估计/聚类/自监督(:23-40);特征学习准则=最小重构误差+约束(低维/独立/非负/稀疏)(:41-44)。
  • PCA:投影方差最大;拉格朗日→Σw=λw;w 是协方差矩阵最大特征值对应的特征向量,λ=投影方差(式10.5-10.7)(:96-105);前 D' 个特征向量=最优投影矩阵(式10.8);用途=去噪去相关预处理,不保证类别可分性更好(那是监督的 LDA)(:113-118)。
  • 稀疏编码:视觉皮层简单细胞启发,编码稀疏符合低功耗(:123-131);线性编码 x=Az,A=字典,z=编码(式10.9-10.10)(:136-143);过完备 M>D(数学小知识)(:148-158);稀疏约束缩小解空间→稳定可辨识(:160-163);目标=重构+ηρ(z)(式10.11);ρ 选择:ℓ0 不可导→ℓ1/对数/指数(式10.12-10.15)(:176-190);交替优化:固定 A 求 z、固定 z 求 A(:206-220);优点:可解释(少数非零=少数相关特征)/自动特征选择/计算效率(注意:学习本身要迭代不便宜,学好的表示可利用稀疏结构)(:223-235)。
  • 自编码器:编码器 f:R^D→R^M + 解码器 g,最小重构误差(式10.18-10.19)(:237-252);M≥D 且容量大→退化为恒等函数仅仅复制输入,必须加约束(低维/稀疏/噪声鲁棒/取值范围)(:254-258);编码取 K 个值=向量量化/聚类(:260-262);捆绑权重 W²=W¹ᵀ 参数更少正则化(:289 附近);线性自编码器≈PCA 推广(:296 附近);训练后去掉解码器只留编码器(:304);稀疏自编码器:M>D+稀疏,平均活性 ρ̂ⱼ≈ρ*(0.05) 用 KL 约束(式10.24-10.26)(:308-350);堆叠自编码器:逐层训练,历史上为深层网络提供初始化;如今逐层预训练不再主流,但「先无标注学表示再迁移」思想影响自监督(:351-362);降噪自编码器:随机损坏(μ≤0.5)再重构无损;「去噪重构」类目标的早期代表(:363-380)。
  • 密度估计:参数(假设分布估参数)vs 非参数(不假设)(:399-402);MLE(式10.27-10.28)(:415-420);正态:μ_ML=样本均值,Σ_ML=样本协方差(式10.31-10.32)(:430-450);多项:拉格朗日→μ_k=m_k/N=频率(式10.36)(:452-475);三个坎:模型选择/不可观测变量(需 EM,第14章)/维度灾难(:486-498);非参数核心公式:P≈K/N、P≈p(x)V → p(x)≈K/(NV)(式10.37-10.41)(:501-535);直方图:Δ 小→随机性大、Δ 大→过平滑;M^D 区间→维度灾难(Histogram 词源边注:皮尔逊 1895)(:539-564);核密度估计/Parzen 窗:超立方体核→高斯核(式10.43-10.47)(:566-610);K 近邻:固定 K 可变宽度;边注:不是严格的密度函数估计(习题10-10);最近邻分类器 N→∞ 错误率≤2倍最优[Cover 1967] (:612-626);密度估计是现代生成模型的入口(扩散/得分建模核心目标仍是学数据分布)(:628-634)。
  • 聚类:输出=离散簇编号;与表示学习/密度估计的差异(:636-640);K-Means:最小化组内平方距离和,交替优化(分配+更新中心)(式10.48)(:641-652);限制:预设 K、对初始化和特征尺度敏感、局部最优、球形假设(:652);聚类结果强烈依赖特征空间与距离度量(像素空间 vs 表征空间)(:654-658);评价:内部指标(组内平方误差/轮廓系数)vs 外部指标(纯度/NMI),都只反映一类偏好;同批文档按主题/风格/时间聚都合理(:658-668)。