跳到主要内容

第 34 章末尾说「势函数写成 exp(−能量)」;这一章把这句话长成一族完整的模型。 它们已经退出主流工程,但书开宗明义:学它们不是学工程实现, 是学三件事——怎么用能量定义分布、推断难时怎么近似、 逐层预训练的思想怎么一路活到今天的自监督时代。

玻尔兹曼机与深度信念网络:用能量定义一个分布

1. 这一章讲什么

两件事: 一族用「能量」定义概率的模型(玻尔兹曼机 → 受限玻尔兹曼机 → 深度信念网络),以及它们留下的三笔遗产:隐变量表示学习、 近似训练、逐层预训练思想。

它在全书链条里的位置: 第 34 章的玻尔兹曼分布与配分函数在这里 正式开工;第 25 章「逐层预训练」的伏笔在这里看到全貌;第 27、31 章 的自监督是它的思想后代。

需要第 34 章(配分函数)与第 35 章(吉布斯采样)。

2. 顶层全景

p(x) = exp(−E(x)/T) / Z —— 能量越低概率越高(§3)
├ 温度:高温抛硬币、低温确定性;与解码温度同形不同用(§4)
├ 全条件概率 = Logistic(§5)——每个变量是一台随机神经元
├ 学习:梯度 = 数据期望 − 模型期望(§6);慢在模型期望要重新逼近平衡
├ 砍同层连接 → RBM:整层条件独立、并行采样(§7)
│ 只走 k 步 → 对比散度,有偏但够用(§8)
├ 摞起来 → DBN:顶层 RBM + 下面有向层,逐层预训练(§9)
└ 历史定位:逐层预训练已退,「无标注预训练+微调」活成自监督(§10)

3. 用「能量」定义一个分布

玻尔兹曼机是一条三性质定义的随机动力系统:变量全是二值、全连接、 两两影响对称1。联合概率不写密度,写能量(第 34 章的玻尔兹曼分布):

p(x) = (1/Z)·exp(−E(x)/T) E(x) = −(Σ_{i<j} wij xixj + Σ bi xi)

正权重让「两个变量同时取 1」的状态能量下降、更常出现;负权重相反。 书给了一个好读的解释:每个变量是一个基本假设,权重是假设之间的 约束关系——正权重=互相支持,负权重=不能同真2。 玻尔兹曼分布有个方便性质:两个状态的概率比只依赖能量差 pα/pβ = exp((Eβ−Eα)/kT)3

4. 温度是什么旋钮

式子里的 T 不是比喻,是温度(能量模型里的):除在能量上再取指数。 书把两极说得很具体:T→∞ 时全条件概率趋近 0.5,每个变量的更新接近 随机抛硬币,状态之间容易混合;T→0 时随机性消失——能量差为正就取 1、 为负就取 0,「随机性方法变成了确定性方法」4

读者在第 31 章解码策略里见过采样温度(除在打分上、控制生成的随机程度), 在第 27 章见过对比学习的温度参数(除在相似度上)—— 三处是同一个数学形状,不是同一个旋钮:能量模型的温度定义「系统有多热」, 调的是探索与收敛的平衡5

顺带认识它的确定性亲戚:Hopfield 网络每次更新都让能量下降, 玻尔兹曼机则以一定概率让能量上升——后者靠这点随机性跳出局部最优6。 把「先高温后降温」正式化的算法叫模拟退火:冷却足够慢时, 依概率收敛到全局最优7

5. 全条件概率恰好是一个 Logistic 函数

吉布斯采样(第 35 章)需要全条件概率。玻尔兹曼机在这里送上一份大礼: 改变一个变量的取值,能量差恰好是 Σ wij xj + bi;把能量差过一遍 Logistic 函数,就是这个变量取 1 的概率(定理 15.1)8:

p(xi = 1 | x∖i) = σ( (Σj wij xj + bi) / T )

形式上就是一个神经元。这也解释了书开头那句「在一定程度上也称 为随机神经网络」——温度为 0、按期望取值时,它退化成普通网络; 带上温度,它是一台会掷骰子的网络9

6. 学习为什么这么慢

对数似然对权重的梯度,书推出了一个极简的形状(式 15.24):

∂ℒ/∂wij = ⟨xixj⟩data − ⟨xixj⟩model

数据分布下的期望,减去模型分布下的期望10。第一项好办:把训练样本 固定住,对隐变量采样即可。第二项是深渊:⟨·⟩model 要求模型自由运行 (所有变量都采样)达到热平衡再统计——而每更新一次参数,分布就变了, 整条链要重新逼近平衡。书原话:全连接的玻尔兹曼机「每更新一次权重, 往往都需要网络重新接近平衡分布,这个过程依然比较低效」11

顺带一提,这个更新规则只用局部信息(权重只看它两端变量的相关), 书说这与神经科学的赫布规则(一起激活的连接加强)十分类似12

7. 砍掉同层连接:受限玻尔兹曼机

受限玻尔兹曼机(RBM)的改动只有一刀:同一层内部不连边, 两层之间全连接(二分图)。书把收益说在明处:「给定一层时,另一层中的 各个变量条件独立,从而使采样和学习都明显简化」13

条件独立让整层可以并行采样:给定可见向量,所有隐单元同时算概率、 同时抽签;再反过来重构可见层——交替进行,像第 35 章吉布斯采样的 「分块版」,收敛快得多14。RBM 的直观形象书也给了:可见层是数据层, 隐层是潜在特征层;学习目标是用潜在特征较好地解释并重构训练数据15。 数据不是二值时换能量函数即可:高斯-伯努利 RBM 处理连续输入(像素), 伯努利-高斯 RBM 处理连续隐变量——变体只是换了能量函数16

主走查:一台 3+2 的 RBM 走完一次 CD-1

**结构:3 个可见单元、2 个隐单元。权重与偏置全部为演示编的: W 的第 i 行第 j 列是可见 i 到隐 j 的权重,

W = [[0.5, −0.4], [0.3, 0.6], [−0.2, 0.1]], b(隐) = [0.1, −0.1], a(可见) = [0, 0, 0]。

训练样本 v = (1, 0, 1);学习率 α = 0.1。按书内公式实算。**

第一步:向上,算隐单元取 1 的概率 p(hj=1|v)=σ(bj+Σi wij vi)17:

h₁: 0.5×1 + 0.3×0 + (−0.2)×1 + 0.1 = 0.4 → σ(0.4) = 0.599
h₂: −0.4×1 + 0.6×0 + 0.1×1 − 0.1 = −0.4 → σ(−0.4) = 0.401

第二步:向下,重构可见层(用期望重构,书中的算法在此处是按分布抽样; 期望版便于看清数字):

p(v₁=1|h 概率) = σ(0.5×0.599 + 0.3×0.401 + 0) = σ(0.420) = 0.603
p(v₂=1|h 概率) = σ(0.3×0.599 + 0.6×0.401 + 0) = σ(0.420) = 0.603
p(v₃=1|h 概率) = σ(−0.2×0.599 + 0.1×0.401 + 0) = σ(−0.080) = 0.480

第三步:再向上一次,得到「模型侧」的隐概率,然后按 ΔW = α(⟨vh⟩data − ⟨vh⟩model) 更新18。以 w₁₁ 为例:

数据侧 ⟨v₁h₁⟩data = v₁ × p(h₁=1|v) = 1 × 0.599 = 0.599
模型侧:重构后隐概率 h₁' = σ(0.5×0.603+0.3×0.603−0.2×0.480+0.1)
= σ(0.474) = 0.616
⟨v₁h₁⟩model = 0.603 × 0.616 = 0.371
Δw₁₁ = 0.1 × (0.599 − 0.371) = +0.021

读数:正号意味着 w₁₁ 增大——数据里「可见 1 与隐 1 一起亮」的频率, 比模型自己想象的高,连接就该加强。每个权重都按同式各走一步, 这就是 CD-1 的一次完整更新。

8. 只走 k 步就更新:对比散度

模型侧的期望本该等到热平衡,对比散度(CD)的赌注是:从训练样本出发, 吉布斯走 k 步就停下、就地统计。书把话说得非常诚实:「对比散度给出的 并不是精确的对数似然梯度,而是一种计算高效、在实践中通常足够有效的 带偏近似」——偏差来自链从数据分布(而非模型分布)出发、k 步内没到 平衡;k 越大偏差越小,代价越高19

持续对比散度(PCD)的改进:让采样链在多次参数更新之间不重启, 模型分布的样本越滚越准,偏差进一步减小20。书给的实践参考: 早期经验里 k=1 已可得到可用的表示21

9. 摞起来:深度信念网络

深度信念网络(DBN)的图结构有个关键细节:它不是纯有向图—— 最顶部两层是无向的(一个 RBM),其余层之间的连接是有向的, 是一个混合结构22。顶层 RBM 负责给最高隐层提供先验, 下面每层是 Sigmoid 条件概率(「每一层都可以看作一个 Sigmoid 信念网络」)。 与名字相近的深度玻尔兹曼机(DBM)的分工:DBM 相邻层全用无向连接, 后验依赖更强、推断更难;DBN 更强调逐层预训练23

逐层预训练:把 DBN 看成 RBM 的叠罗汉——第 l 层 RBM 的隐层, 当作第 l+1 层 RBM 的可见层;自下而上每次只训练一层, 用上层表示当下一层的训练集24。训练完还有生成与微调两用: 生成=顶层 RBM 采样后自顶向下逐层还原;微调=Wake-Sleep 交替 (Wake 阶段改生成权重「如果现实跟我想象的不一样,改变我的生成权重」; Sleep 阶段改认知权重「如果梦中的景象不是我脑中的概念,改变我的 认知权重」),或当预训练模型接一层输出做反向传播25

10. 它在历史上的位置

书用了整节的篇幅给这族模型「盖棺定论」,三句话值得整段带走26:

  • 「基于 DBN 的预训练不再是训练深层网络的常用方案」——更好的激活 函数、初始化、规范化、残差连接让端到端训练变容易(第 17-19 章全家桶);
  • 但「先在大量无标注数据上预训练、再在下游任务上微调」这一核心范式 并未消失——它在自监督预训练语言模型里以新的目标函数和架构延续 (第 27、31 章);
  • DBN 的历史意义两点:证明了「深层表示」可以分层逐步学出来; 把无监督预训练与监督微调结合,成为深度学习走向复兴的关键过渡。

第 25 章堆叠自编码器那笔「思想活了下来」的账,在这里看到了同一个结论 的另一份证词。

11. 作者的判断与证据

书里给了定理与推导的: 全条件概率=Logistic(定理 15.1)8; 梯度=数据期望−模型期望(式 15.24-15.26)10;RBM 条件概率与 并行采样(定理 15.2)17;CD 的带偏性来源19

书里给了坦白的: 全连接 BM 学习低效11;CD 是有偏近似19; 逐层预训练已非主流26

书里给了结构判断的: 「从玻尔兹曼机到受限玻尔兹曼机,不只是结构上的 简化,更体现了在复杂建模能力和可学习性之间作出平衡」;表 15.1 的 BM/RBM/DBN 三行对照27

12. 边界与局限

二值假设是硬边界:标准 RBM 的变量只能取 {0,1};连续数据要换 能量函数(高斯-伯努利),而书没有展开连续能量下采样的额外困难。

配分函数仍然算不出:RBM 简化的是采样,不是 Z;似然本身依旧不可 精确评估——训练时看的是近似的梯度,模型好坏没有精确的似然读数, 书未讨论替代评估。

「逐层预训练为什么当时有效」只有历史叙述:深层网络当年训不动的 具体病理(和第 17-19 章手段的对应关系)要读者自己连线。

13. 可带走的

  1. 能量模型:概率 = exp(−能量)/Z;正权重=假设互相支持;
  2. 状态概率比只看能量差——配分函数在比值里约掉了;
  3. 温度:高温抛硬币、低温确定性;与解码温度同形状、不同用途;
  4. 全条件概率=σ(能量差/T)——每个变量就是一个随机神经元;
  5. 学习梯度 = 数据期望 − 模型期望;慢在模型期望要重新逼近平衡;
  6. RBM 砍同层连接 → 整层条件独立、可并行采样;
  7. CD-k:从数据出发只走 k 步;有偏但实用;PCD 不重启链以减偏差;
  8. CD-1 一次更新:向上算隐概率→重构→再向上→按两端乘积的差更新权重;
  9. DBN=顶层 RBM(无向)+下面有向 sigmoid 层;逐层预训练自下而上;
  10. 逐层预训练死了,「无标注预训练+微调」的范式活成了自监督

14. 原文地图

主题原书章原文位置
章定位与历史意义第15章 深度信念网络text/16-ch15.txt:12(搜「已经不再是训练深层网络」) · text/16-ch15.txt:14(搜「逐层预训练思想」)
BM 三性质第15章 深度信念网络text/16-ch15.txt:38(搜「每个随机变量是二值的」)
玻尔兹曼分布与能量第15章 深度信念网络text/16-ch15.txt:52(搜「玻尔兹曼分布」) · text/16-ch15.txt:59(搜「能量函数」)
权重=假设约束第15章 深度信念网络text/16-ch15.txt:69(搜「正的权重」) · text/16-ch15.txt:76(搜「互相支持」)
概率比=能量差第15章 深度信念网络text/15-ch14.txt:362(搜「能量」) —— 见 text/16-ch15.txt:108(搜「𝐸𝛽 − 𝐸𝛼」)
温度两极第15章 深度信念网络text/16-ch15.txt:171(搜「热平衡」) · text/16-ch15.txt:173(搜「随机抛硬」) · text/16-ch15.txt:184(搜「确定性方法」)
Hopfield 对比第15章 深度信念网络text/16-ch15.txt:185(搜「Hopfield 网络」)
模拟退火第15章 深度信念网络text/16-ch15.txt:241(搜「模拟退火」)
全条件概率定理第15章 深度信念网络text/16-ch15.txt:121(搜「定理 15.1」) · text/16-ch15.txt:125(搜「(15.5)」)
梯度=两期望之差第15章 深度信念网络text/16-ch15.txt:317(搜「(15.24)」) · text/16-ch15.txt:323(搜「很难精确计算」)
局部信息与赫布规则第15章 深度信念网络text/16-ch15.txt:340(搜「局部信息」) · text/16-ch15.txt:342(搜「赫布规则」)
RBM 结构与条件独立第15章 深度信念网络text/16-ch15.txt:357(搜「受限玻尔兹曼机(Restricted」) · text/16-ch15.txt:364(搜「条件独」)
能量函数与直观第15章 深度信念网络text/16-ch15.txt:386(搜「(15.27)」) · text/16-ch15.txt:398(搜「潜在特征层」)
定理 15.2 与并行采样第15章 深度信念网络text/16-ch15.txt:421(搜「定理 15.2」) · text/16-ch15.txt:424(搜「(15.33)」) · text/16-ch15.txt:500(搜「并行」)
CD 与带偏近似第15章 深度信念网络text/16-ch15.txt:572(搜「对比散度」) · text/16-ch15.txt:576(搜「带偏近似」) · text/16-ch15.txt:579(搜「持续对比散度(Persistent Contrastive Divergence」) · text/16-ch15.txt:583(搜「CD-」)
变体第15章 深度信念网络text/16-ch15.txt:592(搜「伯努利-伯努利」) · text/16-ch15.txt:594(搜「高斯-伯努利」)
DBN 混合结构第15章 深度信念网络text/16-ch15.txt:646(搜「深度信念网络(Deep Belief」) · text/16-ch15.txt:652(搜「纯有向图模型」) · text/16-ch15.txt:656(搜「深度玻尔兹曼机」)
逐层预训练第15章 深度信念网络text/16-ch15.txt:14(搜「逐层」) · text/16-ch15.txt:740(搜「逐层训练」) · text/16-ch15.txt:744(搜「逐层预训练和微调」)
Wake-Sleep第15章 深度信念网络text/16-ch15.txt:816(搜「Wake」) · text/16-ch15.txt:821(搜「改变我的生成权重」) · text/16-ch15.txt:821(搜「改变我的」)
历史定位第15章 深度信念网络text/16-ch15.txt:12(搜「不再是训练深层网络」) · text/16-ch15.txt:871(搜「并未消失」) · text/16-ch15.txt:872(搜「历史意义」)
三模型对照表第15章 深度信念网络text/16-ch15.txt:921(搜「BM、RBM 和 DBN 的对比」) · text/16-ch15.txt:167(搜「平衡」)

Footnotes

  1. 出处:「第15章 深度信念网络」第 31 至 41 段(text/16-ch15.txt:38,搜「每个随机变量是二值的」)。

  2. 出处:「第15章 深度信念网络」第 69 至 78 段(text/16-ch15.txt:69,搜「正的权重」; text/16-ch15.txt:73,搜「弱约束」)[Ackley et al., 1985]。

  3. 出处:「第15章 深度信念网络」第 104 至 110 段(text/16-ch15.txt:108,搜「𝐸𝛽 − 𝐸𝛼」),式(15.4)。

  4. 出处:「第15章 深度信念网络」第 171 至 184 段(text/16-ch15.txt:173,搜「随机抛硬」; text/16-ch15.txt:184,搜「确定性方法」),式(15.15)。

  5. 出处:「第15章 深度信念网络」第 58 至 59 段(text/16-ch15.txt:58,搜「温度」)。 采样温度见本书第 31 章第 3 节;对比学习的温度参数见第 27 章第 6 节。

  6. 出处:「第15章 深度信念网络」第 185 至 188 段(text/16-ch15.txt:185,搜「Hopfield 网络」)。

  7. 出处:「第15章 深度信念网络」第 238 至 248 段(text/16-ch15.txt:241,搜「模拟退火」; text/16-ch15.txt:248,搜「依概率收敛」)[Kirkpatrick et al., 1983]。

  8. 出处:「第15章 深度信念网络」第 121 至 160 段(text/16-ch15.txt:121,搜「定理 15.1」; text/16-ch15.txt:125,搜「(15.5)」;text/16-ch15.txt:133,搜「能量差异(Energy Gap」), 式(15.5)-(15.14)。 2

  9. 出处:「第15章 深度信念网络」第 21 至 26 段(text/16-ch15.txt:24,搜「随机神经」)。

  10. 出处:「第15章 深度信念网络」第 276 至 326 段(text/16-ch15.txt:317,搜「(15.24)」; text/16-ch15.txt:323,搜「很难精确计算」;text/16-ch15.txt:3,搜「数据」亦可按 「𝑥𝑖𝑥𝑗 的近似期望」定位),式(15.16)-(15.26)。 2

  11. 出处:「第15章 深度信念网络」第 352 至 355 段(text/16-ch15.txt:354,搜「重新接近平衡分布」)。 2

  12. 出处:「第15章 深度信念网络」第 340 至 343 段(text/16-ch15.txt:340,搜「局部信息」; text/16-ch15.txt:342,搜「赫布规则」)。

  13. 出处:「第15章 深度信念网络」第 356 至 365 段(text/16-ch15.txt:357,搜「受限玻尔兹曼机(Restricted」; text/16-ch15.txt:364,搜「条件独」;text/16-ch15.txt:358,搜「簧风琴」)。

  14. 出处:「第15章 深度信念网络」第 499 至 510 段(text/16-ch15.txt:500,搜「并行」; text/16-ch15.txt:505,搜「按位采样」)。

  15. 出处:「第15章 深度信念网络」第 398 至 402 段(text/16-ch15.txt:398,搜「潜在特征层」; text/16-ch15.txt:401,搜「重构」)。

  16. 出处:「第15章 深度信念网络」第 587 至 603 段(text/16-ch15.txt:592,搜「伯努利-伯努利」; text/16-ch15.txt:594,搜「高斯-伯努利」;text/16-ch15.txt:605,搜「伯努利-高斯」), 式(15.57)-(15.58)。

  17. 出处:「第15章 深度信念网络」第 421 至 497 段(text/16-ch15.txt:421,搜「定理 15.2」; text/16-ch15.txt:424,搜「(15.33)」),式(15.33)-(15.49)。 2

  18. 出处:「第15章 深度信念网络」第 556 至 564 段(text/16-ch15.txt:558,搜「(15.54)」), 式(15.54)-(15.56);算法 15.1 见第 608 至 633 段(text/16-ch15.txt:608,搜「单步对比散度」)。

  19. 出处:「第15章 深度信念网络」第 572 至 580 段(text/16-ch15.txt:576,搜「带偏近似」; text/16-ch15.txt:578,搜「尚未收敛」;text/16-ch15.txt:578,搜「偏差越小」)[Hinton, 2002]。 2 3

  20. 出处:「第15章 深度信念网络」第 579 至 580 段(text/16-ch15.txt:579,搜「持续对比散度(Persistent Contrastive Divergence」; text/16-ch15.txt:580,搜「不重启」)。

  21. 出处:「第15章 深度信念网络」第 581 至 584 段(text/16-ch15.txt:583,搜「𝑘 = 1」)。

  22. 出处:「第15章 深度信念网络」第 645 至 655 段(text/16-ch15.txt:650,搜「最底层为可观测变量」; text/16-ch15.txt:652,搜「纯有向图模型」)。

  23. 出处:「第15章 深度信念网络」第 656 至 678 段(text/16-ch15.txt:656,搜「深度玻尔兹曼机」; text/16-ch15.txt:677,搜「变分推断或 MCMC」;text/16-ch15.txt:678,搜「逐层 RBM 预训练」)。

  24. 出处:「第15章 深度信念网络」第 735 至 747 段(text/16-ch15.txt:739,搜「自下而上堆叠」; text/16-ch15.txt:740,搜「逐层训练」;text/16-ch15.txt:746,搜「先学好每一层的表示」), 算法 15.2。

  25. 出处:「第15章 深度信念网络」第 714 至 722 段(text/16-ch15.txt:721,搜「自顶向下」); Wake-Sleep 见第 816 至 830 段(text/16-ch15.txt:821,搜「改变我的生成权重」; text/16-ch15.txt:821,搜「改变我的」);判别式微调见第 833 至 858 段 (text/16-ch15.txt:835,搜「预训练模型」)。

  26. 出处:「第15章 深度信念网络」第 861 至 873 段(text/16-ch15.txt:12,搜「不再是训练深层网络」; text/16-ch15.txt:871,搜「并未消失」;text/16-ch15.txt:873,搜「思想渊源」); 历史意义两点见第 898 至 908 段(text/16-ch15.txt:904,搜「关键过渡环节」)。 2

  27. 出处:「第15章 深度信念网络」第 889 至 897 段(text/16-ch15.txt:167,搜「平衡」); 表 15.1 见第 921 至 930 段(text/16-ch15.txt:921,搜「BM、RBM 和 DBN 的对比」)。