跳到主要内容

这一章讲的是全书所有「差多远」的共同出处。 为什么训练时算的是那个特定的式子、而不是别的随便什么式子,答案全在这里。

说不准的事怎么算

1. 这一章讲什么

三件事: 一件说不准的事怎么用数记下来;看到新证据之后怎么改主意; 以及两份「说不准」之间差多远怎么用一个数量出来。

它在全书链条里的位置: 这是把「学习」变成「一道能求解的题」的那一层。 第 05 章说的「差多远」为什么长成那个样子、第 06 章那条拟合直线为什么用平方来算差距、 第 08 章为什么能给答案配一个可信度——全在这一章的推导链上。

只需要第 01、02 章。 全章从掷骰子和判断一封邮件是不是垃圾邮件出发。

2. 顶层全景

一件说不准的事 ──▶ 随机变量:把可能的结果编上号

├─ 每种结果多大可能 ──▶ 概率分布
│ │
│ ├─ 拿一个数概括它 ──▶ 期望(平均落在哪)、方差(散得多开)
│ └─ 多个量一起看 ──▶ 联合 / 边际 / 条件

├─ 看到证据后改主意 ──▶ 贝叶斯:先验 × 似然 ∝ 后验

└─ 两份清单差多远 ──▶ 熵 → 交叉熵 → KL 散度

这就是训练时那个「差多远」

一句话链条: 说不准的事编成号 → 每种结果配一个可能性 → 用几个数概括这份清单 → 新证据来了就更新 → 「模型给的清单」和「真实的清单」之间的差,就是要最小化的东西。

3. 把「说不准」编成号

先看现象: 掷一个骰子,结果可能是 1 到 6。你事先不知道是哪个,但你知道每个的可能性。

把这种「结果随试验而变的量」写成一个符号,就是随机变量1。 掷骰子的点数是一个随机变量,明天的气温是一个随机变量, 一封邮件是不是垃圾邮件也是一个随机变量——它只取两个值。

结果能一个一个数出来的,叫离散随机变量2;取值填满一段实数、数不过来的, 叫连续随机变量3。这两种的记账方式不一样,后面每个公式都要先分清是哪一种。

列出每种结果各自的可能性,这张清单叫概率分布4

本书里常把这份清单简称分布——后面凡是说「某某分布」,指的都是这样一张清单。 清单上每一项都不小于 0,全部加起来正好等于 1。这两条约束是后面所有推导的地基。

为什么连续的要另起炉灶? 因为一个连续量取到某个具体值(比如身高恰好 1.750000…米) 的可能性是 05。所以连续情形不记「取到某个值的可能性」, 而记概率密度函数:它在一段区间上的面积,才是落在这段区间里的可能性6

3.1 三种要认得的分布

伯努利分布:只有两个结果的那种,一件事发生的可能性是 μ,不发生就是 1 − μ7。 抛硬币、判断邮件是不是垃圾、判断一张图是不是猫——全书所有二分类(只判两类: 是或不是)任务的输出都是它。

二项分布:同一件事独立做 N 次,数一数发生了几次8。抛 10 次硬币出现 3 次正面的可能性, 就是这个分布上的一项。

正态分布(又叫高斯分布)9:那条中间高、两边对称往下掉的钟形曲线。 它由两个数完全决定:中心在哪、胖瘦多少。书里第 18 章初始化参数、 第 38 章生成图像,起点都是它。

多个量一起看时,正态分布升级成多元正态分布,它由一个中心向量和一张方形的数表决定10。 那张表说的是「各个方向之间怎么一起变」——它正是第 01 章说的实对称矩阵。

4. 拿两个数概括一整份清单

问题: 一份清单上有几百项,能不能用一两个数说个大概?

能,而且只要两个。

期望就是「按可能性加权的平均值」11:每个结果乘上它的可能性,全部加起来。 掷一个公平骰子,期望是 (1+2+3+4+5+6) ÷ 6 = 3.5——注意它自己根本不是一个可能的结果。

方差说的是这份清单散得有多开12:每个结果和期望的差,平方之后再按可能性加权平均。 方差小说明结果都挤在期望附近,方差大说明四处乱飞。

一个必须先说清的一词多用(这是我们的裁决): 「方差」这个词在这本书里会指三个不同对象的散布程度:一份清单的、一批数据的、 以及第 07 章那个「换一批训练数据模型会变多少」。它们是同一个量法用在不同东西上。 本书凡是用到这个词,都会在同一句里点明「谁的方差」,不省略。

上面那张方表里装的就是协方差:衡量两个量是不是一起变的那个数13。 它为 0 只说明两者没有线性关系, 不代表它们独立——书里特意提醒了这一点:它们之间可能存在某种非线性关系14

4.1 一条撑起整个训练流程的定律

大数定律说:独立同分布地采一大批样本,它们的平均值会趋近于真正的期望15

这条定律是「用一批数据代替真实世界」这件事的全部依据。 训练时算的损失是在几千条样本上的平均,而我们真正想要的是在全世界所有数据上的期望。 两者之间的桥就是这条定律。

两者之间的差距有一个名字叫误差——模型给的答案和该给的答案之间差了多少。 第 07 章那个「泛化误差」就从这里出发。

5. 多个量一起看:三种关系

先看现象: 一封邮件有两个可以观察的量:里面有没有「中奖」两个字、它是不是垃圾邮件。

联合 p(有「中奖」, 是垃圾) ── 两件事同时发生的可能性
边际 p(是垃圾) ── 把另一个量的所有可能加起来,只留下自己
条件 p(是垃圾 | 有「中奖」) ── 已知一个量的取值后,另一个量的可能性

边际分布就是「把不关心的那个量加掉」16条件分布是「已知一件事之后,另一件事的可能性清单」17——竖线读作「在……的条件下」。

三者之间只有一条关系式:联合 = 条件 × 边际。 把它反复用下去,就能把一长串量同时发生的可能性拆成一串条件相乘。

一个必须先说清的重名(这是我们的裁决): 上面这条拆法在很多资料里叫「概率的链式法则」。 本书里「链式法则」这个名字只留给第 02 章那条微积分的规则; 概率这一条我们一律叫「概率的乘法拆解」。 第 31 章那句「语言模型就是逐字预测下一个字」,数学上就是这条拆解。

5.1 独立:两件事互不相干

如果知道一个量的取值对另一个量的可能性毫无影响,就说这两个量独立18。 独立时,联合概率等于两个边际概率直接相乘。

还有一种更弱、但在实际中更有用的版本:条件独立19。 两个量本身相关,但一旦第三个量确定下来,它们就互不相干了

举个具体的: 冰淇淋销量和溺水人数正相关。可一旦把「气温」固定住,两者就没关系了—— 它们在给定气温时条件独立。第 34 章的概率图模型整章都在处理这件事。

6. 看到证据之后怎么改主意

先看现象: 100 封邮件里有 20 封垃圾邮件。现在收到一封含「中奖」两字的邮件, 它是垃圾邮件的可能性有多大?

把两个条件概率联系起来的那条式子叫贝叶斯定理20:

p(是垃圾 | 有「中奖」) = p(有「中奖」| 是垃圾) × p(是垃圾) ÷ p(有「中奖」)

三个名字要记住,它们贯穿全书:

先验是看到证据之前你的判断——上面那个 p(是垃圾) = 0.2。 似然就是「如果它真是垃圾,会出现这个证据的可能性」。 后验是看完证据之后更新过的判断。

这三个词在第 29 章、第 38 章会反复出现,含义完全一致。

7. 哪套参数最能解释我看到的数据

问题: 手上有一批数据,模型有一堆旋钮。怎么定这些旋钮?

有一个非常自然的答案:挑那套让「出现这批数据」这件事显得最不意外的旋钮。

「在这套旋钮下,出现这批数据的可能性」这个量叫似然函数21。 让它最大的那套旋钮,就是最大似然估计22

实际算的时候先取一次对数——一种把连乘变成连加的换算,记作 log。 对似然取完对数,就得到对数似然23

为什么要这么绕?因为一长串小数连乘会小到算不出来,取完对数就变成一串数相加。 这是全书那些式子里到处都是 log 的原因。

这里有一个决定性的转换:

让「出现这批数据」的可能性最大
↕ 取对数、加负号
让「负对数似然」最小

这就是第 05 章那个要被最小化的「差多远」

「最大化可能性」和「最小化损失」是同一件事的两个说法。

7.1 给旋钮加一点先验偏好

最大似然完全听数据的。数据少的时候,它会跟着噪声(数据里那些没有规律、纯属偶然的成分)跑。

办法是给旋钮本身也配一个先验分布,然后最大化后验——这叫最大后验估计24。 书里点明了它的后果:第 19 章那个「给参数上税」的做法,本质就是给参数加了一个先验25

8. 两份清单差多远

训练时被最小化的那个「差多远」,正式名字叫损失函数这一节是整本书所有损失函数的正源,前面所有铺垫都是为了下面这四个量。

8.1 一件事有多让人意外

一个事件发生的可能性越低,它发生时带来的信息就越多。 必然发生的事,信息量为 0。这个量叫自信息26

对数的底取 2 时单位是比特,取自然常数时单位是奈特27

8.2 一整份清单平均有多让人意外

把自信息按可能性加权平均,得到的量叫28——它衡量一份清单整体有多不确定。

抛一枚公平硬币 两种结果各 0.5 熵 = 1 比特(最不确定)
抛一枚必出正面 一种结果为 1 熵 = 0 比特(毫无悬念)

熵还有一个更硬的解释:它是给这份清单编码所需的最短平均码长的下界29。 后面「多少个比特」这类说法,底都在这里。

一个必须先说清的重名(这是我们的裁决): 「熵」这个词后面还会以别的身份出现。

第 31 章让模型一个字一个字往外蹦时,每一步都要从一份可能性清单里随机抽一个, 这个抽的动作叫采样

抽的时候有一个旋钮,拧大了结果更花哨、拧小了更保守,很多资料把它叫温度。 它和这里的熵有关,但不是同一个量:本书一律叫它「采样温度」; 第 36 章能量模型里那个同名的旋钮,一律叫「温度(能量模型里的)」。

8.3 用错了清单要多付多少

这才是训练时真正在算的东西。

真实情况服从一份清单 p,而你按照另一份清单 q 去编码。 这时的平均码长叫交叉熵30

q 越接近 p ──▶ 交叉熵越小
q 就是 p ──▶ 交叉熵取到最小值,正好等于 p 的熵

多分类时,真实标签是一个 one-hot 向量, 于是交叉熵坍缩成非常简单的一项: 对真实那一类的预测可能性取负对数31。别的类的预测值一个都不进这个式子。

而这个式子,正好就是负对数似然32。所以:

交叉熵损失 = 负对数似然 = 最大似然的等价写法

训练一个分类器(判断输入属于哪一类的模型)时,这三件事是同一件事。 书里在信息论附录的开头就点明了这一点。

8.4 差的那一部分:KL 散度

交叉熵减去 p 自己的熵,剩下的就是「用 q 而不是 p 的额外代价」,叫 KL 散度33

它有两条性质要记住:永远不小于 0,而且只有 p 和 q 完全一样时才等于 034。 但它不对称:p 到 q 的值和 q 到 p 的值通常不一样,所以它不是一个真正的距离35

这个不对称有实际后果,书里的边注说得很清楚:

前向 KL(拿真实分布当基准) ──▶ q 被迫覆盖 p 的所有区域,倾向于摊得很宽
反向 KL(拿近似分布当基准) ──▶ q 倾向于缩到 p 的某一个峰上,不管别的峰

第 37 章讲那两类生成模型时,选哪个方向直接决定生成出来的东西长什么样。

把两个方向平均一下,得到一个对称的版本,叫 JS 散度36。 但书里同时指出它的软肋:两个分布没有重叠时,KL 和 JS 都失效37—— 这正是第 37 章生成对抗网络训练不稳定的病根,也是 Wasserstein 距离被提出来的原因38

9. 一件说不准的事随时间变化

随机过程就是「一串随时间变化的随机变量」39。股价、语音、身高变化都是。

其中最重要的一条性质叫马尔可夫性质:下一步只依赖当前状态,和更早的历史无关40

这条性质是第 29、30 两章强化学习的全部前提。 那里的「状态」之所以能只用当前一个, 靠的就是这个假设——而它是不是真的成立,是那几章反复要处理的问题。

10. 主走查:一个二分类器从数据算到损失

场景: 判断邮件是不是垃圾邮件。下面的数字是我们为演示编的,不是书里的例子。

已知: 100 封邮件里 20 封是垃圾邮件。垃圾邮件里 16 封含「中奖」,正常邮件里 8 封含「中奖」。

第一步:把这四个数摆成一份联合清单。

是垃圾不是垃圾行合计
含「中奖」16824
不含47276
列合计2080100

第二步:从联合清单读出三种关系。

要算什么怎么算结果
联合 p(含「中奖」, 是垃圾)16 ÷ 1000.16
边际 p(是垃圾)(16+4) ÷ 1000.20 ← 这是先验
边际 p(含「中奖」)(16+8) ÷ 1000.24
条件 p(含「中奖」| 是垃圾)16 ÷ 200.80 ← 这是似然
条件 p(是垃圾 | 含「中奖」)16 ÷ 240.667 ← 这是后验

第三步:用贝叶斯定理独立验一遍那个后验。

0.80 × 0.20 ÷ 0.24 = 0.16 ÷ 0.24 = 0.667 ✓ 和直接数出来的一致

先验 0.20 → 看到「中奖」两字 → 后验 0.667。证据把判断从两成推到了六成半。

第四步:检验独立性。 如果两件事独立,联合应该等于两个边际相乘: 0.20 × 0.24 = 0.048,而实际是 0.16。差了三倍多——它们显然不独立。

第五步:算这两份清单各自的熵(取以 2 为底)。

清单各项
是不是垃圾0.20 / 0.80−0.2·log₂0.2 − 0.8·log₂0.8 = 0.722 比特
已知含「中奖」后0.667 / 0.333−0.667·log₂0.667 − 0.333·log₂0.333 = 0.918 比特

这里有一个反直觉的结果,值得停一下: 看到证据之后,熵变大了。 因为原来 0.2/0.8 已经很有倾向性,而 0.667/0.333 反而更接近对半开。 「证据让判断改变」和「证据让不确定性下降」是两回事—— 真正保证下降的是按所有证据取值加权的平均,也就是条件熵。

第六步:算一封邮件的交叉熵损失。 假设模型对某封真实是垃圾的邮件,给出「是垃圾」的可能性:

模型给真实类别的可能性损失 = −log₂(那个值)
模型甲0.6670.585 比特
模型乙0.900.152 比特
模型丙0.103.322 比特

注意最后一行:模型丙不只是错,它是自信地错,代价是模型乙的二十多倍。 交叉熵损失的这个性质——罚「自信的错」远重于罚「犹豫的错」—— 会在第 08 章讨论模型该不该自信时再次出现。

第七步:算 KL 散度。 真实清单 p = (1, 0)(它确实是垃圾),模型乙给的 q = (0.9, 0.1)。

p 的熵 = 0 比特(毫无悬念)
交叉熵 = −1 × log₂0.9 = 0.152 比特
KL(p‖q) = 0.152 − 0 = 0.152 比特

真实标签是 one-hot 时,p 的熵恒为 0,所以交叉熵和 KL 散度完全相等。 这就是为什么实际工程里这两个词经常被混着用——在这个特定场景下它们真的一样。 但只要真实标签不是 one-hot(比如第 28 章那种「拿大模型教小模型」的做法),两者就分家了。

11. 作者的判断与证据

书里给了证明或直接推导的:

  • 交叉熵损失等价于负对数似然32 —— 书里在信息论附录开篇和第 2 章正文各说了一遍, 两处口径一致;
  • KL 散度非负、当且仅当两分布相同时为零34 —— 给了结论,证明留给读者;
  • Softmax 配交叉熵的梯度等于「预测减真实」31 —— 附录 B 给了完整推导。

书里明确说是选择而非定理的:

  • KL 散度的方向 —— 边注专门解释了前向与反向的不同后果,并用了「覆盖」与「集中」两个词 来概括35这是建模选择,不是数学规定。

书里坦白的:

  • 「协方差为 0 不代表独立」14 —— 书里主动点出了这个常见误解,还说明了可能存在 非线性关系;
  • 「KL 散度并非严格的度量」35 —— 既不对称,也不满足三角不等式;
  • 「两个分布没有重叠时 KL 和 JS 都难以有效衡量距离」37 —— 这句话直接承认了 一整类生成模型的训练困难有数学上的根源。

我们要补一句书里没说的: 大数定律保证的是「样本数目趋于无穷时」。 实际训练用的每一批数据都是有限的,所以第 07 章那个「训练集上好不代表真实世界好」 不是工程问题,是这条定律在有限样本下的必然。

12. 边界与局限

不讲测度论。 概率空间、可测函数这些严格基础一律不碰,附录直接从「样本点的函数」开始。

不讲统计推断的完整体系。 假设检验、置信区间、估计量的相合性与有效性都没有。 书里只取了做机器学习最低限度要用的那几件。

采样方法只在正文里零星出现。 附录里没有专门讲蒙特卡罗方法怎么做, 拒绝采样、重要性采样、马尔可夫链蒙特卡罗散落在第 23 章和第 38 章,用到时才讲。

高斯过程只有一页半。 给了定义和「输入接近则输出接近」的直觉,不给推断算法。

信息论只取了做损失函数要用的部分。 信道容量、编码定理这些信息论的主干内容一概不讲。

13. 可带走的

  1. 随机变量就是「结果说不准的那个量」,概率分布就是「每种结果各自多大可能」的清单;
  2. 离散和连续要分开记账。 连续量取到某个具体值的可能性是 0,所以记的是密度,面积才是可能性;
  3. 期望是按可能性加权的平均,方差是散得多开。 期望本身可以不是任何一个可能的结果;
  4. 联合 = 条件 × 边际。 反复用这一条,就能把一长串量拆成一串条件相乘——这就是语言模型的数学形状;
  5. 协方差为 0 只说明没有线性关系,不等于独立; 但独立一定推出协方差为 0;
  6. 贝叶斯定理就三个词:先验(看证据前的判断)、似然(证据有多符合)、后验(更新后的判断);
  7. 最大似然 = 最小化负对数似然 = 最小化交叉熵。 这三个说法在训练分类器时完全等价;
  8. 熵是「平均有多让人意外」,交叉熵是「用错清单要多付多少」,KL 散度是两者之差;
  9. KL 散度不对称,方向不同后果不同: 一个方向逼着模型覆盖全部,另一个方向允许它只抓一个峰;
  10. 真实标签是 one-hot 时,交叉熵和 KL 散度数值相等;标签是软的(比如拿大模型教小模型时)两者就不一样了。

14. 原文地图

主题原书章原文位置
随机变量附录 D 概率论text/18-apx.txt:1194(搜「样本点的一个函数」)
离散与连续附录 D 概率论text/18-apx.txt:1213(搜「称 𝑋 为离散随机变量」) · text/18-apx.txt:1273(搜「不可数及无穷尽」)
概率分布与密度附录 D 概率论text/18-apx.txt:1218(搜「概率分布」) · text/18-apx.txt:1276(搜「概率密度函数」)
伯努利与二项分布附录 D 概率论text/18-apx.txt:1232(搜「又名两点分布」) · text/18-apx.txt:1235(搜「二项分布」)
正态分布附录 D 概率论text/18-apx.txt:1296(搜「又名高斯分布」) · text/18-apx.txt:1377(搜「多元正态分布」)
边际与条件分布附录 D 概率论text/18-apx.txt:1426(搜「边际分布」) · text/18-apx.txt:1444(搜「条件分布」)
贝叶斯定理附录 D 概率论text/18-apx.txt:1461(搜「贝叶斯定理」)
独立与条件独立附录 D 概率论text/18-apx.txt:1468(搜「互相独立」) · text/18-apx.txt:1475(搜「条件独立」)
期望、方差、协方差附录 D 概率论text/18-apx.txt:1486(搜「其期望定义为」) · text/18-apx.txt:1491(搜「概率分布的离散程度」) · text/18-apx.txt:1495(搜「协方差」)
大数定律附录 D 概率论text/18-apx.txt:1535(搜「大数定律」)
随机过程与马尔可夫性质附录 D 概率论text/18-apx.txt:1544(搜「一组随机变量」) · text/18-apx.txt:1555(搜「马尔可夫性质」)
似然与最大似然估计第2章 机器学习概述text/03-ch02.txt:771(搜「上的似然函数」) · text/03-ch02.txt:793(搜「最大似然估计」)
最大后验估计第2章 机器学习概述text/03-ch02.txt:808(搜「先验分布」) · text/03-ch02.txt:317(搜「正则化是引入了参数的先验分布」)
自信息与熵附录 E 信息论text/18-apx.txt:1702(搜「自信息」) · text/18-apx.txt:1711(搜「其自信息的数学期望」)
交叉熵附录 E 信息论text/18-apx.txt:1799(搜「所对应的平均码长」) · text/18-apx.txt:1808(搜「进一步等」)
KL 与 JS 散度附录 E 信息论text/18-apx.txt:1815(搜「相对熵」) · text/18-apx.txt:1837(搜「一种对称的散度」) · text/18-apx.txt:1843(搜「没有重叠或重叠极」)
Wasserstein 距离附录 E 信息论text/18-apx.txt:1852(搜「Wasserstein 距离」)

Footnotes

  1. 出处:「附录 数学基础」第 1194 段(text/18-apx.txt:1194,搜「样本点的一个函数」)。

  2. 出处:「附录 数学基础」第 1213 段(text/18-apx.txt:1213,搜「称 𝑋 为离散随机变量」)。

  3. 出处:「附录 数学基础」第 1273 段(text/18-apx.txt:1273,搜「不可数及无穷尽」)。

  4. 出处:「附录 数学基础」第 1218 段(text/18-apx.txt:1218,搜「概率分布」)。

  5. 出处:「附录 数学基础」第 1274 段(text/18-apx.txt:1274,搜「取任一具体值」)。 原文:「连续随机变量 𝑋 取任一具体值 𝑥𝑖 的概率为 0,这与离散情形截然不同。」

  6. 出处:「附录 数学基础」第 1276 段(text/18-apx.txt:1276,搜「概率密度函数」)。

  7. 出处:「附录 数学基础」第 1232 段(text/18-apx.txt:1232,搜「又名两点分布」)。

  8. 出处:「附录 数学基础」第 1235 段(text/18-apx.txt:1235,搜「二项分布」)。

  9. 出处:「附录 数学基础」第 1296 段(text/18-apx.txt:1296,搜「又名高斯分布」)。

  10. 出处:「附录 数学基础」第 1377 段(text/18-apx.txt:1377,搜「多元正态分布」)。 原书还给了一个特例:协方差矩阵简化为一个数乘单位矩阵时,叫各向同性高斯分布, 此时各维彼此独立且方差相同。

  11. 出处:「附录 数学基础」第 1486 段(text/18-apx.txt:1486,搜「其期望定义为」)。

  12. 出处:「附录 数学基础」第 1491 段(text/18-apx.txt:1491,搜「概率分布的离散程度」)。

  13. 出处:「附录 数学基础」第 1495 段(text/18-apx.txt:1495,搜「协方差」)。

  14. 出处:「附录 数学基础」第 1504 段(text/18-apx.txt:1504,搜「可能存在某种非线性的函数关系」)。 2

  15. 出处:「附录 数学基础」第 1535 段(text/18-apx.txt:1535,搜「大数定律」)。

  16. 出处:「附录 数学基础」第 1426 段(text/18-apx.txt:1426,搜「边际分布」)。

  17. 出处:「附录 数学基础」第 1444 段(text/18-apx.txt:1444,搜「条件分布」)。

  18. 出处:「附录 数学基础」第 1468 段(text/18-apx.txt:1468,搜「互相独立」)。

  19. 出处:「附录 数学基础」第 1475 段(text/18-apx.txt:1475,搜「条件独立」)。

  20. 出处:「附录 数学基础」第 1461 段(text/18-apx.txt:1461,搜「贝叶斯定理」)。

  21. 出处:「第2章 机器学习概述」第 771 段(text/03-ch02.txt:771,搜「上的似然函数」)。 边注写明:似然函数是关于统计模型中参数的函数,不是关于随机变量的。

  22. 出处:「第2章 机器学习概述」第 793 段(text/03-ch02.txt:793,搜「最大似然估计」)。

  23. 出处:「第2章 机器学习概述」第 788 段(text/03-ch02.txt:788,搜「对数似然函数」)。

  24. 出处:「第2章 机器学习概述」第 808 段(text/03-ch02.txt:808,搜「先验分布」)。

  25. 出处:「第2章 机器学习概述」第 317 段(text/03-ch02.txt:317,搜「正则化是引入了参数的先验分布」)。

  26. 出处:「附录 数学基础」第 1702 段(text/18-apx.txt:1702,搜「自信息」)。

  27. 出处:「附录 数学基础」第 1709 段(text/18-apx.txt:1709,搜「对数的底可以使用」)。

  28. 出处:「附录 数学基础」第 1711 段(text/18-apx.txt:1711,搜「其自信息的数学期望」)。

  29. 出处:「附录 数学基础」第 1797 段(text/18-apx.txt:1797,搜「最优平均编码长度的理论下」)。

  30. 出处:「附录 数学基础」第 1799 段(text/18-apx.txt:1799,搜「所对应的平均码长」)。

  31. 出处:「附录 数学基础」第 1808 段(text/18-apx.txt:1808,搜「进一步等」)。 原书还说明:标签是软标签或平滑后的目标分布时,同一个公式仍然成立。 梯度形式见「附录 数学基础」第 851 段(text/18-apx.txt:851,搜「多分类模型输出层最常见的梯度形式」)。 2

  32. 出处:「第2章 机器学习概述」第 262 段(text/03-ch02.txt:262,搜「交叉熵损失函数也就是负」)。 附录 E 开篇也说了同一件事:「模型训练中的交叉熵等价于负对数似然」 (text/18-apx.txt:1691,搜「交叉熵等价于负对数似然」)。 2

  33. 出处:「附录 数学基础」第 1815 段(text/18-apx.txt:1815,搜「相对熵」)。

  34. 出处:「附录 数学基础」第 357 段(text/18-apx.txt:357,搜「当且仅当」)。 2

  35. 出处:「附录 数学基础」第 1830 段(text/18-apx.txt:1830,搜「既不满足对称性」)。 边注用「覆盖」(Zero Avoiding)与「集中」(Zero Seeking)两个词概括了两个方向的后果。 2 3

  36. 出处:「附录 数学基础」第 1837 段(text/18-apx.txt:1837,搜「一种对称的散度」)。

  37. 出处:「附录 数学基础」第 1843 段(text/18-apx.txt:1843,搜「没有重叠或重叠极」)。 2

  38. 出处:「附录 数学基础」第 1852 段(text/18-apx.txt:1852,搜「Wasserstein 距离」)。

  39. 出处:「附录 数学基础」第 1544 段(text/18-apx.txt:1544,搜「一组随机变量」)。

  40. 出处:「附录 数学基础」第 1555 段(text/18-apx.txt:1555,搜「马尔可夫性质」)。