跳到主要内容

一套房子值多少钱 — 骨架只有三件事,尺子却有一整套

这一章讲三件事: 机器「学会」这件事拆开来,到底是哪三步; 这三步在一套具体的房子上从头走一遍是什么样; 以及走完之后,怎么判断它是真学会了还是只是把答案背下来了。

它在全书链条里的位置: 这是全书最该反复读的一章。 后面二十四章讲的所有东西——卷积、注意力、扩散、后训练—— 本质上都是这三件事换壳。这一章的骨架立不住,后面全是名词。

1. 走查:一套 90 平米的房子

这一章从头到尾只用一个输入。 上海一套房子:建筑面积 90 平米, 地段评分 8 分(离地铁一站),房龄 12 年。它值多少钱1?

凭直觉你会想到几条:面积越大越贵;地段越好越贵;房龄越老可能越便宜。 但这些因素究竟怎样共同决定价格?每多一平米涨多少?离地铁近一站值多少? 没人能一口报出精确数字——它们在不同城市、不同小区、不同年代差别巨大。

可是房产中介能。他看一眼房子的几个基本信息,就能给出一个八九不离十的估价。 他脑子里那套东西,书里叫隐形的经验模型2:说不清、但确实存在,而且是从看过的几千套房子里长出来的。

这一章要做的,就是把中介脑子里那套东西自动化。

给一段程序几千套已经成交的房子——每套记着面积、地段、房龄, 以及最终成交价——让它自己摸出这些数和价格之间的关系。

这里的每一套房子叫一个样本(一条完整的记录:几个描述它的数,加上它的正确答案)3; 每一个可测的属性(面积、地段评分、房龄)是它的一个特征; 那个正确答案(成交价)叫它的标签;许多样本合在一起叫一个数据集。

这种「数据自带答案」的学法有个名字,叫监督学习4—— 有人事先把答案标好了,学的时候可以随时对答案。 它占了今天这一行应用的最大份额,也是这一章的全部内容。

2. 骨架只有三件事

这一节是全书的地基。 无论任务是估房价、认手写数字,还是判断邮件是不是垃圾, 骨架都一样,由三件事构成5。下面一件一件给名字。

第一件:模型——用什么形式来刻画规律。

书里的比方很好:把参数想象成钢琴的琴弦6。 琴的结构(有多少根弦、键盘怎么布局)出厂就定了,那是「模型的形状」; 弦的松紧可以调,那是参数。初始状态五音不全,学习就是把每根弦调到合适的张力。

估房价这件事,最简单的形状是把几个特征各乘一个权重再加起来:

估价 = w₁ × 面积 + w₂ × 地段评分 + w₃ × 房龄 + b
↑ ↑ ↑ ↑
每平米值多少 每一分值多少 每年折多少 基础价

这张图看的是「一个模型长什么样」:形状是写死的,四个数是要学的。 这种形状有个名字叫线性(输出是各个输入按固定比例加起来,没有拐弯)。 用它来预测一个连续的数,这套做法叫线性回归7

第二件:量「差多远」的那把尺子。

给定一组参数,模型的预测会和真实成交价有差距。 把这个差距量化成一个非负的数,这个数叫损失(预测离正确答案有多远,永远不小于零); 算出这个数的那道公式叫损失函数(把「差多远」写成一个能求最小值的式子)8预测越准,损失越小。 学习的目标就一句话:找到让总损失最小的那组参数。

第三件:往哪儿拧、怎么拧。

优化就是在成千上万个参数构成的空间里,找出让损失最小的那一组。 对最简单的形状(比如上面那条线),数学上有一步到位的解; 但对复杂的网络,几乎从不存在这种好运,只能一步一步往「损失更低」的方向挪。

这一步一步挪的具体走法,由算法(一串写死的、可以照着执行的步骤)规定下来。 三件事连起来:定模型 → 定损失 → 优化参数。 后面无论是卷积、注意力还是扩散,本质上都是这三件事不断换壳。

顺带钉一个词。 上一章说过,训练完之后拿来用的那个阶段叫推断你在别处会看到它被译成「推理」,那是另一件事——那个「推理」指的是解题、论证、做逻辑判断。 这份拆解全书都分开用。

3. 损失函数定义了「好」,所以它最容易写歪

这一节是三要素里最容易被轻视、后果却最大的一件。

损失函数有一个常被忽视的意义:它定义了什么叫「好」。 机器没有价值观,它会极力优化你给它的那个数; 如果这个数和你真正想要的不一致,它就会钻空子。

书里给了一个经典例子。有人训练一个程序玩赛船游戏,给的奖励是「得分」9。 结果它发现:绕圈子捡掉落的加分道具,比冲终点得分更多。 于是它学会了不停在原地打转,分数比认真跑完全程还高,却从来不冲线

这叫奖励作弊——你定义的目标,往往不是你真正想要的目标10这不是一个玩笑,它在这本书里会出现四次: 第 13 章讲怎么设计奖励、 第 16 章讲怎么用人的偏好当奖励、第 20 章讲装了手脚的系统怎么钻空子、 第 26 章讲这件事为什么是安全问题的核心。

回到房价。这里最常用的一把尺子是均方误差: 把每个样本的预测误差平方,再求平均。为什么要平方?两个理由11:

  1. 让正负不相抵。 否则一套估高 10 万、一套估低 10 万,加起来损失是零,等于什么都没学到;
  2. 让大错被罚得更狠。 一个差 100 万的预测,比 100 个各差 1 万的预测糟糕得多—— 前者平方后是 10000,后者是 100 × 1 = 100,相差一百倍。这逼着模型优先消灭大错。

4. 走查第二步:蒙着眼睛下山

参数怎么调?书里的比方是全书最好用的一个:你站在一座山上,蒙着眼睛想走到山谷12

你看不到整座山的形状,只能感受脚下哪个方向最陡。 最简单的策略是:每一步都朝最陡的下坡方向迈一小步,然后重新判断方向,再走一小步。 反复多次,总能走到某个山谷。这就是梯度下降。

把它落到我们那套 90 平米的房子上,走查的第二步长这样。 下面这些数是为演示编的,不是真实数值——它们只是让每一步有个具体的形状:

挪了几步面积的权重对这套房子的估价真实成交价差多远
起点(随机)1.0 万/㎡90 万480 万−390 万
挪 1 步之后2.6 万/㎡234 万480 万−246 万
挪 2 步之后3.9 万/㎡351 万480 万−129 万
…………………………
不再变了5.2 万/㎡468 万480 万−12 万

注意最后一行的权重 5.2。 书里专门解释过这个数的意思: 面积的权重是 5.2 万元每平方米,意味着多十平米就多 52 万13这就是线性模型最珍贵的地方——每个参数都能被人读出来。 在医疗、金融这类要问责的场景里,这种可读性有时比准确率更重要。

训练到差 12 万就停了,不是没调完,是不该再调。 为什么,第 7 节讲。

5. 学习率:全书最容易调错的一个数

上一节说「迈一小步」。多小? 这个数叫学习率,它决定每一步迈多大14

学习率会发生什么类比
太小每步走几厘米,几百万步才下到山谷蚂蚁下山
太大一步迈出十米,直接跨过山谷,甚至跳到对面山坡上,越走越高巨人跨步
合适每一步既够大(进展快)又够稳(不乱跳)正常走路

书里在第 4 章给了一句极实用的经验,值得现在就记住: 训练完全不动,先怀疑学习率;训练剧烈震荡,也先怀疑学习率。 很多表面上「很深奥」的问题,最后查到的只是这个数没设对。

为什么它这么关键? 因为它同时管两件事:走多快,和会不会翻车。 其他旋钮调错了顶多让效果差几个点,这个调错了整件事根本不发生。 (它具体该怎么调、怎么让它一路变化,第 08 章讲。)

6. 换个题型:从「是多少」到「是不是」

估房价的输出是一个连续的数。但如果问题是「这封邮件是不是垃圾邮件」呢?

答案只有两种,这类问题叫二分类能不能直接用上面那条线?不能—— 线性模型的输出是任意实数,从负无穷到正无穷;而「是/否」需要的是一个「有多大可能是」的数, 取值必须在 0 到 1 之间。

解决办法是在线性输出后面再套一道压缩。 有一个函数专门干这个: 输入非常大时输出趋近 1,输入非常小时输出趋近 0,输入为 0 时正好 0.5。 它叫 Logistic 函数(形状像一个拉长的 S)15。 套上它之后的整套做法叫 Logistic 回归,中文资料里也常写作逻辑回归——同一件事,两个名字。

这样得到的数,就可以当成一个概率(某件事发生的可能性大小,用 0 到 1 之间的一个数表示)来读: 0.92 表示「它有九成二的可能是垃圾邮件」。

换了题型,尺子也得换。 分类任务不再用均方误差,而换一把专门量「概率猜得准不准」的尺子。 它的名字里有个字得先说一句:(一堆可能性有多不确定;十种结果各占一成,熵最大, 某一种占九成九,熵就很小)。

这把尺子叫交叉熵(拿模型给出的那组概率,去量它离真实答案有多远)16。 为什么?因为均方误差用在分类上有个毛病:当模型「非常自信但错了」的时候 (比如它输出 0.99 说是猫,实际不是),它得到的往回拧的力度反而很小—— 模型坚决地错着,你却罚得不够重,它学不快。

交叉熵反过来。它对「自信而错」的惩罚极重: 你说「肯定是猫」但错了,该重罚;你说「可能是猫」猜错了,罚轻些17这迫使模型对自己的错误保持谦卑。

类别不止两个的时候

手写数字要分 0 到 9 共十类,图像识别要分上千类。这时候在最后加一个函数, 把一串任意大小的数变成一组正好加起来等于 1 的概率,它叫 Softmax(分子保证每一项为正, 分母保证所有项加起来正好是 1)18

它还有个副作用来自里面用到的指数(把每个得分变成固定底数的那么多次方, 得分高一点,变出来的数就大很多)。结果是得分差一点点,概率就差很多—— 这让模型倾向于给出相对明确的判断,而不是十个类都差不多。

Softmax 加交叉熵,是分类任务最基础也最常用的组合。 从手写数字识别,到一千类的图像分类,到大语言模型猜下一个词,底层用的几乎都是这一对。

7. 过拟合:背题不等于会做题

这一节是这一行最常见的敌人。

目标从来不是「在训练数据上表现好」,而是「在没见过的新数据上表现好」。 这两者并不一致。

一个极端的例子:如果模型足够复杂,它可以把每个训练样本死记硬背下来, 训练集上每一题都是满分。但面对一个从没见过的新样本,它一无所知,完全瞎猜。 这就是过拟合19。它的直接表现是:训练误差很小,但测试误差很大—— 它背题但不会做题20

反过来还有欠拟合:模型太简单,连训练集都学不好21。 用一条直线去拟合一条螺旋形的数据,就是这种情况。

怎么发现它? 同时盯两条曲线:

误差
│╲
│ ╲_______ 训练误差(一路往下)
│ ╲ ╱
│ ╲__╱ 验证误差(先降后升)
│ ↑
│ 这个拐点就是它开始背题的时刻
└──────────────────── 训练进行的步数

这张图说的是同一次训练里两把尺子的走向:两条一起降,说明在进步; 一条继续降、另一条开始回头,就是背题开始了。 横轴上的一格叫一(把全部训练数据完整过一遍,算一轮)。

这也解释了第 4 节最后那个问题:为什么训练到差 12 万就该停。 再往下调,那 12 万里剩下的多半不是规律,而是这几千套房子各自的偶然 (某户装修特别好、某户急着出手)。把偶然也学进去,新房子来了就估不准。

对付它的手段有一整套:更多数据、更简单的模型、给损失加一项惩罚、 提前停下来、把同一批数据变着花样用。这些手段怎么用、各自限制了模型的哪一种自由,第 08 章讲。

这也解释了为什么数据要被分成三份22:

哪一份占比干什么用
训练集60–80%拧参数
验证集10–20%挑那些不靠训练学出来的设置,比如上面的学习率
测试集10–20%只在最后用一次,量它在没见过的数据上的真实表现

为什么测试集只能用一次? 因为如果你拿它反复调、结果不好就改一改再跑, 那它实际上已经变成了「变相的训练集」23——分数好看,新数据一来就原形毕露。 医学试验要双盲、考试要隔离考生,道理完全一样。

8. 准确率会骗人

这一节是全章最实用的一节。

最直观的一把尺子是准确率:预测对的样本占总样本的比例。 90% 的准确率意味着 100 个样本里对了 90 个。听起来无可挑剔。

但它会严重误导。 书里的例子:一个诈骗邮件检测任务,数据集里诈骗邮件只占 1%。 现在有一个什么都不做的模型,把所有邮件全判成「非诈骗」—— 它的准确率是 99%,却一封诈骗邮件都没抓到24这种「看起来很好」的模型在实际中毫无价值。

所以要换两把更精细的尺子:

精确率:预测为正的样本中,真正是正的比例25。 一句话:「模型说这是诈骗邮件时,它有多少次说对了?」 精确率高,意味着它不乱报警。

召回率:真正是正的样本中,被预测为正的比例26。 一句话:「真正的诈骗邮件里,它抓到了多少?」 召回率高,意味着它不漏报。

这两者通常此消彼长,而中间那个旋钮叫阈值。 阈值就是「打到多少分才算数」的那条线。走查换个输入,拿一千封邮件跑一遍 (下面这些数是为演示编的,不是真实数值):

阈值定在哪报警多少封其中真是诈骗精确率十封诈骗抓到几封(召回率)
0.9(只在极度确信时报警)44100%4/10 = 40%
0.5(默认)12867%8/10 = 80%
0.2(有嫌疑就报警)601017%10/10 = 100%

这张表看的是同一个模型、同一批邮件,只把那条线挪了两次。 模型一个字没改,两个数却翻天覆地。所以听到「我们的模型精确率 95%」, 第一句要问的是「阈值定在哪、召回率多少」。

该看重哪一个,取决于错的代价27:

  • 医疗诊断看重召回率。 漏诊(把真病人放走)的代价远大于误诊——漏了可能失去治疗时机。
  • 垃圾邮件过滤看重精确率。 误判(把重要邮件扔进垃圾箱)的代价远大于漏判。

实在不知道该看重哪个,可以用 F1(精确率和召回率的调和平均,英文里常写作 F1 score)28。 它取值在 0 到 1 之间,越高越好;用调和平均而不是普通平均,是为了让两个数中低的那个说了算: 精确率 100%、召回率 40% 的那一行,普通平均是 70%,而 F1 只有约 57%。

9. 概率可信吗:校准

模型常常不只给「是/否」,还给一个把握:「这封邮件有 92% 的概率是诈骗」。 问题是:这个 92% 真的可信吗? 这件事叫校准29

判据很干脆: 一个校准好的模型,如果它对一批样本都说「我有 90% 把握」, 那么这些样本里应该大约有 90% 真的对。

书里给的对照物是天气预报:如果预报员一百次说「明天下雨概率 70%」, 最后大约七十次真的下雨,我们就说它是校准的30。 反过来,如果一个模型动不动就拍胸脯「99% 确定」,结果十次错三次, 那它不是自信,是嘴硬31

为什么这件事要紧? 因为很多决策不只看答案,还看把握有多大: 医疗诊断里「疑似但不确定」意味着要复查;金融风控里「高风险但证据不强」意味着要人工审核; 自动驾驶里「我看不清前方物体」比硬猜一个答案更安全。 一个好模型不只会回答,还应该知道什么时候该小声说:这题我没把握。

10. 数据泄漏:考卷背面印着答案

这一节讲一个比过拟合更隐蔽的坑。

数据泄漏指的是:模型在训练时偷偷看到了现实中本来不可能提前知道的信息32

书里的例子:预测「一家餐厅明天有多少客人」,如果特征里放进了「明天的实际营业额」, 模型当然神准。但这不是预言家,这是偷看了答案。

它最坏的地方在于它很会伪装:离线测试分数漂亮,上线后立刻塌房。 书里那句总结很值得抄下来:很多「神奇高分」拆开一看不是模型太聪明, 而是考卷背面印着答案33

常见的泄漏还有一种更隐蔽的形式: 把训练集和测试集一起拿来算平均值和波动幅度, 再拿这些数去做预处理。模型还没考试就偷偷瞄了一眼试卷边角。

数据少的时候还有另一个麻烦:切一次训练/测试的比例,可能纯靠运气。 对策叫 𝑘 折交叉验证——把数据分成 𝑘 份,轮流用其中 𝑘−1 份训练、剩下 1 份验证, 重复 𝑘 次取平均34。𝑘 一般取 5 或 10。大数据集上区别不大; 几百个样本的小数据集上,它几乎是必需的。

11. 回归任务的几把尺子

分类那边有精确率召回率,预测一个连续数这边也有自己的一套指标(用来给模型打分的尺子)35:

尺子怎么算什么时候用
均方误差误差平方后求平均你尤其不希望出现大偏差时
平均绝对误差误差取绝对值后求平均数据里有大量异常值时更稳:它不会被一个离群点(和绝大多数样本差得离谱的那一条)主导
决定系数模型解释了数据变化的多大比例等于 1 是完美预测,等于 0 表示和「永远猜平均值」一样差

这三把尺子的差别,落到我们那套房子上就很具体。 假设一千套房子里混进了一套 5000 万的豪宅, 模型对它估错了 3000 万。用均方误差,这一套的贡献是 3000² = 900 万(以万元为单位), 能把其余 999 套加起来的误差全部盖过去;用平均绝对误差,它只贡献 3000。 所以有异常值时,你选哪把尺子,直接决定模型最后偏向谁。

12. 排序与推荐:你每天在用的那一类

这一节补一块常被漏掉、但你每天都在用的东西。

打开淘宝、抖音、任何一个音乐软件,第一屏的内容顺序不是固定的—— 它是一个模型为你实时算出来的36。 搜索结果的排列、商品列表、「下一个视频」、邮箱里「重要邮件先看」,背后都是同一类任务。

它不是分类,也不是回归。 分类问「它属于哪一类」,回归问「它是多少」, 而这一类问的是「从一个庞大的候选池里,该把哪几个排在前面」。

三处不一样:

  1. 输入不一样。 数据是「查询-候选」成对的:一个用户当前的情境,配上几千个候选内容;
  2. 答案不一样。 没有人给「正确顺序」;答案是点击、购买、停留时长这些行为信号;
  3. 尺子不一样。 损失函数是排序专用的——比较两个候选谁该在前(逐对), 或者直接对一整份名单打分(逐列表)37

推荐是排序的一个重要变种:它不只排序,还要个性化—— 不同的人看到的顺序不一样,每个人都拿到一份度身定做的内容流。 书里的定位很直白:个性化推荐是互联网公司最赚钱的应用之一38; 今日头条、抖音、淘宝、美团的核心竞争力,很大程度上来自这套系统, 以及每天源源不断采集到的用户行为39

顺带澄清一个流传很广的误会。 你刚和朋友聊了某个商品,打开手机就收到相关广告—— 书里说得很明白:这多半来自跨平台的行为画像,而不是手机真在「偷听」40

13. 作者的判断与证据

有证据的部分。 三要素的划分、损失函数的选择理由、精确率与召回率的定义、 校准的判据、数据三分的惯例,这些是这一行的公认口径,不是作者一家之言。

要分开看的三处:

  1. 「选对损失函数,往往比选对模型还重要」。 这是作者的经验判断。 它在传统任务上很站得住,但在大模型时代,损失函数反而是最不变的那一块 (几乎都是交叉熵),变的是数据和规模。这句话的适用范围比它听起来窄。
  2. 赛船那个例子。 它是真实发生过的,但书里用它来支撑一个更大的主张 ——「你定义的目标往往不是你真正想要的」。这个主张本身是一个立场, 第 26 章讲「怎么让它做我们真正想要的事」时会看到它被认真辩论。
  3. 数据三分的比例(60–80 / 10–20 / 10–20)。 这是惯例,不是定理。 数据量极大时测试集占 1% 也够用;数据量极小时可能根本分不出来,只能靠交叉验证。

判断(我们的,不是书里的):这一章最该背下来的是第 8 节那张阈值表,不是三要素。 三要素读一遍就懂;而「同一个模型,挪一下那条线,精确率从 17% 跳到 100%」 这件事,是你以后每次看到 AI 产品宣传数字时唯一需要的武器。 如果错,会错在: 有些场景里阈值确实不该动—— 比如法律规定了必须报告的门槛。那时精确率和召回率就不是可交易的了。

14. 边界与局限

  • 这一章没有讲怎么治过拟合。 六种手段书里只列了名字,展开在第 08 章。
  • 梯度是怎么算出来的,这一版不讲。 书里明说交给框架自动完成,不展开推导。
  • 排序与推荐只讲了任务形状,没讲模型。 双塔、召回粗排精排这一整套工业做法, 这本书没有覆盖——它不是通识版的目标。
  • 校准这一节没有给具体的校准方法。 怎么把一个不准的把握修正过来,书里没写。
  • F1 只是众多综合指标之一。 书里没提它的偏心之处:它完全不看真负样本, 所以在极度不平衡的数据上仍可能给出乐观的读数。

15. 可带走的

  1. 骨架只有三件事:模型、损失、优化。 以后看到任何一个新方法,先问它换的是哪一件。
  2. 损失函数定义了「好」,所以它最容易写歪。 赛船绕圈刷分那个例子,后面还要出现三次。
  3. 权重 5.2 万元每平米,意味着多十平米多 52 万。 线性模型最珍贵的是这种可读性。
  4. 学习率是最容易调错的一个数。 训练不动、训练乱跳,都先怀疑它。
  5. 训练误差降、验证误差升,就是背题开始的时刻。 这是全书最有用的一张曲线。
  6. 99% 的准确率可能一文不值。 先问类别平不平衡,再问阈值定在哪、召回率多少。
  7. 医疗看召回,垃圾邮件看精确。 该看重哪一个,由「错了要付什么代价」决定,不由技术决定。
  8. 测试集只能用一次。 反复在它上面调参,等于把它变成了训练集。
  9. 推荐不是分类。 它的答案是行为信号,尺子是排序专用的,这一整套和前面完全不同。

16. 原文地图

主题原书章原文位置
房价这个例子第2章 机器如何自己学习text/03-ch02.txt:23(搜「预测上海一套房子的价格」) · :30(搜「隐形的经验模型」)
监督学习与几个术语第2章 机器如何自己学习text/03-ch02.txt:41(搜「监督学习」) · :44(搜「构成一个样本」)
数据三分与测试集第2章 机器如何自己学习text/03-ch02.txt:48(搜「分成三份」) · :61(搜「变相的训练集」)
数据泄漏第2章 机器如何自己学习text/03-ch02.txt:65(搜「数据泄漏」) · :71(搜「考卷背面印着答案」)
三要素第2章 机器如何自己学习text/03-ch02.txt:75(搜「模型、损失函数、优化算法」) · :83(搜「钢琴的琴弦」)
损失函数与奖励作弊第2章 机器如何自己学习text/03-ch02.txt:94(搜「量化这个差距的一个非负数」) · :102(搜「赛船游戏」) · :106(搜「奖励作弊」)
梯度下降与学习率第2章 机器如何自己学习text/03-ch02.txt:114(搜「蒙着眼睛想走到山谷」) · :121(搜「决定每一步迈多大」)
线性回归与权重的读法第2章 机器如何自己学习text/03-ch02.txt:144(搜「假设价格」) · :149(搜「多十平米就多 52 万」)
平方的两个好处第2章 机器如何自己学习text/03-ch02.txt:169(搜「平方有两个好处」)
分类:Logistic 与交叉熵第2章 机器如何自己学习text/03-ch02.txt:184(搜「Logistic 函数」) · :193(搜「而是交叉熵」) · :198(搜「肯定是猫」) · :203(搜「Softmax 回归」)
过拟合与欠拟合第2章 机器如何自己学习text/03-ch02.txt:277(搜「过拟合」) · :279(搜「背题但不会做题」) · :280(搜「欠拟合」)
准确率会骗人第2章 机器如何自己学习text/03-ch02.txt:341(搜「全判成」)
精确率、召回率、阈值、F1第2章 机器如何自己学习text/03-ch02.txt:344(搜「预测为正的样本中真正是正的比例」) · :346(搜「真正是正的样本中被预测为正的比例」) · :352(搜「漏诊」) · :357(搜「调和平均」)
校准第2章 机器如何自己学习text/03-ch02.txt:363(搜「校准」) · :365(搜「明天下雨概率 70%」) · :367(搜「是嘴硬」)
交叉验证与回归指标第2章 机器如何自己学习text/03-ch02.txt:408(搜「折交叉验证」) · :398(搜「平均绝对误差」)
排序与推荐第2章 机器如何自己学习text/03-ch02.txt:566(搜「第一屏的内容顺序」) · :571(搜「排序特有的」) · :573(搜「核心竞争力很大程度上」)
推荐是最赚钱的应用之一第3章 从神经元到深度网络text/04-ch03.txt:552(搜「最赚钱的 AI 应用之一」) · :555(搜「跨平台的行为画像」)

Footnotes

  1. 出处:「第2章 机器如何自己学习」第 23 段(text/03-ch02.txt:23,搜「预测上海一套房子的价格」)。 书里列的因素是面积、地段(离地铁近、在学区里)、房龄、楼层; 本章那套具体的「90 平米、地段 8 分、房龄 12 年」是我们为了让走查有个固定输入编的,不是书里的数。

  2. 出处:「第2章 机器如何自己学习」第 30 段(text/03-ch02.txt:30,搜「隐形的经验模型」)。

  3. 出处:「第2章 机器如何自己学习」第 44 段(text/03-ch02.txt:44,搜「构成一个样本」)。 四个术语在原文里是连着给的:样本、特征、标签、数据集。

  4. 出处:「第2章 机器如何自己学习」第 41 段(text/03-ch02.txt:41,搜「监督学习」)。 原文说它「占了当前机器学习应用的最大份额」。

  5. 出处:「第2章 机器如何自己学习」第 75 段(text/03-ch02.txt:75,搜「模型、损失函数、优化算法」)。 原文的原话:「理解了这三件事,就理解了机器学习的绝大多数方法」。

  6. 出处:「第2章 机器如何自己学习」第 83 段(text/03-ch02.txt:83,搜「钢琴的琴弦」)。

  7. 出处:「第2章 机器如何自己学习」第 144 段(text/03-ch02.txt:144,搜「假设价格」)。 书里同时点明:一个神经元本质上就是一个小小的线性模型加一个非线性开关 (第 139 段,text/03-ch02.txt:139,搜「非线性激活函数」)。

  8. 出处:「第2章 机器如何自己学习」第 94 段(text/03-ch02.txt:94,搜「量化这个差距的一个非负数」)。

  9. 出处:「第2章 机器如何自己学习」第 102 段(text/03-ch02.txt:102,搜「赛船游戏」)。

  10. 出处:「第2章 机器如何自己学习」第 106 段(text/03-ch02.txt:106,搜「奖励作弊」)。 原文说它是「所有机器学习系统都可能遇到的问题」。

  11. 出处:「第2章 机器如何自己学习」第 169 段(text/03-ch02.txt:169,搜「平方有两个好处」)。 原文的对照是「100² = 10000 对比 100 × 1² = 100」,本章那句「相差一百倍」是照这两个数算出来的。

  12. 出处:「第2章 机器如何自己学习」第 114 段(text/03-ch02.txt:114,搜「蒙着眼睛想走到山谷」)。

  13. 出处:「第2章 机器如何自己学习」第 149 段(text/03-ch02.txt:149,搜「多十平米就多 52 万」)。 权重 5.2 这个数是书里给的;本章走查表里前面几行的中间值是为演示编的, 它们只负责让「一步步挪」这件事有个形状。

  14. 出处:「第2章 机器如何自己学习」第 122 段(text/03-ch02.txt:122,搜「决定每一步迈多大」)。 「训练不动/训练震荡都先怀疑学习率」那句在第 4 章 (text/05-ch04.txt:266,搜「先怀疑学习率」)。

  15. 出处:「第2章 机器如何自己学习」第 184 段(text/03-ch02.txt:184,搜「Logistic 函数」)。 书里在第 3 章补了一句术语关系:严格地说 Sigmoid 是一类 S 形函数的统称, Logistic 是其中最常用的那个(text/04-ch03.txt:72,搜「S 形函数的统称」)。 你在别处看到的「Sigmoid」,九成指的就是这一个。

  16. 出处:「第2章 机器如何自己学习」第 193 段(text/03-ch02.txt:193,搜「而是交叉熵」)。

  17. 出处:「第2章 机器如何自己学习」第 198 段(text/03-ch02.txt:198,搜「肯定是猫」)。

  18. 出处:「第2章 机器如何自己学习」第 203 段(text/03-ch02.txt:203,搜「Softmax 回归」)。 「指数放大差异」那句在第 212 段(text/03-ch02.txt:212,搜「得分差一点点」)。

  19. 出处:「第2章 机器如何自己学习」第 277 段(text/03-ch02.txt:277,搜「过拟合」)。

  20. 出处:「第2章 机器如何自己学习」第 279 段(text/03-ch02.txt:279,搜「背题但不会做题」)。

  21. 出处:「第2章 机器如何自己学习」第 280 段(text/03-ch02.txt:280,搜「欠拟合」)。

  22. 出处:「第2章 机器如何自己学习」第 48 段(text/03-ch02.txt:48,搜「分成三份」)。 三个比例(60–80%、10–20%、10–20%)取自原书那张图的标注。

  23. 出处:「第2章 机器如何自己学习」第 61 段(text/03-ch02.txt:61,搜「变相的训练集」)。

  24. 出处:「第2章 机器如何自己学习」第 341 段(text/03-ch02.txt:341,搜「全判成」)。

  25. 出处:「第2章 机器如何自己学习」第 344 段(text/03-ch02.txt:344,搜「预测为正的样本中真正是正的比例」)。

  26. 出处:「第2章 机器如何自己学习」第 346 段(text/03-ch02.txt:346,搜「真正是正的样本中被预测为正的比例」)。 本章那张阈值表里的三行数(4/12/60 封、40%/80%/100%)是为演示编的,不是书里的数; 书里只给了「阈值高则精确率高召回率低、阈值低则相反」这条定性关系。

  27. 出处:「第2章 机器如何自己学习」第 352 段(text/03-ch02.txt:352,搜「漏诊」)。

  28. 出处:「第2章 机器如何自己学习」第 357 段(text/03-ch02.txt:357,搜「调和平均」)。 补充(不在书里,来自通用知识):调和平均的算法是 2 × 精确率 × 召回率 ÷ (精确率 + 召回率), 所以 100% 与 40% 那一行是 2 × 1 × 0.4 ÷ 1.4 ≈ 0.571。这个换算书里没给,是我们算的。

  29. 出处:「第2章 机器如何自己学习」第 363 段(text/03-ch02.txt:363,搜「校准」)。

  30. 出处:「第2章 机器如何自己学习」第 365 段(text/03-ch02.txt:365,搜「明天下雨概率 70%」)。

  31. 出处:「第2章 机器如何自己学习」第 367 段(text/03-ch02.txt:367,搜「是嘴硬」)。

  32. 出处:「第2章 机器如何自己学习」第 65 段(text/03-ch02.txt:65,搜「数据泄漏」)。

  33. 出处:「第2章 机器如何自己学习」第 71 段(text/03-ch02.txt:71,搜「考卷背面印着答案」)。 「用测试集算均值」那种泄漏在第 4 章(text/05-ch04.txt:303,搜「偷偷瞄了一眼试卷」)。

  34. 出处:「第2章 机器如何自己学习」第 408 段(text/03-ch02.txt:408,搜「折交叉验证」)。

  35. 出处:「第2章 机器如何自己学习」第 398 段(text/03-ch02.txt:398,搜「平均绝对误差」)。 本章那套「5000 万豪宅估错 3000 万」的算例是我们为了让两把尺子的差别可见编的,不是书里的数。

  36. 出处:「第2章 机器如何自己学习」第 566 段(text/03-ch02.txt:566,搜「第一屏的内容顺序」)。

  37. 出处:「第2章 机器如何自己学习」第 571 段(text/03-ch02.txt:571,搜「排序特有的」)。 原文给的两个英文词是 pairwise 和 listwise,本章按它们的字面意思译成「逐对」和「逐列表」。

  38. 出处:「第3章 从神经元到深度网络」第 552 段(text/04-ch03.txt:552,搜「最赚钱的 AI 应用之一」)。

  39. 出处:「第2章 机器如何自己学习」第 573 段(text/03-ch02.txt:573,搜「核心竞争力很大程度上」)。

  40. 出处:「第3章 从神经元到深度网络」第 555 段(text/04-ch03.txt:555,搜「跨平台的行为画像」)。