跳到主要内容

语音识别(让机器把人说的话变成文字) — 一个教授加两个学生,追平一家巨头

这一章讲三件事: 深度学习的第一次工业级胜利发生在哪(不是图像,是语音); 让它成为可能的硬件意外——游戏显卡;以及「小团队+大数据+新硬件」这个公式 是怎么第一次被跑通的。这个公式就是后来整场革命的操作系统。

1. 起点:惠斯勒山脚的一句「有什么新鲜事吗」

2008 年 12 月,温哥华以北的滑雪胜地惠斯勒。微软语音识别研究员邓力 在学术研讨会的一个房间里遇到辛顿,照例问:「有什么新鲜事吗?」辛顿答:「深度学习。」1

这话当时没有分量:辛顿不是语音圈内人,而神经网络「从未在任何事情上奏效过」; 邓力的团队花三年打磨的新系统,下一版预期也只提升约 5%2。 但辛顿不停地说「你必须试一试」,还发来论文初稿:用大约 3 个小时的口语词汇训练, 性能已经逼近最好的语音方法3。邓力要来原始测试数据,亲眼看完才信: 「这篇论文存在一些问题,但我简直不敢相信,他们得到了跟我一样的结果。」4

这里补一个读懂数字的工具(全章都要用):语音系统的成绩单叫词错率—— 机器听写一大段话,数一数认错的词占多大比例。 20% 出头是什么概念?随便一句十个词的指令,平均有两三个词被听错。 (原书没有做这个换算,这是我们补的演示口径。) 微软卖了十多年语音听写软件,官方事实是:错误多于正确5

2. 主走查:一个语音系统是怎么被「练」出来的

把 2009-2010 年这条生产线整个走一遍。所有步骤都是书里记载的真实动作, 合并成的数值口径是我们的整理:

① 原料:口语录音 + 对应的文字稿
多伦多:约 3 小时(2008,论文里) → 微软:12 小时 → 谷歌:2,000 小时
② 机器:不是普通电脑芯片,是 GPU(图形处理器)
——本来是给《光环》《侠盗猎车手》渲染画面的芯片,
2005 年微软的三名工程师和斯坦福团队先后发现它同样擅长跑神经网络的数学[^6]
③ 训练:让神经网络反复听录音、猜文字稿、按对错调权重(反向传播,第 02 章)
④ 验收:拿没听过的录音考它,数词错率
多伦多/微软:追平甚至超过微软多年系统
谷歌:21% → 两周后 18%,而谷歌自家安卓语音服务是 23%[^7]

两个承重细节:

  • 硬件采购本身就是一场斗争。 辛顿开出的条件是一万美元一块的英伟达专业卡, 还可能不止一块,外加一台同价的服务器(机房里干重活的专用电脑)。上司阿塞罗的反应是「不要浪费钱」, 让邓力去电子商店买便宜通用显卡——辛顿反击:连续几天分析语音数据会把便宜卡烧掉, 而且「神经网络要依靠额外的处理能力实现蓬勃发展」。他给邓力的邮件写道: 「这将花费你大约一万美元。我们自己则要订购三套,但我们是一所资金雄厚的加拿大大学, 不是一家资金短缺的软件销售商。」6
  • 代码出乎意料地少。 2009 年 11 月,辛顿躺公交、坐三天火车到西雅图, 和邓力用 MATLAB 写出原型:不超过 10 页,大部分出自辛顿之手。 邓力的评语:「一行一行,都太清晰了。」训练几天之后,效果超过了微软多年积累的系统7

为什么这套打法成立: 语音识别的老方法靠工程师手工描述「声音长什么样」; 神经网络改靠数据——样本越多,它自己摸出的规律越细。 而 GPU 让「样本多」从奢望变成日常。三样东西(更多数据、更强算力、会自己学的模型) 第一次凑齐,系统就跨过了旧方法的天花板。

边界在哪: 2010 年这个原型还远不能上线——贾特利的系统当时要快 10 倍 才能处理实时查询8。「能用」和「能用一辈子」之间,还有工程化的几年(第 07 章)。

3. 雪崩是怎么开始的:微软→IBM→谷歌

原书记录了一条精确的传导链,每一步都以「几个月」计:

  1. 微软(2009-2010): 辛顿驻场,做出原型;2010 年夏学生达尔来访, 用微软必应语音搜索积累的数据训练,超越微软在研的一切9。 彼得·李——新任研究负责人——审预算时看到这些开支,原话是: 「我有时会想,如果我一年前被微软聘用,那么这一切都不会发生。」 他当时认为神经网络「是他看到的最愚蠢的想法之一」10;
  2. IBM(2010 秋): 学生穆罕默德转赴 IBM 沃森研究中心,如法炮制11;
  3. 谷歌(2010 夏): 学生贾特利独自去实习。他申请的 GPU 机器被塞在角落—— 风扇太吵,负责人万豪克把它藏在打印机后面,让噪音都算到打印机头上12; 谷歌数据中心的电脑没有 GPU,贾特利只能在蒙特利尔小办公室远程接入。 谷歌人问:能不能用 2,000 小时口语训练?他问辛顿: 「有人做过 2,000 个小时的训练吗?」「没有,但我不知道这为什么行不通。」13 结果不到一周出第一个模型:词错率 21%(谷歌自家 23%);两周后 18%14; 他还顺手做了在 YouTube 视频里找词的系统,把谷歌同类服务的错误率从 53% 打到 48%15;
  4. 产品(不到 6 个月): 谷歌全团队接手,把语音识别推上安卓手机。 一个注脚说明新系统强到什么程度:一家给手机做消噪芯片的公司打电话来抱怨 自己的芯片「失效」了——真相是,新系统连噪声(录音里的背景杂声)都学会了处理,用不上消噪了16

4. 作者的判断与证据

书里给了证据的: 三家公司的时间线与词错率数字;GPU 采购的往来邮件; 邓力「辛顿是个天才,他知道如何不断地制造影响力」的当面评价17; 贾特利「这让人上瘾,结果越来越好」的自述18

作者的整理与判断,要分开:

  • 「这是人工智能漫长历史中的一个转折点」——作者下的判断,依据是 「一位教授和他的两名研究生的成果超越了世界上最大的公司之一已经研发了十几年的一个系统」19;
  • 「全球军备竞赛的开始」——这是第 02 章前言场景的回声,属于作者的叙事框架,不是当事人原话。

5. 边界与局限

  • 原书没给三个系统之间的严格对照实验:三家的数据、任务、评测集并不完全一样, 「18% 打败 23%」是跨系统比较,不是同题竞赛;
  • 本章的成功局限在「识别」:系统能听写,不代表能听懂—— 「理解语言」的距离在后面几章会反复出现(第 10、12 章);
  • 2010 年的训练仍然以天计;「几周太慢」的焦虑贯穿全书,直到专用芯片出现(第 07 章)。

6. 可带走的

  1. 深度学习的第一场工业胜利在语音,不是图像:2010 年前后,教授+学生的小团队在三家巨头各自复现;
  2. 词错率是这门技术的成绩单:18% 对 23% 的差距,等于每听写五个词少错一个;
  3. GPU(图形处理器)是无意中来的救兵:为游戏画面而生,恰好擅长神经网络的数学—— 书里原话的对照是:GPU 跑深度学习的效率几十倍于普通芯片,而它是无心插柳20;
  4. 数据的威力第一次显形:从 3 小时到 12 小时到 2,000 小时,性能随数据一路上扬; 「喂更多数据」从此成为这个行业的默认动作;
  5. 防守方输在预判:微软上司认为买游戏显卡是浪费钱,研究负责人认为是「最愚蠢的想法」—— 不是能力不够,是没料到小团队能撬动巨头十几年的积累;
  6. 复述公式:小团队 + 会自己学的模型 + 借来的游戏算力 + 大公司才有的数据 = 追平并反超

7. 原文地图

主题原书章原文位置
惠斯勒相遇、有什么新鲜事04 微软与谷歌的新突破text/05-p81-100.txt:432(搜「有什么新鲜事吗」) · text/05-p81-100.txt:416(搜「提高 5%」)
3 小时数据逼近最好方法、邓力看数据04 微软与谷歌的新突破text/05-p81-100.txt:456(搜「3 个小时」) · text/05-p81-100.txt:463(搜「跟我一样的结果」)
错误多于正确、语音记录软件04 微软与谷歌的新突破text/05-p81-100.txt:412(搜「错误」)
GPU 来源(游戏)、2005 两处发现04 微软与谷歌的新突破text/06-p101-120.txt:79(搜「英伟达」) · text/06-p101-120.txt:84(搜「2005 年」)
巴士+三天火车、站立办公桌04 微软与谷歌的新突破text/06-p101-120.txt:4(搜「布法罗」) · text/06-p101-120.txt:15(搜「站立式办」)
MATLAB 原型 10 页、太清晰了04 微软与谷歌的新突破text/06-p101-120.txt:63(搜「MATLAB」) · text/06-p101-120.txt:67(搜「太清晰了」)
一万美元 GPU、不要浪费钱、邮件04 微软与谷歌的新突破text/06-p101-120.txt:101(搜「一万美元」) · text/06-p101-120.txt:107(搜「不要浪费钱」) · text/06-p101-120.txt:119(搜「资金雄厚的加拿大大学」)
彼得·李最愚蠢、一年前聘用04 微软与谷歌的新突破text/06-p101-120.txt:130(搜「最愚蠢」) · text/06-p101-120.txt:135(搜「一年前」)
达尔来访、必应数据、超越一切04 微软与谷歌的新突破text/06-p101-120.txt:151(搜「必应」) · text/06-p101-120.txt:157(搜「转折点」)
IBM 沃森中心、穆罕默德04 微软与谷歌的新突破text/06-p101-120.txt:175(搜「托马斯·沃森」)
GPU 藏打印机后04 微软与谷歌的新突破text/06-p101-120.txt:217(搜「打印机后」)
2,000 小时问答04 微软与谷歌的新突破text/06-p101-120.txt:249(搜「2,000 个小时」)
21%/18%/23%、YouTube 53%/48%04 微软与谷歌的新突破text/06-p101-120.txt:263(搜「21%」) · text/06-p101-120.txt:280(搜「53%」)
消噪芯片失效、6 个月上安卓04 微软与谷歌的新突破text/06-p101-120.txt:308(搜「噪声」) · text/06-p101-120.txt:298(搜「推向了安卓智能手机」)
辛顿是个天才04 微软与谷歌的新突破text/06-p101-120.txt:163(搜「制造影响力」)
让人上瘾04 微软与谷歌的新突破text/06-p101-120.txt:286(搜「让人上瘾」)

Footnotes

  1. 出处:「04 微软的尝试与谷歌的新突破」(text/05-p81-100.txt:432,搜「有什么新鲜事吗」)。2008-12-11,惠斯勒 NIPS 研讨会。

  2. 出处:同章(text/05-p81-100.txt:416,搜「提高 5%」)。邓力团队三年打造的新系统,下一版预期仅比上一版提高约 5%。

  3. 出处:同章(text/05-p81-100.txt:456,搜「3 个小时」)。分析约 3 小时口语词汇后,性能与最好的语音方法相媲美。

  4. 出处:同章(text/05-p81-100.txt:463,搜「跟我一样的结果」)。

  5. 出处:同章(text/05-p81-100.txt:412,搜「错误」)。原文:清晰说话时,记录下来的单词中错误数量超过正确的。

  6. 出处:同章(text/06-p101-120.txt:107,搜「不要浪费钱」)与(text/06-p101-120.txt:119,搜「资金雄厚的加拿大大学」)。上司阿塞罗后来去了苹果负责 Siri。

  7. 出处:同章(text/06-p101-120.txt:63,搜「MATLAB」)与(text/06-p101-120.txt:67,搜「太清晰了」)。原型不超过 10 页代码,几天完成。

  8. 出处:同章(text/06-p101-120.txt:292,搜「10 倍」)。贾特利的系统处理速度要提升 10 倍才能处理实时查询。

  9. 出处:同章(text/06-p101-120.txt:151,搜「必应」)。达尔用一万美元级显卡与必应语音数据训练,超越公司在研的一切产品。

  10. 出处:同章(text/06-p101-120.txt:130,搜「最愚蠢」)与(text/06-p101-120.txt:135,搜「一年前」)。

  11. 出处:同章(text/06-p101-120.txt:175,搜「托马斯·沃森」)。2010 年秋,穆罕默德开始与 IBM 合作。

  12. 出处:同章(text/06-p101-120.txt:217,搜「打印机后」)。万豪克担心风扇噪声让人随手关机。

  13. 出处:同章(text/06-p101-120.txt:249,搜「2,000 个小时」)。贾特利坚持后邮件问辛顿,辛顿回「没有,但我不知道这为什么行不通」。

  14. 出处:同章(text/06-p101-120.txt:263,搜「21%」)。不到一周训练出第一个网络;两周后 18%。

  15. 出处:同章(text/06-p101-120.txt:280,搜「53%」)。YouTube 找词任务,谷歌已有服务错误率 53%,贾特利降到 48%。

  16. 出处:同章(text/06-p101-120.txt:308,搜「噪声」)。新系统上线后消噪芯片过时;「谷歌的神经网络已经学会了如何处理噪声」。

  17. 出处:同章(text/06-p101-120.txt:163,搜「制造影响力」)。

  18. 出处:同章(text/06-p101-120.txt:286,搜「让人上瘾」)。

  19. 出处:同章(text/06-p101-120.txt:157,搜「转折点」)。作者判断:一位教授和两名研究生的成果超越了世界上最大的公司之一研发了十几年的系统。

  20. 出处:同章(text/06-p101-120.txt:86,搜「更短的时间」)与推荐序(text/01-p1-20.txt:282,搜「几十倍」)。余凯在推荐序中的对照:GPU 运行深度学习的效率是 CPU 的几十倍,但 GPU 本是为图形渲染设计——「无心插柳的结果」。