跳到主要内容

炒作与真金 — 4 万块 GPU、砍掉小数点的芯片,和一场误判了中国的推销

这一章讲三件事: 赢了比赛之后,一笔大钱是怎么在公司里逐级过关的(以及谁在挡); 算力怎么变成产品——从「每个句子翻译 10 秒」到「几毫秒」的那颗芯片; 以及宣传机器怎么起步:真进步、假预期和地缘误判搅在一起。 本章是「革命产业化」的部分:第 06 章买人,这一章买机器。

1. 买机器:4 万块 GPU 的过会记录

AlexNet 之后,谷歌内部最尴尬的事实是:赢得比赛的技术,在公司自己的数据中心里没有位置。 克里哲夫斯基到岗第一天,去电子商店买了台 GPU 机器放进走廊尽头的壁橱—— 公司数据中心的管理者认为「没有理由在数据中心里铺满 GPU 机器」1

2014 年春,迪恩找到人工智能主管詹南德雷亚,两人商量出的数字是 2 万块, 自己觉得太少,改成 4 万块——总价约 1.3 亿美元。谨慎的决策层当场拒绝; 申请转到即将去跳伞的尤斯塔斯手里,他理解这件事,再转给佩奇——批(签字放行)准2。 不到一个月,4 万块芯片夜以继日地训练神经网络。

这段过会记录值得原样记住: 技术判断(「GPU 才是对的硬件」)在公司内部 三次被组织常识(「数据中心不这么干」「玩游戏的东西」)挡住, 最后靠一个跳伞爱好者的个人判断力通关。原书借尤斯塔斯之口给了方法论: 「他们无法看到那些能改变格局的专业知识的交会点。」3

2. 主走查:一个句子怎么从 10 秒变成几毫秒

背景: 2014 年底,萨特斯基弗在 NIPS 展示了新的机器翻译:把英语句子变成一个 数学表示(向量——用一长串数给句子定位,意思相近的句子位置相近),再映射(一一对应地转换)成法语4。 效果惊艳但不可用:翻译一个 10 个单词的句子要 10 秒,放在互联网上没人会用5

与此同时,迪恩算了一笔账:安卓语音服务若覆盖全球 10 多亿部手机、 每部每天用 3 分钟,公司需要再建一倍的数据中心——每个数据中心造价数亿美元。 他告诉数据中心负责人:「我们需要另一个谷歌。」替代方案:自己造一块只为神经网络服务的芯片6

于是有了 TPU——张量(排成阵列的一组数)处理器。主走查(乘法例子为书内原载):

普通芯片(浮点运算):13.646 × 45.828 = 625.33…
TPU(整数运算): 13 × 45 = 585

神经网络有几十亿次这样的乘法,而每次结果差一点点并不影响
「这个词是狗还是猫」的判断 —— 精度可以卖
⟹ 砍掉小数点后,同样的电路面积每秒多做数万亿次运算[^7]

效果链:翻译系统在 TPU 上重跑
→ 2016-02:10 秒/句 → 几毫秒/句
→ 团队比迪恩的截止日期提前三个月完成
→ 2016 年美国劳动节后上线,首个语言对:中文-英文(两种语言差异最大、
深度学习改进最明显、也是世界最大两个经济体的语言对)
→ 质量上,BLEU 评分(翻译质量的行业通行分)旧系统不足 30 分、
四年只涨了 3 分;新系统一口气高出旧系统 7 分[^8]

为什么有效: 先补一个词:吞吐——单位时间能处理多少请求。神经网络是同一类乘法的海量重复——这是把「通用精度」换成 「专用吞吐量」的理想场景。旧翻译系统把句子切块、逐块翻译再拼回; 新系统是一个单一的学习任务,整句进、整句出,「突然之间,事情从不可理解变成了可以理解」 (旧系统负责人休斯语)7

边界在哪: 萨特斯基弗的研究原型「可以很好地处理普通词汇,但不能处理更大体量的词汇」, 上线的系统靠的是公司搜集的、比原型大 100 到 1,000 倍的数据重训8。 演示原型和量产系统之间,永远隔着数据工程。

3. 渗透:深度学习进了谷歌的每一层

批下来的 4 万块 GPU 迅速改变了全公司的技术路线:

产品深度学习做了什么
谷歌照片在海量图像中搜「狗」「海滩」
Gmail预测你下一个要打的词
广告系统(AdWords)预测用户会点什么——公司 560 亿美元年收入的大部分来自这里9
搜索2015 年上线 RankBrain,神经网络参与排序,上线即覆盖约 15% 的查询,预测点击比资深工程师还准10
自动驾驶「司机」项目(后拆分为 Waymo):克里哲夫斯基寒假与同事用数千张街景照片做出行人识别原型,方法随后铺满项目,他被称为「人工智能密语者」11
数据中心DeepMind 用《越狱》同款技术调控冷却系统,节省数亿美元——「补偿了收购 DeepMind 的成本」12

同一年,亚马逊把语音助手 Alexa 从手机搬上客厅茶几;每家巨头都造了自己的助手。 「人工智能」成了这十年的流行词——原书提醒:这是一锅「非常真实的技术进步、 毫无根据的炒作、疯狂的预测」的混合物,和 1958 年罗森布拉特的报纸标题(第 01 章) 是同一个配方13

对炒作,圈内的反应分裂成两派。一派要功劳:施米德胡贝反复抗议媒体英雄名单里没有他 (他的名字成了动词——「你一直都在施米德胡贝」);一派要降温: 克里哲夫斯基说**「深度学习不应该被称为人工智能」**——「我读研究生是为了研究曲线设置, 而不是人工智能」:这些技术已存在几十年,只是凑齐了数据和算力14。 而真正响亮的声音来自他的同学萨特斯基弗——2014 年 12 月,他在讲台上宣布: 「如果你有一个非常大的数据集和非常大的神经网络,那么成功是有保证的。」 辛顿在台下想:「只有萨特斯基弗才不受到质疑。」15 (这句话后来成了整个行业押注规模化的信条,它的极限在第 12 章的辩论里浮现。)

4. 傲慢的顶点:乌镇的推销

2017 年,谷歌董事长施密特在乌镇的围棋赛场边向中国科技界推销 TensorFlow ——谷歌开源的深度学习软件系统,DistBelief 的继任者16。 开源不是慈善:如果全行业都用谷歌的软件训练模型,谷歌就掌握了平台, 并顺势卖出算力(云计算,当年亚马逊云收入已超 174.5 亿美元)17。 他放话:这套软件可以重塑阿里巴巴、腾讯和百度——「如果使用 TensorFlow, 那么它们全都会发展得更好。」18

误判在哪: 中国不需要被启蒙。百度的吴恩达已经建起硅谷和北京两间实验室和巨型 GPU 集群(成千上万块芯片连成的一台大机器); 百度已有自己的 TensorFlow——PaddlePaddle;腾讯在做类似的事;前微软高管陆奇加入百度任 COO,直接和五座城市合作改造道路来适配自动驾驶汽车——「政府认为这是中国汽车产业 跨越式发展的机会」19。两个月后,中国国务院发布规划:2030 年成为世界人工智能领导者, 一个超过 1,500 亿美元的产业。两位参与规划的教授告诉《纽约时报》: AlphaGo 战胜李世石,是中国的「人造卫星时刻」20

施密特自己的事后总结,是本章最好的注脚:「我在演讲时就知道,中国人要来了。 当时我还不了解他们的一些项目有多高效……以后,我不会再误解了。」21

判断(我们的,不是书里的): 乌镇推销的错误不是傲慢,是时差—— 谷歌用 2010 年的记忆想象中国市场(2010 年它退出中国),而对手已经完成了第 04 章那场 「小团队+大数据」的补课。技术传播的速度超过了巨头更新世界地图的速度。 如果错,会错在: 如果中国公司的进步当时仍主要依赖开源软件的输入, 那「时差」的说法就高估了对手——原书对「中美技术差距到底多大」明确写了「这是存在争议的」22

5. 作者的判断与证据

书里给了证据的: GPU 审批链与金额;TPU 的整数运算设计与翻译延迟(从发问到出译文要等多久)对比; BLEU 分数;RankBrain 的 15%;AdWords 的 560 亿;国务院规划与 1,500 亿数字; 施密特的前后两句话。

作者的叙事判断,要分开: 「谷歌已经将这些钱赚回来了」(买 GPU 的钱)—— 这是作者基于广告收入规模的推断;「深度学习革命中最重要的大玩家已经在为竞争而努力了」 ——叙事框架,不是可以拿证据检验的说法。

6. 边界与局限

  • 原书没有解释 BLEU 评分怎么算,读者只能知道「+7 分很大」(四年才涨 3 分), 不知道每 1 分对应什么;我们如实转述对比关系,不硬解;
  • TPU 的架构细节(脉动阵列等)书里没有,「砍小数点」是原书给的唯一机制解释;
  • 中美 AI 实力对比,原书自身标注为「存在争议」,引用时别把陆奇的高调判断当共识 ——他需要为自己的公司讲这个故事。

7. 可带走的

  1. 技术采用的最大阻力常常在组织内部:4 万块 GPU 被拒过一次才获批; 「数据中心不这么干」差点误了整个公司;
  2. TPU 的思路是「精度换吞吐」:神经网络不需要每次乘法都精确, 整数运算让每秒多做数万亿次——专用芯片由此成为行业标准动作;
  3. 翻译质量的跃升 = 端到端(整句进、整句出,不再切块拼接)整句建模 × 数据量 × 专用芯片: 10 秒→毫秒不是算法又进步了,是硬件给了算法跑满的空间;
  4. 「更大的数据集 + 更大的网络 = 成功有保证」是这个时代的行业信条(萨特斯基弗语), 它解释了此后所有军备竞赛,它的失效条件到第 12 章再讲;
  5. 开源软件是平台战争:TensorFlow 的目标从来不是帮助对手,是让对手的模型长在谷歌的地基上;
  6. 对中国的判断:「人造卫星时刻」——一场围棋比赛的失利触发国家级规划, 技术事件的政治放大效应从此成为这个行业的常量;
  7. 记一组锚点:2014 年 4 万 GPU/1.3 亿美元;2016 年翻译上线;2017 年乌镇与国务院规划。

8. 原文地图

主题原书章原文位置
克里哲夫斯基壁橱 GPU08 炒作text/09-p161-180.txt:429(搜「电子商店」) · text/09-p161-180.txt:431(搜「壁橱」)
2 万改 4 万、1.3 亿、佩奇批准08 炒作text/10-p181-200.txt:23(搜「2 万个」) · text/10-p181-200.txt:32(搜「1.3 亿」)
尤斯塔斯方法论08 炒作text/09-p161-180.txt:452(搜「交会点」)
Waymo 密语者、容易摘到的果子08 炒作text/10-p181-200.txt:70(搜「人工智能密语者」) · text/10-p181-200.txt:73(搜「容易摘到的果」)
AdWords 560 亿、RankBrain 15%08 炒作text/10-p181-200.txt:95(搜「560 亿」) · text/10-p181-200.txt:108(搜「15%」)
DeepMind 冷却省钱08 炒作text/10-p181-200.txt:116(搜「冷却」)
Alexa、流行词、大杂烩08 炒作text/10-p181-200.txt:138(搜「Alexa」) · text/10-p181-200.txt:160(搜「大杂烩」)
施米德胡贝邀功、变成动词08 炒作text/10-p181-200.txt:168(搜「施米德胡贝」)
深度学习不该叫 AI、曲线设置08 炒作text/10-p181-200.txt:208(搜「不应该被称为人工智能」) · text/10-p181-200.txt:211(搜「曲线设置」)
seq2seq 词嵌入、哈佛耶鲁08 炒作text/10-p181-200.txt:264(搜「词嵌入」) · text/10-p181-200.txt:272(搜「哈佛」)
成功有保证、只有萨特斯基弗08 炒作text/10-p181-200.txt:314(搜「成功是有保证的」) · text/10-p181-200.txt:320(搜「不受到质疑」)
需要另一个谷歌、两倍数据中心08 炒作text/10-p181-200.txt:332(搜「另一个谷歌」) · text/10-p181-200.txt:339(搜「两倍的数据中心」)
TPU 砍小数点、13×4508 炒作text/10-p181-200.txt:378(搜「张量」) · text/10-p181-200.txt:382(搜「13.646」)
BLEU 30 分、+7 分、10 秒08 炒作text/10-p181-200.txt:402(搜「BLEU」) · text/10-p181-200.txt:405(搜「7 分」) · text/10-p181-200.txt:416(搜「10 秒钟」)
提前三个月、劳动节、中英文08 炒作text/10-p181-200.txt:436(搜「三个月」) · text/10-p181-200.txt:432(搜「中英文」)
蒸馏、胶囊网络、玛丽女王 2 号08 炒作text/10-p181-200.txt:445(搜「蒸馏」) · text/10-p181-200.txt:453(搜「胶囊网络」) · text/10-p181-200.txt:458(搜「玛丽女王」)
TensorFlow 开源平台、云 174.5 亿14 谷歌的傲慢text/15-p281-300.txt:1(搜「TensorFlow」) · text/15-p281-300.txt:20(搜「174.5 亿」)
施密特推销、都会发展得更好14 谷歌的傲慢text/14-p261-280.txt:433(搜「智能时代」) · text/14-p261-280.txt:443(搜「发展得更好」)
中国人要来了14 谷歌的傲慢text/15-p281-300.txt:48(搜「中国人要来了」)
李飞飞、PaddlePaddle、1500 亿14 谷歌的傲慢text/15-p281-300.txt:31(搜「李飞飞」) · text/15-p281-300.txt:114(搜「PaddlePaddle」) · text/15-p281-300.txt:87(搜「1,500 亿美元」)
人造卫星时刻14 谷歌的傲慢text/15-p281-300.txt:91(搜「人造卫星时刻」)
陆奇 5 座城市、数据生产资料14 谷歌的傲慢text/15-p281-300.txt:141(搜「5 座城市」) · text/15-p281-300.txt:157(搜「生产资料」)
争议标注14 谷歌的傲慢text/15-p281-300.txt:175(搜「存在争议」)

Footnotes

  1. 出处:「08 炒作」(text/09-p161-180.txt:431,搜「壁橱」)。原话:「管理公司数据中心的人认为,没有理由在数据中心里铺满 GPU 机器。」

  2. 出处:同章(text/10-p181-200.txt:23,搜「2 万个」)与(text/10-p181-200.txt:32,搜「1.3 亿」)。最初建议 2 万块被认为太少;决策层拒绝后经尤斯塔斯转佩奇批准。

  3. 出处:「08 炒作」(text/09-p161-180.txt:452,搜「交会点」)。尤斯塔斯谈大多数人「以特定的方式、特定的视角和特定的历史来看待特定的问题」。

  4. 出处:同章(text/10-p181-200.txt:264,搜「词嵌入」)与(text/10-p181-200.txt:282,搜「翻译系统是这一想法的延伸」)。向量地图有成千上万个维度;「哈佛」向量接近「耶鲁」「大学」「常春藤」。

  5. 出处:同章(text/10-p181-200.txt:416,搜「10 秒钟」)。翻译 10 个单词的句子需要 10 秒,「在开放的互联网上永远都行不通」。

  6. 出处:同章(text/10-p181-200.txt:332,搜「另一个谷歌」)与(text/10-p181-200.txt:339,搜「两倍的数据中心」)。10 多亿部手机、每天各用 3 分钟;每个数据中心造价数亿美元。

  7. 出处:同章(text/10-p181-200.txt:412,搜「有人把灯打开了」)。休斯是旧系统团队负责人。

  8. 出处:同章(text/10-p181-200.txt:388,搜「普通词汇」)与(text/10-p181-200.txt:394,搜「100 到」)。数据集比萨特斯基弗所用大 100 到 1,000 倍。

  9. 出处:同章(text/10-p181-200.txt:95,搜「560 亿」)。AdWords 是公司年收入绝大部分的来源;深度学习预测用户点击。

  10. 出处:同章(text/10-p181-200.txt:106,搜「RankBrain」)与(text/10-p181-200.txt:108,搜「15%」)。2015 年推出;辛格哈尔随后因性骚扰指控离开,詹南德雷亚接任搜索主管(text/10-p181-200.txt:110,搜「詹南德雷亚」)。

  11. 出处:同章(text/10-p181-200.txt:70,搜「人工智能密语者」)与(text/10-p181-200.txt:73,搜「容易摘到的果」)。

  12. 出处:同章(text/10-p181-200.txt:116,搜「冷却」)。控制风扇、窗口、冷却器的开关时机,「节省了数亿美元」。

  13. 出处:同章(text/10-p181-200.txt:160,搜「大杂烩」)。非常真实的进步+毫无根据的炒作+疯狂的预测+担忧;「这就像是弗兰克·罗森布拉特和感知机的历史重现」。

  14. 出处:同章(text/10-p181-200.txt:168,搜「施米德胡贝」)与(text/10-p181-200.txt:208,搜「不应该被称为人工智能」)。克里哲夫斯基:「我读研究生是为了研究曲线设置,而不是人工智能。」

  15. 出处:同章(text/10-p181-200.txt:314,搜「成功是有保证的」)与(text/10-p181-200.txt:320,搜「不受到质疑」)。2014 年 12 月 NIPS 蒙特利尔;「我们用最小的创新,获得了最大的结果」亦出自该演讲。

  16. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:1,搜「TensorFlow」)。DistBelief 的取代者,迪恩团队设计,开源共享。

  17. 出处:同章(text/15-p281-300.txt:20,搜「174.5 亿」)。亚马逊云服务 2017 年收入;谷歌 90% 以上收入仍来自广告。

  18. 出处:「14 谷歌的傲慢」(text/14-p261-280.txt:443,搜「发展得更好」)。施密特乌镇发言。

  19. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:114,搜「PaddlePaddle」)与(text/15-p281-300.txt:141,搜「5 座城市」)。吴恩达自 2014 年起管百度实验室;「深度学习研究所」见 text/14-p261-280.txt:409,搜「深度学习研究所」。

  20. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:87,搜「1,500 亿美元」)与(text/15-p281-300.txt:91,搜「人造卫星时刻」)。2030 年世界领导者的规划。

  21. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:48,搜「中国人要来了」)。

  22. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:175,搜「存在争议」)。原书原话:「即使中国的大公司和大学目前在技术上落后于它们的美国对手——这是存在争议的——差距也没有那么重要。」