跳到主要内容

AlphaGo — 第 37 手,和它真正证明了什么

这一章讲三件事: 围棋为什么是「最后一个堡垒」(数字在哪摆着); AlphaGo 的训练配方——人类棋谱起步、自我对弈升级——以及第 37 手和第 78 手 这两手「万分之一」的对称;还有乌镇那场没有悬念的告别赛说明了什么。 这一章是全书公众影响的顶点:2 亿人围观的不是一场比赛,是一次对「机器能不能思考」的全民投票。

1. 顶层全景:为什么偏偏是围棋

2015 年 10 月底,Facebook 首席技术官斯科洛普夫向满屋记者宣布:Facebook 也在教神经网络下围棋, 深度学习能更快破解这个游戏1。几天后,杨立昆被记者问到 DeepMind 能否造出击败顶级围棋手的系统, 答:「不会。」还补了一句:「如果 DeepMind 击败了一名顶级围棋选手,有人会告诉我的。」 ——但是他错了。 几天后《自然》封面文章:AlphaGo 五比零完胜欧洲冠军樊麾2

围棋难在哪,原书给了可以背下来的对比数字:

国际象棋围棋
棋盘8×819×19 交叉点
每步选择约 35 种约 200 种
比喻模仿地面战斗模仿冷战——一处落子会在别处泛起涟漪3

国际象棋靠暴力枚举(把每种走法一路算到底)就够(1997 年「深蓝」胜卡斯帕罗夫);围棋每步 200 选、 连环几百步,合理时间内算不完——机器必须像职业棋手那样「看出」好棋, 而不是算出好棋。这就是它二十年被称作「最后的堡垒」的原因。

2. 主走查:第 37 手是怎么落下的

训练(赛前): 团队先向深度神经网络输入 3,000 万步人类职业棋手的具体下法, 让机器学会「职业棋手会怎么下」;然后让它自我对弈——一局接一局, 细看哪些下法最终导向赢棋。败给樊麾后的几个月里,它又下了几百万盘4

比赛(2016 年 3 月,首尔,五盘制): 赛前李世石放话 4:1 甚至 5:0 获胜5。 第一盘,机器赢了。第二盘,第 37 手:

局面:第 37 手前,棋盘右侧有一大片「谁的也不是」的空白
AlphaGo 落子:黑色棋子下在白棋侧下方——远离边线,孤军深入
人类反应:
九段棋手雷蒙(西方最高段位解说):「我真的不知道,这是一步好棋还是一步坏棋。」
联合解说加洛克:「我认为这是一个错误。」
李世石离开对局室去抽烟;回来后想了 15 分钟(每方只有两小时用时)
败者樊麾(已是 AlphaGo 的陪练):「这不是人类的下法,我从未见过有人下过这一手。」
4 个多小时后,李世石认输[^6]

事后复盘:AlphaGo 用数千万人类棋谱算出——这一手在人类棋谱中出现的概率:万分之一
也就是说:机器知道「人类不这么下」,再依据几百万盘自我对弈的胜负经验,
判定「虽然没人这么下,但它是对的」
西尔弗的总结:「它自己发现了这一点,通过它自己的内省过程。」[^7]

为什么这一手重要: 它不是「机器算得快」的证据(枚举根本算不完),而是 「机器对『好』的判断越出了人类经验——它在人类棋谱里学语言, 在自我对弈里超越了这门语言的母语者」。樊麾连说三遍的评语是「太漂亮了」6

对称的另一手: 第四盘,李世石下出第 78 手——挖穿机器盲区的一挖。 AlphaGo 为此重新计算,这一手在它那里的出现概率同样是万分之一: 「AlphaGo 认为没有人会走第 78 手。」它的胜率暴跌,坚持近 5 小时后认输7。 两个万分之一,一手属于机器,一手属于人类——这场 4:1 的比赛真正的比分。

3. 围棋之外:两群人的两种震动

棋手的震动: 樊麾输给机器后加入 DeepMind 当陪练,随后对人类棋手六连胜, 排名创新高——「与 AlphaGo 的相遇让他学到了一些新的下法」8。 李世石赛后说与机器对弈「重新点燃了我对围棋的热情……我已经进步了」, 接下来对人类棋手九连胜9。佛罗里达一位程序员把 37 手和 78 手分别纹在两条手臂上10

公众的震动: 超过 2 亿人观看——美国「超级碗」的两倍11。 一位中国记者在首尔捶着胸口说,赢棋那一刻他很高兴,现在「感到深深的绝望」; 韩国创业者吴英权的话被原书引作注脚:「对所有人类来说,这都是一个拐点。 这让我们意识到人工智能离我们很近,也意识到了它的危险性。」12 原书同时记下了另一面:比赛揭示了技术「将人类推向新高度」的方式—— 它没有消灭围棋,它把下围棋的人推得更高。

4. 乌镇:清空人类知识之后

一年后(2017 年 5 月),乌镇,AlphaGo 对世界排名第一的柯洁。赛前哈萨比斯透露了 真正的变化:新版本不再需要人类棋谱起步,完全靠自我对弈从零学起, 还顺带学会了国际象棋和将棋——「它清除了越来越多的人类知识」13。 柯洁的评语:「就像棋手里的神一样。」0:3,无悬念14。 新架构高效到可以装在一块谷歌 TPU 芯片上运行(第 07 章的那颗芯片)15

一场比赛同时是谷歌的商业动作:谷歌 2010 年退出中国,皮查伊三次访华、与柯洁在长城合影, 赛前估计已有 6,000 万中国人在网上看过首尔之战——围棋是重返中国的门票16。 两个月后,《新一代人工智能发展规划》发布(第 07 章)。

5. 作者的判断与证据

书里给了证据的: 樊麾 5:0 与首尔 4:1 的比分、每手的用时与现场反应、 两个万分之一的复盘数字、乌镇 0:3、观看人数。

作者的框架判断,要分开:

  • 章首引语「哈萨比斯推动 AlphaGo 就像奥本海默执行曼哈顿计划一样」是辛顿的原话, 原书转述:奥本海默「知道如何打动男人(以及女人)」,并能统筹庞大团队—— 这是对组织能力的评价,不是对技术本身的17;
  • 「人工智能的新运动在公众意识中爆发的时刻」——作者的定性;
  • 起源的偶然性值得记下:项目起点是哈萨比斯与布林闲聊围棋,布林说「我认为这是不可能的」, 哈萨比斯「那一刻下定决心要去实现它」18

6. 边界与局限

  • AlphaGo 是封闭游戏里的冠军:棋盘 19×19、规则完备、输赢分明、得分自动—— 原书在第 19 章会借机器人研究提醒:现实世界「没有人记分」; 马库斯在第 12 章的攻击正是抓这一点(「一个会下围棋的系统在任何其他情况下都毫无用处」);
  • 「内省」是西尔弗的修辞:原书没有(也无法)说明机器内部是否形成了人类意义上的 「理解」;我们自己也要小心,别把解说词当机制;
  • 第 78 手后 AlphaGo 修复了这个盲区吗?首尔之后团队改进了设计,乌镇版「免受崩溃影响」 ——但原书注明这是哈萨比斯的说法,未附第三方验证19

7. 可带走的

  1. 围棋难,因为「每步约 200 选 × 连环几百步」把暴力枚举堵死——机器必须改学「判断」;
  2. 配方 = 人类棋谱起步(3,000 万步)+ 自我对弈升级(数百万盘): 先学会人类的语言,再下出人类语言里没有的话;
  3. 两个万分之一是理解这场革命的最好意象:机器能下出人类概率万分之一的妙手, 也能被人类概率万分之一的手击穿——能力与盲区是同一件事的两面;
  4. 被击败的棋手变强了(樊麾六连胜、李世石九连胜):人机对抗的早期历史里, 「 AI 抬高人类」的证据先于「AI 取代人类」的证据;
  5. 乌镇版删除了人类知识——从「模仿人类」到「从零自 学」,这条路线通往第 12 章的通用人工智能之争;
  6. 技术事件的放大器是媒体与地缘:2 亿观众、人造卫星时刻、 谷歌的入场券——记得把「比赛」和「比赛的意义生产」分开看。

8. 原文地图

主题原书章原文位置
斯科洛普夫宣布、Facebook 围棋10 AlphaGo 的胜利text/11-p201-220.txt:435(搜「斯科洛普夫」)
杨立昆「不会」、他错了10 AlphaGo 的胜利text/12-p221-240.txt:63(搜「不会。」) · text/12-p221-240.txt:67(搜「有人会告诉我」)
围棋 19×19、200 种选择、冷战比喻10 AlphaGo 的胜利text/12-p221-240.txt:9(搜「19 乘 19」) · text/12-p221-240.txt:15(搜「200 个选择」) · text/12-p221-240.txt:12(搜「冷战」)
樊麾 5:0、自然封面10 AlphaGo 的胜利text/12-p221-240.txt:72(搜「封面故事」) · text/12-p221-240.txt:81(搜「五盘比赛」)
布林「不可能」、哈萨比斯下决心10 AlphaGo 的胜利text/12-p221-240.txt:94(搜「不可能的」)
奥本海默类比10 AlphaGo 的胜利text/12-p221-240.txt:97(搜「奥本海默」)
3,000 万步、自我对弈数百万盘10 AlphaGo 的胜利text/12-p221-240.txt:144(搜「3,000 万步」) · text/12-p221-240.txt:148(搜「几百万盘」)
2 亿人、超级碗两倍、李世石夸口10 AlphaGo 的胜利text/12-p221-240.txt:124(搜「2 亿人」) · text/12-p221-240.txt:128(搜「4∶1」)
第 37 手、雷蒙、15 分钟10 AlphaGo 的胜利text/12-p221-240.txt:199(搜「第 37 手」) · text/12-p221-240.txt:203(搜「一步好棋」) · text/12-p221-240.txt:209(搜「15 分钟」)
樊麾「不是人类的下法」、太漂亮了10 AlphaGo 的胜利text/12-p221-240.txt:223(搜「不是人类的下法」)
万分之一、内省10 AlphaGo 的胜利text/12-p221-240.txt:284(搜「万分之一」) · text/12-p221-240.txt:239(搜「内省」)
周记者、吴英权、拐点10 AlphaGo 的胜利text/12-p221-240.txt:248(搜「绝望」) · text/12-p221-240.txt:252(搜「拐点」)
第 78 手、必须重启、万分之一10 AlphaGo 的胜利text/12-p221-240.txt:268(搜「第 77 手」) · text/12-p221-240.txt:278(搜「重启」) · text/12-p221-240.txt:283(搜「没有人会走第 78 手」)
樊麾六连胜、李世石进步、纹身10 AlphaGo 的胜利text/12-p221-240.txt:219(搜「六连胜」) · text/12-p221-240.txt:289(搜「我已经进步」) · text/12-p221-240.txt:305(搜「文身」)
乌镇、清除人类知识、将棋14 谷歌的傲慢text/14-p261-280.txt:293(搜「乌镇」) · text/15-p281-300.txt:59(搜「人类知识」)
柯洁、棋手里的神、捻头发14 谷歌的傲慢text/15-p281-300.txt:78(搜「棋手里的神」) · text/15-p281-300.txt:76(搜「捻转」)
单 TPU、皮查伊三访华、6,000 万14 谷歌的傲慢text/14-p261-280.txt:325(搜「TPU」) · text/14-p261-280.txt:351(搜「三次访华」) · text/14-p261-280.txt:342(搜「6,000 万」)

Footnotes

  1. 出处:「10 神经网络的爆发:AlphaGo 的胜利」(text/11-p201-220.txt:435,搜「斯科洛普夫」)。2015-10-31,Facebook 总部记者会。

  2. 出处:同章(text/12-p221-240.txt:63,搜「不会。」)与(text/12-p221-240.txt:72,搜「封面故事」)。杨立昆补充:「有人会告诉我的。但是他错了。」《自然》2016 年 1 月刊登 5:0 胜樊麾(2015 年 10 月闭门比赛)。

  3. 出处:同章(text/12-p221-240.txt:9,搜「19 乘 19」)与(text/12-p221-240.txt:15,搜「200 个选择」)。国际象棋每步约 35 种。

  4. 出处:同章(text/12-p221-240.txt:144,搜「3,000 万步」)与(text/12-p221-240.txt:148,搜「几百万盘」)。原书:与自己对战,分析哪些下法成功。

  5. 出处:同章(text/12-p221-240.txt:128,搜「4∶1」)。李世石赛前称 4:1 甚至 5:0 获胜。

  6. 出处:同章(text/12-p221-240.txt:225,搜「太漂亮了」)。原书:他不停地重复这个词,三遍。

  7. 出处:同章(text/12-p221-240.txt:278,搜「重启」)、(text/12-p221-240.txt:283,搜「没有人会走第 78 手」)。胜率立即暴跌;哈萨比斯转述李世石私下的话。

  8. 出处:同章(text/12-p221-240.txt:216,搜「对战伙伴」)与(text/12-p221-240.txt:219,搜「六连胜」)。

  9. 出处:同章(text/12-p221-240.txt:289,搜「我已经进步」)。此后九场对人类顶尖棋手全胜。

  10. 出处:同章(text/12-p221-240.txt:305,搜「文身」)。乔迪·恩塞恩,45 岁程序员,37 手右臂、78 手左臂。

  11. 出处:同章(text/12-p221-240.txt:124,搜「2 亿人」)。超级碗的两倍。

  12. 出处:同章(text/12-p221-240.txt:252,搜「拐点」)与(text/12-p221-240.txt:248,搜「绝望」)。

  13. 出处:「14 谷歌的傲慢」(text/15-p281-300.txt:59,搜「人类知识」)。新版本不需分析职业玩家招式;可自学国际象棋与将棋。

  14. 出处:同章(text/15-p281-300.txt:78,搜「棋手里的神」)。三盘皆负;比赛三天里柯洁捻了 12 个多小时头发。

  15. 出处:「14 谷歌的傲慢」(text/14-p261-280.txt:325,搜「TPU」)。训练完成后可在单一芯片上运行。

  16. 出处:同章(text/14-p261-280.txt:342,搜「6,000 万」)与(text/14-p261-280.txt:351,搜「三次访华」)。2010 年谷歌撤出中国;比赛作为重返中国的尝试。

  17. 出处:「10 神经网络的爆发:AlphaGo 的胜利」(text/12-p221-240.txt:97,搜「奥本海默」)。辛顿原话:「他推动 AlphaGo 就像奥本海默执行曼哈顿计划一样。如果由其他任何人来执行,那么他们都不会让它推进得这么快、这么好。」

  18. 出处:同章(text/12-p221-240.txt:94,搜「不可能的」)与(text/12-p221-240.txt:95,搜「哈萨比斯下定决」)。

  19. 出处:「14 谷歌的傲慢」(text/14-p261-280.txt:317,搜「免受韩国那场比赛」)。哈萨比斯谈新架构缩小知识差距。