跳到主要内容

通读笔记(人工智能简史 第3版,尼克,2026)

通读时间:2026-08-27。读了全部三个前言与 16 个正文章;参考文献(21-fm)与人名对照(22-fm)是导航章,跳过。

作者与文风(写拆解必须交代)

  • 作者尼克:乌镇智库创始人;内容提要证实「曾师从图灵奖得主、强化学习奠基人安德鲁·巴托」(text/01-fm.txt:11);第3版前言自述与萨顿是同门(text/02-ch03.txt:10-14)。写过多篇博客(达特茅斯/神经网络两章前身即其博客),还有《哲学评书》《理解图灵》。
  • 行文带强烈个人观点与八卦(第2版前言自称「夹枪带棒」,text/03-ch02.txt:7-8)。作者自己申明:第1版前言说「八卦的历史,读者自然喜欢」(text/04-ch01.txt:5-7)。史实与轶事常混讲:明斯基冷冻遗体是「江湖传说」(05-ch01:493);罗森布拉特溺亡「很多人认为他是自杀」(09-ch05:119);拿破仑与土耳其人对局是「好事者把棋谱记录在案」(11-ch07:24);维纳妻子造谣「现在看玛格丽特是有意造谣」(09-ch05:64)。拆解要点破哪些是考据、哪些是段子。
  • 作者自造词:「尼克定律」(摩尔+库米放缓的统一刻画,19-ch15:128-129,标 Zhang,2022)、「O点/遗忘点」(碰到兰道尔极限的时刻,19-ch15:134-136,321-325)、「老派实效主义」(paleo-pragmatism,15-ch11:491)、「想啥来啥/吃啥补啥」(符号派/神经网络派的昵称,09-ch05:10-12)。自造词必须点明是谁造的、是否公认。
  • 三分法:逻辑主义(规则派)、连接主义(统计派/深度学习派)、自然主义(20-ch16:8-14)——作者自己的分类,与常见的「规则/神经网络/行为主义」三分不同。

各章要点(行号=段落号,短语可直接搜)

前言(02-ch03 第3版 / 03-ch02 第2版 / 04-ch01 第1版)

  • 第3版动机:大语言模型(主要)+强化学习(次要);NLP 四阶段划分:规则40年/统计20年/深度学习7年/LLM准备5年(02-ch03:19-24)。
  • 所罗门诺夫归纳作为 LLM 第一性原理:伊利亚 2023-08-14 伯克利演讲(02-ch03:35-38)。
  • 第3版新增第9、11、14章;删去图灵附录(移入《理解图灵》)(02-ch03:48-50)。
  • 第1版前言:两种史写法(以人/以事),作者偏以人为本;听了近100小时巴贝奇研究所口述历史录音(04-ch01:24-28);第10章(计算理论)可跳过(04-ch01:50-53)。

第1章 达特茅斯会议(05-ch01)

  • 1955 前戏:西部联合大会「学习机讨论会」,皮茨主持,预示逻辑 vs 神经网络(05-ch01:9-18)。
  • 六君子:麦卡锡(克门尼带回的4博士之一)、明斯基、塞弗里奇、香农、纽厄尔、司马贺。预算:申请13500美元/批7500,年薪<8000≈2025年10万美元(05-ch01:258-262)。
  • 「人工智能」一词来源悬案:伍德华 vs 麦卡锡1955建议书;英国早用「机器智能」(05-ch01:172-187)。纽厄尔司马贺主张「复杂信息处理」(05-ch01:189-190)。
  • 建议书7个领域(05-ch01:251-256)。
  • 所罗门诺夫:卡尔纳普影响;柯尔莫哥洛夫复杂性;无限点→库兹韦尔奇点;2022年后被认作 LLM 数学基础(05-ch01:273-286)。
  • 逻辑理论家 vs 王浩:1958 夏 IBM 704 上 9 分钟证《数学原理》一阶逻辑 120/150 条;王浩鄙视逻辑理论家;DP→DPLL(05-ch01:303-314)。
  • 1956 IRE 信息论年会:米勒《魔力数字七》、乔姆斯基《语言描述的三种模型》(乔姆斯基分层起源);经费来自空军海军(05-ch01:356-371)。
  • 刺猬与狐狸:纽厄尔司马贺=刺猬,麦卡锡明斯基=狐狸(05-ch01:340-348)。
  • ARPA 资助史:利克莱德→海尔梅尔砍预算→温斯顿「三个圈」;ARPA vs NSF 风格(05-ch01:402-443)。
  • 预言失败史:司马贺1957(10年内下棋胜人)/1965(20年)、1968麦卡锡-列维赌局输钱、1997深蓝;明斯基1968(30年)、1989(20年解决NLP);「悟性=人的解释能力极限」(05-ch01:446-466)。

第2章 自动定理证明(06-ch02)

  • 数学哲学三派:逻辑主义(罗素)、形式主义(希尔伯特)、直觉主义;哥德尔判死希尔伯特纲领(06-ch02:19-26)。
  • 戴维斯1954第一个定理证明程序(JOHNNIAC),普利斯博格算术(只有加法,可判定但超指数);DP过程→DPLL(06-ch02:48-84)。
  • 逻辑理论家被克里尼退稿(《符号逻辑杂志》);王浩「杀鸡焉用宰牛刀」(06-ch02:100-117)。
  • 王浩 1958-59:9分钟证120/150条;AE 形式→库克 NP完全性(1971《定理证明的复杂性》);「王浩的定理证明研究孕育了整个理论计算机科学」(06-ch02:137-165)。
  • 普拉维茨:父亲手编程序进机器码(2K 40位内存);合一(unification)概念(06-ch02:119-125)。
  • 阿兰·罗宾逊 1965 归结原理(JACM,审稿拖延);合一+归结+包含(subsumption)三合一;沃思(盲人数学家)阿贡小组;支持集 SoS;马库恩 Otter(C语言)/EQP,1996-10-10 证罗宾斯猜想(486跑13天,RS/6000验7天)(06-ch02:199-300)。
  • ANS 谓词答问(格林1969):~Husband(x,Mary)|ANS(x) → ANS(John)(06-ch02:302-327)。
  • 路线斗争:定理证明vs问题解决、过程vs陈述、逻辑vs心理;费根鲍姆批罗宾逊;研究中心转向欧洲→逻辑程序→五代机(06-ch02:329-365)。
  • 项重写=希尔伯特形式主义精髓(分配律 a(b+c)→ab+ac);Knuth-Bendix;superposition(06-ch02:241-259)。
  • 吴文俊:1977大年初一突破;几何定理证明;王浩1978通信;1997埃尔布朗奖(06-ch02:367-434)。
  • 沃斯认为马库恩接近弗雷德金一等奖,芒福德「现在不行,一百年都够呛」(06-ch02:494-503)。
  • 四色定理1976、200TB布尔勾股数证明2016、有限单群分类(100人/50年/500期刊/1万页)(06-ch02:507-550)。
  • 术语漂移:机器定理证明→自动定理证明→自动演绎→自动推理(06-ch02:631-643)。
  • 专家系统术语=定理证明重新包装:知识库=公理集合,规则库=支持集;知识图谱基础=描述逻辑(一阶逻辑子集)(06-ch02:622-627)。
  • 阿贡小组2006被裁(同年辛顿深度学习论文);马库恩53岁失业,2011急症去世(06-ch02:609-617)。
  • 现状:o1(2024夏)/R1(2025-01-20)用RL提升推理;Lean(2013莫拉)复兴,AlphaProof、陶哲轩、巴扎德(06-ch02:660-683)。

第3章 专家系统到知识图谱(07-ch03)

  • DENDRAL:费根鲍姆+莱德伯格(质谱仪/火星生命)+翟若适(化学);第一个专家系统;「翟算法」署名之争(07-ch03:43-66)。
  • MYCIN:布坎南/肖特莱福,细菌感染诊断,准确率69% vs 专科医生80%,优于非专科;从未临床使用;EMYCIN(07-ch03:101-123)。
  • 纽厄尔认为 MYCIN 才是专家系统鼻祖(产生式规则/不精确推理)(07-ch03:112-116)。
  • XCON(DEC,1980-86处理8万订单;省钱的估计从每年4000万到几百万美元不等,是谜)(07-ch03:126-137)。
  • 福吉 Rete 算法/OPS;专家系统→规则引擎(改名重卖);FICO(07-ch03:137-144)。
  • 知识表示:一阶逻辑无本体;描述逻辑 ABox/TBox/RBox,例子:Physicist(Newton)、Lawfirm⊆Company⊆…⊆Thing、hasFather◦hasFather⊆hasGrandfather(07-ch03:154-203)。
  • 心理学来源:米勒《魔力数字七》;「金丝雀会飞吗」比「鸟会飞吗」反应慢(认知经济性);WordNet 上下位(07-ch03:204-213)。
  • 明斯基框架=类型→面向对象;语义网络=框架等价;索瓦概念图/知识汤;格与多重继承(07-ch03:216-238)。
  • 雷纳特:AM→Eurisko→Cyc(=encyclopedia);知识原则;「智能就是一千万条规则」;1984预言15年后每台计算机预装Cyc;25万条规则=350人年;临界点遁词(07-ch03:240-302)。
  • 语义网:伯纳斯-李;2006 AAAI 诺维格发难;「大杂烩,理论上不严谨,实践中不可用」(07-ch03:304-345)。
  • 谷歌知识图谱:2010收购Metaweb(Freebase,4000万实体 vs 维基1000万文章);2016捐给维基数据;沃森底层=YAGO+DBpedia(07-ch03:347-367)。
  • 知识vs推理=狭义vs广义:知识=公理,公理越多推理步骤越少(07-ch03:376-384)。
  • GNN 融合:链接预测、图谱补齐(刘知远2021)(07-ch03:386-391)。

第4章 第五代计算机(08-ch04)

  • 1978通产省委托元冈达;1981报告89页,6种体系结构;LISP vs Prolog:渕一博选Prolog(覆盖面广+非美国造)(08-ch04:15-65)。
  • 逻辑程序=定理证明「歪打没正着」的副产品;科瓦尔斯基 SL归结(1971);科莫饶尔+卢梭 Prolog(卢梭妻子起名);Horn子句;沃伦抽象机WAM;「算法=逻辑+控制」(08-ch04:76-129)。
  • Datalog=关系数据库+递归(08-ch04:131-136)。
  • 预算:十年4.5亿美元,总投入预期8.5-10亿;对照IBM 1982年一年研发经费15亿美元(08-ch04:159-164)。
  • 四十浪人(全部<35岁)(08-ch04:170-180)。
  • 并发Prolog:夏皮若、上田和纪GHC→KL1;Thinking Machines CM-1(1994关;希利斯→Metaweb→Freebase→谷歌,John Giannandrea)(08-ch04:205-244)。
  • 美国反应:MCC(1982,每年7500万美元,600职位,英曼,选址奥斯汀,布莱索,免反垄断)(08-ch04:297-316);DARPA三个项目:无人车、飞行员辅助、战场管理(08-ch04:318-320)。
  • 英国阿尔维计划(2.5亿英镑,1987放弃;奥克利自扇耳光1991);ESPRIT(15亿ECU);法国密特朗电子百科全书(佩珀特);德国DFKI 1988(08-ch04:322-359)。
  • 结局:1981会议录280页 vs 1988三大卷1300页,「大杂烩」;休伊特批评:用逻辑程序解已解决的问题;逻辑编程与并行性不可调和(08-ch04:362-376)。
  • 日本经济4%→1%;主要负责人无留学背景,精神支柱=民族主义(08-ch04:378-390)。
  • 2016日本下一代AI战略:福岛邦彦(CNN源头)、甘利俊一壮年时钱都投了五代机(08-ch04:398-411)。

第5章 神经网络简史(09-ch05)

  • 「想啥来啥」vs「吃啥补啥」(作者昵称两派)(09-ch05:8-14)。
  • 1943 M-P 文章:参考文献只有3本(卡尔纳普/希尔伯特-阿克曼/数学原理);第3节证明神经网络+纸带等价于图灵机(参考文献指南,09-ch05:675-689)。
  • 维纳-麦卡洛克决裂(妻子造谣),皮茨受创,1969年46岁去世;Hebb 1949学习规则(09-ch05:48-87)。
  • 罗森布拉特1957感知机(IBM 704),线性可分收敛定理;1962书;1969明斯基佩珀特《感知机》证XOR不行;两人是布朗克斯科学高中校友(1945/1946届)互相嫉妒(09-ch05:88-146)。
  • 1971罗森布拉特43岁生日溺亡;「神经网络的漫长寒冬」近20年;1988再版删攻击句+手写纪念(09-ch05:117-164)。
  • 维德罗 Adaline(躲过派系斗争)(09-ch05:148-155)。
  • 复兴:霍普菲尔德(凝聚态物理,巴克利奖1969,1982网络,1984模拟电路实现);玻尔兹曼机(谢诺夫斯基+辛顿1983-86);费曼-霍普菲尔德-米德课程1983-85《费曼计算机科学讲义》(09-ch05:192-286)。
  • 2024诺贝尔物理奖(霍普菲尔德+辛顿)=Science4AI;化学奖AlphaFold=AI4Science(09-ch05:361-381)。
  • 连接主义:PDP两卷,第3章分布式表示(词向量源头);平克批评过去式;乔姆斯基vs诺维格(优雅vs两条腿走路)(09-ch05:290-359)。
  • KA叠加定理:希尔伯特第十三问题;柯尔莫哥洛夫1957+阿诺德;赫克-尼尔森1987(3页,三层网络实现KA);HNC信用卡反欺诈公司2002年8.1亿美元卖Fair Isaac;赛本科1988 sigmoid;通用逼近定理;波焦反对(不平滑/维数灾难);KAN 2024(泰格马克/刘子鸣,计算在边上)(09-ch05:383-511)。
  • 深度学习:辛顿2006《科学》(逐层预训练);ILSVRC 2012 SuperVision错误率26%→<15%(10万张训练/15万张测试——注意原文是1000万/15万);微软邓力2011语音,2012拉希德天津演示;DNNresearch被谷歌几千万美元收购(3人);加拿大三人组;2018图灵奖;2015 Nature综述(09-ch05:513-599)。
  • 脑100万亿-1000万亿突触;GPU/TPU(孔祥重脉动阵列)(09-ch05:563-573)。
  • CNN谱系:胡贝尔-威瑟尔感受野1959→福岛邦彦新认知机1980→张伟1988平移不变→杨立昆(不认「卷积神经网络」这个名字);LSTM 1997;word2vec 2013(米科洛夫不满伊利亚不引用);Seq2Seq;Transformer 2017(8作者,自/交叉注意力,decoder-only);ViT;伊利亚NeurIPS 2024演讲(09-ch05:600-673)。
  • 施密特休伯的怨气:反向传播优先权(林纳因马1970硕士论文、沃波斯1974)(09-ch05:736-747)。

第6章 向自然学习(10-ch06)

  • 两条生物学脉络:神经网络(麦卡洛克-皮茨)与细胞自动机(冯诺伊曼)→GA→RL(10-ch06:9-12)。
  • 霍兰德:密歇根,伯克斯(ENIAC/冯诺伊曼助手),第一个计算机科学博士;费舍《自然选择的遗传理论》;收到达特茅斯邀请但夏季要教课没去(10-ch06:14-105)。
  • neat vs scruffy(麦卡锡干净/明斯基邋遢)(10-ch06:67-74)。
  • GA 结构五步(随机初始群体→适应度→选精英→配对→小概率变异)(10-ch06:118-133)。
  • 遗传编程:寇扎1987;程序也是数据;1999 Beowulf 1000节点;1995布尔电路优化;「发明机器」;LLM也是「把数据压缩成程序」(10-ch06:142-184)。
  • RL 谱系:阿比卜(维纳最后一个学生)→克劳普夫(空军,享乐主义神经元)→巴托(博士后)→萨顿(第一个博士生);「可适应系统」实验室(10-ch06:206-294)。
  • MDP形式化:S_t,A_t,R_t+1,π;动态规划(贝尔曼1957)是另一理论源(10-ch06:302-321)。
  • 图灵1948 P型机(快乐/痛苦刺激)=奖励/惩罚;明斯基1954博士论文也是RL(他晚年顾左右而言他)(10-ch06:343-353)。
  • 探索vs利用,ε;「享乐主义」→「奖励假设」→「Reward is enough」;巴托萨顿2024图灵奖(10-ch06:358-341)。
  • AlphaGo使RL成显学;DeepMind核心=萨顿学生(席尔瓦、黄士杰);2017阿尔伯塔联合实验室(10-ch06:385-407)。
  • 萨顿《苦涩的教训》2019:通用方法+算力胜过专用方法;→Scaling Law;摩尔定律放缓→Scaling Law必放缓(10-ch06:424-430)。
  • 《经验时代》2025(萨顿+席尔瓦):模拟时代(AlphaZero)→人类数据时代(ChatGPT)→经验时代(AlphaProof)(10-ch06:432-438)。
  • 应用:芯片布局(Mirhoseini 2021 Nature,<6小时,预训练48小时,2022/2024更正)、AlphaFold(CASP13 25/43,CASP14 88/97,98.5%人类蛋白质)(10-ch06:466-497)。
  • 《性作为算法》(2016 CACM):mixability;瓦连特PAC;蔡汀元生物学(10-ch06:499-545)。

第7章 计算机下棋(11-ch07)

  • 土耳其人1769(肯佩伦),藏人施伦伯杰1827被两个孩子揭穿,1854焚毁;拿破仑1809输棋摔子(11-ch07:15-36)。
  • 图灵1947第一款下棋程序(没机时);普林茨1951两步将死;斯特雷奇1951跳棋(图灵1952赢了一局);塞缪尔1956自学习跳棋(11-ch07:43-56)。
  • Chinook vs 廷斯利:1992人赢,1994廷斯利胰腺癌去世;2007《科学》证明跳棋先手和棋(11-ch07:58-70)。
  • 冯诺伊曼-摩根斯顿1944 Minimax;香农1950《计算机下棋程序》(评估函数);「图灵来自火星,香农来自金星」;两人从未聊密码(11-ch07:73-89)。
  • α-β剪枝:麦卡锡提出,NSS实现(JOHNNIAC);同样资源搜索深度大一倍(11-ch07:96-106)。
  • 伯恩斯坦1958(IBM 704,每步8分钟);Kotok-McCarthy 1962;1966-67美苏电报赛3:1;格林布拉特MacHack VI(16KB,1400分,ARPANET最早网游;志愿者克柔克);德雷弗斯1966输给MacHack(11-ch07:108-135)。
  • KAISSA 1971(斯帕斯基一负一和;1972《共青团真理报》众包挑战);1974 IFIP首届世界计算机象棋锦标赛(KAISSA胜CHESS)(11-ch07:143-171)。
  • Belle(汤普森,UNIX/B作者)1982在肯尼迪机场被海关扣(600美元罚款赎回)(11-ch07:173-183)。
  • 许峰雄:ChipTest→深思(1989弗雷德金二等奖,>2400分)→IBM深蓝:1996年4:2卡斯帕罗夫赢;1997深蓝胜;「像上帝下的」;深蓝团队不认为机器有智能(11-ch07:189-241)。
  • 围棋:组合爆炸→蒙特卡洛(正方形内贴边画圆扔沙粒);AlphaGo=RL最早的工业级应用;AlphaGo Zero(零人类知识)→AlphaZero(4小时学会人类百年棋类技能)(11-ch07:243-273)。
  • 图灵1948报告结尾已定义模仿游戏(用下棋考);1950年改用语言(11-ch07:275-280)。

第8章 自然语言处理(12-ch08)

  • 乔治敦-IBM实验1953-54:6条语法规则,250词,有机化学,打孔卡,俄文罗马化(12-ch08:15-27)。
  • ALPAC 1966《语言与机器》:MT比人工慢、不准、贵两倍;停资助;首创「计算语言学」(12-ch08:35-42)。
  • 乔姆斯基:文法谱系3型=有限自动机/2型=下压自动机/1型=线性有界/0型=图灵机;哈里斯学生;哈佛Fellow;第一篇论文发在JSL;6周拿宾大博士;LSLT近千页→《句法结构》小册子(哈利推荐);「合并」=LISP cons;批评斯金纳;compelled vs incited;1967反战被捕与梅勒同监;成名研究靠军方经费(12-ch08:44-218)。
  • ELIZA(魏森鲍姆1966):词库匹配+脚本回复;秘书上瘾;BBN副总没打句号以为机器傲慢;完整心理医生对话(12-ch08:220-324)。
  • PARRY(科尔比1972偏执病人);1972 ICCC 经ARPANET ELIZA扮医生对PARRY扮病人(12-ch08:326-414)。
  • SHRDLU(维诺格拉德1970):积木世界;Micro-Planner;ETAOINSHRDLU键盘;整合NLU+规划+知识表示+图形学;1971首届「计算机与思维」奖;后转HCI,学生布林佩奇创办谷歌;德雷弗斯塞尔每周午餐(12-ch08:423-590)。
  • 统计派回来:1988 IBM CANDIDE(加拿大议会记录);贾里尼克「每开除一名语言学家,语音识别性能提高一点」;寇克(RISC图灵奖,CYK的C);欧赫2004谷歌(12-ch08:591-625)。
  • 问答系统三件套:问题理解/知识查询/答案生成;沃森2011 Jeopardy:知识库4TB,90台Power 750=720核2880线程,16TB内存,≈当年第500名超算的一半,300万美元(2017年同算力20万,2025年<2万);沃森医疗2022卖给私募(12-ch08:627-681)。
  • GNMT 2016(vs PBMT误差降约60%,基本单位从短语变句子);Transformer 2017;BERT(双向/Encoder-only)vs GPT(单向/NTP);GPT-3 2020反超;ChatGPT 2022-11-30;LLaMA 2023开源;o1 2024-09不公开;DeepSeek R1 2025-01-20开源+技术报告(12-ch08:683-756)。
  • NLP进步速度:40年→20年→<10年→5年→按月计(12-ch08:742-746)。
  • 莱莫因LaMDA事件2022-06(被谷歌开除);FLI暂停公开信2023-03(3万人签名)(12-ch08:758-782)。
  • 瑞迪1976预言10年内2万美元语音识别,实际35年;黑板系统→改名多Agent系统(12-ch08:784-801)。
  • 「一个人工智能问题一旦被解决,就不再是人工智能问题」(12-ch08:803-805)。
  • 2011 MIT「不会思维的机器」研讨会:乔姆斯基vs诺维格,「两种文化」;解释的层级(维特根斯坦梯子);人类不懂力学就会造弹弓(12-ch08:817-839)。

第9章 语言等于思维吗(13-ch09)

  • 乔姆斯基2023-03-08《ChatGPT的虚假承诺》(NYT):「John is too stubborn to talk to」例句被ChatGPT答对,「打了脸」;曼宁推文「乔老爷老了」(13-ch09:17-27)。
  • 柏拉图之问(刺激贫乏)vs 奥威尔之问(13-ch09:34-38)。
  • 核心:「思维即语言」从没变过;洪堡「思维的形成器官」「有限手段的无限运用」;合并=原始递归机制(13-ch09:55-89)。
  • 弗里德里希《人类语言的大脑之源》:绒顶柽柳猴能识别正则语言(3型)不能识别短语结构(2型)(13-ch09:93-103)。
  • 「如果承认语言等于思维,实际上承认了图灵机可以思维」(13-ch09:103)。
  • 语言比视听更接近人性;妻子卡罗尔:脑膜炎儿童靠触觉补偿语言(13-ch09:108-119)。
  • Colorless green ideas sleep furiously=「幻觉」或创造力(13-ch09:121-124)。
  • 经验主义者把学习看作记忆;承认丘奇-图灵论题的人把学习看作压缩(13-ch09:135-137)。
  • 塔南鲍姆等2023「分离语言与思维」:《自然》版「语言主要是交流工具而非思维」;形式能力vs功能能力≈乔姆斯基I-语言/E-语言,「小塔并没有提出什么新东西」(13-ch09:141-171)。
  • 图灵1948「人作为机器」:建议研究不太需要与外部世界交互的功能(游戏/语言学/翻译/密码学/数学)(13-ch09:174-184)。
  • 工程影响:多模态以语言为基座;火星绿色停车标志一条prompt适应(13-ch09:186-207)。
  • 罗素:「如今的自然语言处理不再研究语言,我认为这是非常不幸的」(13-ch09:216-219)。
  • 辛顿vs乔姆斯基:先天结构vs数据驱动;但「语言=思维?」这个大是大非问题上有共识(13-ch09:233-240)。

第10章 人是机器吗(14-ch10)

  • 「人是机器吗」→「人是计算机器吗」→「人是数字计算机吗」;冯诺伊曼:神经系统本质是数字的;费曼:世界是数字的(14-ch10:31-46)。
  • 图灵机三部件;丘奇-图灵论题=观察不是定理,更像物理定律;「图灵机」一词是丘奇1937年书评里起的;λ记号来自排版事故(14-ch10:52-135)。
  • UTM→存储程序→冯诺伊曼架构(真正原创是随机寻址)(14-ch10:110-121)。
  • 高德纳:计算机科学是「非自然科学」,50人里1个有CS思维(14-ch10:126-135)。
  • 复杂性:冒泡n²;王浩悖论(1是小数,n小则n+1小→所有自然数都是小数);多项式=小,指数=大;最坏vs平均(快速排序/单纯形)(14-ch10:137-163)。
  • NP完全:库克1971 SAT(受王浩启发);卡普归约;P?=NP在斯梅尔表和克雷七题都排第三;「证明定理比验证证明难,写书比读书难」(14-ch10:165-181)。
  • 洪加威相似性原则:靠谱的计算装置互相模拟成本是多项式;强/扩展丘奇-图灵论题;工作假设;北大学数学系1960,王浩推荐给库克(14-ch10:190-216)。
  • 超计算:寇普兰;oracle;作者自己的判据:「在复杂性层面不服从相似性原则」也算超计算;「类似永动机」(14-ch10:218-239)。
  • BSS实数模型:单位时间实数四则运算;一阶实数可判定(=塔尔斯基定理的计算体现);线性规划在BSS上复杂度未知(斯梅尔称CS最重要理论问题);贾德:三层以上网络学习在图灵机上NP完全(14-ch10:250-289)。
  • 量子计算:朗道尔1961(不可逆计算耗能);本内特可逆;弗雷德金门;多依奇1985通用量子图灵机+丘奇-图灵-多依奇原理;RSA 1024位朴素筛法约2^512次运算;肖尔1994;2001 IBM 7量子位分解15=3×5;BQP;怀疑者列文、古德瑞克(14-ch10:291-364)。
  • 马尔三层:计算层面=丘奇-图灵论题,算法层面=相似性原则(14-ch10:381-384)。
  • 瓦连特三层:超级普适性/普适性/数学结论(14-ch10:405-420)。
  • 「如果我们认可丘奇-图灵论题和相似性原则,那么人就是图灵机」(14-ch10:422-425)。
  • 生命游戏(康韦);布鲁克斯「难以构想的新数学」;彭罗斯两个跳跃(图灵机→量子计算→人);「超级智能是个模糊不清的伪概念」(14-ch10:446-493)。
  • computer原指人类计算者(多为女性)(14-ch10:499-501)。

第11章 什么是学习(15-ch11)

  • 麦卡锡1956《图灵机定义的逆函数》(5页):给输出猜输入;「在所有可能的英文文章中按某种顺序寻找一个猜想的证明」;(m,r)在今天就是一个大语言模型(15-ch11:60-77)。
  • 达特茅斯对话:所罗门诺夫「给定序列初始段预测后续」;麦卡锡反问「这不就是外插吗」;次日麦卡锡改口:老房子里的计算机正打印序列,你敢打赌下一个字符吗;=「在下一个字符上下注」=next token(15-ch11:78-88,179)。
  • 博雷尔1913无限猴子(哈姆雷特概率约5.02×10^-29);博尔赫斯巴比伦图书馆(15-ch11:93-106)。
  • 图灵1948「主动性」:枚举所有程序,学习可归约到此,但不停机(15-ch11:108-113)。
  • 所罗门诺夫备忘录1956-08-14;明斯基2011:「这篇文章让我从神经网络转向符号」——讽刺:这次转向使神经网络停滞20年,而最终实现所罗门诺夫归纳的恰是神经网络(15-ch11:116-124)。
  • 1964《信息与控制》两部分;Oxbridge一人公司拿政府经费(15-ch11:135-151)。
  • 定义:找编码长度最短的图灵机建模序列;(1,1,1,…)复杂度O(log n);(3,5,7)→奇数程序vs素数程序(素数描述复杂度更大)(15-ch11:153-167)。
  • 监督学习可归约为自监督:把标签并进序列预测下一项(15-ch11:169-178)。
  • 学习=压缩;参数量与token量的关系;不停机→近似;贝叶斯先验;神经网络=通用近似器=实现所罗门诺夫归纳的候选机制(15-ch11:179-188)。
  • 乔姆斯基先天内生文法本质=所罗门诺夫先验概率分布;理性/经验之分在丘奇-图灵论题下只是修辞(15-ch11:190-198)。
  • 柯尔莫哥洛夫1965创刊号《信息的量化定义的三种方式》7页;KC(x)=min{l(p):U(p)=x);不变性定理(差一个常量)=柯尔莫哥洛夫论题;1968引用所罗门诺夫,苏联名声更响;SKC复杂性(15-ch11:204-265)。
  • 蔡汀:贝里悖论;LISP;无趣/不可归约/随机的整数;证KC不可计算(「不完全性」);「可解释是偶然的」;1974电话哥德尔遇雪取消;维也纳「比哥德尔还哥德尔!」;元生物学(15-ch11:277-348)。
  • 列文1973两页:定理1 NP完全(库克-列文定理);定理2通用搜索L-search,解函数的逆=麦卡锡问题;Kt(x)=min{l(p)+log(time(p))};可计算;倾向P=NP;2012高德纳奖(15-ch11:350-382)。
  • 本内特1988逻辑深度:近乎最短程序的运行时间=解压时间;P vs PSPACE未知;大模型对应:压缩时间=训练,KC=参数量,逻辑深度=最短推断时间;inference应译「推断」区别reasoning「推理」(15-ch11:384-409)。
  • 李明&维特涅「圣经」;李明2024 McDowell奖(信息距离,Bennett等1993 STOC);胡特尔AIXI(2000,RL+所罗门诺夫),Hutter Prize 2006;BERT vs GPT:所罗门诺夫归纳提供「BERT不可能比GPT更强」的证据(没有数学证明);Transformer只是实现NTP的一种手段(15-ch11:412-449)。
  • 伊利亚2023-08-14赛蒙斯研究所演讲:GPT数学依据=所罗门诺夫归纳;自称2015年独立想出(15-ch11:453-457,596-598)。
  • 「Language Modeling is Compression」(2023);LLM无损压缩远胜哈夫曼变种;次优压缩仍是无损,不是有损(15-ch11:459-471)。
  • 哲学:所罗门诺夫归纳=皮尔士实效主义的精确版(「老派实效主义」);波普尔证伪、库恩革命都是特例(革命=模型KC大变);奥卡姆剃刀=置信度随程序长度指数衰减;伊比鸠鲁无差别原则;休谟归纳问题的建设性框架(15-ch11:473-531)。
  • 结论:「图灵机的求逆就是通用的学习」;「压缩是人的本性」(亚里士多德梗);「适者生存」→「最压者生存」;「我压缩,故我在」(15-ch11:533-560)。
  • 三人独立发明过程的类比:能量守恒(迈尔/焦耳/赫尔姆霍兹1842-47)(15-ch11:561-568)。

第12章 哲学家和人工智能(16-ch12)

  • 德雷弗斯:1964兰德《炼金术与人工智能》(老板扣稿9个月);《计算机不能做什么》→1992《计算机仍然不能做什么》(MIT出版社);食堂躲他;终身教职风波(维斯纳干预;想雇演员扮DARPA官员);1986被邀请回MIT讲「为什么AI从业者应该读《存在与时间》」;2008「为什么海德格尔派AI失败了」;框架问题;胡塞尔=知识表示之说被作者驳(顶层概念=Java Object/DBpedia Thing)(16-ch12:39-182)。
  • 批评两句总结:「都是哲学家玩剩下的」+「人能做的计算机做不了」;1966输给MacHack后说「赢我不算赢」;佩珀特维特根斯坦体笔记:1.5计算机不能下棋,1.5.1德雷弗斯也不能下棋(16-ch12:92-115)。
  • 飞机论证:机翼不会扇,「造飞机不需要模仿鸟类」(16-ch12:161-165)。
  • 塞尔:中文屋1980《行为与脑科学》;源自图灵测试;系统回应;眼镜/人工耳蜗/飞机的内化阶梯;「植物是很慢的动物」(丹尼特)+作者加「植物是很大的动物」;意向性;强弱AI只有量的渐变;手册若过图灵测试本身就是机器翻译神器(16-ch12:184-265)。
  • 普特南:1960《心和机器》定义计算主义/功能主义,80年代又变批判者;1981缸中脑(营养液+超级计算机);图灵指称测试(照片测试);底线:图灵测试=语言,缸中脑=神经末梢(16-ch12:267-326)。
  • 丹尼特:AI提出问题本身即进步;一个把AI当用户,一个把自己当AI用户(16-ch12:317-326)。
  • 埃德尔曼(生物学家):AI「太过综合而不够分析」;亚里士多德没数过夫人牙齿;飞机不需要懂鸟(16-ch12:358-370)。
  • 彭罗斯看不起塞尔但喜欢其结论(16-ch12:348-356)。
  • 「整个人工智能就是个大的假想实验,只不过哲学家用纸和笔」(16-ch12:399-402)。

第13章 生死(17-ch13)

  • 苏格拉底死前一日与学生的对话(《斐多篇》);尼克与苏格拉底的假想对话:断臂→假肢→换心→换头→记忆体(海马体/前额叶)→人造记忆体;「所有的学习,都是记忆」;安乐死(比利时三医生+一心理医生);21克灵魂(1907麦克道高尔,作者注明是玩笑);永生只能解决「给人无限时间就能解决」的问题;超计算机(hypercomputer)问题永生解决不了(17-ch13:50-188)。

第14章 教科书(18-ch14)

  • 尼尔森五本书映射学科变迁:1965《学习机》(神经网络)→1971(符号)→1980《人工智能原理》(只字未提机器学习)→1987《逻辑基础》→1998《新综合》→未完成的ML书稿(两章RL);「从机器学习起,到机器学习终」(18-ch14:8-49)。
  • 温斯顿1977/1992;瑞奇1983/1991/2010(第3版倒数第2章是Prolog——MCC/五代机印迹);查尼亚克&麦克德莫特1985(查尼亚克2019出深度学习教材);金斯伯格1993(谓词逻辑vs一阶逻辑的用法混乱);罗素诺维格AIMA:1500多所学校采用,诺维格教过16万学生;1100多页(比瑞奇厚一倍多);约600页传统+<200概率+220深度学习与RL+40哲学未来;第1版1995几乎无神经网络;第4版2020加DL/NLP-DL/MCTS章节(AlphaGo影响);只字不提语义网(诺维格与伯纳斯-李不睦)(18-ch14:52-160)。
  • 重要进展进教科书需3-5年;物理对照:费曼讲义1500页、哈里德-瑞思尼克12版(1960-2021)、萨缪尔森经济学19版(1948-2021)(18-ch14:133-148)。
  • AI教科书缺第一性原理(计算理论);EE背景从业者不知道丘奇-图灵论题;「计算理性」↔可计算性,「有界优化」↔计算复杂性(18-ch14:170-184)。
  • 《人工智能手册》(费根鲍姆科恩,3卷+第4卷,2000多页)只在D2节用4页回顾神经网络(18-ch14:186-198)。
  • 马萨诸塞大学全体教授联授AI课,作者赶上了(18-ch14:200-212)。
  • 教科书使人遗忘贡献者(欧几里得;NP完全性大家从加雷约翰逊的书学的,不从库克1971)(18-ch14:219-229)。

第15章 智能的进化(19-ch15)

  • 埃尔库拉诺-乌泽尔「大脑汤」:人脑860亿神经元(皮层160亿);大象2570亿但98%在小脑,皮层56亿;人脑能耗占全身25%;烹饪是关键(19-ch15:9-39)。
  • 莫里斯《西方将主宰多久》:能耗测文明;西方领先除公元6-18世纪中叶;杜彻斯内批定义(西方含中东?);李约瑟难题的重新表述(19-ch15:43-70)。
  • 文明测度尺度:神经元(十万年)→能耗(万年)→印刷出版(千年)→算力(几十年);全社会算力=设备数×单机能力,两条指数曲线叠加(19-ch15:79-104)。
  • 摩尔1965每年一倍→1975两年一倍→2024约4年;P=fCV²;邓纳德缩放(每代频率+40%)2006年起失效→多核;库米定律1.57年→3-4年;「尼克定律」(作者自造)(19-ch15:114-129)。
  • 兰道尔极限与O点:2018年研究距兰道尔极限约6个数量级(≈原始摩尔定律20-30年);库米原估2050;重新拟合O点在2080年后;2050-2080极缓(19-ch15:134-141)。
  • Scaling Law=摩尔+库米的自然结果,O点失效;scale out vs scale up;并行加法加速比n/ln n;2030年美国算力能耗或增2-4倍(Aschenbrenner 2024);SMR小型模块化反应堆(19-ch15:142-159)。
  • AI两次高潮:80年代(专家系统+五代机)、21世纪;「每一次高潮都是旧哲学思想的技术再包装,每一次衰败都源自承诺不能兑现」(19-ch15:172-178,244-246)。
  • 超级智能:博斯特罗姆2014;赫拉利「神人」(作者毒评「托儿」);古德1960s智能爆炸/极致智能;强弱AI;功能整合之问;多明戈斯终极算法5类(漏了RL);基因编辑伦理(1%还是49%)(19-ch15:181-268)。
  • 维纳「确认我们给机器设定的目的确实是我们想要的」;阿西莫夫三定律(AlphaGo赢了李世石算伤害吗);罗素价值观对齐(19-ch15:290-297)。
  • FLI公开信2023-03(本吉奥/罗素/马斯克/沃兹尼亚克签,辛顿没签——「暂停行不通」);核武器vs AI:「核武器不过毁灭人类,人工智能会生成新的物种」(19-ch15:299-315)。
  • 本内特1982:耗能的是擦除不是测量;博尔赫斯「只有一件事要紧,那就是遗忘」→O点=遗忘点;「不知道是奇点先来还是O点先来?也许O点先来是更人道的」(19-ch15:317-331)。

第16章 总结(20-ch16)

  • 三分法:逻辑主义/连接主义/自然主义;反对「行为主义」标签(机器人学核心困难是机械与材料工程)(20-ch16:8-26)。
  • 规则派=计划经济/第三人称全知/还原论;统计派=自由市场/第一人称/涌现论(20-ch16:28-37)。
  • 明斯基vs罗森布拉特≈马赫vs玻尔兹曼(20-ch16:38-41)。
  • 「所谓深度学习不过是神经网络的层数多一些而已……所有基于神经网络的模型都是宽的而不是深的;定理证明是深的,很难并行化。也恰是因此,定理证明可以解释,而神经网络不可解释」(20-ch16:41-44)。
  • 三派融合:深度强化学习;RL做定理证明;「人工智能的核心问题正在被归约到几个理论(计算理论和学习理论)问题」(20-ch16:62-67)。
  • 三张谱系图:逻辑主义(定理证明→知识图谱)、连接主义(神经网络→深度学习)、自然主义(细胞自动机→强化学习)(20-ch16:69-75)。

与书架可连的锚(②类)

  • 《这就是ChatGPT》(what-is-chatgpt-doing):NTP、温度、Transformer 机制——第7/8/10/11章可连。
  • Sutton & Barto《强化学习》(reinforcement-learning-sutton-barto):第6章 MDP/Q-learning 可连书架。
  • AIMA(aima-4e):第8/14章教科书话题可连。
  • 深度学习革命(genius-makers):第5章辛顿收购战可互指。
  • nndl 系列:神经网络机制补充。