跳到主要内容

向自然学习 — 遗传算法、遗传编程与强化学习

这一章讲三件事: 向生物学借模型的两条具体路径——把"种群进化"当学习算法 (遗传算法、遗传编程),把"婴儿试错"当学习算法(强化学习);强化学习怎么从 空军资助的一个小实验室,熬成 AlphaGo 的核心算法;以及萨顿 2019 年那篇两页纸的 《苦涩的教训》——它是今天所有"大力出奇迹"叙事的理论祖先。 本章的主走查是一条会自己学会"哪个老虎机最好"的策略。

1. 这一章讲什么

原书开头给了一张谱系图:从生物学里找计算模型,学术上有两条传承的脉络——一条源自 麦卡洛克和皮茨的神经网络(第 04 章),另一条源自冯诺伊曼的细胞自动机,历经遗传算法、 遗传编程,其中一条支线最后演变成了今天的强化学习1

两条脉络共享一个赌注:智能不一定要被"编写",它可以被"进化/试错"出来。 差别在单位:遗传算法进化的单位是解(一组参数),强化学习进化的单位是策略 (在什么处境做什么动作)。

2. 顶层全景

1948 图灵《智能机器》:P 型机只接受"快乐/痛苦"刺激而学习

1962-75 霍兰德:遗传算法(费舍的遗传选择 + 染色体交叉变异)

1987 寇扎:遗传编程(程序本身也是数据,也能被进化)
↓ ↓
温吞发展(常被拒稿:性能不如 70-80年代 巴托-萨顿(马萨诸塞大学):
简单搜索算法) 奖励假设 → 强化学习成形
↓ ↓
2016 AlphaGo:强化学习最早的工业级应用 ← 两条线在此交叉

2019 《苦涩的教训》:通用方法+算力 > 专用知识

2025 《经验时代》:模拟时代 → 人类数据时代 → 经验时代(AlphaProof)

图说:左列是"进化算法"一脉,右列是"强化学习"一脉,2016 年汇合。
注意起点:两条线的思想源头都可以追到图灵 1948 年那份内部报告。

3. 核心原理

3.1 遗传算法:把进化论写成循环

遗传算法解决的问题是:搜索空间太大、没有现成公式可解时,让一群候选解自己 "繁殖"出更好的解。 霍兰德的灵感来自统计学家费舍的《自然选择的遗传理论》—— 孟德尔的遗传学加达尔文的选择。原书点破其直觉:"进化和遗传是族群学习的过程, 机器学习可以此为模型"2

算法五步(原书原文结构)3:

(1) 随机生成初始群体
(2) 主循环(停机条件:迭代次数,或适应度达标):
a. 执行策略,计算当前群体中所有个体的适应度
b. 从当前群体中选择精英作为下一代的父母
c. 将选出的精英父母配对(交叉:子代各取父母一部分)
d. 以极小概率将子代变异
e. 将子代个体添加到新群体

"适应度"就是给每个候选解打的分,"交叉"就是两个好解各取一半拼成新解, "变异"就是随机改动一小处防止全体挤在同一个山头。 所谓"优胜劣汰"的算法含义, 全在这五步里。

3.2 遗传编程:程序也是数据

霍兰德的学生寇扎 1987 年把进化的对象从"参数"升级成"程序":种群是一群程序, 按运行结果的好坏排序,交叉就是把两段表现好的程序互相嫁接,变异就是对程序做微小 调整——程序本身也是数据,自然也可以修改4

它的高光与局限各记一笔。高光:1995 年用遗传编程做布尔电路的优化(在无数电路里挑出最快的)取得成功。

1999 年寇扎搭了 1000 个节点的集群(这套攒机器的技术叫 Beowulf, 是 Hadoop 与 Spark 的先驱)5。局限:投稿多次被拒,理由是"遗传编程的性能常常 还不如一些简单的搜索算法"——原书替它辩护了一句:若没有算力的大幅提升, "眼下红得发紫的各种深度学习算法也无法实用"6。这个辩护值得收藏: 判断一个算法"不行"之前,先问是原理不行,还是这个年代的算力配不上它。

寇扎有个口号:遗传编程是"发明机器",有了它就不需要其他人工智能。原书的回应很妙: 当下大语言模型"在概念上就是把数据压缩成程序,从这个意义上,就是'发明机器'"7—— 这句是通往第 10 章(学习=压缩)的第一座桥。

3.3 强化学习:从婴儿到 Agent

强化学习解决的问题是:没有标准答案可对的学习。 有老师陪练的学习(行话叫监督学习),每道题都配着正确答案;而婴儿学走路没有人给他写下"这一步重心错了 0.3 米"——他只有摔疼了 和没摔疼。原书用巴托-萨顿的话说,他们关心的是"更原始但也更抽象的可适应性"8

技术谱系原书挖得很深,三个名字各记一笔:资助人克劳普夫(美国空军,写过《享乐主义的 神经元》,他要求课题组收下刚毕业的本科生萨顿,由此成就了巴托-萨顿这对师徒); 巴托把实验室命名为"可适应系统"——故意与名声不佳的"神经网络"保持距离; 1975 年之后的美国资助机构已鲜有长期计划,这支小小的队伍靠一个空军项目结题报告 (题目就叫"Goal-Seeking")立下了整个领域的公理9

形式化骨架是马尔可夫(下一步只取决于当前这一步、不看更早历史的这类问题)决策过程:Agent(学习主体)与环境互动——在时刻 t, 环境处于状态 S_t,Agent 采取动作 A_t,环境回馈奖励 R_t+1 并转入新状态 S_t+1; Agent 的策略 π 就是在每个状态下选每个动作的概率表;学习 = 根据经验调整策略, 使长期总奖励最大10

另一个理论源头是贝尔曼 1957 年的动态规划(把"未来每一步的最好收益"从终点 倒推回起点)。原书记了一个动人的细节:巴托当年让研究生分工研读贝尔曼的《动态规划》, 数学好的学生不明所以——"如果强化学习就是动态规划,那还有啥意思?" 三十年后,当强化学习被用来下围棋时,当年的学生才体会到初衷11理论的种子与它的季节,经常隔着一代人。

3.4 奖励假设:一个领域的一条公理

每个成熟领域都有一句压缩 everything 的公理,强化学习的是奖励假设: 学习系统想要最大化的,就是环境给它的那种反馈——后来更流行的说法是萨顿的 "Reward is enough"(奖励就够了)12

它的思想源头是图灵 1948 年的内部报告:图灵定义了一种"P 型机"—— 只接受"快乐"和"痛苦"两种刺激、其余全靠自己折腾的学习机器, 这实际上就是奖励与惩罚;巴托和萨顿的经典教材引用的唯一一篇图灵文献就是它13。 还有一笔有趣的旧账:明斯基 1954 年的博士论文做的就是强化学习—— 他晚年被人问起时"顾左右而言他"14符号派的旗手,起点在对手的阵地里。

3.5 主走查:一条策略学会挑老虎机

探索-利用两难是强化学习最日常的形态:去常去的馆子(利用),还是试试新开的 那家(探索)?原书给的对照是人生:"大部分时间在苦干(利用),很少时间可以探索 '诗和远方'"15。把它压成最小实验——多臂老虎机:

场景:10 台老虎机,每台吐钱的概率不同但未知。每次拉一台,拿一次回报。
目标:总回报最大。

策略(ε-greedy,以小概率 ε 探索;以下数值全部为演示编的):
设 ε = 0.1(每 10 次里约 1 次随机探索)

初始:每台机器的估值 V(k)=0,被拉次数 n(k)=0

第 1~10 步(把每台都拉一遍,拿初始印象):
拉第 3 台得了 1(吐钱),V(3)=1;其余台得 0,V=0
第 11 步起,每一步:
- 扔骰子:若落在 0.1 的探索侧 → 随机拉一台
第 17 步恰好随机拉了第 7 台,得 1 → V(7) 从 0 升到 1
- 否则利用:拉估值最高的台(此刻是第 3 台与第 7 台并列)
第 18 步拉第 3 台得 0 → V(3) 更新为 (1×2+0)/3 ≈ 0.67
(估值 = 平均回报;每拉一次,分母加一)

200 步后的典型形态(演示数字):
第 7 台(真实概率 0.8)被拉 150 次,估值稳定在 0.78 附近
第 3 台(真实概率 0.5)被拉 30 次,估值 0.5 附近
其余 8 台合计被拉 20 次——探索的代价被摊得极薄

图说:ε 小 → 稳定但可能抱错大腿(第 3 台开局走运就会一直被宠);
ε 大 → 探得全但收益薄。整个强化学习的调参,相当一部分在拧这一个数。

16

为什么这个两难是本质的? 原书给了算法侧的解释:遗传算法和强化学习有一个共同点 ——效果要等多步以后才能显现,这是与监督学习的主要不同;这就需要访问尽可能多的 状态,效率自然受损,于是要蒙特卡洛模拟来减少状态空间(所有可能处境的总集)里的搜索,状态空间太大时再请 神经网络来压缩表示17记住最后这句:"神经网络成了强化学习的工具"—— 两年后(2016)这个组合有了名字:深度强化学习,AlphaGo 是它的第一场加冕。

3.6 苦涩的教训与 Scaling Law

2019 年,萨顿发表两页纸短文《The Bitter Lesson》(苦涩的教训),结论一句话: 长期来看,通用方法总可以战胜专用方法——所谓专用,就是注入人类理解和知识的做法; 以通用算法(如强化学习/搜索)为基础,辅以不断增长的算力,智能自然会提升18

这条结论的隐含前提是摩尔定律式的算力增长;基于它,工程师圈有了 Scaling Law (缩放定律):智能会随算力和数据投入的加大而自然增长。但摩尔定律的增长是放缓的, Scaling Law 必然也会放缓19——这句原书判语,是通往第 12 章"O 点"的伏笔。

2025 年初,萨顿和弟子席尔瓦又合写《Welcome to the Era of Experience》,把学习的 进化分三个阶段:模拟时代(AlphaZero,封闭环境自我博弈生成数据)→ 人类数据时代(ChatGPT,但高质量人类数据几乎用尽)→ 经验时代 (AlphaProof 发现了人没有发现的证明方法,迫使人们重新思考奖励函数怎么设)20"人类高质量训练数据将被用尽"——这就是为什么全行业突然都在谈强化学习。21

3.7 应用与反照:芯片、蛋白质与"性作为算法"

强化学习的工业化应用,原书挑了两个硬案例:谷歌 2021 年发表于《自然》的芯片布局 方法——深度强化学习自动生成的芯片布局在功耗、性能、面积上优于或等同人工/EDA, 耗时不到 6 小时(预训练 48 小时);此文因数据问题在 2022、2024 两度被更正, 但现在各种芯片设计软件都已引入强化学习22。AlphaFold 更广为人知: CASP13(2018)预测 43 种蛋白质中 25 种的精确结构;CASP14(2020)97 个目标对 88 个; 2021 年宣布预测了 98.5% 的人类蛋白质结构23

理论上,原书用一篇引起轰动的文章《性作为算法》(2016)反照整章:有性繁殖并不比 无性繁殖更像优化算法,它优化的不是个体最优,而是种群混合程度(mixability); 对照之下,遗传算法像有性繁殖,而强化学习更像无性繁殖24。 这一节还收留了全章的方法论批评:遗传算法、深度学习、强化学习都缺乏计算理论的 基础——"它们都不需要解释……只要能查看输出结果就够了"25这个"缺理论"的洞,第 10 章的所罗门诺夫归纳会来填。

4. 作者的判断与证据

史实层:霍兰德的师承与达特茅斯邀请(他因夏季要教课没去,自称重大遗憾)、 寇扎的拒稿史、克劳普夫的资助安排、巴托-萨顿 2024 年图灵奖、AlphaFold 的 CASP 战绩, 均有口述与文献支撑。原书此章最硬的独家材料是资助链的考据:没有克劳普夫那纸 "必须收下萨顿"的条件,强化学习的历史可能要改写9

作者观点层(要分开):

  • 作者的师承立场毫不掩饰:他直接预言"巴托和萨顿有希望得诺贝尔生理学或医学奖" (因为多巴胺神经元被证明在执行强化学习)26——这是预测,不是事实;
  • 对《苦涩的教训》的态度是双面的:一面承认它是 Scaling Law 的思想源头, 一面立刻补上"摩尔定律放缓,Scaling Law 必然放缓"19——先立后破;
  • 对"错失浪潮的人改提世界模型(在机器内部重建物理环境)等说辞"的讥讽(第 3 版前言),呼应本章末尾 的立场:真实世界可能需要强化学习来探索,而不是建模型27

原书自己注明存疑处:芯片布局论文的数据质疑与两次更正,原书照录并保留判断 ("但无论如何……都已引入强化学习")22;"Hutter Prize 奖励最好的无损压缩" 与本章关系在第 10 章才收紧。

5. 边界与局限

  • 本章不含强化学习的技术细节:Q-learning(1989,沃科金斯的剑桥博士论文)原书 只在参考文献里点了一笔;要看算法请配我们书架的 Sutton & Barto《强化学习》。
  • **"强化学习包含了全部人工智能"**是《人工智能:现代方法》作者的话,原书引时 加了限定"这不无道理……像动态规划一样,是没办法的办法"28——引用这句名言时 要连限定一起引。
  • AlphaGo 的机制细节(策略网络、价值网络、蒙特卡洛树搜索)原书留给第 7 章, 我们的下一章接住。
  • 原书把 ε 叫作学习率:在标准强化学习教材里,ε-greedy 中的 ε 管的是 探索比例,通常译作探索率;"学习率"一般留给步长参数(补充:不在书里,来自通用知识)。 本书沿用原书叙事时,读者记住机制即可,不必纠结这个叫法。

6. 可带走的

  1. 从生物学借模型有两条线:进化解(遗传算法)与试错策略(强化学习); 前者进化的单位是参数,后者是"在什么处境做什么动作";
  2. 遗传算法五步可以压缩成一句:打分、选优、杂交、小概率变异、循环; "优胜劣汰"的算法含义就这么朴素;
  3. 判一个算法不行之前,先问是不是算力还没配得上——遗传编程 1987 年的"性能不行" 与深度学习 1986 年的"性能不行",是同一个误会;
  4. 强化学习的公理是奖励假设:没有标准答案时,把"想要什么"定义成奖励, 学习就是最大化它;图灵 1948 年的 P 型机是它的零号原型;
  5. 探索-利用两难不可消除,只能定比例:ε 的手感(多敢试新)是这个领域 最日常的调参;
  6. 理论与季节隔一代人:贝尔曼 1957 年的动态规划,三十年后才在围棋上兑现; 巴托让研究生读贝尔曼这件事,是"基础研究怎么投资"的最好寓言;
  7. 《苦涩的教训》是 Scaling Law 的思想源头,也是它的软肋:通用方法+算力 成立的前提是算力持续指数增长——第 12 章会看到这个前提的到期日;
  8. 人类数据用尽,是强化学习重回舞台中央的行业理由(《经验时代》三阶段);
  9. 这条脉络的根本短板是"缺理论":输出有效但不可解释、无第一性原理—— 这个洞在第 10 章将由所罗门诺夫归纳来补。

7. 原文地图

主题原书章原文位置
两条生物学脉络第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:10(搜「脉络」)
图灵 P 型机(快乐/痛苦)第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:346(搜「定义了可学习的机器」) · text/10-ch06.txt:298(搜「奖励」)
霍兰德师承与费舍启发第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:33(搜「伯克斯」) · text/10-ch06.txt:7(搜「费舍」) · text/10-ch06.txt:105(搜「族群学习」)
达特茅斯邀请但没去第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:86(搜「邀请」)
neat 与 scruffy第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:69(搜「干净」)
遗传算法五步第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:118(搜「种群」) · text/10-ch06.txt:122(搜「主循环」)
遗传编程:程序也是数据第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:11(搜「遗传编程」) · text/10-ch06.txt:154(搜「程序本身也是数据」)
Beowulf 集群、布尔电路优化第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:165(搜「Beowulf」) · text/10-ch06.txt:175(搜「布尔电路优化」)
拒稿理由与算力辩护第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:169(搜「被拒」) · text/10-ch06.txt:171(搜「算力的大幅提升」)
发明机器与 LLM第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:179(搜「发明机器」) · text/10-ch06.txt:183(搜「压缩成程序」)
克劳普夫、巴托、萨顿谱系第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:272(搜「克劳普夫」) · text/10-ch06.txt:278(搜「萨顿」) · text/10-ch06.txt:284(搜「可适应系统」)
婴儿与监督学习对照第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:297(搜「婴儿」)
MDP 形式化第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:302(搜「马尔可夫决策过程」)
贝尔曼动态规划与三十年第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:312(搜「动态规划」) · text/10-ch06.txt:317(搜「三十年」)
奖励假设、Reward is enough第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:328(搜「Goal-Seeking」) · text/10-ch06.txt:337(搜「奖励假设」) · text/10-ch06.txt:339(搜「Reward is enough」)
明斯基 1954 博士论文是 RL第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:352(搜「1954年的博士论文」)
探索与利用、ε第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:358(搜「抬头看路」) · text/10-ch06.txt:358(搜「探索」)
多步显现、蒙特卡洛、神经网络压缩第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:370(搜「多步以后」) · text/10-ch06.txt:374(搜「蒙特卡洛」) · text/10-ch06.txt:183(搜「压缩」)
内在动机与多巴胺第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:378(搜「内在动机」) · text/10-ch06.txt:379(搜「多巴胺」)
AlphaGo 与 DeepMind 谱系第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:386(搜「AlphaGo」) · text/10-ch06.txt:398(搜「席尔瓦」)
苦涩的教训与 Scaling Law第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:424(搜「The Bitter Lesson」) · text/10-ch06.txt:429(搜「缩放定律」) · text/10-ch06.txt:430(搜「放缓」)
经验时代三阶段第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:432(搜「Welcome to the Era」) · text/10-ch06.txt:435(搜「人类数据时代」)
数据用尽、目光投向强化学习第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:421(搜「用尽」)
"强化学习包含了全部AI"第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:419(搜「encompass」) · text/10-ch06.txt:420(搜「没办法的办法」)
芯片布局应用与更正第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:479(搜「芯片布局」) · text/10-ch06.txt:483(搜「修正」)
AlphaFold CASP 数字第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:486(搜「AlphaFold」) · text/10-ch06.txt:492(搜「98.5%」)
性作为算法、mixability第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:502(搜「性作为算法」) · text/10-ch06.txt:517(搜「混合程度」)
缺计算理论基础第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:526(搜「计算理论的基础」)
诺奖预测(作者观点)第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:455(搜「有希望得诺贝尔」)
强化学习像无性繁殖第6章 向自然学习:从遗传算法到强化学习text/10-ch06.txt:510(搜「无性繁殖」)

Footnotes

  1. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 10 段(text/10-ch06.txt:10,搜「脉络」)。

  2. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 7 段(text/10-ch06.txt:7,搜「费舍」)与第 105 段(搜「族群学习」)。

  3. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 118-133 段(text/10-ch06.txt:118,搜「种群」)、第 120 段(搜「主循环」)。五步为原文列举结构的转写,非整段引用。

  4. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 11 段(text/10-ch06.txt:11,搜「遗传编程」)与第 153 段(搜「程序本身也是数据」)。

  5. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 165 段(text/10-ch06.txt:165,搜「Beowulf」)与第 175 段(搜「布尔电路优化」)。

  6. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 169 段(text/10-ch06.txt:169,搜「被拒」)与第 171 段(搜「算力的大幅提升」)。

  7. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 179 段(text/10-ch06.txt:179,搜「发明机器」)与第 183 段(搜「压缩成程序」)。

  8. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 297 段(text/10-ch06.txt:297,搜「婴儿」)。

  9. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 272 段(text/10-ch06.txt:272,搜「克劳普夫」)与第 277 段(搜「萨顿」)、第 281 段(搜「可适应系统」)、第 334 段(搜「Goal-Seeking」)。 2

  10. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 302-309 段(text/10-ch06.txt:302,搜「马尔可夫决策过程」)。形式化的散文转写,符号与原文一致。

  11. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 312 段(text/10-ch06.txt:312,搜「动态规划」)与第 318 段(搜「三十年」)。

  12. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 337 段(text/10-ch06.txt:337,搜「奖励假设」)与第 338 段(搜「Reward is enough」)。

  13. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 346 段(text/10-ch06.txt:346,搜「定义了可学习的机器」)与第 349 段(搜「唯一」)。原文:"这份报告也是巴托和萨顿在其经典教材《强化学习导论》中引用的唯一一篇图灵的文献"。

  14. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 352 段(text/10-ch06.txt:352,搜「1954年的博士论文」)。

  15. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 358 段(text/10-ch06.txt:358,搜「抬头看路」)与第 363 段(搜「诗和远方」)。

  16. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 358-368 段(text/10-ch06.txt:358,搜「探索」)。原书给出探索/利用的定义与 ε 的角色("用希腊字母ε表示学习率,其值越小,能用于探索的时间就越少",见第 361-362 段);老虎机走查的全部数值(ε=0.1、估值、拉臂次数)为演示编的,多臂老虎机作为探索/利用的标准教学例见"参考文献指南"对 Q-Learning 的说明(第 575 段,text/10-ch06.txt:575,搜「Q-Learning」)。

  17. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 370 段(text/10-ch06.txt:370,搜「多步以后」)与第 371 段(搜「蒙特卡洛」)、第 374 段(搜「压缩」)。

  18. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 424 段(text/10-ch06.txt:424,搜「The Bitter Lesson」)与第 425-426 段(搜「通用方法」)。

  19. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 429 段(text/10-ch06.txt:429,搜「缩放定律」)与第 430 段(搜「放缓」)。 2

  20. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 432 段(text/10-ch06.txt:432,搜「Welcome to the Era」)与第 436-437 段(搜「经验时代」)。

  21. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 421 段(text/10-ch06.txt:421,搜「用尽」)。

  22. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 479 段(text/10-ch06.txt:479,搜「芯片布局」)与第 482 段(搜「修正」)。 2

  23. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 487-492 段(text/10-ch06.txt:486,搜「AlphaFold」)与第 491 段(搜「98.5%」)。

  24. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 502 段(text/10-ch06.txt:502,搜「性作为算法」)与第 510 段(搜「无性繁殖」)、第 516 段(搜「混合程度」)。

  25. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 526 段(text/10-ch06.txt:526,搜「计算理论的基础」)。

  26. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 379 段(text/10-ch06.txt:379,搜「多巴胺」)与第 453 段(搜「有希望得诺贝尔」)。

  27. 出处:「第3版 前言」第 26 段(text/02-ch03.txt:26,搜「世界模型」)与「第9章 语言等于思维吗?」第 198 段(text/13-ch09.txt:198,搜「而不是建立模型」)。

  28. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 419 段(text/10-ch06.txt:419,搜「encompass」)与第 420 段(搜「没办法的办法」)。