跳到主要内容

aima-4e 拆解大纲(18 章)

切分原则:理性 agent 主线贯穿;按推理链与新词密度切,原书 28 章重组为 18 章。 每章七段结构:讲什么/顶层全景/核心原理/作者判断与证据/边界与局限/可带走的/原文地图。

章节切分与每节「进来时以为 → 出去时知道」

01-rational-agents.md 理性智能体:AI 的定义与 agent 设计(原书 ch1 绪论 + ch2 智能体)

  • 四象限:进来以为 AI 有唯一定义 → 出去知道四个流派(类人行为/思考、理性思考/行为)各带研究纲领,作者选理性 agent 路线,理由是标准数学化。
  • 标准 model 与益机:进来以为 AI 就是最优化 → 出去知道作者认为固定目标的标准模型不充分,价值对齐/不确定目标才是正确框架。
  • agent 框架:进来以为「智能」玄学 → 出去知道 PEAS/性能度量/理性 4 要素是一张设计表;表驱动 agent 为何注定失败(出租车表 > 宇宙原子数);四种结构(反射→模型→目标→效用)是逐步补信息的过程;环境 7 维决定设计。
  • 主走查:真空吸尘器世界(A/B 格、Suck/Left/Right、每步每干净格 1 分)贯穿:性能度量怎么定坏、理性怎么判、四种 agent 分别怎么写。

02-search.md 通过搜索进行问题求解(原书 ch3)

  • 进来以为搜索=穷举 → 出去知道 5 元组问题形式化+抽象层级(合理性与有用性)。
  • 无信息搜索家族:进来以为 BFS/DFS 随便选 → 出去知道完备性/最优性/时间/空间四指标下的系统权衡;UCS、迭代加深、双向。
  • 有信息搜索:进来以为 A* 是魔法 → 出去知道 f=g+h、可容许(不高估)⟹最优的完整证明、一致性、等值线与剪枝;加权 A*=满意搜索。
  • 启发式从哪来:松弛问题、模式数据库、地标。
  • 主走查:Arad→Bucharest(贪心 366 直觉、A* 在 f=417/450 的取舍、多走 70 英里的对比)。

03-search-complex.md 复杂环境中的搜索(原书 ch4)

  • 局部搜索:进来以为还是要记路径 → 出去知道只管状态不管路径(爬山 86% 卡住、横向移动 94%、模拟退火的温度、束搜索、遗传算法的杂交何时有用)。
  • 连续空间:梯度/步长/牛顿-拉弗森;3 机场质心。
  • 非确定与部分可观测:与或树、信念状态、无传感器规划(强迫世界)、条件规划;在线搜索与 LRTA*。
  • 主走查:不稳定真空吸尘器(Results(1,Suck)={5,7} → 条件规划;if State=5)。

04-adversarial-search.md 对抗搜索与博弈树(原书 ch5)

  • minimax:进来以为博电脑会算到底 → 出去知道 O(b^m) 不可行(象棋 35^80≈10^123),最优性依赖「对手也最优」。
  • α-β 剪枝:α/β=至少/至多;移动顺序决定一切(有效分支因子 35→6);换位表。
  • 截断与评价函数:Eval=期望效用估计;视野效应/静态搜索;残局表。
  • MCTS:模拟代替评价;UCB1 公式;与 α-β 的分工(围棋 vs 象棋)与互相渗透。
  • 主走查:同一棵二层树(3/12/8…),minimax 算 9 个叶、α-β 只算 7 个,数着算。

05-csp.md 约束满足问题(原书 ch6)

  • 进来以为 CSP=特殊搜索题 → 出去知道因子化表示让「通用启发式」成为可能(SA=blue 省 87%)。
  • 约束传播:弧一致、AC-3、路径一致、k 一致、边界传播;数独 AC-3 走查。
  • 回溯搜索:MRV/度/最少约束值;前向检验 vs MAC;冲突导向回跳;no-good。
  • 结构:树状 CSP 线性可解、割集调整、树分解与树宽;最少冲突法百万皇后 50 步。
  • 主走查:澳大利亚地图着色(WA=red→前向检验→SA 空→回溯;V=blue→SA 空)。

06-logical-agents.md 逻辑智能体:命题逻辑(原书 ch7)

  • 知识库 agent:进来以为知识=数据 → 出去知道 Tell/Ask/蕴含=遵循不能捏造;知识层面 vs 实现层面。
  • wumpus 世界:进来看着像游戏 → 出去知道部分可观测下「结合不同时间地点的推断」怎么走。
  • 命题逻辑:语法/语义/真值表;⇒ 真值表反直觉;模型检验 TT-Entails O(2^n)。
  • 推断:归结+CNF;霍恩子句与前向/反向链接(线性);DPLL/WalkSAT;SAT 阈值 4.3。
  • 主走查:wumpus [1,2] 无坑的 5 步证明 + 128 模型真值表。

07-fol-knowledge.md 一阶逻辑与知识表示(原书 ch8 一阶逻辑 + ch9 一阶逻辑中的推断 + ch10 知识表示)

  • FOL:进来以为逻辑只谈真假命题 → 出去知道对象/关系/函数+量词(∀配⇒、∃配∧);数据库语义 3 假设。
  • 推断:合一与 MGU、出现检查;前向/反向链接(犯罪问题);CNF+斯科伦化;归结完备(好奇心害死猫);Prolog=数据库语义+否定即失败。
  • 知识表示:类别/继承/物化、自然类(番茄)、事件演算、精神对象;语义网络/描述逻辑;非单调(尼克松菱形)、限定、真值维护。
  • 主走查:犯罪问题(Nono/导弹 M1/West)从前向链接走到归结证明同一结论。

08-planning.md 自动规划(原书 ch11)

  • PDDL:进来以为规划=长序列搜索 → 出去知道动作模式用参数表示 4Tn² 个动作;删除列表/添加列表。
  • 前向 vs 反向(回归):ISBN 例子(1 个动作 vs 1 万亿);为什么多数系统用前向(启发式好做)。
  • 启发式:忽略前提/忽略删除列表(FF);对称约简;可序列化子目标;状态抽象与子目标独立。
  • 分层:HTN/HLA/天使语义;时间与调度(CPM/关键路径/松弛)。
  • 主走查:航空货运(Load/Unload/Fly;C1 SFO→JFK;清点前提与效果)。

09-uncertainty-bayes.md 不确定性:概率与贝叶斯网络(原书 ch12 + ch13)

  • 为什么概率:惰性/理论无知/实践无知;「概率是关于知识状态的断言」;决策论=概率+效用;德菲内蒂赌局。
  • 完全联合分布:边缘化/归一化;独立性;贝叶斯法则(脑膜炎 0.0014);条件独立=「AI 近期历史最重要进展」;朴素贝叶斯文本分类。
  • 贝叶斯网络:报警器网络;链式法则语义;紧凑性 960 vs 10 亿;节点顺序与因果方向;马尔可夫毯;d 分离;噪声或。
  • 推断:枚举、变量消元(因子)、拒绝采样/似然加权/Gibbs;因果网络与 do 算子、后门准则。
  • 主走查:牙科完全联合(0.108…→P(Cavity|toothache)=〈0.6,0.4〉)走到报警器 P(j,m,a,¬b,¬e)=0.000628 与变量消元。

10-temporal-prob.md 时间上的概率推理与概率编程(原书 ch14 + ch15)

  • 时序模型:马尔可夫假设/传感器马尔可夫/时间齐次;滤波/预测/平滑/最可能解释;雨伞世界走查(0.5→0.667→0.75)。
  • HMM(维特比)、卡尔曼滤波(线性高斯)、DBN(稀疏性:5×10^29→几千参数);电池瞬时故障/持续故障的传感器模型故事。
  • 概率编程:RPM(图书推荐/诚实度)、OUPM(存在/身份不确定性、女巫攻击、数字语句、泊松)、生成式程序。
  • 主走查:雨伞世界两步滤波全数字;Gibbs 一步重采样 〈0.048,0.952〉。

11-decisions.md 决策:效用、序贯决策与多智能体(原书 ch16 做简单决策 + ch17 做复杂决策 + ch18 多智能体决策)

  • 效用理论:6 公理→MEU 定理;金钱效用(100 万赌局、对数曲线、微亡/QALY);决策网络(机场选址)。
  • 信息价值 VPI:石油勘探;VPI≥0 但不可加;短视信息收集。
  • MDP:4×3 世界(0.8/0.1/0.1 转移;r=−0.04);策略而非序列;贝尔曼方程;价值迭代(压缩、γ 因子)、策略迭代;9 种最优策略与 r 的区间;老虎机与探索-利用。
  • POMDP;博弈论:囚徒困境(占优策略均衡、帕累托)、纳什均衡(存在性)、混合策略;辅助博弈与回形针;开关游戏(顺从来自偏好不确定性:0.4×0+0.6×30=+18>10)。
  • 主走查:4×3 MDP 从 [Up,Up,Right…] 0.32768 走到价值迭代收敛、策略比较。

12-learning-from-examples.md 从样例中学习(原书 ch19)

  • 学习的形式:监督/无监督/强化;归纳 vs 演绎;偏差-方差;奥卡姆与「参数个数不是好标准」(深度网络反例)。
  • 决策树:餐厅 12 样例;信息增益(熵;公平硬币 1 位);χ² 剪枝;学习曲线。
  • 线性模型:梯度下降(α、SGD 小批量 N=10000/m=100)、正规方程 w*=(XᵀX)⁻¹Xᵀy;逻辑斯谛回归。
  • 非参数(kNN/SVM/核)、集成(bagging/随机森林/boosting);开发 ML 系统(数据、不平衡、离群值、经验法则)。
  • 主走查:餐厅等待 12 样例:Patrons 根节点、熵 1 位→0.25 位、剪枝判定。

13-learning-probabilistic-models.md 学习概率模型(原书 ch20)

  • 统计学习=推断:糖果袋 5 假设;贝叶斯/MAP/最大似然/MDL 是一条谱(0.8 vs 1.0 预测对比)。
  • 完全数据:最大似然 3 步法(樱桃比例 θ=c/N);朴素贝叶斯参数;生成 vs 判别(Ng & Jordan 15 数据集 9:14)。
  • 隐变量与 EM:心脏病网络 78 vs 708 参数;混合高斯聚类;E 步/M 步;HMM 学习。
  • 主走查:糖果:先验〈0.1,0.2,0.4,0.2,0.1〉,10 颗酸橙逐颗更新后验,θ̂=c/N。

14-deep-learning.md 深度学习(原书 ch21)

  • 为什么深度:计算路径长度与输入交互(线性回归短路径/决策树长路径只对少数输入/深度=两者兼得)。
  • 前馈网络:单元=加权和+非线性;万能近似定理;计算图;权重=音量旋钮;反向传播(感知误差 Δ;链式法则);梯度消失与 ReLU;自动微分与端到端。
  • 卷积网络:9 万亿参数问题→局部连接+参数共享+池化;残差;MNIST 环/交叉/尾端。
  • 训练与泛化:小批量 SGD/批量归一化/权重衰减/暂退;RNN 与 LSTM(门;加法记忆);无监督(VAE/GAN)与迁移(预训练)。
  • 主走查:同一个两层小网络(21-3 图)算 ∂L/∂w3,5 与 ∂L/∂w1,3 的每一步。

15-reinforcement-learning.md 强化学习(原书 ch22)

  • 为什么 RL:10^8 样本 vs 10^40 局面;「你在 MDP 中而不只是求解它」;稀疏奖励。
  • 被动:直接效用估计(reward-to-go,为何慢)→ADP(学模型解贝尔曼;10^20 方程问题)→TD(U←U+α(R+γU′−U);α(n)=60/(59+n))。
  • 主动:探索(乐观/遗憾);Q 学习(免模型;「重要性质在于它不包含什么」)、SARSA(同策略);深度 Q。
  • 策略搜索/逆强化学习/应用(Atari、直升机)。
  • 主走查:4×3 世界 TD:第二次试验 (1,3)→(2,3),0.88 被抬到 0.92 的那次更新。

16-nlp.md 自然语言处理:从 n-gram 到 Transformer(原书 ch23 + ch24)

  • 语言模型:词袋→n 元(参数爆炸 10^200)→平滑(拉普拉斯//Kneser-Ney)。
  • 文法与分析:CFG/PCFG/树库;CYK;为什么 2018 后数据驱动胜出(乔姆斯基的 20 年错案)。
  • 词嵌入:Firth;向量算术(雅典-希腊+奥斯陆=挪威);ice/steam 与 solid/gas。
  • RNN/seq2seq/注意力/Transformer(QKV、多头、位置嵌入);预训练与 MLM(掩码填空);GPT-2 1.5B 参数零微调;T5;「为什么舍弃文法」作者的坦白。
  • 主走查:翻译「The front door is red」:贪心解码翻错(La entrada),束搜索保住 La puerta。

17-vision-robotics.md 视觉与机器人:感知与行动(原书 ch25 + ch26)

  • 视觉:重建与识别;图像形成(针孔/透视投影/消失点);边缘/纹理/光流;CNN 分类(MNIST 局部模式;ImageNet 2010<70%→2012 98%→2019 Top1 87%);检测/立体/运动;生成图片。
  • 机器人:效应器/传感器(激光雷达 100m<1cm;GPS 米级);定位(MCL 粒子滤波:均匀→走廊双峰→房间单峰;EKF 误差椭圆);SLAM;构形空间与运动规划;sim-to-real。
  • 主走查:蒙特卡罗定位三张快照(粒子群怎么收敛),机器人「在办公室哪里」的每一步。

18-ethics-future.md AI 的哲学、伦理、安全与未来(原书 ch27 + ch28)

  • 哲学:弱/强 AI;图灵测试(30%;Eugene Goostman=易骗性测试);中文房间;卢卡斯-彭罗斯哥德尔论证的三个反驳;「潜艇能否游泳」。
  • 伦理:LAWS/监控/偏见/透明度/就业/机器人权利;AI 安全:意外副作用、低影响、specification gaming(摔倒式快速移动)、税法比喻。
  • 益机主线回收:价值对齐、辅助博弈、开关游戏、智力爆炸与控制(国家/企业=非人类实体的先例)。
  • 未来:组件(激光雷达 75000→10 美元)、表示、分层规划、奖励知识工程;标准模型转向益机的总结。
  • 主走查:回形针博弈(H 做 2 个回形针/订书钉/各 1 → R 读出 θ≈0.45 的信号链)。

自查(任意两节「出去时知道」不得是同一件事)

  • 02 与 03:「出去」分别是无信息/有信息的系统性搜索 vs 放宽假设(局部/非确定/在线)——不同。02 的主走查是 A*(罗马尼亚),03 是与或树(不稳定真空)——不同输入。
  • 04 与 11:「出去」分别是博弈树搜索(完全信息零和、minimax/α-β/MCTS)vs 决策理论(效用/MDP/纳什均衡/机制)——04 是算法层,11 是决策理论层;两者在「对手建模」处呼应但机制不同(树搜索 vs 解概念)。
  • 06 与 07:命题 vs 一阶+知识内容;07 的「出去」含合一/斯科伦/本体论——不同。
  • 09 与 10:静态贝叶斯网络+推断 vs 时序模型+概率编程——不同。
  • 12 与 13:判别式样例学习(树/线性/集成)vs 概率模型学习(贝叶斯/MAP/EM)——不同;13 明确回收 12 的「过拟合」(先验=复杂度惩罚)。
  • 14 与 16:14 讲深度学习的通用机制(计算图/反向传播/卷积),16 讲这些机制在语言上的应用与演进(RNN→Transformer)——14 的「出去」是机制层,16 是应用层;16 明确引用 14 而不重复展开反向传播。
  • 主线核:01 立框架(理性 agent+标准模型)→ 02–05 确定性问题求解 → 06–08 知识与逻辑 → 09–11 不确定性与决策 → 12–15 学习 → 16–17 感知与语言 → 18 收回益机主线。总纲第 3 节按此链条写。

兑现承诺候选(写正文时逐条记账,完稿在 index 兑现表逐行核)

  • 01 章承诺「效用怎么定、目标不确定怎么办」→ 11、18 章。
  • 02 章承诺「启发式从哪来」→ 02 自答(松弛/PDB/地标)+ 12 章(学出来的)。
  • 05 章承诺「树宽」→ 05 自答 + 09 章(变量消元复杂度=树宽)。
  • 09 章承诺「时序怎么办」→ 10 章;「干预与观察的区别」→ 09 自答(do 算子)。
  • 10 章承诺「模型参数从哪学」→ 13 章(EM 学 HMM)。
  • 11 章承诺「Q 函数怎么学」→ 15 章;「辅助博弈」→ 18 章。
  • 12 章承诺「深度网络为何泛化」→ 14 章。
  • 14 章承诺「语言上怎么用」→ 16 章。
  • 15 章承诺「从演示学」→ 15 自答(学徒学习)+ 18 章。
  • 16 章承诺「为什么舍弃文法」→ 16 自答。