跳到主要内容

AIMA 4e 通读笔记(边读边写;行号均为 text/10-fm.txt)

全书结构:全部正文在一个文件 10-fm.txt(32494 行)。TOC 在 1–426(跳过)。 28 章边界(行号): ch1 绪论 429–1706 / ch2 智能体 1708–2544 / ch3 通过搜索进行问题求解 2547–4038 / ch4 复杂环境中的搜索 4039–5087 / ch5 对抗搜索和博弈 5088–6123 / ch6 约束满足问题 6124–7004 / ch7 逻辑智能体 7008–8396 / ch8 一阶逻辑 8397–9330 / ch9 一阶逻辑中的推断 9331–10397 / ch10 知识表示 10398–11308 / ch11 自动规划 11309–12602 / ch12 不确定性的量化 12606–13466 / ch13 概率推理 13467–14951 / ch14 时间上的概率推理 14952–16106 / ch15 概率编程 16107–17003 / ch16 做简单决策 17004–18090 / ch17 做复杂决策 18091–19246 / ch18 多智能体决策 19247–20974 / ch19 样例学习 20977–23254 / ch20 概率模型学习 23255–24059 / ch21 深度学习 24060–25277 / ch22 强化学习 25278–26409 / ch23 自然语言处理 26413–27608 / ch24 自然语言处理中的深度学习 27609–28345 / ch25 计算机视觉 28346–29568 / ch26 机器人学 29569–31107 / ch27 人工智能的哲学、伦理和安全性 31110–32154 / ch28 人工智能的未来 32155–32494。 另:正文引用书内其他章的编号(如 16.5 决策网络、19.1 学习的形式)与英译原版一致。

ch1 绪论 (429–1706)

  • 四象限定义 AI(类人行为=图灵测试/类人思考=认知建模/理性思考=思维法则/理性行为=理性智能体):448–458;作者选理性行为路线。
  • 图灵测试需要的 4 种能力(NLP/知识表示/自动推理/机器学习):466–475;完全图灵测试再加 CV+机器人:476–480。
  • 飞机类比:「停止模仿鸟类,改用风洞学空气动力学」:481–484。
  • 标准 model:AI=构建「做正确的事」的 agent,正确=我们给的目标定义;控制论/运筹学/统计/经济同构:551–555。完美理性计算上不可行→有限理性:556–559。
  • 益机(beneficial machine,译者注 590):价值对齐问题:572–577;国际象棋机器越界行为的例子(催眠/勒索对手、贿赂观众、劫持算力):578–581;「机器实现我们的目标但对目标不确定→谨慎、求许可、观察学习」:584–587;「可证益的(provably beneficial)」:587。
  • 基础学科史:哲学(亚里士多德三段论 604–606;霍布斯「推理即计算」617–620;笛卡尔二元论 vs 唯物主义 622–634;经验主义/休谟归纳 635–641;逻辑实证主义 642–646;功利主义 vs 康德义务论 690–701);数学(布尔 1847/弗雷格一阶逻辑 1879:710–713;贝叶斯法则 723–724;哥德尔不完备 1931:737–741;图灵机 1936+Church-Turing 743–747;易处理性/NP 完全 748–758);经济(斯密 1776:764;Arnauld 1662 期望值、伯努利 1738 效用 770–774;冯诺依曼摩根斯坦博弈论 776–790;Bellman 1957 MDP:794–797;西蒙满意解 satisficing:799–803);神经科学(布罗卡区 813–815;神经元/突触数字:轴突 1cm、一神经元连 1万~10万突触、皮质柱 0.5mm/2万神经元:822–828;脑机接口 845–847;计算机 vs 大脑:超级计算机 10^18 运算/秒 vs 人脑 10^17、周期时间快百万倍:856–874;奇点提及 850–854「没有正确的理论,更快的机器只会更快地给出错误的答案」);心理学(行为主义 886–891;克雷克 3 步:刺激→内在表示→处理→再转成行为 899–901;「小规模模型」模拟外部现实以便先试后行 903–907;1956-09 MIT 认知科学研讨会 911–920;IA 智能增强/恩格巴特 921–929);计算机工程(摩尔定律 946–948;2012–2018 训练算力涨 30 万倍/约每 100 天翻番:953–956;GPU/TPU/WSE 952;巴贝奇分析机/洛芙莱斯 963–970);控制论(克特西比乌斯水钟 982–984;瓦特调节器/麦克斯韦 1868:985–988;维纳「目的性行为=最小化误差的调节机制」989–997;控制理论与 AI 分家原因:数学工具不同 1004–1010);语言学(乔姆斯基 1957 批行为主义:语言创造力 1014–1022)。
  • 历史:图灵奖得主列表(明斯基/麦卡锡/纽厄尔西蒙/费根鲍姆雷迪/珀尔/2018 深度学习三人) 1034–1043;麦卡洛克-皮茨 1943 神经元=命题+可计算+可学习:1046–1054;赫布学习 1054–1056;SNARC 3000 真空管 40 神经元(明斯基 1950):1057–1061;达特茅斯 1956 夏(10 人、麦卡锡命名 AI):1075–1087;逻辑理论家 LT 证 Principia 定理:1089–1096;GPS+物理符号系统假说(1976):1103–1117;塞缪尔跳棋(强化学习、业余高手、1956 电视演示):1121–1128;Lisp 1958+Advice Taker(知识表示+演绎=核心原则):1129–1137;鲁滨逊归结原理 1965:1140–1142;微世界(明斯基学派):1146–1152;组合爆炸=莱特希尔报告主要批评:1207;专家系统时代(MYCIN、R1 每年省 4000 万美元:1255–1259;AI winter:1284–1285);概率回归(«脆弱性导致基于概率而非布尔逻辑的新方法»:1306);大数据时代(2001–):1354–1356;ImageNet 2012(1000 类分类):1381–1385;Watson Jeopardy 2011:1371;深蓝 1997 vs AlphaGo(柯洁:「越来越像围棋之神」):1493–1497。
  • 1.5 风险与收益:监视/有偏决策/就业/安全关键/网络安全:1550 起;HLAI(2004)/AGI(2008 首会)/ASI 担忧:1560 起;大猩猩问题:1572 起;迈达斯国王问题(许愿神话、第三个愿望是撤销前两个):1595 起;维纳 1960 引文(「最好能完全确定设定给机器的目标是我们真正想要实现的」):1600 起;「几乎所有 AI 研究都在标准模型下…第16章 可证益的关闭动机、第18章 辅助博弈、第22章 逆向强化学习、第27章 困难」:1608–1615;小结:1616–1690。

ch2 智能体 (1708–2544) —— 已读完

  • agent 定义(传感器感知环境+执行器作用于环境):1730 区;感知/感知序列/智能体函数(感知序列→动作):1748–1760 区;真空吸尘器世界 2 格 A/B、[A,Dirty]→Suck 表(图2-3):1771–1798。
  • 性能度量:结果主义;「吸尘量」度量坏例子(清完倒掉再清可刷分):1816–1820;「每时间步每干净格 1 分」:1852;「按真正想要的目标而非认为 agent 该如何表现来设计度量」:1821–1824。
  • 理性 4 要素(度量/先验/可执行动作/感知序列):1839–1843;理性定义:1846–1847;理性≠全知(香榭丽舍货舱门):1869–1877;信息收集:1884–1886;粪甲虫:1892–1895;掘土黄蜂:1896–1901;自主性:1902–1906。
  • PEAS:1924–1927;出租车 PEAS(图2-4):1931–1938。
  • 环境 7 维:可观测性(1988)/单多智能体(2008–2014,竞争环境中随机是理性的)/确定性(2015–2027)/回合序贯(2028)/静动(2035)/离散连续(2042)/已知未知(2052);最难组合:2065;表图2-6:2074–2091。
  • 智能体=架构+程序:2102–2107;表驱动失败:出租车 1 小时>10^6000000000000 条、象棋≥10^150 vs 宇宙原子<10^80:2134–2145;「小程序而非大表」:2149–2150。
  • 四种 agent:①简单反射(条件-动作规则 2186;只适用完全可观测 2215;无位置传感器无限循环 2224;随机化平均两步 2229);②基于模型(内部状态+转移模型+传感器模型 2244–2256;最佳猜测 2261);③基于目标(「如果我这样做会怎样」2293;灵活改目的地 2302);④基于效用(效用函数=性能度量内部化 2314;冲突目标+概率权衡 2319;期望效用 2325;无模型 agent 2345)。
  • 学习型 agent 4 组件:学习元素/性能元素/评估者/问题生成器(伽利略斜塔 2379);奖励/惩罚 2396;按喇叭学偏好 2398。
  • 表示轴:原子/因子化/结构化(2417–2449;奶牛场例子 2436;棋规 1–2 页 vs 数千页 vs 10^38 页 2445);局部 vs 分布式(Truck/Truce 2450–2458)。
  • 小结:2460–2481。

ch3 通过搜索进行问题求解 (2547–4038) —— 已读完

  • 环境 5 元组:状态空间/初始/Is-Goal/Actions/Result/代价 c(s,a,s'):2610–2630;Actions(Arad)={ToSibiu,ToTimisoara,ToZerind}:2623;罗马尼亚 Arad→Bucharest 不可退款机票:2567–2571;4 阶段:2576–2598;开环/闭环:2599–2604。
  • 抽象:「右脚 1 厘米」找不到出停车场:2644–2646;抽象合理性+有用性:2663–2668。真空世界 8 状态(2×2×2):2684–2688;8 数码奇偶=一半可达:2721–2723;高德纳 4 问题 (4!)!=620448401733239439360000:2740–2755;TSP 波士顿校车省 500 万美元:2785。
  • 状态空间 vs 搜索树:2819–2822;扩展/边界 frontier/已达 reached:2824–2838;边界分离:2845;最佳优先(评价函数 f):2853–2860;节点 4 字段 g(n):2891–2897;三种队列:2906–2912;冗余路径(140 vs 297 英里:2922;10×10 网格 8^9>1 亿、消冗余快百万倍:2926–2930);图搜索 vs 树状搜索:2939。
  • 4 评估标准(完备/代价最优/时间/空间):2953–2965;b,d,m:2984–2986。
  • BFS:f=深度、FIFO+早期目标测试:2996–3008;b=10,d=10:3 小时+10TB;d=14:3.5 年:3041–3046。UCS=Dijkstra f=g:Sibiu→RimnicuVilcea80/Fagaras99→Pitesti177→Bucharest310 vs 278:3055–3067;O(b^(1+⌊C*/ε⌋)):3068。
  • DFS 空间 O(bm);「BFS 边界=球面,DFS 边界=半径」:3102–3104;回溯搜索 O(m):3110–3117。深度受限 ℓ=19/罗马尼亚直径 9:3130–3133。IDS:N(IDS)=123450 vs N(BFS)=111110(b=10,d=5):3173–3176;双向 b^(d/2)+b^(d/2),b=d=10 不到五万分之一:3188–3190;对比表图3-15:3245–3259。
  • 启发式 h(n):3262–3266;贪心 f=h:hSLD(Arad)=366:3276;贪心解多 32 英里:3283–3284;hSLD 表:3291–3302。
  • A* f=g+h:3311–3318;Bucharest f=450 不扩展 vs Pitesti f=417:3319–3325;可容许=从不高估:3326–3328;反证法:3329–3342;一致性=三角不等式:3343–3348;等值线:3373–3381;必然扩展/效率最优:3394–3407;剪枝 Timisoara447/Zerind449:3408–3413;指数反例 2^N 超强吸力:3415–3419。
  • 满意:弯道指数 1.2–1.6:3428–3431;加权 A* f=g+W·h(W=1 A*/0 UCS/∞ 贪心):3433–3444;W=2 状态<1/7、代价+5%:3435–3440。
  • 内存受限:束搜索 k:3484;IDA*(截断=f;8 数码最难迭代≤31):3493–3504;RBFS(备份 417/450「改变主意」):3505–3542;SMA*(丢最差叶、备份父):3552–3570;内存限制→时间难处理(磁盘抖动):3571–3578。双向 f2=max(2g,g+h):3605;lb(m,n):3595。
  • 启发式:h1 错位数=8、h2 曼哈顿=18 vs 26:3643–3653;8 数码 181400 可达、15 数码 16!/2>10 万亿:3639–3641;b*有效分支因子(52 节点 d=5→1.92):3656–3664;h2 占优:3694–3701;表图3-26:3675–3688。
  • 松弛问题:h2/h1=松弛精确代价:3719–3729;Absolver+魔方:3732;max 组合:3738。模式数据库:15120 模式;15 数码 1/1000;不相交 1/10000、24 数码百万倍:3756–3776。地标 10-20 个+差分启发式 hDH:3780–3828。元级状态空间:3835–3850;学 h=c1x1+c2x2:3867。
  • 小结:3872–3915。

ch4 复杂环境中的搜索 (4039–5087) —— 已读完

  • 本章放宽假设:不管路径只要好状态(离散4.1/连续4.2)、非确定(4.3)、部分可观测(4.4)、在线未知(4.5):4042–4049。
  • 局部搜索:不记录路径/已达;优点=内存少+适用大/无限空间:4057–4061;状态空间地形图/爬山/梯度下降:4064–4069。
  • 爬山法:8 皇后完整状态形式化(56 后继,h=可攻击对数,h=17 状态:4087–4093);「大雾中的健忘者找珠峰」:4076;卡住三因:局部极大/岭/平台(4099–4125);86% 卡住只解 14%:4126–4129;允许横向移动(限 100 次)→94%:4130–4135;变体:随机/首选/随机重启(p=0.14→约 7 次、22 步):4136–4150;NP 困难=指数级局部极大;「秃顶豪猪」地形:4151–4155。
  • 模拟退火:冶金退火;乒乓球晃动比喻(晃动够大弹出局部极小、不能太大弹出全局极小):4164–4174;接受坏移动概率 e^(−∆E/T),T 渐降→概率集中于全局最优:4176–4180;VLSI 布图应用:4193–4194。
  • 局部束搜索:k 状态+信息在并行线程间流动(「过来,这里的草更绿」):4196–4205;多样性缺乏→爬山 k 倍慢;随机束=按适应度概率选:4206–4210。
  • 进化算法:遗传算法(串=8 皇后每列行号,适应度=非攻击对数,解=28,4 个体 24/23/20/11;杂交点例子 327+48552):4239–4248;模式 schema(246*****):4288–4292;杂交有用性=存在「构建块」区域,否则无优势:4283–4287;精英主义/淘汰:4235–4238;Baldwin 效应(学习放宽适应度、加速进化):4315–4322;达尔文 10^43 生物体:4311。
  • 连续空间:3 机场例子(6 维,∑最近城市距离平方):4342–4353;离散化/经验梯度:4354–4361;梯度 ∇f+步长 α+线搜索:4362–4382;牛顿-拉弗森(黑塞矩阵;单机场=坐标算术平均;3 机场每步移到质心):4383–4394;线性规划/凸优化多项式可解:4397–4407。
  • 非确定搜索:信念状态(belief state):4423–4425;解=条件规划(应变规划):4426–4429;不稳定真空世界(Suck 有时清两格/干净格反弄脏;Results(1,Suck)={5,7}):4431–4447;条件规划[Suck, if State=5 then [Right,Suck] else []]:4450;与或树(或节点=自己的选择,与节点=环境的结果):4458–4473;And-Or-Search 算法+环处理:4474–4504;光滑真空世界 Right 可能原地不动→循环解[while State=5 do Right]:4506–4525(传动带断=不可观测原因)。
  • 无传感器(conformant)问题:广谱抗生素例子:4532–4538;[Right,Suck,Left,Suck] 强迫世界到状态 7:4539–4544;信念状态空间搜索(2^N 个信念状态):4545–4560;转移公式(4-4):4574–4578;可达信念状态 12/256:4592–4593;超集剪枝({1,3,5,7} 剪为 {5,7}):4601–4613;增量信念状态搜索:4621–4631。
  • 部分可观测:Percept(s);局部感知真空世界初始感知 [L,Dirty]→信念 {1,3}:4640–4644;三阶段:预测/可能感知/更新:4645–4659;条件规划[Suck, Right, if Bstate={6} then Suck else []]:4676–4678;递归状态估计器 b'=Update(Predict(b,a),o):4695–4708(监视/过滤/状态评估);定位 localization(声呐位向量 1011→4 位置→Right→1010→唯一位置):4712–4738;传感器故障→概率推理(第12章)「出错不超过一半就有用」:4739–4741。
  • 在线搜索:离线 vs 在线(交替计算/动作):4743–4752;竞争比:4778–4781;死胡同+对手论证:4782–4793;可安全探索:4796–4800;Online-DFS-Agent(result 表+unbacktracked 物理回溯;最坏遍历每连接 2 次):4805–4847;随机游走(指数陷阱:4854–4859;三维网格返回概率 0.3405:4879);LRTA*(H(s) 估计+拉平局部极小;乐观主义:未试动作按 h(s) 假定):4863–4908。
  • 小结在 4910 后。

ch5 对抗搜索和博弈 (5088–6123) —— 已读完

  • 三种观点(经济整体/对手=非确定环境/显式对抗搜索):5100–5106;minimax=与或搜索推广:5108。
  • 形式化:S0/To-Move/Actions/Result/Is-Terminal/Utility(象棋 1,0,1/2;双陆棋 0–192):5132–5142;完美信息=完全可观测;零和(常量和):5122–5163;井字棋 9!=362880 终止节点、5478 不同状态:5153;象棋节点>10^40:5154。
  • Minimax 定义+递归公式:5185–5203;图5-2:B={3,12,8}→3;根=max(3,2,2)=3,a1 最优:5197–5203;max 最优假设 min 也最优;「次优对手时冒险走法(9/10 胜)可能更好」:5204–5212;算法 O(b^m):5222–5228;象棋 b≈35,m≈80,35^80≈10^123:5225–5226。
  • 多人博弈:值向量;X 节点 C 选〈1,2,6〉>〈4,2,3〉:5258–5267;联盟=自私的自然结果:5268–5278;非零和合作〈1000,1000〉:5286–5289。
  • α-β 剪枝:min(2,x,y)≤2→根=max(3,z,2)=3 与 x,y 无关:5300–5306;α=「至少」β=「至多」:5330–5333;算法图5-7:5338–5365。
  • 移动顺序:完美排序 O(b^(m/2)),有效分支因子 35→6,深度翻倍:5372–5374;随机 O(b^(3m/4)):5375;吃子>威胁>前进:5377;绝招+迭代加深排序:5380–5386;换位表(象棋深度×2):5387–5395;香农 A 型(宽浅)vs B 型(深窄):5396–5405。
  • 启发式 α-β:H-Minimax(s,d)=Eval+截断:5407–5416;评价函数=期望效用估计(两兵对一兵:0.82×1+0.02×0+0.16×0.5=0.90):5436–5439;子力价值兵1马象3车5后9:5442–5445;加权线性函数:5446;机器学习几小时复制几世纪人类经验:5460–5463;静态搜索 quiescence:5482–5485;视野效应(黑象被兵拖延出视野):5486–5497;单步延伸:5498;前向剪枝:束/ProbCut(64% 胜率 vs 2 倍时间常规)/后期移动缩减:5508–5525;象棋 100 万节点/秒→minimax 5 层;α-β+换位表 14 层;8GPU 10 亿/秒+残局库→大师:5526–5534;Stockfish 深度>30:5535。
  • 查表:开局 10–15 步后转搜索:5539–5546;残局逆向 retrograde 分析;≤7 子残局表 400 万亿状态:5550–5557。
  • MCTS:围棋 b=361→α-β 只 4–5 层+评价函数难:5560–5563;模拟 playout/rollout:5567–5571;模拟策略(自我对弈神经网络):5575–5578;4 步 选择/扩展/模拟/反向传播(27/35→28/36,37/100→37/101):5590–5614;UCT/UCB1(C=√2 理论、实测调;C=1.4→60/79 最高,C=1.5→2/11 最高):5615–5627;返回模拟次数最多(65/100 vs 2/3):5628–5631;10 亿状态:minimax 6 层/α-β 12 层/MCTS 1000 万次模拟:5644–5648;α-β 对单点评价误差敏感、MCTS 靠聚合:5650–5654;缺陷=B 型剪枝可能漏关键招:5663–5665。
  • 随机博弈:双陆棋机会节点;36→21 种点数,P(1-1)=1/36 其余 1/18:5681–5683;期望极小化极大:5697–5707;评价函数必须=获胜概率线性变换([1,2,3,4] vs [1,20,30,400] 改变最优):5713–5721;O(b^m·n^m),n=21,b≈20(翻倍 4000)→只 3 层:5724–5728;机会节点剪枝(效用值域 [-2,2]):5740–5743。
  • 部分可观测:四国军棋;信念状态 20 种:5774–5777;确保将死(中盘深度 9):5785–5792;概率将死(KBNK=1,KBBK=1−ε):5793–5803;最佳玩法需随机性(餐厅卫生检查员):5818–5822;均衡→第17章:5823;纸牌:观测力平均(三岔路口金子故事)为何错:5837–5862;桥牌 10,400,600 种发牌;抽象 AAA72≈AAA64;样本 100–1000:5864–5871;Libratus 2500 万 CPU 小时:5881–5887。
  • 局限:①评价误差(100 vs 99;s=5→71% 左边好):5901–5907;②元推理(按节点扩展的效用值分配计算):5911–5921;③缺抽象层级规划:5922–5926;④机器学习融入:5927–5930。
  • 小结:5932–5954。

ch6 约束满足问题 (6124–7004) —— 已读完

  • CSP=X(变量)/D(域)/C(约束〈scope,rel〉):6141–6150;一致/完整赋值/解:6151–6155;CSP 是 NP 完全:6154。
  • 澳大利亚着色:X={WA,NT,Q,NSW,V,SA,T},Di={red,green,blue},9 约束:6158–6172;SA=blue→5 邻居不能 blue:243→32 种、省 87%:6178–6180;「违反即放弃+知道为什么不是解」:6187–6190。
  • 车间调度:15 任务变量;AxleF+10≤WheelRF;析取约束(AxleF+10≤AxleB)∨(AxleB+10≤AxleF);30 分钟域:6192–6229。
  • 变体:离散有限/无限(线性约束)/连续(哈勃望远镜调度;线性规划):6231–6249;一元/二元/全局约束(Alldiff;密码算术 O+O=R+10C1:6265–6268;超图:6270);辅助变量→二元化;对偶图:6276–6286;偏好约束→COP:6290–6298。
  • 约束传播:用约束减合法值、可替代搜索:6300–6308;节点一致性(SA 删 green):6313–6320;弧一致(Y=X²:X→{0,1,2,3},Y→{0,1,4,9}:6326–6330;对澳洲着色无帮助:6330–6334);AC-3(弧队列;域变了就把邻居弧塞回队列:6335–6344;O(cd³):6369–6371;AC-3 名字来源=Mackworth 1977 第三版:6366);路径一致(两色澳洲:WA/SA 相对 NT 无效:6383–6387);k 一致(1=节点/2=弧/3=路径;强 n 一致 O(n²d)):6389–6406。
  • 全局约束:Alldiff 不一致检测(m 变量 n 值,m>n):6412–6421;Atmost 资源约束:6422–6427;边界传播(F1+F2=420,D1=[35,165]):6430–6439。
  • 数独:81 变量+27 个 Alldiff;E6 域{4}推导链:6466–6475;AC-3 只能解最简单数独;PC-2 需 255960 路径约束:6477–6478;三链数删减法:6482–6485。
  • 回溯搜索:可交换性消 n! 因子:6502–6508;算法图6-5:6513–6533;MRV(失败优先;WA=red/NT=green 后 SA 唯一:6553–6555):6556–6560;度启发式(打破僵局;SA 度 5):6561–6566;最少约束值(为邻居留最多选择;Q 选红不选蓝):6567–6571;「变量选择失败优先,值选择失败延后」:6572。
  • 前向检验(WA=red→NT/SA 删 red;V=blue→SA 空回溯:6584–6588);MRV+前向检验互补:6594–6599;前向检验盲区(NT、SA 都只剩蓝但相邻):6600–6602;MAC=赋值后调 AC-3,严格强于前向检验:6603–6608。
  • 智能回溯:时序回溯的愚蠢(T 重着色救不了 SA):6616–6620;冲突集+回跳:6622–6626;前向检验已含回跳(冗余):6631–6634;冲突导向回跳({WA,NSW} 共同致败;conf(Xi)←conf(Xi)∪conf(Xj)−{Xi}:6655–6658):6643–6658;约束学习/无用赋值(no-good):6660–6674。
  • 局部搜索:最少冲突启发式(随机选冲突变量,改到冲突最少值):6677–6706;百万皇后平均 50 步:6708–6710;哈勃调度 3 周→10 分钟:6713–6714;平台区/禁忌搜索/模拟退火/约束加权:6715–6724;在线重调度优点:6725–6729。
  • 结构:独立子问题(塔斯马尼亚;c 常数→O(d^c·n/c) 线性;100 变量拆 4 份=宇宙寿命→<1 秒:6740–6746);树状 CSP=定向弧一致 DAC+拓扑排序,O(nd²) 不回溯:6748–6759;割集调整(SA 移除→森林;O(d^c(n−c)d²);c=20/100 变量→几分钟:6807–6812);树分解(3 条件;树宽 w;O(nd^(w+1));w=10→几秒,w=30→几世纪:6839–6841);值对称(3!=6 解;对称破缺 NT<SA<WA):6853–6864。
  • 小结:6866–6882。

ch7 逻辑智能体 (7008–8396) —— 已读完

  • 基于知识的智能体:KB=语句集;Tell/Ask;推断不能捏造:7039–7050;KB-Agent 图7-1:7054–7063;知识层面 vs 实现层面(金门大桥):7076–7082;陈述性 vs 过程性:7083–7088。
  • wumpus 世界:PEAS(+1000 金/-1000 死/-1 动作/-10 箭):7105–7118;4×4、坑概率 0.2、仅 [1,1] 可爬出:7107–7118;5 传感器(Stench/Breeze/Glitter/Bump/Scream):7121–7132;环境属性:7133–7140;21% 环境不公平:7142–7144。
  • 推理走查:[1,1] 无感知→[1,2][2,1] OK:7153;[2,1] 微风→[2,2] 或 [3,1] 有坑;[1,2] 臭味+无微风→wumpus 在 [1,3]+坑在 [3,1] (结合不同时间地点):7164–7169;「信息正确则结论正确」:7173–7175。
  • 逻辑:语法/语义/模型/满足 M(α):7180–7194;蕴含=M(KB)⊆M(α):7195–7203;x=0 蕴含 xy=0:7202;8 模型例子(3 个 KB 真;α1 蕴含 α2 不蕴含):7204–7228;干草堆与针:7232;可靠/完备:7237–7243;落地+学习「wumpus 闰年2月29洗澡」:7249–7268。
  • 命题逻辑:联结词 ¬∧∨⇒⇔+优先级:7278–7317;真值表:7348–7355;⇒ 反直觉(「5 是奇数蕴含东京是日本首都」真):7361–7367;B1,1⇔(P1,2∨P2,1):7369;KB R1–R5:7388–7399。
  • 模型检验:7 符号 128 模型、KB 真 3 个:7404–7408;TT-Entails?:7430–7448;O(2^n);余 NP 完全:7450–7456。
  • 定理证明:逻辑等价图7-11:7463–7495;有效性/重言式/演绎定理:7472–7482;SAT=第一个 NP 完全:7501;归谬法:7504–7510;肯定前件/合取消去:7512–7527;5 步证明 ¬P1,2:7528–7540;证明=搜索:7541;单调性:7558–7566。
  • 归结:R13 ¬P2,2 与 R15 P2,2 归结:7585–7591;单元/全归结+因子提取:7592–7606;CNF 4 步:7615–7641;PL-Resolution(空子句=蕴含):7654–7677;归结闭包+基本归结定理:7692–7717。
  • 霍恩/确定子句:7723–7741;体/头/事实:7735;前向链接(count/inferred/queue;与或图;数据驱动;线性):7744–7797;反向链接(目标导向;=And-Or-Graph-Search):7798–7806。
  • SAT:DPLL(提前终止/纯符号/单元子句+单元传播;确定子句时=前向链接):7819–7853;WalkSAT(p≈0.5;最小冲突 vs 随机游走):7898–7934;failure 二义;「思考一小时不能证明安全」:7932–7934;随机 3-CNF 峭壁 m/n≈4.3、困难在阈值处:7936–7973。
  • 逻辑 agent:流 fluent(Stench⁴)+非时序变量:7999–8009;SATPlan([Shoot0] 也能「解」;前提公理;动作排除公理):8212–8248;100×100 场地 1000 时间步→上亿语句;一阶逻辑 10 条描述:8249–8260。
  • 小结:8262–8291。

ch8 一阶逻辑 (8397–9330) —— 已读完

  • 表示回顾:编程语言缺通用推断机制;命题逻辑有合成性但写不了「相邻方格有微风」的一般规则:8406–8432;自然语言:歧义/语境依赖(「看!」):8434–8446;萨丕尔-沃尔夫假说已基本被摒弃:8447–8452;Guugu Yimithirr 无相对方位词:8459–8463;「接触 51.5 vs 撞击 66 km/h」:8473–8476;fMRI 读词 77% 准确:8480–8486。
  • 对象/关系/函数;本体论约定(命题=事实;一阶=事实+对象+关系)+认识论约定(真假未知 vs 信念度):8503–8574;图8-1 表:8534–8543;模糊逻辑(维也纳 0.8):8552–8557。
  • 模型:域(非空)+解释;狮心理查/约翰/左腿/王冠 5 对象;兄弟关系={〈理查,约翰〉,〈约翰,理查〉}:8585–8602;LeftLeg 函数:8604–8608;全函数+不可见对象:8609–8612;6 对象→137,506,194,466 个模型:8673–8676。
  • 语法:常量/谓词/函数符号+元数:8643–8649;项=指称对象(LeftLeg(John) 不是子程序调用:8684–8688);原子语句 Brother(Richard,John):8694–8704。
  • 量词:∀=合取、∃=析取;∀ 搭配 ⇒(假前提不声明):8724–8757;∀ 配 ∧ 常见错误(要求左腿是国王):8758–8766;∃ 配 ∧:8784–8796;量词顺序(「每个人都爱一些人」vs「有人被所有人爱」):8807–8814;∀/∃ 德摩根:8823–8837。
  • 等词:Father(John)=Henry;理查≥2 兄弟需 ¬(x=y):8838–8851。
  • 数据库语义:唯一名称假设/封闭世界假设/域闭包:8862–8870;「逻辑没有『正确的』语义」:8884–8888。
  • 使用:论域=要表示的那部分世界:8890–8894;亲属关系:8926;数/集/列表:8982;wumpus 世界 FOL 化:9042;知识工程过程+电子电路:9095–9250。
  • 小结:9300 后。

ch9 一阶逻辑中的推断 (9331–10397) —— 已读完

  • 命题化:∀ 直接实例化对所有对象、∃ 需猜测(9.1);提升版推断:9339–9446。
  • 合一:Unify(x,y) 返回 MGU;Knows(John,x) 例子;x 不能同时=John 和 Elizabeth→标准化分离 x17:9446–9463;最一般合一子唯一:9469–9471;出现检查(S(x)≠S(S(x)),二次复杂度;Prolog 取消出现检查):9474–9478;算法图9-1:9479–9498。
  • 存储与检索:谓词索引/多键索引;包容格(4 个查询格点):9500–9544。
  • 前向链接:一阶确定子句(∀ 隐含);犯罪问题(美国出售武器给敌对国家→Criminal(West);Nono/导弹 M1):9551–9582;datalog=无函数符号:9583–9585;FOL-FC-Ask 图9-3:9595–9613;两次迭代走查:9615 起;高效问题:增量前向链接/合取排序(最稀有谓词优先):9646–9739。
  • 反向链接:FOL-BC-Ask;生成目标;深度优先;犯罪问题证明树图9-7:9764–9806;逻辑编程:Prolog(数据库语义:唯一名称+封闭世界+域闭包;否定即失败):9804–9905;冗余推断/无限循环:9849–9877;约束逻辑编程:9905–9929。
  • 归结:CNF 转换+斯科伦化(F(x)、G(x);斯科伦函数参数=辖域内全称变量):9934–9985;二元归结+因子提取=完备:9987–10000;犯罪问题归结证明图9-10(主线=反向链接):10002–10014;「好奇心害死猫」范例(Loves(x,F(x)) 等):10016–10059;反演完备:10061–10080;哥德尔不完全性定理(一阶逻辑本身完备、算术不完备):10082 起;等词处理:10156;归结策略(单元优先/输入归结/线性归结/SOS):10196–10397。
  • 小结:10360 后。

ch10 知识表示 (10398–11308) —— 已读完

  • 本体论工程:通用本体论难(CYC 4 条路径:专家写/数据库引入/文本抽取/业余输入;DBpedia/TextRunner/OpenMind):10412–10475;谷歌知识图谱 700 亿事实、1/3 搜索:10476–10478。
  • 类别:谓词 vs 物化为对象(Member/Subset 物化 reification):10480–10529;继承;分类学;不相交/完全分解/划分;单身汉=未婚成年男性;自然类(番茄/游戏/单身汉质疑;维特根斯坦家族相似、奎因):10598–10627。
  • 物理组成:PartOf 传递自反;PartPartition;束 BunchOf(袋中苹果重两磅;集合抽象无重量):10531–10565;量度:Length(L1)=Inches(1.5)=Centimeters(3.81);排序而非数值(诺维格习题更难:10590);定性物理:10567–10596。
  • 事物与物质:食蚁兽 vs 黄油(不可数;砍半≠两只):10629–10642。
  • 事件演算:T/Happens/Initiates/Terminates;物化事件可加任意信息(Bumpy(E1)):10661–10706;时间:瞬间/延续间隔;Allen 13 种间隔关系(Meet/Before/Overlap;伊丽莎白二世紧接乔治六世):10708–10727;流和对象:President(USA)=一个跨时间对象(1789 华盛顿、1797 亚当斯):10730–10747。
  • 精神对象/模态逻辑:Believes/Knows;引用不透明(Lois 爱 Superman 不爱 Clark):10749–10848。
  • 类别推理系统:语义网络(继承+缺省;实例/子类链):10855–10925;描述逻辑 Classic(And/All/AtLeast/AtMost/Fills;单身汉;包容/分类/一致性;多项式包容的代价=不能说否定析取或指数大描述):10926–10973。
  • 缺省推理:非单调(4 轮车例;人跳到结论);限定 circumscription(Abnormal 谓词最小化;尼克松菱形:贵格 vs 共和党;优先限定):10980–11048;缺省逻辑(规则 P:C if J 一致;拓展=最大结论集):11019–11037;缺省=阈值概率(刹车例;重卡下陡坡):11043–11048。
  • 真值维护:信念修正;JTMS(论证 justification;Retract(P) 删论证全靠 P 的语句;标记在内/外):11050–11079;ATMS(同时表示所有假设状态;标签):11088–11100;解释生成(汽车不启动;电瓶假设):11093–11100。
  • 小结:11105。

ch11 自动规划 (11309–12602) —— 已读完

  • 经典规划=离散/确定/静态/完全可观测中找动作序列:11321–11328;PDDL:一个动作模式表示 4Tn² 个动作、无需领域启发式:11329–11333;状态=基本流合取;数据库语义:11334–11341;动作模式=名称+变量+前提+效果;适用=前提满足;结果=删删除列表+加添加列表:11345–11359。
  • 范例领域:航空货运(Load/Unload/Fly;At 实义=「可取用」;解=11 行图11-1):11367–11390;备用轮胎(LeaveOvernight 效果=轮胎全没了;解=[Remove,Remove,PutOn]):11392–11411;积木世界(Clear 谓词;Move(b,x,y) 前提 On(b,x)∧Clear(b)∧Clear(y);Table 的特例处理:11413–11455)。
  • 前向搜索:货物 41 步解、分支 450–10450、平均 2000 种动作→2000^41 节点:11479–11490;反向(回归)搜索:相关动作(效果与目标合一且不否定目标);ISBN 例子:反向只考虑 1 个动作 vs 前向枚举 1 万亿 Buy:11520–11526;回归难点=含变量状态难做启发式→多数系统偏向前向:11530–11532。
  • SATPlan:命题化动作+动作排除公理+前提公理+初始状态+目标析取+后继状态公理:11534–11556;其他:Graphplan 规划图/情景演算/CSP 编码(Actionᵗ 单变量)/偏序规划(80 个装载动作无需定序;2000 年后前向搜索+启发式胜出;航天器/火星车规划人可读):11558–11593。
  • 启发式:因子化表示→领域无关启发式可自动推导:11595–11601;忽略前提(≈未满足目标数;集合覆盖 NP 难+贪心 logn 倍):11607–11619;8 数码松弛→错位数/曼哈顿自动导出:11620–11627;忽略删除列表(单调前进,爬山可解,FF=FastForward):11628–11710;对称约简(110 种积木对称状态留 1):11648–11654;可序列化子目标(积木自底向上;n 个开关;NASA 深空一号远程智能体实时控制):11660–11674;状态抽象(去掉 At 流;子目标独立假设;max Cost(Pi) 可容许、Σ 不可容许):11675–11705。
  • 分层规划:HTN;基元动作 vs 高层动作 HLA(Go(Home,SFO) 两种细化;真空世界递归细化):11733–11747;angelic 语义(恶魔 vs 天使非确定论;效果的「可能/必然」;「可能 HaveCash 时断言可能到达」):11834–11959 区。
  • 非确定域:无传感器规划(强解)、应变规划(中途分支/循环)、在线规划(监控+重规划):11959–12240 区。
  • 时间与调度:动作加持续时间+资源约束;关键路径法 CPM(ES/LS;松弛=LS−ES;零松弛=关键路径;85 分钟例:顶部作业 15 分钟松弛):12320–12345;最小松弛/时间窗;调度=CSP 求解:12350 后。
  • 11.7 分析:规划器竞赛;启发式质量决定成败:12382–12397。
  • 小结:12398。

ch12 不确定性的量化 (12606–13466) —— 已读完

  • 信念状态+应变规划三缺点:12616–12621;A90 机场规划+资格问题:12622–12628;理性决策=期望最大化性能度量:12629–12637。
  • 逻辑失败的 3 原因:惰性/理论无知/实践无知(Toothache⇒Cavity 不对):12641–12662;信念度+概率论;本体论承诺相同、认识论承诺不同:12662–12670;「概率是关于知识状态的断言,不是关于世界的」(0.8→0.4→0):12671–12683。
  • 决策论=概率论+效用理论;MEU 最大期望效用原则:12704–12711;DT-Agent 图12-1:12717–12725。
  • 概率基础:样本空间/可能世界(掷骰 36 个):12739–12748;事件=世界集合=命题:12754–12764;P(Total=11)=1/18:12764;无条件/先验 vs 条件/后验:12771–12779;P(cavity)=0.2、P(cavity|toothache)=0.6:12778–12779;条件概率定义+乘积法则:12786–12798。
  • 随机变量/值域/分布(Weather〈0.6,0.1,0.29,0.01〉):12805–12841;概率密度函数 Uniform(18–26C):12842–12864;联合分布:12865–12882;完全联合分布 16 格:12897–12901。
  • 柯尔莫哥洛夫公理;P(¬a)=1−P(a);容斥原理 P(a∨b)=P(a)+P(b)−P(a∧b):12903–12913;德菲内蒂 1931 赌博论证(不一致信念→必输的赌局组合;图12-2:4/3/2 美元赌注):12924–12953;「拒绝赌博就像拒绝时间流逝」:12955–12958;考克斯/杰恩斯:12959–12965。
  • 完全联合推断:图12-3 牙科 2×2×2 表(0.108…);P(cavity∨toothache)=0.28:12986–12987;边缘化 P(cavity)=0.2:12990;P(Cavity|toothache)=α〈0.12,0.08〉=〈0.6,0.4〉:13022–13024;式12-9 通用查询;O(2^n) 不可扩展(n=100→10^30 条目):13039–13043。
  • 独立性:天气与牙科 P(Toothache,Catch,Cavity,Weather)=P(Toothache,Catch,Cavity)P(Weather):13049–13067;3 等价形式:13072–13078。
  • 贝叶斯法则:脑膜炎例(P(s|m)=0.7,P(m)=1/50000,P(s)=0.01→P(m|s)=0.0014:13115–13124);诊断方向脆弱 vs 因果方向健壮(流行病例子):13141–13146;合并证据→条件独立 P(toothache∧catch|Cavity)=P(toothache|Cavity)P(catch|Cavity):13161–13174;分解 7 个数→5 个:13191–13196;「条件独立性=AI 近期历史最重要进展之一」:13199–13201。
  • 朴素贝叶斯:P(Cause,Effects)=P(Cause)∏P(Effecti|Cause):13203–13214;文本分类(news/sports/business/weather/entertainment;P(HasWord6|business)=0.37):13229–13258;未见词不许赋 0:13249–13251;垃圾邮件过滤:13259。
  • wumpus 概率版:P1,3≈31%、[3,1]≈31%、P2,2≈86%(逻辑 agent 不知道 [2,2] 更危险):13328–13333;frontier/other 分解:13309–13327。
  • 小结:13343–13366。

ch13 概率推理 (13467–14951) —— 已读完

  • 贝叶斯网络=DAG+每个节点一个随机变量+条件概率表 CPT:13487–13503;报警器例子(珀尔;Burglary/Earthquake/Alarm/JohnCalls/MaryCalls;P(j|a)=0.90,P(m|a)=0.70,P(a|b,e)=0.95):13513–13542;CPT 每行和为 1:13524–13532;「惰性与无知被概括进概率」(湿度/死老鼠卡警铃):13533–13540。
  • 语义:P(x1..xn)=∏P(xi|parents):13547–13561;P(j,m,a,¬b,¬e)=0.90×0.70×0.001×0.999×0.998=0.000628:13556–13557;构造法(链式法则+选最小父集;因果顺序更紧凑):13575–13610;紧凑性:局部结构化,k 父→2^k·n vs 2^n(n=30,k=5:960 vs 10 亿):13612–13624;节点顺序:M,J,A,B,E→13 参数;M,J,E,B,A→31 参数(=联合分布);原始 10 个:13632–13664;因果模型更少数值+更易得:13655–13660。
  • 条件独立性:非子孙性质;马尔可夫毯(父+子+子的其他父):13666–13689;d 分离 4 步(祖先子图/道德图/无向/阻塞):13691–13704。
  • 高效表示:确定性节点;CSI 特定上下文独立(if-then-else);噪声或(Fever=Cold/Flu/Malaria,q=0.6/0.2/0.1;P(¬fever|三者真)=0.6×0.2×0.1=0.012):13706–13757;k 参数 vs 2^k;CPCS 网络 448 节点 906 链:8254 vs 1.34 亿参数:13759–13762。
  • 精确推断:枚举 P(B|j,m)=α〈0.00059224,0.0014919〉≈〈0.284,0.716〉:13955–13959;Enumeration-Ask 图13-11:13975–13993;O(2^n);保险网络 2.27 亿次计算:13965–13966;重复子表达式(P(j|a)P(m|a) 算两次):13967–13970。
  • 变量消元:因子+逐点乘积+求和消元;f4(A)、f5(A) 二元向量:13996–14056;动态规划:13998;复杂度=网络树宽指数:14104–14147;聚类算法(junction tree):14148–14170。
  • 近似推断:直接采样(拓扑顺序;洒水器网络例子 [true,false,true,true]=0.324:14191–14221);一致的估计:14222–14228;拒绝采样(100 样本 73 拒;P(Rain|Sprinkler)≈〈0.296,0.704〉vs 真实〈0.3,0.7〉):14230–14261;证据多时接受率指数下降(保险网络千分之一到万分之一):14262–14271;小行星比喻:14272–14276;重要性采样/似然加权(固定证据变量,权重补偿):14278–14370;Gibbs 采样(MCMC;一次改一个变量;马尔可夫毯条件采样;Cloudy 例子 α〈0.001,0.020〉≈〈0.048,0.952〉:14420–14424;20/60 Rain 样本→〈0.25,0.75〉:14426–14430);平稳分布/细致平衡:14436–14463;每个样本代价独立于网络规模:14495–14497。
  • 因果网络:Fire→Smoke 反向等价但反直觉:14602–14619;结构方程(机制稳定;删链路=局部干预):14624–14636;do 算子:do(Sprinkler=true) 删入链→只影响后代(残缺图):14640–14683;「伸手打开洒水器不影响天气」:14677–14683;调整公式:14694–14700;后门准则(以 Rain 为条件关闭后门;反驳「只有 RCT 才能给因果信息」):14702–14724。
  • 小结:14726。

ch14 时间上的概率推理 (14952–16106) —— 已读完

  • 状态与观测:时间片/Δ(相机 1/30 秒;血糖 10 分钟变化→1 分钟间隔;大陆漂移 100 万年):14988–14993;雨伞世界(R_t 状态,U_t 证据):14999–15013。
  • 转移模型:马尔可夫假设(一阶 P(Xt|X0:t−1)=P(Xt|Xt−1)):15018–15028;时间齐次:15038–15042;传感器马尔可夫假设 P(Et|X0:t,E1:t−1)=P(Et|Xt):15043–15048;「下雨导致出现雨伞」箭头方向:15050–15053;联合分布 P(X0,E1:Xt,X1:t):15058–15070;提高精度两法:加阶数 vs 扩状态变量(可证等价):15077–15087;电池电量恢复马尔可夫性:15088–15096。
  • 推断 4 任务:滤波(状态估计)/预测/平滑/最可能解释(语音识别、噪声信道):15100–15129;学习(EM)指向第20章:15124–15129。
  • 滤波:递归估计两步(预测+更新):15133–15162;f1:t+1=Forward(f1:t,e);常量时间/空间:15158–15162;雨伞走查:P(R0)=〈0.5,0.5〉→第一天 0.667→第二天 0.75:15163–15174;预测收敛到平稳分布〈0.5,0.5〉(混合时间):15182–15190;似然消息:15191–15202。
  • 平滑:前后向消息乘积:15204–15231;前向-后向算法。
  • 最可能序列:维特比;把求和换 max:15289–15348;雨伞 [true,true,false,true,true] 图14-5。
  • HMM:单状态+单证据变量;简化矩阵;前向-后向;定位示例:15349–15512。
  • 卡尔曼滤波:连续状态、线性高斯;更新高斯分布;一维例子;适用范围(非线性→扩展/无迹卡尔曼):15513–15696。
  • DBN:每时间片任意多状态/证据变量;HMM=单变量 DBN;DBN 转成 HMM 则转移矩阵 O(d^2n) vs DBN O(nd^k)(42 脏位置:5×10^29→几千个参数):15697–15719;钥匙多峰例子(单个高斯凸起会给「前花园半空中」显著概率):15720–15730;构建:先验/转移/传感器 3 件套:15732–15758;瞬时故障故事(20 次 5 读数后 2 次 0→高斯误差模型误判电池耗尽;瞬时故障模型 P(BMeter=0|Battery=5)=0.03:15760–15801;持续故障模型+BMBroken 持续边(故障概率 0.001):15803–15815)。
  • 精确推断在 DBN 中=展开后变量消元(滚雪球);近似:粒子滤波(采样/重采样):15862–16105;Rao-Blackwellization:15990 区。
  • 小结:16016 后;参考文献:16030 后。

ch15 概率编程 (16107–17003) —— 已读完

  • 开篇:一阶概率模型=对象+关系+概率;一阶模型集合无限→求和不可行:16138–16156。
  • RPM(关系概率模型):数据库语义+唯一命名+域闭包,但不做封闭世界假设:16161–16170;图书推荐例子(Honest/Kindness/Quality/Recommendation;类型签名:16201–16205;先验 Honest(c)∼〈0.99,0.01〉:16216;RecCPT 50 行:16224;10 亿顾客 1000 万本书→10^70×10 可能世界但模型<300 参数:16231–16234);CSI 细化(不诚实顾客〈0.4,0.1,0.0,0.1,0.4〉:16239–16241);粉丝例子+关系不确定性(Author(B2) 未知→多路选择器:16261–16268;3 位 A1 粉丝+都给 5 分→A1 极可能是作者:16272–16277)。
  • 技能等级:埃洛分(初学者约 800、世界冠军>2800);Performance(i,g);TrueSkill 每天数亿用户:16279–16298。
  • 推断:落地/展开=命题化;相关性片段;缓存加速 3 个数量级;MCMC 在关系不确定下不增加网络复杂性:16300–16337。
  • OUPM(开宇宙):存在不确定性+身份不确定性(《飘》多 ISBN;sybil 女巫攻击数千 ID:16354–16358;视觉/文本/间谍例子:16363–16372);数字语句(#Customer∼UniformInt(1,3);#LoginID(Owner=c) if Honest then Exactly(1) else UniformInt(2,5)):16389–16399;泊松分布(均值 λ 方差 λ;蚂蚁 100 万→标准差 1000=0.1%):16400–16410;对象=生成历史〈LoginID,〈Owner,〈Customer,,2〉〉,3〉:16411–16428;世界概率=采样值乘积 1.2672×10^-11:16425–16426;MCMC 增删对象+部分世界:16459–16476。
  • 示例:引文匹配(CiteSeer/Google Scholar;两条引用串同一论文?):16485–16500 区;多目标跟踪(15.3):16600 区;交通监控:16697 区。
  • 概率编程:程序=概率模型;文本阅读例子(生成程序;英语文本生成):16717–16859。
  • 小结:16859。

ch16 做简单决策 (17004–18090) —— 已读完

  • 决策论 agent:概率+效用;回合式;EU(a)=ΣP(Result(a)=s′)U(s′);MEU:17034–17046;MEU 未解决 AI(感知/学习/表示/推断/因果模型/人类效用不确定):17047–17054;性能度量→内部效用函数:17055–17061。
  • 效用理论 6 公理:有序性/传递性/连续性/可替换性/单调性/可分解性(彩票 L=[p1,S1;…]):17070–17114;非传递偏好→1 美分换环骗光钱:17115–17127;von Neumann-Morgenstern 定理(效用函数存在+彩票效用=ΣpU):17132–17151;正仿射变换不变 U′=aU+b(温度类比):17151–17157。
  • 效用评估:标准彩票法(英格兰世界杯 0.3);微亡 micromort=百万分之一死亡;英国 370km=1 微亡、每微亡规避价值 60 美元、政府 6 美元;统计学生命价值约 1000 万美元(2019);石棉故事(拒绝标价=隐式更低定价):17173–17217;QALY:17216。
  • 金钱效用:100 万 vs 掷硬币(EMV=125 万但拒绝;效用 5/8/9 例子);Grayson 1960 对数效用;Beard 先生 U=−263.31+22.09·log(n+150000);风险厌恶/风险寻求(S 形;绝望区)/确定性等价(400 vs EMV500;保险费):17219–17277;风险中性=小额线性。
  • 决策后失望:k 个选项选最大估计→乐观偏差(顺序统计量):17279–17326。
  • 多属性:占优(严格/随机);偏好结构(加性):17411–17555。
  • 决策网络:机会节点(椭圆)/决策节点(矩形)/效用节点(菱形);机场选址;简化=动作效用=Q 函数:17556–17609;评估三步:17611–17624。
  • 信息价值 VPI:石油开采权例(信息价值=C/n:17641–17659);VPI 公式=有无信息的期望效用差:17665–17706;「信息只有能改变规划且新规划明显更好才有价值」:17705;VPI≥0(期望);不可加但次序独立:17708–17730;短视信息收集 agent(VPI/C 成本):17732–17758。
  • 未知偏好:榴莲冰激凌(不确定效用→引入 LikesDurian 随机变量:17844–17871);开关游戏(酒店 R/H;U∼Uniform(−40,+60);等待=0.4×0+0.6×30=+18 > 立即行动 +10 → 顺从动机来自偏好不确定性:17874–17924;EU(d)≥EU(a);若完全确定偏好则无顺从动机:17911–17924);H 的打扰成本/非理性 H(两岁小孩不该关掉自动驾驶):17925–17933。
  • 小结:17935–17953。

ch17 做复杂决策 (18091–19246) —— 已读完

  • 4×3 世界:动作不可靠(0.8 预期方向+0.1+0.1 垂直);[Up,Up,Right,Right,Right] 成功概率 0.8^5=0.32768;奖励:出口 ±1,其他 −0.04;10 步到达总效用 0.64:18105–18138;MDP 定义(状态/动作/转移 P(s′|s,a)/奖励 R(s,a,s′)):18139–18143;解=策略 π(s)(非序列):18144–18155;两种最优策略((3,1) Left vs Up;风险 vs 时间:18161–18164;r=−0.04 最优范围 −0.0850≤r≤−0.0273;r≤−1.6497 直奔最近出口;0<r 不离开→无限奖励;共 9 种最优策略:18165–18176)。
  • 时间效用:有限期(非平稳)vs 无限期(平稳);加性折扣奖励 Uh=Σγ^t R;γ=0.9⇔11.1% 利率;γ 等价每步 1−γ 意外终止;平稳性假设→加性折扣是唯一形式;无限和=Rmax/(1−γ);适当策略;平均奖励:18186–18255。
  • 状态效用 U(s);最优策略与初始状态无关;贝尔曼方程 U(s)=max_a ΣP(s′|s,a)[R+γU(s′)]:18257–18307;4×3 U(1,1) 方程:18301–18307;Q 函数 Q(s,a):18313–18330;奖励塑形 R′=R+γΦ(s′)−Φ(s)(势函数;函数设计定理):18331–18360。
  • 价值迭代:贝尔曼更新(非线性 max→迭代);图17-6 算法;压缩(除以2例子;唯一不动点;γ 因子压缩);误差界 N=⌈log(2Rmax/ε(1−γ))/log(1/γ)⌉;策略损失;i=5 时策略已最优但误差仍 0.51:18418–18528。
  • 策略迭代:策略评估+策略改进;线性方程组解 U;终止=改进后策略不变:18530–18597;线性规划:18598;在线算法(异步/实时):18613。
  • 老虎机:探索与利用;Gittins 指数(独立可索引;贴现);伯努利老虎机;UCB;不可索引变体:18664–18879。
  • POMDP:信念状态上的 MDP;传感器模型;价值迭代=信念空间分段线性凸;在线:18880–19245。
  • 小结:19200 后。

ch18 多智能体决策 (19247–20974) —— 已读完

  • 多智能体环境特性;单决策者 vs 多决策者;多智能体规划;合作与协调:19250–19477。
  • 正则形式博弈:参与者/动作/支付矩阵;两指猜拳(O one/two vs E;E+2,−3…);「为什么需要博弈论」=需考虑对方推理;解概念:19482–19531;纯/混合策略 [p:a;(1−p):b];策略组合:19521–19527。
  • 囚徒困境:支付矩阵(testify/refuse;−5/−10/0/−1);占优策略分析 3 步;占优策略均衡;困境=(testify,testify) 比 (refuse,refuse) 差:19532–19579;占优/强占优/弱占优/最佳反应:19550–19579。
  • 纳什均衡(纳什 1950 博士论文,1994 诺奖):单方面偏离无益;局部稳定;多均衡例子(t,l)/(b,r);协调问题+焦点:19581–19607;猜硬币无纯策略均衡→混合策略;纳什定理=混合策略均衡总存在:19608–19628。
  • 社会福利:帕累托最优;功利主义(总和;饼干狂热者);平等主义(极大化极小;基尼系数);囚徒困境=唯一非帕累托最优:19630–19659。
  • 计算均衡:穷举 m^n;迭代最佳反应;零和=冯诺依曼 1928 极大化极小(等价 LP):19661–19760 区。
  • 重复博弈(以牙还牙等):19761–19859;序贯博弈(扩展形式;逆向归纳;子博弈完美):19860–20050。
  • 辅助博弈:H 和 R 都是玩家;R 对 H 偏好有先验 P(θ);收益由 θ 定义且两人相同=都最大化 H 的收益;「有益 AI 的形式化模型」:20051–20064;均衡策略涌现教学/求许可/示范/纠错,无须形式化:20065–20070;回形针博弈(H 做 2 个回形针/2 个订书钉/各 1;θ=0.45;R 90/50;H 先行动=信号):20071–20092 区。
  • 合作博弈论:联盟结构;Shapley 值;计算:20090–20354。
  • 集体决策:合同网;拍卖(英式/荷式/首价密封/次价密封 Vickrey;说真话=占优策略);投票(Arrow 不可能性定理);议价:20355–20973。
  • 小结:20890 后。

ch19 样例学习 (20977–23254) —— 已读完

  • 学习定义:计算机观测数据→构建模型→假设;为何学:设计者无法预见所有情形+不知道怎么编程(辨家人面孔):20981–20992;本章=决策树/线性/非参数/集成+实用方法+理论:20993–20995。
  • 学习形式:7 个可学组件(自动驾驶刹车的例子):20997–21018;星系图像软件加速一千万倍+数据中心冷却省 40%:21019–21024;归纳 vs 演绎(归纳结论可能错):21032–21035;分类 vs 回归(高尔顿「向平均回归」注释:21054–21057);监督/无监督(聚类)/强化(输赢奖惩):21042–21067。
  • 监督学习:训练集/假设 h/假设空间 H/泛化/测试集:21069–21097;图19-1 4 个假设空间(直线/正弦/分段线性/12 次多项式):21102–21148;偏差 vs 方差;欠拟合/过拟合;偏差-方差权衡:21116–21144;奥卡姆剃刀+爱因斯坦引言:21133–21144;深度网络数十亿参数也能泛化→「参数个数不是好标准」:21141–21144;贝叶斯选择 h*;表达力与计算复杂性权衡(拟合图灵机不可判定):21158–21169。
  • 餐厅等待问题:10 属性(Alternate/Bar/Fri-Sat/Hungry/Patrons/Price/Raining/Reservation/Type/WaitEstimate);9216 种组合只 12 样例:21171–21214。
  • 决策树:表达式=析取范式;投票/奇偶函数需指数树;对角线边界需堆矩形:21216–21252;Type 差属性 vs Patrons 好属性:21262–21266;Learn-Decision-Tree 4 情形(全正/全负、继续分、空集用父多数、属性用尽用多数=噪声):21267–21312;学习曲线(95%,20 次平均,快乐图):21315–21326。
  • 信息增益:熵(公平硬币 1 位、四面骰 2 位、99% 硬币≈0.08 位):21328–21348;餐厅 p=n=6 熵=1 位:21351;Gain(Remainder);Patrons 信息增益最大:21359–21365。
  • 过拟合与剪枝:决策树剪枝;χ² 显著性检验(5%→Δ=7.82,3 自由度;Type 4 值):21382–21404;标签噪声线性影响、属性噪声渐进:21405–21408;多值属性偏置(日期属性):21422–21459 区。
  • 模型选择:验证集/交叉验证(留一);正则化(L1/L1+L2);超参数调整(网格/随机):21460–21700 区。
  • 学习理论:PAC 学习;哈夫丁不等式;VC 维;学习曲线经验律;「没有免费午餐」:21701–21838 区。
  • 线性回归:单变量;梯度下降(学习率 α;w0←w0+α(y−hw(x)));批梯度下降(凸损失,epoch);SGD(小批量 m;N=10000/m=100→计算 1/100、标准误×10、步数×10 仍快 10 倍):21888–21953;多变量+解析解 w*=(XᵀX)⁻¹Xᵀy:21974–21982;L1/L2 正则化:21996 区;硬阈值分类(感知机;线性可分;发散):22034–22102;逻辑斯谛回归(sigmoid):22103–22139。
  • 非参数:kNN(距离加权;维数灾难);k-d 树;局部敏感哈希;非参数回归(核平滑);SVM(最大间隔);核技巧:22140–22439。
  • 集成:自助聚合 bagging(25 棵树误差降到 6%?);随机森林;boosting(AdaBoost;样本加权);梯度提升;在线学习(感知机犯了错也行;乘法权重):22440–22707。
  • 开发 ML 系统:问题形式化(「巴黎照片」例子;损失≠真正目标):22714–22731;监督/无监督/强化界线模糊;弱监督(谎报年龄):22733–22746;数据:ImageNet 1400 万图 2 万标签;Waze;迁移学习/联邦学习;数据源头 provenance:22748–22769;数据量经验法则(困难问题几百万/一般 1000/每类几百-几千/参数 10 倍):22778–22784;数据增强(旋转裁剪);不平衡类(1000 万有效 vs 1000 欺诈;欠采样/过采样/SMOTE):22789–22805;离群值(316 美元;线性回归敏感、决策树健壮;取对数 1.3/1.4/2.5):22806–22820;特征工程:22822 后;训练调试(欠拟合/过拟合诊断表);信任/可解释性;运维监控漂移:22918–23000 区。
  • 小结:23180 后。

ch20 概率模型学习 (23255–24059) —— 已读完

  • 学习=不确定推理;贝叶斯观点为噪声/过拟合/最优预测提供通用解:23255–23267。
  • 糖果例子(5 种假设袋 h1 全樱桃…h5 全酸橙;贝叶斯学习=按所有假设加权预测;P(hi|d)=αP(d|hi)P(hi)):23273–23319;先验〈0.1,0.2,0.4,0.2,0.1〉;10 颗酸橙后 h5;贝叶斯预测渐近 1:23307–23319;错误假设后验最终消失;贝叶斯预测最优(数据无论大小):23326–23330;MAP(3 颗酸橙后 hMAP=h5→预测第 4 颗 1.0 vs 贝叶斯 0.8 更冒险):23334–23342;MAP+奥卡姆;MDL(−log2P(d|h)−log2P(h)=说明假设位数+额外数据位数):23353–23362;最大似然=均匀先验;大数据集先验被淹没:23363–23370。
  • 完全数据学习:密度估计;参数学习:23372–23379;最大似然 3 步法(似然→对数似然导数→解 0):23381–23410;0 计数问题(初始化 1):23408–23410;红/绿包装例子(θ,θ1,θ2 分解为 3 个独立方程):23415–23439;贝叶斯网络完全数据=逐参数频率:23434–23439。
  • 朴素贝叶斯学习:2n+1 参数;餐厅问题不及决策树(真假设是树);处理噪声/缺失;缺点=过度自信:23441–23461。
  • 生成 vs 判别模型(朴素贝叶斯 vs 逻辑斯谛;Ng&Jordan 2002:全数据 15 中 9 判别好;小数据 15 中 14 生成好):23465–23481。
  • 连续:单变量高斯(µ=样本均值,σ);线性高斯/贝叶斯线性回归:23483–23649;贝叶斯网络结构学习(评分/搜索):23650–23683;非参数密度估计:23684–23718。
  • EM:隐变量=医疗记录里没有疾病本身(诊断≠疾病);心脏病网络:去隐变量参数 78→708:23719–23749;无监督聚类=混合高斯(十万颗恒星光谱;红巨星/白矮星):23744–23811;E 步=算隐变量后验权重,M 步=加权频率重估;交替到收敛(局部极大);学习带隐变量的贝叶斯网络(EM for BN);学习 HMM(Baum-Welch);EM 一般形式(对数似然的期望下界);结构学习:23812–23990。
  • 小结:23995 后。

ch21 深度学习 (24060–25277) —— 已读完

  • 定义:复杂代数电路形式假设+可调连接强度;「深度」=多层;起源 McCulloch-Pitts 1943;「与真实神经元相似仅停留于表面」:24060–24071;浅层模型(线性回归:短路径+输入独立)vs 决策树(长路径但只对少数输入)vs 深度网络(长路径+所有输入复杂交互):24072–24092。
  • 前馈网络=DAG;循环网络=有记忆:24094–24099;单元 a_j=g_j(Σw_i,j·a_i);虚拟单元+1(w0,j 偏置):24105–24119;激活函数必须非线性(否则仍是线性);万能近似定理(两层:一层非线性+一层线性→任意精度逼近连续函数;指数多个「凸起」=查找表):24120–24126;sigmoid/ReLU(max(0,x))/softplus(导数=sigmoid)/tanh:24127–24141。
  • 计算图(数据流图);权重=「音量控制旋钮,决定下一个节点从特定前驱听到多少」:24152–24160;hw(x)=g⁽²⁾(W⁽²⁾g⁽¹⁾(W⁽¹⁾x)):24166;全连接:24170–24175。
  • 梯度:链式法则;感知误差 Δ5;反向传播=误差回传;g′=0 →梯度消失(sigmoid 平坦区/ReLU):24177–24213;自动微分(反向模式;动态规划效率);端到端学习:24214–24228。
  • 输入编码:布尔→0/1;数值缩放/对数;图像=数组结构(邻接重要);独热编码(Type 4 值;Thai=3/Burger=4 的数值邻接无意义):24241–24260。
  • 损失:负对数似然=交叉熵 H(P,Q)=ΣP log Q;KL 散度注释:24262–24315;softmax(〈5,2,0,−2〉→〈0.946,0.047,0.006,0.001〉;sigmoid=2 类 softmax):24297–24305;回归=线性输出层+高斯解释:24306–24310;隐藏层=输入的不同表示(边/角/椭圆/眼睛/脸);2010 年前 sigmoid/tanh→ReLU;「固定权重数:深而窄优于浅而宽」:24317–24340;「为什么某些结构更好几乎没理解;像厨师的直觉」:24341–24345。
  • 卷积:百万像素全连接=9 万亿权重;局部区域输入(一箭双雕:邻接+参数量 ln·n²):24347–24357;参数共享/卷积核(平移不变);池化与下采样:24432–24454;张量运算;残差网络 ResNet(恒等连接解决深度退化):24483–24519。
  • 学习算法:计算图梯度(前向/反向);批量归一化:24520–24618;泛化:架构选择/神经架构搜索/权重衰减/暂退 dropout(每次训练随机删单元):24619–24760。
  • RNN:输入向量+隐藏状态;训练=沿时间展开(BPTT);梯度消失/爆炸;LSTM(记忆单元 c 直接复制+加法更新,不乘累积;门=遗忘 f/输入 i/输出 o;更新公式 ft=σ(...):24842–24849);「LSTM 是 RNN 最早的实用形式之一」:24852–24853。
  • 无监督:孩子一张图认长颈鹿 vs 深度学习几千张:24856–24863;PPCA;自编码器(编码器 f+解码器 g;x≈g(f(x));线性自编码器=PCA):24914–24930;变分自编码器 VAE;GAN(生成器 vs 判别器博弈;「伪造者与侦探」):24940–24998 区;迁移学习与多任务(从 ImageNet/预训练 RoBERTa 出发:25019–25058,25043)。
  • 应用:视觉(21.8.1);NLP(21.8.2:词向量/预训练);强化学习(21.8.3:DQN/AlphaGo);社会影响:25059–25277。
  • 小结:25210 后。

ch22 强化学习 (25278–26409) —— 已读完

  • 监督学下棋的问题:10^8 样本 vs 10^40 局面空间;RL=与世界互动+定期奖励;「你正处于 MDP 中而不仅是求解它」;不懂规则的新游戏裁判告诉你输了:25287–25306;「AI 革命不该是有监督的」LeCun/Efros 注:25311–25313;奖励比标签容易(几行代码);稀疏奖励;「RL+深度学习→Atari/机器人/纸牌」:25317–25327。
  • 分类:基于模型 RL(学 U(s))/无模型(Q 学习学 Q(s,a)/策略搜索学 π(s)):25331–25347;「被动 RL=固定策略学效用」4×3 世界;γ=1:25359–25386。
  • 直接效用估计:reward-to-go;把 RL 化为监督学习;忽略贝尔曼约束(3 次试验 (3,3) 高效用→(3,2) 也要高,但 DUE 学不到)→收敛慢:25389–25410。
  • ADP:学转移模型+策略评估解贝尔曼;计数 Ns′|sa;P((3,2)|(3,3),Right)=1/2 例子:25412–25433;双陆棋 10^20 方程不可行:25432–25433;算法图22-2:25434–25452;(2,1)/(3,2) 分别在第 14/23 次试验才被发现连接 +1:25454–25457。
  • TD:Uπ(1,3)=−0.04+Uπ(2,3) 例;更新 U(s)←U(s)+α(R+γU(s′)−U(s));学习率 α(n)=60/(59+n):25459–25500;TD vs ADP(观测后继 vs 所有可能后继;单次调整 vs 保持一致;TD=ADP 的粗略有效近似;伪经验/优先扫描):25502–25536。
  • 主动 RL:探索;GLIE;乐观主义(乐观初始化);遗憾;UCB;安全探索(教师示范/安全控制员接管直升机):25538–25683。
  • Q 学习:学 Q(s,a) 免模型;TD 更新式(22-7);「重要性质在于它所不包含的内容:不需要转移模型」;奖励稀疏时困难:25684–25713;算法图22-8:25714–25725;SARSA(用实际执行的 a′;探索产生负奖励时 SARSA 惩罚该动作而 Q 学习不会):25727–25743;离策略 vs 同策略:25736–25743。
  • 泛化:近似直接效用估计;近似 TD;深度强化学习(DQN;Atari):25746–25872;奖励函数设计(伪奖励/塑形);分层强化学习(选项):25873–25989;策略搜索(策略梯度;REINFORCE;进化策略):25990–26068;学徒学习与逆强化学习(观察人类演示反推奖励):26069–26168;应用:电子游戏/机器人控制:26169–26408。
  • 小结:26140 后。

ch23 自然语言处理 (26413–27608) —— 已读完

  • 开篇:说话 10 万年、写字 5 千年;NLP 3 理由(交流/学习/科学理解;维基 3000 万页事实:26427);自然语言 vs 形式语言:歧义「He saw her duck」/模糊「That's great!」/无符号-对象映射:26435–26455;语言模型=字符串的概率分布:26456–26463;萨丕尔「任何文法都有所遗漏」/戴维森「不存在语言这种东西…没有像 Python 3.8 那样的英语」:26464–26470。
  • 词袋:朴素贝叶斯句子分类;生成模型=袋子抽词:26472–26518;语料库(25 亿词维基、140 亿词 iWeb):26494–26497;P(stocks|business)≈700/100000=0.007:26501;分词(aren't):26516–26518。
  • n 元模型:每个词只依赖前 n−1 个;unigram/bigram/trigram:26520–26548;垃圾邮件/情感分析/作者归属:26543–26548;字符级模型(丹麦语 Speciallæge…;语言识别 99%+):26551–26560;跳字 skip-gram(je ne comprends pas):26561–26565。
  • 平滑:低频 n 元方差;未登录词 (或 /; 起始符):26567–26582;拉普拉斯平滑(太阳系 200 万天,1/(N+2)):26589–26596;回退/线性插值(λ3+λ2+λ1=1,EM 训练);Witten-Bell/Kneser-Ney/stupid backoff:26597–26607。
  • 单词表示:n 元无泛化(原子模型);「the fulvous kitten」泛化;词嵌入指向 24 章;WordNet(kitten IS-A young_mammal):26609–26638。
  • 词性标注:45 标签 Penn Treebank(300 万词);HMM 生成模型:26640–26709;语言模型比较(困惑度):26754–26793。
  • 文法:CFG(上下文无关文法);「S 爱上 NP」;概率 PCFG;树库:26794–26883;句法分析:CYK O(n³)/乔姆斯基范式;束搜索/移位归约 O(n):26884–26994;依存分析:26995–27010;从样例学句法分析器:27011–27042;扩展文法(主谓一致/代词格):27043–27158;语义解释(逻辑形式):27159–27234;真实语言复杂性:27235–27362。
  • NLP 任务:语音识别(错误率 3–5%≈人工转录;2011 深度学习→错误率立即改进约 30%):27367–27375;文本-语音(WaveNet 2/3 听者认为更自然):27376–27384;机器翻译(n 元限制:7 元也难传到句尾;seq2seq(Sutskever 2015)解决;注意力(Vaswani 2018)再提升;某些语言对达人类水平:27385–27399);信息提取(TextRunner/NELL):27400–27409;信息检索;问答(AskMSR 模板搜索;Aristo 八年级科学 91.6%):27410–27424。
  • 小结:27426–27445;乔姆斯基「概率模型对句法无洞见」造成 20 年回避统计模型:27452–27457。

ch24 自然语言处理中的深度学习 (27609–28345) —— 已读完

  • 词嵌入:独热无法捕捉相似性;Firth「要知道一个单词的含义就要看它周围是什么单词」:27635;10 万词表 5 元=10^25 计数→缩到几百维稠密向量=词嵌入:27637–27643;语义相似词彼此邻近(GloVe 60 亿词;country/kinship/transportation/food 聚类):27651–27655;向量算术:Athens→Greece 的差 B−A=国家/首都;Oslo+ (B−A)≈Norway:27658–27669;「无法保证捕捉特定语义关系;受欢迎是因为对下游任务是好表示」:27672–27674;word2vec/GloVe/fastText(157 语言):27676–27679;词性标注 8 步(窗口 w=5;词嵌入矩阵 E v×d;3 层网络):27688–27716。
  • RNN 语言模型:上下文问题(Eduardo/Miguel/him 需整句):27722–27731;RNN 参数 O(1) vs 前馈 O(n) vs n 元 O(vn):27752–27757;解决不对称问题:27758;训练=预测下一个词(hello→world):27767–27772;生成=采样(可选最可能/按概率/过采样冷门=超参数):27773–27778;莎士比亚伪文本:27779–27783;RNN 分类(共指消解):27785–27792。
  • 序列到序列:源 RNN+目标 RNN;编码器-解码器:27837–27892。
  • 注意力:目标 RNN 每生成一词关注源句不同部分(The→La, door→puerta);上下文向量 ci=注意力得分 rij 经 softmax=aij 加权平均源向量:27893–27915;注意力组件本身无可学习权重;「完全是潜在的」:27916–27920;softmax 3 作用(可微/远距离上下文/表示不确定性):27921–27926;注意力概率可被人解释=词对齐矩阵:27927–27930。
  • 解码:贪心解码(The front door is red→La entrada 错误;没有纠错机制):27936–27954;束搜索(保留 k 个假设; 结束;现代 NMT 束宽 4–8 vs 统计 MT ≥100):27955–27968。
  • Transformer:「Attention is all you need」(Vaswani 2018);自注意力=从源到源+目标到目标;查询 qi=Wq·xi/键 ki=Wk·xi/值 vi=Wv·xi;点积偏向自身→3 个投影解决;比例因子√d:27970–27995;多头注意力(复制 m 份各自权重再拼接):27996–28001;每层=自注意力+前馈+残差连接;通常 6 层或更多:28003–28011;不显式捕捉词序→位置嵌入(每个位置学一个向量):28012–28017;编码器(分类用)vs 解码器(自注意力只看前面+额外注意力到编码器输出):28026–28033。
  • 预训练:互联网每天新增超 1000 亿单词文本;Common Crawl:28035–28047;GloVe=无监督词嵌入(ice/steam 与 solid/gas 共现概率比;两向量点积=共现概率对数;台式机 CPU 几小时可训几十亿词):28054–28082;材料科学嵌入(NiFe:铁磁性 ↔ IrMn:反铁磁性;2008 前摘要训练→前 5 预测中 3 个在 2009–2019 才被发现):28083–28094。
  • 上下文表示:多义词 rose(花 vs rise 过去式)一个嵌入不够:28096–28110;RNN 上下文嵌入(预测下一词训练):28111–28125。
  • 掩码语言模型 MLM:「The river __ five feet」填空;句子本身提供标签;不需要标注数据:28126–28146(=BERT 思路)。
  • SOTA:2018「NLP 的 ImageNet 时刻」(Ruder):28148–28155;word2vec 2013/GloVe 2014;预训练上下文表示训练开销高几个量级→GPU/TPU 普及;Transformer 让更大更深网络可训(软件进步而非硬件):28156–28162;RoBERTa 问答/阅读理解 SOTA;GPT-2:15 亿参数、40GB 文本训练、零微调多任务:28163–28168;GPT-2 生成样本(「.tell me a story」×9 崩溃例:28183–28185);Aristo 八年级 91.6%(RoBERTa 单独 88.2%):28189–28193;T5(750GB C4 语料 350 亿词;「translate English to German: That is good」→「Das ist gut」;Winograd referent 标记):28211–28218;上下文限制几百词(Reformer 100 万):28219–28221;RoBERTa 训练 2.2 万亿词:28222;「为什么舍弃文法句法?数据驱动更易开发维护、基准分更高;是否学到潜在表征我们根本不知道」:28226–28232;「处理了人类一辈子读不完的数千倍文本仍落后人类」:28239–28241;混合方法(Kitaev-Klein 注意力句法分析器最佳纪录):28233–28238。

ch25 计算机视觉 (28346–29568) —— 已读完

  • 主动 vs 被动传感(蝙蝠/海豚/深海鱼);特征=简单计算得到的数字(飞行动物估算撞击时间);哥斯拉玩具歧义:28356–28383;两个核心问题=重建+识别:28384–28390。
  • 图像形成:透视收缩;针孔照相机(视杆细胞 1 亿/视锥 500 万;光圈;运动模糊);透视投影 x=fX/Z(远的小/图像倒转);消失点(铁轨):28394–28449;透镜(暗图像噪声;光圈大→散焦):28451–28465;缩放正交投影:28477;光线与明暗:28486;颜色:28534。
  • 简单特征:边缘/纹理/光流/自然图像分割:28561–28751。
  • 图像分类:CNN;ImageNet 1400 万图 3 万类、189 狗子类;2010 Top5<70%→2012 CNN 98%(超人类)→2019 Top1 87%:28784–28802;MNIST 70000 手写数字;局部模式(环/交叉/尾端)+空间关系→「局部小邻域构建特征→观察特征的模式的模式」;卷积+ReLU=局部模式检测器:28804–28830。
  • 物体检测(滑动窗口/候选区域):28831–28932;三维:多视图/双目立体(视差)/运动(光流)/单视图线索:28933–29074。
  • 应用:理解人类行为;匹配图片与文字(CLIP 类);多视图重建;单视图几何;生成图片(GAN):29075–29330;视觉控制运动:29331–29567。
  • 小结:29490 后。

ch26 机器人学 (29569–31107) —— 已读完

  • 机器人=实体智能体+效应器+传感器;部分可观测+随机;连续状态/连续动作(机械臂 6-7 关节、人形数百关节);「真实世界拒绝比真实时间更快运行」→ sim-to-real:29569–29602。
  • 硬件:机械手/移动机器人/四旋翼 UAV/AUV/巡视器/腿式:29609–29630;传感器:被动(相机)/主动(声呐);测距仪/立体视觉/Kinect 结构光;飞行时间相机 60 帧/秒;扫描激光雷达 100m 精度<1cm;雷达穿云(千米级);GPS(31 卫星,米级;差分 GPS 毫米级;室内/水下失效):29637–29678;本体感受:轴编码器/计程(轮子打滑)/陀螺仪/力与扭矩传感器(拧灯泡例子;每秒几百次):29679–29694;执行器(电动/液压/气动):29696 起。
  • 机器人感知:定位(位姿 (x,y,θ);地标模型 vs 距离扫描模型):29788–29827;蒙特卡罗定位 MCL=粒子滤波(先验均匀→走廊双峰→进房间单峰:29829–29860);卡尔曼滤波/EKF(线性化=泰勒展开;误差椭圆;多峰失败):29861–29882;SLAM 同时定位与地图构建(鸡与蛋):29883–29890;感知的监督/无监督学习:29904。
  • 规划与控制:构形空间(自由度;障碍物=构形空间障碍;Piano mover);运动规划(RRT 等);轨迹跟踪控制(PID);最优控制(LQR):29930–30387。
  • 不确定运动规划:29883+;机器人强化学习(利用模型;利用演示/其他信息):30457–30519;人与机器人(协调;学习人类期望=辅助博弈):30520–30738;其他框架:反应式控制器/包容架构(Brooks):30739–30809;应用领域:30810 起。
  • 小结:30980 后。

ch27 人工智能的哲学、伦理和安全性 (31110–32154) —— 已读完

  • 弱 AI vs 强 AI(希尔勒 1980;强 AI 定义漂移到 AGI):31120–31125;Newcomb 1903「空中飞行人类永远无法应对」:31126–31128。
  • 极限:非形式化论据(德雷福斯;GOFAI;资格问题;「擅长飞盘而弱于逻辑」克拉克;体验认知):31133–31163;能力缺陷论据(图灵列表:善良/幽默/恋爱/犯错/享受草莓奶油;泰迪熊/Levy 2050):31165–31181;数学异议(卢卡斯/彭罗斯;哥德尔命题;3 个反驳:卢卡斯命题、四色证明 11 年后发现问题、计算机≠图灵机是有限的):31183–31218。
  • 衡量:图灵测试(5 分钟对话;30% 误判;图灵预测 2000 年 10 亿存储);Eugene Goostman 33%(乌克兰男孩人设;「或许图灵测试是关于人类易受骗性的测试」):31220–31244;「潜艇能否游泳」迪杰斯特拉:31246–31257;礼貌惯例:31258–31262;中文房间(希尔勒):31264 起;意识与感质:31283。
  • 伦理:致命性自主武器(27.3.1);监控/安全/隐私(27.3.2);公平与偏见(27.3.3:COMPAS 等);信任与透明度(27.3.4);工作前景(27.3.5);机器人权利(27.3.6):31308–31792。
  • AI 安全:FMEA/FTA(螺栓/桥梁/海啸备份服务器);正确性 vs 安全性(轮胎爆胎);咖啡机器人意外副作用;低影响 low impact(「首先,不要伤害」=正则化);公地悲剧/奥斯特罗姆 7 原则:31793–31851;specification gaming(Racakovna:游戏崩溃/用尽内存;摔倒式快速移动的高个子生物):31852–31860;安全网格世界:31861–31863;价值对齐问题=迈达斯问题;税法比喻(「让机器人愿意纳税好过强迫;足够聪明的机器人总会找到逃税方法」:31870–31873);模仿学习 vs 逆强化学习(AlphaZero/直升机特技):31874–31882;辅助博弈+人类不完美(撒谎/自我毁灭;人类许可错误):31883–31894;「国家/企业=非人类实体,我们已有数百年合作经验,记录并不振奋人心(战争/气候)」:31895–31900;古德 1965 智力爆炸/文奇 1993 奇点/库兹韦尔 2017:31901–31912。
  • 小结:32100 后。

ch28 人工智能的未来 (32155–32494) —— 已读完

  • 专家预测 50–100 年接近人类水平;10 年内每年贡献上万亿美元;反对者认为 AGI 尚需几个世纪:32164–32167。
  • 组件:传感器与执行器(激光雷达 75000→1000 美元→单芯片 10 美元;雷达数一叠纸;机器人=80 年代早期 PC):32174–32195;世界状态表示(原子→命题→一阶→概率时序→RNN;「罗素和诺维格喝茶」高层次行为难;「有起必有落」抽象概念难;通用可复用表示仍艰巨):32197–32214;动作选择(「4 年大学毕业」数亿基元步骤→需分层;POMDP 未分层):32216–32225;决定想要什么(效用函数难;开箱即用 agent 缺个体经验;奖励函数知识工程;逆强化学习):32227–32245 区。
  • 28.2 架构:模块性/组合:32372 起;28.3 目标(标准模型 vs 益机)。
  • 小结:32480 后。