Reinforcement Learning: An Introduction — 书籍拆解
读到哪:未读。
readState不是 read/partial 的书不能当锚。
| 项 | |
|---|---|
| 作者 | Richard S. Sutton、Andrew G. Barto |
| 版次 | 2nd edition (2018, MIT Press;作者站点免费 PDF) |
| 格式 | pdf | 文本源 pdftotext -layout |
| 许可 | 作者官网免费发布(MIT Press 版权) |
| 来源 | 作者 Richard Sutton 个人站点 incompleteideas.net 教材页(the-book-2nd.html)挂出的免费 PDF,2026-08-23 取 |
| 清洗 | 删页眉页脚 329 行、页码 255 行、断词接回 208 处、按书规则修复 2231 处 |
我们重写的拆解(0 章)
(还没写。拆解是这本书对我们的真正产出——底下的元数据只是索引。)
为什么收它
强化学习的标准教材。以后碰到「agent 怎么从反馈里学」这类问题,它是最硬的原理出处。
合法性
作者官网免费发布(MIT Press 版权,作者获准放出电子版)。原始文件不入库,转码文本入库(私有库)。
转码注记
这本 PDF 的字体编码有坏字(↵ 实为 ff、⇤ 实为 *),已在
library/reinforcement-learning-sutton-barto/clean-rules.json 配了修复规则,
本轮修了 2231 处;另删掉页眉页脚 329 行、页码 255 行。
它大概覆盖什么、不覆盖什么
覆盖:RL 的完整理论体系(赌博机、MDP、动态规划、蒙特卡洛、TD、函数近似、策略梯度)。 不覆盖:深度 RL 的工程实践、LLM 时代的 RLHF——出版年代早于那些。
它覆盖什么、不覆盖什么
(还没读到能下判断的程度。claims / notCovered 空着就是空着,不猜。)
怎么引用它
(依据: book=reinforcement-learning-sutton-barto §Introduction)
章节名对不上会被 lab:validate 拦下;页码锚(§p.123)同样可用。
结构(22 段,共 1876k 字符)
| 段 | 章节 | 页 | 规模 |
|---|---|---|---|
| 01 | Preface to the Second Edition | p.13–16 | 14.8k |
| 02 | Preface to the First Edition | p.17–18 | 6.3k |
| 03 | Summary of Notation | p.19–22 | 8.9k |
| 04 | Introduction | p.23–46 | 77.6k |
| 05 | Multi-armed Bandits | p.47–68 | 64.3k |
| 06 | Finite Markov Decision Processes | p.69–94 | 88.8k |
| 07 | Dynamic Programming | p.95–112 | 58.9k |
| 08 | Monte Carlo Methods | p.113–140 | 86.8k |
| 09 | Temporal-Difference Learning | p.141–162 | 77.4k |
| 10 | n-step Bootstrapping | p.163–180 | 47.3k |
| 11 | Planning and Learning with Tabular Methods | p.181–218 | 116.9k |
| 12 | On-policy Prediction with Approximation | p.219–264 | 145.1k |
| 13 | On-policy Control with Approximation | p.265–278 | 42.4k |
| 14 | *Off-policy Methods with Approximation | p.279–308 | 206.3k |
| 15 | Eligibility Traces | p.309–342 | 111.8k |
| 16 | Policy Gradient Methods | p.343–362 | 55.2k |
| 17 | Psychology | p.363–398 | 120.3k |
| 18 | Neuroscience | p.399–442 | 149.8k |
| 19 | Applications and Case Studies | p.443–480 | 164.8k |
| 20 | Frontiers | p.481–502 | 76.3k |
| 21 | References | p.503–540 | 131.5k |
| 22 | Index | p.541–549 | 24.8k |
我们自己的读书笔记(0 篇)
(还没有。读完某章后写进 docs/reinforcement-learning-sutton-barto/notes/,那才是这本书对我们的产出。)
本页由 node scripts/book-build.mjs 生成:表格来自转码结果,散文来自书卡正文。不要手改本页。