跳到主要内容

深度强化学习:基础、研究与应用 — 书籍拆解

读到哪:未读。 readState 不是 read/partial 的书不能当锚

作者待填
版次2022 版
格式pdf | 文本源 pdftotext -layout
许可自购/个人收藏
来源主人个人藏书,2026-08 放入收件箱
清洗删页眉页脚 344 行、页码 652 行、断词接回 10 处

我们重写的拆解(0 章)

(还没写。拆解是这本书对我们的真正产出——底下的元数据只是索引。)

为什么收它

和 Sutton & Barto 互补:那本讲经典 RL 理论,这本讲深度时代的做法。

合法性

自购/个人收藏。来源:主人个人藏书,2026-08 放入收件箱。原始文件不入库,转码文本入库(私有库)。

出版方怎么说

(起草参考,不是我们的判断。真正的「覆盖什么/不覆盖什么」写进 frontmatter 的 claims / notCovered)

它覆盖什么、不覆盖什么

(还没读到能下判断的程度。claims / notCovered 空着就是空着,不猜。)

怎么引用它

(依据: book=deep-rl-fundamentals-research-applications §基础部分)

章节名对不上会被 lab:validate 拦下;页码锚(§p.123)同样可用。

结构(27 段,共 728k 字符)

章节规模
01版权页p.2–117.9k
02前言p.12–2112.1k
03目录p.22–3023.3k
04基础部分p.31–310.5k
05第1章 深度学习入门p.32–7255.9k
06第2章 强化学习入门p.73–139114.4k
07第3章 强化学习算法分类p.140–14811.3k
08第4章 深度Q网络p.149–17542.4k
09第5章 策略梯度p.176–22980.0k
10第6章 深度Q网络和Actor-Critic的结合p.230–26552.8k
11研究部分p.266–2661.2k
12第7章 深度强化学习的挑战p.267–28732.4k
13第8章 模仿学习p.288–31851.3k
14第9章 集成学习与规划p.319–3279.6k
15第10章 分层强化学习p.328–34426.3k
16第11章 多智能体强化学习p.345–35514.0k
17第12章 并行计算p.356–37217.5k
18应用部分p.373–3730.7k
19第13章 Learning to Runp.374–38310.7k
20第14章 鲁棒的图像增强p.384–39516.0k
21第15章 AlphaZerop.396–41722.8k
22第16章 模拟环境中机器人学习p.418–44130.5k
23第17章 Arena:多智能体强化学习平台p.442–46221.8k
24第18章 深度强化学习应用实践技巧p.463–47416.0k
25附录A 算法总结表p.476–4808.8k
26附录B 算法速查表p.481–50528.0k
27附录C 中英文对照表p.506–52119.3k

我们自己的读书笔记(0 篇)

(还没有。读完某章后写进 docs/deep-rl-fundamentals-research-applications/notes/,那才是这本书对我们的产出。)


本页由 node scripts/book-build.mjs 生成:表格来自转码结果,散文来自书卡正文。不要手改本页。