心智中的强化学习 — 从巴甫洛夫的狗到多巴胺神经元
这一章讲三件事: TD 学习怎么解释动物条件反射的一串「反直觉」实验现象; 习惯/目标导向这条心理学老区分怎么精确对上 model-free/model-based; 多巴胺=奖励预测误差假说的内容、证据边界,以及它为什么值得认真对待。 读完你会明白这本书为什么敢把「工程算法」与「大脑」写进同一本书。
1. 定位:不是类比,是「独立撞车」
先把作者的态度摆正:RL 的算法是纯计算动机造出来的,并不试图复刻动物;但它与动物学习理论撞出了大量独立发现的对应——作者认为这恰恰最有价值,因为两边独立,对应之处暴露的是学习的通用计算原则1。而且方向是双向的:RL 的形式化(任务、回报、算法分家)正在帮心理学理清实验数据、提示新实验1。
2. 心理学:条件反射的三桩「怪事」
背景一分钟。 巴甫洛夫的狗听到节拍器就分泌唾液——原本中性的刺激(条件刺激 CS)因反复预告食物(非条件刺激 US)而引发反应(CR)。这是经典条件反射;CS 与 US 之间的间隔 ISI 是关键变量2。
20 世纪的实验攒出一堆现象,最扎眼的两桩:
- blocking(阻滞):先训练「音调→气吹」,兔子学会对音调眨眼;再加入灯光与音调一起配对吹气;最后单独测灯光——兔子几乎不对灯光眨眼。旧灯光什么都没学到。这直接打脸「时间接近就足以建立联结」的朴素理论:灯光与 US 的接近度明明和当年音调一样3。
- 高级条件化:节拍器(已条件化)后面跟个黑方块(不再给食物);十次之后,黑方块单独也能引发分泌——一个「二手」强化物凭空获得了强化力4。
TD 模型一箭三雕。 把第 06 章的 TD 误差 δ 搬过来当作「学习信号」:δ>0 意外的好消息,加强此前的线索;δ≈0 一切如期,没有新东西可学。于是:
主走查:blocking 的 TD 读法(机制为书中 TD 模型,数值为演示编的)
阶段一:音调→食物。食物到来时 δ = 奖励 − 预期 = 1 − 0 = +1 → 音调的预测被抬高。
反复几次后,音调期 δ≈0(食物已完全被音调预告)。
阶段二:音调+灯光→食物。食物到来时 δ = 1 − (音调已预告的≈1) ≈ 0
→ 灯光什么误差信号都没分到 → 学不到任何东西。就是 blocking。
阶段三(高级条件化):黑方块→节拍器。节拍器携带「预告食物」的价值,
节拍器出现时 δ>0 → 黑方块的预测被抬高 —— 价值沿链传播,无需食物出场。
要点:阶段二里灯光学不到,不是因为「灯不配」,而是预测误差被先来的音调吃光了——这正是 Rescorla–Wagner 模型(1972)解释 blocking 的思路,而 TD 模型=「把它的误差换成时间差分」,于是顺手把 CR 的时间提前性(兔子学会在气吹前一刻才闭眼)与高级条件化也一并解释了——后两件事是 Rescorla–Wagner 处理不了的5。
第三桩对应:习惯 vs 目标导向。 心理学的老区分— —习惯由先行刺激自动触发,快但僵;目标导向靠「动作→后果」的知识控制,慢但能随机应变(检验法:把奖励贬值,目标导向的动物立刻改行为,习惯照做不误)。作者指出这与 model-free/model-based 的区别精确对应,并用大鼠迷宫给出并排图解:model-free 仓库里存的是动作值,走熟了就照值走;model-based 存的是转移知识与各目标的奖励值,现算路径6。
3. 神经科学:多巴胺=奖励预测误差假说
假说内容(首次明确表述:Montague, Dayan & Sejnowski 1996):哺乳动物多巴胺神经元的相位性(phasic)活动,功能之一是向全脑投递「新旧奖励预期之间的误差」——拿 TD 误差的格式逐字对上:δ>0 对应高于背景放电率的爆发,δ<0 对应跌到背景之下的抑制(神经元不能负放电,所以是「背景率+δ」)7。
证据来自 Wolfram Schultz 实验室 1980–90 年代的猴子实验。书里归纳了四个平行特征(为让 TD 误差「知道时间」,假设刺激启动一串按时刻分布的内部状态,即 CSC 表示)8:
| 学习阶段 | 多巴胺神经元 | TD 误差 δ |
|---|---|---|
| 初学,奖励意外到达 | 在奖励时刻爆发 | R−V = 1−0 = +1 |
| 学成,线索预告奖励 | 爆发前移到线索时刻;奖励时刻不再反应 | 线索期 δ=+1;奖励期 δ=R−V≈0 |
| 更早的线索出现 | 爆发再前移给最早线索 | 价值沿链被 bootstrapping 传回去 |
| 学成后奖励缺席 | 在预定奖励时刻跌破背景 | δ=0−V=负 |
主走查的第 4 行是最锋利的一条:「预料之中的奖励不引起多巴胺」与「奖励缺席时多巴胺跌到背景之下」——这两个现象,行为主义时代就是条件反射研究的著名怪事,而它们恰好是 TD 误差的直接推论。多巴胺像是给全脑群发的 δ9。
架构层面,书里还给了神经 actor–critic:actor(策略)与 critic(值/δ)分别映射到基底神经节的不同通路;更早的源头是 Klopf 的「享乐主义神经元」假说——本书的故事从这个人的想法开始(第 01 章的献词),在这里闭环10。
4. 作者的判断与证据
有实验的: blocking、高级条件化、Schultz 实 验室的四个特征,都是可复现的实验事实;「TD 误差与多数受测多巴胺神经元的活动惊人相似」是书里认可的证据强度11。
是假说、书里明说边界的: ①不是所有受测神经元都符合;②输入表示(CSC 等)是人为假设,多巴胺反应的时间细节对表示选择敏感;③多巴胺在厌恶(惩罚)情境中的角色仍有争议;④书里专节承认存在假说对不上的情形,并列出补丁思路。总评:假说在研究奖励学习的神经科学家中广受接纳、且面对新实验数据表现出显著的韧性——但它是假说,不是定理12。
作者立场的诚实注脚: 术语对不上要当心——心理学里的 reinforcement 另有严格定义(撤掉刺激后效果仍持续才算),RL 借词时放宽了;书末专门有一节做术语对照13。
5. 边界与局限
- 对应集中在经典条件反射与奖励学习;高级认知(语言、长程思考)本书不碰。
- 「多巴胺=δ」是降级近似:真实多巴胺参与运动、成瘾、精神分裂等多重功能,书里自己也先列了一堆非学习职能14。
- 神经 actor–critic 是「启发映射」级别的主张,不是电路级的证明;书里用词是「可以如此解读」。
- 成瘾一节给出假说式解读(药物劫持预测误差机制),证据链与假说同级别,不要当定论引用15。
6. 可带走的
- 独立撞车最有说服力:RL 算法与动物学习规律互不相谋而对上,说明两边都摸到了通用计算原则。
- blocking 的机理:预测误差是稀缺品(先来先得),先来的线索把它吃光,后来的线索学不到——「时间接近」从来不是充分条件。
- TD 模型一箭三雕:blocking、CR 的时间提前、高级条件化,一个 δ 全解释;前两者旧理论各管一摊。
- 习惯/目标导向 = model-free/model-based:奖励贬值实验就是判别实验;术语不同,结构相同。
- 多巴胺群发 δ:意外的好消息=爆发、如期的奖励=沉默、缺席的奖励=跌破背景;四行表是这一章的心脏。
- 「预料之中的奖励不引起多巴胺」:这条反直觉现象是假说最漂亮的胜利,也是它可证伪(能被实验推翻)的检验点。
- 引用纪律:对上的部分引「实验事实」,机制归因引「假说」;术语(reinforcement)在两个学科里不等价。
7. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 章旨、通用计算原则 | Psychology | text/17-fm-psychology.txt:9(搜「making sense of experimental data」) · text/17-fm-psychology.txt:22(搜「computational principles」) |
| Pavlov、CS/US/CR | Psychology | text/17-fm-psychology.txt:103(搜「metronome」) · text/17-fm-psychology.txt:120(搜「conditioned stimulus」) |
| blocking | Psychology | text/17-fm-psychology.txt:160(搜「Blocking」) · text/17-fm-psychology.txt:175(搜「temporal contiguity」) |
| 高级条件化、TD 模型三合一 | Psychology | text/17-fm-psychology.txt:183(搜「black square」) · text/17-fm-psychology.txt:196(搜「bootstrapping idea」) |
| 习惯 vs 目标导向 | Psychology | text/17-fm-psychology.txt:1006(搜「antecedent stimuli」) · text/17-fm-psychology.txt:959(搜「Model-Free」) |
| RPE 假说 | Neuroscience | text/18-fm-neuroscience.txt:190(搜「Reward Prediction Error」) · text/18-fm-neuroscience.txt:195(搜「Montague」) |
| 背景率、CSC 表示 | Neuroscience | text/18-fm-neuroscience.txt:213(搜「background firing rate」) · text/18-fm-neuroscience.txt:218(搜「serial compound」) |
| 四平行特征 | Neuroscience | text/18-fm-neuroscience.txt:233(搜「phasic response」) · text/18-fm-neuroscience.txt:239(搜「omitted」) |
| 多巴胺基础 | Neuroscience | text/18-fm-neuroscience.txt:266(搜「substantia nigra」) |
| TD/多巴胺对应 | Neuroscience | text/18-fm-neuroscience.txt:534(搜「Correspondence」) |
| 假说的边界 | Neuroscience | text/18-fm-neuroscience.txt:250(搜「do not match」) · text/18-fm-neuroscience.txt:258(搜「resilient」) |
| 神经 actor–critic、成瘾 | Neuroscience | text/18-fm-neuroscience.txt:753(搜「Actor–Critic」) · text/18-fm-neuroscience.txt:1396(搜「Addiction」) |