跳到主要内容

心智中的强化学习 — 从巴甫洛夫的狗到多巴胺神经元

这一章讲三件事: TD 学习怎么解释动物条件反射的一串「反直觉」实验现象; 习惯/目标导向这条心理学老区分怎么精确对上 model-free/model-based; 多巴胺=奖励预测误差假说的内容、证据边界,以及它为什么值得认真对待。 读完你会明白这本书为什么敢把「工程算法」与「大脑」写进同一本书。

1. 定位:不是类比,是「独立撞车」

先把作者的态度摆正:RL 的算法是纯计算动机造出来的,并不试图复刻动物;但它与动物学习理论撞出了大量独立发现的对应——作者认为这恰恰最有价值,因为两边独立,对应之处暴露的是学习的通用计算原则1。而且方向是双向的:RL 的形式化(任务、回报、算法分家)正在帮心理学理清实验数据、提示新实验1

2. 心理学:条件反射的三桩「怪事」

背景一分钟。 巴甫洛夫的狗听到节拍器就分泌唾液——原本中性的刺激(条件刺激 CS)因反复预告食物(非条件刺激 US)而引发反应(CR)。这是经典条件反射;CS 与 US 之间的间隔 ISI 是关键变量2

20 世纪的实验攒出一堆现象,最扎眼的两桩:

  • blocking(阻滞):先训练「音调→气吹」,兔子学会对音调眨眼;再加入灯光与音调一起配对吹气;最后单独测灯光——兔子几乎不对灯光眨眼。旧灯光什么都没学到。这直接打脸「时间接近就足以建立联结」的朴素理论:灯光与 US 的接近度明明和当年音调一样3
  • 高级条件化:节拍器(已条件化)后面跟个黑方块(不再给食物);十次之后,黑方块单独也能引发分泌——一个「二手」强化物凭空获得了强化力4

TD 模型一箭三雕。 把第 06 章的 TD 误差 δ 搬过来当作「学习信号」:δ>0 意外的好消息,加强此前的线索;δ≈0 一切如期,没有新东西可学。于是:

主走查:blocking 的 TD 读法(机制为书中 TD 模型,数值为演示编的)

阶段一:音调→食物。食物到来时 δ = 奖励 − 预期 = 1 − 0 = +1 → 音调的预测被抬高。
反复几次后,音调期 δ≈0(食物已完全被音调预告)。
阶段二:音调+灯光→食物。食物到来时 δ = 1 − (音调已预告的≈1) ≈ 0
→ 灯光什么误差信号都没分到 → 学不到任何东西。就是 blocking。
阶段三(高级条件化):黑方块→节拍器。节拍器携带「预告食物」的价值,
节拍器出现时 δ>0 → 黑方块的预测被抬高 —— 价值沿链传播,无需食物出场。

要点:阶段二里灯光学不到,不是因为「灯不配」,而是预测误差被先来的音调吃光了——这正是 Rescorla–Wagner 模型(1972)解释 blocking 的思路,而 TD 模型=「把它的误差换成时间差分」,于是顺手把 CR 的时间提前性(兔子学会在气吹前一刻才闭眼)与高级条件化也一并解释了——后两件事是 Rescorla–Wagner 处理不了的5

第三桩对应:习惯 vs 目标导向。 心理学的老区分——习惯由先行刺激自动触发,快但僵;目标导向靠「动作→后果」的知识控制,慢但能随机应变(检验法:把奖励贬值,目标导向的动物立刻改行为,习惯照做不误)。作者指出这与 model-free/model-based 的区别精确对应,并用大鼠迷宫给出并排图解:model-free 仓库里存的是动作值,走熟了就照值走;model-based 存的是转移知识与各目标的奖励值,现算路径6

3. 神经科学:多巴胺=奖励预测误差假说

假说内容(首次明确表述:Montague, Dayan & Sejnowski 1996):哺乳动物多巴胺神经元的相位性(phasic)活动,功能之一是向全脑投递「新旧奖励预期之间的误差」——拿 TD 误差的格式逐字对上:δ>0 对应高于背景放电率的爆发,δ<0 对应跌到背景之下的抑制(神经元不能负放电,所以是「背景率+δ」)7

证据来自 Wolfram Schultz 实验室 1980–90 年代的猴子实验。书里归纳了四个平行特征(为让 TD 误差「知道时间」,假设刺激启动一串按时刻分布的内部状态,即 CSC 表示)8:

学习阶段多巴胺神经元TD 误差 δ
初学,奖励意外到达在奖励时刻爆发R−V = 1−0 = +1
学成,线索预告奖励爆发前移到线索时刻;奖励时刻不再反应线索期 δ=+1;奖励期 δ=R−V≈0
更早的线索出现爆发再前移给最早线索价值沿链被 bootstrapping 传回去
学成后奖励缺席在预定奖励时刻跌破背景δ=0−V=负

主走查的第 4 行是最锋利的一条:「预料之中的奖励不引起多巴胺」与「奖励缺席时多巴胺跌到背景之下」——这两个现象,行为主义时代就是条件反射研究的著名怪事,而它们恰好是 TD 误差的直接推论。多巴胺像是给全脑群发的 δ9

架构层面,书里还给了神经 actor–critic:actor(策略)与 critic(值/δ)分别映射到基底神经节的不同通路;更早的源头是 Klopf 的「享乐主义神经元」假说——本书的故事从这个人的想法开始(第 01 章的献词),在这里闭环10

4. 作者的判断与证据

有实验的: blocking、高级条件化、Schultz 实验室的四个特征,都是可复现的实验事实;「TD 误差与多数受测多巴胺神经元的活动惊人相似」是书里认可的证据强度11

是假说、书里明说边界的: ①不是所有受测神经元都符合;②输入表示(CSC 等)是人为假设,多巴胺反应的时间细节对表示选择敏感;③多巴胺在厌恶(惩罚)情境中的角色仍有争议;④书里专节承认存在假说对不上的情形,并列出补丁思路。总评:假说在研究奖励学习的神经科学家中广受接纳、且面对新实验数据表现出显著的韧性——但它是假说,不是定理12

作者立场的诚实注脚: 术语对不上要当心——心理学里的 reinforcement 另有严格定义(撤掉刺激后效果仍持续才算),RL 借词时放宽了;书末专门有一节做术语对照13

5. 边界与局限

  • 对应集中在经典条件反射与奖励学习;高级认知(语言、长程思考)本书不碰。
  • 「多巴胺=δ」是降级近似:真实多巴胺参与运动、成瘾、精神分裂等多重功能,书里自己也先列了一堆非学习职能14
  • 神经 actor–critic 是「启发映射」级别的主张,不是电路级的证明;书里用词是「可以如此解读」。
  • 成瘾一节给出假说式解读(药物劫持预测误差机制),证据链与假说同级别,不要当定论引用15

6. 可带走的

  1. 独立撞车最有说服力:RL 算法与动物学习规律互不相谋而对上,说明两边都摸到了通用计算原则。
  2. blocking 的机理:预测误差是稀缺品(先来先得),先来的线索把它吃光,后来的线索学不到——「时间接近」从来不是充分条件。
  3. TD 模型一箭三雕:blocking、CR 的时间提前、高级条件化,一个 δ 全解释;前两者旧理论各管一摊。
  4. 习惯/目标导向 = model-free/model-based:奖励贬值实验就是判别实验;术语不同,结构相同。
  5. 多巴胺群发 δ:意外的好消息=爆发、如期的奖励=沉默、缺席的奖励=跌破背景;四行表是这一章的心脏。
  6. 「预料之中的奖励不引起多巴胺」:这条反直觉现象是假说最漂亮的胜利,也是它可证伪(能被实验推翻)的检验点。
  7. 引用纪律:对上的部分引「实验事实」,机制归因引「假说」;术语(reinforcement)在两个学科里不等价。

7. 原文地图

主题原书章原文位置
章旨、通用计算原则Psychologytext/17-fm-psychology.txt:9(搜「making sense of experimental data」) · text/17-fm-psychology.txt:22(搜「computational principles」)
Pavlov、CS/US/CRPsychologytext/17-fm-psychology.txt:103(搜「metronome」) · text/17-fm-psychology.txt:120(搜「conditioned stimulus」)
blockingPsychologytext/17-fm-psychology.txt:160(搜「Blocking」) · text/17-fm-psychology.txt:175(搜「temporal contiguity」)
高级条件化、TD 模型三合一Psychologytext/17-fm-psychology.txt:183(搜「black square」) · text/17-fm-psychology.txt:196(搜「bootstrapping idea」)
习惯 vs 目标导向Psychologytext/17-fm-psychology.txt:1006(搜「antecedent stimuli」) · text/17-fm-psychology.txt:959(搜「Model-Free」)
RPE 假说Neurosciencetext/18-fm-neuroscience.txt:190(搜「Reward Prediction Error」) · text/18-fm-neuroscience.txt:195(搜「Montague」)
背景率、CSC 表示Neurosciencetext/18-fm-neuroscience.txt:213(搜「background firing rate」) · text/18-fm-neuroscience.txt:218(搜「serial compound」)
四平行特征Neurosciencetext/18-fm-neuroscience.txt:233(搜「phasic response」) · text/18-fm-neuroscience.txt:239(搜「omitted」)
多巴胺基础Neurosciencetext/18-fm-neuroscience.txt:266(搜「substantia nigra」)
TD/多巴胺对应Neurosciencetext/18-fm-neuroscience.txt:534(搜「Correspondence」)
假说的边界Neurosciencetext/18-fm-neuroscience.txt:250(搜「do not match」) · text/18-fm-neuroscience.txt:258(搜「resilient」)
神经 actor–critic、成瘾Neurosciencetext/18-fm-neuroscience.txt:753(搜「Actor–Critic」) · text/18-fm-neuroscience.txt:1396(搜「Addiction」)

Footnotes

  1. 出处:「Psychology」第 9 段(text/17-fm-psychology.txt:9,搜「making sense of experimental data」)与第 22 段(text/17-fm-psychology.txt:22,搜「computational principles」)。 2

  2. 出处:「Psychology」第 103 段(text/17-fm-psychology.txt:103,搜「metronome」)与第 110 段(搜「conditioned stimulus」);ISI 与 delay/trace 在第 120-140 段(搜「Trace Conditioning」)。

  3. 出处:「Psychology」第 160 段(text/17-fm-psychology.txt:160,搜「Blocking」)与第 175 段(text/17-fm-psychology.txt:175,搜「temporal contiguity」);对照组脚注在第 206 段(搜「control group」)。

  4. 出处:「Psychology」第 183 段(text/17-fm-psychology.txt:183,搜「black square」)。

  5. 出处:「Psychology」第 196 段(text/17-fm-psychology.txt:196,搜「bootstrapping idea」);Rescorla–Wagner 的提出在第 178 段(搜「Rescorla–Wagner」);CR 的时间提前性例子(兔子瞬膜)在第 145-152 段(搜「nictitating」)。

  6. 出处:「Psychology」第 1006 段(text/17-fm-psychology.txt:1006,搜「antecedent stimuli」)与图 14.5 说明(第 1012-1075 段,搜「Model-Free」)。

  7. 出处:「Neuroscience」第 190 段(text/18-fm-neuroscience.txt:190,搜「Reward Prediction Error」)与第 193 段(搜「Montague」);「背景率+δ」的假设在第 214-216 段(搜「background firing rate」)。

  8. 出处:「Neuroscience」第 218 段(text/18-fm-neuroscience.txt:218,搜「serial compound」);四个特征列表在第 231-240 段(text/18-fm-neuroscience.txt:233,搜「phasic response」)。

  9. 出处:「Neuroscience」第 239 段(text/18-fm-neuroscience.txt:239,搜「omitted」)与第 534 段起的 15.6 节(搜「Correspondence」)。主走查表格中的 δ 数值是按 TD 误差定义编排的演示值。

  10. 出处:「Neuroscience」第 753 段(text/18-fm-neuroscience.txt:753,搜「Actor–Critic」);Klopf 与享乐主义神经元在第 1099 段(搜「Hedonistic Neurons」),文献注在第 1699 段(搜「Klopf」)。

  11. 出处:「Neuroscience」第 248 段(text/18-fm-neuroscience.txt:248,搜「striking correspondence」)。

  12. 出处:「Neuroscience」第 250 段(text/18-fm-neuroscience.txt:250,搜「do not match」)与第 257 段(搜「resilient」);厌恶情境的争议在第 274 段(搜「aversive」)。

  13. 出处:「Psychology」第 41 段(text/17-fm-psychology.txt:41,搜「borrowed from animal learning」)。

  14. 出处:「Neuroscience」第 268 段(text/18-fm-neuroscience.txt:268,搜「motivation」)。

  15. 出处:「Neuroscience」第 1396 段(text/18-fm-neuroscience.txt:1396,搜「Addiction」)。