生物行移动版

主页 > 神经科学 > 类脑智能与AI

什么是智能?——节选


在《什么是智能?》一书中,Blaise Agüera y Arcas探讨了生物和人工系统中智能的基本方面。在第四章的节选中,他研究了时序差分学习——一种强化学习算法。时序差分学习通过不断预测预期奖励并根据实际奖励更新这个预测模型来工作。该方法由Richard Sutton在1980年代发明,旨在将巴甫洛夫条件反射的现有数学模型转化为机器学习算法。在多巴胺神经元记录实验中,Wolfram Schultz的实验室发现:当猴子偶然发现产生糖水饮料的动作时,这些多巴胺神经元的放电率上升;一旦猴子学会视觉线索和奖励之间的关联,奖励到来时不再释放额外的多巴胺,而是在呈现视觉线索时释放。Peter Dayan和Read Montague意识到,多巴胺的行为恰恰像时序差分学习信号——大脑的“评论家”告诉“演员”:请强化你正在做的任何行为,因为我预测它将导致未来奖励。本文节选自《什么是智能?》一书,系统解析时序差分学习、多巴胺作为预测误差信号及其局限

一、时序差分学习基础

 
 
方面 描述
发明者 Richard Sutton(1980年代,UMass Amherst心理学博士研究生)
目标 将巴甫洛夫条件反射的数学模型转化为机器学习算法
核心问题 “学习预测,即使用过去对不完全已知系统的经验来预测其未来行为”
信用分配问题 长链的动作和观察可能导致最终奖励,但在动作和奖励之间创建直接关联只能使智能体学习该链的最后一步

二、时序差分学习 vs. 常规预测学习

 
 
方法 信用分配方式
常规预测学习 通过预测和实际结果之间的差异分配信用
时序差分学习 通过时间上连续预测之间的差异分配信用

关键优势:通过使用估计未来奖励的变化作为学习信号,可以在游戏输赢或食物被吃之前判断给定动作是好(应强化)还是坏(应惩罚)。

三、演员-评论家框架

 
 
组件 功能
评论家 估计预期奖励(价值函数
演员 决定采取什么行动(策略函数
学习过程 评论家通过将其预测与实际奖励(通过执行演员指示的动作获得)进行比较来学习;演员通过学习如何执行最大化评论家预期奖励的动作来改进

四、多巴胺作为时序差分学习信号

 
 
实验观察(Schultz实验室,猕猴) 发现
基线 多巴胺神经元通常以中等背景率放电
偶然发现奖励 当猴子偶然发现产生糖水饮料的动作时,多巴胺神经元放电率上升
学会关联后 一旦猴子学会视觉线索和奖励之间的关联,奖励到来时不再释放额外的多巴胺,而是在呈现视觉线索时释放(同时猴子舔嘴唇)
奖励被扣留 如果视觉线索后奖励被扣留,多巴胺神经元活动随后下降(相对于背景率变安静)

关键洞察(Dayan & Montague):多巴胺的行为恰恰像时序差分学习信号——大脑的“评论家”告诉“演员”:请强化你正在做的任何行为,因为我预测它将导致未来奖励。

五、多巴胺的进化

 
 
方面 描述
早期双侧动物 多巴胺不再代表食物,而是代表附近食物(已经是食物的预测,而非食物奖励本身)
预测的预测 预测多巴胺因此是对食物预测的预测
保守性 多巴胺信号已被保存了数亿年,其角色至少是可识别的

六、局限与注意事项

 
 
局限 描述
不是全部 多巴胺的实验发现不能证明大脑实施了Sutton公式化的时序差分学习——这不可能是全部故事
更强大的学习者 人类(可能许多其他动物)是比时序差分学习算法更强大的学习者(我们毫不费力玩的先进棋盘游戏超出了时序差分学习的能力)
多巴胺编码更多信息 最近的实验表明,多巴胺编码的信息远远超出时序差分误差信号

七、结论:优雅的概念简化,但非全貌

时序差分学习是一种优雅的概念简化,它照亮了某些角落,但并没有照亮每个角落。它既不是大脑所做事情的完整表示,也不是精确表示。像本书中描述的每一种其他机器学习方法一样,时序差分学习是一个优雅的概念简化,为理解大脑提供了启示。

核心信息

  • 时序差分学习:通过时间上连续预测之间的差异分配信用。

  • 演员-评论家:评论家(价值函数)估计预期奖励;演员(策略函数)决定行动。

  • 多巴胺作为时序差分信号:奖励预测误差,从奖励本身转移预测奖励的线索

  • 进化:多巴胺从代表食物 → 附近食物(已经是预测)。

  • 局限:大脑不完全是时序差分学习;人类是更强大的学习者。

参考来源
Agüera y Arcas, B. (2025). What Is Intelligence? Lessons from AI About Evolution, Computing, and Minds. MIT Press.

(责任编辑:泉水)