
在《什么是智能?》一书中,Blaise Agüera y Arcas探讨了生物和人工系统中智能的基本方面。在第四章的节选中,他研究了时序差分学习——一种强化学习算法。时序差分学习通过不断预测预期奖励并根据实际奖励更新这个预测模型来工作。该方法由Richard Sutton在1980年代发明,旨在将巴甫洛夫条件反射的现有数学模型转化为机器学习算法。在多巴胺神经元记录实验中,Wolfram Schultz的实验室发现:当猴子偶然发现产生糖水饮料的动作时,这些多巴胺神经元的放电率上升;一旦猴子学会视觉线索和奖励之间的关联,奖励到来时不再释放额外的多巴胺,而是在呈现视觉线索时释放。Peter Dayan和Read Montague意识到,多巴胺的行为恰恰像时序差分学习信号——大脑的“评论家”告诉“演员”:请强化你正在做的任何行为,因为我预测它将导致未来奖励。本文节选自《什么是智能?》一书,系统解析时序差分学习、多巴胺作为预测误差信号及其局限。
一、时序差分学习基础
二、时序差分学习 vs. 常规预测学习
关键优势:通过使用估计未来奖励的变化作为学习信号,可以在游戏输赢或食物被吃之前判断给定动作是好(应强化)还是坏(应惩罚)。
三、演员-评论家框架
四、多巴胺作为时序差分学习信号
关键洞察(Dayan & Montague):多巴胺的行为恰恰像时序差分学习信号——大脑的“评论家”告诉“演员”:请强化你正在做的任何行为,因为我预测它将导致未来奖励。
五、多巴胺的进化
六、局限与注意事项
七、结论:优雅的概念简化,但非全貌
时序差分学习是一种优雅的概念简化,它照亮了某些角落,但并没有照亮每个角落。它既不是大脑所做事情的完整表示,也不是精确表示。像本书中描述的每一种其他机器学习方法一样,时序差分学习是一个优雅的概念简化,为理解大脑提供了启示。
核心信息:
-
时序差分学习:通过时间上连续预测之间的差异分配信用。
-
演员-评论家:评论家(价值函数)估计预期奖励;演员(策略函数)决定行动。
-
多巴胺作为时序差分信号:奖励预测误差,从奖励本身转移到预测奖励的线索。
-
进化:多巴胺从代表食物 → 附近食物(已经是预测)。
-
局限:大脑不完全是时序差分学习;人类是更强大的学习者。
参考来源:
Agüera y Arcas, B. (2025). What Is Intelligence? Lessons from AI About Evolution, Computing, and Minds. MIT Press.
(责任编辑:泉水) |