一项发表于《自然·神经科学》的研究发现,行为和奖赏学习速率与奖励间隔时长成正比。具体而言,在多种小鼠实验条件下,行为和奖赏学习速率与奖励间隔时长成比例关系。由于这一规则,在固定时长内,总体学习效果与经历的条件刺激-奖励配对数量无关。基于奖赏触发的回溯性学习的多巴胺模型(ANCCR)解释了这些发现,从而为学习的生物学机制提供了统一的解释。
研究背景与意义
学习奖赏的因果关系对生存至关重要。线索-奖赏联想学习在大脑中由中脑边缘多巴胺控制。广泛认为多巴胺通过传递奖赏预测误差来驱动学习。基于多巴胺的学习算法通常是“基于试验的”:学习随着每次线索-结果体验顺序进行。这些模型的一个基本假设是,在固定时长内经历的线索-奖赏配对越多,学到的关联就越多。本研究通过识别一个新的控制学习的生物学原理,推翻了这一假设。
主要发现与ANCCR模型
研究通过在不同试验间隔下对小鼠进行线索-奖赏条件反射,发现行为和奖赏学习速率与奖励间隔时长成正比。这意味着,延长试验间隔十倍,学习所需的试验次数减少十倍,而总学习时间保持不变。这一规则同样适用于厌恶性线索-电击学习。研究提出的ANCCR模型(在每次奖赏时回溯性更新线索-奖赏关联)自然地解释了这种比例缩放关系,而传统的强化学习模型无法捕捉这一规律。
参考文献
(2026). Duration between rewards controls the rate of behavioral and dopaminergic learning. Nature Neuroscience, 29, 825–839. DOI: 10.1038/s41593-026-02206-2
该研究通过在小鼠中进行不同试验间隔的线索-奖赏条件反射实验,发现行为和奖赏学习速率与奖励间隔时长成比例,总学习时间保持恒定。研究提出了基于奖赏触发的回溯性学习模型(ANCCR),该模型通过贝叶斯规则自然解释了这一比例缩放规律,而传统的时间差强化学习模型无法捕捉该规律。研究团队来自加州大学旧金山分校等机构。