当前位置: 主页 > 神经科学 > 科研资讯

可塑性神经网络中关系学习与快速知识重组的神经机制

2026-04-21 16:54 Kenneth Kay Nature Neuroscience 阅读 0
核心摘要: 本研究通过元学习训练人工神经网络,揭示了关系学习中传递性推理和列表链接的神经机制。网络自发演化出两种解决方案:被动值编码和主动轨迹模拟。只有主动网络能通过重新编码和动态恢复神经轨迹实现快速知识重组,为理解大脑关系推理提供了新模型。

导语:人类和动物具有惊人的学习经验中项目(如刺激、物体和事件)之间关系的能力,这使其能够进行结构化泛化和快速吸收新信息。这种关系学习的一个基本类型是顺序学习,它能够实现传递性推理(如果A > B且B > C,则A > C)和列表链接(A > B > C和D > E > F在学习C > D后快速“重组”为A > B > C > D > E > F)。尽管研究历史悠久,但对于传递性推理和顺序知识的快速重组,一直缺乏神经生物学上合理的机制。本研究报告,赋予神经调节突触可塑性(允许自我导向学习)并通过人工元学习(学会学习)识别的神经网络,能够执行传递性推理和列表链接,并且进一步地,表达出在人类和动物中广泛观察到的行为模式。至关重要的是,只有采用“主动”解决方案的网络——其中过去试验中的项目以重新编码的形式在神经活动中被恢复——才能够进行列表链接。这些结果识别了关系学习的完全神经机制,并强调了发现此类机制的方法。

关系学习的奥秘:从“传递性推理”到“列表链接”

关系学习,特别是学习序列中项目之间的顺序关系(例如,A > B > C > D > E > F),是高级认知的核心。它使我们能够进行传递性推理(从A > B和B > C推断A > C)和列表链接(将两个已知的短序列A > B > C和D > E > F,在仅学习C > D这一个关系后,就立即整合成一个完整的长序列A > B > C > D > E > F)。这种快速重组的能力是“知识组装”的标志。

尽管行为学上已被充分研究,但支持这些能力的神经机制一直是个谜。本研究使用元学习训练人工神经网络,使其在解决一系列顺序学习任务的过程中,“学会”如何学习关系。由此产生的网络自发演化出了两种不同的解决方案,但只有其中一种(“主动”解决方案)能够实现快速的列表链接。

核心发现:两种解决方案,一种关键机制——“主动恢复”

1. 元学习训练产生两种网络“天性”

研究者使用元学习范式,让循环神经网络在一个由大量顺序判断任务组成的“元训练集”上进行训练。每个任务要求网络学习一个5项序列(A > B > C > D > E)的顺序,然后在测试中判断从未一起出现过的项目对(如B vs D)的顺序。网络通过基于梯度的元学习调整其权重,同时其突触可塑性本身也是可学习的(即学习“如何学习”)。

经过训练的网络成功学会了执行传递性推理。然而,有趣的是,网络群体分化出两种在计算上截然不同的解决方案:

  • “被动”网络:其行为可以用一个经典的“符号距离效应”模型完美解释。网络似乎编码了项目在序列中的绝对“位置”值(例如,A=1, B=2, ...)。在测试中,它比较这些值来做判断。这种网络无法进行列表链接
  • “主动”网络:其行为模式更符合动物实验中观察到的“预期值”模型(例如,在比较B和D时,反应时更倾向于预期胜出的项目D)。更关键的是,这种网络能够成功地进行列表链接。在仅学习C > D这一个新关系后,它能立即将两个已知序列合并成一个一致的6项序列。

2. “主动”网络的内部机制:项目“重新编码”与“恢复”

通过分析“主动”网络的内部活动,研究者发现了其快速重组的机制:

  • 重新编码:在顺序学习过程中,网络不只是简单地学习项目标签(A, B, C...)。它学习将每个项目重新编码为一个高维的、随机的神经活动模式(“神经状态”)。重要的是,这些模式之间没有预设的、反映顺序的几何关系。
  • 关系学习:网络通过赫布型突触可塑性学习的是项目对之间的转换关系(从A的状态到B的状态的转换)。
  • 主动恢复:当被问到比较B和D时,“被动”网络会计算其内部存储的“位置值”。而“主动”网络则主动地、动态地恢复(或“想象”)出从B到C再到D的神经轨迹。在这个过程中,它首先激活B的神经状态,然后通过已学习的转换规则(B→C和C→D)顺序地、快速地在神经活动中“重放”或“模拟”出C和D的状态。然后,它基于模拟轨迹的终点(D)与起点(B)的状态差异来做判断。正是这种对中间项目(C)的“主动恢复”,使得网络能够在仅知道C > D时,立即将D插入到B之后的正确位置,从而实现列表链接。

结论与意义:从“静态值”到“动态模拟”的计算转换

这项研究为理解大脑如何进行关系推理提供了全新的、可检验的神经计算模型。

  • 理论突破:提出了关系学习的两种不同计算机制:“被动值编码”和“主动轨迹模拟”。前者可以解释基本的传递性推理,但无法解释快速的知识重组。后者提出,大脑可能并非将知识存储为静态的“值”,而是作为可被重新激活和遍历的“神经轨迹”。推理过程是一个主动的、动态的模拟过程。
  • 神经机制:识别了突触可塑性(学习转换规则)和神经活动恢复(重放/模拟轨迹)作为核心机制。这与海马体中观察到的“重放”现象高度吻合。海马体已知在离线状态下会重放序列轨迹,而本研究提出,在需要推理时,大脑在线地、快速地进行类似的恢复过程。这为海马体在关系记忆和推理中的作用提供了计算解释。
  • 行为解释:该模型自然地解释了“符号距离效应”(对间隔远的项目对(如A vs E)反应比间隔近的(如B vs D)更快),因为恢复整个轨迹需要时间。它还预测,在“主动”方案中,反应时应偏向于轨迹中先被模拟到的项目(预期值效应),这与动物实验数据相符。
  • 方法论创新:展示了元学习作为发现神经计算机制的强大工具。通过让网络在大量相关任务上“学习如何学习”,网络自组织地演化出了复杂的行为策略,然后可以被逆向分析其内部机制。这为在其他认知领域(如概念形成、因果推理)发现神经机制提供了范例。
  • 人工智能启示:该工作为开发能够进行组合泛化快速知识整合的人工智能系统提供了新思路。传统的深度学习模型通常需要大量数据来学习“端到端”的映射,而此研究展示了一种通过内部动态模拟来实现结构化推理的“系统2”式方法。

该研究的通讯作者Kenneth Kay总结道:“我们的工作揭示了大脑进行快速知识重组的秘密。它可能不是将知识编码为一组静态的数字(如A=1, B=2),而是将知识编码为一种可以随时被‘重新体验’的神经轨迹。当需要推理时,大脑会在内部快速‘播放’这些轨迹,模拟出从未直接体验过的状态。正是这种主动的、基于模拟的策略,使得大脑能够像搭积木一样,将分开学习的知识片段迅速地、灵活地组装成新的知识结构。” 这项发表于《Nature Neuroscience》的研究,通过计算建模与行为分析相结合,为理解关系学习和知识重组的神经计算原理提供了深刻见解。

原文链接https://www.nature.com/articles/s41593-024-01852-8

    发表评论