
一项发表在《Current Biology》杂志上的最新研究揭示了生物视觉与人工智能(AI)在根本计算原理上的深刻分歧。来自约克大学的研究团队通过测试人类、灵长类动物和最先进的AI神经网络对“运动后效”错觉的反应,发现尽管灵长类大脑的颞下(IT)皮层能根据近期视觉历史动态调整物体位置编码,但目前的AI视觉模型仍保持僵硬,严格受限于像素坐标,无法再现这种历史依赖性感知。
这项突破性发现为神经AI(NeuroAI)领域设立了一个全新基准,强调若要构建与人类安全直观协同工作的机器视觉系统,必须整合动态的、依赖于视觉历史的感知计算,而非仅仅优化静态像素的准确性。
人类眼睛和灵长类动物的视觉大脑并非被动地充当数字相机。它们不只是持续地记录原始、客观的像素坐标,而是依赖于自适应计算,积极整合即时的视觉历史,以理解动态变化的世界。有时,这种历史背景会导致系统性的感知偏差,例如经典的“运动后效”错觉。
在该错觉中,当观察者适应了连续的定向运动后,随后出现的静止物体会感知为向相反方向移动。尽管视网膜上接收到的物理光线并未改变,但物体在空间中的意识感知位置却发生了偏移。神经科学家们越来越倾向于将这些感知上的“错误”视为生物体优化、节能计算的标志,而非工程上的缺陷。
约克大学的研究团队提出一个关键问题:如果AI视觉模型旨在像人类一样理解世界并与之互动,那么它们是否也应该再现这些相同的感知错觉?这项研究成果明确指出,目前主流的人工视觉网络完全缺乏人类和非人类灵长类动物所共有的历史依赖性空间灵活性。
该研究的资深作者、加拿大视觉神经科学研究主席兼约克大学理学院助理教授Kohitij Kar博士表示:“今天的AI视觉系统令人印象深刻,但它们并不总是像我们一样看待世界。这项研究捕捉了神经AI的潜力,展示了当神经科学和人工智能结合时所能实现的目标。通过巧妙的实验揭示生物视觉所使用的、而AI仍缺乏的计算方式,我们可以利用这些见解来构建更好、更类脑的人工系统。”
追踪灵长类IT皮层中的神经坐标
当前深度人工神经网络(ANNs)在空间物体识别方面表现出色,在静态图像的物体分类方面往往能与人类媲美甚至超越人类。然而,它们主要通过前馈式、基于物理像素属性的方式评估每个图像,缺乏动物视觉所特有的连续时间适应性。
为了精确找出人工视觉与生物视觉的分歧点,由研究生兼第一作者Elizaveta Yakubovskaya领导的约克大学团队,将人类心理物理学实验与灵长类动物颞下(IT)皮层的电生理记录相结合。IT皮层是已知负责物体识别的高级视觉区域。
研究人员让人类观察者和猕猴适应定向运动,并呈现静止目标以诱发位置偏移错觉。“我们将灵长类动物视觉皮层的记录与人类感知实验相结合,利用运动适应诱导视觉错觉,使静止物体在感知上略微偏移,然后考察大脑和AI是否表现出相同的效应,”Yakubovskaya解释道,“人类观察者报告了错觉,灵长类颞下(IT)皮层中对位置的神经表征也向相同方向偏移,尽管图像本身并未改变。”
然而,当研究人员将标准的AI视觉网络应用于相同的实验范式时,这些模型并未表现出类似的适应性。AI的内部空间表征始终锚定在客观、未偏移的像素坐标上,未能反映生物视觉系统所体验到的感知现实。
弥合神经AI鸿沟,实现人机对齐
这些发现强调,灵长类IT皮层不仅仅编码静态的物体身份;它所表示的物体位置坐标与意识感知是高度一致的。这一发现为评估动态、循环视觉模型提供了一个至关重要的全新计算基准。
随着自动驾驶系统、机器人助手和计算机视觉算法日益融入日常环境——例如与人类驾驶员一同行驶或与临床医生一同解读实时医学影像——人类和机器在感知空间关系方面的差异可能会导致危险的错位。
“在AI领域,一个日益增长的问题是,能力日益强大的系统将变得更像我们,还是与我们越来越不同,”Kar博士指出,他也是约克大学视觉研究中心和“互联思维”计划的研究员。
“如果我们希望AI能够与人类协同工作,并以更符合人类的方式理解世界,我们就不能只关注它是否得到了正确答案。我们还需要理解产生人类感知和行为的计算方式。神经科学为我们提供了一条途径,去发现这些计算方式,并有可能将其融入AI之中。”
- Media Contact: Sandra McLean
- Source: York University
- Image Credit: Image credited to Neuroscience News
- Original Research is Open Access: Current Biology (Sept 22, 2026). “The macaque IT cortex but not current artificial vision networks encode object position in perceptually aligned coordinates.” Authors: Elizaveta Yakubovskaya, Hamidreza Ramezanpour, Matteo Dunnhofer, and Kohitij Kar.
- DOI: 10.1016/j.cub.2026.09.019