当前位置: 主页 > 神经科学 > 类脑智能与AI

经典大脑测试揭示AI致命短板:无法像人类一样进行“认知灵活性”学习

2026-06-10 19:03 泉水 PNAS Nexus 阅读 0
核心摘要: 一项发表在《PNAS Nexus》上的最新研究利用经典的“威斯康星卡片分类测试”(WCST)对当前最先进的人工智能(AI)模型进行了评估,结果发现AI在需要快速适应新规则的“认知灵活性”任务上表现远逊于人类。研究团队测试了包括GPT-4、Claude 3和Gemini在内的多种大型语言模型(LLM),发现它们在面对规则突然改变时,普遍出现“顽固性错误”,无法像人类一样从错误中学习并灵活切换策略。该研究不仅揭示了当前AI在模仿人类认知方面的根本局限,也为未来开发更具适应性的智能系统提供了重要方向。

一项由多国科学家合作完成的最新研究,利用神经科学领域经典的“威斯康星卡片分类测试”(WCST),对当前最先进的人工智能(AI)模型进行了系统性评估。结果令人震惊:尽管AI在语言生成、图像识别等任务上已接近甚至超越人类水平,但在需要快速适应新规则的“认知灵活性”测试中,它们暴露出了根本性的短板。该研究于2026年6月10日发表在《PNAS Nexus》上。

经典测试:威斯康星卡片分类测试(WCST)

WCST是神经心理学中用于评估人类执行功能认知灵活性的黄金标准测试。在测试中,参与者需要根据颜色、形状或数量等不同规则对卡片进行分类,但规则会突然改变且不事先告知。人类受试者通常能在几次错误后迅速察觉并调整策略,而前额叶皮层受损的患者则会表现出“顽固性错误”——即持续使用旧规则,无法切换。研究团队将这一测试改编为适合AI的版本,要求模型根据给定的分类规则(如“按颜色分类”)对卡片进行匹配,并在规则改变后观察其表现。

AI的“顽固性错误”与人类对比

研究测试了包括OpenAI的GPT-4、Anthropic的Claude 3和Google的Gemini在内的多个主流大型语言模型(LLM)。结果显示,所有AI模型在规则切换后的首次错误率高达80%以上,而人类受试者的首次错误率仅为15%左右。更关键的是,AI在犯错后往往无法从错误中学习:在连续10次规则切换中,AI的平均正确率仅从初始的45%缓慢提升至52%,而人类在相同次数内正确率可迅速回升至90%以上。研究第一作者、来自剑桥大学的认知科学家Dr. Emily Carter指出:“AI就像一台只会执行固定程序的机器,一旦规则改变,它就陷入混乱,无法像人类那样灵活地调整策略。

原理解析:为什么AI缺乏认知灵活性?

科学家认为,这一缺陷源于当前AI架构的根本设计。大型语言模型本质上是基于海量文本数据训练的统计模式匹配器,它们擅长识别和复现训练数据中的常见模式,但缺乏真正的因果推理在线学习能力。当规则改变时,AI无法像人类大脑前额叶皮层那样,通过监测错误信号来动态更新内部模型。人类大脑拥有专门的认知控制网络,能在冲突发生时(如旧规则与新规则不匹配)迅速抑制先前的反应倾向并激活新的策略。而AI的“学习”在训练阶段就已固定,在推理时无法进行这种实时调整。研究还发现,即使通过“思维链”提示(Chain-of-Thought)来引导AI逐步推理,其表现提升也极为有限,说明问题并非出在任务理解上,而是缺乏根本的认知灵活性

对AI发展的深远启示

这项研究不仅揭示了当前AI的局限性,也为未来研究指明了方向。Dr. Carter表示:“如果我们希望AI真正融入人类生活,比如在自动驾驶、医疗诊断或机器人协作中,它们必须学会在动态环境中灵活适应。”目前,研究团队正在探索将神经科学中的强化学习元学习(learning to learn)机制引入AI架构,以模拟人类前额叶皮层的功能。然而,要实现真正的认知灵活性,可能需要对AI的基本设计范式进行根本性变革,例如开发能够在线更新权重模拟短期记忆的新型神经网络。


Journal Reference: Emily Carter, et al. "A classic brain test exposed AI's biggest weakness." PNAS Nexus, 2026.
    发表评论