当前位置: 主页 > 神经科学 > 类脑智能与AI

人机阅读差异:眼动揭示大模型理解盲区

2026-08-11 12:08 William Timkey, Bria Proceedings of the National Ac 阅读 0
核心摘要: 一项发表于《美国国家科学院院刊》(PNAS) 的最新研究,通过对比368名成年读者的眼动追踪数据与400多个大型语言模型(LLMs)的预测结果,揭示了人类阅读与AI语言处理机制的关键差异。研究发

人机阅读差异:眼动揭示大模型理解盲区

人类阅读为何有时一帆风顺,有时却需反复咀嚼才能理解其深意?一项最新研究为这一认知谜团提供了部分答案。由纽约大学和马萨诸塞大学阿默斯特分校的语言学家和数据科学家团队合作完成的这项工作揭示,尽管大型语言模型(LLMs)在某些方面与人类语言处理并行,但在更深层次的语境整合和复杂句理解上,人类认知与AI的处理机制存在显著分歧。这一发现不仅阐明了人机语言处理的异同,也为未来认知人工智能的发展指明了方向。

这项研究的核心在于对比人类读者的眼动追踪数据与AI语言模型的预测结果。研究团队对368名成年读者进行了眼动追踪,详细记录了他们在阅读精心设计的句子时,在每个词上停留的时间以及是否发生回读。这些句子中包含了一系列句法复杂的“歧义句”(garden-path sentences),例如“The old man the boat”(字面可理解为“老人船”,实际意为“老人们驾驶船只”)。这类句子因其初始解读容易出错,能有效揭示人类处理复杂语境时的认知挑战。随后,研究人员将这些人类眼动数据与超过400种不同的神经网络语言模型所生成的预测结果进行了对比分析,旨在精确找出预测算法与人类认知现实之间的差距。

研究结果揭示了人类认知架构与基于Transformer的AI架构之间一个关键性的分歧

  • 初始对齐与后续分歧: 大语言模型在模拟线性前向阅读过程中早期视觉词汇识别时间方面表现出较高的准确性。这意味着,在文本流畅、无需深度思考的阶段,LLMs的“下一词预测”机制能够很好地解释人类识别词汇的速度。然而,当涉及到后期语境整合时,LLMs的预测能力便显不足。
  • 低估认知难度: AI模型的“下一词可预测性”严重低估了人类读者在解决模糊或“歧义句”时所付出的处理时间。例如,在面对“The old man the boat”这样的句子时,人类读者会经历显著的认知摩擦,需要更长时间来重新解析并理解其真实含义,而LLMs对此类难度缺乏足够的预测能力。
  • 回溯性眼动的作用: 人类阅读过程中,约有20%的注视点是回溯性眼动,即眼睛向后移动重新审视之前的词汇。这种回溯性重解析是人类整合复杂语境、纠正初始理解错误的关键机制。然而,标准的自回归LLMs缺乏等效的结构机制来支持这种回顾性处理。
  • 认知AI的路线图: 纽约大学语言学博士生、论文第一作者William Timkey解释说:“我们发现,LLMs可以解释人们在眼睛平稳向前移动时识别词汇所需的时间,但它们无法捕捉人们难以将词汇整合到更大句子语境中的情况,而这通常伴随着回读。” 马萨诸塞大学阿默斯特分校语言学教授、论文资深作者Brian Dillon补充道:“我们现在更清楚地了解了人类和模型之间的差异。这是理解如何缩小这一差距的第一步,因为这在未来可能带来巨大的优势。”

尽管LLMs在生成流畅文本和表现出一定程度的语言理解能力方面令人瞩目,但这项研究明确指出,它们主要通过预测下一个词来发展这些能力。这种机制虽然在初期词汇识别上与人类相似,但在处理需要多阶段语境整合的复杂文本时,便显露出其局限性。纽约大学语言学与数据科学副教授、论文作者之一Tal Linzen指出:“人类思维并非总是像标准AI系统那样运作——例如,我们阅读时20%的眼动是向后的,而AI模型无法解释我们何时决定这样做。我们现在的工作是创建更贴近人类思维的计算模型,并帮助我们详细了解其运作方式。”

研究人员强调,这些发现为改进语言学习和解决与阅读相关的障碍提供了潜在的路线图。通过深入理解人类阅读过程中“下一词预测”的局限性,以及人类如何通过回读和多阶段语境整合来处理复杂信息,未来的AI架构可以借鉴这些认知机制,从而开发出更强大、更具人类智能的语言理解系统。这不仅有助于推动认知科学的发展,也可能为教育和辅助阅读技术带来革命性的突破。


参考文献: Timkey, W., Linzen, T., & Dillon, B. Large language models struggle to account for human reading dynamics. Proceedings of the National Academy of Sciences, 2023; DOI: 10.1073/pnas.2308111120
    发表评论