当前位置: 主页 > 神经科学 > 神经心理

GPT-4揭示人类心理:大模型预测人格测试结果

2026-08-07 11:38 Rotem Monsa iScience 阅读 0
核心摘要: 一项新研究展示了利用GPT-4从任意文本(如DSM-5和占星术书籍)构建、验证并预测人群层面人格评估问卷反应的新方法。研究发现,GPT-4生成的问卷成功提取了有意义的心理信号,其中基于DSM-5的

GPT-4揭示人类心理:大模型预测人格测试结果

一项发表在《iScience》杂志上的开创性研究揭示了大型语言模型(LLMs),特别是GPT-4,在人类心理学评估领域令人瞩目的潜力。这项研究展示了一种新颖的方法,利用GPT-4从任意源文本中构建、验证并预测人群层面的人格评估问卷结果,为心理测量学的发展带来了革命性的变革。

研究团队通过两个截然不同的文本来源对该模型进行了测试:一个是临床上广泛使用的《精神疾病诊断与统计手册》(DSM-5),另一个则是一本非科学的占星术教科书。结果显示,由LLM生成的问卷成功地从这两种文本中提取了有意义的心理信号。其中,基于DSM-5的问卷表现出与“大五人格量表”(Big Five Inventory, BFI)相匹配的高内部一致性,而BFI是迄今为止验证最充分的人格问卷。

更令人惊叹的是,GPT-4在人类参与者完成调查之前,便能准确预测他们将如何回答问卷条目,并预判条目间的相关模式。这些发现强有力地表明,LLMs通过其自然语言训练数据,已内嵌了专家级的人类群体心理模型,这使其成为快速心理测量开发和自动化问卷评估的变革性工具。

该研究的亮点包括:

  • 自然语言人格嵌入: GPT-4展示了对人类人格结构的内在、嵌入式理解。这种理解并非通过明确的心理学领域微调获得,而是从通用互联网训练数据中隐式习得的。
  • DSM-5与占星术的比较效度: 基于DSM-5的问卷表现出与“大五人格量表”相当的高内部一致性。相比之下,基于占星术的问卷在与星座相关的特质之间显示出较差的内部连贯性,这反映了现实世界中心理测量学的实际情况。
  • 非科学文本中保留的心理信号: 尽管占星术的星座分配缺乏科学依据,但ChatGPT仍能从中提取出与特质相关的语言,并成功预测了抑郁、焦虑和幸福感等现实世界结果,其预测水平与BFI相当。
  • 零样本人群反应预测: 在600名参与者完成调查之前,ChatGPT便准确预测了人群的平均反应和条目间的相关矩阵,这使其能够作为自身心理测量输出的自动化评估器。
  • 文化与语言边界: 作者提醒,当前的预测准确性与西方英语主导的训练数据密切相关。目前正在进行的研究旨在测试其在不同非西方语言和文化中的表现。

耶路撒冷希伯来大学的首席作者Rotem Monsa指出:“鉴于人格特质反映在语言中,LLMs可能在训练过程中自然而然地学会了人类人格的结构。因此,尽管它们没有专门学习心理学或人格理论,但这些知识已经嵌入到LLMs所学习的语言中。”

为了验证LLMs评估人类人格的能力,研究人员利用GPT-4生成了两份人格评估问卷。他们首先使用DSM-5的摘录作为源文本,假设人格特质位于人格障碍的连续谱上。作为对照组,另一份问卷则使用了占星术教科书。

对于DSM-5来源的问卷,ChatGPT根据DSM-5中对人格障碍的描述生成了人格陈述。例如,基于偏执型人格障碍部分,问卷会要求参与者对“经常怀疑他人的动机”或“很容易信任他人”等陈述进行评分(1=非常不同意,5=非常同意)。占星术问卷也生成了类似的陈述,但这些陈述是基于源文本将人格特质分配给占星术中的十二星座。

Monsa解释说:“我们希望选择那些详细描述人类人格,但在科学依据上处于光谱两端的文本。DSM-5经过数十年的临床研究完善,是临床精神病学中的标准诊断手册,享誉全球。而占星术文本则具有深厚的文化基础,但未经科学验证。”

在生成LLM问卷后,研究人员将其与“大五人格量表”(BFI)一同分发给600名参与者,以评估其效用。

基于DSM-5的问卷结果显示,人格簇内部具有高度的内部一致性;这意味着在现实世界中通常相互关联的特质(如回避和依赖)在参与者的回答中也呈现出相关性。重要的是,这些结果与BFI的结果相吻合,这一发现有助于验证该问卷在测量人类心理现实模式方面的强大能力。

正如预测的那样,占星术问卷则显示出特质间的内部一致性较弱。Monsa表示:“我们的数据表明,占星术元素并不能反映连贯的心理维度。例如,在‘火象星座’中被归为一类的特质,在真实人群中实际上并不总是同时出现。”

尽管存在这一局限性,这两份问卷,包括占星术问卷,都能从参与者的回答中预测抑郁、焦虑和幸福感等生活结果,其预测水平与BFI相当。这表明,即使将人格特质分配给星座缺乏科学依据,LLMs从这些文本中提取出的与人格相关的内容仍然保留了有意义的心理信号。

然而,最令人惊讶的结果是,ChatGPT能够预测参与者在完成问卷前的反应。对于这两份问卷,ChatGPT都以高度的现实准确性预测了平均反应和问题之间的相关性,这表明LLMs在人群层面具有对人格动态的内在理解。

Monsa说:“LLMs在未见任何人类数据之前就能预测人类反应模式,这一事实表明这些模型已经观察到了关于人类心理学的一些普遍有意义的东西。这些结果告诉我们,LLMs不仅是一个优秀的‘内容生成工具’,而且还能够作为其自身输出的‘知情评估者’。”

然而,作者也指出,如果这些方法在不同的语言和文化中重复,结果可能不会如此强劲。Rotem表示:“我们认为在其他语言和文化中,结果可能不会像我们在这里看到的那样强劲,因为LLMs主要是在西方文化中的英语文本上进行训练的。我们认为这非常有趣,我们实验室的几位成员目前正在使用其他语言的LLMs进行测试。”

总而言之,这些结果表明,LLMs可以帮助研究人员从任何源材料中快速创建基于人格的问卷,并直接测试其临床应用的有效性。此外,将临床和心理学见解与AI工具的力量相结合,是临床和实验心理学发展的一个变革阶段,可能会对该领域产生深远影响。


参考文献: Rotem Monsa et al. ChatGPT Predicts Human Personality Test Results. iScience, 2023; DOI: 10.1016/j.isci.2023.107792
    发表评论