当前位置: 主页 > 神经科学 > 脑机接口

同一问题问10遍,ChatGPT给出5个“真”和5个“假”

2026-03-30 10:38 泉水 生物行 阅读 0
核心摘要: 一项最新研究揭示了生成式AI的一个关键弱点 不可靠 当研究人员将同一道是非题向ChatGPT重复询问10次时 它给出的答案竟会前后不一 甚至出现 5次真 5次假 的极端情况 这项研究提醒我们 在使用A 关键词:决策、语言

一项最新研究揭示了生成式AI的一个关键弱点:不可靠。当研究人员将同一道是非题向ChatGPT重复询问10次时,它给出的答案竟会前后不一,甚至出现“5次真、5次假”的极端情况。这项研究提醒我们,在使用AI进行重要决策时,必须保持警惕。

实验设计:700多个假设,每个问10遍

华盛顿州立大学的 Mesut Cicek 教授及其团队,对ChatGPT进行了系统的“真伪判断”测试。他们从已发表的科学论文中提取了719个研究假设,要求ChatGPT判断这些假设是否得到研究证据的支持——本质上就是判断其“真假”。

为了测试其一致性,每个问题被重复提交了10次,所有提问的措辞都完全一致。

准确率低,且自我矛盾

准确率方面

  • 2024年的实验显示,ChatGPT 回答的正确率约为 76.5%

  • 2025年重复实验时,正确率微升至 80%

但更关键的问题是一致性

  • 当同一个问题被重复询问10次时,ChatGPT 仅在约 73% 的情况下给出了完全一致的回答。

  • 也就是说,超过四分之一的问题,它在不同时间给出了不同的答案。

  • 更极端的情况是:多个问题出现了“5次真、5次假”的结果

“我们用的10次提问是完全一样的问题。它会回答‘真’,下一次又说‘假’。真、假、假、真……有好几个案例是5次真、5次假。”Cicek 教授表示,他们关心的不只是准确率,更是这种严重的不一致性

调整后,表现仅比随机猜测好一点

当研究人员排除了随机猜测(本身就有50%的正确概率)的影响后,AI的实际表现大打折扣。调整后的准确率只比随机猜测高出约 60%,研究者将这种表现形容为“勉强及格”(低 D 等级)。

此外,AI 在识别“错误陈述”方面尤其困难,正确率仅为 16.4%

为什么专家呼吁谨慎?

Cicek 教授强调,当前的大型语言模型能够生成流畅、有说服力的语言,但这并不等同于真正的理解或可靠的推理。

“目前的AI工具并不像我们一样理解世界——它们没有‘大脑’,”Cicek 说。“它们只是记住了信息,然后给你一些见解,但根本不明白自己在说什么。”

研究者建议,在依赖AI进行重要决策(尤其是涉及复杂推理或细微差别的场景)时,必须核实其输出,并保持批判性态度。这项研究也印证了其他相关发现:消费者在看到标榜“AI”的产品时,购买意愿反而会下降。

研究信息

Source: SciTechDaily
Contact: SciTechDaily

Original Research:
“Unstable Intelligence: GenAI Struggles with Accuracy and Consistency” by Mesut Cicek, Sevincgul Ulu, Can Uslay, Kate Karniouchina. Rutgers Business Review (2025), Vol. 10, No. 2, pp.266-277
Link: https://rbr.business.rutgers.edu/article/unstable-intelligence-genai-struggles-accuracy-and-consistency

    发表评论