一项最新研究揭示了生成式AI的一个关键弱点:不可靠。当研究人员将同一道是非题向ChatGPT重复询问10次时,它给出的答案竟会前后不一,甚至出现“5次真、5次假”的极端情况。这项研究提醒我们,在使用AI进行重要决策时,必须保持警惕。
实验设计:700多个假设,每个问10遍
华盛顿州立大学的 Mesut Cicek 教授及其团队,对ChatGPT进行了系统的“真伪判断”测试。他们从已发表的科学论文中提取了719个研究假设,要求ChatGPT判断这些假设是否得到研究证据的支持——本质上就是判断其“真假”。
为了测试其一致性,每个问题被重复提交了10次,所有提问的措辞都完全一致。
准确率低,且自我矛盾
准确率方面:
-
2024年的实验显示,ChatGPT 回答的正确率约为 76.5%
-
2025年重复实验时,正确率微升至 80%
但更关键的问题是一致性:
-
当同一个问题被重复询问10次时,ChatGPT 仅在约 73% 的情况下给出了完全一致的回答。
-
也就是说,超过四分之一的问题,它在不同时间给出了不同的答案。
-
更极端的情况是:多个问题出现了“5次真、5次假”的结果。
“我们用的10次提问是完全一样的问题。它会回答‘真’,下一次又说‘假’。真、假、假、真……有好几个案例是5次真、5次假。”Cicek 教授表示,他们关心的不只是准确率,更是这种严重的不一致性。
调整后,表现仅比随机猜测好一点
当研究人员排除了随机猜测(本身就有50%的正确概率)的影响后,AI的实际表现大打折扣。调整后的准确率只比随机猜测高出约 60%,研究者将这种表现形容为“勉强及格”(低 D 等级)。
此外,AI 在识别“错误陈述”方面尤其困难,正确率仅为 16.4%。
为什么专家呼吁谨慎?
Cicek 教授强调,当前的大型语言模型能够生成流畅、有说服力的语言,但这并不等同于真正的理解或可靠的推理。
“目前的AI工具并不像我们一样理解世界——它们没有‘大脑’,”Cicek 说。“它们只是记住了信息,然后给你一些见解,但根本不明白自己在说什么。”
研究者建议,在依赖AI进行重要决策(尤其是涉及复杂推理或细微差别的场景)时,必须核实其输出,并保持批判性态度。这项研究也印证了其他相关发现:消费者在看到标榜“AI”的产品时,购买意愿反而会下降。
研究信息
Source: SciTechDaily
Contact: SciTechDaily
Original Research:
“Unstable Intelligence: GenAI Struggles with Accuracy and Consistency” by Mesut Cicek, Sevincgul Ulu, Can Uslay, Kate Karniouchina. Rutgers Business Review (2025), Vol. 10, No. 2, pp.266-277
Link: https://rbr.business.rutgers.edu/article/unstable-intelligence-genai-struggles-accuracy-and-consistency