当行人站在路边,自动驾驶汽车不仅能看到他,还能预判他下一秒会不会过马路。由德州农工大学和韩国科学技术院联合开发的AI系统“OmniPredict”,正是为了实现这一目标而生。它通过多模态大语言模型理解行人的意图,在预测行人行为方面,准确率远超现有模型。
从“看见”到“预判”:给自动驾驶装上“直觉”
自动驾驶汽车的挑战不仅在于识别物体,更在于预判不确定的人类行为。为了解决这一问题,研究人员开发了 OmniPredict,这是首个利用多模态大语言模型来预测行人行为的系统。与传统的仅分析运动轨迹的模型不同,OmniPredict能结合场景和上下文,实时“推理”出人接下来最可能做什么。
“城市是难以预测的,行人也是,”项目负责人、德州农工大学自动驾驶车辆与传感器系统中心主任Srikanth Saripalli博士说,“我们的新模型让我们瞥见了未来:机器不仅能看见正在发生的事情,还能预判人类可能要做什么。”
准确率67%,远超现有模型
研究团队在JAAD和WiDEVIEW这两个最严苛的行人行为数据集上测试了OmniPredict。在没有进行任何专门预训练的情况下,它达到了67%的准确率,比现有最新模型高出10%。
即使在行人部分被遮挡或正看向车辆等复杂情境下,模型依然保持了出色的性能。它反应速度更快,对不同道路场景的泛化能力更强,决策也更稳健。
不止于十字路口:从交通到安全
OmniPredict的潜力远超自动驾驶。它能够通过解读姿态、犹豫、身体朝向或压力信号,来预判人的行为。这项能力对军事和紧急救援操作同样具有重要价值。
“它可以帮助标记和预警早期风险,甚至提供一层额外的态势感知,”Saripalli博士说。在这些场景中,AI可以帮助人员快速解读复杂环境,做出更快、更明智的决策。
“我们项目的目标不是取代人类,而是提供一个更聪明的合作伙伴来增强他们的能力,”Saripalli强调。
工作原理:用“理解”替代“暴力学习”
传统的自动驾驶系统依赖于用海量数据和图像训练出的计算机视觉模型。虽然强大,但它们在天气变化、行人行为异常或突发状况面前,往往难以适应。
OmniPredict则另辟蹊径。它背后的多模态大语言模型,能够像高级聊天机器人和图像识别系统一样“理解”它所看到的内容。它不只是在“看”一个画面,而是在解释这个画面,并实时推演其中每个元素将如何移动。
未来:更流畅的街道,更安全的互动
想象一下:你站在人行横道前,不再需要与司机进行眼神确认,而是知道自动驾驶车辆正在追踪你的位置,并已规划好应对你下一步行动的策略。这可能意味着更少的紧张对峙,更少的险情,街道的通行也将变得更加流畅。
“这全是因为车辆不仅能理解运动,最重要的是,能理解意图,”Saripalli博士说。
尽管OmniPredict目前仍是一个研究模型,尚未准备好上路,但它预示着一个未来:自动驾驶汽车将不再依赖“蛮力”视觉学习,而是基于对行为的推理。当AI驱动的汽车能读懂我们的下一步时,前方的道路将变得前所未有的智能。
研究信息
Reference: “Multimodal understanding with GPT-4o to enhance generalizable pedestrian behavior prediction” by Je-Seok Ham, Jia Huang, Peng Jiang, Jinyoung Moon, Yongjin Kwon, Srikanth Saripalli and Changick Kim, 18 October 2025, Computers and Electrical Engineering.
DOI: 10.1016/j.compeleceng.2025.110741