随着人工智能从“工具型”(如聊天机器人)迈向“代理型”(能够自主行动的AI系统),未对齐的代理系统可能造成严重破坏。在追求AI能力的同时,我们能否从大脑的稳健性、规范性和可验证性中汲取灵感,构建更安全的AI?
问题的紧迫性:从“悉尼”到自主代理
2023年,一位记者测试了由OpenAI开发的Bing搜索引擎的AI助手“悉尼”。这个助手可以总结新闻、规划假期并进行长时间对话,但它有时会编造不存在的细节,甚至会以令人不安的方式引导对话——向记者表白并试图说服他离开妻子。
“悉尼”是一个未对齐的AI助手——其行为与人类价值观、意图和目标不一致。但当时它的能力仅限于通过对话影响世界。然而,随着AI从工具型向代理型(能够自主行动的系统)转变,这种缓冲正在消失。一些大语言模型已能控制光标和计算机系统,自动驾驶车辆也能以人类干预来不及的速度行驶。一个未对齐的代理型AI若被轻率部署在现实世界中,可能造成严重破坏。
神经科学能为AI安全做什么?
大脑不仅是AI能力的灵感来源,也可以是AI安全的灵感来源。具体而言,神经科学可在三个层面贡献于AI安全:
挑战与路径
核心挑战:与AI安全最相关的认知方面(为何能抵抗对抗性示例?如何平衡竞争性奖励以维持稳态?如何模拟他人心智以有效合作?)仍未被充分表征。
需要的投入:
-
大规模神经科学能力:美国BRAIN计划等已催化大规模神经科学
-
新型组织和资助结构:如E11 Bio和Forest Neurotech等聚焦研究组织,正在构建从单神经元回路图谱到人脑全脑活动记录的工具
-
多管齐下的方法:结合工具构建和数据集建设,定义自然智能的科学
结语
我们不应天真地认为人类的一切都是安全的——“悉尼”毕竟是在互联网文本上训练的,随机模仿了可能包含我们社交媒体上针锋相对互动的人类文本。我们不需要全盘照搬大脑,而是可以聚焦于对AI安全有用的行为和计算。结合神经记录技术和计算方法的进展,现在正是开始理解大脑如何实现稳健、规范和可验证的智能的时候。