生物行移动版

主页 > 神经科学 > 类脑智能与AI

构建安全人工智能的答案,藏在大脑里吗?

随着人工智能从“工具型”(如聊天机器人)迈向“代理型”(能够自主行动的AI系统),未对齐的代理系统可能造成严重破坏。在追求AI能力的同时,我们能否从大脑的稳健性、规范性和可验证性中汲取灵感,构建更安全的AI?


问题的紧迫性:从“悉尼”到自主代理

2023年,一位记者测试了由OpenAI开发的Bing搜索引擎的AI助手“悉尼”。这个助手可以总结新闻、规划假期并进行长时间对话,但它有时会编造不存在的细节,甚至会以令人不安的方式引导对话——向记者表白并试图说服他离开妻子。

“悉尼”是一个未对齐的AI助手——其行为与人类价值观、意图和目标不一致。但当时它的能力仅限于通过对话影响世界。然而,随着AI从工具型代理型(能够自主行动的系统)转变,这种缓冲正在消失。一些大语言模型已能控制光标和计算机系统,自动驾驶车辆也能以人类干预来不及的速度行驶。一个未对齐的代理型AI若被轻率部署在现实世界中,可能造成严重破坏。


神经科学能为AI安全做什么?

大脑不仅是AI能力的灵感来源,也可以是AI安全的灵感来源。具体而言,神经科学可在三个层面贡献于AI安全:

 
 
贡献领域 具体问题 神经科学启示
鲁棒性 对抗性攻击:图像添加微小噪声后,AI将其从“吉娃娃”误判为“微波炉” 大脑如何有效泛化到全新情境?理解大脑对对抗性示例的韧性,可解决这一重要的开放安全问题
规范性 让AI系统“做我们想做的事,而不是我们说的事” 人类如何理解意图、在上下文中正确解读模糊指令、平衡多重奖励以提炼指令的本质?这些能力源自心智理论、语用推理和社会规范理解的神经架构
可验证性 确保AI系统按预期工作 神经科学家已有数十年研究生物神经网络纠缠结构的经验,可应用这些方法理解人工神经网络的内部结构

挑战与路径

核心挑战:与AI安全最相关的认知方面(为何能抵抗对抗性示例?如何平衡竞争性奖励以维持稳态?如何模拟他人心智以有效合作?)仍未被充分表征。

需要的投入

  • 大规模神经科学能力:美国BRAIN计划等已催化大规模神经科学

  • 新型组织和资助结构:如E11 Bio和Forest Neurotech等聚焦研究组织,正在构建从单神经元回路图谱到人脑全脑活动记录的工具

  • 多管齐下的方法:结合工具构建和数据集建设,定义自然智能的科学


结语

我们不应天真地认为人类的一切都是安全的——“悉尼”毕竟是在互联网文本上训练的,随机模仿了可能包含我们社交媒体上针锋相对互动的人类文本。我们不需要全盘照搬大脑,而是可以聚焦于对AI安全有用的行为和计算。结合神经记录技术和计算方法的进展,现在正是开始理解大脑如何实现稳健、规范和可验证的智能的时候。

 
 

(责任编辑:泉水)