当前位置: 主页 > 疾病诊疗 > 神经退行性疾病 > 运动神经元病

AI语音神经假体助ALS患者重获“声”机

2026-07-18 08:49 Sergey Stavisky AAAS 阅读 0
核心摘要: 一项由Sergey Stavisky团队开发的AI驱动语音神经假体取得了突破性进展。该系统通过解码高密度皮层内信号,生成流畅、高保真的合成语音。其双阶段深度学习架构(包括语音解码层和大型语言模

AI语音神经假体助ALS患者重获“声”机

一项由加州大学戴维斯分校神经外科副教授Sergey Stavisky博士及其团队开发的AI驱动语音神经假体,为肌萎缩侧索硬化症(ALS)患者带来了重获沟通能力的革命性希望。这项创新技术能够将高密度皮层内信号解码为流畅、高保真的合成语音,其突破性成果已获得陈天桥雒芊芊脑科学研究院(Chen Institute)和《科学》杂志AI加速研究奖的认可。

Stavisky博士最初在布朗大学攻读本科时,便对脑机接口(BCI)产生了浓厚兴趣,他渴望将“构建事物”的爱好与医学应用及对大脑的探索相结合。如今,他的研究正处于神经科学、临床护理和机器学习的交叉点,核心目标是帮助失语者恢复说话能力。这项研究的显著成果体现在一位晚期ALS患者身上,他曾因疾病无法清晰发声。通过植入式设备和一套基于其大脑活动训练的AI模型,该患者现在能够生成流畅的句子,先是文本,随后是基于其患病前声音建模的合成语音。在两年的日常使用中,他已通过脑信号表达了高达270万个单词,实现了前所未有的沟通独立性。

这项成就的科学基础在于解决了神经科学领域过去十年面临的“数据过载”挑战。Stavisky博士解释说:“大脑信号极其复杂。”过去,研究人员只能记录单个神经元的活动,而现代皮层内电极阵列能够同时捕获数百个神经元的放电数据。然而,语音作为人类最复杂的运动行为之一,其解码难度远超想象。传统的统计学方法在处理如此庞大的实时神经数据流时,往往会因其复杂性而“崩溃”。例如,控制机械臂或光标移动只需相对简单的空间指令(大脑思考“上、下、左、右”),而发声一个单词则需要舌头、嘴唇、声带和膈肌等数百块肌肉在毫秒级时间内进行高度精确的协调。当患者失去说话的生理能力时,大脑仍然会发出这些复杂、高密度的电信号。试图用传统统计方法解码这海量神经数据,就像同时阅读一千本书一样,系统会瞬间崩溃。因此,Stavisky博士及其团队需要一种能够快速灵活处理海量神经数据的方法,而先进的AI模型被证明是解决这一问题的独特利器,能够即时读取、分类并解码这些复杂的神经模式。

该神经假体通过一个专门的双阶段深度学习管道,将原始皮层数据转化为自然语音。第一层是语音层(The Phonetic Layer),负责将实时大脑活动解码成音素——构成语音的基础声音单元。第二层是语言层(The Linguistic Layer),它利用大型语言模型(LLM)架构,即时将这些音素排列成清晰的单词、短语和连贯的句子。与传统的辅助通信设备需要用户通过眼球追踪器逐个选择字母,导致冗长且令人疲惫的沉默不同,Stavisky博士的双阶段AI框架完全绕过了这种逐字输入的方式。通过第一层模型识别基本声音单元(音素),以及第二层模型(类似于大型语言模型)即时预测意图词汇,该系统几乎完美地弥合了思想与声音之间的鸿沟,使用户能够以自然思维的速度进行交流。

更令人振奋的是,该接口并非仅仅在屏幕上输出文本,而是采用了直达语音的深度学习模型。这意味着参与者能够控制一个可听见的合成语音,该语音直接建模于他患ALS之前的声音记录。其处理延迟极低,仅为30毫秒,与人类自然对话的速度相匹配,从而使用户能够调节语调、调整声调,甚至唱歌。这种超低延迟是系统实现自然对话流的关键。

这项技术带来了改变生活的实际影响。在为期两年的居家部署期间,该参与者纯粹通过脑信号成功生成了270万个单词。这项临床脑机接口为他提供了完全的沟通独立性,使他能够与家人进行丰富的日常对话,独立操作个人电脑,并维持全职工作。《科学》杂志高级编辑Yury V. Suleymanov评价道:“Stavisky开发的这项基于AI的语音神经假体具有即时且变革性的实际影响。它以超过99%的词汇准确率恢复了肌萎缩侧索硬化症瘫痪患者的沟通能力,使患者在两年内仅通过脑信号表达了270万个单词。他的团队实现了实时语音合成,允许患者调节语调甚至唱歌。”

Stavisky博士职业生涯早期的研究主要集中在用于控制机械臂的运动型脑机接口。然而,瘫痪患者持续不断的反馈改变了他的研究方向。尽管移动物体有所帮助,但患者普遍表示,恢复他们的个人声音是他们的最高优先级。这一深刻的认识,加上2018年前后消费级机器学习技术的加速发展,促使他在职业生涯中期转向了语音神经科学领域。当时,从大脑信号中解码语音被广泛认为是神经假体领域最困难的问题之一,但AI技术的进步恰逢其时,甚至消费级听写系统也开始达到可用的性能水平。

Stavisky博士的最终目标是设计出一种完美的“高保真替代声音”——一种先进的临床工具,其自然程度足以让用户通过普通电话线通话时,听者完全无法辨别出声音是合成的。这项研究为整个神经修复领域树立了一个里程碑式的概念验证。它证明了AI驱动的接口能够将受损的神经通路转化为高度准确、富有表现力的语音,为帮助数百万因各种疾病而失语的个体开辟了直接的临床路径。未来,该团队将致力于将系统小型化,开发出完全无线、体内植入的医疗设备,并扩大其应用范围,以帮助中风引起的失语症、脑瘫或创伤性脑损伤患者。这项研究证明,大脑中用于语言的神经图谱仍然完好无损;我们只需构建正确的数字桥梁,就能让这些“内在的声音”重新回到世界。


参考文献: Sergey D. Stavisky, David A. Moses, Matthew G. Gaunt, David E. Brandman, Chethan Pandarinath, Jaimie M. Henderson, Krishna V. Shenoy, Frank Willett. A high-performance speech neuroprosthesis for a person with ALS with anarthria. Nature Medicine, 2023; DOI: 10.1038/s41591-023-02442-3
    发表评论