当前位置: 主页 > 神经科学 > 脑机接口

脑机接口新突破:AI实时合成自然语音,为瘫痪患者重获“声”机

2026-05-23 10:40 Marni Ellery UC Berkeley 阅读 0
核心摘要: 加州大学伯克利分校和旧金山分校的研究团队在《自然·神经科学》上发表了一项突破性研究,开发出一种新型脑机接口(BCI)系统。该系统能够近乎实时地将严重瘫痪患者的脑部活动转化为自然流畅的语音,延迟不到1秒。不同于以往仅能输出文字或合成声音生硬的系统,这项新技术通过人工智能模型解码运动皮层的神经信号,并利用患者受伤前的录音合成个性化语音,实现了连续、流畅的语音输出。研究还验证了该算法在不同类型脑感应设备(包括侵入式微电极阵列和非侵入式表面肌电图)上的通用性,为未来实用化神经假体装置奠定了基础。该成果标志着向恢复

想象一下,你无法发出声音,但仅仅通过“想”要说话,你的声音就能被他人听见。这不再是科幻小说的情节。来自加州大学伯克利分校(UC Berkeley)和加州大学旧金山分校(UCSF)的研究团队,在《自然·神经科学》(Nature Neuroscience)上发表了一项里程碑式的研究,成功开发出一种近乎实时的“脑到语音”神经假体系统,为因严重瘫痪而失去语言能力的人们带来了重新“开口说话”的希望。

突破延迟瓶颈:从8秒到1秒的飞跃

长期以来,语音神经假体面临的最大挑战之一是“延迟”——从患者试图说话到设备产生声音之间的时间差。过长的延迟会严重破坏对话的自然流畅性,使交流变得支离破碎。在此前的研究中,解码一句完整句子大约需要8秒的延迟。而这项新研究彻底改变了这一局面。研究团队利用基于深度学习的循环神经网络传感器(RNN-T)模型,以80毫秒为增量对神经信号进行解码,成功将延迟压缩至1秒以内。“我们的流式处理方法,将类似Alexa和Siri的快速语音解码能力带入了神经假体领域,”研究的共同首席研究员、UC Berkeley电气工程与计算机科学系助理教授Gopala Anumanchipalli解释道,“我们使用类似类型的算法,发现可以解码神经数据,并首次实现近乎同步的语音流式输出。结果是更自然、更流畅的语音合成。” 更重要的是,这种速度的提升并未以牺牲精度为代价。新系统在解码准确性上与此前的非流式方法持平,实现了“又快又准”的突破。

解码“无声”的意图:AI如何读懂大脑

这项技术的核心在于如何解读大脑中关于“说话”的指令。研究团队将重点放在了运动皮层——大脑中控制言语产生的区域。他们与一位名叫Ann的严重瘫痪且患有失语症的参与者合作。Ann无法发出任何声音,因此研究人员无法直接获得她试图说话时的音频目标。为了解决这一难题,团队巧妙地运用了人工智能。“我们使用了一个预训练的文本转语音模型来生成音频并模拟目标,”研究的共同第一作者、UC Berkeley博士生Cheol Jun Cho解释说。同时,他们利用Ann受伤前的录音,使得合成的语音听起来更像她本人的声音。研究过程是:Ann看着屏幕上的提示(例如“嘿,你好吗?”),然后默默地尝试说出这句话。系统采集她运动皮层产生的神经信号,AI模型则将这些信号与目标句子进行映射,最终合成语音。“我们本质上是在思想被转化为发音动作的中间环节截获信号,”Cho补充道,“我们解码的是在想法产生之后、决定说什么之后、以及决定如何移动声道肌肉之后发生的信号。” 为了验证模型是否真正在学习语音的构成单元,而非简单的模式匹配,研究人员还测试了模型对训练数据集中未出现过的词汇(如北约 phonetic alphabet中的“Alpha”、“Bravo”等26个罕见词)的合成能力。结果显示,模型表现良好,证明了它确实在学习声音的基本构建块。

个性化与通用性:迈向实用化的关键一步

除了速度和准确性,这项研究在用户体验和系统通用性方面也取得了重要进展。通过使用Ann受伤前的录音,系统能够合成出带有她个人特色的声音,这极大地增强了患者的“具身感”(sense of embodiment)。Anumanchipalli教授转述Ann的反馈称:“她表示,流式合成是一种更具意志控制感的模式。在近乎实时地听到自己声音的过程中,她的具身感增强了。” 此外,研究团队还展示了其算法的强大通用性。他们证明,同样的算法不仅适用于高密度皮层表面电极阵列,还能很好地兼容其他类型的脑感应接口,包括穿透大脑表面的微电极阵列(MEAs)以及通过面部传感器测量肌肉活动的非侵入式表面肌电图(sEMG)。“通过在其他无声语音数据集上展示准确的脑到语音合成,我们证明了这项技术并不局限于某一种特定类型的设备,”研究的共同第一作者、UC Berkeley博士生Kaylo Littlejohn表示,“只要信号质量足够好,同样的算法可以跨不同模态使用。” 这为未来开发更灵活、更易于临床推广的神经假体装置铺平了道路。

展望未来,研究团队的目标是进一步提升语音的自然度,特别是为输出语音增加副语言特征,如语调、音高和响度的变化,以表达兴奋等情绪。这将是实现完全自然交流的最后一块拼图。这项研究得到了美国国立卫生研究院下属的国家耳聋与其他交流障碍研究所(NIDCD)等机构的资助。


Journal Reference: Gopala Anumanchipalli et al. "A streaming brain-to-voice neuroprosthesis to restore naturalistic communication." Nature Neuroscience, 2025. DOI: 10.1038/s41593-025-01905-6
    发表评论