生物行移动版

主页 > 神经科学 > 脑机接口

让机器说话“有情绪”:腹侧中央前回神经元群编码语音模式与响度

改变说话模式(如默念、耳语、正常说话或大声喊叫)和响度的能力是人类语音表达范围的重要组成部分。然而,这些行为在腹侧中央前回(vPCG)中的编码机制,此前从未在神经元放电率的分辨率下进行研究。2026年4月15日发表于 Nature Communications 的一项研究中,加州大学戴维斯分校的Aparna Srinivasan、Maitreyee Wairagkar及同事,在两名参与语音神经假体临床试验的参与者(其vPCG中植入了皮质内微电极阵列)中,探究了这一机制。他们发现,vPCG中的神经元放电率随试想的默念、耳语、正常或大声说话的模式而发生强烈调节。在神经群水平上,语音模式/响度和音素内容被编码在不相交的神经子空间中。从vPCG中,试想模式/响度可分别以94%和89%的准确率被解码,相应的神经准备活动在语音开始前640毫秒和270毫秒就能实现80%的解码准确率。基于此,他们开发了一个闭环响度解码器,能够根据试想的响度调节脑到文本的语音神经假体输出,在线准确率达到94%。这些发现证明了从vPCG解码模式和响度的可行性,为能够合成更具表现力语音的神经假体铺平了道路。


研究亮点速览

  1. 高分辨率记录:在两名参与者的vPCG中植入微电极阵列,直接记录单个神经元放电率,而非脑电图(EEG)或皮层电图(ECoG)的群体信号。

  2. 语音模式与响度编码:vPCG神经元的活动强烈区分试想的默念(mimed)、耳语(whispered)、正常(normal)和大声(loud) 说话模式,并编码响度等级。

  3. 神经子空间分离:语音模式/响度与音素内容(正在说什么词)的神经表征在高维神经空间中占据不同的子空间——一个子空间编码“怎么说”,另一个子空间编码“说什么”。这使得解码器能够独立提取语音模式,而不受词汇内容的干扰。

  4. 语音前准备活动:在声音产生之前的准备阶段(语音启动前数百毫秒),vPCG就已可解码试想的语音模式(80%准确率),表明vPCG不仅参与运动执行,还参与运动计划。

  5. 闭环解码器:开发并测试了一个实时、闭环的响度解码器,能以94%的在线准确率区分正常音量和低音量,并成功地将解码的输出映射到神经假体输出(“脑到文本”)。


背景:从“说什么”到“怎么说”

当前语音神经假体(BNCI) :

  • 最新的语音脑机接口(BNCI)在解码音素或单词方面表现出卓越的准确性。

  • 然而,这些假体仅输出标准化的、单调的合成语音,无法传达情绪、意图或社会语境的关键副语言特征,如语调、重音、模式和响度。

副语言特征的重要性:

  • 响度变化传达自信、紧迫感或情感(“大声喊叫”要求注意,“耳语”表示秘密)。

  • 模式变化(如从正常说话切换到耳语)在医疗环境或需要隐私时很关键。

未解问题:

  • 腹侧中央前回——已知参与有声发声和发音运动计划的区域——是否在单神经元水平上编码语音模式和响度?

  • 这些特征是否与词汇内容(“说什么”)在神经上分离?如果能分离,就可以设计出能同时解码词汇和副语言特征的假体。


核心结果

1. 语音模式强烈调节vPCG的神经放电率

实验设置:

  • 两名因颈椎脊髓损伤导致四肢瘫痪和严重构音障碍的参与者(T15, T16)。

  • 在vPCG(控制喉部/发声的运动皮层区域)中植入两个微电极阵列(Blackrock Neurotech)。

  • 任务:试想说出4个不同的单词(例如,“heave”、“pick”、“Kodak”、“copilot”),以4种模式之一:默念(无声)、耳语、正常音量和超大声。

结果:

  • 在vPCG中,许多神经元表现出稳健的、模式选择性的调节(即,对“正常”与“耳语”的放电率不同)。

  • 在神经群水平上,跨模式分离显著(主成分分析可视化显示了4种模式的清晰聚类)。

量化:

  • 解码准确率(200毫秒时间窗口):

    • T15:4种模式之间平均94% 准确率。

    • T16:平均89% 准确率。

  • 跨单词泛化:使用一个单词的子集(例如“heave”)训练的解码器,可以很好地泛化到保留的单词(“pick”),证明模式是一种全局、与单词无关的表征。

2. 神经准备活动:语音前解码模式达到80%准确率

时序分析:

  • 在语音启动前(定义为声学发作)对齐神经活动。

  • 在语音启动前数百毫秒,vPCG的种群状态就已根据试想的语音模式出现分歧。

  • 解码准备活动(语音启动前500-1000毫秒的窗口):

    • T15:平均解码准确率80% (语音前270毫秒可预测)。

    • T16:平均解码准确率80% (语音前640毫秒可预测)。

解释:vPCG参与语音的运动准备(例如,为耳语、正常或大声设定喉部/发声系统的“增益”),而不仅仅是执行。这种准备活动可能在下一个语音序列启动前就已经开始了。

3. 模式/响度与音素在不相交的神经子空间中编码

降维技术(解混主成分分析, dPCA) :

  • dPCA是一种线性方法,可分离由不同任务变量解释的方差。

  • 主要发现:

    • 语音模式/响度和音素身份在vPCG高维神经活动中由正交(不相交)的维度表征。

    • 在高维空间中,代表模式与音素的维度几乎呈90°角。

    • 对模式有选择性的神经元与对音素有选择性的神经元是不同程度的不同群体(少量重叠)。

    • 一个神经元群体编码“怎么说”(例如,响亮的声音),另一个群体编码“说什么”(例如,发“p”音)。

启示:

  • 理论上可以设计一个神经假体,同时解码目标单词和预期的语音模式,而不会相互干扰。

  • 闭环响度解码器可以实时调整合成语音的幅度,或者输出代表音量等级的文本标签(例如,“[大声喊叫]我做不到!”)。

4. 闭环响度解码器实时工作

挑战:

  • 通常,语音神经假体以“范式切换”方式运行:用户根据提示说一个单词,然后假体输出文本。

  • 但响度是一个连续变化的参数,对于自然对话的流畅性至关重要。

开发了实时闭环解码器:

  • 参与者被提示以“正常”或“低”(耳语) 音量试想说话。

  • 解码器连续处理vPCG的放电率,实时分类为“正常”或“耳语”。

  • 解码输出用于调节脑到文本假体的文本输出(例如,如果解码为耳语,则以小字体或括号显示)。

在线性能:

  • 平均准确率94% (T15),94% (T16)。

  • 与离线解码性能相匹配,证明了实时应用的实用性。

视频演示:论文包含补充视频,展示解码器成功切换文本显示。


对语音神经假体的临床影响

 
 
特征 当前假体 本研究中提出的扩展
解码的内容 音素、单词 + 语音模式、响度、副语言特征
输出方式 单调合成语音或文本 + 标有响度/模式的文本,或富有表现力的合成语音
实时调整 无 闭环响度检测;动态增益控制
神经特异性 未区分模式与单词 在不相交的子空间中分离;允许独立控制

临床应用场景:

  • 患有闭锁综合征或晚期肌萎缩侧索硬化症(ALS)的患者可以使用语音神经假体进行交流。

  • 除了说“我非常愤怒”,患者还能说出“我非常[大声喊叫]愤怒”——传达情绪强度。

  • 在嘈杂房间中,神经假体可自动切换到“响亮模式”。

  • 在安静环境中(如医院),切换到“耳语模式”。


神经生理学见解:vPCG作为语音“增益/模式”控制器

模型:

  • 前运动皮层(包括vPCG):为即将到来的音节编码发音目标(“说什么”)。

  • 同时:vPCG的子回路或动态模式编码发声模式的增益(响度)和模式(耳语 vs. 正常)。

  • 这种“并行输出”通过皮质延髓束传输到脑干运动核(疑核、舌下神经核、三叉神经运动核),以协调喉部、舌部和唇部肌肉的精确活动。

与经典研究的联系:

  • 在非人灵长类动物中,运动皮层在运动开始前就编码运动参数(方向、速度、力)。

  • 本研究将这一原理扩展到人类语音运动控制:在发声开始前数百毫秒,vPCG就已设定了预期声音的“增益”和“模式”。


局限性与未来方向

 
 
局限 未来方向
仅两名参与者(n=2,由于侵入性微电极植入的罕见性) 在更大规模的队列中复制(多中心试验进行中)。
仅4种离散模式;无连续响度等级 训练解码器对连续响度值(如dB水平)而非分类标签进行回归分析。
vPCG控制模式/响度的机制(直接 vs. 通过调节喉部运动皮层)未知 同时记录vPCG和喉部肌肉肌电图;使用有效连接分析。
假体输出为文本,而非富有表现力的合成语音 开发有声调、可调节音量的文本到语音引擎,该引擎接收神经解码出的参数作为输入。
参与者为脊髓损伤患者(喉部/面部肌肉张力正常,但由于瘫痪而无法发声);结果可能不适用于因肌肉或脑干损伤导致的构音障碍 在其他病因(如ALS、脑干卒中)的患者中进行测试。

作者与资助

  • 通讯作者:David M. Brandman, Sergey D. Stavisky(加州大学戴维斯分校)

  • 第一作者:Aparna Srinivasan(研究生), Maitreyee Wairagkar

  • 核心资助:美国国家科学基金会研究培训项目(NRT, 2152260);A.P. Giannini基金会博士后研究奖学金;国防部助理部长办公室ALS研究项目(AL220043);美国国立卫生研究院主任办公室DP2(1DP2DC021055);Searle学者项目;Burroughs Wellcome基金科学界面职业奖。


论文信息

原文标题:Encoding of speech modes and loudness in ventral precentral gyrus
作者:Srinivasan, A., Wairagkar, M., Iacobacci, C. et al.
期刊:Nature Communications (2026)
DOI:10.1038/s41467-026-71284-4
开放获取:CC BY 4.0


BIOGUIDER.COM 编辑按:
这项研究是神经工程学在现实世界影响方面迈出的重要一步。通过将单细胞分辨率的神经记录与闭环实时解码器相结合,作者不仅为运动皮层如何编码副语言特征提供了基础洞见,还直接构建了一个可转化为临床应用的系统。对于从事脑机接口、神经假体或人类语言神经生理学研究的读者,最关键的结论是:腹侧中央前回(vPCG)接收并行指令——“说什么”和“怎么说”的信息在神经上被解开。这为第二代语音神经假体(Neuroprosthesis 2.0)铺平了道路:在这种假体中,用户将能够通过想象不同的发音方式来控制合成语音的语调和情绪表达。接下来的挑战在于解码更精细的参数,如音高(语调)和连续响度梯度,并将它们无缝集成到快速、自定进度的交流界面中。


专业术语快速索引(全小写)

  • 腹侧中央前回(vPCG) :运动皮层的一个亚区,参与喉部/语音控制。

  • 神经假体:一种直接与神经系统接口以恢复感觉或运动功能的设备。

  • 副语言特征:伴随语音的非音段特征(例如,语调、响度、语速、模式)。

  • 解混主成分分析(dPCA) :一种将神经方差分解为由不同任务变量(如音素 vs. 模式)解释的维度的技术。

  • 神经子空间:高维神经种群活动空间中的一个低维子空间,对应于特定的认知/运动变量。

  • 闭环解码器:实时持续处理神经输入以产生即时输出的解码算法,与离线“批次”解码相对。

(责任编辑:泉水)