改变说话模式(如默念、耳语、正常说话或大声喊叫)和响度的能力是人类语音表达范围的重要组成部分。然而,这些行为在腹侧中央前回(vPCG)中的编码机制,此前从未在神经元放电率的分辨率下进行研究。2026年4月15日发表于 Nature Communications 的一项研究中,加州大学戴维斯分校的Aparna Srinivasan、Maitreyee Wairagkar及同事,在两名参与语音神经假体临床试验的参与者(其vPCG中植入了皮质内微电极阵列)中,探究了这一机制。他们发现,vPCG中的神经元放电率随试想的默念、耳语、正常或大声说话的模式而发生强烈调节。在神经群水平上,语音模式/响度和音素内容被编码在不相交的神经子空间中。从vPCG中,试想模式/响度可分别以94%和89%的准确率被解码,相应的神经准备活动在语音开始前640毫秒和270毫秒就能实现80%的解码准确率。基于此,他们开发了一个闭环响度解码器,能够根据试想的响度调节脑到文本的语音神经假体输出,在线准确率达到94%。这些发现证明了从vPCG解码模式和响度的可行性,为能够合成更具表现力语音的神经假体铺平了道路。
研究亮点速览
-
高分辨率记录:在两名参与者的vPCG中植入微电极阵列,直接记录单个神经元放电率,而非脑电图(EEG)或皮层电图(ECoG)的群体信号。
-
语音模式与响度编码:vPCG神经元的活动强烈区分试想的默念(mimed)、耳语(whispered)、正常(normal)和大声(loud) 说话模式,并编码响度等级。
-
神经子空间分离:语音模式/响度与音素内容(正在说什么词)的神经表征在高维神经空间中占据不同的子空间——一个子空间编码“怎么说”,另一个子空间编码“说什么”。这使得解码器能够独立提取语音模式,而不受词汇内容的干扰。
-
语音前准备活动:在声音产生之前的准备阶段(语音启动前数百毫秒),vPCG就已可解码试想的语音模式(80%准确率),表明vPCG不仅参与运动执行,还参与运动计划。
-
闭环解码器:开发并测试了一个实时、闭环的响度解码器,能以94%的在线准确率区分正常音量和低音量,并成功地将解码的输出映射到神经假体输出(“脑到文本”)。
背景:从“说什么”到“怎么说”
当前语音神经假体(BNCI) :
副语言特征的重要性:
未解问题:
核心结果
1. 语音模式强烈调节vPCG的神经放电率
实验设置:
-
两名因颈椎脊髓损伤导致四肢瘫痪和严重构音障碍的参与者(T15, T16)。
-
在vPCG(控制喉部/发声的运动皮层区域)中植入两个微电极阵列(Blackrock Neurotech)。
-
任务:试想说出4个不同的单词(例如,“heave”、“pick”、“Kodak”、“copilot”),以4种模式之一:默念(无声)、耳语、正常音量和超大声。
结果:
量化:
2. 神经准备活动:语音前解码模式达到80%准确率
时序分析:
解释:vPCG参与语音的运动准备(例如,为耳语、正常或大声设定喉部/发声系统的“增益”),而不仅仅是执行。这种准备活动可能在下一个语音序列启动前就已经开始了。
3. 模式/响度与音素在不相交的神经子空间中编码
降维技术(解混主成分分析, dPCA) :
启示:
4. 闭环响度解码器实时工作
挑战:
开发了实时闭环解码器:
-
参与者被提示以“正常”或“低”(耳语) 音量试想说话。
-
解码器连续处理vPCG的放电率,实时分类为“正常”或“耳语”。
-
解码输出用于调节脑到文本假体的文本输出(例如,如果解码为耳语,则以小字体或括号显示)。
在线性能:
视频演示:论文包含补充视频,展示解码器成功切换文本显示。
对语音神经假体的临床影响
临床应用场景:
神经生理学见解:vPCG作为语音“增益/模式”控制器
模型:
-
前运动皮层(包括vPCG):为即将到来的音节编码发音目标(“说什么”)。
-
同时:vPCG的子回路或动态模式编码发声模式的增益(响度)和模式(耳语 vs. 正常)。
-
这种“并行输出”通过皮质延髓束传输到脑干运动核(疑核、舌下神经核、三叉神经运动核),以协调喉部、舌部和唇部肌肉的精确活动。
与经典研究的联系:
局限性与未来方向
作者与资助
-
通讯作者:David M. Brandman, Sergey D. Stavisky(加州大学戴维斯分校)
-
第一作者:Aparna Srinivasan(研究生), Maitreyee Wairagkar
-
核心资助:美国国家科学基金会研究培训项目(NRT, 2152260);A.P. Giannini基金会博士后研究奖学金;国防部助理部长办公室ALS研究项目(AL220043);美国国立卫生研究院主任办公室DP2(1DP2DC021055);Searle学者项目;Burroughs Wellcome基金科学界面职业奖。
论文信息
原文标题:Encoding of speech modes and loudness in ventral precentral gyrus
作者:Srinivasan, A., Wairagkar, M., Iacobacci, C. et al.
期刊:Nature Communications (2026)
DOI:10.1038/s41467-026-71284-4
开放获取:CC BY 4.0
BIOGUIDER.COM 编辑按:
这项研究是神经工程学在现实世界影响方面迈出的重要一步。通过将单细胞分辨率的神经记录与闭环实时解码器相结合,作者不仅为运动皮层如何编码副语言特征提供了基础洞见,还直接构建了一个可转化为临床应用的系统。对于从事脑机接口、神经假体或人类语言神经生理学研究的读者,最关键的结论是:腹侧中央前回(vPCG)接收并行指令——“说什么”和“怎么说”的信息在神经上被解开。这为第二代语音神经假体(Neuroprosthesis 2.0)铺平了道路:在这种假体中,用户将能够通过想象不同的发音方式来控制合成语音的语调和情绪表达。接下来的挑战在于解码更精细的参数,如音高(语调)和连续响度梯度,并将它们无缝集成到快速、自定进度的交流界面中。
专业术语快速索引(全小写)
-
腹侧中央前回(vPCG) :运动皮层的一个亚区,参与喉部/语音控制。
-
神经假体:一种直接与神经系统接口以恢复感觉或运动功能的设备。
-
副语言特征:伴随语音的非音段特征(例如,语调、响度、语速、模式)。
-
解混主成分分析(dPCA) :一种将神经方差分解为由不同任务变量(如音素 vs. 模式)解释的维度的技术。
-
神经子空间:高维神经种群活动空间中的一个低维子空间,对应于特定的认知/运动变量。
-
闭环解码器:实时持续处理神经输入以产生即时输出的解码算法,与离线“批次”解码相对。
(责任编辑:泉水) |