HyperAIHyperAI

Command Palette

Search for a command to run...

可解释的感知语音 MEG 解码:皮层源与驱动检索的刺激特征

Ilia Semenkov Daria Kleeva Zarina Maksudova Ivan Dakhtin Alex Ossadtchi

摘要

通过一个以 CLIP 风格目标针对 wav2vec 2.0 音频嵌入进行训练的深度网络,可以从非侵入性脑磁图(MEG)记录中检索出短片段感知语音 [1–3]。此类研究并未将其权重转换为经典电生理学中所使用的概念。尽管 [1] 前端中的空间滤波器原则上可以映射到源拓扑,但这些源的动态特性仍然无法触及。语音流中的哪些属性有助于解码同样不清楚。在此,我们仔细审视一个解码器,其前端受到测量物理和其源生理的约束。基于 Petrosyan 等人 [4, 5] 的框架,我们用球谐函数参数化的层 [6] 替换了 [1] 的二维傅里叶空间注意力,将特定于被试的表示从 270 个分支减少到 K = 25 个分支,添加了一个可训练的时间滤波器层,使得我们网络中的每个分支在时间和空间上都与一个神经元源相匹配。在训练前移除了眼动和心脏成分,因为两者都可能提供刺激锁定的信息,否则这些信息会被误认为是皮层来源。在清理后的 MEG-MASC 数据集 [7] 上,该模型在六个训练方案中,于 1005 个候选项中达到了 39.75 ± 0.34% 的 Top-1 准确率,且解码器中的可训练参数减少了约 20 倍。其权重映射到源空间 [4, 8],恢复了与经典语音感知网络一致的生成器,并且定位到左侧的分支携带了右侧不明显的更高频率节律成分。配对 MEG 遮挡实验,即用来自特征存在和特征缺失区间的匹配供体替换特征标记的语音片段,表明 19 个刺激特征中有 15 个有贡献,其中最大的效应来自静音、声音强度、元音和声学起始。有趣的是,随机排序的词表表现出相反的行为:将叙事性 MEG 替换进去能改善检索,因此,剥离了叙事结构的词语所引发的活动,其携带的可恢复信息少于连贯语音所引发的活动。wav2vec 目标可以缩减到大约十二个学习到的特征维度而不损失检索准确率,而强时间压缩则会导致明显的性能下降。因此,受物理和生理约束的解码器可以作为知识发现工具:其学习到的权重可以映射到皮层源和时间动态,而输入干预则揭示了决策规则所依赖的内容。

一句话总结

HSE大学和ITMO大学的研究人员提出了一种受生理约束的MEG语音解码器,将二维傅里叶注意力替换为球谐函数层,加入可训练的时间滤波器,并将受试者特定分支降至K=25K = 25K=25,将学习到的权重映射到典型的言语感知皮层源,同时实现39.75±0.34%39.75 \pm 0.34\%39.75±0.34%的Top-1准确率,参数减少约20×20\times20×倍;遮挡实验表明,静音、声音强度、元音和声学起始驱动检索最多,而叙述结构强烈影响可恢复信息。

核心贡献

  • 带有球谐函数前端和可训练时间滤波器的解码器在MEG-MASC上达到39.75%的top-1准确率,参数数量比之前工作减少约20倍。
  • 该架构的可解释性允许将学习到的权重映射到皮层源,恢复典型的言语感知网络,并显示左半球分支承载更高频率的节律动态。
  • 成对的MEG遮挡和叙述替换实验表明,模型依赖于声学特征,如静音、强度、元音和起始,连贯的语音上下文改善可恢复信息,并且特征使用模式在六个训练种子下保持稳定。

引言

从非侵入性脑磁图(MEG)中解码感知语音已实现高检索准确率,但由此产生的模型仍然不透明:其学习到的权重并不对应于可识别的神经源、节律或时间进程,因此高分无法与特定的皮层计算联系起来。虽然分解空间与时间滤波的紧凑分解架构已在脑解码中使用,但早期尝试解释它们时忽视了联合训练滤波器的相互依赖性,并且未应用于复杂自然语音任务中的全头MEG。作者通过扩展一个基于生理的前端来填补这一空白,该前端分解了空间和时间处理,配备球谐注意力、可训练的深度可分离时间滤波器、25个分支的小瓶颈,并明确去除了眼部和心脏伪影。该架构在允许将训练权重直接映射到皮层源位置及其二阶动态的同时,取得了有竞争力的检索准确率。通过成对的MEG替换实验,作者进一步揭示了解码器实际使用哪些刺激属性——跨越声学、语音和上下文惊奇度——将网络从黑箱基准转变为神经生理学发现的工具。

数据集

作者使用了MEG-MASC数据集,该数据集包含27名英语母语参与者在收听MASC语料库的叙述故事时同时采集的音频和脑磁图(MEG)记录。数据集包含49次会话记录(22人提供两次,五人提供一次),每次约一小时。

关键数据集特征和处理步骤:

  • 音频预处理:语音重采样至16 kHz,并以1秒步长切割为3秒窗口。丢弃峰值绝对幅度低于 10410^{-4}104 的窗口。仅当一个或多个标注单词至少有50%的持续时间落入窗口内时,才保留该窗口。
  • MEG预处理:去除眼部和心电ICA成分。信号从1000 Hz下采样至100 Hz。对于每位参与者–会话–故事记录,减去第一个刺激开始前0.5秒内的各通道均值,使用中位数和四分位距对通道进行鲁棒缩放,标准化至零均值和单位方差,并裁剪至±20标准差。
  • 目标表示:对于每个保留的音频窗口,通过将音频传入wav2vec 2.0基础模型,并平均每个模型时间步的最后四个隐藏层输出,获得目标。
  • 训练/验证/测试划分
    • 开发集(2698个片段)包含完整故事 LW1Cable Spool FortEasy Money,以及 Black Willow 的前五个子片段。在此集合中,Black Willow 的第五个子片段作为验证集保留。
    • 测试集(1005个片段)包含 Black Willow 的最后七个子片段。
    • 对于 Black Willow,缩放参数仅在第一个测试片段之前的样本上拟合,以避免数据泄露。
  • 音频–MEG配对:每个3秒的音频片段与延迟150毫秒开始的3秒MEG片段配对,以考虑听觉反应潜伏期。
  • 测试片段对齐:与常规做法不同,测试片段并未对齐到单词起始点,使得检索设置更具挑战性。

方法

作者通过训练一个网络来为MEG数据构建与wav2vec 2.0产生的音频嵌入对齐的嵌入,采用CLIP风格的目标,来解决检索任务。提出的架构将标准空间注意力层替换为基于物理动机的3D空间注意力层,增加一个时间滤波层,并修改卷积解码器。

如下图所示:

可解释的前端通过分解的时空结构处理输入MEG数据。空间滤波阶段始于一个3D空间注意力层。由于MEG传感器呈三维、近似球状排列,作者使用真实球谐函数对每个 J=270J = 270J=270 虚拟通道进行参数化。虚拟通道 jjj 和传感器 mmm 的未归一化系数计算如下:

cjm==0L1q=γjq,Yq(θm,φm)c_{jm} = \sum_{\ell=0}^{L-1} \sum_{q=-\ell}^{\ell} \gamma_j^{q,\ell} Y_\ell^q(\theta_m, \varphi_m)cjm==0L1q=γjq,Yq(θm,φm)

其中 (θm,φm)(\theta_m, \varphi_m)(θm,φm) 是传感器 mmm 的极角和方位角,YqY_\ell^qYq 是实球谐基函数,γjq,\gamma_j^{q,\ell}γjq, 是可学习参数。系数在 MMM 个传感器上使用softmax函数进行归一化,并应用于输入信号。

在空间注意力之后,一个共享的 1×11 \times 11×1 反混叠卷积在通道空间中应用可学习的仿射变换。然后,一个受试者特定层将该表示投影到 KKK 个可解释分支。有效的参与者特定空间滤波矩阵定义为 W(s)=WsWuC\mathbf{W}^{(s)} = \mathbf{W}_s \mathbf{W}_u \mathbf{C}W(s)=WsWuC,对应的逐分支偏置为 b(s)=Wsbu\mathbf{b}^{(s)} = \mathbf{W}_s \mathbf{b}_ub(s)=Wsbu。时间滤波前的分支信号计算为 as(t)=W(s)xs(t)+b(s)\mathbf{a}_s(t) = \mathbf{W}^{(s)} \mathbf{x}_s(t) + \mathbf{b}^{(s)}as(t)=W(s)xs(t)+b(s)

参考框架图:

前端被设计为分支集合,每个分支适应于具有特定空间和动态特性的特定神经源。为了瞄准特定频率范围,作者对每个 KKK 分支信号应用一个可训练的一维深度时域滤波器。每个滤波器有15个样本,相当于MEG采样率100 Hz下的150毫秒。时间滤波器在参与者之间共享,而之前的空间投影是参与者特定的。分支 kkk 的输出通过将其时间滤波器应用于空间滤波后的信号获得:

rs,k(t)=(as,khk)(t)r_{s,k}(t) = (a_{s,k} * h_k)(t)rs,k(t)=(as,khk)(t)

由可解释前端产生的 KKK 个分支信号随后被送入一个非线性时间解码器。该解码器包含 BBB 个时间卷积块,后接一个卷积头。每个时间块包含三个一维卷积,具有特定的扩展因子、批归一化和GELU激活。卷积头将解码器通道投影到768维的wav2vec特征通道。

训练目标是一个单向的MEG到音频的对比交叉熵损失。MEG导出的嵌入与当前小批次中表示的唯一音频目标进行比较。在特征-时间维度上执行 L2L_2L2 归一化后计算相似度,并除以可学习的温度参数。模型使用AdamW优化器进行训练,并根据验证损失进行早停。

为了理解空间和时间分解的贡献,作者对前端组件进行了架构消融实验。

如下图所示:

消融结果表明,完整的时空分解表现最佳。当去除了受试者条件空间映射时,检索准确率下降幅度最大,突显了由于解剖结构和传感器几何形状的差异,需将空间投影适应于个体受试者的必要性。移除注意力层或将3D注意力替换为2D版本也会降低性能,支持使用传感器几何感知的参数化。

作者还研究了时间滤波器支撑对检索准确率的影响。

如下图所示:

检索主要取决于滤波器是否有足够的时间支撑。单样本条件(不含时间上下文)表现差于150毫秒默认值。随着时间支撑增加到约150毫秒,性能总体提升,之后增益变得不系统,表明滤波器长度的益处在该尺度附近开始饱和。

此外,作者通过改变可解释分支数 KKK 和解码器中卷积块的数量来分析模型容量。

如下图所示:

准确率从很小的 KKK 急剧增加到约 K=1025K = 10-25K=1025,然后进入一个宽阔的平台。更大的 KKK 值并未产生系统的增益,并可能轻微降低性能。在解码器深度方面,0块模型始终较弱,而具有2至5个卷积块的模型构成了相似的高性能区间。主要配置(2个卷积块和 K=25K = 25K=25 个分支)位于这个紧凑的高准确率平台上。

实验

一系列实验验证了一个可解释的MEG到语音检索解码器,该解码器在叙述性聆听数据上对比训练,使用了成对遮挡、空间聚类和架构消融。解码器依赖于一组紧凑的刺激特征,包括静音、响度、元音和声学起始,具有集中分布于双侧听觉皮层、额叶和颞上回的空间组织滤波器。随着MEG音频片段长度的增加,性能单调提升,音频目标表示可通过学习的低维子空间沿特征轴进行大幅压缩,而时间分辨率仍然关键。受试者特定的空间映射、3D几何感知注意力和时间滤波均对检索有贡献,性能在许多架构配置上处于宽广的平台。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供