可解释的感知语音MEG解码:皮层来源与驱动检索的刺激特征
摘要
本文提出了一种可解释的感知语音MEG到音频检索模型,利用球谐空间注意力和源映射重新设计,以少得多的解码器参数实现了39.75%的Top-1准确率,同时揭示了哪些语音特征驱动检索。
查看缓存全文
缓存时间: 2026/08/07 13:57
论文页面 - 可解释的感知语音 MEG 解码:皮层源与驱动检索的刺激特征
来源:https://huggingface.co/papers/2608.01481
摘要
通过使用 CLIP 风格目标函数、针对 wav2vec2.0 音频嵌入训练的深度网络,可以从非侵入性脑磁图(MEG)记录中检索到所感知语音的短片段。然而,其权重并不映射到电生理量,并且仍不清楚哪些语音属性驱动了检索。我们基于一种高性能的 MEG 到音频检索架构,但重新设计了其前端和解码器。其空间注意力作用于展平的传感器布局;我们将其替换为定义在三维 MEG 头盔几何形状上的球谐函数。我们将受试者特定表示从 270 个分支减少到 25 个,为每个分支添加时间滤波器以使其在空间和时间上与神经源匹配,并使卷积解码器变得更浅。在训练之前移除眼动和心电成分,以降低刺激锁定捷径的风险。在 MEG-MASC 上,该模型在六个训练解决方案中对 1005 个候选项达到了 39.75 ± 0.34% 的 Top-1 准确率,解码器参数大约减少 20 倍。其权重映射到源空间,恢复出与语音感知网络一致的生成器,而左侧偏侧化的分支携带了右侧不明显的高频节律成分。配对 MEG 遮挡显示,19 个刺激特征中有 15 个有贡献,其中对静音、声音强度、元音和声学起始的影响最大。随机单词列表的表现则相反:将叙事性 MEG 代入其中可改善检索,这表明缺乏叙事结构的活动所携带的可恢复信息少于连贯语音期间的活动。wav2vec 目标可以缩减到约十二个学习到的特征维度而不损失准确率,而强时间压缩则会导致明显损失。总之,源映射和输入干预揭示了驱动检索的因素。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01481) 查看 PDF (https://arxiv.org/pdf/2608.01481) 项目页面 (https://ivsemenkov.github.io/LISA/) GitHub1 (https://github.com/ivsemenkov/LISA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01481)
在您的代理中获取此论文:
hf papers read 2608\.01481
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.01481 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.01481 以从此页面链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.01481 以从此页面链接它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
@HuggingPapers: LISA:一种紧凑、可解释的MEG解码器,用于听到的语音 它从非侵入性脑记录中检索感知语音……
LISA是一种紧凑、可解释的MEG解码器,能够从非侵入性脑记录中检索感知到的语音,在1005个候选项中达到39.75%的Top-1准确率,使用的解码器参数减少约20倍,同时揭示皮层来源和语音特征。
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。
利用语言模型的稀疏特征解读大脑对语言的反应
本文介绍了Augmented Sparse Encoding Models,利用语言模型的稀疏特征解读大脑对语言的反应,并在高场7T fMRI数据上进行了验证。该模型恢复了已知的神经调谐特性,并发现了一个新的体素群体,该群体对与人相关的内容具有调谐特性。
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。
自然理解过程中语言模型的异质性神经预测性
本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。