语义瓶颈:利用语义表征进行非侵入式语音解码

Hugging Face Daily Papers 论文

摘要

本文介绍了Brain2Semantics2Text,一种非侵入式语音解码方法,通过将MEG响应映射到语义嵌入空间,在无词级对齐的情况下重构句子级文本。

非侵入式语音解码仍受神经记录低信噪比的限制,这使得对音素或单个单词的精细重构变得困难。基于神经科学证据,即高级语义表征分布在皮层区域并以较慢的时间尺度演化,我们假设语义内容可能比低级声学或词汇特征更适合作为非侵入式解码的目标。我们引入了Brain2Semantics2Text,一种通过中间语义嵌入空间重构文本的方法。我们的模型将句子级MEG响应映射到语义流形,然后将预测的嵌入逆向转化为自然语言。这种语义瓶颈使得在没有词级对齐的情况下恢复高级含义成为可能。我们描述了该方法的核心原理、其实现以及用于缓解学习可靠神经到语义映射挑战的策略。最后,我们与先前的非侵入式Brain2Text方法进行比较,并展示了句子级结果的改善。
查看原文
查看缓存全文

缓存时间: 2026/09/10 14:16

论文页面 - 语义瓶颈:利用语义表征实现非侵入式语音解码

来源:https://huggingface.co/papers/2609.10296

摘要

一种非侵入式脑解码方法将脑磁图响应映射至语义嵌入空间,从而重构句子级文本,无需词级对齐。

非侵入式语音解码(https://huggingface.co/papers?q=Non-invasive%20speech%20decoding)仍受限于神经记录的低信噪比,这使得音素或单词的精细级重构尤为困难。基于神经科学证据表明高级语义表征分布于皮层区域且以较慢的时间尺度演变,我们假设语义内容可能比低级声学或词汇特征更适合作为非侵入式解码的目标。我们提出Brain2Semantics2Text(https://huggingface.co/papers?q=Brain2Semantics2Text)方法,通过中间语义嵌入空间(https://huggingface.co/papers?q=semantic%20embedding%20space)重构文本。该模型将句子级脑磁图(https://huggingface.co/papers?q=MEG)响应映射至语义流形,随后将预测的嵌入向量反转为自然语言。这种语义瓶颈机制使得无需词级对齐即可恢复高级语义信息。本文阐述了该方法的核心原理、实现方式,以及缓解可靠神经-语义映射(https://huggingface.co/papers?q=neural-to-semantic%20mapping)学习挑战的策略。最终,通过与先前非侵入式Brain2Text方法对比,展示了句子级解码结果的提升。

查看arXiv页面 (https://arxiv.org/abs/2609.10296) 查看PDF (https://arxiv.org/pdf/2609.10296) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10296)

通过代理工具获取论文:

hf papers read 2609\.10296

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无关联模型

在模型README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。

引用本文的数据集0

暂无关联数据集

在数据集README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。

引用本文的Spaces0

暂无关联空间

在Space README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。

包含本文的收藏集0

暂无相关收藏集

将本文添加至收藏集 (https://huggingface.co/new-collection),即可从此页面建立关联。

相似文章

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。

从非侵入式脑电记录中准确解码自然语句

arXiv cs.CL

本文介绍了Brain2Qwerty v2,这是一个AI模型,能从非侵入式脑磁图记录中准确解码自然语句,词错误率为39%,证明了数据规模化有助于缩小与侵入式方法之间的性能差距。