语义瓶颈:利用语义表征进行非侵入式语音解码
摘要
本文介绍了Brain2Semantics2Text,一种非侵入式语音解码方法,通过将MEG响应映射到语义嵌入空间,在无词级对齐的情况下重构句子级文本。
查看缓存全文
缓存时间: 2026/09/10 14:16
论文页面 - 语义瓶颈:利用语义表征实现非侵入式语音解码
来源:https://huggingface.co/papers/2609.10296
摘要
一种非侵入式脑解码方法将脑磁图响应映射至语义嵌入空间,从而重构句子级文本,无需词级对齐。
非侵入式语音解码(https://huggingface.co/papers?q=Non-invasive%20speech%20decoding)仍受限于神经记录的低信噪比,这使得音素或单词的精细级重构尤为困难。基于神经科学证据表明高级语义表征分布于皮层区域且以较慢的时间尺度演变,我们假设语义内容可能比低级声学或词汇特征更适合作为非侵入式解码的目标。我们提出Brain2Semantics2Text(https://huggingface.co/papers?q=Brain2Semantics2Text)方法,通过中间语义嵌入空间(https://huggingface.co/papers?q=semantic%20embedding%20space)重构文本。该模型将句子级脑磁图(https://huggingface.co/papers?q=MEG)响应映射至语义流形,随后将预测的嵌入向量反转为自然语言。这种语义瓶颈机制使得无需词级对齐即可恢复高级语义信息。本文阐述了该方法的核心原理、实现方式,以及缓解可靠神经-语义映射(https://huggingface.co/papers?q=neural-to-semantic%20mapping)学习挑战的策略。最终,通过与先前非侵入式Brain2Text方法对比,展示了句子级解码结果的提升。
查看arXiv页面 (https://arxiv.org/abs/2609.10296) 查看PDF (https://arxiv.org/pdf/2609.10296) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10296)
通过代理工具获取论文:
hf papers read 2609\.10296
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无关联模型
在模型README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。
引用本文的数据集0
暂无关联数据集
在数据集README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。
引用本文的Spaces0
暂无关联空间
在Space README.md中引用arxiv.org/abs/2609.10296,即可从此页面建立关联。
包含本文的收藏集0
暂无相关收藏集
将本文添加至收藏集 (https://huggingface.co/new-collection),即可从此页面建立关联。
相似文章
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。
超越并行跟踪:交互式多特征融合驱动来自非侵入性脑记录的语义重建
本文介绍了一种用于非侵入性脑记录语义重建的多特征融合框架,通过交叉注意力机制结合静态词汇(Word2Vec)和动态上下文(GPT)表示,在脑到文本解码中取得了最先进的性能。
基于语义对齐的连续潜变量预测建模用于脑电-语言基础模型
该论文提出了BLPM,一种脑电-语言基础模型,利用连续潜变量预测建模和语义对齐将脑电信号映射到文本嵌入,在多样任务和数据集上实现了可泛化的神经解码。
面向脑-语言对应的边界正则化结构化语义对齐
本文提出了MD-SigLIP,这是一个边界正则化结构化语义对齐框架,它直接对齐脑和文本嵌入以提升脑-语言解码,实现了最先进的检索性能。
从非侵入式脑电记录中准确解码自然语句
本文介绍了Brain2Qwerty v2,这是一个AI模型,能从非侵入式脑磁图记录中准确解码自然语句,词错误率为39%,证明了数据规模化有助于缩小与侵入式方法之间的性能差距。