超越并行跟踪:交互式多特征融合驱动来自非侵入性脑记录的语义重建

arXiv cs.CL 论文

摘要

本文介绍了一种用于非侵入性脑记录语义重建的多特征融合框架,通过交叉注意力机制结合静态词汇(Word2Vec)和动态上下文(GPT)表示,在脑到文本解码中取得了最先进的性能。

arXiv:2607.12071v1 公告类型:new 摘要:从非侵入性神经记录中进行连续语义重建仍然受到语义特征空间与神经编码模式之间表征不匹配的限制,这严重阻碍了高噪声神经信号与目标语义特征之间的跨模态对齐。先前的语义解码器主要依赖静态词汇表示或动态上下文化表示中的单一维度。这种单维度方法不可避免地导致严重的信息损失,因为它未能考虑人脑同时整合稳定词属性和动态上下文的能力。为了弥补这一差距,本研究提出了一种用于非侵入性语义重建的多特征融合框架,系统基准测试了两种集成方法:线性朴素拼接和非线性多头交叉注意力。在该框架内,我们的方法通过交互式门控机制,用动态上下文表示(GPT)补充静态词汇表示(W2V),以促进语言理解过程中的协同处理。通过广泛的语义重建和文本生成实验评估,我们的框架显示了稳健的性能层次:交叉注意力 > 拼接 > GPT > W2V。关键在于,非线性交叉注意力融合方法达到了最先进的性能,表明神经语言解码受益于模拟上下文信息和核心词汇属性之间的协同调节,而不是依赖于孤立的单一特征,同时提供了一种可行的非侵入性脑到文本解码方法。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 超越并行追踪:交互式多特征融合驱动非侵入性脑信号语义重建
来源:https://arxiv.org/html/2607.12071
11institutetext:北京大学前沿交叉学科研究院生物医学交叉研究中心,北京,中国22institutetext:北京大学智能科学与技术学院言语与听觉研究中心,北京,中国33institutetext:通用人工智能国家重点实验室,北京,中国44institutetext:国家生物医学成像中心,膜生物学国家重点实验室,北京大学-清华大学生命科学联合中心,北京大学未来技术学院,北京,中国
44email:janechenjing@pku\.edu\.cn###### 摘要

基于非侵入性神经记录的连续语义重建,一直受限于语义特征空间与神经编码模式之间的表征不匹配,这严重阻碍了高噪声神经信号与目标语义特征之间的跨模态对齐。先前的语义解码器主要依赖于孤立的静态词汇表征或动态上下文表征。这种单一特征的方法不可避免地导致严重的信息丢失,因为它未能考虑人脑同时整合稳定词属性和动态上下文的能力。

为弥补这一差距,本研究引入了一个用于非侵入性语义重建的多特征融合框架,系统性地比较了两种整合方法:线性朴素拼接和非线性多头交叉注意力。在该框架内,我们的方法通过交互式门控机制,用动态上下文表征(GPT)来补充静态词汇表征(W2V),以促进语言理解过程中的协同处理。

通过大量的语义重建和文本生成实验评估,我们的框架揭示了一个稳健的性能层级:Cross-Att>Concat>GPT>W2V\text{Cross-Att}>\text{Concat}>\text{GPT}>\text{W2V}。关键在于,非线性交叉注意力融合方法取得了最先进的性能,表明神经语言解码受益于模拟上下文信息和核心词汇属性之间的协作调制,而非依赖于孤立的单一特征,同时也提供了一种可行的非侵入性脑到文本的解码方法。

## 1 引言

### 1.1 语义重建中的跨模态对齐挑战

语义重建旨在将神经信号转换为连续的、符合自然语言规律的文本[2 (https://arxiv.org/html/2607.12071#bib.bib1),40 (https://arxiv.org/html/2607.12071#bib.bib25)]。虽然基于侵入性神经信号训练的语音解码器[4 (https://arxiv.org/html/2607.12071#bib.bib60),29 (https://arxiv.org/html/2607.12071#bib.bib16),48 (https://arxiv.org/html/2607.12071#bib.bib61)] 利用高信噪比的神经信号[13 (https://arxiv.org/html/2607.12071#bib.bib4),26 (https://arxiv.org/html/2607.12071#bib.bib15)] 取得了稳健的结果,但显著的手术风险限制了其广泛适用性。因此,基于更安全、非侵入性的神经信号(如脑磁图MEG和脑电图EEG)的解码器已成为可扩展的替代方案。先前的工作曾探索将这些非侵入性神经记录映射到离散的语义元素[9 (https://arxiv.org/html/2607.12071#bib.bib62)],或对表征差异进行基准测试[49 (https://arxiv.org/html/2607.12071#bib.bib63)]。与此同时,通过fMRI体素实现了连续语言重建[40 (https://arxiv.org/html/2607.12071#bib.bib25)],并利用基于MEG的语义解码器进行了研究[45 (https://arxiv.org/html/2607.12071#bib.bib28),44 (https://arxiv.org/html/2607.12071#bib.bib29)],而EEG模态已被引入用于听觉注意力追踪、频谱图重建和声学语音重建[51 (https://arxiv.org/html/2607.12071#bib.bib31),52 (https://arxiv.org/html/2607.12071#bib.bib32),10 (https://arxiv.org/html/2607.12071#bib.bib37)],但使用EEG进行连续文本重建仍然极具挑战性。

尽管取得了这些进展,非侵入性语义重建仍面临一个深层瓶颈:语义特征空间与神经编码模式之间的表征不匹配,这阻碍了准确的跨模态对齐。传统框架通过回归单个语义特征来缓解这一问题,要么依赖静态词汇表征,要么孤立地依赖上下文表征。强制解码器回归这些孤立的目标,由于不可避免的信息丢失,会造成严重的表征差距。为了进行系统分析,我们将这些目标形式化为一个包含静态语言属性和动态上下文信息的双组件配置。从静态角度看,主流嵌入模型基于文本共现统计将单个单词映射到固定向量空间[30 (https://arxiv.org/html/2607.12071#bib.bib17),31 (https://arxiv.org/html/2607.12071#bib.bib8),34 (https://arxiv.org/html/2607.12071#bib.bib18)]。虽然这些静态特征捕捉了稳定的概念坐标,但它们完全孤立地表示单词,并省略了必要的上下文信息[49 (https://arxiv.org/html/2607.12071#bib.bib63)],导致连续文本上的语义模糊。相反,动态上下文组件从预训练语言模型中提取表征[12 (https://arxiv.org/html/2607.12071#bib.bib3),37 (https://arxiv.org/html/2607.12071#bib.bib21)],以跟踪长距离上下文序列[38 (https://arxiv.org/html/2607.12071#bib.bib23),5 (https://arxiv.org/html/2607.12071#bib.bib2),46 (https://arxiv.org/html/2607.12071#bib.bib30)]。然而,仅依赖上下文表征也会引入信息丢失,因为这些依赖于历史的嵌入常常模糊了尖锐的局部词边界,并稀释了单个单词的稳定基线含义,使得高噪声的神经记录容易干扰离散词的检索。

这种单一特征公式直接偏离了人脑的语言处理机制。神经生物学证据表明,人脑通过两条协同通路来避免这种信息丢失,从而处理连续语言:一条是词汇记忆检索通路,从分布式的颞叶网络中检索稳定的词属性[24 (https://arxiv.org/html/2607.12071#bib.bib14)];另一条是语境统一通路,在额颞网络中动态整合这些单元[16 (https://arxiv.org/html/2607.12071#bib.bib7),17 (https://arxiv.org/html/2607.12071#bib.bib9),18 (https://arxiv.org/html/2607.12071#bib.bib10)]。在连续语音理解过程中,人脑同时追踪稳定的词汇属性和上下文信息以解决语义歧义[39 (https://arxiv.org/html/2607.12071#bib.bib24),24 (https://arxiv.org/html/2607.12071#bib.bib14),19 (https://arxiv.org/html/2607.12071#bib.bib12),35 (https://arxiv.org/html/2607.12071#bib.bib20),41 (https://arxiv.org/html/2607.12071#bib.bib26),14 (https://arxiv.org/html/2607.12071#bib.bib6)],并在经典的N400时间窗内紧密交互[22 (https://arxiv.org/html/2607.12071#bib.bib13)]。

因此,依赖单一的孤立特征轨迹不足以捕捉人类语言网络的协同功能。为了更好地匹配生物语言处理机制,一个稳健的语义重建框架需要采用多特征融合方法。通过强制静态词汇表征和上下文表征相互调制,以合成统一的目标语义特征空间,该框架可以防止信息丢失并促进准确的跨模态映射。

### 1.2 提出框架与核心贡献

关键在于,设计一个统一语义特征空间的工程目标是提高神经解码的计算可行性,而非机械地复制生物大脑结构。由于非侵入性神经信号(如MEG和EEG)高度非平稳且噪声极大,将它们直接映射到无约束的语言空间很容易导致严重的过拟合。非侵入性神经方法中固有的时间序列自相关性进一步加剧了这种脆弱性[50 (https://arxiv.org/html/2607.12071#bib.bib33)]。多特征语义空间提供了必要的正则化;通过将解码目标约束在这个明确定义的表征空间内,我们在结构上缩小了假设空间。这种约束使得解码模型能够稳定地收敛到有意义的语义目标上,尽管神经数据本身存在噪声。

为了实现这一目标语义特征空间,本研究引入了一个用于语义重建的多特征融合框架。与传统的单一特征方法不同,我们系统地阐述并对比了两种融合方法,以合成一个统一的语义特征空间:通过朴素拼接实现的线性融合基线,以及通过多头交叉注意力驱动的非线性融合。在这种交叉注意力方法中,静态词汇表征和动态上下文信息相互交互关注,模拟了人类语言网络中固有的协同多特征处理的互补机制。

通过在一个连续听觉叙事MEG数据集上使用自监督对比对齐进行跨模态评估,我们的框架产生了三个主要贡献:

- **双特征融合框架**:我们提出了一个混合语义特征目标框架,整合了静态词汇属性和上下文信息,提高了语义重建和连续文本生成的总体性能。
- **支持神经科学假设**:通过对线性和非线性特征整合进行基准测试,我们的实验揭示了一个稳健的性能层级 (Cross-Att>Concat>GPT>W2V)(\text{Cross-Att}>\text{Concat}>\text{GPT}>\text{W2V})。互逆交叉注意力相对于朴素拼接的定量优势,为支持语言理解过程中多特征协同处理的神经科学假设提供了证据。
- **对比对齐方法**:我们实现了一种自监督对比学习方法,用于优化跨模态框架。该方法有效缓解了使用低信噪比非侵入性神经信号进行语义重建时固有的困难。

参见图注图 1:提出的非侵入性语义重建交互式多特征融合框架的总体架构。该方法被构建为两阶段框架:第一阶段:语义特征重建与对比学习。音频刺激文本通过分词处理,分别输入到捕捉稳定词汇属性的 LM1(Word2vec)和跟踪动态序列上下文的 LM2(GPT-Neo)。这些表征由融合模型整合,得到融合语义特征 EfusedE_{\text{fused}}。同时,神经记录通过神经编码器映射为预测的融合嵌入。构建一个批次范围内的成对相似性矩阵,由 InfoNCE 损失函数控制,以最大化对角线匹配,同时最小化非对角线干扰项。第二阶段:文本生成。以历史前缀和第一阶段预测的融合嵌入为条件,预训练的 LM3(mengzi-GPT-Neo)扩展路径假设以生成候选词。每个候选词通过融合模型顺序转换为其融合嵌入。框架通过计算这些候选融合嵌入与预测融合嵌入之间的似然度来决定下一个词,从而输出流畅、自然的语言文本。

## 2 方法

在本节中,我们介绍用于非侵入性语义重建的交互式多特征融合框架的完整方法论。所提出框架的总体架构如图 1 (https://arxiv.org/html/2607.12071#S1.F1) 所示。接下来的小节将详细阐述框架内每个组件的具体实现和操作细节。

### 2.1 方法论概述与设计动机

在形式化具体的矩阵运算之前,我们概述一下框架的结构性假设。为了模拟人类语言处理的两个方面(静态词汇属性和上下文信息),我们使用两个不同的语义特征提取器来构建一个混合目标空间。关键的是,我们评估了两种相反的集成工程方法:(1)线性拼接融合,假设静态词汇项和上下文序列轨迹通过孤立的、被动的并行通道进行处理;以及(2)交互式交叉注意力融合,引入主动的、互逆的非线性门控模块,让这两个特征动态地相互调制彼此的潜在几何结构。然后,使用自监督对比学习将这些多层次的目标与高维神经时间序列进行数学对齐,以驱动下游文本生成方法。

### 2.2 数据集

SEM4Lang。SEM4Lang 数据集包含 60.7 小时的脑磁图(MEG)记录,这些记录来自 12 名汉语母语者在连续语音聆听任务中的采集[47 (https://arxiv.org/html/2607.12071#bib.bib35)]。在实验过程中,参与者聆听了 60 个不同的音频故事,每个故事时长 4 到 7 分钟,涵盖了多种主题。神经活动以 1000 Hz 的采样率,使用 306 通道的全头 MEG 系统(Elekta-Neuromag TRIUX,赫尔辛基,芬兰)进行记录。

### 2.3 语义特征提取与预处理

语义特征提取。使用六十个中文音频作为连续的自然叙事语音刺激。对于动态特征流,我们实现了一个预训练的中文 GPT-Neo 基础模型(mengzi-GPT-Neo-base[23 (https://arxiv.org/html/2607.12071#bib.bib34)],最大序列长度 ML=128ML=128,批大小 BS=64BS=64)。利用对称的上下文回看窗口(5 个词符,GPT_WORDS=5\text{GPT\_WORDS}=5),逐词提取第 9 个 Transformer 层的隐藏状态。给定一个分词序列 w1,w2,...,wnw_{1},w_{2},\dots,w_{n},第 ii 个词符的动态上下文向量形式化为:

eiGPT=GPT-Neo-layer-9([wi−5,...,wi])[−1,:]∈R768e_{i^{\text{GPT}}}=\text{GPT-Neo-layer-9}([w_{i-5},\dots,w_{i}])[-1,:]\in\mathbb{R}^{768} (1)
随后,对于第 ii 个词符的静态特征,使用在中文文本语料库上训练、上下文窗口为 10 的连续词袋(CBOW)Word2Vec 框架[31 (https://arxiv.org/html/2607.12071#bib.bib8),30 (https://arxiv.org/html/2607.12071#bib.bib17)],提取 300 维的词级表征 eiW2Ve_{i^{\text{W2V}}}。之后,根据每个词符的开始和结束时间,其动态和静态特征被平铺到其占据的整个时间间隔内,得到最终表征 EGPT∈RT×768E_{\text{GPT}}\in\mathbb{R}^{T\times 768} 和 EW2V∈RT×300E_{\text{W2V}}\in\mathbb{R}^{T\times 300},其中 TT 表示整个故事的总采样点数。EGPTE_{\text{GPT}} 和

相似文章

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。

元学习上下文学习实现无需训练的跨被试脑解码

Hugging Face Daily Papers

# 论文页面 - 元学习上下文学习实现无需训练的跨被试脑解码 来源:[https://huggingface.co/papers/2604.08537](https://huggingface.co/papers/2604.08537) 作者:,,,,,,,,,,,,, ## 摘要 一种元优化方法通过少量图像-脑示例快速推断个体独特神经编码模式,无需跨被试及扫描仪微调,即可实现可泛化的语义视觉解码。[视觉解码](https://huggingface.co/papers?q

用于词元级幻觉检测的时序多信号融合方法

Hugging Face Daily Papers

本文介绍了一种时序多信号融合方法,用于通过融合特征上的序列标注检测语言模型中的词元级幻觉,在不访问模型内部信息的情况下实现了改进的跨模型性能。