面向脑-语言对应的边界正则化结构化语义对齐

arXiv cs.CL 论文

摘要

本文提出了MD-SigLIP,这是一个边界正则化结构化语义对齐框架,它直接对齐脑和文本嵌入以提升脑-语言解码,实现了最先进的检索性能。

arXiv:2608.16975v1 Announce Type: new 摘要:随着大型语言模型的快速发展,脑-语言解码取得了显著进展。然而,解码内容是否真正反映了神经表征,还是在很大程度上由语言模型自身重建,目前尚不清楚。这种模糊性限制了可解释性,并阻碍了对内在脑-语言对应的研究。为应对这一挑战,我们提出了MD-SigLIP。这个边界正则化结构化语义对齐框架直接在共享语义空间中对齐脑嵌入和文本嵌入,实现了基于检索的解码。这种形式化使得神经表征与语言语义之间的对应关系能够被显式建模。在重复感知的S型对比学习基础上,我们引入了一个列表级边界正则化项,该强制在正语义聚类和负样本之间实施结构化排序约束。通过同时建模多正语义结构和基于边界的排序,该方法捕捉了神经信号中反映的语言嵌入的流形组织。实验表明,在全词汇和子集评估设置下,该方法都实现了最先进的检索性能。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:45

# 面向脑-语言对应关系的边际正则化结构化语义对齐
来源: https://arxiv.org/html/2608.16975  
王嘉琦 | 单位:中国西北工业大学计算机科学与技术学院,西安 710072  
张舒  

###### 摘要

随着大型语言模型的快速发展,脑-语言解码取得了显著进展。然而,解码出的内容究竟真正反映了神经表征,还是在很大程度上由语言模型本身重构,目前仍不明确。这种模糊性限制了可解释性,并阻碍了对内在脑-语言对应关系的探索。为应对这一挑战,我们提出了MD-SigLIP。这一边际正则化的结构化语义对齐框架,直接在共享语义空间中将大脑嵌入与文本嵌入对齐,从而实现基于检索的解码。该方法明确建模了神经表征与语言语义之间的对应关系。基于重复感知的sigmoid对比学习,我们引入了列表级边际正则化项,以强制执行正语义簇与负样本间的结构化排序约束。通过同时建模多正语义结构和基于边际的排序,该方法捕捉了神经信号所反映的语言嵌入流形组织。实验结果表明,在全词汇和子集评估设置下,该方法均实现了最先进的检索性能。

###### 关键词:

脑-语言解码;边际正则化;结构化语义对齐;检索生成。

## 1 引言

从非侵入性脑信号中解码语言长期以来一直是计算神经成像的一个核心目标[21]、[17]、[4]。随着大型语言模型的快速发展,近期研究通过将神经表征与预训练生成模型结合,展示了越来越流畅的脑-语言解码[19]、[18]、[12]、[3]。然而,尽管输出质量令人印象深刻,但解码出的语义内容究竟是真正源自神经信号,还是在很大程度上由大型语言模型的统计先验重构,目前仍不清楚[2]、[8]、[5]。这种模糊性限制了可解释性,并削弱了关于大脑如何表征语言含义的神经科学结论。

为了更直接地研究脑信号与语言表征之间的内在关系,近期工作将解码重新表述为一个基于检索的对齐问题[5]、[10]、[14]。这些方法不再依赖生成模型,而是学习一个共享的嵌入空间,并根据神经表征的相似性检索文本候选,从而能够显式测量脑-文本对应关系。

在先前的研究中,对比学习为多模态对齐提供了一个自然的框架[11]、[6]、[15]、[7]。CLIP[13]的目标函数使用基于softmax的对比损失来对齐配对表征,成功地桥接了图像和文本模态。然而,CLIP强制执行严格的一对一匹配,并通过softmax归一化在候选之间引入了强烈的竞争。这样的假设可能对于神经解码并非最优,因为语义表征是连续的且可能重叠。SigLIP[20]用独立的基于sigmoid的二元交叉熵代替了softmax,从而支持多标签监督并提高了训练稳定性。尽管这种放松缓解了过度竞争,但它仍然独立处理每一对,并未显式建模相对语义排序。为了进一步考虑语义冗余,重复SigLIP(D-SigLIP)[5]通过识别语义相似的文本来引入多正目标。这一扩展捕捉了语言空间中的局部语义簇,并放松了严格的一热编码监督。

为了对结构化脑-语言对应关系建模,我们提出了MD-SigLIP(边际正则化的D-SigLIP)。MD-SigLIP扩展了D-SigLIP,引入了列表级边际正则化项,在嵌入空间中强制执行结构化排序。具体来说,我们将多个语义相似的正样本聚合为簇级参考分数,并明确惩罚任何排名高于该正簇的负样本。这种基于边际的正则化将独立的成对对齐转化为结构化语义排序问题,鼓励大脑嵌入尊重语言表征的流形组织。因此,MD-SigLIP同时建模了多正语义簇,并在每个检索列表内强制执行结构化排序一致性。在两个MEG-语言数据集上的实验表明,MD-SigLIP在不依赖生成式语言模型的情况下取得了优越的性能。本工作的主要贡献总结如下:

1. 我们提出了一个新颖的对齐框架MD-SigLIP,它通过列表级边际正则化扩展了D-SigLIP,从而在嵌入空间中实现簇感知的语义建模和显式的排序约束。
2. 我们通过基于检索的解码和表征相似性分析,提供了大脑与文本表征之间在语义和结构上一致性的经验证据。
3. 我们证明非侵入性神经信号编码了可检索的与语言相关的语义结构,为研究脑-语言对应关系提供了一个可解释的框架。

## 2 方法

### 2.1 问题公式化

图1展示了所提出的MD-SigLIP框架。我们将脑到文本的解码重新表述为共享嵌入空间中的结构化语义对齐。给定成对数据 \(\mathcal{D}=\{(x_i, y_i)\}_{i=1}^N\),其中 \(x_i \in \mathbb{R}^{T \times C}\) 表示MEG信号,\(y_i\) 表示对应的句子,一个冻结的T5编码器 \(g(\cdot)\) 产生文本嵌入 \(t_i = g(y_i) \in \mathbb{R}^d\),而一个大脑编码器 \(f_\theta\) 将神经信号映射到相同空间,\(z_i = f_\theta(x_i)\)。解码基于 \(z_i\) 与候选嵌入 \(t_j\) 之间的相似性通过检索进行。

(图注:图1:MD-SigLIP概述。为建模语义冗余,我们采用重复感知监督(图1(b)),将语义相似的文本嵌入视为多正目标。为进一步强制执行结构化排序,我们引入了列表级边际正则化项(图1(c)),鼓励正簇的排名高于负样本。)

### 2.2 D-SigLIP损失

如图1(b)所示,遵循D-SigLIP[5],相似性分数定义为:
\[ s_{ij} = \tau \langle \tilde{z}_i, \tilde{t}_j \rangle + b, \quad (1) \]
其中 \(\tilde{z}_i\) 和 \(\tilde{t}_j\) 可选地表示 \(\ell_2\) 归一化嵌入,\(\tau\) 是可学习的温度参数,\(b\) 是偏置项。令 \(S \in \mathbb{R}^{B \times B'}\) 表示一个迷你批次内的相似性矩阵。

标准的对比学习假设一对一匹配。然而,语义表征形成连续的簇。因此,我们定义文本空间中的语义重复项。
成对余弦相似性:
\[ C_{jk} = \frac{\langle t_j, t_k \rangle}{\|t_j\| \|t_k\|}. \quad (2) \]
给定阈值 \(\delta\),重复掩码为:
\[ M_{jk} = \mathbf{1}(C_{jk} \geq \delta). \quad (3) \]
对于每个样本 \(i\),正样本集变为:
\[ \mathcal{P}_i = \{j \mid M_{ij} = 1\}. \quad (4) \]
遵循基于sigmoid的对比学习,我们采用多标签二元交叉熵目标函数[5]:
\[ L_{\text{D-SigLip}} = \frac{1}{B} \sum_{i=1}^B \sum_{j=1}^{B'} \ell_{\text{BCE}}(s_{ij}, Y_{ij}), \quad (5) \]
其中 \(Y_{ij} = M_{ij}\),且
\[ \ell_{\text{BCE}}(s, y) = -y \log \sigma(s) - (1-y) \log (1-\sigma(s)). \quad (6) \]
该公式移除了softmax竞争,并支持每个样本有多个正样本。

### 2.3 MD-SigLIP损失

尽管 \(L_{\text{D-SigLip}}\) 对成对对齐建模,但它并未显式强制排序。因此,我们将正样本的相似性聚合为 \(s_i^{\text{pos}} = \log \left( \frac{1}{|\mathcal{P}_i|} \sum_{j \in \mathcal{P}_i} e^{s_{ij}} \right)\),并定义负样本集 \(\mathcal{N}_i = \{j \mid Y_{ij} = 0\}\)。

边际正则化项为:
\[ L_{\text{margin}} = \frac{1}{B} \sum_{i=1}^B \mathrm{softplus}\!\left( \log \sum_{j \in \mathcal{N}_i} e^{s_{ij} - s_i^{\text{pos}}} \right), \quad (7) \]
它以可微的形式近似 \(\max_{j \in \mathcal{N}_i} (s_{ij} - s_i^{\text{pos}})\) 并强制执行结构化排序。

最终目标函数为:
\[ L_{\text{MD-SigLip}} = L_{\text{D-SigLip}} + \lambda L_{\text{margin}}, \quad (8) \]
其中 \(\lambda\) 平衡对齐和边际正则化。

## 3 实验与结果

### 3.1 数据集与设置

我们在两个公开的涵盖听觉和阅读范式的MEG-语言数据集上评估了我们的方法。Armeni2022[1]是一个MEG-音频数据集,包含3名受试者,每人约10小时的记录,共7,282个不同的词。SchoffelenRead2019[16]是一个MEG-阅读数据集,包含99名受试者和2,223个不同的词。MEG信号经过滤波(0.1–40 Hz),降采样至50 Hz,进行基线校正,并分割为3秒的词级时间段。文本表示使用冻结的T5-large编码器提取。模型使用Adam(学习率 \(1 \times 10^{-4}\))训练最多50个周期,批次大小为128,在单个RTX 4090 GPU上运行。性能在检索设置下使用Top 1准确率、Top 10准确率和中位数排名进行评估,在250个最常见词和全词汇集上分别计算。

### 3.2 跨数据集MEG到文本性能的比较分析

如表1所示(SchoffelenRead2019),我们的方法在Top 10准确率和中位数排名上取得了最佳结果。在Top 250设置下,Top 10准确率从8.2%(D-SigLIP)提高到10.3%,中位数排名从86降至65。在全词汇设置下,Top 10准确率从6.3%增加到8.7%,中位数排名从180改善到138。我们的方法在Armeni2022数据集上略优但一致地优于现有方法。这可能是因为受试者较少但每人记录量大的范式产生了更高的信噪比。尽管这使得所有基线方法表现都相对较好,但我们的方法仍然建立了新的先进水平。

表1:SchoffelenRead2019和Armeni2022数据集上的方法比较。
| 方法 | SchoffelenRead2019 | | | | | Armeni2022 | | | |
| :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| | **Top 250** | | | **Full** | | **Top 250** | | | **Full** | |
| | Top1↑ | Top10↑ | Rank↓ | Top1↑ | Top10↑ | Rank↓ | Top1↑ | Top10↑ | Rank↓ | Top1↑ | Top10↑ | Rank↓ |
| CLIP[13] | 4.4% | 8.2% | 140 | 3.2% | 5.6% | 267 | 3.7% | 17.5% | 84 | 2.4% | 9.5% | 76.5 |
| SigLIP[20] | 1.1% | 7.7% | 94 | 0.8% | 5.9% | 194 | 15.4% | 47.3% | 11 | 10.1% | 30.4% | 63 |
| D-SigLIP[5] | 1.3% | 8.2% | 86 | 0.8% | 6.3% | 180 | 17.2% | 48.0% | 11 | 11.4% | 31.0% | 62 |
| Ours | 2.3% | 10.3% | 65 | 1.2% | 8.7% | 138 | 17.3% | 48.9% | 10 | 11.5% | 31.6% | 56 |

### 3.3 MEG到文本解码的检索分析

为了直观展示我们模型的实际解码能力,我们在图2中提供了句子级解码的定性示例。结果表明,即使在解码连续MEG信号这项极具挑战性的任务中,我们的模型也能成功捕捉核心语义并重建句法连贯的句子结构。值得注意的是,即使精确的单词匹配失败,预测的词也经常表现出与真实单词高度的语义等价性和句法一致性(例如,用同义名词或动词替代)。这表明模型不仅仅是在记忆训练数据,而是在学习脑活动背后的高级语义表征。

(图注:图2:句子级检索示例。真实单词以黑色粗体显示,而对应的预测单词以红色粗体突出显示。)

此外,图3可视化了基于相似性分数由特定MEG信号片段检索出的Top 10候选词。可以清楚地观察到,这些高分候选词在语义空间内表现出显著的聚类效应(例如,围绕特定上下文或概念的词汇簇)。这一观察表明,所提出的方法学习了一个平滑且结构良好的跨模态潜空间。在这个空间中,相似的脑激活模式被准确地映射到邻近的语言表征,从而赋予模型卓越的检索鲁棒性。

(图注:图3:按相似性排序的Top 10检索候选词。)

总的来说,检索示例和Top 10候选词分析一致表明,所提出的模型在共享嵌入空间中捕捉到了连贯的语义邻域。模型不是产生孤立的单词匹配,而是将相似的神经激活模式映射到语义相关的语言表征,这表明脑信号与文本之间具有稳健的语义对齐。

### 3.4 MEG与文本嵌入之间的表征相似性分析

为了研究MEG神经记录与文本嵌入之间的结构对应性,我们进行了表征相似性分析(RSA)[9]。具体来说,我们计算大脑嵌入空间和文本嵌入空间内的成对相似性矩阵,并测量它们的Spearman相关性。为了评估统计显著性,我们通过随机打乱样本间的对应关系构建了基于排列的零分布(图4)。

相似文章

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。