解码脑电图信号以探究人脑中下一个词的可预测性
摘要
本研究利用脑电图探究词汇类别中单词可预测性如何影响N400脑响应,结果显示内容词比功能词表现出更大的N400差异,且解码技术优于传统的ERP分析。
arXiv:2607.18321v1 公告类型:新
摘要:人类发明了阅读,并通过语言将这一复杂技能代代相传。本研究提供了自下而上(与高阶语言结构相关)和自上而下(与下一个词的可预测性相关)过程的神经机制的经验证据,这些过程相互作用以指导阅读过程中的理解。虽然以往的研究集中在可预测性或词汇类别的N400效应上,但关于可预测性如何影响不同词汇类别的N400响应的研究有限,这主要是由于公开数据集的限制。在这里,我们研究了可预测性如何影响以毫秒分辨率通过脑电图(EEG)记录的脑响应,重点关注不同词汇和语法类别的N400时间窗(刺激后300-500毫秒)。我们的结果表明,高和低完形填空概率水平之间的N400响应显著差异在内容词中比功能词更为明显。在两类主要内容词中,动词比名词表现出更大的N400差异,而名词则比动词携带更多关于其可预测性的独特信息。此外,我们证明解码技术比事件相关电位(ERP)传统分析更能捕捉随时间变化的认知过程的更详细和独特的表征。
查看缓存全文
缓存时间: 2026/07/22 08:23
# 解码脑电信号探索人脑中的下一个词可预测性 来源: https://arxiv.org/html/2607.18321 Boi Mai QuachBinh T\. NguyenCathal Gurrinmai\.quach3@mail\.dcu\.iengtbinh@hcmus\.edu\.vncathal\.gurrin@dcu\.ieSchool of Computing, ML\-Labs,Department of Computer Science,School of Computing, ADAPT Centre,Dublin City University, IrelandVNUHCM – University of ScienceDublin City University, Ireland Graham Healygraham\.healy@dcu\.ieSchool of Computing, ADAPT Centre,Dublin City University, Ireland ###### 摘要 人类发明了阅读,并通过语言将这一复杂技能代代相传。本研究提供了支持自下而上(与高阶语言结构相关)和自上而下(与下一个词可预测性相关)过程神经机制的经验证据,这两个过程在阅读过程中相互作用以引导理解。以往研究主要关注可预测性或词汇类别的N400效应,但关于可预测性如何影响不同词汇类别N400反应的研究有限,主要原因是公开数据集的限制。在此,我们使用脑电图(EEG,毫秒级分辨率)记录大脑反应,重点关注N400时间窗(刺激后300-500毫秒)内不同词汇和语法类别的影响。结果表明,在内容词和功能词之间,高完形概率与低完形概率条件下的N400反应差异更显著。在两种主要的内容词类别中,动词的N400差异大于名词,而名词携带的可预测性信息比动词更独特。此外,我们证明解码技术比传统的事件相关电位(ERP)分析方法能更有效地捕捉随时间变化的详细且独特的认知过程表征。 关键词: 认知神经科学; 阅读理解; 机器学习; 脑电图 (EEG) ## 引言 阅读理解涉及两个相互关联的过程:自下而上和自上而下的处理(?, ?)。自下而上处理通常被认为是准确词汇识别的自动结果(?, ?, ?),而自上而下处理则利用线索来消除歧义并预测即将出现的词汇(?, ?, ?)。例如,我们可以推断出“我喝咖啡加奶油和……”这句话很可能以“糖”结尾。读者通过自下而上的过程访问语言结构(例如词汇组、语法类别),以预测下一个词可能是名词。同时,他们依靠自上而下的线索,在词汇完全呈现之前预判其正确含义。 N400 ERP成分是在刺激词出现后约400毫秒出现的负向偏转,因其对语义复杂性的敏感性而闻名(?, ?)。完形概率(?, ?)用于估计在给定句子中某个词出现的可能性,并反映自上而下的预测过程,长期以来一直被认为是N400振幅的主要预测因子。N400随完形概率变化而梯度衰减是使用脑电图进行阅读理解时最广泛复制的现象之一,支持以下结论:与低完形值的词相比,高完形值的词引发更小(负性更弱)的N400反应(?, ?, ?, ?)。 基本上,词汇分为两大类:内容词和功能词。内容词包括名词、动词、形容词和大多数副词,传达关于物体和事件的具体语义信息。功能词则包括代词、限定词、助动词和介词,作为短语构建的结构元素。来自阅读加工过程中ERP记录的证据支持由自下而上过程引导的基于词汇的分析。开创性研究的结果表明,内容词引发的N400振幅比功能词更大(?, ?)。这一发现后来得到观察结果的支持,表明两种词类都能引发N400反应,但功能词,尤其是高频功能词,振幅显著更小(?, ?, ?)。语法类别,特别是名词和动词,也会影响N400振幅,观察到动词的振幅大于名词(?, ?, ?)。 由于公开可用的语义层面脑电图数据集有限(?, ?),目前缺乏基于词汇分析的下一个词可预测性证据。为了获得更深的理论见解,本研究旨在检验两个假设:第一个假设认为,与功能词相比,内容词在高完形和低完形水平之间引发更大的N400差异效应。第二个假设认为,动词在高完形和低完形之间的N400可预测性差异比名词更显著。 此外,我们不仅探索自上而下处理的本质及其与阅读理解中自下而上信息处理的关系,还提供证据表明多变量解码在捕捉不同条件下的独特神经信息方面优于传统ERP分析方法。通过利用单变量和解码技术来研究我们的假设,我们进一步证明了多变量解码在这方面的优势。 ## 方法论 ### EEG记录与数据准备 为了研究不同词汇类别对N400对可预测性的反应,我们使用了DERCo数据集(?, ?),其中包括22名以英语为母语的人在阅读《格林兄弟童话》时记录的脑电图数据。两名参与者“QPF42”和“USQ95”因数据中过多的眼动而被排除在数据分析之外。此外,通过Mechanical Turk众包平台使用完形程序收集了逐词完形值。高密度脑电图数据使用32通道电极记录,电极放置遵循国际10-20系统(?, ?)。 词性使用Python库IPA¹识别,该库允许我们提取并归类句子中每个单词的语法功能。例如,在句子“她快速审阅了一些详细报告与她的团队”中,词性分类如下:她(代词),快速(副词),审阅(动词),一些(限定词),详细(形容词),报告(名词),与(介词),她的(代词),团队(名词)。关于完形概率,我们使用了与DERCo数据集相同的两个不同组(高与低)。这一决定基于他们的验证,该验证表明大多数电极上N400存在显著差异。 预处理后,不同词汇类别的高、低完形概率水平试验次数因参与者而异。为了标准化分析的试验次数,我们确定了每个完形概率水平下试验次数最少的参与者,并将其设为基线。然后,我们从其他参与者中随机选择相等数量的试验,确保其完形值分布与基线紧密匹配。这一随机选择过程由Kolmogorov-Smirnov (KS)检验指导,迭代多达5000次以找到具有最低KS统计量的子集,表示最佳分布匹配。如前所述,我们的分析侧重于二元分类,如词汇组(内容词与功能词)和内容词类别(名词与动词)。每个组别每个条件用作基线的试验数量详见表 1 (https://arxiv.org/html/2607.18321#Sx2.T1)。 ### 单变量分析 传统的单变量分析涉及计算给定ERP成分下两种或多种条件之间的差异波。处理此问题的最常见统计方法是使用数据聚类结合置换检验(?, ?)。通过检查所有电极位点的数据,这些分析确保全面的空间覆盖,提高统计功效,控制多重比较,并允许识别感兴趣成分最大的电极簇(?, ?, ?, ?)。在标准单变量方法中,两个条件之间的ERP振幅差异在多个时间点进行量化。对于大规模单变量分析,我们拥有显著更大的(通道,时间)对集合,也称为样本,其中我们旨在检查N400效应。 在我们的分析中,每个单词级别的EEG时期具有三个维度:32个电极 × 20名参与者 × 600个时间点(从单词刺激后-100到500毫秒),这需要多重比较。与单个传感器分析相比,多重比较问题在此背景下更为显著:使用32个通道和600个时间点,我们生成19,200个t值。基于聚类的置换检验(10,000次)使用逐点独立样本t检验来识别数据点低于α水平(p<0.05)的聚类。对于多通道分析,方法与单通道类似,但聚类不同:不是仅基于时间邻接进行聚类,我们现在根据空间和时间邻接对选定的(通道,时间)样本进行聚类。 此分析的一个主要优点是能够识别特定时间窗内的最佳电极位点组。一旦确定了(通道,时间)样本的聚类,那些p值超过临界双尾α水平(0.05)的聚类被认为不显著。计算错误发现率(FDR)并用于校正多重比较(?, ?)。每个显著聚类代表跨时间点以及可能跨电极通道的连续活动块。通过在一个最优电极位点聚类内对所有参与者的差异波进行平均,我们可以近似最能解释ERP效应的电极位置。请注意,如果使用FDR校正后该方法未能产生任何最优电极位点,我们将选择未经校正的最优通道。表 1 (https://arxiv.org/html/2607.18321#Sx2.T1)显示了N400时间窗内最优电极位点聚类的结果。 | 组别 | 基线试验数 | 最优电极聚类 | |------|------------|--------------| | | 高完形 | 低完形 | | 内容词 | 193 | 365 | P3, P7, CP1, CP2, Pz, P4, Fp2, F7, F3, Fz, F4 | | 功能词 | 318 | 155 | FT10, FC1, FC2, C3, Cz, C4, Fp2, F7, F3, Fz, F4 | | 名词 | 125 | 93 | P3, P7, CP1, CP2, Pz, P4, F7, F3, Fz, F4 | | 动词 | 401 | 65 | T8, CP6, FT9, P3, P7, CP1, CP2, Pz, P4, F7, F3, Fz, F4 | 表 1: 各条件在N400时间窗内的基线试验数和最优电极聚类。高和低分别指高完形和低完形条件。 ### 解码分析 与其他机器学习(ML)模型(如线性判别分析和随机森林)相比,支持向量机(SVM)在检查预测和语义相关性的N400效应方面表现出更优的性能(?, ?)。SVM在解码EEG/ERP数据方面特别有效,因其易于实现、在小训练集上性能强,尤其通过使用核函数处理高维空间中的非线性关系的能力(?, ?)。 图 1 (https://arxiv.org/html/2607.18321#Sx2.F1)中的流程图展示了使用RBF核SVM进行EEG数据解码的过程。该过程从收集多个受试者的神经数据开始,每个参与者的数据被组织成三维数组,对应试验次数、电极位点以及时间点。为了减少潜在偏差,试验被随机排序,以减轻顺序效应并确保更好的泛化。单次试验的EEG时期通常噪声太大,无法有效解码细微的刺激类别。可以通过将数据随机分成M组,每组包含大约一定数量的试验,从而为每组创建平均ERP来提高信噪比(SNR)(?, ?, ?)。许多先前的研究(?, ?, ?, ?)使用了多组10-20次试验,并在分类器准确率上达到了最高或接近最高的性能。因此,本研究采用了平均15次试验。例如,内容词组的80个高完形和80个低完形试验可以平均为每组条件下的5组16次试验。这种方法也捕捉到了受试者内部的变异性,并提高了解码可靠性。 然后对平均ERP进行分层K折交叉验证(?, ?),该技术处理类别不平衡分布并最小化过拟合风险(?, ?, ?),确保每个类别在训练和验证阶段都得到公平的代表。在我们的研究中,基于SVM的解码重复了五次。每一轮,使用RBF核的SVM分类器在四个折上进行训练,并在剩下的一个折上进行测试。与主解码过程一样,此过程独立应用于每个时间点。解码准确率定义为正确分类的测试用例比例。为了提高解码准确率的分辨率,整个过程对每个参与者迭代100次(L)。每次迭代,我们重新随机将试验分配到平均值,并训练新的SVM。 参见标题 图 1: 使用RBF核SVM的EEG解码过程流程图。该过程从每个参与者的EEG数据开始,组织成N个试验 × C个电极 × T个时间点的3D数组。试验被随机排序以减少偏差,并通过平均一定数量的EEG试验来提高SNR,为每组生成M个子试验 × C个电极 × T个时间点的数据。应用分层K折交叉验证以平衡训练和测试数据,然后在每个折上进行SVM训练和测试。该过程对每个参与者重复L次,共有S个参与者。 如果神经模式编码了不同的词汇类别信息,则二元分类的解码准确率应高于0.5的概率水平。为了比较每个时间点解码准确率与概率水平,同时控制多重比较,我们使用了类似于单变量分析中的基于聚类的置换技术。我们使用单样本t检验将参与者间的平均准确率与概率水平进行比较。然而,对于SVM解码准确率,我们使用单尾检验而非单变量技术中的双尾检验,因为SVM分类器不应产生有意义的低于概率水平的解码。 对于给定的得分(即单变量差异波中的电压或解码准确率),我们从N名参与者中随机选取n个样本(从N名参与者集合中有放回地抽样),并计算该随机样本的效应量。然后我们进行5,000次测试过程迭代,从而可以构建最大聚类级t_max的零分布,并带有聚类p值。 ### 方法性能比较 基于SVM的解码和单变量分析均显示了词汇组间显著的N400振幅差异,但无法量化效应大小或直接比较ERP振幅变化。一个常见的解决方案是使用效应量或统计功效,通过Cohen's d_z(?, ?)来实现。效应量衡量结果之间差异的大小。这种方法使研究人员能够以标准化方式呈现报告效应的幅度。
相似文章
编码EEG信号以探究语言模型中类似人类的下一词预测行为
本文通过分析EEG信号和事件相关电位(ERP),探究语言模型的下一词预测是否与人类认知处理一致,发现只有surprisal与人类大脑反应相关,尤其是对于开放类词汇。
非侵入式EEG解码默读
这项研究使用非侵入式EEG和对比学习来解码默读过程中的单词,展示了可扩展的词汇信息恢复,其性能随数据量增加而提升。
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。
自然理解过程中语言模型的异质性神经预测性
本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。
在慢速fMRI上微调语言编码模型提升对快速ECoG的预测
本文表明,尽管fMRI的时间分辨率较低,但在fMRI数据上微调语言编码模型能提升其对ECoG记录中神经活动的预测能力。研究结果表明,丰富的'慢速'fMRI数据可以增强针对'快速'ECoG数据的模型。