编码EEG信号以探究语言模型中类似人类的下一词预测行为
摘要
本文通过分析EEG信号和事件相关电位(ERP),探究语言模型的下一词预测是否与人类认知处理一致,发现只有surprisal与人类大脑反应相关,尤其是对于开放类词汇。
查看缓存全文
缓存时间: 2026/07/21 06:42
# 编码EEG信号以探究语言模型中类似人类的下一个词预测行为 来源:https://arxiv.org/html/2607.16549 Boi Mai Quach、Binh T. Nguyen、Cathal Gurrin、[email protected]、[email protected]、[email protected] 计算学院,机器学习实验室,计算机科学系,ADAPT中心,都柏林城市大学,爱尔兰 VNUHCM – 理学院,都柏林城市大学,爱尔兰 Graham Healy、[email protected] 计算学院,ADAPT中心,都柏林城市大学,爱尔兰 ###### 摘要 语言模型经过训练,能够根据先前上下文出色地预测序列中的下一个词,而人类在阅读理解中也共享这种可预测性。神经科学研究表明,下一个词的可预测性会影响大脑反应,这些反应可通过脑电图(EEG)以毫秒级分辨率记录。虽然有证据表明,高级语言模型在下一个词预测任务中达到的准确度与人类表现高度吻合,但这引发了一个问题:更高的预测准确度是否必然意味着这些模型充分捕捉了与人类阅读理解相关的认知信号?在此,我们基于两种信息度量(包括top-1预测和惊奇度)为人类和语言模型生成回归变量,以预测从EEG记录中引出的事件相关电位(ERP),这些电位反映了阅读过程中认知加工的不同阶段。我们认为,对ERP模式进行建模可以精细分析不同语言模型在阅读过程中的认知合理性。我们的结果表明,只有惊奇度可能与语言加工ERP相关,尤其是对于具有高语义内容的内容词。此外,我们的发现挑战了这样一种假设:随着语言模型参数增多和计算预算增加,其与人类语言处理的收敛性会持续改善。 关键词:认知神经科学;阅读理解;语言模型;GPT;脑电图(EEG) ## 引言 词预测反映了一个更广泛的认知过程,在此过程中,个体持续整合上下文以预测即将发生的事件,并根据所听到或读到的言语感知输入来检验这些预测\@BBOPcitep\@BAP\@BBN\(Bar,2007 (https://arxiv.org/html/2607.16549#bib.bib31)\)\@BBCP。在阅读过程中,可预测性效应被认为反映了与概率推理相关的认知需求,大脑逐步评估并更新对下一个可能词的解释\@BBOPcitep\@BAP\@BBN\(Shainet al.,2024 (https://arxiv.org/html/2607.16549#bib.bib30)\)\@BBCP。从信息论的角度\@BBOPcitep\@BAP\@BBN\(Shannon,1948 (https://arxiv.org/html/2607.16549#bib.bib32)\)\@BBCP来看,预测是一个概率生成认知系统的核心功能,该系统逐步处理展开句子中的词语。语言单元传达可量化的信息,度量如惊奇度(一个词在给定先前上下文中的意外程度)。因此,惊奇度是量化句子处理过程中逐词可预测性的有用指标\@BBOPcitep\@BAP\@BBN\(Hale,2016 (https://arxiv.org/html/2607.16549#bib.bib33)\)\@BBCP。 研究表明,惊奇度是阅读过程中神经反应的一个可靠预测因子,尤其是与N400成分相关。\@BBOPcitet\@BAP\@BBNMichaelov and Bergen (2020 (https://arxiv.org/html/2607.16549#bib.bib41))\@BBCP发现,惊奇度能有效预测N400振幅的变化,N400是语言理解过程中加工困难的一个神经指标。\@BBOPcitet\@BAP\@BBNFranket al.(2013 (https://arxiv.org/html/2607.16549#bib.bib42))\@BBCP通过分析参与阅读相同句子的受试者EEG数据并考察四个不同的ERP成分,进一步支持了这些发现。他们的结果表明,惊奇度估计值显著预测N400振幅,更令人惊讶的词会引发更大的负向N400响应。 来自语言模型的惊奇度建模已被广泛用于解释语言理解过程中的神经反应,早期工作表明,基于三元模型的惊奇度与阅读研究中的N400相关\@BBOPcitep\@BAP\@BBN\(Franket al.,2015 (https://arxiv.org/html/2607.16549#bib.bib51); Willemset al.,2016 (https://arxiv.org/html/2607.16549#bib.bib52); Armeniet al.,2019 (https://arxiv.org/html/2607.16549#bib.bib53)\)\@BBCP。最近基于Transformer语言模型的工作报告了类似效应:\@BBOPcitet\@BAP\@BBNHeilbronet al.(2019 (https://arxiv.org/html/2607.16549#bib.bib54))\@BBCP表明,GPT-2的逐词不可预测性与有声书聆听过程中的N400-like响应一致,而\@BBOPcitet\@BAP\@BBNMichaelovet al.(2024 (https://arxiv.org/html/2607.16549#bib.bib55))\@BBCP发现,GPT-3的惊奇度在模型中最好地预测了N400振幅,这表明期望性、合理性和语境语义相似性的效应可以通过词可预测性的变化来解释。尽管GPT-2在心理语言学预测方面的表现优于TransformerXL和XLNet\@BBOPcitep\@BAP\@BBN\(Haoet al.,2020 (https://arxiv.org/html/2607.16549#bib.bib48)\)\@BBCP,但关于更大模型能否产生更强可预测性-加工关系的证据是混杂的。在GPT家族中,\@BBOPcitet\@BAP\@BBNShainet al.(2024 (https://arxiv.org/html/2607.16549#bib.bib30))\@BBCP质疑了更先进的语言模型应在语境可预测性与加工困难之间表现出更强对数关系的说法。他们发现,尽管GPT-3规模更大且计算能力更强,但其惊奇度估计并不比GPT-2等较小模型更具“超对数性”。 尽管自然语言处理取得了重大进展,但语言模型仍然缺乏一个可解释的、与人类大脑处理语言方式相一致的机制性解释。这引发了关于语言模型是否捕捉了人类智能的某些方面,还是仅仅产生模仿人类思维的输出的争论\@BBOPcitep\@BAP\@BBN\(Mitchell and Krakauer,2023 (https://arxiv.org/html/2607.16549#bib.bib1)\)\@BBCP。下一个词可预测性是人类语言处理的一个基本方面,它有力地支持了语言模型的认知合理性\@BBOPcitep\@BAP\@BBN\(Keller,2010 (https://arxiv.org/html/2607.16549#bib.bib2)\)\@BBCP。谈到思维,我们应该考察大脑活动。在语言理解过程中,人脑表现出反映持续预测加工的系统性神经活动模式\@BBOPcitep\@BAP\@BBN\(Fitz and Chang,2019 (https://arxiv.org/html/2607.16549#bib.bib3)\)\@BBCP。因此,我们不考察不同语言模型的下一个词预测表现,而是研究自然阅读语境(尤其是较长的叙事文本)中下一个词可预测性与神经反应之间的关系。 为了探究这个问题,我们进行了多项实验。首先,我们使用DERCo数据集(一个结合EEG和下一个词预测数据的语言资源)\@BBOPcitep\@BAP\@BBN\(Quachet al.,2024 (https://arxiv.org/html/2607.16549#bib.bib59)\)\@BBCP,计算了三个预测因子(人类受试者、n-gram模型和GPT家族模型)在内容词和功能词层面的top-1预测和词汇惊奇度。接着,我们使用基于回归的反卷积对神经反应进行编码,以估计可预测性对神经活动的影响。然后,我们比较了基于top-1预测和语言模型惊奇度估计得出的神经反应预测与通过人类完形概率得出的预测之间的相关性。此比较的目的是确定哪个模型最接近人类在阅读行为中的可预测性模式。为了提供更深入的见解,这些相关性将在显著时间窗口和显著电极簇中进行可视化。 ## 方法 ### 刺激材料与EEG数据准备 我们使用了DERCo数据集\@BBOPcitep\@BAP\@BBN\(Quachet al.,2024 (https://arxiv.org/html/2607.16549#bib.bib59)\)\@BBCP,该数据集包含22名以英语为母语的受试者在阅读《格林童话》时的EEG记录。由于过度眼动,排除了两名受试者(“QPF42”和“USQ95”)。此外,通过Amazon Mechanical Turk众包平台上的完形程序收集了逐词的完形概率。 EEG数据使用32通道电极帽按照国际10-20系统\@BBOPcitep\@BAP\@BBN\(Klem,1999 (https://arxiv.org/html/2607.16549#bib.bib87)\)\@BBCP进行记录。由于分析使用了预处理后的数据,DERCo数据集抄本中词级EEG试验的数量因伪迹去除而减少。所有经过预处理后剩余的词语都作为编码大脑信号的刺激材料。使用Python库IPA提取词性,然后将其分为内容词和功能词。 ### 信息论度量 为了探究下一个词的可预测性,我们使用了两种度量:top-1预测和惊奇度。这些度量作为人类和计算模型在阅读理解中的期望和加工努力的代理,捕捉了与预测相关的认知负荷的不同方面。 #### Top-1预测估计 大多数语言模型旨在估计词汇表VV上的概率分布,用于给定上下文w1,w2...wi−1w_1,w_2...w_{i-1}(包含序列中前面词语的文本)后位置ii处可能的下一个词wi∈Vw_i\in V。最高概率(也称为top-1预测)定义为: Pwi=maxwi∈VP(wi∣w1,w2,...,wi−1)P_{w_i}=\max_{w_i\in V}P(w_i\mid w_1,w_2,...,w_{i-1}) (1) #### 惊奇度估计 惊奇度是对目标词意外程度的度量。\@BBOPcitet\@BAP\@BBNHale (2001 (https://arxiv.org/html/2607.16549#bib.bib34))\@BBCP和\@BBOPcitet\@BAP\@BBNLevy (2008 (https://arxiv.org/html/2607.16549#bib.bib35))\@BBCP认为,一个词在给定语境中越不预期,其惊奇度就越高。例如,“Peter won the championship. Afterward, he was in seventh ...”。如果读者识别出这个习语,他们可以猜到缺失的词是“heaven”。由于该词高度可预测,因此具有低惊奇度并传递极少的新信息。 在处理完句子的前t个词w1...tw_{1...t}后,即将出现的词wt+1w_{t+1}的身份仍然未知,因此可以视为一个随机变量。惊奇度定义为实际下一个词给定其前面上下文的负对数概率: SurprisalSwt+1=−logP(wt+1|w1...t)\textit{Surprisal }S_{w_{t+1}}=-\log P(w_{t+1}|w_{1...t}) (2) ### 预测因子 #### 人类预测 Top-1预测是指猜测出相同下一个词的参与者最高百分比。top-1预测值为100%表示所有参与者都猜出了相同的下一个词,而0%表示没有参与者预测到即将出现的词。这可以简单地定义为在可能出现在下一位置的词中的最大完形概率。 相比之下,词汇惊奇度是抄本中正确下一个词的完形概率。需要注意的是,正确下一个词的完形值不一定等于top-1预测值。仅当该词非常容易预测(即所有参与者预测的词正是抄本中的正确词)时,这些值才相等。 完形程序的一个主要问题是零概率响应会产生未定义的惊奇度。当没有参与者根据前面上下文w1,w2,...,wi−1w_1,w_2,...,w_{i-1}预测到准确的目标词wiw_i时,就会发生这种情况。在实际样本量下,概率P(wi|w1,w2,...,wi−1)<0.001P(w_i|w_1,w_2,...,w_{i-1})<0.001的词不会出现在响应中,这促使扩展概率分布以包含更多词。因此,遵循\@BBOPcitet\@BAP\@BBNLowderet al.(2018 (https://arxiv.org/html/2607.16549#bib.bib64))\@BBCP,我们在计算惊奇度之前将零完形概率替换为最小非零值的一半。 #### N-gram模型 在本研究中,我们使用NLTK Python包(https://www.nltk.org/)训练了从二元到四元的模型。与先进的Transformer语言模型\@BBOPcitep\@BAP\@BBN\(Amaratunga,2023 (https://arxiv.org/html/2607.16549#bib.bib60); Desaiet al.,2023 (https://arxiv.org/html/2607.16549#bib.bib61)\)\@BBCP不同,n-gram模型在捕捉长距离依赖性方面存在局限性。为了缓解这一问题,我们在童话语料库\@BBOPcitep\@BAP\@BBN\(Lobo and de Matos,2010 (https://arxiv.org/html/2607.16549#bib.bib62)\)\@BBCP上训练了n-gram模型,该语料库是与DERCo领域对齐的数据集,包含来自Project Gutenberg\@BBOPcitep\@BAP\@BBN\(Klein and Manning,2002 (https://arxiv.org/html/2607.16549#bib.bib63)\)\@BBCP的453篇童话故事。 为避免过拟合,我们排除了DERCo数据集抄本中使用的五篇格林童话。所有标点符号被移除,字母转换为小写。为应对数据稀疏性,我们分别训练了无平滑、Laplace平滑和Kneser-Ney平滑的n-gram模型。然后,每个模型使用固定大小的上下文窗口(n-1个词),在问题实例中定位所有匹配的窗口,并计算每个可能下一个词出现的次数,以计算top-1预测和惊奇度估计的词概率。 #### GPT-2与GPT-Neo家族 生成式预训练Transformer(GPT)\@BBOPcitep\@BAP\@BBN\(Radford,2018 (https://arxiv.org/html/2607.16549#bib.bib88)\)\@BBCP是一种基于Transformer的自回归语言模型,使用基于编码器-解码器架构的多头“注意力”机制\@BBOPcitep\@BAP\@BBN\(Vaswani,2017 (https://arxiv.org/html/2607.16549#bib.bib89)\)\@BBCP。我们选择GPT-2和GPT-Neo家族进行调查,因为它们主要基于从左到右的概率来预测即将出现的标记,类似于下一个词预测任务中使用的完形程序\@BBOPcitep\@BAP\@BBN\(Taylor,1953 (https://arxiv.org/html/2607.16549#bib.bib36)\)\@BBCP。 Transformer模型将标记序列(例如,词、音素或标点)作为输入,上下文窗口取决于故事长度。如果故事长度超过一个上下文窗口(例如1024个标记),则后续标记的概率估计基于前一个窗口的后半部分。预测是针对每个故事单独进行的,故事之间重置上下文,而不是从前一个故事延续上下文。故事主题被包含在预测中,因为DERCo数据集中实验开始时向参与者披露了主题。 对于跨多个标记的词,词概率使用链式法则计算为标记的联合概率。惊奇度通过对标记级惊奇度求和得到,反映了在线实验中参与者将词语与相关标点一起查看。相比之下,top-1预测仅关注正确词的识别;由于参与者只输入了不带标点的词语,因此对应的概率
相似文章
解码脑电图信号以探究人脑中下一个词的可预测性
本研究利用脑电图探究词汇类别中单词可预测性如何影响N400脑响应,结果显示内容词比功能词表现出更大的N400差异,且解码技术优于传统的ERP分析。
自然理解过程中语言模型的异质性神经预测性
本文研究了在自然语言理解过程中,语言模型表示如何预测MEG、ECoG等记录中的神经活动。研究结果表明,语言模型特征可作为有用的神经预测因子,但需谨慎避免将预测成功过度解读为共享神经组织的证据。
在慢速fMRI上微调语言编码模型提升对快速ECoG的预测
本文表明,尽管fMRI的时间分辨率较低,但在fMRI数据上微调语言编码模型能提升其对ECoG记录中神经活动的预测能力。研究结果表明,丰富的'慢速'fMRI数据可以增强针对'快速'ECoG数据的模型。
Brain Score 追踪语言的共享属性:来自多种自然语言和结构序列的证据
本文研究了 Brain Score(一个将语言模型表征与人类阅读时 fMRI 激活进行比较的指标)是否真正捕捉到类似人类的语言处理,或仅反映结构相似性。研究人员在多种自然语言和非语言结构数据(基因组、Python、嵌套括号)上训练语言模型,发现在不同语言和非语言序列上训练的模型达到相似的 Brain Score 性能,这表明该指标可能不足以区分人类特有的处理方式。
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。