非侵入式EEG解码默读
摘要
这项研究使用非侵入式EEG和对比学习来解码默读过程中的单词,展示了可扩展的词汇信息恢复,其性能随数据量增加而提升。
暂无内容
查看缓存全文
缓存时间: 2026/08/23 22:42
# 从非侵入式EEG解码默读活动 来源:https://arxiv.org/html/2608.20186 作者:Anthilia Alchanat, Priyanka Jain 单位:\[0.5em\] nubrain 发布日期:2026年8月18日 ###### 摘要 非侵入式解码内部言语面临一个根本性的数据难题:无法建立将大脑活动与个体自发内心独白配对的语料库,且现有的替代范式(如*有线索的重复性*和*事后报告的生成性*内部言语)存在数据采集缓慢、时间对齐困难、受试者配合度无法验证等问题。因此,我们将默读视为一个可扩展的替代任务,探究对比解码器能从中提取多少词汇与语义信息。本研究通过19通道干电极EEG,记录了单名高密度采样参与者在393次运行(约49小时)中约24万次单词呈现的开放词汇分析结果。连续叙事文本中的单词以快速序列视觉呈现方式呈现,每次试验随机化排版以部分降低单词特征与低级视觉形式的相关性。卷积EEG编码器(可选连接因果Transformer)采用CLIP式对比目标进行训练,将短时EEG窗口与大语言模型生成的单词隐状态嵌入对齐。以分组Top-10检索评估的解码结果显著优于排列基线,可扩展至中频词和罕见词,且随训练数据量呈对数线性增长,无饱和迹象。移除枕叶和后颞叶电极使单词级增益下降约三分之一,但未改变上下文追踪能力。控制分析区分了单词级解码与叙事上下文追踪,以及Transformer位置编码引入的非神经位置先验。这些结果证实,EEG可在默读过程中提取开放词汇级的单词信息,且解码性能受数据量限制而非已饱和。 ## 1 引言 ### 1.1 研究动机 中风、创伤性脑损伤、肌萎缩侧索硬化症或其他神经退行性疾病导致的言语能力丧失,切断了人类最基本的沟通渠道。因此,直接从神经活动解码预期或想象言语的脑机接口(BCIs)一直是长期的临床目标。过去五年该领域取得了显著进展,但主要依赖侵入性技术。皮层内和皮层电图系统现在能以对话速率和近乎完美的准确率解码数万词汇的尝试性言语(2 (https://arxiv.org/html/2608.20186#bib.bib2);17 (https://arxiv.org/html/2608.20186#bib.bib17);18 (https://arxiv.org/html/2608.20186#bib.bib18)),最新研究表明*内部言语*(无尝试性发声的想象言语)在运动皮层中作为尝试性言语的缩小版本被稳健表征,二者共享神经子空间,从而能实现12.5万词汇表的实时想象句解码(11 (https://arxiv.org/html/2608.20186#bib.bib11))。缘上回的单神经元记录也呈现相似规律,内部言语可在线解码,且在阅读、听力和发声言语间具有共享表征(22 (https://arxiv.org/html/2608.20186#bib.bib22))。这些结果确立了从测量的脑活动中解码内部言语的科学可行性,但未能解答这种结构是否在不进行神经手术的情况下可获取。侵入性设备存在手术风险、长期耐久性有限,且无法扩展至需恢复或增强沟通能力的广大人群。核心问题在于非侵入式记录(特别是EEG)能否被推进到实用程度。 ### 1.2 非侵入式语言解码现状 非侵入式语言解码文献可分为两种效果迥异的方法。第一种方法解码参与者*感知*的语言。7 (https://arxiv.org/html/2608.20186#bib.bib7)采用对比目标(CLIP)训练卷积脑模块,将M/EEG与wav2vec 2.0自监督语音表征对齐,从超过千个候选片段中以最高41%的Top-1准确率识别正确的3秒语音片段(基于MEG)。但其EEG结果较弱(两个数据集的Top-10准确率分别为17.7%和25.7%)。21 (https://arxiv.org/html/2608.20186#bib.bib21)记录了单名参与者长达175小时的朗读EEG数据,在512个候选片段上达到48.5% Top-1和76.0% Top-10分类准确率,更重要的是证实了数据量与解码准确率间未饱和的对数线性缩放关系。当他们将数据子采样至该领域典型的约3小时时,准确率骤降至先前报道水平。其结论——也是本研究的出发点——在于EEG语言解码的约束条件可能是数据集规模而非信号质量的硬上限。 第二种方法试图直接解码*内部*言语,效果显著较差。5 (https://arxiv.org/html/2608.20186#bib.bib5)收集了异常大量的单人EEG/MEG数据集,涵盖三种范式——默读、重复性内部言语和生成性内部言语——采用临床相关的五词词汇表。默读在EEG、MEG和光泵磁力计上的解码准确率为30–40%(随机基线20%),置换特征重要性显示效应在约150毫秒时定位于视觉皮层。两种内部言语范式在多种解码方法下均接近随机水平,失败阻碍了从阅读到内部言语的迁移测试。早期EEG想象言语研究报道的准确率统计上高于随机但远未达到实用程度,通常基于小词汇表和少数电极(3 (https://arxiv.org/html/2608.20186#bib.bib3);14 (https://arxiv.org/html/2608.20186#bib.bib14)),个别异常值的范式易引入混淆因素(1 (https://arxiv.org/html/2608.20186#bib.bib1))。直接针对想象短语的MEG研究报道了较高准确率(6 (https://arxiv.org/html/2608.20186#bib.bib6)),但范式中想象紧随同一短语的感知过程,残留的感知和运动准备活动可能成为混淆因素。 ### 1.3 内心独白的标注数据困境 这两种非侵入式语言解码方法的差距具有启示意义。在能获得大量时间对齐良好数据(如感知和显性产出)的领域,非侵入式解码虽不完美但可测量。在缺乏此类数据(自发性内部言语)的领域,解码则无效。这种差异反映了根本障碍。理想的心语解码器训练语料库需要将短时EEG片段与该时段人物所思内容的文字记录配对,但此类语料库无法存在。要知道某人在精确时间点的内心独白,需要一台读心设备;而构建该设备又需要此类语料库。现有范式都是试图部分打破这个循环,每种范式都付出了特定代价。 *生成性内部言语*(参与者自由想象项目并事后报告(10 (https://arxiv.org/html/2608.20186#bib.bib10);5 (https://arxiv.org/html/2608.20186#bib.bib5)))保留了思维的内源性特征,但破坏了时间信息。即使如实报告想过“我喜欢香蕉”,也无法确定该思维发生在报告前400毫秒还是1500毫秒——这对信息结构以数十毫秒为尺度的信号是致命的模糊性。该范式还要求持续且无法验证的配合度:无法客观检查参与者是否专注、走神或选择性报告。数据质量和数量均受影响。 *重复性内部言语*(参与者被指示想象特定项目并在提示时想象)恢复了时间信息但重新引入了提示。记录的响应包含提示和想象项目的神经处理。精心设计可缓解此问题:短暂呈现项目,等待随机间隔,然后发送内容中立的执行信号可减少感官污染,但无法消除。(基于感知的替代任务,如本研究中的任务,显然也受感官信号影响,见第4.5节(https://arxiv.org/html/2608.20186#S4.SS5)。)但我们认为,比生成性内部言语缺乏精确时间信息和重复性内部言语感官污染更重要的是,这些范式强加了缓慢的试验结构。缓慢重复的试验令人厌倦,厌倦的参与者会脱离任务,而脱离状态在数据中无法检测。因此该范式具有双重局限:无法扩展,且其标注以无法审计的方式退化。两种方法均无法合理产生21 (https://arxiv.org/html/2608.20186#bib.bib21)缩放结果所建议的每人数十或数百小时所需的数据量。 ### 1.4 我们的方案:以阅读(及后续听力)作为可扩展替代 任何语言解码范式都必须平衡三个相互制约的目标: 1. 1. **有效性**:任务必须诱发语言处理并激活语义表征。例如,仅需关注单词刺激视觉属性即可完成的任务不能保证语义处理。 2. 2. **可扩展性**:范式必须覆盖大量语言内容/小时,并在数小时内保持可行性。 3. 3. **配合度**:任务必须足够吸引以维持注意力,足够简单以无需过多心智努力就能遵循,并配备仪器以检测注意力涣散。 我们得出结论,获取语言解码训练数据集的最佳妥协方案是结合默读和被动听力的多模态范式。阅读单词时,初级视觉皮层首先编码字母形状和位置。单词形式被识别后,高级脑区参与编码其意义。听到同一单词时,听觉皮层首先编码语音结构,但最终引发相同的语义表征。因此,阅读和听力共享表征目标,同时在输入驱动的模态特异性成分上差异最大。跨两者训练的解码器或评估其间的迁移能力,可缓解限制默读范式的混淆因素——即可解码信号可能主要由视觉单词形式处理驱动(5 (https://arxiv.org/html/2608.20186#bib.bib5);13 (https://arxiv.org/html/2608.20186#bib.bib13))。 模态通用语义编码的证据已充分确立。颞叶前部的与语言无关的语义表征在双语听者的两种语言间具有泛化能力(4 (https://arxiv.org/html/2608.20186#bib.bib4)),基于语言感知训练的fMRI分类器能成功解码语言产出的内容(12 (https://arxiv.org/html/2608.20186#bib.bib12))。 本报告仅涵盖多模态语言解码设计的默读部分。被动听力条件计划在后续研究中实施,因此目前无法进行跨模态迁移分析。与先前非侵入式默读工作相比,我们的设计在三个影响结果解释的方面有所不同: 1. **词汇表开放且自然**:参与者阅读连续叙事散文而非临床相关的小型固定词汇集,因此模型必须处理数万词类而非寥寥数词。 2. **逐次试验随机化排版**(字体、大小、颜色、字符间距),直接解决5 (https://arxiv.org/html/2608.20186#bib.bib5)提出的担忧——当每个单词始终以相同方式呈现时,低级视觉形式与单词特征存在混淆。 3. **数据量足够大**以回答缩放问题。 ### 1.5 本报告目的 本报告呈现了一项进行中研究项目的初始结果。现有结果仅限于单名高密度采样参与者。我们已单独收集了60名参与者的默读数据(每人1-2个时段),计划在未来报告中呈现跨被试结果和多模态结果(包括被动听力条件)。本报告中,我们具体探究: 1. 1. 在开放词汇对比设置中,EEG能否在默读过程中解码单词级信息? 2. 2. 表观解码中有多少属于上下文追踪(即跟随进行中的叙事主题)而非识别当前呈现的单词?这是当目标表征来自因果语言模型时的核心解释风险,我们直接解决此问题。相关风险是序列模型习得的位置编码对上下文目标产生位置先验(位置编码是模型唯一的逐试验变化非神经输入)。我们通过掩蔽探针直接测量此贡献。 3. 3. 信号是否局限于高频(主要是功能词),还是扩展到中频和罕见内容词? 4. 4. 性能如何随训练数据量缩放? 5. 5. 哪些分析和优化选择能最大化解码准确率?因本工作的实践动机是脑机接口开发而非纯描述性表征。 实验范式、记录设置、解码架构和评分流程四面板概览 图1:范式与解码流程。完整说明见下一页。 图1 (https://arxiv.org/html/2608.20186#S1.F1)(前页):范式与解码流程。(a)连续叙事散文的单词逐个呈现在黑色屏幕中央(快速序列视觉呈现)。排版(颜色、字体、大小和字符间距)在每次试验中随机绘制,使单词特征与低级视觉形式去相关。每个单词在屏幕上停留500–900毫秒(根据字符数缩放,附加最多100毫秒抖动)。深参与者的前171次运行的刺激间隔为100毫秒,之后为0毫秒。每次运行包含约600个单词,叙事内容从一次运行延续到下一次。(b)记录设置:10-20布局的19个干头皮电极,采样率600 Hz(补充材料S0 (https://arxiv.org/html/2608.20186#A0))。(c)解码架构。固定长度EEG窗口通过双通路卷积编码器——全局通路由卷积块经可学习注意力池化折叠,局部通路保留六个粗时间区间——和全连接头部,生成每个试验256维特征。可选的四层因果Transformer在单次运行的特征序列上操作。独立地,呈现的单词被映射到Llama-3.1-8B的隐状态,取自第0层(非上下文:输入嵌入,仅依赖单词特征)或第20层(上下文:依赖所有前文)。
相似文章
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。
解码脑电图信号以探究人脑中下一个词的可预测性
本研究利用脑电图探究词汇类别中单词可预测性如何影响N400脑响应,结果显示内容词比功能词表现出更大的N400差异,且解码技术优于传统的ERP分析。
从非侵入式脑电记录中准确解码自然语句
本文介绍了Brain2Qwerty v2,这是一个AI模型,能从非侵入式脑磁图记录中准确解码自然语句,词错误率为39%,证明了数据规模化有助于缩小与侵入式方法之间的性能差距。
无声语音与超声波
一个基于舌头超声波记录训练的模型能够以15.6%的词错误率解码无声语音,尽管数据集较小,但其性能已接近唇读水平。
从神经活动进行端到端的大脑皮层内语音解码
本文提出了一种端到端的基于Conformer的神经解码器,用于从一位肌萎缩侧索硬化症(ALS)参与者的皮层内记录进行语音解码,在没有任何外部语言模型的情况下,字符错误率达到23.80%。该研究表明,在完全端到端的框架中实现有意义的字符级解码是可行的。