从非侵入式脑电记录中准确解码自然语句

arXiv cs.CL 论文

摘要

本文介绍了Brain2Qwerty v2,这是一个AI模型,能从非侵入式脑磁图记录中准确解码自然语句,词错误率为39%,证明了数据规模化有助于缩小与侵入式方法之间的性能差距。

arXiv:2608.18114v1 Announce Type: new 摘要:对于因脑损伤而失去说话或行动能力的人来说,恢复交流是一个重大挑战。虽然颅内植入物现在能实现高性能的脑机接口,但非侵入式替代方案仍然落后。在此,我们介绍了Brain2Qwerty v2,一个能够仅从实时脑磁图(MEG)记录中解码自然语句产生的模型。通过收集九名受试者输入的22,000个语句,每人记录10小时,我们的模型利用字符、单词和句子级表示,实现了平均词错误率(WER)为39%。对于最佳参与者,模型准确解码了一半的语句,错误不超过一个词。关键的是,解码精度随数据量对数线性提升,表明通过数据规模化,与颅内方法的性能差距可以部分缩小。我们展示了AI通过三种主要方式实现这一性能:用深度学习替代手工设计的事件检测流程,微调大型语言模型以提取语义表示,以及部署AI代理通过自动代码开发迭代优化我们的解码流程。总之,这些结果表明,非侵入式脑到文本解码开始达到以前认为仅限于外科植入物的精确度,为安全高效的脑机接口开辟了道路。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:03

# 从非侵入式脑部记录中准确解码自然句子

来源:https://arxiv.org/html/2608.18114  
1\]Meta AI  
2\]巴黎高等师范学校,巴黎文理研究大学,法国国家科学研究中心  
3\]阿道夫·德·罗斯柴尔德医院基金会  
4\]里尔大学,法国国家科学研究中心,UMR 9193-SCALab-认知科学与情感科学,法国里尔  
5\]巴斯克认知、大脑与语言中心,圣塞巴斯蒂安  
6\]巴黎西岱大学  
7\]法国国家信息与自动化研究所,巴黎-萨克雷大学,法国帕莱索  
8\]法国国家科学研究中心、法国国家健康与医学研究院、法国原子能委员会,神经影像中心,法国吉夫  
\contribution\[\*\]同等贡献  
\contribution\[†\]共同指导本研究  
\metadata\[Code\]https://github.com/facebookresearch/brain2qwerty  
\correspondence, , Jarod Lévy Cedric Rommel Jérémy Rapin Corentin Bel Julie Bonnaire Daniel Nieto Pierre Bourdillon Svetlana Pinet Stéphane d’Ascoli Thomas Moreau Jean\-Rémi King  
\[[jarod@meta\.com](mailto:[email protected]) [lucy\.zhang@psl\.eu](mailto:[email protected]) [jeanremi@meta\.com](mailto:[email protected])\]  
\(2026年6月29日\)  

###### 摘要  
为脑损伤后丧失说话或运动能力的人恢复沟通是一个重大挑战。虽然颅内植入物现已能实现高性能的脑机接口,但非侵入性替代方案仍显落后。本文提出Brain2Qwerty v2,一个仅凭实时脑磁图(MEG)记录即可解码自然句子产出的模型。通过收集九名受试者键入的22,000个句子,每人记录10小时,我们的模型利用字符、词和句子级表征,实现了平均39%的词错误率(WER)。对于表现最佳的受试者,模型能准确解码一半句子,且每个句子的错误不超过一个词。关键的是,解码准确率随数据量呈对数线性提升,表明与颅内方法的性能差距可能通过数据规模扩展部分弥合。我们展示了人工智能通过三种主要方式实现这一性能:用深度学习替代手工设计的事件检测流程、微调大语言模型以提取语义表征、以及部署智能体通过自动代码开发迭代优化解码流程。这些结果共同表明,非侵入式脑-文本解码的准确率已开始达到此前认为仅属于外科植入物的水平,为安全高效的脑机接口开辟了道路。

## 1 引言  
参考标题 图1:通过记录规模和多样性实现异步MEG解码。A. 实验方案。左:我们使用脑磁图(MEG)对健康志愿者每人记录10小时,他们在听到自然句子几秒后进行键入。右:按键时的平均MEG源重构显示,MEG主要捕捉运动皮层的神经活动。B. 脑-文本解码方法。同步解码指对与每次击键时间锁定的窗口内的字符进行分类(如levy2025brain)。异步解码指从连续的脑信号中解码文本,因此可用于实时场景,尽管可能存在一定延迟(如feghhi2025time)。C. 我们数据集(EnglishBCBL)与levy2025brain(SpanishBCBL)在数据量(每受试者小时数)和多样性(唯一句子数量)上的对比。D. levy2025brain同步编码器的字符错误率(CER)。每个彩色点代表一名受试者;柱状图为受试者间平均值。E. 我们异步编码器的相同图表。F. 异步编码器CER随训练数据量(对数坐标)的扩展情况,以每受试者总记录小时数表示(所有点的测试集固定)。蓝色曲线为我们在EnglishBCBL数据集上的受试者间平均值。橙色菱形表示在SpanishBCBL上训练我们的异步编码器后的结果。G. 在总句子数匹配时,句子列表多样性对异步编码器CER的影响:128个唯一句子×2次重复(SpanishBCBL方案,橙色)与256个唯一句子(EnglishBCBL方案,蓝色)。每个条件下n=9名受试者的双侧Mann-Whitney U检验:(\*\*\*)表示p < 0.001。所有图表中,CER按句子计算,然后在每个受试者内平均,最后在受试者间平均。

侵入式脑机接口(BCIs)最近已为因脑损伤或疾病丧失说话或运动能力的个体恢复了沟通能力。最近,几位患有失语症、闭锁综合征或肌萎缩侧索硬化症(ALS)并在运动皮层植入电极的患者,能够通过尝试言语、书写和打字产生语言,其解码速度和准确性接近自然语言水平。尽管取得了这些突破,颅内植入物的侵入性仍是大规模临床转化面临的挑战。神经外科手术意味着显著的医学风险,且由于神经炎症反应,维持良好的神经记录长期稳定性可能颇具挑战。为广泛的患者群体提供专业的手术护理也将带来巨大的后勤挑战。作为替代方案,多年来已提出了许多非侵入性BCI。然而,这些方案中的每一个都面临重要挑战。脑电图(EEG)的*信噪比*较差,限制了BCI只能用于复杂且要求极高的任务,使其实际上对患者不实用。类似地,功能性磁共振成像有限的*时间分辨率*本质上限制了其在沟通中的应用。脑磁图(MEG)可能提供一种有前景的替代方案,但性能仍落后于侵入式记录。特别是,levy2025brain最近通过训练与每次击键时间锁定的分类器,以32%的字符错误率(CER)解码了键入的文本。然而,该方法面临三个主要挑战。首先,它需要知道单个击键的时间点,因此限制了实时使用。其次,击键分类无法保证有效的句子重建,因为错误分类的字符会导致无法理解的输出。第三,该研究基于相对较少的数据:侵入式BCI通常利用数千个句子,记录时长10-40小时,而levy2025brain的参与者每人仅记录了1小时。为了应对这三个挑战,我们引入了Brain2Qwerty v2,这是一个旨在从非侵入性脑磁图(MEG)记录中解码22,000个句子语料库的深度学习框架。我们在九名健康志愿者的延迟打字任务上训练了该模型,共90个总记录会话。在每个试验中,参与者通过耳机听到一个句子,等待强制延迟,然后键入相应的文本。我们的解码研究专注于语言产出阶段的神经活动。这个新数据集的数据量比levy2025brain多10倍,涵盖更多样化的句子。基于此数据集,我们的方法通过三种主要方式利用AI:首先,我们通过联结主义时间分类(CTC)目标解决了实时挑战。其次,我们设计模型通过微调大语言模型(LLM)来生成有意义的句子。第三,我们采用“自动化研究”AI智能体,通过自动代码开发自主编写代码来优化我们的解码流程。

## 2 结果

### 2.1 解码单个击键

#### 源重建确认了打字期间预期网络的激活。  
为了检查受试者的大脑活动,我们首先在击键起始时进行源重建分析。结果显示初级运动皮层(M1)和辅助运动区(SMA)双侧激活。值得注意的是,激活在右半球更为广泛,这一模式与右利手人群中M1的对侧组织一致,也与SMA在双手运动协调中既定的作用一致。在击键周围还可以检测到左额背外侧、额下回和颞顶联合区的额外残余活动,与语言网络一致。

#### 数据集规模提升解锁了具有竞争力的异步解码。  
解码击键是解码键入句子的良好起点。为了移除先前工作中同步方法需要击键时间的限制,我们在此实现了异步解码,它从连续的响应窗口中输出一系列预测。为此,我们采用了联结主义时间分类(CTC)目标,该目标学习将可变长度的MEG记录与击键序列对齐,而无需每次击键的起始时间。然而,使用CTC进行异步解码是一个相当更难的问题。因此,我们首先询问:我们新的打字MEG数据集的规模和多样性是否足以缩小与同步性能的差距,使我们能够在不需要击键时间的情况下解码完整句子。为了量化数据规模的益处,我们在低数据SpanishBCBL数据集和我们新的、更大的EnglishBCBL数据集上,比较了levy2025brain中使用的同步编码器(Encoder Sync)和本工作中使用的异步编码器(Encoder Async)预测结果的CER。两个编码器都包含一个BrainModule,随后是一个Transformer用于分组学习的击键表征(Encoder Sync)或一个在完整时间帧表征上运行的Conformer(Encoder Async)。使用Encoder Sync时,从SpanishBCBL扩展到EnglishBCBL显著提升了同步解码性能(CER:0.39±0.02 → 0.23±0.03)。关键的是,规模的益处对Encoder Async更为显著(CER:0.59±0.02 → 0.25±0.03),后者在EnglishBCBL上的性能几乎与同步方法相当。虽然Encoder Sync在低数据SpanishBCBL数据集上优于Encoder Async,但这一差距在EnglishBCBL上缩小到仅2%。总体而言,这些结果证实,数据集的规模是使异步解码能够接近同步方法设定的性能上限的决定性因素。

#### 异步性能随数据量呈对数线性扩展。  
接下来,我们研究异步编码器的性能如何随训练数据扩展。我们在EnglishBCBL数据集逐渐增大的子集上重新训练了一系列Encoder Async模型。CER随着记录小时数的增加持续降低,并且在目前约90小时(所有参与者合并)的数据上限下没有饱和迹象。扩展遵循清晰的对数线性趋势(在5个训练比例条件下,log10(小时数)与受试者间平均CER之间的Pearson相关系数r = -0.99,p = 1.1×10⁻³,R² = 0.98;斜率 = -0.39 CER/十倍频程),表明通过额外数据采集可实现进一步的性能提升。

#### 句子多样性独立提升解码性能。  
有趣的是,在SpanishBCBL数据集上,Encoder Async的CER为0.59±0.02,显著高于在我们EnglishBCBL数据集类似量数据上训练的结果(0.52±0.02,p < 0.05)。这一性能差距是否可能源于两个数据集在语言多样性上的差异?在SpanishBCBL数据集中,每个唯一句子由每名参与者重复两次,而在EnglishBCBL数据集中,每个唯一句子每名参与者仅键入一次。此外,SpanishBCBL数据集在词性和句法结构上的多样性较小。为了区分语言多样性和数据量的影响,我们构建了两个控制数据集,总句子数和参与者数量(n=9)匹配,但唯一句子数量不同:一个来自SpanishBCBL(128个唯一句子 × 每人重复2次),一个来自EnglishBCBL(256个唯一句子,每人键入一次)。在非重复句子上训练的编码器实现的CER显著低于在重复句子上训练的编码器(CER:0.45±0.03 vs. 0.65±0.01;p < 0.001;图1G),证明句子多样性构成了与总样本量不同的数据质量的独立维度。这些发现共同表明,即使不使用任何语言模型,训练句子的数量和多样性也是非侵入式脑-文本解码中编码器性能的关键决定因素。

### 2.2 使用Brain2Qwerty v2从MEG解码自然句子

#### Brain2Qwerty v2利用多层级架构提取语义表征。  
使用击键解码的方法侧重于提取捕获字符级信息的信号表征。虽然这一步骤对于解码键入文本至关重要,但它并未利用自然语言的统计规律性,例如大语言模型(LLM)中编码的规律。上述异步击键解码器既未设计用于(1)提取语义表征,也未设计用于(2)高效利用自然语言的统计规律。为了利用神经记录中的高层语义信息和LLM的能力,我们开发了一个三级架构,旨在共同提取字符、词和句子级信息:- • Encoder Async(此后称为编码器),使用CTC目标训练,以输出一系列击键预测。- • 对齐器将神经数据与词语连接。通过使用对比学习方法(SigLIP损失),它训练模型将处理后的脑信号直接与其正确的词语表征对齐。- • LLM部分使用低秩适配器(LoRA)和交叉熵损失对LLM进行微调,当输入CTC击键预测和神经元标记时,能够自回归地生成目标句子。一个基本挑战是如何弥合来自编码器的连续MEG嵌入与LLM期望的词语级标记之间的差距。为此,我们设计了一个CTC分词器,它根据“空格”键所在的位置将连续的MEG嵌入分块。

相似文章

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。

Brain-IT-VQA:从大脑信号到答案

Hugging Face Daily Papers

Brain-IT-VQA 框架利用 Transformer 架构从 fMRI 信号中解码视觉内容,性能优于此前的方法。作者还引入了 NSD-VQA,这是一个新数据集,具有更丰富的标注,用于评估基于 fMRI 的视觉问答。