LibriBrain100:面向大规模神经语音解码的一百小时广度与深度MEG数据集
摘要
本文介绍了LibriBrain100,一个大规模MEG数据集,包含超过100小时的神经语音解码数据,在单词分类基准测试中达到了最先进的性能。
arXiv:2608.25204v1 公告类型:新
摘要:我们引入了LibriBrain100,一个专为可重复、标准化评估而从零设计的大规模MEG数据集。LibriBrain100的规模是原始LibriBrain版本的两倍多,提供了超过100小时的高质量MEG数据,这些数据是在受试者聆听自然连续语音时采集的。其中约80小时来自单个受试者,LibriBrain100创下了深度、受试者内神经数据的新纪录(是下一个可比数据集的8倍,大约是其他数据集的80倍)。为了展示这种深度优先设计的价值,我们在单词分类基准测试上进行了评估——这是一个日益成熟的、通往非侵入式脑到文本解码开放挑战的阶梯。使用现有的解码模型,我们达到了最先进的性能——验证了记录的质量和大规模受试者内数据的价值。由于在实际应用中为每个用户收集80小时的数据不切实际,我们还从32个受试者中每人额外收集了约40分钟的数据。使用相同的单词分类基准测试,我们展示了广泛多受试者数据的价值:对预训练模型进行监督微调可以显著补偿有限的受试者内数据。我们提供了标准的训练、验证和测试划分,所有这些都可以通过一个开源Python库轻松重现,该库支持方便下载、可选预处理以及为常见深度学习框架加载数据。此外,数据集和评估基础设施将与一个开放的机器学习竞赛一起发布,该竞赛设有公共排行榜,用于标准化基准测试。最终,我们希望LibriBrain100能够加速向实用非侵入式脑机接口的进展,这些接口能够为严重瘫痪患者恢复交流能力。
查看缓存全文
缓存时间: 2026/08/27 09:36
# LibriBrain100:用于大规模神经语音解码的一百小时广泛而深入的MEG数据 来源:https://arxiv.org/html/2608.25204 **Francesco Mantegna** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 电子邮箱:[francesco@robots\.ox\.ac\.uk](mailto:) **Dulhan Jayalath** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 电子邮箱:[oiwi@robots\.ox\.ac\.uk](mailto:) **Tasha Kim** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Benjamin Ballyk** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Alex Fung** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 隶属机构:FMRIB,牛津大学综合神经影像中心,英国 **SungJun Cho** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 隶属机构:OHBA,牛津大学综合神经影像中心,英国 **Teyun Kwon** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Luisa Kurth** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Miran Özdogan** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Gilad Landau** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Pratik Somaiya** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 **Natalie Voets** 隶属机构:FMRIB,牛津大学综合神经影像中心,英国 **Mark Woolrich** 隶属机构:OHBA,牛津大学综合神经影像中心,英国 **Oiwi Parker Jones** 隶属机构:PNPL![[Uncaptioned image]](https://arxiv.org/html/2608.25204v1/logos/PNPL_logos_final_Pineapple.png),英国牛津大学工程科学系 ###### 摘要 我们推出了 LibriBrain100,这是一个从头开始为可复现、标准化评估而设计的大规模 MEG 数据集,用于语音解码。LibriBrain100 的规模比最初的 LibriBrain 发布版扩大了一倍多,产生了超过 100 小时的高质量 MEG 数据,这些数据是在受试者收听自然连续语音时采集的。LibriBrain100 拥有约 80 小时来自单一受试者的数据,为深入的个体内神经数据设立了新纪录(是次优可比数据集的 8 倍,大约是其他数据集的 80 倍)。为了证明这种“以深度为先”设计的成效,我们在一个单词分类基准上进行了评估——这是通往无创脑-文本解码这一开放挑战的、日益成熟的垫脚石。使用现有的解码模型,我们达到了最先进的性能——这既验证了录音的质量,也证明了大规模个体内数据的价值。由于为每个用户收集 80 小时数据在实际应用中不切实际,我们还从另外 32 名受试者每人额外收集了约 40 分钟的数据。使用相同的单词分类基准,我们证明了广泛的多受试者数据的价值:对一个预训练模型进行监督微调可以显著弥补有限的个体数据。我们提供了标准的训练、验证和测试划分,所有划分均可通过一个开源的 Python 库进行复现,该库支持便捷下载、可选预处理以及为常用深度学习框架加载数据。此外,数据集和评估基础设施的发布还将伴随一场开放的机器学习竞赛及公共排行榜,以实现标准化基准测试。最终,我们希望 LibriBrain100 能加速实用非侵入式脑机接口的进展,从而为严重瘫痪患者恢复沟通能力。 ## 1 引言 一旦 ImageNet 提供了基准测试——大规模数据和标准评估协议,深度学习对计算机视觉产生了变革性的影响。神经语音解码正处于一个类似的转折点——但复杂性更高。在侵入性场景中,从手术植入电极解码的系统在某些条件下现已超越了自动语音识别,在瘫痪患者中实现了低于 5% 的词错误率(Card 等人,2024 (https://arxiv.org/html/2608.25204#bib.bib5))。但是侵入性记录需要脑部手术,这限制了其仅能用于临床试验,并将绝大多数可能受益的人排除在外。因此,非侵入性替代方案才是真正的目标,深度学习也开始在这一领域取得实际进展(Tang 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib13);Défossez 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib7);d’Ascoli 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib6);Jayalath 等人,2025a (https://arxiv.org/html/2608.25204#bib.bib34))。然而,与计算机视觉不同,该领域缺乏共享的基础设施来了解有多少进展是真实的,什么可以可靠地构建,以及可以多快预期到进展。没有标准的基准、共享的数据和通用的评估协议,很难知道什么方法有效或效果如何。LibriBrain 数据集(Özdogan 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib14))——及其开放的 ML 竞赛(Landau 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib16))——代表了朝正确方向迈出的重要一步。基于个体内数据能最快推动结果这一洞察(d’Ascoli 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib6)),LibriBrain 提供了迄今为止最大的个体内脑磁图(MEG)数据集,用于从大脑记录中进行语音解码,并附带标准划分和渐进式基准任务。在 LibriBrain 基础设施的基础上,后续工作在语音检测、音素分类、单词分类、关键词检测乃至完整的脑-文本解码方面推动了最先进水平(Elvers 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib59);Elvers 等人,2026 (https://arxiv.org/html/2608.25204#bib.bib55);Jayalath 等人,2025a (https://arxiv.org/html/2608.25204#bib.bib34);Jayalath 和 Parker Jones,2026 (https://arxiv.org/html/2608.25204#bib.bib36))。但 LibriBrain 有其局限性。它只覆盖了单一受试者收听单一类型(侦探小说)的数据,因此不能直接说明跨被试泛化。这对于现实世界的脑机接口至关重要,因为在这些应用中,每个用户的数据收集必须最小化。专注于《福尔摩斯探案集》这一系列作品,其内在的有限刺激多样性使得关于语音和语义解码的精细问题未被充分探索。最后,即使拥有前所未有的个体内数据规模,对 LibriBrain 的分析也显示没有平台期迹象(Özdogan 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib14),例如),这表明更多的数据应该能带来更大的收益。 LibriBrain100 直接解决了这些局限性。它在**深度**和**广度**上扩展了 LibriBrain。在深度轴上,LibriBrain100 将个体内数据从约 50 小时扩展到约 80 小时,完成了《福尔摩斯探案集》的全部作品,并添加了同时考虑语音学和语义学设计的新刺激:TIMIT(Garofolo 等人,1993a (https://arxiv.org/html/2608.25204#bib.bib18))和 MOCHA-TIMIT(Wrench,1999 (https://arxiv.org/html/2608.25204#bib.bib20);Wrench,2000 (https://arxiv.org/html/2608.25204#bib.bib21))是 ASR 研究(Mohamed 等人,2009 (https://arxiv.org/html/2608.25204#bib.bib53);Hinton 等人,2012 (https://arxiv.org/html/2608.25204#bib.bib54);Graves 等人,2013 (https://arxiv.org/html/2608.25204#bib.bib51),例如)和侵入性语音脑机接口(Mesgarani 等人,2014 (https://arxiv.org/html/2608.25204#bib.bib42);Cheung 等人,2016 (https://arxiv.org/html/2608.25204#bib.bib15);Anumanchipalli 等人,2019 (https://arxiv.org/html/2608.25204#bib.bib2);Makin 等人,2020 (https://arxiv.org/html/2608.25204#bib.bib3);Metzger 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib11),例如)中的标准语料库,它们控制了音素和音素对的分布,并能与使用相同刺激的先前研究进行直接比较;以及涵盖广泛语义领域的播客叙述,这些播客此前曾用于基于 fMRI 的语义解码(Tang 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib13)),从而支持跨模态比较。在广度轴上,LibriBrain100 将数据收集扩展到 32 名新受试者,每人贡献约 40 分钟的 MEG 数据,旨在支持监督微调和数据高效的跨被试泛化。总的来说,这些语料库覆盖了声学-语义轴,使 LibriBrain100 能够解决基于 MEG 的语音解码如何受到大脑中声音表征与意义表征驱动的问题。 在评估方面,LibriBrain100 将任务课程从语音检测和音素分类推进到单词分类——这一任务能够利用大脑中的语音和语义表征,并且更接近激励该领域大部分工作的脑-文本目标(图 1 (https://arxiv.org/html/2608.25204#S1.F1))。我们在两种设置下评估单词分类:个体内,通过扩展 subject 0 的训练数据以实现最先进的性能;跨被试,关注从高数据量的单一受试者到有限记录的新受试者的监督微调所实现的数据高效泛化。我们为所有子数据集提供了标准划分,并发布了使用 MEG-XL(Jayalath 和 Parker Jones,2026 (https://arxiv.org/html/2608.25204#bib.bib36))的基线结果,以支持可复现的社区基准测试。 LibriBrain100 做出了以下贡献: - • **一个大规模的、刺激多样的个体内 MEG 数据集**:来自受试者 0 的约 80 小时录音——这是迄今最大的个体内语音解码数据集——完成了完整的《福尔摩斯探案集》,并添加了 TIMIT 和 MOCHA-TIMIT 用于语音学受控分析,以及播客叙述用于语义解码——实现了与 fMRI 文献的跨模态比较以及与有影响力的侵入性脑机接口研究的直接比较。 - • **用于跨被试泛化的多受试者 MEG 数据集**:来自 32 名新受试者的录音(每人约 40 分钟),旨在支持监督微调和数据高效泛化的基准测试。 - • **具有标准划分和基线的单词分类基准**:扩展的评估课程,包含所有子数据集的训练/验证/测试划分,以及使用 MEG-XL 的个体内和跨被试设置的可复现基线结果。 - • **开放数据发布和工具**:HuggingFace 上的原始和预处理数据,涵盖从亚词汇到词汇级别的丰富语言注释,以及一个用于简化深度学习集成的 Python 库——所有资源都旨在支持计划中的开放 ML 竞赛。 **参考图例** **图 1:从 LibriBrain100 解码单词。** LibriBrain100 支持深度个体内数据和广泛跨被试数据的单词分类基准测试。(a) **个体内解码**:来自受试者 0 跨越多个语料库的语音刺激和 MEG 响应示例。目标单词在文本中突出显示,与声学频谱图对齐,并在相应的 MEG 时间序列中标出。MEG 时间序列是按图中所示传感器布局中的时域传感器进行平均的。(b) **跨被试解码**:相同的目标词分类任务可以在 32 名拥有有限个体数据的额外受试者上进行评估,从而实现数据高效泛化的基准测试。 ## 2 相关工作 在最近关于自然语音听觉期间采集的 MEG 的解码工作(Défossez 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib7);d’Ascoli 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib6);Jayalath 等人,2025a (https://arxiv.org/html/2608.25204#bib.bib34);Jayalath 等人,2025b (https://arxiv.org/html/2608.25204#bib.bib37);Jayalath 和 Parker Jones,2026 (https://arxiv.org/html/2608.25204#bib.bib36),例如)中,已经出现了一系列常用的 MEG 数据集(King 等人,2026 (https://arxiv.org/html/2608.25204#bib.bib52),另见)。常见数据集包括 MOUS(Schoffelen 等人,2019 (https://arxiv.org/html/2608.25204#bib.bib23))、MEG-MASC(Gwilliams 等人,2023 (https://arxiv.org/html/2608.25204#bib.bib8))、Armeni 等人(2022 (https://arxiv.org/html/2608.25204#bib.bib22))、Le Petit Prince(d’Ascoli 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib6))和 LibriBrain(Özdogan 等人,2025 (https://arxiv.org/html/2608.25204#bib.bib14))。表 2 (https://arxiv.org/html/2608.25204#A1.T2)(附录 A.2 (https://arxiv.org/html/2608.25204#A1.SS2))总结了这些数据集以及 LibriBrain100,列出了刺激语言等详细信息,以及我们衡量其规模的维度。 就“深入的”个体内数据而言,LibriBrain100 比次优的非 LibriBrain 数据集(Armeni 等人,2022 (https://arxiv.org/html/2608.25204#bib.bib22))大**约 8 倍**,比其余数据集大**约 80 倍**。我们可以从**广度**(受试者数量)和**深度**(每个受试者的数据小时数)来比较现有数据集。一方面,MOUS、MEG-MASC 和 Le Petit Prince 代表了广度优先的设计,涵盖 27-96 名受试者,但每人不足 2 小时。Armeni 和 LibriBrain 则是深度优先的设计,每人分别有 10 和 52.3 小时,但只有 1-3 名受试者。这种区别对解码至关重要。尽管其他数据集拥有更多的总小时数,但 d’Ascoli 等人(2025 (https://arxiv.org/html/2608.25204#bib.bib6))发现单词分类性能在 Armeni 上显著最强——这是他们研究中最深入的数据集(LibriBrain 当时尚未发布)。当包含 LibriBrain 时(Jayalath 等人,2025a (https://arxiv.org/html/2608.25204#bib.bib34)),其解码性能甚至比 Armeni 更强,这进一步强调了个体内深度的重要性。 最接近 LibriBrain100 的现有数据集是 LibriBrain,其明显的权衡是它的深度以牺牲任何广度为代价——最初的 LibriBrain 发布版仅包含一名受试者。LibriBrain100 在继续优先考虑深度的同时解决了这一局限性。它将单个受试者的录音深度扩展到约 80 小时,同时添加了来自另外 32 名受试者每人约 40 分钟的数据——导致每人小时数范围在 0.6 到 80.0 之间。这既反映了以深度为先的设计,也为研究在更现实的数据量下对新受试者的泛化提供了可观的资源——在表 2 (https://arxiv.org/html/2608.25204#A1.T2) 的六个数据集中……
相似文章
2026年PNPL竞赛:LibriBrain100中的单词分类与高效跨主题泛化
这篇文章宣布了2026年PNPL竞赛,专注于LibriBrain100数据集中的单词分类和高效跨主题泛化,以推进用于脑机接口的非侵入性语音解码。
@HuggingPapers: LISA:一种紧凑、可解释的MEG解码器,用于听到的语音 它从非侵入性脑记录中检索感知语音……
LISA是一种紧凑、可解释的MEG解码器,能够从非侵入性脑记录中检索感知到的语音,在1005个候选项中达到39.75%的Top-1准确率,使用的解码器参数减少约20倍,同时揭示皮层来源和语音特征。
BrainBench:面向全面脑电图理解的大型语言模型基准测试
BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。
可解释的感知语音MEG解码:皮层来源与驱动检索的刺激特征
本文提出了一种可解释的感知语音MEG到音频检索模型,利用球谐空间注意力和源映射重新设计,以少得多的解码器参数实现了39.75%的Top-1准确率,同时揭示了哪些语音特征驱动检索。
语义瓶颈:利用语义表征进行非侵入式语音解码
本文介绍了Brain2Semantics2Text,一种非侵入式语音解码方法,通过将MEG响应映射到语义嵌入空间,在无词级对齐的情况下重构句子级文本。