EEG-to-Report:一个用于临床EEG训练语言模型的标注和特征-文本框架

arXiv cs.AI 论文

摘要

本文介绍了EEG-to-Report,这是一个基于浏览器的框架,用于标注临床EEG数据并提取特征以创建AI就绪数据集,其中包含一个自动报告模块,该模块结合了卷积网络和大语言模型来生成临床叙述。

arXiv:2608.26153v1 公告类型:新 摘要:临床脑电图(EEG)报告在很大程度上是手工且耗时的,当前的EEG软件生态系统无法产生训练现代语言模型所需的结构化EEG-文本监督。大多数工具箱专注于可视化或预处理,对生成AI高质量数据集的工作流支持有限。我们介绍了EEG-to-Report,这是一个基于浏览器的标注和特征-文本框架,将常规EEG审查与构建AI就绪数据集联系起来。该框架集成了多格式EEG摄入、通道标准化和一个交互式查看器,该查看器具有多模态标注层,结合了打字文本和转录语音笔记。对于每个标注段,特征提取引擎计算一组标准化的频谱、时间、熵、Hjorth、连接性和尖峰相关描述符,与临床描述一起存储在可移植的JSON模式中。这产生了对齐的特征-文本对,旨在监督多模态EEG-语言模型。该框架还包括一个自动报告模块,该模块将卷积网络的集成与大语言模型耦合,为神经科医生审查起草临床叙述。使用试点标注,我们描述了EEG-to-Report如何简化标注工作流并生成可编辑的草稿报告,为自动化EEG报告系统提供可重用的基础。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:29

# EEG转报告:面向临床脑电图语言模型训练的标注与特征-文本框架
来源:https://arxiv.org/html/2608.26153
\[1\]\\fnmXuan\-The\\surTran
\[1\]\\orgdiv机械工程学院,\\orgname越南海事大学,\\orgaddress\\city海防市,\\orgaddress\\country越南
2\]\\orgnameHAISmartlink实验室,ANCHI STE公司,\\orgaddress\\country越南

###### 摘要

临床脑电图(EEG)报告目前仍以手动完成为主,耗时较长,且现有EEG软件生态系统并非为训练现代语言模型所需的结构化EEG-文本监督数据而设计。大多数工具箱专注于可视化、预处理或事件标记,对能够同时生成高质量AI数据集、以临床医生为中心的工作流程支持有限。我们推出了*EEG转报告*——一个基于浏览器的标注与特征-文本框架,将常规EEG审阅与AI就绪数据集的构建相结合。该框架集成了多格式EEG数据导入、自动通道标准化与预处理、支持拖拽选择时间范围和通道的交互式多通道查看器,以及结合分类型文本与通过语音转录的语音笔记的多模态标注层。对于每个标注片段,特征提取引擎计算标准化的频谱、时域、熵值、Hjorth参数、连接性和尖波相关描述符,这些特征与相应的临床描述一同存储在可移植的JSON模式中,该模式捕获片段时序、通道上下文、特征和注释。这种表示方法生成了对齐的特征-文本对,旨在为多模态EEG-语言模型提供监督。作为可运行的报告生成器,该框架包含一个内置自动报告模块,该模块结合卷积网络集成与大型语言模型来起草临床叙述;在导出的数据集上训练特征到文本模型是自然的下一步,我们将其列为未来工作。通过试点标注,我们描述了EEG转报告如何简化标注工作流程,并生成可供神经科医生审阅的可编辑草稿报告,为未来的EEG-文本语料库和自动化EEG报告系统提供了可复用的基础。

###### 关键词:

脑电图、临床EEG报告、标注工具、特征-文本表示、序列到序列模型、人机协同、EEG自动报告

## 1引言

常规临床脑电图(EEG)仍然是中枢神经系统功能评估的基石,在癫痫、脑病、精神状态改变和重症监护监测的诊断工作中不可或缺。\[Beniczky2017SCORE\]然而,临床EEG解读复杂、耗时,并且严重依赖于全球分布不均的专业知识。EEG的误判可能影响大量患者,导致漏诊和过度诊断,这促使人们需要计算机辅助工具,以提高日常实践中EEG评估和报告的质量、一致性和可扩展性。\[Beniczky2017SCORE\]

标准化方面的一个重大进展是SCORE(标准化基于计算机的EEG组织报告)及其第二版国际版本的发展。\[Beniczky2013SCORE,Beniczky2017SCORE\]SCORE提供了一种结构化术语和图形用户界面,脑电图专家通过它选择预定义的描述符,涵盖背景活动、睡眠、发作间期异常、癫痫发作以及新生儿或重症监护模式,而不是撰写自由文本报告。此过程自动生成结构化临床报告,并同时将选定的EEG特征存储在数据库中,用于质量保证、教育和研究。\[Beniczky2017SCORE\]SCORE-EEG软件已在多个语言和中心超过12,000例记录中进行了测试,证明了标准化、计算机辅助EEG报告在临床工作流程中的可行性。\[Beniczky2017SCORE\]

在这一标准化特征-报告表示的基础上,近期研究利用人工智能(AI)实现EEG解读的部分自动化,涵盖从解码原始EEG的卷积和深度神经网络,到检测病理性记录并推导临床生物标志物的系统。\[Schirrmeister2017Decode,Roy2019DLReview,Bajpai2021Pathology,Geraedts2021Biomarkers\]Tveit等人引入了SCORE-AI,这是一个在30,493例SCORE标注的EEG上训练的卷积神经网络,用于区分正常与异常记录,并将异常EEG进一步分类为临床相关类别(癫痫样局灶性/全面性,非癫痫样局灶性/弥漫性)。\[Tveit2023SCOREAI\]除了总体病理分类,深度架构还被提出用于特定临床任务,例如用于痴呆检测的状态空间模型。\[tran2024eegssm\]在三个独立测试集(包含9,945例EEG)上验证时,SCORE-AI达到了与专家读者相当的诊断准确性,并且与人类共识的观察者间一致性处于或超过了人类间变异性的范围。\[Tveit2023SCOREAI\]这些结果表明,在大型结构化EEG数据库上训练的AI模型可以将专家级解读扩展到服务不足的地区,并减轻高负荷中心的工作量。\[Tveit2023SCOREAI\]此外,类似的多模态融合方法可以将EEG与其他行为和生理特征相结合,以预测人类表现和状态。\[Tran2024Multimodal\]

最近,混合系统开始将可解释的定量EEG特征与现代自然语言处理(NLP)模型相结合,用于自动生成报告。Tung等人提出了一种混合AI系统,该系统提取EEG背景和异常的标准化描述符,将其输入机器学习模型,并使用大型语言模型生成与现有临床叙述一致的自由文本报告。\[Tung2024Hybrid\]他们对大型临床数据集进行的回顾性研究表明,此类混合流程能够生成临床上合理的背景描述和印象,同时保持与现有结构化报告实践和评分系统的兼容性。\[Tung2024Hybrid\]总之,SCORE、SCORE-AI和混合EEG-NLP系统展示了从标准化的人工驱动报告,到全自动分类,再到近期AI支持的叙述性报告生成的发展历程。

尽管取得了这些进展,但仍有几个重要的差距。首先,大多数现有系统假设可以访问专有的、高度策划的SCORE风格数据库,并且与特定的商业EEG平台紧密集成,这限制了它们在那些使用异构EEG文件格式和遗留系统的小型中心、研究实验室和资源有限的医院中的应用。\[Beniczky2017SCORE,Tveit2023SCOREAI\]此外,广泛使用的开源EEG工具箱(如EEGLAB、MNE-Python和FieldTrip)主要设计用于信号处理、可视化和研究分析,而非用于以临床医生为中心的对齐特征-文本训练数据生成。\[Delorme2004EEGLAB,Gramfort2013MNE,Oostenveld2011FieldTrip\]其次,当前的AI模型在很大程度上将信号到解读的过程视为一个整体黑箱:要么将原始EEG直接映射到粗略标签,要么将固定的人工定义特征集映射到文本报告,缺乏让临床医生在单个片段层面检查、策划和迭代优化训练数据的工具。第三,虽然混合系统证明了EEG特征可以驱动语言模型,但仍然缺乏开放的、端到端的框架,这些框架应(i)帮助临床医生标注多格式EEG记录;(ii)从选定片段自动提取标准化的定量特征;(iii)以*AI就绪*格式导出对齐的特征-文本对,用于训练和评估EEG转报告模型。

构建这样一个框架提出了三个实际挑战,这些挑战无法通过简单扩展现有工具来解决。首先,临床EEG以许多厂商格式到达,通道命名不一致,因此绑定到单一格式或导联的查看器无法作为通用的导入层;强大的格式无关导入和通道标准化是任何下游语料库的先决条件。其次,语言模型的监督必须在具有临床意义的片段层面进行对齐:将整条记录映射到一个粗略标签(如大多数分类器所做的那样),丢弃了报告实际描述的时间和空间上下文,因此特征和文本必须按选定片段绑定在一起。第三,获取丰富的叙述性描述而不干扰临床工作流程是困难的:在单独的查看器和文本编辑器之间切换速度很慢,这就是为什么标注、定量特征计算和多模态(打字或口述)文本输入必须紧密集成,而不是简单拼接。

在本研究中,我们介绍了*EEG转报告*,一个旨在解决这些差距的标注与特征-文本框架。我们的贡献不是单一的算法,而是一个集成的、基于浏览器的网络应用程序,它在一个工作流程中连接了交互式EEG可视化、多模态标注(文本和语音)、自动化特征提取和AI就绪数据集导出。具体来说,我们的主要贡献是:

- •我们引入了一个与厂商无关的临床EEG标注工具,支持超过十种常见的EEG文件格式,提供片段和通道级别的选择,并为标准化标注和结构化医生笔记提供统一界面(第4.4节 (https://arxiv.org/html/2608.26153#S4.SS4))。
- •我们定义了一个可复用的*特征-文本表示*,其中每个标注的EEG片段被映射到一组定量的时频和连接性特征,以及丰富的临床文本(打字或转录语音),并以JSON格式导出,供下游机器学习使用(第4.5节 (https://arxiv.org/html/2608.26153#S4.SS5) 和 4.6节 (https://arxiv.org/html/2608.26153#S4.SS6))。
- •我们包含了一个可运行的自动报告模块,该模块将卷积网络集成与大型语言模型相结合来起草临床报告,并且我们构建了导出的特征-文本对,以便各中心将来能够在其数据上训练和评估自己的EEG转报告模型,同时将原始信号和标注保留在机构控制之下(第4.7节 (https://arxiv.org/html/2608.26153#S4.SS7))。

通过专注于工具和数据表示,而非单一的基准模型,EEG转报告旨在降低开发、审查和共享EEG自动报告系统的门槛。我们将此框架设想为连接标准化人工标注传统(如SCORE)与新兴的基础模型和神经科临床语言模型生态系统的一座桥梁,从而在学术和临床环境中实现可解释的EEG AI的迭代、人机协同开发。

## 2结果

我们从三个轴线展示EEG转报告:(i)其摄入临床EEG记录并支持以临床医生为中心的标注的能力,(ii)生成的EEG特征-文本语料库的结构和内容,以及(iii)自动报告模块生成的草稿报告。除非另有说明,所有分析均在公开可用的Siena头皮EEG数据库上进行\[Detti2020Siena\](第4.2节 (https://arxiv.org/html/2608.26153#S4.SS2))。

### 2\.1数据摄入与标注工作流程

我们首先在Siena记录(EDF格式)上评估数据摄入。该应用程序解析了通道标签、采样率和基本元数据,并将通道名称标准化为基于10-20系统的约定;非EEG通道(例如ECG或触发通道)在存在时被检测并从主查看器中排除,同时仍可通过通道选择对话框进行检查。

交互式查看器(图1 (https://arxiv.org/html/2608.26153#S2.F1))允许我们浏览完整长度的记录,并使用基于拖拽的时间范围选择来选择用于标注的候选片段。在癫痫发作起始/终止标记的指导下,我们通常使用20.0秒的时间窗口,并为局灶性模式选择较短的片段(例如单次爆发或放电)。在Siena记录中,该工具用于创建112个片段级标注,涵盖36条记录和12名患者,覆盖发作期、发作期前后和发作间期时间窗。图2 (https://arxiv.org/html/2608.26153#S2.F2)说明了典型的标注时间线。

参见标题 图1:EEG转报告标注界面(模块1)。通过拖拽选择的时间范围和Ctrl选择的通道在查看器中高亮显示;标注对话框捕获打字或语音转录的描述,保存的标注出现在时间线上供审阅和导航。参见标题 图2:Siena数据库中患者的典型标注时间线,说明了发作期和发作间期片段的选择。虽然该系统通过基于Whisper的语音标注接口支持语音转文本输入,但在当前演示中,所有标注均以直接文本输入(0%语音)。收集关于语音与文本输入实用性的临床医生定性反馈,以及评估语音转文本在医学领域术语的准确性,计划在未来临床可用性试验中进行。

### 2\.2EEG特征-文本语料库统计

每个保存的标注在JSON数据集中生成相应的*片段对象*,包含片段时序、通道列表、定量EEG特征块和自由文本临床描述,病例级医生笔记则单独存储。表1 (https://arxiv.org/html/2608.26153#S2.T1)总结了语料库统计。

表 1:导出的特征-文本语料库摘要统计(Siena头皮EEG数据库)。数值待从JSON导出中完成。片段持续时间范围为20.0至20.0秒(中位数20.0秒),反映了短暂的阵发性事件和较长的背景样本。特征提取引擎为每个片段和每个通道计算了delta、theta、alpha、beta和gamma频段的功率,基本统计量(均值和标准差),Hjorth活动度和复杂度,香农熵和近似熵,基于z分数阈值的尖波计数,以及成对通道相干性度量。对于典型的36通道导联,这导致每个片段产生长度为1322的特征向量。

在文本方面,每个标注附带自由文本临床描述,并在病例级由医生笔记补充。由于Siena数据库不包含叙述性临床描述,每个片段的文本是根据数据集的癫痫发作标注(发作期与发作间期状态,以及在可用情况下的发作类型和定位)结合计算的特征程序化生成的;这些种子描述旨在由临床医生在EEG转报告中进行审阅和优化,而非作为专家撰写的叙述。为了表征语言内容,我们计算了基本文本统计,包括标记数、词汇大小和词性分布。叙述性描述通常由9-17个标记组成(中位数9),词汇以EEG特定术语和常见的临床修饰语为主(例如,“癫痫发作”、“发作间期”、“背景”、“起始”、“局灶性”)。图3 (https://arxiv.org/html/2608.26153#S2.F3)显示了标注长度的分布。

参见标题 图3:标注长度分布。

相似文章

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。

BrainBench:面向全面脑电图理解的大型语言模型基准测试

arXiv cs.AI

BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。