EEG情绪识别中的评估协议与跨受试者泛化

arXiv cs.LG 论文

摘要

本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。

arXiv:2607.27655v1 公告类型:新 摘要:在脑电图(EEG)情绪识别中,报告的准确率取决于完整的评估流程,而不仅仅是分类器。我们将目标量、开发流程和报告规则区分开来,然后使用SEED和SEED-IV上的一个归档动态图卷积神经网络(DGCNN)方案作为示例案例。在协议匹配的受试者相关(subject-dependent)检查中,SEED的结果与公开参考值差距在1.47个百分点以内;而SEED-IV的3.40个百分点差异仍未解决。在30条匹配的SEED受试者-会话轨迹中,基于重复测试集评估的检查点选择将平均窗口准确率从第80个epoch的0.7855提高到0.8892。在五折跨受试者(subject-disjoint)评估下,通过验证集选择的检查点在SEED上实现了训练参与者的试验准确率0.9990,在SEED-IV上为0.9920。在SEED上,完全留出(held-out)参与者的准确率为0.5348(95%受试者水平的条件偏差校正加速[BCa]区间[0.4667, 0.5985])。SEED-IV的估计值为0.3954([0.3343, 0.4648]),仅作为次要敏感性证据报告,因为其协议匹配的兼容性检查仍未解决。所观察到的训练受试者与留出受试者之间的差距与简单的优化欠拟合不一致,但这些差距并不能将受试者身份与实现、预处理、表征或分布因素分离开来。进一步的支持性分析表明,参与者排名取决于表征和时间尺度,而一个基于开发集选择的尾部风险集成在单独的最终评估中并未确立正向增益。因此,受试者相关、跨受试者和跨会话的结果应分别作为对不同问题的回答来报告。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:04

# 脑电情感识别中的评估协议与跨被试泛化
来源:https://arxiv.org/html/2607.27655

\[1,2\]\\fnmYuwen\\surLi 1\]\\orgdiv仪器科学与工程学院,\\orgname东南大学,\\orgaddress\\city南京,\\postcode210096,\\country中国 2\]\\orgdiv生物电子学国家重点实验室,\\orgname东南大学,\\orgaddress\\city南京,\\postcode210096,\\country中国

###### 摘要

脑电图(EEG)情感识别中报告的准确率不仅取决于分类器本身,还取决于完整的评估流程。我们将目标量、开发流程和报告规则分开,并以此为基础,以 SEED 和 SEED-IV 上的一条存档动态图卷积神经网络(DGCNN)路径作为实例进行说明。在与协议匹配的被试相关检验中,SEED 的结果与公开参考值的差异在 1.47 个百分点以内;而 SEED-IV 的 3.40 个百分点的差异仍未得到解决。在 30 条匹配的 SEED 被试-会话轨迹中,基于重复测试集评估的检查点选择将平均窗口准确率从第 80 个 epoch 的 0.7855 提高到 0.8892。在五折被试不相交评估下,验证集选择的检查点在 SEED 和 SEED-IV 上分别达到了 0.9990 和 0.9920 的训练参与者试验准确率。完全留出被试的准确率在 SEED 上为 0.5348(95% 条件性被试层面偏差校正加速 [BCa] 区间 [0.4667, 0.5985])。SEED-IV 的估计值为 0.3954([0.3343, 0.4648]),仅作为次要敏感性证据报告,因为其协议匹配兼容性检验仍未解决。观察到的训练集到留出被试的差距与简单的优化欠拟合不一致,但并不能将被试身份与实现、预处理、表示或分布因素分离开来。进一步的支持性分析表明,参与者排名取决于表示和时间尺度,而一个由开发过程选择的尾部风险集成在单独的最终评估中并未确立正向增益。因此,被试相关、被试不相交和跨会话结果应作为对不同问题的答案来报告。

###### 关键词:情感计算;基准可复现性;测试集复用;模型选择;分布鲁棒性;被试层面推断

## 1 引言

脑电图(EEG)情感识别通常被表述为一个预测问题:模型接收基于 EEG 的表示并分配一个情感标签。然而,报告的准确率是由一个更长的实验系统产生的。该系统决定哪些人和会话进入训练和测试、开发过程中目标数据的哪些信息可用、选择哪个检查点、预测是在窗口、试验还是视频级别评分、重复观察如何聚合,以及最终期望旨在描述哪个总体。两项研究可能使用相同的数据集和指标名称,却估计了不同的性能量。我们一致使用三个任务标签。

**被试相关试验不相交评估**测试那些在模型开发期间已出现的参与者的新试验。**无目标数据访问的被试不相交**表示被试不相交且不访问目标数据的评估:被评估的参与者不参与拟合和模型选择,开发过程中既不使用他们的协变量,也不使用他们的标签。**跨会话评估**比较同一参与者的不同记录会话。最后一种设置关注的是随时间的变化,而不是迁移到新的人。在此定义之后,我们使用更直接的短语“无目标数据访问的被试不相交评估”。这一区分至关重要,因为 EEG 记录具有强烈的聚类性。从一个参与者可以获得数百个窗口,但这些窗口并不能创造数百个独立的人。被试特定的信号结构、会话条件、试验时长、预处理和优化随机性都会影响分数。因此,在预期用途涉及未见参与者时,基于片段级别的随机分割可能使模型看起来有效。结构化交叉验证应阻止独立的部署单元,而不是忽略层次依赖性[25 (https://arxiv.org/html/2607.27655#bib.bib25)]。转化 EEG 研究已经记录了来自相关片段泄漏的显著乐观偏差[6 (https://arxiv.org/html/2607.27655#bib.bib6)],而更广泛的机器学习文献将分割泄漏和评估数据的自适应重用视为可复现性的主要威胁[15 (https://arxiv.org/html/2607.27655#bib.bib15)]。问题并不在于每个被试相关的研究都无效。个性化分类器可以是一个合法的研究对象。问题在于将个性化、目标自适应和未见被试的分数混称为一个无差别的名称。

近期工作已改进了该领域的实验基础设施。EEGain 回顾了 216 项 EEG 情感识别研究,并提出了标准化的数据集、分割、指标和实现[16 (https://arxiv.org/html/2607.27655#bib.bib16)]。LibEER 为广泛使用的数据集上的代表性模型组装了一个通用代码库和基准[21 (https://arxiv.org/html/2607.27655#bib.bib21)]。Del Pup 等人在多个 EEG 任务上比较了五种交叉验证设置,并表明基于样本的验证相对于嵌套的基于被试的设计可能高估性能[8 (https://arxiv.org/html/2607.27655#bib.bib8)]。Gil 和 Hernández-Sabaté 在分层统计分析中区分了窗口、状态和被试层面的验证[12 (https://arxiv.org/html/2607.27655#bib.bib12)]。这些研究确立了分割和统计层面的重要性。一个尚存的报告问题是,仅凭分割名称并不能记录目标数据访问、检查点选择、原始评分单元、总体权重或不确定性区间的条件集。统计概念“估计目标”(estimand)为陈述这一问题提供了有用的方式。估计目标是分析旨在估计的量,而估计值是从观测数据中产生的数值结果[22 (https://arxiv.org/html/2607.27655#bib.bib22)]。相关描述已被提出用于机器学习评估[4 (https://arxiv.org/html/2607.27655#bib.bib4)]。我们使用这一区分来明确每个 EEG 分数所代表的内容,但实际重点在于实验:哪些被试被留出、开发过程中哪些目标信息可用、模型如何选择,以及重复观察如何汇总。

本研究由四个研究问题组织。**RQ1** 询问何时两个 EEG 情感识别分数可以被视为同一目标风险的估计值。**RQ2** 询问当模型路径和数据集标签大致固定,而目标访问、选择和被试划分发生变化时,报告性能会如何强烈变化。**RQ3** 询问被试层面的性能排名是否足够可复现,以支持对低表现参与者的持续加权。**RQ4** 询问一个在仅训练集外包开发中成功的尾部风险集成,能否在留出试验的独立被试相关评估中保持其优势。

本研究做出四项贡献。第一,定义了一个三部分 EEG 协议记录,将目标量、开发流程和报告规则分开。第二,记录目标数据访问,并在相同的已保存轨迹上比较基于重复测试的检查点选择与固定终点检查点。第三,将预测单元和参与者加权与明确陈述的不确定性条件集联系起来。第四,将这些要素整合为一份可审计的 EEG 报告清单,并用一条存档的 DGCNN 路径加上三个支持性分析对清单进行检验。其贡献是一种 EEG 特定的评估方法论和经验压力测试,而不是新的分类器、泛化算法或基准排行榜。结果按以下顺序呈现:检查点选择对比、协议匹配的实现检验,以及无目标数据访问的被试不相交评估。竞赛队列、参与者排名研究和尾部风险集成是对总体、时间尺度和开发边界假设的支持性压力测试。

## 2 相关工作

### 2.1 EEG 情感识别数据集与跨被试模型

SEED 和 SEED-IV 是广泛使用的基于 EEG 的情感识别基准。SEED 引入了一个在重复会话中收集的三类情感协议[32 (https://arxiv.org/html/2607.27655#bib.bib32)],发布的特征文件中使用的差分熵表示由 Duan 等人描述[9 (https://arxiv.org/html/2607.27655#bib.bib9)]。SEED-IV 将该实验线扩展为多模态设置中的四类情感类别[33 (https://arxiv.org/html/2607.27655#bib.bib33)]。它们的重复被试结构支持几个合理的问题:人内识别、对留出试验的被试相关泛化、对未见人的迁移,以及跨会话迁移。仅凭数据集名称无法将数值结果归属于这些问题之一。

图神经网络在该文献中占有重要地位,因为电极具有空间组织和功能关系。DGCNN 在执行情感分类时学习动态邻接结构[27 (https://arxiv.org/html/2607.27655#bib.bib27)]。SOGNN 和 STGATE 提供了后来跨被试图建模的例子[18 (https://arxiv.org/html/2607.27655#bib.bib18),19 (https://arxiv.org/html/2607.27655#bib.bib19)]。最近的一篇跨被试综述组织了该领域的主要迁移、适应、图和泛化挑战[20 (https://arxiv.org/html/2607.27655#bib.bib20)],而最近的比较工作继续记录了对数据集和验证设计的强依赖性[23 (https://arxiv.org/html/2607.27655#bib.bib23)]。这些研究推动了公开基准比较,但其报告值只有在其相关的分割、预处理、评估单元和选择规则下才有意义。因此,我们使用一个存档的 DGCNN 实现作为受控案例,而不是声称复现每个 DGCNN 变体或在不相容的协议之间对架构进行排名。

更广泛的 EEG 情感识别文献规模庞大且面向应用。综述描述了在情感脑机接口中的使用,并记录了信号表示、数据集构建和验证方面的显著差异[10 (https://arxiv.org/html/2607.27655#bib.bib10)]。模型论文通常关注表示能力。我们的关注点是互补的:在建模选择完成后,我们询问某个结果支持哪种总体层面的预测声明。

### 2.2 评估标准化、泄漏与可复现性

EEGain 和 LibEER 通过标准化评估软件和协调的基准库来解决碎片化的实验实践问题[16 (https://arxiv.org/html/2607.27655#bib.bib16),21 (https://arxiv.org/html/2607.27655#bib.bib21)]。Del Pup 等人提供了跨 EEG 任务的基于被试和嵌套交叉验证的直接实证分析[8 (https://arxiv.org/html/2607.27655#bib.bib8)],而 Gil 和 Hernández-Sabaté 对从窗口到被试的层次结构进行建模,并检验跨被试可复现性[12 (https://arxiv.org/html/2607.27655#bib.bib12)]。这些贡献大大缩小了基于分割分类法、基准协调或窗口级验证可能乐观这一普遍观察的任何新颖性主张。更窄的未解决问题是如何记录科学目标以及完整开发过程所使用的信息。例如,两次被试不相交的运行仍可能以不同方式选择检查点、聚合不等数量的窗口,或附加具有不同条件集的区间。

泄漏是最明显的失败模式,但并不是误解的唯一来源。一项 EEG 情感分类研究直接表明,按试验分割和测试集重用可以实质性地改变报告性能[17 (https://arxiv.org/html/2607.27655#bib.bib17)]。在交叉验证之外执行的特征选择可能使误差估计产生偏差,正如微阵列分析中的经典所示[1 (https://arxiv.org/html/2607.27655#bib.bib1)]。重用嘈杂的验证标准进行大量模型选择也会产生选择偏差[7 (https://arxiv.org/html/2607.27655#bib.bib7)]。当交叉验证用于调参时,嵌套评估是标准补救措施[30 (https://arxiv.org/html/2607.27655#bib.bib30)]。这些原则适用于 EEG 实验,即使原始样本从未跨越名义上的训练-测试边界:来自最终目标数据的标签或性能摘要仍可能影响所选检查点。

可复现性还要求报告固定分割无法消除的变异。神经优化可能在小的扰动和不同的随机种子下发生变化[28 (https://arxiv.org/html/2607.27655#bib.bib28)]。基准变异可能来自数据分割、训练随机性、超参数搜索和实现选择[5 (https://arxiv.org/html/2607.27655#bib.bib5)]。工件和报告清单有助于重建这些选择[24 (https://arxiv.org/html/2607.27655#bib.bib24)]。因此,我们的实验保留确切的配置文件、记录的输入哈希、逐被试输出、种子感知聚合以及独立实现的指标重建。

### 2.3 模型选择、估计目标与分布鲁棒性

估计目标视角将科学目标与用于估计它的计算分开。当熟悉的指标(如准确率)可能指代不同的总体或干预时,这一点尤其有用[22 (https://arxiv.org/html/2607.27655#bib.bib22),4 (https://arxiv.org/html/2607.27655#bib.bib4)]。在本文中,类似干预的元素是评估协议本身:在模型选择过程中允许目标标签会改变过程的信息集,从而改变被评估的量。我们并不断言某个估计目标普遍正确。当协议与声明的用途匹配且其信息要求可行时,该协议就是合适的。

域适应和最差组优化解决相关但不同的问题。域对抗学习寻求对任务有预测性且对域成员信息较少的特征[11 (https://arxiv.org/html/2607.27655#bib.bib11)]。CORAL 对齐跨域的二阶特征统计量[29 (https://arxiv.org/html/2607.27655#bib.bib29)]。组分布鲁棒优化针对最差的观测组损失[26 (https://arxiv.org/html/2607.27655#bib.bib26)]。当域或组有意义且稳定时,这些方法可能有用。它们并不能消除开发到评估边界的需求。持续提高开发分数较低的参与者的权重,假设他们的相对表现会延续到未来的评估单元。在定义这样的组之前,我们先检验这一前提。

现有的 EEG 框架标准化了许多协议组件,实证研究展示了分割选择的后果,统计工作解释了选择偏差。本研究将这些要素整合到一个 EEG 协议记录中。其独立增量在于明确分离目标、开发和报告层;同一轨迹上的检查点

相似文章

EEG基础模型中的身份陷阱:诊断性审计

arXiv cs.LG

本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。