CogEEGAgent: 迈向基于落地执行与选择感知验证的自主认知脑电分析
摘要
CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。
arXiv:2607.25045v1 Announce Type: new
摘要:在认知研究中,脑电图(EEG)分析需要专业知识,并涉及对比、通道、时间窗口和统计检验等方面的多种合理选择。大型语言模型(LLM)智能体可以将多样化的自然语言问题转化为分析选择,为自动化提供灵活的接口。然而,仅凭流畅的报告无法证明智能体选择了所请求的分析,或独立于自适应搜索评估了验证性声明。我们提出 CogEEGAgent,这是一个基于 MNE-Python 的认知脑电分析智能体。其专用的脑电科学框架将语义权威与科学权威分离。LLM 解释意图并提出预注册的分析方案,而确定性组件则验证类型契约、控制确认访问权限,并授权基于证据的发布。在一个预先指定的路由基准测试中,CogEEGAgent 将语言映射到预注册分析方案的准确度高于匹配的确定性路由器,而匹配的预检机制使得两个系统在必要时都选择弃权。在一项由外部模型撰写、结果盲验的活动中,完整系统通过参与者不相交的确认释放了支持的分析,并阻止了预定义的能力危害和生命周期重用请求。策略压力测试表明,留出确认机制有效抑制了未经校正的自适应搜索产生的误报。综合这些研究,我们建立了有限自主性和可审计的自动化框架,用于认知脑电工作流。更广泛地说,它们展示了科学智能体如何将灵活的语言理解与推理和发布的故障关闭控制相结合。
查看缓存全文
缓存时间: 2026/07/29 09:53
# CogEEGAgent:面向自主认知脑电图分析,具备接地执行与选择性感知验证
## 摘要
认知研究中的脑电图(EEG)分析需要专业知识,并在对比、通道、时间窗和统计检验方面涉及许多可辩护的选择。大型语言模型(LLM)代理可以将各种自然语言问题转化为分析选择,为自动化提供灵活的接口。然而,仅凭流畅的报告无法证明代理选择了所要求的分析,或是在自适应搜索之外独立评估了验证性主张。本文提出CogEEGAgent,一个基于MNE-Python的认知EEG分析代理。其**EEG专用科学护栏**将语义权威与科学权威分离。LLM负责解释意图并提出注册分析,而确定性组件则验证类型化契约、控制确认权限并授权基于证据的发布。在预设的路由基准测试中,CogEEGAgent将语言映射到注册分析的准确率高于匹配的确定性路由器,而匹配的预检机制使两个系统在需要时均能放弃处理。在外部模型创作、结果盲测的实验中,完整系统发布了带有参与者不重叠确认的支持性分析,并阻止了预设能力风险与生命周期复用请求。策略压力测试表明,保留的确认手段能够抑制未校正自适应搜索产生的假阳性。这些研究共同确立了认知EEG工作流中的有限自主性与可审计自动化框架。更广泛地看,它们展示了科学代理如何将灵活的语言理解与对推理和发布的故障安全控制相结合。
## 1 引言
脑电图(EEG)是认知神经科学的基石,能够在感知、注意、语言和运动任务期间提供毫秒级的大脑活动记录(Luck 2014)。分析认知EEG数据需要复杂的多步骤工作流,包括加载记录、滤波与伪迹去除、分段、提取事件相关电位(ERP)或频谱以及统计检验(Gramfort 等,2013)。每一步的选择都可能无声地传播错误。可辩护的处理流水线空间非常庞大。在一项研究中,分析同一神经影像数据集的70个团队使用了70种不同的工作流并得出了不同的结论(Botvinik-Nezer 等,2020),而仅预处理选择就可能削弱EEG的可靠性(Hou 等,2026)。自动化还扩大了研究者的自由度,因为即使工具调用成功,当代理搜索可能的分析并报告最有利的结果时,名义上的错误率也无法保持。
图1:CogEEGAgent将有限的语义路由与确定性科学权威分离。事后PCVR审计记录的工作流;前瞻性科学控制平面在参与者不重叠确认之前提交LLM选定的候选分析,并将重放证据绑定到发布。右列展示了三种支持的复合活动发布;请求文本已缩写,轨迹为示意图,统计数据为保留确认的近似结果。
最近的LLM代理通过工具增强规划自动化科学分析(Lu 等,2024;Ding 和 Do 2025;Sun 等,2026;Jiao 等,2026;Bai 等,2026;Wu 等,2026)。在EEG领域,现有系统针对临床解释、分类或流水线优化,而非认知推理。其报告的基准测试通常强调任务性能、完成度、路由或工具选择(Zhou 等,2026)。CogEEGAgent增加了两项保障措施:它检查推断性主张是否得到成功统计返回的支持,并在打开确认证据之前提交分析。我们构建了CogEEGAgent,一个基于工具的LLM代理,用于对预加载数据进行可审计的认知EEG分析。图1总结了其EEG专用科学护栏,该护栏通过可执行轨迹-分区-证据绑定将语义权威与科学权威分离。LLM从自然语言中选择一个注册分析,而确定性代码负责契约具体化、检查、数据访问、提交、推理、证伪和报告。科学控制平面提供前瞻性发布路径,范式条件验证(PCVR)则事后审计记录的工作流。它们共同解决了认知EEG注册分析中的意图对齐、契约可接受性和验证性证据绑定的问题。我们做出三项贡献:
1. **自主认知EEG分析代理**:CogEEGAgent将自然语言请求映射到注册的认知EEG分析,并从预处理后的epoch到证据关联的报告运行契约绑定的MNE-Python工作流。
2. **语义权威与科学权威分离**:LLM选择语义路线,而科学护栏使用类型化契约、持久提交、隐藏确认、独立重放和证据绑定来管理执行与发布。
3. **前瞻性边界评估**:预定义研究测试语义选择、参与者不重叠执行、策略行为以及故障安全发布。
代码与资源:https://github.com/dengzhe-hou/CogEEGAgent
## 2 相关工作
#### 科学分析代理
LLM代理自动化通用和特定领域的科学工作流(Lu 等,2024;Ding 和 Do 2025;Sun 等,2026;Jiao 等,2026;Bai 等,2026;Wu 等,2026)。EEGAgent、NeuroWeaver、EEG-GPT和BrainAgent报告了在EEG工具编排、受限流水线搜索、分类与解释以及分层脑信号工作流方面的互补能力(Zhao 等,2025;Wang 等,2026;Kim 等,2024;Zhou 等,2026);EEG到文本的工作提供了另一种解释接口(Jo 等,2024)。其报告的评估侧重于任务性能、完成度、路由或工具选择。我们的EEG专用科学护栏为认知EEG推理增加了两项保障:它要求预定义显著性结果语言具有模式验证的推断性证据,并在打开指定确认证据之前提交分析。NeuroAgent在模态化的生成-执行-验证工作流中评估意图解析、预处理步骤正确性和恢复能力(Zhong 等,2026),而精心策划的技能库则涉及领域覆盖(Wu 等,2026)。这些工作共同推动了与任务级性能互补的验证需求。
科学代理基准测试越来越倾向于执行生成的程序或对长分析进行评分,而非流畅的报告(Chen 等,2024;Mitchener 等,2025)。CogEEGBench增加了认知EEG故障注入、设计的零假设和敏感性控制,以及工作流级共现检查,即预定义显著性结果语言与模式验证的推断性证据之间的共现。
#### 验证与自适应选择
推理状态审计、外部声明证实和静态工作流图检查处理互补的一致性、来源和拓扑故障(Yuan 等,2026;Du 等,2026;Xavier 等,2026)。PCVR则在预定义显著性结果语言缺少模式验证的推断性证据时记录硬故障,同时保留合法的零结果。这在自适应分析后仍然不足。一个真实的返回结果可能仍然是多种通道/窗口选择中最有利的,这是确认偏差的工作流类比(Jhaveri 等,2026)。保留复用和自适应数据有效性是已建立的统计问题(Dwork 等,2015)。CogEEGAgent相反地执行有序的、数据依赖的发布条件:它在打开确认数据之前提交一个发现结果,将确认能力和结果保留在规划器上下文之外,并通过一个类型化返回编译最终声明。我们的贡献通过在代理工作流中实现可执行轨迹-分区-证据绑定,将已建立的样本分割和多重检验策略操作化。Bonferroni和max-T作为策略比较器。
## 3 CogEEGAgent
### 3.1 概述
CogEEGAgent将基于LLM的语义路由器与一个EEG专用科学护栏相结合,该护栏管理确定性执行、验证和基于证据的发布。科学契约将模型选择与确定性执行连接起来。PCVR审计完成的工作流,而科学控制平面通过轨迹-分区-证据绑定,前瞻性地将选定的发现轨迹与隐藏确认和基于证据的发布绑定。一个密封的活动组合了三种注册ERP分析的接口,而匹配的研究则隔离了路由、预检和组确认。威胁模型将模型路线和散文视为不可信的,同时信任冻结的注册表、确定性执行器、承诺账本和源冻结评分器。科学控制平面强制执行预提交、一次确认访问和类型化证据发布,其中包含一次有界候选选择调用,后跟确定性阶段。图1将模型权威与护栏权威分离;补充材料提供了详细的协议和消融实验。
### 3.2 工具增强的认知EEG分析
CogEEGAgent通过函数调用模式公开MNE-Python(一个标准的开源EEG/MEG分析库,Gramfort 等,2013)的操作,并定义了输入、输出、前置条件和诊断。基于MNE而非重新实现信号处理,确保了记录的步骤是真实的库操作。LLM接收元数据、工具返回的标量和检验结果,从未接收原始样本;这既限制了数据暴露,也限制了直接从波形叙述效应的机会。工具涵盖滤波、ICA、重新参考、事件锁定的分段、条件平均、差异波、频谱分析和统计检验,包括聚类置换推断(Maris 和 Oostenveld,2007)、双样本t检验和方差分析。自动拒绝、成分标记以及周期/非周期频谱分解仍然是已建立的专业替代方案(Jas 等,2017;Pion-Tonachini 等,2019;Donoghue 等,2020);代理将这些专业原语组合成可审计的工作流。知识库为十种范式(P300、N170、ERN、N2pc、N400、LRP、运动、MMN、SSVEP和静息态)提供了软窗口、区域、频段和对比。规划器将其用作指导,PCVR用作F6合理性检查。任何一层都不规定预期结果,因此未能找到成分仍然是有效的零结果。这些条目遵循ERP CORE(Kappenman 等,2021)和标准ERP实践(Luck,2014);范式特定和受试者特定假设仍由策展人提供,如任务约束的theta和受试者内频率-地形图分析所示(Hou 等,2025;Zeng 等,2026)。
### 3.3 范式条件验证(PCVR)
PCVR对记录的工作流应用五类检查。结构检查(F1,硬性)强制依赖关系,例如ERP之前必须先分段。元数据检查(F2,硬性)拒绝执行或事件错误以及零试次条件。数值检查(F3)将无效或非有限的epoch和基线边界、非有限的工具输出以及少于五个保留试次视为硬故障;五到九个试次或拒绝率高于50%视为软警告。范式合理性检查(F6,建议性)对诸如P300窗口在0–50毫秒等选择发出警告,但不拒绝工作流。推断和结论检查(F4/F5)拒绝模式无效的类型化证据,并在预定义结果语言模式缺少匹配证据或与之矛盾时记录硬故障。这种自由文本的PCVR审计比前瞻性路径窄,在前瞻性路径中,确定性报告器直接将结构化声明绑定到类型化证据。冻结的跨模型研究先于成功感知的F4,并使用其仅调用前身。科学零结果(p > α,F7)是合法的,永远不会被修复。这些门控操作化了核心的COBIDAS-MEEG(Pernet 等,2020)和BIDS-EEG(Pernet 等,2019)报告字段。
#### NaN感知验证
统计工具可能因保留试次太少、条件相同或数值操作退化而返回NaN。朴素的验证可能将其错误分类为有效的F7零结果;NaN感知的PCVR将其标记为F3。F3触发已执行的修复,通常是R2a,该修复在重新运行分段和检验之前放宽epoch拒绝阈值(500到1000 μV)。该循环要么获得数值结果,要么明确报告失败,而不是认证一个退化的零结果。由于R2a保留了被更严格阈值排除的试次,其完成增益可能以信号质量换取数值完成。
### 3.4 零结果保持修复
当硬性检查失败时,PCVR在反确认偏差约束下提出类型化修复。它分别跟踪工作流有效性和效应证据:
- s\_validity = |{通过的检查}| / |{所有检查}|
- s\_effect = f(p值, 聚类数量)
一个零结果可以具有s\_effect = 0,同时保持完全有效;修复必须增加s\_validity,并且不得优化s\_effect。
#### 类型化修复操作
操作包括:重新排序(R1)、重新参数化(R2)、重新标记元数据(R3)、替换方法(R4)、添加诊断(R5)、修改结论(R6)或升级(R7)。基础PCVR仅执行R6;R1–R5仍在报告中作为建议保留,而R7则请求人工审查。这种保守的默认设置在不静默更改分析的情况下更改报告内容。NaN感知的PCVR在F3之后额外执行R2a和R4,每次执行都保留在轨迹中。相似文章
面向低通道EEG智能体的边界感知上下文接地
文章介绍了NeuraDock Agent,一个开源架构,它将确定性的EEG引擎与LLM接口集成在一起,利用硬件和实现感知的上下文来提高低通道EEG的边界感知能力。
CogGuard:边缘智能服务中用于主动预警的认知与操作画像构建
CogGuard是一种用于边缘智能服务的主动预警框架,它将基于LLM的离线画像构建与基于SLM的在线评分预测解耦,在教育和操作数据集上实现了更低的预测误差,同时将构建时间减少48%,微调时间减少19%。
三思而后行:面向具身智能体的验证器引导动作选择
提出VeGAS框架,一种针对基于MLLM的具身智能体的测试时框架,该框架采样多个候选动作,并利用生成式验证器选择最可靠的动作,在挑战性任务上相比CoT基线实现了高达36%的相对性能提升。
评估交互式AI智能体的认知年龄对齐
本文介绍了ChildAgentEval,这是一个基于心理测量学的基准测试,用于评估基于MLLM的智能体的认知年龄对齐,将其推理与人类发展阶段进行比较。
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。