神经数据不再无聊:代理型AI在数据复用中的基准测试
摘要
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。
arXiv:2605.12808v1 Announce Type: new
摘要:神经科学数据在实验室、格式和实验范式之间高度碎片化,复用通常需要大量人工努力。数据复用和整合的一个持续障碍是解读各种定制且多样化的数据格式选择。为此,人们提出了通用数据格式,但该领域仍在为一个基本矛盾而挣扎:足够灵活以适应多样化实验的格式往往缺乏描述性,难以自解释;而足够描述性的格式又需要详细的文档和整理工作,这是大多数实验室难以持续的。代理型AI自然成为解决此问题的候选:LLMs能快速阅读代码和文本,并以持续注意力关注人类往往略过的低层次细节。为了衡量代理型AI在此任务上的表现,我们选取了八篇近期研究大规模小鼠神经群体记录且同时共享数据和代码的文章,这些记录涵盖了多样的记录方式、行为范式和数据集格式(例如NWB、专用API和通用Python或MATLAB文件)。我们向代理提供数据、代码和论文,并提示它们加载、理解和重新格式化数据,以用于一个共同的下游任务:训练一个从神经活动到任务或行为变量的解码器。科学家常用的通用编码代理在每个子任务上表现良好,但很少能串联出完全无错误的端到端解决方案。我们描述了代理所犯的错误类型以及引发这些错误的数据集特性,并提出了代理型AI时代的数据共享最佳实践。我们进一步发现,代理作为裁判在捕捉错误方面不可靠,特别是在缺乏真实参考的情况下,因此交互式的人工在环编码仍然必要。
查看缓存全文
缓存时间: 2026/05/14 06:19
# 神经数据告别枯燥:基准测试智能体AI在数据重用中的表现 来源:https://arxiv.org/abs/2605.12808 查看PDF (https://arxiv.org/pdf/2605.12808) > 摘要:神经科学数据在不同实验室、格式和实验范式间高度碎片化,重用往往需要大量人工操作。数据重用与集成的持续障碍在于需要解读特制且多样的数据格式选择。虽然已有通用数据格式被提出作为应对,但该领域仍面临一个基本矛盾:足够灵活以容纳多样化实验的格式往往缺少描述性,难以自解释;而描述性足够的格式又要求详细的文档和整理工作,很少有实验室能持续维持。智能体AI是解决这一问题的天然候选:大语言模型能够快速阅读代码和文本,并以人类容易忽略细节时仍能保持的专注力关注底层细节。为了衡量智能体AI在此任务上的表现,我们选取了最近八篇研究大规模小鼠神经群体记录的论文,这些论文同时共享了数据和代码,涵盖多种记录模态、行为范式和数据集格式(例如NWB、专用API以及通用的Python或MATLAB文件)。我们向智能体提供数据、代码和论文,提示它们加载、理解并将数据重新格式化为一个共同的下游任务:训练一个从神经活动到任务或行为变量的解码器。科学家常用的通用编程智能体在每个子任务上表现良好,但很少能串联出完全无错误的端到端解决方案。我们描述了智能体所犯的错误类型及引发这些错误的数据集属性,并为智能体AI时代提出了数据共享的最佳实践。我们进一步发现,将智能体作为评判者来捕捉错误是不可靠的,尤其是在缺乏真实参考时;因此,交互式的人机协同编程仍然是必要的。 ## 提交历史 来自:Kristin Branson \[查看电子邮箱 (https://arxiv.org/show-email/f888af11/2605.12808)\] **\[v1\]** 2026年5月12日星期二 23:00:18 UTC (11,544 KB)
相似文章
神经科学数据到发现流程中AI代理评估的案例研究
本文提出了一项实证研究,评估通用编码代理在果蝇光遗传学数据到发现流程中的表现。研究发现,虽然代理能够自动化单个阶段,但在需要科学判断和资源管理的端到端任务中表现不佳。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。