BIABench:在真实生物图像分析任务上评估AI智能体

Hugging Face Daily Papers 论文

摘要

论文提出了BIABench,一个从已发表研究中重建的、包含16项真实生物图像分析任务的开放基准,对AI智能体进行端到端评估,采用结果评分和过程评分两种方式。智能体能够很好地解决常规二维任务,但在三维和延时序列任务上表现失败;无论是生物领域专业化、更强的模型,还是专家撰写的详细指令,都无法弥合这一可靠性差距。

人工智能(AI)智能体在自动化生物图像分析方面前景广阔,但目前尚无基准来评估它们能否端到端地完成真实世界的分析。这类分析对智能体而言难度很大,因为二维图像、三维体数据和延时序列往往过于庞大,无法作为上下文直接读取,智能体必须通过代码、专用软件和渲染视图来选择并执行分析流程。已发表的研究为这种能力的检验提供了条件,因为每一项研究都将原始图像与经过同行评审的结果配对呈现。我们提出了BIABench——一个包含16项任务的基准,这些任务从已发表的生物学研究中重建,保留了其科学问题、成像数据和真值标注。任务涵盖十一种分析子任务和模态,范围从H&E组织学到单分子定位显微镜。每次提交都会获得一个结果评分,即使用领域标准指标将输出文件与真值进行比较;以及一个过程评分,即由视觉语言模型依据专家撰写的评分细则对方法选择和质量控制进行评判。我们在多种语言模型上评估了通用型和生物学专用型智能体,并对每项任务进行了重复运行。常规的二维任务得到了很好的解决,但在一些涉及第三维度或时间轴的任务上,没有任何智能体得分超过0.19。生物领域专业化、更强的模型以及详细的专家指令都未能缩小这一差距。智能体的可靠性也不足:同一智能体在重复运行之间的得分差异,甚至大于不同智能体之间的差异;而且在没有真值的情况下,仅凭过程评分或耗时无法区分一次正确运行与一次错误运行。BIABench连同其数据和代码公开发布,为评估、并最终用于训练能够可靠执行长时程生物图像分析的智能体提供了一个可验证的框架。
查看原文
查看缓存全文

缓存时间: 2026/10/01 20:24

论文页面 - BIABench:在真实世界生物图像分析任务上评估 AI 智能体

来源:https://huggingface.co/papers/2609.34274

摘要

人工智能(AI)智能体有望实现生物图像分析的自动化,但目前尚无基准测试来评估它们能否端到端地完成真实世界的分析。这类分析对智能体而言颇具挑战,因为二维图像、三维体数据和延时序列序列往往过于庞大,无法作为上下文直接读取,因此智能体必须通过代码、专用软件和渲染视图来选择并执行分析流程。已发表的研究使这种能力变得可测试,因为每项研究都将其原始图像与经过同行评审的结果配对。我们提出 BIABench,一个包含 16 个任务的基准测试,这些任务从已发表的生物学研究中重构而来,并保留了其科学问题、成像数据和 ground truth。任务涵盖十一种分析子任务和多种模态,从 H&E 组织学切片到单分子定位显微成像。每份提交都会获得两个分数:结果分数(使用领域标准指标将输出文件与 ground truth 进行比较)以及过程分数(由视觉语言模型根据专家撰写的评分标准,对方法选择和质量控制进行评判)。我们在多种语言模型上评估了通用型和生物学专用型智能体,并对每个任务进行了重复运行。常规的二维任务得到了较好的解决,但在涉及第三维度或时间轴的任务上,没有任何智能体得分超过 0.19。生物学专用化、更强的模型以及详细的专家指令都无法弥合这一差距。智能体的表现也不够可靠:同一智能体重复运行之间的分数差异,甚至大于不同智能体之间的差异;并且在没有 ground truth 的情况下,仅凭过程分数或所花费的时间,无法区分正确的运行结果与错误的结果。BIABench 连同其数据和代码一同公开发布,为评估(乃至最终训练)能够可靠执行长程生物图像分析的智能体提供了一个可验证的框架。

查看 arXiv 页面(https://arxiv.org/abs/2609.34274)|查看 PDF(https://arxiv.org/pdf/2609.34274)|项目页面(https://biabench.github.io/)|GitHub(6)(https://github.com/BIABench/BIABench)|添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.34274)

在你的智能体中获取这篇论文:

hf papers read 2609.34274

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型:0

没有模型关联此论文。

在模型 README.md 中引用 arxiv.org/abs/2609.34274,即可从本页面链接该论文。

引用此论文的数据集:1

BIABench/BIABench 更新于 3 天前 • 871 • 2(https://huggingface.co/datasets/BIABench/BIABench)

引用此论文的 Spaces:0

没有 Space 关联此论文。

在 Space README.md 中引用 arxiv.org/abs/2609.34274,即可从本页面链接该论文。

包含此论文的收藏:0

没有收藏包含此论文。

将此论文添加到收藏(https://huggingface.co/new-collection),即可从本页面链接该论文。

相似文章

AutoMedBench:迈向基于智能体AI模型的医学自动研究

Hugging Face Daily Papers

AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。