HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
摘要
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
arXiv:2606.31179v1 Announce Type: new
摘要:随着AI智能体在复杂、长程推理方面能力的增强,对其进行严格且全面的评估对于衡量其在真实医疗应用中的进展至关重要。我们引入了HealthAgentBench——一个包含7个类别、每个类别具有独特环境的54个智能体医疗任务套件。该基准套件涵盖了患者诊疗过程中的多样化工作流程和广泛模态。每个任务旨在复现端到端的临床工作流程:在给定最少指令的情况下,智能体必须探索原始医疗数据,在复杂环境中操作,并执行超越简单提示的多步骤解决方案。最终任务成功率作为单一可解释指标,用于报告各智能体在HealthAgentBench上的整体表现。在对前沿智能体进行评估时,我们发现总体任务成功率仍然较低,凸显了该套件的难度。最强且最具成本效益的智能体Codex GPT-5.5仅能达到约42%的成功率。除整体表现外,HealthAgentBench揭示了不同任务类别中的细微优劣。前沿智能体在基于电子健康记录数据自动开发研究建模流程方面展现出潜力,但医学影像仍极具挑战性,尤其是对Claude Code模型而言,而Codex GPT-5.5则展现出新兴能力。结合大规模搜索空间与组合推理要求的任务对所有现有智能体而言仍然困难。这些结果表明,HealthAgentBench提供了一个具有挑战性和真实性的基准,未来具有巨大的改进空间。我们已在https://github.com/microsoft/HealthAgentBench发布该基准。
查看缓存全文
缓存时间: 2026/07/01 05:37
# HealthAgentBench: 面向前沿AI智能体的统一基准套件——模拟现实医疗场景的挑战性智能体环境
**来源:** https://arxiv.org/html/2606.31179
*钱楚刘, 张胜\*, 秦光辉\*, Jeya Maria Jose Valanarasu, Maximilian Rokuss, 陆明宇, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, 魏牧, 尹文伟, 刘琴, 荆紫琳, Jason Entenmann, 臼山直人, Tristan Naumann, Hoifung Poon*
###### 摘要
随着AI智能体在复杂、长程推理方面能力的不断增强,建立严谨的评估体系对于衡量其在医疗领域实际应用中的进展至关重要。然而,现有的医疗基准测试往往存在饱和、静态或临床范围狭窄等问题,限制了它们区分尖端系统或跟踪进展的能力。我们推出了 **HealthAgentBench**,这是一套包含54个医疗智能体任务的基准测试,涵盖7个类别,每个类别都拥有独特的运行环境。该基准测试套件贯穿患者诊疗全程的多样化工作流程,并覆盖广泛的数据模态。每个任务都旨在复现端到端的临床工作流程:给定最简指令,智能体必须探索原始医疗数据,在复杂环境中操作,并执行多步骤解决方案——这超越了简单的提示词调用,例如查询大型临床数据库或解释千兆像素的病理图像。所有任务均基于专家标注或人类表现,采用二元成功/失败标准进行评分。最终将报告一个任务成功率指标,为HealthAgentBench上每个智能体的整体表现提供单一、可解释的衡量标准。在对前沿智能体进行评估后,我们发现整体任务成功率仍然很低,这突显了该基准套件的难度。最强大且最具成本效益的智能体 Codex GPT-5.5 仅达到了约 42% 的成功率。除了整体表现,HealthAgentBench 还揭示了不同任务类别下智能体细微的优劣势。前沿智能体在基于电子健康记录数据自动开发研究建模管道方面展现出潜力,但医学影像任务仍然特别具有挑战性,对 Claude Code 模型尤其如此,而 Codex GPT-5.5 则显示出新兴的能力。对于所有当前智能体而言,结合了大型搜索空间与组合推理需求的任务仍然困难重重。这些结果共同表明,HealthAgentBench 提供了一个具有挑战性且逼真的基准测试,为未来的进步留下了巨大空间。我们已在 https://github.com/microsoft/HealthAgentBench 上发布我们的基准测试。
## 1 引言
```
/data/patient/
├── study_01_2187-10-28_14-51-03/
│ ├── view_01.jpg
│ ├── view_02.jpg
│ └── report.txt (完整既往报告)
├── study_02_2187-11-11_17-18-35/
│ └── ...
└── target_study/
├── view_01.jpg
└── report.txt (损坏的“所见”草稿)
```
**准备患者数据和工件**
*一位初级放射科医生为靶向研究撰写的“所见”草稿可能包含临床错误。请使用胸部X光影像和既往研究进行审查和纠正,然后将修正后的报告写入 `/workspace/submission.json`。*
**提供最简指令**
```
agent$ view target_study/view_01.jpg
> 1024x1024 PA正位,肺野清晰...
agent$ zoom view_01.jpg 4x --crop
> 左肺底:无实变;草稿有误
agent$ read target_study/report.txt
> 草稿所见:左肺底实变...
agent$ read study_01_.../report.txt
> 既往:慢性左肺底疤痕,稳定
agent$ write /workspace/submission.json
> 修正后的“所见”已提交 [ok]
```
**智能体执行**
*任务环境(Docker容器)*
*隐藏专家审核标签*
*评估脚本(后处理与评分)*
**输出:** ✓ / ×
**评估**
**图1:** HealthAgentBench 是一个用于医疗AI智能体的统一评估框架。
每个基准任务都打包为一个Docker容器环境,包含三个阶段:(1) 容器通过将患者数据和必要工件放入 `/data/` 目录来设置环境(此处,X光报告修正任务包含一位患者的纵向胸部X光历史,其中靶向研究的报告带有一个损坏的“所见”草稿部分,智能体必须对其进行修正);(2) 向智能体提供一个自然语言指令;(3) 智能体在终端中行动,发出工具调用(它可以自由决定是否安装软件包或运行命令来查看、裁剪、缩放图像,或查阅患者的既往研究),直到将修正后的报告写入 `/workspace/submission.json`。评估在容器外部运行,根据隐藏的专家审核真值进行,并采用二元成功标准。相同的容器化框架实例化了所有7个任务类别(右侧),每个类别都有独特的环境,并显示了每个类别的输入模态和任务数量。
AI研究领域正在经历从将大语言模型作为孤立任务解决者到能够执行复杂环境内行动的智能体系统的转变。传统的大语言模型基准测试主要围绕静态输入设计:模型接收一个固定的提示词(通常包含一段简短的文本上下文),然后产生一个单一的答案。例如,MedQA [15] 这类任务评估LLM在给定简洁临床情景下能否回答问题。如今,配备工具、框架和执行环境的LLM智能体能够超越固定上下文的提示词调用:它们可以搜索、检查、查询、计算,并迭代地对分布在文件、数据库、图像和软件系统中的数据采取行动。因此,开发智能体评估环境对于准确衡量这些前沿系统的能力变得至关重要。这种转变对于医疗保健领域尤为重要,因为许多高价值应用需要对复杂、多模态和大规模数据进行端到端的推理。促进真实的临床工作流程通常涉及处理无法在简短提示词中完全呈现的信息,例如3D CT体积、千兆像素病理切片、纵向EHR数据库、试验方案以及异构临床文档。这些场景历来超出了传统提示词方法的能力范围,原因要么是数据超出了模型的上下文窗口,要么是解决问题的过程中需要与工具和环境进行多步交互。智能体系统通过允许模型探索环境、操作原始数据、设计并执行特定任务策略,为更真实地应对这些工作流程创造了可能性。因此,超越静态评估,开发能够评估智能体在端到端医疗任务上的新兴能力的现实、整体基准套件至关重要。
然而,目前的医疗基准测试格局仍然支离破碎,不足以评估AI智能体的全部能力。传统基准测试主要衡量孤立的推理或问答能力,而近期专注于智能体的工作 [7, 14, 21, 5] 范围仍然有限,通常集中在特定任务、模态或预定义的工作流程上。这种缺乏广泛、原生智能体评估的现状,使得我们难以对前沿系统在医疗领域的能力得出可靠结论,因为现实世界的临床工作流程很少依赖于单一任务、模态或数据源(例如,临床医生通常整合来自不同输入的信息——如病理切片、CT扫描、放射学报告等——来做出诊断和治疗决策)。因此,需要一个全面、真实且具有挑战性的基准测试套件,为评估和比较医疗领域的智能体AI系统提供共同基础,使研究人员能够识别优势和改进领域,并跟踪这一快速发展领域的进展。
在这项研究中,我们引入了 **HealthAgentBench**,这是一个用于评估AI智能体的统一医疗智能体环境套件。HealthAgentBench 包含54个任务,涵盖7个类别,每个类别都有其独特的环境,包括X光报告修正、病理肿瘤区域选择、CT异常分类、临床试验匹配、EHR数据质量审计、EHR事件建模和EHR格式转换。这些任务贯穿患者诊疗全程的多样化临床工作流程,包括数据管理、诊断、研究和治疗规划。它们还涵盖了广泛的数据模态,包括二维X光片、三维CT体积、全切片病理图像、自由文本和结构化临床数据。如第3节所述,我们提供了一个原则性的工作流程来选择和创建HealthAgentBench中的每个任务,以确保建立一个统一、真实、具有挑战性、可验证且多样化的基准测试。对于每个任务,我们提供一个基于终端的环境,遵循Merrill等人的方法 [24],如图1所示。在每个环境中,智能体都会获得真实的临床工件,包括患者数据和辅助资源,以及最简任务指令。这种设置允许智能体自由探索环境、制定策略并提出解决方案。图1所示的X光报告修正任务向智能体提供了一个包含患者纵向胸部X光历史和一份损坏报告的环境,智能体可以查看、放大、裁剪X光片,并交叉参考既往研究,然后撰写修正后的报告。通过这种方式,HealthAgentBench评估了智能体的端到端自主能力,包括规划、工具使用、环境探索和任务执行。再举一个例子,当面对一个CT体积数据时,智能体可能会选择逐切片检查、安装图像处理工具、预过滤相关区域,或在做出最终预测前裁剪候选病灶。最后,我们提供了一个统一的评估模块,通过针对每个任务定义基于人类表现或专家标签的成功/失败标准来评估智能体输出,从而在整个套件中实现对智能体的一致性比较。我们会进行人工审核,以确保成功标准是可达到的。
我们使用HealthAgentBench对前沿LLM智能体进行了实证研究。我们发现,即使对于最先进的系统,这些任务也充满挑战,最强的智能体 Codex GPT-5.5 仅实现了大约 42% 的任务成功率。除了这个总体结果,该套件还能对智能体在不同任务类别、临床工作流程和数据模态中的优劣势进行细致入微的分析,突出了当前智能体表现出潜力的领域,以及仍需要实质性进步的领域。
### 贡献
总之,我们的贡献如下:
1. **统一的医疗智能体环境套件。** 我们引入了HealthAgentBench,这是一个用于评估AI智能体在真实、基于患者任务上的基准测试套件,这些任务涵盖多样化的临床工作流程和数据模态,包括医学影像、自由文本和结构化EHR数据。我们还建立了一个原则性的工作流程,用于为基准测试寻找和选择任务,该流程可扩展用于未来版本。
2. **一个远未饱和的挑战性基准测试。** HealthAgentBench旨在长期衡量前沿医疗智能体的进展。当前的前沿智能体整体任务成功率较低,最强的模型 Codex GPT-5.5 仅达到约 42%,为未来的改进留下了巨大空间。
3. **对前沿智能体能力的细致分析。** 我们的基准测试揭示了当前前沿智能体的两个主要瓶颈:(i) 医学影像任务(即CT、X光、病理切片) (ii) 需要大搜索空间和复杂组合推理的任务。我们进一步观察到了清晰的模型家族差异,Codex GPT 模型(尤其是 GPT-5.5)通常更具成本效益,并且始终在医学影像任务上优于Claude Code模型。
## 2 相关工作
医疗领域拥有数量快速增长、面向智能体的基准测试,但目前还没有一个能够提供涵盖完整患者诊疗过程的统一、可执行、多模态的评估。我们将近期的工作分为三个互补的研究方向,并讨论HealthAgentBench与每个方向的关系。
第一类工作研究智能体策略如何改善医学问答。两个代表性例子是:MedAgentBoard [39],它提供了对LLM多智能体协作与单LLM提示词调用以及传统强方法在各类医学任务家庭上的仔细比较;ClinicalAgent Bench [20],它考虑了一个包含五个临床能力维度的广泛任务套件,并配有一个丰富的临床工具箱。这些基准测试主要围绕问答格式组织,每个实例将一个查询与预先提供的上下文配对,智能体的工具或协作者作为求解器的一部分。HealthAgentBench的关注点则有所不同:智能体不是回答一个独立的问题,而是必须在一个实时环境中探索和行动,并随着多步操作改变环境的状态。
第二类工作开发了以临床对话为中心的真正交互式评估。HealthBench [6] 和 HealthBench Professional [13] 提供了由医生精心编写、用于多轮患者和临床医生对话的评估标准;MAI-DxO [26] 将诊断建模为针对具有挑战性的NEJM病例的成本感知序列过程;AgentClinic [31] 则将医学QA和EHR病例转化为一个模拟诊所,其中包含相互交互的医生、患者和测量智能体。类似地,模拟医院环境,如AI医院 [8]、MedAgentSim [1] 和 CP-Env [38],让模型在多步就诊和分支护理路径中扮演临床工作人员的角色。这类工作尤其擅长捕捉临床推理和交流。它的焦点是对话和模拟患者交互,而HealthAgentBench要求智能体直接操作原始、异构的患者数据。
第三类工作与我们最为接近,它将智能体置于涉及真实数据的可执行环境中,每个基准测试都专注于一个特定的临床场景。MedAgentBench [14] 和最近的 PhysicianBench [22] 将智能体置于基于FHIR的EHR环境中,用于检索记录和下达医嘱,其中PhysicianBench将范式扩展到长程、执行验证的工作流程;两者都集中于结构化EHR数据。MedAgentGym [35] 提供了一个可扩展的年龄相似文章
CHI-Bench: AI智能体能否自动化端到端、长周期、政策密集的医疗工作流程?
本文介绍了CHI-Bench,这是一个用于评估AI智能体在需要基于政策的决策、多角色组合和多边交互的复杂医疗工作流程端到端自动化方面的基准。实验结果表明,最佳智能体仅实现了28%的任务解决率,突显了当前智能体在政策密集的企业领域中的能力差距。
介绍 HealthBench
OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
StartupBench: 基准测试:针对市场验证的端到端工作流程的通用代理
StartupBench 引入了一个基准,用于评估通用AI代理在真实世界创业工作流程中的表现,揭示顶级模型仅能完成约30%的任务,原因在于复杂指令遵循和领域特定专业知识方面的不足。
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。