LongMedBench:面向长时程临床决策的医疗智能体基准测试
摘要
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。
arXiv:2607.09322v1 公告类型:新
摘要:本文介绍了 LongMedBench,一个基于真实电子健康记录的长时程临床决策基准测试。以往对基于 LLM 的医疗智能体的评估主要侧重于短上下文知识问答和工具使用。然而,现实世界的医疗护理本质上是纵向的,临床医生必须综合多次就诊、检查和不断变化的治疗方案中的证据。因此,长时程交互对于真实评估至关重要。LongMedBench 通过可复现的流水线构建,将 MIMIC-IV 的入院记录和临床笔记整合为时间序列事件流和长上下文记忆数据集,从而实现了智能体与临床环境之间的长时程、多回合交互。该基准包含335名患者,平均每名患者有19.72次住院就诊,每次就诊有44.91项医疗事件。在长时程决策过程的指导下,我们提出了一个包含三个套件的评估分类:事实问答、时序推理和长时程决策。该分类衡量智能体如何理解并在较长时间范围内利用历史患者信息。我们的实验表明,尽管最近的LLM能够很好地利用显式时间戳,但在隐式时间推理方面仍存在挑战;RAG和智能体记忆系统可以提高信息检索任务的性能,但决策任务的性能高度依赖于模型的即时上下文。
查看缓存全文
缓存时间: 2026/07/13 07:53
# LongMedBench:面向长时程临床决策的医学智能体基准测试
来源:https://arxiv.org/html/2607.09322
11浙江大学,杭州,中国
11email:\{zihan1\.22,yanzhen\.22,xiaocheng\.22,zhiting\.23\}@intl\.zju\.edu\.cn11email:einstein@zju\.edu\.cn, zuozhuliu@intl\.zju\.edu\.cn22阿里巴巴集团,杭州,中国
22email:zhaiweiqi\.zwq@alibaba\-inc\.com33经血管植入器械研究院,杭州,中国陈彦臻\*张晓程\*范志婷翟伟奇徐红霞刘佐珠†\\dagger
###### 摘要
本文介绍LongMedBench,一个基于真实世界电子健康记录(EHR)的长时程临床决策基准。先前对基于LLM的医学智能体的评估主要侧重于短上下文知识问答和工具使用。然而,真实世界的医疗护理本质上是纵向的,临床医生必须整合多次就诊、检查及不断演变的治疗过程中的证据。因此,长时程交互对于现实评估至关重要。LongMedBench通过一个可复现的流水线构建,该流水线将MIMIC-IV入院记录和临床笔记整合为时间序列事件流和长上下文记忆数据集,从而实现智能体与临床环境之间的长时程、多轮次交互。该基准包含335名患者,每名患者平均有19.72次住院就诊,每次就诊平均有44.91个医疗事件。在长时程决策过程的指导下,我们提出了一个包含三个套件的评估分类体系:基于事实的问答、时间推理和长时程决策。该分类体系衡量智能体如何在扩展的时间范围内理解和利用患者历史信息。我们的实验表明,虽然近期的大型语言模型能够很好地利用显式时间戳,但在隐式时间推理方面仍面临挑战;RAG和智能体记忆系统可以提升信息检索任务的性能,但决策任务的性能高度依赖于模型的即时上下文。
1. *这些作者对工作贡献相同。
2. †通讯作者:刘佐珠。
## 1 引言
在临床实践中,诊断过程本质上是纵向且依赖时间的。临床医生不仅仅是对孤立的症状做出反应;他们必须综合多年间多次就诊、诊断检查以及不断演变的治疗反应中的证据[4 (https://arxiv.org/html/2607.09322#bib.bib10)]。这种长时程临床推理能力是高质量医疗的基础。随着大型语言模型(LLM)向自主医学智能体转变,它们在真实世界电子健康记录(EHR)[7 (https://arxiv.org/html/2607.09322#bib.bib24)]中导航复杂轨迹的能力已成为临床就绪状态的关键基准。
表1:医学智能体基准比较。基准 Long.a Ctx.b EHR.c Dec.d Temp.e 焦点
MedAgentBench[6 (https://arxiv.org/html/2607.09322#bib.bib14)] × \\times × \\times ✓ \\checkmark ✓ \\checkmark × \\times EHR工具集成
AgentClinic[16 (https://arxiv.org/html/2607.09322#bib.bib33)] × \\times × \\times × \\times ✓ \\checkmark × \\times 模拟交互
DiagBench[14 (https://arxiv.org/html/2607.09322#bib.bib20)] × \\times × \\times ✓ \\checkmark ✓ \\checkmark × \\times 诊断轨迹
MedBench v4[3 (https://arxiv.org/html/2607.09322#bib.bib16)] × \\times ✓ \\checkmark ✓ \\checkmark × \\times × \\times 医学知识问答
ReflecTool[9 (https://arxiv.org/html/2607.09322#bib.bib12)] × \\times × \\times × \\times ✓ \\checkmark × \\times 反思性工具使用
EHRSQL[8 (https://arxiv.org/html/2607.09322#bib.bib7)] × \\times × \\times ✓ \\checkmark × \\times × \\times 关系查询
LongMedBench ✓ \\checkmark ✓ \\checkmark ✓ \\checkmark ✓ \\checkmark ✓ \\checkmark 长时程推理
a纵向:跨多次离散临床就诊的推理。b上下文:基准环境是否包含多轮上下文。cEHR:数据集是否基于真实世界EHR构建。d决策:是否评估超越静态检索或SQL查询的主动临床规划。e时间敏感性:是否评估对临床时间线和紧急程度的理解。
尽管已经出现了用于评估长时程或多轮交互的通用基准[18 (https://arxiv.org/html/2607.09322#bib.bib5),17 (https://arxiv.org/html/2607.09322#bib.bib6),kočiský2017narrativeqareadingcomprehensionchallenge,19 (https://arxiv.org/html/2607.09322#bib.bib3),5 (https://arxiv.org/html/2607.09322#bib.bib2),3 (https://arxiv.org/html/2607.09322#bib.bib16)],但这些基准主要强调基于信息检索的显式推理——即在长上下文中定位特定事实的能力[10 (https://arxiv.org/html/2607.09322#bib.bib32)]。它们测试模型在“大海捞针”的能力,但忽视了临床推理所必需的时间动态性。在真实的医疗场景中,挑战不仅仅是检索孤立的事实,而是理解患者状态如何在几十次就诊中演变,以及这种时间进展如何指导治疗策略。
与这些一般性局限并行的是,当前的医学评估范式也无法满足这一要求,如表1 (https://arxiv.org/html/2607.09322#S1.T1)所示。尽管引入了模拟交互环境,但最近的框架[14 (https://arxiv.org/html/2607.09322#bib.bib20),6 (https://arxiv.org/html/2607.09322#bib.bib14),16 (https://arxiv.org/html/2607.09322#bib.bib33),3 (https://arxiv.org/html/2607.09322#bib.bib16),9 (https://arxiv.org/html/2607.09322#bib.bib12),8 (https://arxiv.org/html/2607.09322#bib.bib7)]受限于有限的上下文窗口和会话次数,强调智能体的工具调用能力和即时预测,而非对完整临床轨迹的理解。因此,它们无法评估模型如何利用广泛的病史进行未来的临床决策。
为解决这些局限,我们引入了LongMedBench,一个基于MIMIC-IV[7 (https://arxiv.org/html/2607.09322#bib.bib24)]的基准,通过整理广泛的纵向轨迹和设计挑战智能体时间敏感性的推理任务,克服了受限的上下文长度和简单的事实回忆。通过将335名患者的记录转换为纵向事件流(每位患者平均19.72次就诊),我们构建了一个时间密集的环境和一个明确针对长时程临床推理的框架。我们的贡献是:(1)**三级记忆数据集架构**,用于不同粒度的历史评估。(2)**渐进式评估分类体系**,涵盖三个层次的任务:基于时间戳或相对位置的事实型问答,针对通用基准的事实检索局限;**时间推理**,用于多次就诊和事件级别的排序,解决现有医学框架中缺乏时间敏感性评估的问题;以及**长时程决策**,直接挑战智能体在广泛历史中导航并自主规划下一步临床行动的能力。(3)**实验发现**:我们表明,尽管最先进的LLM能够利用显式时间戳,但在就诊级别理解所需的隐式时间推理方面存在困难。虽然RAG和记忆系统改善了事实检索的性能,但决策准确性仍然高度依赖于即时上下文,突显了在长期临床轨迹上进行推理的深刻局限性。
## 2 方法
### 2.1 EHR数据处理流水线
LongMedBench基于MIMIC-IV[7 (https://arxiv.org/html/2607.09322#bib.bib24)]构建,这是一个包含超过100,000名患者医疗记录公开数据库。为了将静态EHR转换为交互式智能体环境,我们设计了一个三阶段流水线(图1 (https://arxiv.org/html/2607.09322#S2.F1))。
参见图注
图1:LongMedBench的数据处理流水线
#### 2.1.1 事件与患者筛选
为减少冗余同时保留临床信号,我们仅保留异常的实验室结果以及具有完整入院/出院记录的患者。筛选住院次数≥15 \\geq 15次的患者,得到355名患者和6,999次就诊。每名患者平均19.72次就诊(中位数=18.00,SD=5.72),这种密集的多轮次结构严格评估智能体在跨轮次记忆和时间推理方面的能力。
#### 2.1.2 事件流构建
为每位患者P \\mathcal\{P\}构建一个完整的事件流S \\mathcal\{S\}。事件流S \\mathcal\{S\}包含患者的就诊记录S:=\{V1,V2,...,Vn\} \\mathcal\{S\}:=\\\{\\mathcal\{V\}\_\{1\},\\mathcal\{V\}\_\{2\},\\dots,\\mathcal\{V\}\_\{n\}\\\},其中Vi \\mathcal\{V\}\_\{i\}是患者的第i\_\{\\text\{th\}\}次就诊,且n≥15 n\\geq 15。平均而言,每次就诊Vi \\mathcal\{V\}\_\{i\}包含44.91个医疗事件(中位数=25.00,SD=70.32)。
一次就诊Vi \\mathcal\{V\}\_\{i\}以入院事件Eiadm E^\{adm\}\_\{i\}开始,随后是一系列具体的医疗事件,并以出院事件Eidis E^\{dis\}\_\{i\}结束。Vi \\mathcal\{V\}\_\{i\}中的第k\_\{\\text\{th\}\}个医疗事件记为Eik=\{aik,tik,pik,oik\} E^\{k\}\_\{i\}=\\\{a^\{k\}\_\{i\},t^\{k\}\_\{i\},p^\{k\}\_\{i\},o^\{k\}\_\{i\}\\\},其中aik a^\{k\}\_\{i\}是典型临床动作空间A \\mathcal\{A\}中的动作,包括影像、实验室检查、用药等。tik t^\{k\}\_\{i\}是事件时间戳,pik p^\{k\}\_\{i\}是相应的动作参数,如影像事件的模态(CT、X射线、MRI)。oik o^\{k\}\_\{i\}是事件结果或临床观察,如影像事件中的放射报告。Vi \\mathcal\{V\}\_\{i\}可表示为一系列事件的并集:Vi=\{Eiadm,Ei1,Ei2,...,Eidis\} \\mathcal\{V\}\_\{i\}=\\\{E^\{adm\}\_\{i\},E^\{1\}\_\{i\},E^\{2\}\_\{i\},\\dots,E^\{dis\}\_\{i\}\\\}。
除结构化住院数据外,每次就诊还包含两种类型的笔记:一种是放射笔记,解析为影像事件;另一种是出院笔记,即就诊Vi \\mathcal\{V\}\_\{i\}的摘要Ni N\_\{i\},可根据逻辑解析为入院信息Niadm N\_\{i\}^\{adm\}和出院信息Nidis N\_\{i\}^\{dis\}。
#### 2.1.3 记忆数据集生成
为评估智能体如何利用长上下文信息,我们设计了三个粒度逐渐精细的记忆模块。从起始历史就诊Vi \\mathcal\{V\}\_\{i\}、当前就诊Vj \\mathcal\{V\}\_\{j\}和推理时间戳T T开始,智能体的记忆访问被严格限制,以防止事件泄露。
1. **笔记记忆**:MN\(i,j\)=\{Ni,Ni\+1,...,Nj−1\} \\mathcal\{M\}^\{\(i,j\)\}\_\{N\}=\\\{N\_\{i\},N\_\{i\+1\},\\dots,N\_\{j\-1\}\\\},包含从Vi \\mathcal\{V\}\_\{i\}到Vj−1 \\mathcal\{V\}\_\{j\-1\}的就诊级别摘要。摘要高度压缩,强调整体轨迹而非细致的事件回忆。
2. **事件记忆**:ME\(i,j\)=⋃k=ij−1Vk \{\\textstyle\\mathcal\{M\}^\{\(i,j\)\}\_\{E\}=\\bigcup\_\{k=i\}^\{j\-1\}\\mathcal\{V\}\_\{k\}\},包含从Vi \\mathcal\{V\}\_\{i\}到Vj−1 \\mathcal\{V\}\_\{j\-1\}的所有临床事件。事件被扁平化为单一的时间顺序序列,忽略就诊级别的边界,形成统一的患者轨迹。
3. **上下文记忆**:MC\(j,T\)=\{\(r0,m0\),\(r1,m1\),...,\(rP,mP\)\} \\mathcal\{M\}\_\{C\}^\{\(j,T\)\}=\\\{\(r\_\{0\},m\_\{0\}\),\(r\_\{1\},m\_\{1\}\),\\dots,\(r\_\{P\},m\_\{P\)\)\\\},其中rk r\_\{k\}和mk m\_\{k\}表示对话角色和消息内容。它是通过将当前Vj \\mathcal\{V\}\_\{j\}的事件流重写为LLM风格的轨迹构建的。仅保留满足tjk<T t\_\{j\}^\{k\}<T的事件Ejk E\_\{j\}^\{k\}。每个Ejk E\_\{j\}^\{k\}被转化为一个动作-反馈对,使用LLM:\{\(assistant,\{ajk,tjk,pjk\}\),\(user,\{fjk,tjk′\}\)\} \\\\{\\\(\\texttt\{assistant\},\\\{a^\{k\}\_\{j\},t^\{k\}\_\{j\},p^\{k\}\_\{j\}\\\}\),\(\\texttt\{user\},\\\{f^\{k\}\_\{j\},\{t^\{k\}\_\{j\}\}^\{\\prime\}\\\}\)\\\},其中fjk f^\{k\}\_\{j\}和tjk′ \{t^\{k\}\_\{j\}\}^\{\\prime\}表示根据ojk o\_\{j\}^\{k\}和相应时间戳推断的模拟临床反馈。该记忆模拟医学智能体的即时交互状态。
### 2.2 基准问题生成
基于记忆模块\{MN\(i,j\),ME\(i,j\),MC\(j,T\)\} \\\{\\mathcal\{M\}^\{\(i,j\)\}\_\{N\},\\mathcal\{M\}^\{\(i,j\)\}\_\{E\},\\mathcal\{M\}\_\{C\}^\{\(j,T\)\}\\\},我们构建了三个逐级挑战性的任务系列,从**事实型问答**、**时间推理**到**长时程决策**,反映了越来越全局的记忆依赖性。
参见图注
图2:LongMedBench中三个评估任务的示例。
#### 2.2.1 事实型问答
该任务评估智能体在事件记忆中精确检索和时间对齐的能力。从就诊Vi \\mathcal\{V\}\_\{i\}中随机采样一个真实事件Eik∈Vi E^\{k\}\_\{i\}\\in\\mathcal\{V\}\_\{i\},并通过以下两种格式统一转化为问题:**显式**任务在查询文本中包含tik t^\{k\}\_\{i\},评估直接检索能力;而**相对**任务仅提供相对时间关系,不提供时间戳(例如,Vi \\mathcal\{V\}\_\{i\}中第2个用药事件的药物名称)。问题要求智能体从提供的冗余记忆窗口ME\(i−m,i\+m\+1\) \\mathcal\{M\}\_\{E\}^\{\(i\-m,i\+m\+1\)\}中恢复完整的事实细节pik p\_\{i\}^\{k\},其中m≥0 m\\geq 0是调整窗口大小的超参数。我们将Vi \\mathcal\{V\}\_\{i\}置于窗口中间,以评估在长上下文记忆中非近因偏好区域的检索能力[10 (https://arxiv.org/html/2607.09322#bib.bib32)]。
#### 2.2.2 时间推理
该任务评估智能体在不同记忆粒度下重建时间顺序的能力。评估分数通过Kendall's τ \\tau测量。给定目标事件流S \\mathcal\{S\}或其就诊Vi \\mathcal\{V\}\_\{i\},我们设计了三个子任务,每个针对不同层次的时间推理,以原始事件流作为真实标签。**就诊内插入**测试事件级别推理:将Vi∈Vi E\_\{i\}^\{k\}\\in\\mathcal\{V\}\_\{i\}中保留时间戳的几个干预事件Eik E\_\{i\}^\{k\}进行掩蔽,并以打乱列表的形式提供给智能体。智能体必须将每个事件插回其原始位置。**就诊排序**评估就诊级别排序:提供五个打乱的就诊摘要N∈MN\(i,i\+5\) N\\in\\mathcal\{M\}\_\{N\}^\{\(i,i\+5\)\},其时间戳被移除,必须仅凭临床进展线索排序。**联合排序**评估整合能力:将五次就诊拆分为十个入院/出院片段。智能体必须正确配对同一就诊的片段并按时间顺序排列。
#### 2.2.3 长时程决策
该任务评估智能体在长期历史上下文下的下一步规划能力,是一种更全面的评估。从Vn \\mathcal\{V\}\_\{n\}中采样一个真实事件EiGT E\_\{i\}^\{GT\},并将智能体的上下文记忆定义为其工作上下文S S。同时提供长时程笔记或事件记忆作为参考M M。在生成问题Q Q时,我们随机选择以下三种子任务格式之一:**下一步动作预测(T3-N)**要求智能体预测aiGT a\_\{i\}^\{GT\},**参数预测(T3-A)**评估对piGT p\_\{i\}^\{GT\}的推断,**出院决策(T3-D)**询问患者是否可以在6小时内出院。对于两个**预测**任务,如图2 (https://arxiv.org/html/2607.09322#S2.F2)所示,应用时间衰减评分机制来识别动作E24h \\mathcal\{E\}\_\{24h\},即在tiGT t\_\{i\}^\{GT\}后24小时内发生的事件。与之前的任务不同,相似文章
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
长期历史感知的医疗对话合成与评估
本文介绍了一种利用大语言模型(LLMs)合成长期医疗对话数据集的框架,并创建了 MediLongChat,包含三个基准任务,用于评估医疗智能体的记忆与推理能力。实验表明,即使是最先进的 LLMs 也难以完成这些任务。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
MedCUA-Bench:面向临床计算机操作智能体的截图型基准测试
MedCUA-Bench是一个新的基准测试,用于评估计算机操作智能体在临床软件任务上的表现,涵盖10个医学领域的18个场景,并包含安全维度。结果显示,当前智能体表现不佳,尤其在真实OpenEMR上,凸显了可靠性方面的显著差距。