同一患者,不同医嘱:重复运行下临床LLM智能体的行为级可靠性
摘要
本研究通过重新运行具有相同输入的任务并比较医嘱,考察了临床LLM智能体的行为级可靠性,发现了基准测试可能忽略的显著分歧,并提出了增强的评估方法。
arXiv:2609.13582v1 Announce Type: new
摘要:临床代理基准测试可以在相同输入上报告相同的结论,而代理在每次运行中提交实质上不同的医嘱。此类代理会开具检查、请求药物和放置转诊,而基准测试通常对每个任务只评分一次运行,很少询问相同输入是否产生相同行为;我们使用的基准测试MedAgentBench对单次尝试进行评分,并说明如此。为了衡量这一差距,我们引入了“相同输入重运行”,它重放任务时所有输入保持固定,并比较医嘱而非分数,使用六个可靠性指标,并将其应用于来自其五个可写家族的50个任务中的1000次MedAgentBench运行,涉及两个参数低于100亿的开放权重模型,量化到4位,以及两个温度。研究证实行为级分歧存在,并且可能未被分数记录,但并未证明任何比率具有普遍性。在8B模型温度0.7下,所有43个医嘱组在五次相同运行中发出不同的医嘱集,26组在某些运行中发出医嘱而在其他运行中不发出,28组记录了不同的编码值、剂量或分析物。在这43组中的22组,基准测试对实质上不同的行为报告了相同的失败结论,正如它对4B模型在0.7温度下的所有10个分歧组所做的那样。医嘱在不同运行中也到达不同的端点,其中一个被记录服务器拒绝,而代理被告知成功。这些发现促使在临床代理基准测试中进行重复运行评估、行为级稳定性报告和执行忠实的环境反馈。
查看缓存全文
缓存时间: 2026/09/15 08:36
# 临床LLM智能体在重复运行下的行动级可靠性 来源:https://arxiv.org/html/2609.13582 \\mlhtrack proceedings\\jmlrauthorsBellibatlu, Singh, Han and Zhang ## 相同患者,不同操作:临床LLM智能体在重复运行下的行动级可靠性 Manpreet Singhhttps://orcid.org/0000-0003-2368-23772 Zhoutian Han3 and Wenbin Zhanghttps://orcid.org/0000-0003-3024-54151 1 Florida International University, Miami, FL, USA 2 Boston University, Boston, MA, USA 3 Stevens Institute of Technology, Hoboken, NJ, USA \*通讯作者:[rohithreddybc@gmail\.com](mailto:[email protected]) ###### 摘要 一个临床智能体基准测试可能对相同输入报告相同的判定结果,但智能体在每次运行中却提交了实质不同的医嘱。这类智能体会开具检查、请求用药和安排转诊,但基准测试通常仅对每个任务进行一次评分,极少质疑相同输入是否产生相同动作;我们使用的MedAgentBench基准测试也仅评分一次尝试并说明了这一点。为衡量这一差距,我们引入了*相同输入重运行*,即在固定所有输入的情况下重放任务,并比较医嘱而非评分,同时采用六个可靠性指标,并将其应用于来自其五个可写能力族、涵盖50个任务的1000次MedAgentBench运行,使用两个低于100亿参数、量化至4位的开源权重模型,以及两种温度设置。本研究证实了行动级差异的存在,且这种差异可能因评分机制而未被记录,但并未表明任何差异率具有普遍性。在8B模型、温度0.7的设置下,所有43个医嘱组在五次相同运行中均产生了不同的医嘱集,其中26组在某些运行中发出医嘱而其他运行则没有,28组记录了不同的编码值、剂量或分析物。在这43组中的22组中,基准测试对实质不同的行为报告了相同的失败判定,4B模型在0.7温度下的所有10个差异组也是如此。此外,医嘱在不同运行中到达不同的终点,其中有一次记录服务器拒绝了医嘱,而智能体却被告知成功。这些发现为临床智能体基准测试中采用重复运行评估、行动级稳定性报告以及执行环境忠实反馈提供了动机。 ††proceedings:: 预印本 ###### 关键词 临床智能体,评估可靠性,基准设计,运行间变异性,电子健康记录,可复现性 ### 数据与代码可用性 测试框架、分析代码、环境复现脚本以及所有1250条运行记录(包括网格和八位版本)均位于https://github.com/rohithreddybc/clinical-agent-action-reliability。同一提交的匿名只读镜像托管于https://anonymous.4open.science/r/clinical-agent-action-reliability;两者文件树完全相同,因此任一地址均可访问该成果。记录包含完整转录文本,因此本文所有数据均可通过所提供的脚本重新计算。患者记录来自MedAgentBench本身,其作者将其描述为来源处已去标识化、时间戳已扰动、标识符已重新生成的真实病例(Jiang等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib1))。我们仅发布了环境返回到转录文本中的内容,未发布记录存储或任何超出此范围的患者数据,因为运行记录必须保留这些内容才能对智能体行为进行审计。 ### 机构审查委员会(IRB) 我们未收集任何数据。这些记录是随MedAgentBench分发的,其作者报告称在来源处已去标识化,时间戳已扰动,标识符已重新生成(Jiang等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib1))。我们以该形式接收数据,未尝试重新识别,且在本地进行计算,因此本研究是对现有去标识化数据集的二次分析,而非涉及人类受试者的研究,故未申请IRB审查。 ### AI工具使用 研究问题、研究设计、第4节(https://arxiv.org/html/2609.13582#S4)的六项指标定义以及本文提出的所有主张均为作者之责,作者对内容承担全部责任。在这些规范指导下,一名AI助手实现了大部分测试框架和分析代码。该工作经过验证而非直接信任:所有数字均通过已发布脚本从运行记录重新生成,自动化检查会重新推导每个表格,若手稿与之不符则会失败,并且作者手动对照FHIR载荷重新推导了指标定义,并确认了每个差异计数和p值。 一个任务,一位患者,固定输入 运行3 运行2 运行1 运行4 运行5 ∙\\bullet∙\\bullet∘\\circ∙\\bullet–∙\\bullet 发往类型化端点的医嘱 ∘\\circ相同医嘱,其他端点 –完全没有医嘱 将五次运行相互比较 医嘱:相同载荷、相同端点、是否均已发出? 轨迹:运行首次出现差异在哪个回合? 判定:基准测试的通过/失败是否改变? 图1:重运行方案及示例结果。输入固定,因此运行间的任何差异归因于智能体,且三个比较层在实践中是分离的。 ## 1 引言 临床语言模型智能体不再仅仅是回答问题。它们检索患者数据、开具检查、起草处方,并向记录系统发出写入请求(Jiang等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib1); Ferber等人, 2026 (https://arxiv.org/html/2609.13582#bib.bib3); Liu等人, 2026 (https://arxiv.org/html/2609.13582#bib.bib4)),基准测试也随之进入了交互式环境(Schmidgall等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib2))。然而报告惯例并未跟上:这些基准测试报告的是准确率,且大多基于每个任务的一次运行。对于问答任务,其代价是精确性,这已被记录在案,因为对相同项目重复评估相同模型会产生不同的分数,基于单次运行的排名在复现时会被推翻(Atil等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib5); Madaan等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib6); Alvarado Gonzalez等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib8))。 对于开具医嘱的智能体,有其他问题被忽略了。准确率记录的是智能体是否正确,而非是否一致,而基准测试通常只报告其中之一。同样的反对意见也针对静态临床决策支持提出过,这类系统仅通过一个综合数字通过评估,该数字无法说明其在变化下的可靠性(Bellibatlu等人, 2026b (https://arxiv.org/html/2609.13582#bib.bib15))。智能体继承了这个问题,并增加了一个自身的问题,因为它们产生的是动作。 本文衡量的是行为一致性。我们选取建立在符合FHIR的记录环境上的临床智能体基准测试MedAgentBench(Jiang等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib1)),并在固定每个输入的情况下,将每个任务重放五次。我们不询问判定是否改变,而是比较智能体实际做了什么:它发布了哪个资源,发布到哪里,以及是否发布了任何内容。我们的提议直接由此而来:即临床智能体基准测试应重运行每个任务并报告动作改变的频率,在准确率之外报告行动级稳定性度量,并且其环境应像记录服务器那样应答,而非仅仅确认解析通过。 实现这一点比简单地多次重跑基准测试更难,三个困难塑造了后续一切。(i)判断两次医嘱何时相同。文本上不同的运行可能在临床上完全相同,因为时间戳、工作流状态字段以及查询参数的顺序都会变化而医嘱本身不变。比较原始转录会夸大差异,而仅比较判定则会抹除差异,因此需要一套规则来判断两次请求何时是同一份医嘱,规则内的每个选择都会改变数字。(ii)判断环境从未执行的动作。MedAgentBench解析智能体的写入请求,回复说成功,但并不真正写入,因此在一次运行内无法区分记录服务器会创建的医嘱和会拒绝的医嘱;要确认这一点,需要离开基准测试循环,将请求直接提交给服务器。(iii)报告一个在产生它的研究之外仍有意义的比率。在五次重运行上测量的比率不等于三次上的比率,从不下医嘱的组必须被排除在分母之外,而剩下的组并非独立。第4节(https://arxiv.org/html/2609.13582#S4)、第6节(https://arxiv.org/html/2609.13582#S6)和第7节(https://arxiv.org/html/2609.13582#S7)将依次处理这些困难。 以下三项发现随之而来。行动级差异出现在我们测量的每个分支中,并且在我们测试的两个模型中,医嘱集差异和遗漏都随解码温度升高而增加。机制往往是机械性的:医嘱被路由到一个会拒绝它的端点,或者在格式错误的载荷和失败的重试后丢失。但也并非总是如此。在大模型的采样分支中,43个医嘱组中有28组在相同运行中记录了不同的编码值、剂量或分析物,这是任何路由或解析机制都无法解释的。而且在那些下达医嘱的任务中,判定的改变频率在每个分支中都低于医嘱的改变频率。 综合来看,这些构成了设计和报告临床智能体基准测试的一种方法,而不仅仅是此处实现的代码。一个方案。相同输入重运行将评估单元定义为一个任务组的多次重运行,而非一次尝试,并将任何行动级比率所引用的分母定为医嘱组(第4节 (https://arxiv.org/html/2609.13582#S4))。一个位于判定之下的测量层。六个可靠性指标,四个读取医嘱本身,两个读取产生它的运行,每个指标均可从基准测试已保存的转录文本计算,其中一个指标以不依赖于购买重运行次数的形式报告。匹配的证据。区间估计和对匹配组的精确配对检验,跨家族的聚类自举(第7节 (https://arxiv.org/html/2609.13582#S7)),以及一个指标是与记录服务器而非我们自己的转录文本核对(第6节 (https://arxiv.org/html/2609.13582#S6))。 ## 2 背景 ### 语言模型评估中的方差 Atil等人(2024)(https://arxiv.org/html/2609.13582#bib.bib5)报告了被配置为确定性的模型在多次运行中的准确率变化,Yuan等人(2025)(https://arxiv.org/html/2609.13582#bib.bib7)将其部分追溯到批处理大小变化下的浮点数非结合性。Madaan等人(2024)(https://arxiv.org/html/2609.13582#bib.bib6)指出何时差异是有意义的,Alvarado Gonzalez等人(2025)(https://arxiv.org/html/2609.13582#bib.bib8)发现基于单次运行的排行榜频繁地颠倒成对排名,证明了重复评估的必要性,Potamitis等人(2025)(https://arxiv.org/html/2609.13582#bib.bib9)描述了推理系统的方差结构,而Mustahsan等人(2025)(https://arxiv.org/html/2609.13582#bib.bib10)将组内相关系数应用于通用基准测试上的智能体评估。 ### 医学中的可重复性 关于此问题的临床研究比智能体文献更为深入。可重复性已在基于病例分析的考试中(Krishna等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib18))、非结构化临床笔记中(Shah, 2024 (https://arxiv.org/html/2609.13582#bib.bib20))以及执照考试和罕见病项目中得到测量,其中Shyr等人(2025)(https://arxiv.org/html/2609.13582#bib.bib11)区分了可重复性和可复现性,Gürses等人(2026)(https://arxiv.org/html/2609.13582#bib.bib12)报告称单次试验的准确率隐藏了波动性和稳定的系统误差。最接近具有后果的决策的是,Franc等人(2024)(https://arxiv.org/html/2609.13582#bib.bib19)对一个分配急诊分诊级别的商用模型衡量了这两者。 ### 缺失的部分 所有这些医学研究都对单轮输出进行评分:考试答案、分诊级别、笔记摘要。差距不仅仅在于没有一个研究重运行智能体基准测试;而在于一致率和组内相关系数描述的是一个标量或字符串,而不是一份被发送到错误端点或根本未被发出的医嘱。有几项研究更接近。passk\\mathrm\{pass\}^\{k\},即一个任务所有k次试验都成功的概率(Yao等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib23)),对最终状态进行评分;Gupta(2026)(https://arxiv.org/html/2609.13582#bib.bib25)将其与故障注入配对,Liu等人(2026)(https://arxiv.org/html/2609.13582#bib.bib4)将这个判定级的理念应用于临床智能体。Yagubyan(2026)(https://arxiv.org/html/2609.13582#bib.bib24)确实触及了调用层面,询问智能体在相同调用下是否选择相同的工具和参数,但超出了医学领域。最接近的是,Mokssit等人(2026)(https://arxiv.org/html/2609.13582#bib.bib26)对每个任务重运行临床FHIR沙箱三次,并将写入操作在可重置的服务器上执行,但他们的运行间变异是针对任务成功与否:载荷和字段值从未被比较过。没有一项研究比较的是相同运行下的医嘱本身:它的载荷、它的目的地以及返回给它的判定。第4节(https://arxiv.org/html/2609.13582#S4)定义了四个做到这一点的行动级量,第7节(https://arxiv.org/html/2609.13582#S7)对它们进行了测量。 同样的转变,即从评判智能体说什么到评判它做什么,已被用于公平性论证(Morla等人, 2026 (https://arxiv.org/html/2609.13582#bib.bib16));可靠性尚未得到同等对待。自动评判也会因重新措辞的提示而改变(Bellibatlu等人, 2026a (https://arxiv.org/html/2609.13582#bib.bib17)),尽管我们的评分器是固定参考实现而非模型,而相邻工作发现临床智能体在未察觉患者身份错误的情况下行动(Klang等人, 2026 (https://arxiv.org/html/2609.13582#bib.bib22)),基准测试分数与部署行为存在偏差(Agrawal等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib13); Mehandru等人, 2024 (https://arxiv.org/html/2609.13582#bib.bib14))。 ## 3 环境 ### MedAgentBench MedAgentBench(Jiang等人, 2025 (https://arxiv.org/html/2609.13582#bib.bib1))提供了来自十个家族的300个临床衍生任务,一个符合FHIR的记录服务器(其作者称包含约一百名患者的记录),以及一个智能体发出GET和POST请求并以FINISH结束的文本协议。五个家族可能涉及写入:一个记录观察结果,一个放置服务请求,三个取决于实验室值或其时间,其中三个中的一个将药物与服务请求配对。在条件性家族中,有时不医嘱是正确的,因此一个组可能在没有写入的情况下通过,但由于输入在组内是固定的,正确答案在五次运行中是相同的。我们使用所有五个家族,因为仅在它们中存在可能产生差异的动作。 第二个版本(Chen等人, 2026 (https://arxiv.org/html/2609.13582#bib.bib21))修订了智能体框架但保留了环境不变:一个新的系统提示、少样本示例、记忆以及允许智能体无需手动构建HTTP请求即可行动的工具,使用GPT-4.1达到了91%的成功率。我们的测量使用原始框架,第9节(https://arxiv.org/html/2609.13582#S9)说明了这意味以及不意味着什么。记录服务器以容器镜像形式发布;由于缺乏容器运行时,我们从注册表中拉取了层并运行了提取的HAPI F
相似文章
LLM代理的一致性如何?在多步骤工具调用流程中测量行为可重现性
本文系统性地测量了LLM代理在多步骤工具调用流程中的行为可重现性,涉及1140条轨迹,发现了'结构一致性,参数变异性'的模式:代理可靠地按相同顺序选择工具,但参数有所不同,并且结构一致性能够预测任务的成功。
多步骤临床LLM代理的反事实公平性审计需要测量每动作不稳定性的下限
本文证明,对于多步骤临床LLM代理的反事实公平性审计,需要测量每动作不稳定性下限以准确解释翻转率,因为固有的异质性可能掩盖人口统计学差异。
RealICU:大型语言模型代理是否能理解长上下文ICU数据?一个超越行为模仿的基准测试
RealICU是一个事后标注的基准测试,用于评估ICU场景中的大型语言模型(LLM),涵盖四个由医生驱动的任务。实验表明,现有LLM在回忆-安全权衡和锚定偏差方面存在困难,而一种新的结构化记忆代理改善了推理能力,但未能完全消除安全故障。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
面向时间干预下个人LLM智能体的用户条件化评估
本文认为,评估个人LLM智能体需要跨不同的用户条件化状态重放时间干预,并指出现有基准中的空白。它提出了一个最小基准设计和用于用户条件化适应的报告指标。