多步骤临床LLM代理的反事实公平性审计需要测量每动作不稳定性的下限

arXiv cs.CL 论文

摘要

本文证明,对于多步骤临床LLM代理的反事实公平性审计,需要测量每动作不稳定性下限以准确解释翻转率,因为固有的异质性可能掩盖人口统计学差异。

arXiv:2609.03221v1 公告类型:新 摘要:反事实审计是检查临床代理是否对人口统计学不同但临床相同的患者区别对待的标准工具。它们报告翻转率:仅当患者描述符改变时,动作改变的频率。我们表明,这个量本身是不可解释的。在十六个情景上重新运行相同的条件十次(相同叙述,相同描述符字符串,无变化),在8.7%的结果-情景单元中移动了临床代理的动作,并且不稳定性在动作之间异质性高达八倍,从ICU升级的0.022到受控物质谨慎的0.179。我们数据中没有人口统计学对比可以与该下限区分开来。第二个模型给出了6.7%的汇总下限,并且几乎相同地排列了六个动作(Spearman 0.94,精确p=0.017),所以下限不是一个系统的产物。五次抽样的多数投票聚合去除了39%的它然后趋于平坦,一个空模拟将残差归因于异质的单元格速率,所以复制减轻但不消除。因此,任何没有附带每动作下限报告的反事实公平性估计都不能被解读为差异的证据。测量是用FairMedAgent进行的,这是一个用于评估临床LLM代理动作中差异的评估工具,其估计量,范围内反事实翻转率,只计算在已发布决策规则允许且临床医生已裁决的动作之间的翻转。那个估计量需要频段裁决,正在进行中;这里没有声称差异结果。每个合成情景在固定形式条件下运行六阶段轨迹(五个模型面对决策围绕确定性环境步骤),涵盖种族、性别、年龄、保险、英语熟练程度及其交叉点。该工具、下限协议和每个分析脚本都已发布。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:56

# 多步临床LLM智能体的反事实公平性审计需要可衡量的单步行为不稳定性下限
来源:https://arxiv.org/html/2609.03221
Manpreet Singh, Deepak Parashar† 和 Rahul Joshi††
††注:手稿于2026年8月29日提交。
*(通讯作者:Deepak Parashar)。*
R. R. Bellibaltu 和 M. Singh 共享第一作者署名。R. R. Bellibaltu(ORCID 0009-0003-6083-0364)隶属于佛罗里达国际大学(电子邮箱:[email protected])。M. Singh(ORCID 0000-0003-2368-2377)隶属于波士顿大学,地址:美国马萨诸塞州波士顿 02215(电子邮箱:[email protected])。Rahul Joshi 隶属于Symbiosis国际大学(电子邮箱:[email protected])。Deepak Parashar 隶属于曼帕拉理工学院,曼帕拉高等教育学院,印度曼帕拉([email protected])。本工作未获得特定资金支持。代码和协议的可用性在“数据与代码可用性”部分说明。本工作已提交给 IEEE 以供可能的出版。版权可能在无通知的情况下转移,此后本版本可能无法访问。

###### 摘要
反事实审计是检查临床智能体是否对人口学特征不同但临床表现相同的患者采取不同对待的标准工具。它们报告一个翻转率:仅当患者描述符改变时,行动发生变化的频率。我们表明,这个数值本身是无法解释的。在16个临床情景(相同叙述,相同描述符字符串,无任何变化)下重复运行完全相同的条件十次,有8.7%的结果-情景单元格中临床智能体的行动发生了变化,且行动之间的不稳定性存在异质性,其差异可达八倍,从ICU升级行动的0.022到受管制物质警示行动的0.179。我们数据中没有任何人口学对比能与该下限区分开来。第二个模型给出了6.7%的合并下限,并且对六个行动的排序几乎完全相同(斯皮尔曼相关系数0.94,精确p=0.017),因此该下限并非某个系统的特例。五次抽取的多数投票聚合消除了其中的39%,之后趋于平稳,零模拟将残余归因于单元格间的异质性速率,因此重复抽样可以缓解但不能消除该问题。因此,任何未附带单步行为下限的反事实公平性估计都不能被视为存在差异的证据。测量是使用FairMedAgent进行的,这是一个评估临床LLM智能体行动差异的评估工具集,其估计量是范围内反事实翻转率,仅计算在已发布决策规则允许且临床医生已裁决的行动之间的翻转。该估计量需要行动带裁决,相关工作正在进行中;本文未声称存在差异结果。每个合成情景在固定形式条件下运行一个六阶段轨迹(围绕确定性环境步骤的五个面向模型的决策),条件涵盖种族、性别、年龄、保险、英语熟练程度及其交叉组合。该工具集、下限协议和所有分析脚本均已发布。

###### 索引词:智能体AI,临床决策支持,大型语言模型,算法公平性,健康公平,反事实评估,测量有效性,不稳定性下限,可重复性,基准,FairMedAgent,可信AI。

## I 引言
临床护理中的人口学差异已有充分记录且影响深远:黑人患者在同等疼痛下获得的镇痛较少[1 (https://arxiv.org/html/2609.03221#bib.bib12), 2 (https://arxiv.org/html/2609.03221#bib.bib13)],种族和性别会影响心导管检查的建议[3 (https://arxiv.org/html/2609.03221#bib.bib14)],英语熟练程度有限的患者会经历更多不良事件[4 (https://arxiv.org/html/2609.03221#bib.bib15)]。随着大型语言模型进入临床决策支持领域,它们有可能再现这些差异:LLM传播基于种族的医疗误解[5 (https://arxiv.org/html/2609.03221#bib.bib8)],生成刻板印象的评估和计划[6 (https://arxiv.org/html/2609.03221#bib.bib6)],并在临床内容固定的情况下根据社会人口学标签改变护理建议[7 (https://arxiv.org/html/2609.03221#bib.bib5)]。临床AI正在从单一响应助手转变为在人类定义的约束下自主规划、调用工具并采取连续行动的*智能体*系统[8 (https://arxiv.org/html/2609.03221#bib.bib21)]。在这类系统中,潜在危害的根源在于*行动*(分配的紧急程度、订购的检查、选择的药物、记录的处置),某一步引入的偏差可能传播并与后续步骤复合。然而,现有的公平性审计评估的是单一模型响应,而现有的临床智能体基准是为衡量能力而构建的(第II节 (https://arxiv.org/html/2609.03221#S2))。两者均未携带可接受行动带,因此都无法区分两个合理的临床选择之间的变化与变为错误选择的变化,也未提供可重用的基础设施来审计这种区别。本文报告的测量是使用FairMedAgent进行的,这是一个评估多步临床LLM智能体行动中人口学公平性的评估工具集,我们将其随测量结果一同发布。它渲染合成情景,其可接受行动带源自已发布的决策规则,并由盲法临床医生裁决(第IV-B节 (https://arxiv.org/html/2609.03221#S4.SS2)),置于固定形式的反事实人口学条件下,保持临床内容冻结,且工具结果固定与条件无关,使得任何差异可归因于人口学描述符(第III-B节 (https://arxiv.org/html/2609.03221#S3.SS2) 阐述了返回结果也相同的条件)。它报告反事实翻转率、平均绝对评分差异和一个将人口学敏感性与临床错误分离的标题性*范围内*差异。我们的贡献包括:
- • 一个可测量的不稳定性下限,以及证据表明反事实翻转率在没有下限的情况下无法解读。在4320次比较中,重复运行完全相同的条件使智能体的行动在8.7%的结果-情景单元格中发生了移动,且不稳定性在行动间存在强烈异质性:升级至重症监护的行动在其720次比较中移动了2.2%,而受管制物质警示标志移动了17.9%。第二个模型给出了6.7%的合并下限,并且对六个行动的排序几乎完全相同。五次抽取的多数投票聚合消除了不到一半的下限并趋于平稳,零模拟将残余归因于单元格间的异质性速率,而非其他因素。我们提供了协议、发布的脚本以及由此导出的四步流程(第V-B节 (https://arxiv.org/html/2609.03221#S5.SS2))。
- • 一个将偏差与临床错误分离的公平性估计量。现有的反事实审计评估行动是否发生了变化,混淆了两个合理的临床选择之间的变化与变为错误选择的变化。范围内反事实翻转率仅计算前者,其条件是两个人口学变体均落入已发布决策规则允许且盲法临床医生已裁决的行动带内。通用智能体行动公平性由AgentFairBench[9 (https://arxiv.org/html/2609.03221#bib.bib1)]引入,这是我们先前的一个通用领域基准,而单次决策临床审计针对单一输出[10 (https://arxiv.org/html/2609.03221#bib.bib2), 11 (https://arxiv.org/html/2609.03221#bib.bib3), 12 (https://arxiv.org/html/2609.03221#bib.bib4)];两者均未携带可接受行动带,因此均未表达此估计量。这是关于覆盖范围的主张,而非优先级主张,表I (https://arxiv.org/html/2609.03221#S2.T1)列举了各个维度。
- • 临床轨迹作为该估计量最重要的场景。行动带是按行动定义的,因此一个包含五个连续行动的会话有五个这样的行动带,范围内差异可以在没有任何单一决策错误的情况下累积。五个行动带提供了五个这样的机会,但这与确定其确实发生不同:独立的均值零偏移会相互抵消而非复合。累积要求各步骤偏移共享相同符号,因此我们报告一个轨迹层面的有符号复合指标与独立偏移可能产生的结果进行描述性对比,因为一个单一的情景潜变量在无任何前向传递的情况下重现了其最大值。识别出的估计量是强制上游对比,固定的阶段顺序通过让上游行动被*设定*而非观察,使之成为可能。我们首次贡献了映射到PROGRESS-Plus[13 (https://arxiv.org/html/2609.03221#bib.bib35)]的一级LEP和交叉性维度。
- • 可重现的基础设施。一个可通过pip安装的工具集,包含盲法多临床医生标注协议(完整规范;目前只有一位临床医生审查了草案行动带)、适合小型集群的统计方法,以及一个密封分割评估协议,附带参考排行榜实现和采用日志,在行动带裁决完成后发布,按TRIPOD-LLM[14 (https://arxiv.org/html/2609.03221#bib.bib28)]报告。

## II 相关工作
临床语言模型中的偏差。越来越多的工作记录了医学LLM中的人口学偏差:基于种族的医疗误解[5 (https://arxiv.org/html/2609.03221#bib.bib8)],来自GPT-4的刻板印象差异和建议[6 (https://arxiv.org/html/2609.03221#bib.bib6)],从编辑过的笔记中可检测到的种族及其对下游建议的影响[15 (https://arxiv.org/html/2609.03221#bib.bib9)],对抗性医学问答揭示的公平性危害[16 (https://arxiv.org/html/2609.03221#bib.bib7)],临床决策支持提示中的偏差[17 (https://arxiv.org/html/2609.03221#bib.bib10)],以及在推理模型中的持续性[18 (https://arxiv.org/html/2609.03221#bib.bib11)]。固定临床内容并交换受保护属性的反事实审计包括CLIMB的临床偏差指标[11 (https://arxiv.org/html/2609.03221#bib.bib3)],用于诊断的反事实患者变化[12 (https://arxiv.org/html/2609.03221#bib.bib4)],以及对LLM急诊分诊的单次决策性别互换审计[10 (https://arxiv.org/html/2609.03221#bib.bib2)]。最接近的是,Omar *等人*[7 (https://arxiv.org/html/2609.03221#bib.bib5)]在1000个急诊案例中改变31个社会人口学标签(保持临床内容不变),并发现紧急程度、影像学和精神健康转诊方面存在系统性差异。这些研究确立了偏差的存在;但每项研究评估的是*单一*生成的建议或决策。
智能体与基准基础设施。另一条并行的研究路线构建临床智能体和基准平台:AgentClinic模拟临床环境[19 (https://arxiv.org/html/2609.03221#bib.bib16)],MedAgentBench对电子健康记录工具使用智能体进行基准测试[20 (https://arxiv.org/html/2609.03221#bib.bib17)],DRAGON[21 (https://arxiv.org/html/2609.03221#bib.bib18)]、MedS-Bench[22 (https://arxiv.org/html/2609.03221#bib.bib19)] 和 MedHELM[23 (https://arxiv.org/html/2609.03221#bib.bib20)]提供了临床能力排行榜。这些衡量的是*准确性/能力*。行动中的人口学差异超出了其构建的检测范围。
定位。我们自己的AgentFairBench[9 (https://arxiv.org/html/2609.03221#bib.bib1)]最近对非临床和分诊领域的通用智能体行动公平性进行了基准测试,而面向能力的临床智能体基准则衡量准确性。这两条路线均未提供可接受行动带,而没有它,本文所构建的区分就无法实现(表I (https://arxiv.org/html/2609.03221#S2.T1))。我们的主要贡献是*范围内*差异,这是一个以所有变体共同临床可接受为条件的公平性估计量。像Omar *等人*[7 (https://arxiv.org/html/2609.03221#bib.bib5)]这样的单一建议设计无法表达它,因为它们没有可接受行动带来区分人口学敏感性和临床错误。我们精确界定了该主张的范围:该估计量本身*不*要求多步骤,一次单一回合审计若引发一个行动并根据行动带评分也能表达它。轨迹增加的价值在于行动带是按行动定义的,因此差异可以在一次就诊中累积,并且固定的阶段顺序使上游行动可被操纵。我们进一步贡献了一级LEP和交叉性维度、镇痛和文档记录行动域、污染警戒指标和跨步传播,并将分诊和诊断排序(两者均已被单次回合研究过)视为在智能体设置中的复现,在此设置中早期的翻转可能约束后续行动。密封分割排行榜是*基础设施*,用于将范围内差异的持续测量操作化;我们并未将其作为独立的新颖性呈现(排行榜本身已确立[21 (https://arxiv.org/html/2609.03221#bib.bib18), 22 (https://arxiv.org/html/2609.03221#bib.bib19), 23 (https://arxiv.org/html/2609.03221#bib.bib20)])。
可信性与保障。关于自主临床智能体的工作越来越多地围绕安全性、与人类定义的约束对齐以及问责制来构建[8 (https://arxiv.org/html/2609.03221#bib.bib21), 24 (https://arxiv.org/html/2609.03221#bib.bib34)]。FairMedAgent将这些概念操作化:临床医生定义的可接受行动带编码了人类约束,范围内差异旨在衡量在这些约束下的对齐程度,采用日志支持问责制:这是NIST AI风险管理框架 (AI RMF)[24 (https://arxiv.org/html/2609.03221#bib.bib34)]和TRIPOD-LLM[14 (https://arxiv.org/html/2609.03221#bib.bib28)]等框架所呼吁但尚未为智能体行动提供的保障测量基础设施。
表I:反事实和临床智能体评估的代表性先前工作,最后一列是本文所关注的维度。“–”表示该维度不是该工作的设计目标,因此这不是能力排名。智能体:多步、携带状态、使用工具的智能体;CF:反事实人口学设计;LEP:有限英语熟练程度维度;Int:对命名的交叉单元格的分解估计;Real:评估真实患者而非合成案例(先前工作领先而本文不涉及的一个维度);Floor:报告在同一运行中,对相同行动、相同案例的测量不稳定性下限。✓ = 是,~ = 部分,– = 否;每个标记记录该工作发表的内容。先前没有临床模型的反事实审计报告下限,这是本文所解决的缺口,而非这些研究的缺陷:该量化对他们而言不可用,且其大小未知。进行这些测量的基准工具集,包括范围内估计量,在第III节 (https://arxiv.org/html/2609.03221#S3)中描述;其结果有待行动带裁决,本文未作声称。

## III 基准设计
### III-A 问题形式化:智能体*行动*中的差异
先前的临床语言模型审计评估的是单一生成的响应:鉴别诊断、答案或一条建议[7 (https://arxiv.org/html/2609.03221#bib.bib5), 6 (https://arxiv.org/html/2609.03221#bib.bib6), 16 (https://arxiv.org/html/2609.03221#bib.bib7), 5 (https://arxiv.org/html/2609.03221#bib.bib8)]。部署中的决策支持越来越多地做的是其他事情。它作为一个多步*智能体*运行,规划、调用工具……

相似文章