考察多智能体医疗系统在临床推理中对人为干预的脆弱性
摘要
本文探讨了人为干预在多智能体医疗系统中的故障点如何影响诊断准确性,正确干预可提高准确性,错误干预则会导致性能下降。
arXiv:2609.02191v1 Announce Type: new
摘要:在故障点的人为干预可以改变多智能体医疗系统的诊断准确性。我们将故障点定义为AI代理对话中最容易受到外部影响的时刻。使用MedQA数据集,本研究分析了模拟的医患对话,以衡量干预如何改变推理和准确性。正确的干预方法显示基线诊断准确性提高了最多40%,而错误或偏差相关的干预使性能下降了最多6%,并增加了诊断漂移和不确定性。除了性能变化外,我们的分析还揭示了模拟代理环境中的认知偏差与真实临床实践中的行为相似性。例如过早闭合和易受误导线索的影响。总体而言,这些发现表明,通过人为干预识别和引导故障点,可能为提高多智能体医疗系统的诊断鲁棒性提供一种机制。
查看缓存全文
缓存时间: 2026/09/03 06:02
# 探究多智能体医疗系统对临床推理中人为干预的脆弱性 来源:https://arxiv.org/html/2609.02191 \\workshoptitle Scaling Environments for Agents \(SEA\) Benjamin Liu††thanks:这些作者对本文贡献相等,均为第一作者\.Dillon Mehta11footnotemark:1 附属机构:乔丹高中 邮箱:[dillonamehta@gmail\.com](mailto:) Rishi Malhotra 附属机构:加州大学圣地亚哥分校 邮箱:[rimalhotra@ucsd\.edu](mailto:) Adam Zobian 附属机构:温彻斯特高中 邮箱:[adamzobian@gmail\.com](mailto:) Yong Ying Tan 附属机构:詹姆斯·洛根高中 邮箱:[yongying\.tan@sjsu\.edu](mailto:) Samir Chopra 附属机构:罗格斯大学 邮箱:[sc2364@rutgers\.edu](mailto:) Daniella Rand 附属机构:富山–德安扎学院 邮箱:[20578504@fhda\.edu](mailto:) Natalie Pang 附属机构:福特汉姆大学 邮箱:[np47@fordham\.edu](mailto:) Abhiram Gudimella 附属机构:查普曼大学 邮箱:[gudimella@chapman\.edu](mailto:) Kevin Zhu 附属机构:加州大学伯克利分校 邮箱:[zhu502846@berkeley\.edu](mailto:[email protected]) 附属机构: ###### 摘要 人为在故障点的干预能够改变多智能体医疗系统的诊断准确性。我们将故障点定义为AI智能体对话中其推理最易受到外部影响的关键时刻。本研究使用MedQA数据集,分析了模拟的医患对话,以量化干预措施如何改变推理过程和准确性。正确的干预方法可使基线诊断准确率提升高达40%,而错误或带有偏见的干预则会使性能下降高达6%,并增加诊断漂移和不确定性。除性能变化外,我们的分析还揭示了模拟智能体环境中的认知偏差与现实世界临床实践中的行为相似性,例如过早下结论以及易受误导性线索的影响。总体而言,这些发现表明,通过人为干预识别和引导故障点,可能为提升多智能体医疗系统的诊断稳健性提供一种机制。 ## 1 引言 临床AI研究的核心目标之一是开发能够在复杂诊断环境中进行协作推理的系统Shang et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib18)。传统的单智能体模型往往难以捕捉现实医疗保健中固有的跨学科交互,导致决策出现错误和不一致Zhu et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib22)。多智能体框架通过模拟协作工作流来解决这些限制,其中智能体代表专门的角色,如患者、初级保健医生和诊断解读员。Feng et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib19);Zhu et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib22);Kim et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib17)。 多轮大语言模型(LLMs)通过维持跨连续对话轮次的上下文来模拟诊断交互,使推理能够随着新信息的引入而演进Schmidgall et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib6)。虽然单智能体系统可以执行多轮推理,但它们在验证或修改输出的能力方面仍然有限,并且无法揭示哪些对话点对决策影响最大Tang et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib1)。多智能体扩展通过建模协作动态来缓解这一限制,能够对推断进行交叉验证,并捕捉错误、偏见和启动线索的传播方式Li et al\. \(2023\) (https://arxiv.org/html/2609.02191#bib.bib20)。通过模拟临床工作流,多智能体系统为研究顺序上下文如何影响临床结果和决策可靠性提供了一个受控环境Rajan and Arango \(2025\) (https://arxiv.org/html/2609.02191#bib.bib24)。 基础模型如GPT-4越来越多地应用于医疗任务,包括诊断推理、治疗计划、患者教育和临床文档记录Li et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib21);Li et al\. \(2023\) (https://arxiv.org/html/2609.02191#bib.bib20)。然而,它们仍然容易受到偏见、幻觉和错误传播的影响,如果未加控制,会损害患者护理Schmidgall et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib7)。 为解决此问题,我们引入了故障点:关键的对话时刻,其中微小的启动线索会不成比例地影响结果。识别和分析这些点有助于了解模型的局限性以及制定更可靠、更符合临床的推理策略。先前的工作记录了在单智能体LLMs中,当早期信息具有误导时,会出现级联错误Cabitza et al\. \(2017\) (https://arxiv.org/html/2609.02191#bib.bib23);Rajkomar et al\. \(2018\) (https://arxiv.org/html/2609.02191#bib.bib16)。然而,多智能体框架增加了复杂性:早期线索可以在多个智能体之间传播,放大其对集体结果的影响。识别这些故障点可以进行有针对性的干预,从而提高验证能力并减少错误,支持更安全的人机协作。这些故障点是提高可靠性和公平性的关键目标,特别是考虑到LLMs在诊断环境中已知会遵循启动线索Schmidgall et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib6)。通过绘制这些薄弱点,我们的工作提供了指导AI决策和提高临床交互信任度和可靠性的工具Tang et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib1)。研究这些漏洞有助于增进对多智能体推理的理解,同时为将AI嵌入以人为中心的工作流提供最佳实践指导Chen et al\. \(2025a\) (https://arxiv.org/html/2609.02191#bib.bib5)。 本研究通过系统调查故障点,旨在填补对多智能体诊断系统漏洞理解的空白。通过在医疗数据集和场景中映射它们,我们突出了多智能体推理中的时序和结构性弱点。我们的目标是为医疗领域的决策监控和指导提供洞见,为更可靠、更符合伦理的人机协作做出贡献。 ## 2 相关工作 近期的研究已开始探索AI驱动医疗诊断中偏见的影响,并对多智能体LLM框架日益关注。这些框架依赖于多轮LLM交互,其中智能体被设计为在扩展的交换过程中保持上下文并调整响应Li et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib10)。多智能体系统的目标是模拟从初始主诉到诊断推理的医患交互。先前的研究集中在偏差提示如何影响准确性,而未解决推理何时最容易受到扭曲的问题Schmidgall et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib6)。尽管这些框架已在临床领域进行测试,但它们缺乏人类监督,使得LLMs自主得出结论Liu et al\. \(2025\) (https://arxiv.org/html/2609.02191#bib.bib11)。相比之下,人在环路方法将人类监督、指导或反馈嵌入AI推理过程Wu et al\. \(2022\) (https://arxiv.org/html/2609.02191#bib.bib25);Tu et al\. \(2024\) (https://arxiv.org/html/2609.02191#bib.bib12)。我们的研究扩展了这项工作,通过将人类建议整合到多智能体模拟中,识别出医生智能体推理最容易受到改变的阶段,并研究这些阶段的推理动态。 ## 3 方法 ### 3.1 多智能体系统框架 我们使用一个多智能体系统来模拟临床环境。我们的框架使用五个智能体,它们都使用相同的LLM(GPT 4\.1),每个智能体在环境中都有其特定的角色。具体来说,我们配置了一个患者智能体、一个医生智能体、一个专科智能体、一个测量智能体和一个启动智能体。它们的角色在下文中进一步描述。 每个智能体通过对话轮次进行交流,这些轮次随后被保存并在下一个提示中共享。 - •患者智能体:呈现症状、描述病史并回答问题。 - •医生智能体:在与患者智能体进行10轮对话以及与专科智能体进行最多五轮对话的过程中进行评估。可以要求进行测试并提出澄清问题。将提供最终诊断。 - •专科智能体:与医生智能体沟通,并根据其自身专业知识给出分析。可以帮助纠正推理,而无需实际处理该病例。 - •测量智能体:检索诊断影像和实验室测试结果。 - •启动智能体:通过脚本化提示创建启动消息,根据正确诊断和病例背景,提供正确或错误的建议,可能附带或不附带推理过程。 一旦构建好智能体,患者智能体会获得完整的输入问题并返回其主诉。然后,医生智能体会根据患者智能体的主诉获得提示,并知道将与患者智能体进行10轮对话(患者阶段)。医生智能体可以随时要求进行测试,测量智能体将返回相应的测试结果。与患者智能体的交互完成后,医生智能体可以从各种专科中选择一个,并根据先前的对话和收到的测试进行提示。在五轮对话(专科阶段)中,专科智能体根据其从与患者智能体先前对话中理解的内容帮助纠正推理。在总共15轮对话中,启动智能体会创建一个独特的启动消息,要求医生智能体考虑基于正确诊断、对话历史和给定启动方法的特定专科或子类别。此消息在预定位置输入,位于医生智能体轮次之前。 医生智能体的目标是在专科轮次后提供最终诊断,或者如果医生智能体认为不需要与专科智能体交谈,则在患者轮次后提供最终诊断。 我们的多智能体模拟框架可在附录H (https://arxiv.org/html/2609.02191#A8)中找到。 ### 3.2 数据集与实现 为了使用我们的多智能体框架进行模拟,我们使用了MedQAJin et al\. \(2020\) (https://arxiv.org/html/2609.02191#bib.bib9)公共医学问答数据集。该数据集是开源的,以JSONL格式结构化,共包含214个病例。对于此数据集,每个病例通过从相关区域获取特定信息进行分解。例如,患者病史和症状有助于构建和指导患者智能体的提示和响应。同样,医生智能体由提及医生智能体初始目标的字段来指导。医生和测量智能体参考提供的诊断测试和结果,以确定可以请求哪些测试以及随后的分析。这确保了智能体不会被迫通过观察可能无关的症状或陈述来推断出正确答案。 正确诊断作为问题的地面真值,被启动智能体用于创建干预消息。它也用于评估和在定义故障点时的回顾性分析中。 ### 3.3 人为干预模拟 为了定义和展示在故障点进行干预的有效性,我们设计了一个系统,根据医生智能体的诊断准确性来定义故障点。医生智能体被要求在每一轮对话后附加其最佳可能诊断,使我们能够清晰地看到医生智能体随时间变化的推理思路。我们将故障点定义为患者或专科对话中的任何轮次,其中医生智能体当前诊断与先前诊断之间的余弦相似度处于所有轮次的底部10%。为了找到阈值和合格点,我们在没有启动干预的情况下,对MedQA数据集中的所有214个病例进行了回顾性分析。由此,确定了0.5462作为余弦相似度漂移分数的第10个百分位数基线。如果存在多个合格点,则使用分数较低的轮次。 基于此定义,为了研究在这些故障点进行干预的影响,我们利用启动智能体根据以下四种提示之一提供人为干预:正确子类别、错误子类别、带推理的正确子类别、带推理的错误子类别。用于创建这些干预措施的提示以及其他智能体的提示可在附录E (https://arxiv.org/html/2609.02191#A5)中找到。 我们使用了各种干预方法进行了消融实验。我们还研究了认知偏差对不同干预的影响,通过在故障点使用选定的九种认知偏差之一进行启动Dimara et al\. \(2020\) (https://arxiv.org/html/2609.02191#bib.bib8)。具体定义可在附录F (https://arxiv.org/html/2609.02191#A6)中找到,我们将这些偏差归类为以下组: - •假设评估:确认偏差、过早下结论、代表性启发式 - •估计:可得性启发式、锚定效应、过度自信 - •决策:遗漏偏差、现状偏差、沉没成本谬误 最后,进行了几项消融研究,以充分理解我们故障点框架中的每个组成部分。例如,在某些合格场景中,测试了两个和三个启动的故障点。另一个实验通过将故障点限制在患者阶段、专科阶段或两个阶段来运行。最后,我们通过测试当前诊断与地面真值之间的余弦相似度,研究了故障点的不同定义。 在所有实验中,我们将LLM的温度设置保持在0.05,最大令牌限制为200,以保持一致性并鼓励可重复性。这减少了运行之间的随机性,使得重复试验给出相同的诊断轨迹。由于计算由API处理,因此不需要本地GPU或集群资源。所有实验,包括所有消融研究,通过API调用大约需要30小时和150美元。 ### 3.4 指标与评估 我们使用了多个指标来评估智能体及其诊断的性能。主要使用的指标是**总体诊断准确性**,衡量医生智能体最终任务的性能。**前K准确率**也使用医生智能体的最终前K{1, 3, 5}诊断选项来衡量性能。准确性也用于通过干预场景准确性与基线场景(无启动智能体)准确性的差异来衡量启动智能体特定策略的性能。其他指标包括**要求的测试数量**,这可以提供关于信心和彻底性的洞见。最后,对专科智能体和医生智能体之间的对话历史进行了分析,以显示行为指标。这些代理指标包括可能的**过早诊断/结论**、**考虑的诊断**以及医生智能体与专科智能体之间的**不同意次数**。
相似文章
多轮多模态诊断推理在具有挑战性的真实临床案例上的评估
本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。
MedGuards:用于可靠医疗错误检测与纠正的多智能体系统
MedGuards 提出了一种多智能体框架,通过专门智能体和置信度引导的仲裁机制来检测和纠正医疗文本中的错误,无需额外训练即可提升可靠性。在多语言临床记录上的实验表明,该框架带来了显著改进。
智能体捕捉智能体:临床多智能体系统中的捷径级联与基准博弈
本文研究了临床多智能体系统如何被社会合理的捷径所破坏,并发现独立的裁判监督对于检测此类博弈至关重要。
用于放射学报告结构化和质量保证的多智能体AI系统及独立放射科医生评估
本文介绍了一种本地部署的多智能体AI系统,用于放射学报告结构化和质量保证,放射科医生评估显示其性能良好。
MedExAgent:在嘈杂的临床环境中训练大语言模型代理进行询问、检查与诊断
本文介绍了 MedExAgent,这是一个将临床诊断形式化为部分可观测马尔可夫决策过程(POMDP)以处理嘈杂和不完整信息的框架。该框架提出了一种结合监督微调与强化学习的两阶段训练流程,以提高医疗大语言模型的诊断准确性和成本效益。