信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
摘要
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
arXiv:2606.14149v1 Announce Type: new
摘要:大语言模型(LLMs)在医疗场景中的应用日益增多,但其幻觉倾向在涉及临床决策时带来风险。本研究考察了LLMs在回答临床问题时是否会推荐近期被禁或撤回的药品,并测试了一种基于智能体的方法来减少此类错误。我们开发了一个基于单一LLM骨干的五智能体‘信任但验证’系统。为了衡量法规知识的过时性,我们创建了一个包含103道临床多选题的对抗性数据集,其中历史正确选项如今指向违禁物质。该规模确保了跨不同治疗类别的统计显著性。我们在基础配置和智能体配置下评估了三个开放获取模型系列(GPT-OSS、Llama-3、Falcon-3)。通过逐点评分、标签准确率、幻觉错误率(HER)和组件保真度(CF)分数来衡量性能。我们还观察到专有模型存在临床安全性退化。在默认配置下,所有模型均表现出高幻觉率,一致性地选择了与训练数据模式匹配的违禁药物。我们提出的智能体架构将各模型的HER降低了约53%。逐点评分从-0.25(不安全推荐)向0.0(适当拒绝)转变。安全审计拦截了危险输出,即使模型的参数知识偏向违禁物质。所提出的多智能体框架提供了一种模型无关的方法来强制执行法规合规性,优先考虑患者安全而非流畅的文本生成。我们的工作展示了一种在安全关键的医疗环境中部署自主AI系统的实用方法,并说明了如何将实时法规数据集成到LLM流水线中以支持临床决策。
查看缓存全文
缓存时间: 2026/06/15 09:11
# 信任但验证:通过事后对抗性审计与多智能体反馈回路减轻医疗幻觉 来源:https://arxiv.org/html/2606.14149 Maheera Amjad、 Zartasha Mustansar、 Arslan Shaukat、 Muhammad U\. S\. Khan。本研究在NUST SINES的数据科学与机器学习实验室进行。Muhammad Osama,伊斯兰堡NUST SINES的硕士研究生。研究方向:多智能体AI、医疗AI、软件设计。NUCES软件工程学士。[email protected] ORCID:0009-0006-8423-9167 (https://orcid.org/0009-0006-8423-9167)。Maheera Amjad,NUST SINES博士研究生。研究方向:基因组学、转化生物信息学、AI。SINES硕士。[email protected] ORCID:0009-0009-5670-5492 (https://orcid.org/0009-0009-5670-5492)。Zartasha Mustansar,NUST SINES教授。专长:步态分析、姿势力学、计算力学、图像处理。[email protected] ORCID:0000-0002-2327-7577 (https://orcid.org/0000-0002-2327-7577)。Arslan Shaukat,NUST CEME副教授。研究方向:机器学习、模式识别、自然语言处理。[email protected] ORCID:0000-0002-1612-111X (https://orcid.org/0000-0002-1612-111X)。Muhammad Usman Shahid Khan,NUST SINES副教授。研究方向:数据挖掘、AI、网络安全。IEEE会员。[email protected] ORCID:0000-0002-7299-621X (https://orcid.org/0000-0002-7299-621X) ###### 摘要 大型语言模型(LLMs)在医疗领域的应用日益广泛,但其固有的幻觉倾向在涉及临床决策时带来了风险。本研究探讨了LLMs在回答临床问题时是否会推荐近期被禁用或撤市的药物,并测试了一种基于智能体的方法来减少此类错误。我们开发了一个使用单一LLM骨干网络的五智能体“信任但验证”系统。为衡量监管知识的过时性,我们创建了一个包含103道临床多项选择题的对抗性数据集,其中历史上正确的答案现在指向已被禁用的物质。该规模确保了跨不同治疗类别的统计显著性。我们评估了三个开源模型家族(GPT-OSS、Llama-3、Falcon-3)在原始配置和智能体配置下的表现。性能通过逐点评分、标签准确率、幻觉错误率(HER)和组件保真度(CF)得分来衡量。我们还观察了专有模型在临床安全性方面的退化。在默认配置下,所有模型都表现出较高的幻觉率,持续选择与训练数据模式匹配的禁用药物。我们提出的智能体架构将各模型的HER降低了约53%。逐点评分从-0.25(不安全推荐)向0.0(适当拒绝)转变。即使模型的参数化知识倾向于禁用物质,安全审计也能拦截危险输出。所提出的多智能体框架提供了一种与模型无关的方法来强制执行监管合规性,优先考虑患者安全而非流畅的文本生成。我们的工作展示了在安全关键的医疗环境中部署自主AI系统的实用方法,说明了如何将实时监管数据集成到LLM流水线中以支持临床决策。 \{IEEEkeywords\} 智能体AI,临床决策支持系统,药物安全,幻觉缓解,多智能体系统 ## 1 引言 大型语言模型(LLMs)已进入医疗保健领域[28 (https://arxiv.org/html/2606.14149#bib.bib18),21 (https://arxiv.org/html/2606.14149#bib.bib19)],医疗图像生成模型[14 (https://arxiv.org/html/2606.14149#bib.bib24)]和对话式智能代理[35 (https://arxiv.org/html/2606.14149#bib.bib23)]也是如此。这些进展促使各国研究将智能体AI系统作为一线医疗助手[30 (https://arxiv.org/html/2606.14149#bib.bib17)]。实际应用包括中国的AI驱动的临床分诊系统,其中自主智能体与患者互动、生成评估并提出治疗方案[33 (https://arxiv.org/html/2606.14149#bib.bib2),32 (https://arxiv.org/html/2606.14149#bib.bib25)]。 这些系统依赖于来自OpenAI[18 (https://arxiv.org/html/2606.14149#bib.bib26)]和DeepSeek[5 (https://arxiv.org/html/2606.14149#bib.bib27)]等供应商的LLM骨干网络[26 (https://arxiv.org/html/2606.14149#bib.bib28)],而这些模型仍然容易产生幻觉[12 (https://arxiv.org/html/2606.14149#bib.bib4)]。即使模型在受控任务上达到近乎完美的准确率,剩余的误差率仍可能产生与事实相矛盾的临床陈述。在生物医学背景下,此类错误会带来风险,因为临床决策影响人类的健康和安全[3 (https://arxiv.org/html/2606.14149#bib.bib10)]。 2025年初,《内科学年鉴》记录了一例溴中毒(一种因摄入过量溴(某些镇静剂中含有的化学元素)引起的疾病)[4 (https://arxiv.org/html/2606.14149#bib.bib30)],这是由于患者遵循ChatGPT生成的指示所致[8 (https://arxiv.org/html/2606.14149#bib.bib1)]。另一份来自印度海得拉巴的报告描述了一名肾移植患者因收到误导性的AI回复而停用抗生素,导致移植器官丢失[31 (https://arxiv.org/html/2606.14149#bib.bib3)]。 尽管存在这些安全隐患,对AI健康信息的依赖仍在持续扩大。根据OpenAI 2026年的报告《AI作为医疗助手》[24 (https://arxiv.org/html/2606.14149#bib.bib5)],每天有超过4000万用户通过ChatGPT寻求健康相关信息。在美国医生中,2024年有三分之二的人将AI工具用于临床任务,高于前一年的38%。家庭医学和初级保健领域的使用最为普遍,而四分之一的联合健康从业者(包括营养师和护理人员)报告每周使用。医学生和实习生也采用AI工具来解读症状、审查实验室结果和起草临床记录[24 (https://arxiv.org/html/2606.14149#bib.bib5),16 (https://arxiv.org/html/2606.14149#bib.bib6)]。尽管这些系统支持学习,但其概率性质给可能缺乏审计所生成内容所需临床经验的学习者带来了风险。 Anthropic的《AI熟练度4D框架》将勤勉确定为核心能力,定义为通过深思熟虑的系统选择、透明度以及对AI辅助输出的个人责任来负责任且合乎道德地使用AI[2 (https://arxiv.org/html/2606.14149#bib.bib29)]。这一伦理理想与当前临床实践之间存在差距。尽管初级保健和联合健康从业者越来越依赖ChatGPT等工具来完成每周任务,但最先进的模型仍然表现出临床安全性退化(第7节),包括推荐禁用药物。这种脱节引发了对专业责任的质疑:如果底层系统容易产生随机幻觉,从业者还能保持勤勉吗? 随着AI代理在医疗工作流程中走向自主,幻觉错误的后果变得重大。现有的框架,如检索增强生成(RAG)[1 (https://arxiv.org/html/2606.14149#bib.bib7)]、事前提问验证[13 (https://arxiv.org/html/2606.14149#bib.bib8)]和语义护栏[11 (https://arxiv.org/html/2606.14149#bib.bib9)],提供了部分缓解,但未能解决随机文本生成的限制。在解决监管知识过时方面仍然存在关键空白,正如与领先专有模型的互动中所展示的那样(第7节),LLMs始终无法识别被撤市或禁用的药物。 因此,需要超越知识检索的专业架构,能够主动根据实时监管数据库审计候选响应,确保由确定性安全层支持问责制。 ## 2 背景与上下文 最近的研究越来越强调文本生成模型中幻觉的问题,尤其是在准确性至关重要的医疗情境中[6 (https://arxiv.org/html/2606.14149#bib.bib15)]。随着生成式AI系统在医疗保健中变得越来越普遍,它们对医疗信息的安全可靠共享提出了严峻挑战。由于这些模型在有限且有时过时的数据集上进行训练,它们可能产生不完整、具有误导性或完全错误的响应[3 (https://arxiv.org/html/2606.14149#bib.bib10)]。为了解决这个问题,有人引入了一种旨在提高医学问答事实正确性的自我反思技术[13 (https://arxiv.org/html/2606.14149#bib.bib8)]。然而,他们的方法仅依赖模型内部的参数化知识,并且没有结合任何外部检索源,从而限制了其纠正过时或缺失信息的能力。为了克服静态训练数据的这些固有限制,RAG方法已受到关注[17 (https://arxiv.org/html/2606.14149#bib.bib20)]。RAG通过将LLM与外部、最新的信息源配对来增强它们,从而提高事实准确性并降低幻觉风险[20 (https://arxiv.org/html/2606.14149#bib.bib12),34 (https://arxiv.org/html/2606.14149#bib.bib13)]。这使得模型的输出更基于当前知识,而不是仅仅依赖内部记忆。 Zakka*等人*[36 (https://arxiv.org/html/2606.14149#bib.bib11)]的研究表明,补充了领域特定语料库的LLMs可以支持更可靠的临床决策。一些先前的研究将PubMed(一个提供超过4000万条生物医学和生命科学文献引用的数据库)[22 (https://arxiv.org/html/2606.14149#bib.bib33)]作为医学问答任务的外部知识库[1 (https://arxiv.org/html/2606.14149#bib.bib7)],并强调了配备实时在线浏览能力的RAG系统,用于搜索权威医疗平台如PubMed和UpToDate(一种基于订阅的临床决策支持工具,提供循证医学信息和治疗建议)[10 (https://arxiv.org/html/2606.14149#bib.bib34)],强调了领域特定检索在减少幻觉方面的价值[19 (https://arxiv.org/html/2606.14149#bib.bib16)]。2024年,Hakim*等人*[11 (https://arxiv.org/html/2606.14149#bib.bib9)]的研究团队证明了语义输出护栏在药物安全领域对抗LLM幻觉的功效;然而,他们的方法仍然受到预定义字典静态性质的限制。类似地,Gangavarapu[9 (https://arxiv.org/html/2606.14149#bib.bib35)]提出了一个框架,该框架集成了NVIDIA NeMo Guardrails和Llama Guard,以清理输入并通过连接到FDA和PubMed等数据库的“检索护栏”验证医学术语。本研究中使用的模型参考了Pal*等人*[25 (https://arxiv.org/html/2606.14149#bib.bib14)]的工作,他们开发了大型语言模型医学领域幻觉测试(Med-HALT)。他们的评估记录了不同语言模型在领域特定幻觉基准上的表现。 我们原本打算采用相同的模型以保证实验的一致性。然而,有限的GPU资源阻止了我们运行原始的模型集。为了解决这一限制,我们从NVIDIA API目录[23 (https://arxiv.org/html/2606.14149#bib.bib22)]中选择了属于相同模型家族的最接近可用变体(见表1)。选择这些模型是因为它们在医学幻觉任务中表现出具有竞争力的可靠性,这与我们测试所提出的问题公式的目标一致。 现有的RAG框架和护栏优先考虑信息检索和语义相似性,而不是安全关键的验证。我们需要这样的架构——它不仅提供知识,还能主动根据实时监管数据库审计候选响应,以识别被禁用或撤市的药物实体。 ## 3 方法 本研究提出并评估了一种模块化的智能体AI架构,用于医学领域的幻觉缓解,该架构结合了五个AI智能体(见图2)。实验使用了一个经过整理的多项选择题数据集。 ### 3.1 数据集 实验使用了一个包含103道医学多项选择题的整理数据集,这些题目来自DrugBank[15 (https://arxiv.org/html/2606.14149#bib.bib21)](见第7节)。DrugBank从包括RxNorm、FDA和EMA在内的多个可靠来源获取数据,并聘请医学专家撰写和验证数据。每个问题的设计使得临床上最合理的正确答案指向一种已被FDA或其他监管机构撤市、禁用或发出黑框警告的药物。在103道题目中,有97种独特的药物作为正确选项出现;其余六道题目在不同临床情境中重复使用了相同的药物。与标准的多项选择题不同,这些是对抗性问题,旨在测试参数化知识和临床安全责任。例子包括罗非昔布[27 (https://arxiv.org/html/2606.14149#bib.bib31)]和伐地考昔[7 (https://arxiv.org/html/2606.14149#bib.bib32)]。 ### 3.2 模型选择与骨干网络 我们根据架构多样性和参数量规模选择了五个不同的开源LLM骨干网络,以评估所提出的智能体架构的泛化能力(见表1)。所有模型均通过NVIDIA API目录访问,以确保事实准确性的标准化推理参数(温度=0.1)。 表1:模型摘要 ### 3.3 实验 我们的研究包括三个实验设置,比较了跨五个LLM骨干网络的两种主要配置(实验I和II),并观察了最先进的LLMs的可靠性(实验III)。 #### 3.3.1 实验 I **原始架构(基线)**:单次推理,其中LLM充当临床专家并回答多项选择题(见图1)。该过程定义如下: **输入**:系统接收一个原始的多项选择题,包含医疗状况和四个治疗选项(A、B、C、D)。 **指令**:模型被配置为医学专家的角色并采用严格的格式。 - system_prompt = ( - "你是一名医学专家。对于下面的多项选择题:\n" - "1. 简要说明为什么正确选项是正确的。\n" - "2. 简要说明为什么其他选项是错误的。\n" - "3. 以以下内容结束你的回答:'正确选项是[字母]。'" - ) **参数设置**:模型的温度设置为0.1以保证事实准确性。 **输出**:模型提供理由,然后给出最终选择。 图1:传统非智能体流水线:原始配置 该实验代表了大多数用户与AI交互的当前标准(直接提问)。 #### 3.3.2 实验 II **智能体架构(提出)**:在本实验中,我们提出了一个利用事后对抗性审计循环的智能体流水线,该循环由实时网络基础支持(见图2)。
相似文章
LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI
本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。
幻觉作为特性而非缺陷:评估多智能体架构将推测性语言模型输出转化为可测试科学假设的能力
本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。
超越最终答案:多智能体工业工作流中轨迹级幻觉的审计
本文介绍了Trajel,一个用于审计多智能体工业工作流中轨迹级幻觉的数据集和评估框架,提出了五种幻觉分类法,并表明轨迹感知检测显著优于标准的后验验证。
幻觉即利用:携带证据的多模态智能体
本文形式化了多模态智能体中的幻觉到动作转换,并提出了携带证据的智能体(ECA),它使用受限验证器仅授权安全的工具调用,在200个任务的流水线上实现了0%的不安全动作率。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。