基于Agentic AI的框架:缓解医疗应用中的过早诊断交接与无声幻觉

arXiv cs.AI 论文

摘要

本文提出了一种多智能体框架,采用确定性编排和神经符号状态跟踪,以减轻医疗LLM应用中的过早诊断交接和无声幻觉。

arXiv:2606.18068v1 Announce Type: new 摘要:大型语言模型(LLM)和多智能体系统的最新进展推动了Agentic AI的兴起,在医学推理方面展现出潜力。然而,开放式对话代理仍然容易出现两种关键故障模式:过早诊断交接和无声临床幻觉,这些可能在到达患者之前未被检测到。在这项工作中,我们提出了一种多智能体框架,通过将“LLM-as-a-judge”的路由替换为确定性编排约束来解决这两个问题。该框架包含两种安全机制。首先,一个神经符号状态跟踪门通过阻止诊断转换,直到收集到所有必要维度,来强制执行OLDCARTS临床协议(发病、位置、持续时间、性质、加重/缓解因素、放射、时机和严重程度)的完整性。其次,一个认知不确定性量化(UQ)门计算跨K=5个独立诊断样本的语义熵(H),以在交付前识别和拦截发散输出。 我们使用由llama-3.1-70b-instruct模型驱动的模拟患者代理在150个测试用例上评估该系统。完整架构实现了49.3%的诊断精度,比无约束基线绝对提高了11.3个百分点。此外,我们观察到OLDCARTS完整性(σ)与语义熵(H)之间存在统计显著的负相关(r = -0.181,p < 0.05),表明结构化信息收集与诊断不确定性降低相关。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:41

# 基于主动式AI的框架:缓解医疗应用中的过早诊断交接与无声幻觉 来源: https://arxiv.org/html/2606.18068

###### 摘要

大型语言模型(LLM)和多智能体系统的最新进展推动了主动式AI的兴起,在医学推理方面展现出前景。然而,开放式对话代理仍容易受到两种关键故障模式的影响:过早诊断交接和可能在到达患者前未被发现的无声临床幻觉。在这项工作中,我们提出了一种多智能体框架,通过用确定性编排约束取代“LLM作为裁判”的路由来解决这两个问题。该框架包含两种安全机制。首先,一个神经符号状态跟踪门通过阻止诊断转换直到所有必需维度被收集,来强制确保OLDCARTS临床协议(发作、位置、持续时间、特征、加重/缓解因素、放射、时间、严重程度)的完整性。其次,一个认知不确定性量化(UQ)门计算跨K=5个独立诊断样本的语义熵(HH),以在交付前识别并拦截分歧输出。我们使用由llama-3.1-70b-instruct模型驱动的模拟患者代理在150个测试案例上评估该系统。完整架构实现了49.3%的诊断精确率,相较于未约束基线绝对提升了11.3个百分点。此外,我们观察到OLDCARTS完整性(σ)与语义熵(HH)之间存在统计显著的负相关(r=−0.181, p<0.05),表明结构化信息收集与诊断不确定性降低相关。

## I 引言

临床分诊与诊断是高风险过程,病史采集或诊断推理中的错误可能导致治疗延误、患者伤害以及对AI辅助系统信任的丧失[8]。随着医疗系统需求增长和持续的人力短缺,部署基于AI的临床决策支持工具的兴趣日益浓厚[13]。大型语言模型(LLM)因其编码医学知识、执行推理并通过自然语言与患者交互的能力,已成为有希望的候选方案。近期工作展示了LLM在临床应用的潜力。诸如MedFound等通用模型支持跨多个专业的诊断[7],而适配的LLM在结构化临床总结任务中表现出色[14]。RadGPT等专门系统进一步凸显了LLM生成患者特定解释的能力[4]。这些进展表明,能够协助端到端临床工作流的对话代理成为可能。

然而,可靠性仍是一个关键挑战。医学LLM容易产生幻觉,生成不正确的诊断、虚构药物或不安全的建议[11]。此类失败并不罕见,且已在通用和领域特定模型中都观察到了。一个关键局限性在于现有方法优化的是流畅生成而非认知正确性。

参阅图注 图1:无约束LLM临床代理的两种关键故障模式图示:过早诊断交接和无声幻觉。

当前的缓解策略,包括检索增强生成、思维链提示和LLM作为裁判框架,均以概率方式运作。虽然它们可以降低错误率,但无法提供正确性保证。更重要的是,它们无法确保摄入完整性,即在诊断前是否收集了所有临床所需的症状维度。在临床实践中,使用OLDCARTS协议的结构化病史采集至关重要,因为信息不完全正是诊断错误的主要来源之一[2]。现有的多智能体系统并未通过确定性机制强制这一要求。图1具体展示了促使本工作的两种故障模式。左图描绘了*过早诊断交接*,其中代理仅收集到部分症状史(仅观察了8个OLDCARTS维度中的2个)后就进入诊断,因此诊断是基于不完整的临床背景。右图描绘了*无声临床幻觉*,其中代理给出药物推荐时没有任何明确的不确定性或安全筛查,尽管可能存在严重的药物相互作用。综合来看,这些场景表明,临床对话系统的可靠性不仅取决于生成诊断的质量,还取决于系统是否强制结构化摄入,并在交付前标记不确定或潜在不安全的输出。

在这项工作中,我们通过一种神经符号多智能体框架来解决这些局限性,用系统层面的确定性编排替代纯基于提示的控制。具体来说,我们引入了两种互补机制。第一,神经符号OLDCARTS状态追踪器(M1),通过阻塞到诊断的转换直到所有必需字段被观察到,强制症状收集的完整性。第二,基于语义熵的不确定性量化(UQ)门(M2),计算跨不同独立诊断样本的归一化熵,以在输出呈现给用户之前识别分歧输出。我们在源自MedQA[5]的模拟临床案例上,使用基于Agentic AI软件系统实现的LLM患者代理评估所提框架。结果显示,所提系统相较于无约束基线将诊断准确率提升了11.3个百分点。此外,我们观察到症状完整性与诊断不确定性之间存在统计显著的负相关,表明结构化信息收集有助于生成更一致的模型输出。

本文的主要贡献总结如下:

- **神经符号多智能体框架**:我们提出了一种基于主动式AI范式的结构化多智能体架构,用于临床分诊和诊断,将病史采集、诊断推理和安全监督分离为不同的角色专用组件。通过以这种方式组织工作流,该框架支持对从症状摄入到诊断的转换进行显式控制,而不是仅仅依赖无约束的对话生成。
- **确定性OLDCARTS摄入验证机制**:我们引入了一个神经符号状态跟踪门,在OLDCARTS临床协议下显式监控症状收集的完整性。该机制在诊断开始前强制一个确定性验证步骤,从而降低因病史采集不完整而导致过早诊断交接的风险。
- **不确定性感知的诊断筛查机制**:我们集成了一种基于语义熵的不确定性量化模块,用于评估跨多个独立生成的诊断样本的分歧。该机制为在用户呈现前识别潜在不可靠或分歧的诊断输出提供了额外的筛查层。
- **通过消融研究评估所提框架**:我们在多个测试设置下进行评估,结果显示我们的架构相较于无约束基线提升了诊断准确率(+11.3个百分点)。我们进一步分析了结构化症状完整性与诊断不确定性之间的关系,表明更完整的摄入与下游诊断生成中较低的熵相关。

参阅图注 图2:所提神经符号多智能体分诊框架的系统架构。流程跨越三个阶段:(1) 由OLDCARTS状态跟踪门[M1]强制实施的结构化病史采集,(2) 具有语义熵不确定性量化[M2]的并行随机诊断采样,以及(3) 最多三次修订尝试的递归安全监督循环。

表 I:相关多智能体和基于LLM的临床框架比较

## II 相关工作

**临床决策支持中的LLM**。随着指令调优基础模型的出现,LLM在临床决策支持中的应用迅速扩展。早期证据来自研究表明GPT-4无需任务特定微调即可在美国医师资格考试(USMLE)中表现强劲,凸显其广泛的医学知识和推理能力[10]。后续领域适配模型(如Med-PaLM 2[12])进一步缩小了与专家级性能在医学问答基准上的差距。最近,包括MedFound[7]在内的通用医学模型证明了在统一模型家族中支持跨多个临床专业诊断的可行性。与此同时,诸如用于放射学报告解释的RadGPT[4]和用于临床对话摘要的适配LLM[14]等专业应用表明,这些模型在目标临床语言任务(包括在结构化信息提取中达到或超越人类专家的设置)上可以实现强性能。

**医学AI中的幻觉与安全性**。尽管LLM在医疗领域的 capability 不断增强,幻觉仍然是一个未解决的主要挑战。Omar等人[11]表明LLM可以吸收并再现嵌入在真实患者叙述中的临床不准确信息,通常将错误的医学背景当作有效证据。为缓解此类失败,先前工作探索了检索增强生成(RAG)、思维链提示和自一致性解码等策略。虽然这些方法可以降低幻觉率,但它们本质上是概率性的,不提供确定性保障。类似地,“LLM作为裁判”范式(其中辅助LLM评估主要模型的输出[15])可以平均提升输出质量,但无法以有保证的方式消除故障模式,因为裁判模型本身也容易遭受相同的底层错误。

**医疗领域的多智能体系统**。多智能体框架提供了一种结构机制,将复杂的临床工作流分解为角色专用组件。对话健康代理[1]提出了一种个性化的LLM驱动代理框架,将症状引出与下游规划分离。微软的AutoGen主动式AI框架[9]提供了一个通用的多智能体对话基础设施,已应用于医学问答和摘要任务。然而,现有的多智能体医疗系统通常依赖基于提示的约束进行智能体间路由,将信息收集的完整性留给模型的指令遵循概率,而非通过形式化的符号门验证。

**LLM输出的不确定性量化**。LLM的不确定性量化(UQ)已成为一个独立的研究领域。基于令牌概率的度量面临“语言释义问题”:语义上等价的输出(例如,“STEMI” vs “ST段抬高心肌梗死”)会产生人为的高熵。语义熵(SE)[6]通过双向NLI蕴涵计算前对语义等价的输出进行聚类,然后计算归一化的香农熵,解决了这一问题。该估计器已在开放域QA任务中得到验证,但此前尚未应用于多标签、多诊断的临床鉴别诊断设置,也未集成到确定性的多智能体编排门中。

表I将所提框架与代表性先前系统在六个维度上进行比较,这些维度与第II节中讨论的故障模式相关。据我们所知,这是首个将(1)临床摄入完整性的确定性符号验证、(2)多诊断输出的基于语义熵的不确定性量化,以及(3)开源多智能体架构内的递归安全监督统一起来的工作。

## III 背景与任务形式化

本节将形式化本工作考虑的临床诊断任务。我们首先定义问题设置,然后描述结构化摄入约束、不确定性量化机制以及用于评估的实验设计。

### III-A 问题形式化

令 \(\mathcal{C}\) 表示患者的主诉,令 \(\mathcal{H} = \{h_1, h_2, \ldots, h_n\}\) 表示在分诊对话中收集的症状细节集合。一个临床分诊会话表示为一个元组 \((\mathcal{C}, \mathcal{H}, \mathcal{D}, \mathcal{R})\),其中 \(\mathcal{D}\) 表示诊断代理生成的鉴别诊断,\(\mathcal{R} \in \{0,1\}\) 表示由临床裁判代理分配的二元正确性标签。该框架的目标是在确保仅当症状收集足够完整后才执行诊断的前提下,最大化期望诊断正确性 \(\mathbb{E}[\mathcal{R}]\)。为形式化这一要求,我们定义了一个OLDCARTS状态向量 \(V = \{V_{\text{Onset}}, V_{\text{Location}}, V_{\text{Duration}}, \dots, V_{\text{Severity}}\}\),其中每个 \(V_i \in \{0,1\}\) 指示对应的症状维度是否已收集。完整性条件通过约束 \(\sum_{i=1}^{8} V_i = 8\) 强制执行,要求所有八个OLDCARTS字段在系统允许从分诊转换到诊断之前都已被观察到。在此设置中,问题是设计一个同时满足两个要求的分诊与诊断工作流:(i) 收集完整且结构化的症状史,以及 (ii) 生成具有高期望正确性的诊断。

### III-B OLDCARTS临床协议

OLDCARTS助记符[2]指定了结构化症状表征的八个标准维度:发作、位置、持续时间、特征、加重/缓解因素、放射、时间、严重程度。为编码此协议,我们将每个维度关联到一个布尔变量 \(V_i \in \{0,1\}\),初始化为0,并在相应的症状属性已被分诊护士代理明确引出和注册后设置为1。我们定义摄入完整性。

相似文章

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

Check:面向AI智能体的反幻觉层。

Reddit r/AI_Agents

一位创始人宣布推出Check,这是一个面向AI智能体的SaaS反幻觉层,可将幻觉减少至少50%,并声称它能释放AI的真正能力。