MA-RAG: 用于查询驱动的纵向帕金森病评估摘要的多智能体检索增强生成

arXiv cs.CL 论文

摘要

MA-RAG是一个多智能体检索增强生成框架,用于查询驱动的纵向帕金森病临床评估摘要,与基线方法相比,在事实精度上实现了显著改进,并降低了幻觉率。

arXiv:2608.28624v1 公告类型: 新 摘要: 准确解释帕金森病的单次就诊和纵向临床评估既耗时,又通常依赖专家专业知识。虽然大语言模型(LLMs)可以生成自然语言摘要,但它们经常缺乏特定领域的临床基础,并且难以对结构化的纵向评估数据生成事实正确且时间一致的响应。为了解决这些局限性,我们提出了MA-RAG,一个查询驱动的多智能体检索增强生成框架,它将临床推理分解为领域专门化的代理,结合结构化事实提取,并通过最终验证阶段合成具有临床基础的摘要。该框架支持四种临床分析任务:单次会话、轨迹、比较和队列摘要。我们使用客观指标评估MA-RAG,即事实精度、幻觉率、时间保真度和语义相似度,以及由临床专家进行的主观评估。与传统方法、仅RAG和单智能体RAG基线相比,MA-RAG显著提高了事实正确性,事实精度相对提升高达122%(从0.436提高到0.990),幻觉率降低高达98%(从0.564降低到0.010),同时在组织和临床有用性方面始终获得临床专家的最高评价。这些结果表明,领域专门化的多智能体推理能够实现对结构化纵向临床评估数据的可靠查询驱动摘要。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:54

# MA-RAG: 用于帕金森病纵向评估的查询驱动摘要生成多智能体检索增强生成
来源: https://arxiv.org/html/2608.28624
\[orcid=0000\-0002\-6472\-7570\]

\\cortext

\[cor1\]通讯作者

1\] organization=德克萨斯州立大学, city=圣马科斯, state=德克萨斯, country=美国

###### 摘要

对帕金森病的单次就诊和纵向临床评估进行准确解读既耗时又通常依赖专家经验。虽然大语言模型能够生成自然语言摘要,但它们通常缺乏特定领域的临床依据,并且难以针对结构化纵向评估数据生成事实正确且时间顺序一致的回答。为解决这些局限性,我们提出MA-RAG,一种查询驱动的多智能体检索增强生成框架。该框架将临床推理分解为领域专业智能体,结合结构化事实提取,并通过最终验证阶段合成基于临床依据的摘要。该框架支持四种临床分析任务:单次会话、轨迹、对比和队列摘要生成。我们使用客观指标(即事实精确率、幻觉率、时间保真度和语义相似度)以及临床专家进行的主观评估来评估MA-RAG。与传统方法、仅使用RAG和单智能体RAG基线相比,MA-RAG显著提高了事实正确性,事实精确率相对提升高达122%(从0.436提升至0.990),幻觉率降低高达98%(从0.564降至0.010),同时在组织性和临床实用性方面持续获得临床专家的最高评价。这些结果表明,领域专业的多智能体推理能够实现对结构化纵向临床评估数据可靠的查询驱动摘要生成。

###### 关键词:

多智能体系统\\sep检索增强生成\\sep大语言模型\\sep临床摘要生成\\sep纵向患者记录\\sep帕金森病评估

## 1引言

帕金森病是一种进行性神经退行性疾病,其特征是运动和非运动症状,需要持续的多模式评估。统一帕金森病评定量表是临床评估的金标准,包含日常实践中使用的三个主要领域:第一部分评估日常生活中的非运动体验,第二部分评估日常生活活动(ADL)的运动方面,第三部分通过临床医生实施的检查来衡量运动功能。每个领域包含多个项目,采用0至4的有序量表评分,其中较高的值表示更重的症状负担。在临床实践中,帕金森病问卷-8通常与UPDRS结合使用,通过患者报告的健康相关生活质量测量来补充运动和非运动评估。PDQ-8是PDQ-39的有效简短版本,包含八个项目,捕捉了多个维度的生活质量。对于患者\(p\)在就诊\(v\)次时的情况,令\(x_{c}(p,v)\)表示领域\(d\)内项目\(c \in C_{d}\)的原始分数。领域聚合分数\(S_{d}(p,v)\)计算为其组成项目的总和:

\[S_{d}(p,v)=\sum_{c \in C_{d}}x_{c}(p,v)\],(1)
其中\(d \in \{Non-Motor, ADL, Motor, QoL\}\)分别对应UPDRS第一、二、三部分以及PDQ-8。如图1所示,这种数学结构捕捉了帕金森病进展的多维性质,但给临床医生带来了显著复杂性,他们在将这些结构化数据综合为可操作的纵向见解时面临重大挑战。首先,记录评估和手动计算临床评分非常耗时,限制了在常规临床就诊中进行全面评估的实用性。其次,尽管常规收集互补的评估领域,但它们彼此之间很大程度上是孤立的,迫使临床医生在形成整体临床印象时在脑中整合单一领域的发现。第三,解读纵向疾病进展很困难,因为临床医生必须手动比较多次就诊的评估结果,并关联单个领域分数的变化,而没有患者病情随时间演变的统一视图。因此,临床医生经常依赖静态分期量表,例如Hoehn和Yahr量表,这可能无法完全反映患者病情的短期变化。

参见图1说明图1:1)临床挑战,2)临床医生负担,以及3)用于多领域纵向帕金森评估的MA‐RAG自动解释/摘要生成系统的概述。现有计算工具,如大语言模型和检索增强生成,对于可靠的临床决策支持仍显不足:1)标准LLM在处理多领域输入时经常产生数值幻觉,并编造源文档中不存在的分数;2)模型表现出选择性注意力偏差,过度关注显著的运动特征,而忽略同一记录中包含的关键非运动或生活质量指标;3)没有结构化推理管道的RAG系统无法维持跨纵向就诊的时间保真度,并产生违反时间顺序或错误归因基线变化的摘要;4)当前方法缺乏针对底层事实表的明确验证机制,使得事实错误不受控制地传播到最终临床叙述中。最近的研究进一步表明,仅依赖自主LLM或智能体推理,而不基于可信证据进行基于规则的验证,会放大幻觉和推理错误,可能在高风险临床工作流中导致有害的下游决策。

我们提出一个专为查询驱动的纵向帕金森病患者多模式临床评估摘要生成而设计的多智能体检索增强生成框架。我们的方法通过三个核心创新解决了上述局限性:
1. 我们采用基于元数据的检索而非嵌入相似度搜索,确保患者标识符和就诊时间戳的精确匹配,以消除检索歧义。
2. 我们将临床推理分解为领域专业智能体,这些智能体仅在预计算的事实子集\(F_{d}\)上运行,防止跨领域干扰并确保所有相关发现的完整覆盖。
3. 我们实现了一个专门的验证阶段,其中最终智能体在合成前交叉检查上游叙述与结构化分数表\(T\),确保报告的每个值都基于提取的事实,从而能够对异构临床评估进行准确的纵向推理。
4. 我们通过结合客观指标(包括事实精确率、幻觉率、时间保真度和语义相似度)以及临床专家进行的主观评估,对MA-RAG进行了全面验证。

本文其余部分组织如下。第2节回顾了临床摘要生成的现有方法,并指出在处理多模态纵向数据方面的差距。第3节详细介绍了MA-RAG架构,第4节描述了数据集、知识库构建和实验设置。第5节展示了评估结果以及计算成本分析、伦理考量和局限性。最后,第6节总结了主要贡献并概述了未来方向。

## 2相关工作

临床摘要生成的发展经历了四个不同的技术范式,每个范式都解决了其前代范式的特定局限性,同时在纵向多模态推理中引入了新的故障模式。早期方法依赖于基于模板的自然语言生成系统,这些系统将结构化评估分数映射到固定的文本模式。虽然这些系统通过构造保证了事实一致性,但其僵化的输出模板缺乏综合跨领域关系或适应可变就诊次数所需的语义灵活性。例如,一个运动分数稳定但抑郁和睡眠障碍迅速恶化的患者,将与所有领域均匀进展的患者获得相同的叙述模板,掩盖了需要动态综合的关键临床不一致模式。

抽象Transformer模型通过从大型语料库中学习临床叙述的潜在表示,克服了基于模板方法的僵化,能够流畅地适应不同的轨迹模式。ClinicalBERT和BioGPT等模型展示了优于基于规则方法的领域适应性。然而,这些自回归生成器作为黑盒概率分布运行,没有明确的接地机制,导致在处理结构化多模态输入时产生数值幻觉。在我们自己的实证评估中,此类模型在纵向查询上仅达到43.6%的事实精确率,因为它们混淆了跨就诊的相似分数模式,并编造了看似合理但不存在的基线差异/变化量。一个具体的失败案例是,模型报告“运动分数从就诊1的28改善到就诊3的22”,而实际记录显示就诊1为28,就诊2为31,就诊3为35,即模型基于概率令牌预测而非检索到的证据,虚构了中间值和变化方向。

检索增强生成被引入以缓解幻觉,通过将生成基于检索到的证据块而非仅依赖参数记忆。使用密集向量相似度搜索的标准RAG管道通过检索语义相关段落提高了单次会话摘要的事实基础,直接解决了普通LLM中观察到的编造失败,将输出锚定到可验证的文本跨度。然而,这种方法在纵向临床评估中完全失败,因为嵌入相似度无法强制执行精确的患者-就诊对齐。当查询“患者3的轨迹”时,余弦相似度检索返回来自多个患者的top-k文档,这些文档的文本嵌入在语义上接近但属于不同个体,违反了患者特定时间一致性的基本要求。此外,RAG检索的是非结构化文本片段而非结构化事实表,迫使LLM在生成过程中执行算术聚合和基线差值计算,这是自回归模型由于缺乏符号推理能力而一致失败的任务。

智能体框架出现,将复杂的临床推理分解为通过工具使用和多步骤规划协调的专门子任务。像MedAgent和ClinicalAgents这样的系统将查询路由到领域特定模块,并调用外部计算器进行分数聚合,通过将数值操作卸载给确定性工具,直接解决了标准RAG的算术失败模式。虽然这种架构通过将领域特定推理隔离到单独的智能体中减少了跨领域干扰,但现有实现缺乏明确的验证阶段。生成的叙述直接传递到输出,而没有与底层结构化事实进行交叉检查,允许细微错误传播到最终摘要中。一个具体的失败案例是,一个智能体系统正确地通过外部工具计算出单个领域分数,但随后生成的叙述称“ADL比基线恶化了5分”,而工具输出实际上显示改善了3分。此外,当前智能体系统依赖基于嵌入的检索进行知识访问,继承了困扰标准RAG的相同患者混合失败,当处理具有高患者间语义相似性的纵向记录时。

尽管取得了这些进展,但没有现有框架将基于元数据的检索、领域专业的智能体分解和明确的事实表验证结合在一个用于纵向多模态临床评估摘要生成的统一管道中。此外,现有评估实践仍然有限。广泛使用的指标,包括ROUGE、BLEU、BERTScore和SBERT相似度,未能充分捕捉事实正确性和时间一致性。因此,它们可能给与参考文本在词汇或语义上匹配的摘要分配高分数,同时错误报告就诊顺序、基线锚点或数值临床发现。这些架构和评估局限性共同推动了开发更可靠的框架用于纵向多模态临床评估摘要生成。

## 3方法论

提出的框架MA-RAG针对纵向患者记录上的查询\(q\)生成临床摘要。该架构如图2所示,由三个组件组成。首先,RAG管道包括知识库、检索节点和最终智能体。知识库存储患者会话记录及相关元数据(详见第4节)。检索节点通过基于元数据的匹配检索证据,最终智能体在生成最终摘要之前将其综合基于检索到的证据。尽管当前实现索引结构化评估文档,但文档导向的表示自然支持未来通过相同的向量数据库和RAG检索管道集成额外的临床证据,例如临床医生撰写的叙述。其次,查询解释由一组LLM驱动的智能体执行。第三,这些智能体的输出被综合以产生最终临床摘要。

参见图2说明图2:MA-RAG架构概述:给定查询\(q\),编排器规划检索,检索节点通过基于元数据的匹配\(R(p)\)从ChromaDB知识库获取患者记录,路由器将流向导向领域、队列或对比智能体。最终智能体将这些输出综合成临床摘要\(\hat{y}\)。### 3.1任务定义

令\(\mathcal{P}\)表示患者集,\(\mathcal{V}_{p}\)表示患者\(p \in \mathcal{P}\)的有序就诊集。每次就诊包含一个或多个临床评估,表示为来自领域特定分数集的分数以及项目级响应。

相似文章

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。