FRAC-MAS:一种安全且可解释的骨折诊断多智能体系统
摘要
FRAC-MAS 是一种智能 AI 系统,用于自动化、可解释且安全的骨折检测,通过集成视觉模型与多智能体工作流,提升诊断和临床报告水平。
arXiv:2608.28662v1 公告类型:新
摘要:深度视觉模型与智能 AI 架构集成时,骨折检测及其临床可解释性显著提升。尽管深度学习模型在诊断性能上表现优异,但其黑箱性质限制了临床采纳。我们提出 FRAC-MAS,一种用于自动化、可解释且安全骨折检测的智能 AI 系统。该框架结合了四视觉模型的堆叠集成与保形预测,生成基于统计的鉴别诊断,同时多智能体工作流执行独立验证、检索临床指南并生成患者友好报告。一项流水线深度消融研究证实,我们的多智能体评估器将 86.6% 的病例分诊至高置信度自动确认组,同时处理不确定病例,优于单一智能体基线。与 Llama、MedGemma 和 Gemini 的患者偏好研究进一步证明临床报告更易于理解。这些结果表明,集成多智能体评估器与保形保证可实现更安全的放射学分诊,同时保持临床医生监督。更广泛地说,FRAC-MAS 展示了合作智能架构如何作为可审计、人在回路中的决策支持系统,用于安全关键的医疗保健。我们的代码可在 https://github.com/hardik1712/FRAC-MAS 获取,网站为 https://frac-mas.vercel.app。
查看缓存全文
缓存时间: 2026/09/01 12:38
# FRAC-MAS:用于骨折诊断的安全且可解释的多智能体系统 来源:https://arxiv.org/html/2608.28662 Tirath Bhathawala affiliation: University of Amsterdam, Amsterdam, Netherlands Mihir Panchal affiliation: National University of Singapore, Singapore Ying\-Jung Chen affiliation: Georgia Institute of Technology, Atlanta, USA , , , , E\-mail [hardikiyer17@gmail\.com](mailto:[email protected]) Kiran Bhowmick affiliation: Dwarkadas J Sanghvi College of Engineering, Mumbai, India Pankaj Sonawane affiliation: Dwarkadas J Sanghvi College of Engineering, Mumbai, India Meera Narvekar E\-mail [tirath\.bhathawala@student\.uva\.nl](mailto:[email protected]) E\-mail [mihir@comp\.nus\.edu\.sg](mailto:[email protected]) E\-mail [yingjungcd@gmail\.com](mailto:[email protected]) E\-mail [kiran\.bhowmick@djsce\.ac\.in, pankaj\.sonawane@djsce\.ac\.in, meera\.narvekar@djsce\.ac\.in](mailto:[email protected],%[email protected],%[email protected]) affiliation: Dwarkadas J Sanghvi College of Engineering, Mumbai, India ###### 摘要 将深度视觉模型与智能体AI架构集成后,骨折检测及其临床可解释性得到了显著提升。虽然深度学习模型取得了较高的诊断性能,但其黑盒特性限制了其在临床中的应用。我们提出了FRAC-MAS,一个用于自动化、可解释且安全的骨折检测的智能体AI系统。该框架将四个视觉模型的堆叠集成与保形预测相结合,以生成具有统计学依据的鉴别诊断,同时一个由多个智能体组成的工作流执行独立验证、检索临床指南并生成患者友好的报告。一项流水线深度消融研究证实,我们的多智能体批评者将86.6%的病例分流至高置信度自动确认组,同时将不确定病例上报,优于单智能体基线。与Llama、MedGemma和Gemini进行的患者偏好研究进一步表明,其生成的临床报告可理解性显著更高。这些结果表明,集成多智能体批评者与保形保证,能够在保留临床医生监督的同时,实现更安全的放射学分诊。更广泛地,FRAC-MAS展示了协作式智能体架构如何作为安全关键型医疗保健中可审计、人在环路的决策支持系统。我们的代码可在https://github.com/hardik1712/FRAC-MAS获取,网站可在https://frac-mas.vercel.app/访问。 ###### 关键词: 智能体AI 多智能体系统 医学影像 可解释AI 临床决策 ## 1引言 肌肉骨骼损伤,尤其是骨折,在急诊和骨科部门中占据了相当大的病例比例\[26\]。解读X线平片对于准确的骨折诊断和治疗至关重要,但由于骨折形态的细微性、观察者间差异性以及临床实践中处理的大量病例,这仍然具有挑战性\[19\]。未被发现的骨折常常发展为畸形愈合、缺血性坏死和永久性残疾,而漏诊则会导致不必要的手术、住院时间延长和重大的经济损失\[5\]。 研究报告称,大约2-3%的骨科损伤在创伤和急诊环境中初次就诊时被漏诊,并且在某些颅骨和骨骼损伤中,约10-20%的X线平片可能未能显示骨折的存在\[7\]。因此,在首次接触时,仍有相当比例的骨折未被充分检测到\[13\]。可解释的骨折检测系统越来越多地被用于突出显示导致骨折预测的特定图像区域\[24\]。这使临床医生能够验证模型是否专注于皮质连续性中断或骨小梁塌陷等合理特征,而非无关的伪影,从而提高信任度并支持更安全地采用AI辅助诊断\[11\]。 为解决这些差距,我们提出了FRAC-MAS,一个用于自动化骨折检测并具有临床可解释性的多智能体AI系统。该系统通过让执业骨科外科医生验证输出来强调人机交互,因为在临床AI流程中,人为监督对于减轻自动化偏差、确保与临床价值保持一致、以及在AI无法可靠处理伦理模糊或边界情况时提高决策准确性至关重要\[16\]。我们的多智能体架构通过将诊断流程分解为专业的、可解释的组件(每个组件均可独立验证,并且共同设计用于现实世界部署),弥合了黑盒深度学习预测与临床信任之间的差距。 这种向模块化、专业化AI流程的转变,与近期关于骨折检测特定深度学习应用的研究文献相一致。Joonho Oh等人\[15\]展示了通过注意力模块简化训练过程和提高骨折检测诊断精度的潜力,特别关注腕骨X线图像\[25\]。RAD-DINO已被确立为医学影像中强大的自监督视觉骨干网络,并在多个放射学任务(包括肌肉骨骼X线分类)中进行了系统基准测试\[18\]。此外,混合CNN-Transformer和多流架构对于捕捉异质放射学视图中的细粒度局部特征和全局上下文结构是必要的\[9, 23\]。然而,验证从这些视觉特征生成的语言模型输出仍然是一个开放的挑战;Chung等人\[3\]等研究强调了需要验证和LLM作为评判者协议来验证临床LLM生成的文档。这些流程的智能体扩展到现实世界的临床部署,进一步验证了用于可信诊断AI的检索引导、协调式架构\[14\]。 事后解释性方法现在已成为临床可部署医学影像AI不可或缺的一部分,其中Grad-CAM是主要的可视化范式\[21\]。在骨盆骨折检测中的成功应用\[11\]表明,空间可解释性对于合规监管和建立临床医生信任至关重要。多智能体系统(MAS)在临床基准测试中已证明比单智能体基线具有可衡量的优势。例如,Ying-Jung Chen等人\[2\]表明,MAS的死亡率预测准确率为59%,而单智能体系统为56%,平均住院时间误差从5.82天降低到4.37天\[2, 12\]。这些结果共同推动了智能体协调架构的发展,其中检索、推理和批评等专门角色被分配到协调的智能体中,以实现单体模型无法达到的诊断性能。 简而言之,本研究的主要贡献如下:首先,我们设计了一个多智能体临床决策支持工作流,其中患者交互智能体协调知识、批评和教育智能体,以获取证据基础、执行盲审并支持人工上报、以及生成带有Grad-CAM叠加的面向患者的解释。其次,我们引入了带有保形预测的集成模型,通过堆叠解决常见的混淆骨折类别,并将输出转换为具有明确经验覆盖安全性的鉴别诊断。最后,我们通过一项新颖的流水线深度消融研究严格验证了智能体层,证明了我们的多智能体架构成功分流了不确定病例,并通过与领先LLM(Llama、MedGemma、Gemini)的偏好调查确立了其在患者沟通方面的优越性。 请参阅图表 Figure 1:端到端系统架构:集成集成推理、Grad-CAM定位、多智能体推理和保形预测,用于可验证的临床报告生成。 ## 2方法 ### 2.1数据集和模型集成 该系统在HBFMID数据集的增强版本上进行训练\[17\]。我们使用此数据集是因为它根据精确的骨折形态而非仅仅是解剖位置对X线图像进行分类。我们平衡并增强了训练集,使其包含8个类别的1,952张图像,同时保持了未增强的验证集(106张图像)和测试集(112张图像)划分。 我们的系统采用4个模型的集成来捕捉多样化的骨折表现:MaxViT\[22\],YOLOv26m\-cls\[20\],RAD-DINO,以及一个定制的HyperColumn\-CBAM DenseNet-169\[8, 10\]。这结合了多轴注意力、自监督放射学领域特征和低级边缘细节保留。预测通过两轮加权软投票方案或堆叠元学习器(逻辑回归)进行组合,以最佳方式消除形态相似类别(如斜形骨折和横形骨折)的歧义。 ### 2.2保形预测 为了用严格的不确定性度量来补充集成输出,系统将集成输出包装在分布无关的经验覆盖保证的分裂保形预测集中\[1\],并在验证集上进行校准。给定一个误覆盖水平\(\alpha\)(例如,\(\alpha = 0.10\)对应90%的覆盖),任何概率超过校准阈值的类别都会进入预测集。这自然映射为鉴别诊断,直接将经验不确定性传达给下游智能体。 ### 2.3多智能体系统 为了使预测流水线端到端可审计,我们将每个病例通过一个四智能体工作流(见图1)。通过将诊断过程分解为专业角色,该系统防止单体LLM虚构医疗建议,并强制所有输出都有明确的依据并经过独立验证。 #### 患者界面智能体。 患者界面智能体充当入口点和主要协调器。它管理对话记忆并评估患者的上下文(例如,年龄,报告的疼痛程度)。它使用确定性的LangGraph状态机来路由交互:简单的管理查询直接处理,而上传X线图像的临床评估则调用下游流水线。这种架构确保诊断响应严格通过经过验证的流水线生成,而不是通过无界的、参数化的LLM生成。 #### 知识智能体。 知识智能体负责将叙述锚定到经过验证的临床来源,充当高级检索增强生成(RAG)模块。它查询本地托管的、经过整理的ChromaDB向量存储,其中包含所有8个骨折类别的结构化临床记录。这些记录包括标准化的ICD-10代码、预期的恢复时间线、严重程度评级以及来自权威骨科机构(例如,AO/OTA骨折分类)的官方治疗指南。对于每个X线图像病例,智能体使用句子转换器嵌入执行密集语义搜索。检索到的前k条指南随后作为绝对的、不可协商的上下文提供给快速语言模型(gemini-2.5-flash-lite\[4\]),该模型合成了一个聚焦的临床背景,严格避免虚构未检索到的治疗方案。 #### 批评智能体。 批评智能体作为核心安全机制运行,通过执行盲审前分流来防止自动化偏差。在接收到图像后,它会在看到集成模型的初步标签之前产生一个独立的零样本诊断评估,以防止锚定偏差。然后它评估集成模型的输出,并发出一个属于{‘是’,‘否’,‘不确定’}的裁决。一个严格的混合共识规则在三种条件下强制人工上报:(1)如果批评智能体明确拒绝集成模型的诊断,(2)如果批评智能体的独立第一预测与集成模型不同,且置信度高于预设的安全阈值(默认0.6),或者(3)如果保形预测集包含多个类别,表明模型存在内在模糊性。这确保了临床医生仍然是所有疑难病例的最终裁决者。 #### 教育智能体。 最后,教育智能体负责患者沟通。它接收经临床验证的诊断、来自知识智能体的检索上下文以及由视觉集成生成的Grad-CAM\[21\]热图叠加。利用这个丰富的上下文,它提示一个能力很强的推理模型(gemini-2.5-pro\[6\])生成一个通俗易懂的总结。该智能体明确地突出Grad-CAM热图中激活的解剖区域,以解释为何做出该诊断,将复杂的放射学发现转化为易于理解的语言,同时提供清晰的后续步骤指导(例如,对于移位骨折建议立即前往急诊室,对于未移位损伤则建议安排骨科随访)。 ## 3结果与分析 ### 3.1流水线智能体消融 为了量化每个架构层的边际贡献,我们在保留的测试集(种子42,\(\alpha = 0.10\),堆叠元学习器启用)上评估了FRAC-MAS的五个逐步更丰富的分支。如表1所示,准确率在流水线深度上保持不变,因为下游组件不会改变原始的argmax预测。单智能体基线由于原始置信度阈值而将每个测试病例都上报,没有提供实际的自动化效益。相反,多智能体批评智能体有选择地自动确认了大部分病例,显著减少了不必要的上报。确认的组别相较于原始集成基线达到了较强的安全边际,表明批评智能体成功过滤了错误预测。最后,整个流水线实现了可验证的、基于检索的生成的完整任务完成率。 表1:在112个样本测试集上的流水线深度消融(\(\alpha = 0.10\),堆叠)。\*确认准确率\*是指未被标记为人工上报的病例的准确率。†批评智能体使用本地MedGemma-4B-IT。 ### 3.2外部数据集评估 为了评估在HBFMID之外的泛化能力,我们在两个模型在训练期间从未遇到的外部数据集上评估了二元骨折检测。如表2详述,堆叠
相似文章
递归多智能体系统
本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。
RadAgent:用于胸部CT逐步解读的工具型AI代理
RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。
基于蒙特卡洛树搜索的多智能体系统自主修复
本文提出MARS,一种基于蒙特卡洛树搜索的多智能体系统自主修复框架,以及StateMAS,一个包含1,310条故障轨迹的基准。实验表明,MARS在修复准确率上 consistently 优于现有方法,且 token 成本相当。
SafeRx-Agent:一个基于知识的多智能体框架,用于安全且可解释的药物推荐
介绍了SafeRx-Agent,一种基于知识的多智能体框架,用于安全且可解释的药物推荐,可生成细粒度的ATC代码预测,同时控制药物相互作用和禁忌症,在MIMIC-III和MIMIC-IV数据集上进行了评估。
一种多AI智能体框架实现固体力学问题的端到端有限元分析
本文提出了AbaqusAgent,一个利用大语言模型实现固体力学有限元分析自动化的多智能体框架。在50个问题上实现了86%的成功率,降低了入门级用户的使用门槛,实现了人机仿真交互。