资源受限农村环境下的多模态临床筛查云边协同系统
摘要
本文提出了一种用于资源受限农村环境中多模态临床筛查的云边协同架构,利用轻量级边缘模型生成结构化输出,再由云端大语言模型将其综合为临床摘要。在100个多模态病例上的评估显示,该混合系统在实现高准确率和事实依据性的同时,与纯云端基线相比,传输的数据量减少了数个数量级。
arXiv:2608.12745v1 Announce Type: new
摘要:医学人工智能已展现出专家级的诊断准确率,然而在资源受限的农村环境中,这些能力仍然在很大程度上无法获得——这些地区带宽稀缺、算力有限,且临床决策需要整合异质模态信息。我们提出了一种云边协同架构来应对这些约束:边缘端的轻量级领域专用模型将原始医学数据转换为紧凑的结构化输出,云端大语言模型再将这些输出综合为临床摘要。基于大语言模型的编排器根据患者上下文动态选择诊断工具,在无需处理无关输入的情况下促进全面的模态覆盖。我们在覆盖心脏、产科、创伤和筛查场景的20个多模态临床病例上,于三种模拟网络配置(500 kbps–5 Mbps)下进行了评估。该混合系统实现了98%–99%的诊断工具召回率和92%–96%的精确率,在临床准确性上达到或超过纯云端基线,并保持与带宽无关的延迟(25–35秒),同时词元成本降低4–15倍。这些结果凸显了架构设计在部署约束下实现高效多模态整合以及相比纯云端方法提升事实依据性方面的作用。
查看缓存全文
缓存时间: 2026/08/14 09:31
# 面向资源受限农村环境的多模态临床筛查的云边协同系统 来源: https://arxiv.org/html/2608.12745 ###### 摘要 医学AI已展现出专家级的诊断准确性,然而在带宽稀缺、计算受限、临床决策需要整合异质模态的资源受限农村环境中,这些能力在很大程度上仍无法使用。我们提出了一种云边协作架构来解决这些约束:边缘端的轻量级领域专用模型将原始医学数据转换为紧凑的结构化输出,而云端LLM将这些输出综合为临床摘要。一个基于LLM的编排器根据患者上下文动态选择诊断工具,在不处理无关输入的前提下推动相关模态的覆盖。我们在涵盖心脏、产科、创伤、眼科和筛查场景的100个多模态临床病例上进行了评估——包括缺失模态的稀疏输入表现和包含许多重叠输入的密集输入表现——在三种模拟网络配置文件(500 kbps–5 Mbps)下,全程报告95%置信区间。该混合系统取得了最高的oracle准确率(0.87–0.90)和最强的事实依据(KG精确率高达0.96),同时保持了较高的覆盖精确率(0.95–0.99),而向云端传输的结构化证据仅约6.5 KB——比纯云端基线低三个数量级。在高达15倍的较低token成本下,它保持了与带宽无关的延迟(25–38秒)。这些结果强调了架构设计在部署约束下不仅减少上传大小,而且提高证据选择性和事实依据方面的作用。 ††proceedings:PMLR: Proceedings of Machine Learning Research††volume:340††year:2026††workshop:Machine Learning for Healthcare ###### 关键词 农村医疗, 边缘AI, 多智能体系统, 临床决策支持, 远程医疗 # 1 引言 医学AI现在可以媲美专家阅读胸部X光片31 (https://arxiv.org/html/2608.12745#bib.bib7)、分类心律失常13 (https://arxiv.org/html/2608.12745#bib.bib10) 并分级视网膜疾病12 (https://arxiv.org/html/2608.12745#bib.bib6)。然而,这些进展尚未惠及最需要它们的农村社区2 (https://arxiv.org/html/2608.12745#bib.bib34);14 (https://arxiv.org/html/2608.12745#bib.bib2);37 (https://arxiv.org/html/2608.12745#bib.bib1)。脱节之处不在于AI能做什么,而在于临床诊断的发生地点和方式。临床诊断本质上是多模态和多轮次的。如图1 (https://arxiv.org/html/2608.12745#S1.F1) 所示,农村诊所中典型的诊断/临床工作流从患者主诉开始,迭代地订购并解读多种检查,并综合各模态的发现。在农村诊所中支持这一过程受到三个现有系统无法满足的基本约束。首先,AI系统必须在单次就诊中决定获取哪些检查并收集足够证据,因为后续随访往往因长途跋涉、交通不可靠和诊所可用性有限而延迟或不可用6 (https://arxiv.org/html/2608.12745#bib.bib43);36 (https://arxiv.org/html/2608.12745#bib.bib42)。此外,来自农村诊所的专家转诊大约有一半从未完成1 (https://arxiv.org/html/2608.12745#bib.bib41)。其次,在没有现场专家监督的情况下,它应该可靠地摄入和解释多样的检查模态。最后,它必须在严重的带宽和计算约束下工作,因为农村宽带速度通常在0.5–25 Mbps之间,且经常掉线10 (https://arxiv.org/html/2608.12745#bib.bib3)。 图注 图1: 当前农村诊断工作流。患者前往由技术人员(没有现场专家)组成的农村诊所,技术人员获取任何看起来临床相关的模态。随后患者等待数天至数周以获得远程专家反馈。如果模态覆盖足够,则进行诊断和治疗;否则,患者被要求返回进行额外就诊。每一轮都会产生流失。 现有方法仅部分解决了这些约束。领域专用医学模型(如颈动脉超声19 (https://arxiv.org/html/2608.12745#bib.bib40)、胎儿超声24 (https://arxiv.org/html/2608.12745#bib.bib32);38 (https://arxiv.org/html/2608.12745#bib.bib19)、胸部X光片5 (https://arxiv.org/html/2608.12745#bib.bib20);18 (https://arxiv.org/html/2608.12745#bib.bib11) 和血压读数3 (https://arxiv.org/html/2608.12745#bib.bib31))在个别模态上达到了专家级准确率,并可高效部署在边缘硬件上,但它们仅孤立地在单一模态上运行,无法决定获取什么或在各检查之间综合发现。相比之下,多模态LLM可以跨异质输入进行推理,原则上可以处理综合步骤,但它们的规模使其只能在云端运行,需要上传原始医学数据进行推理,这在农村带宽约束下通常不可行。此外,它们在专业医学模态上的感知准确性仍落后于任务特定的专家模型。这些局限性凸显了一个根本性差距:没有现有系统能够在真实世界的资源约束下同时支持高效部署、多模态整合和可靠的临床推理。在这项工作中,我们通过引入一个*云边协作多智能体系统*来解决这一差距,该系统将边缘端的轻量级领域专用模型与云端的集中推理相结合。边缘模型将原始医学数据转换为紧凑的结构化输出,消除了传输带宽密集型输入的需要。边缘端的编排器动态选择调用哪些诊断工具,确保在患者就诊期间获取临床相关的模态。云端推理代理将这些输出整合为连贯的临床摘要和建议。该设计利用了专用感知模型和通用推理模型的互补优势,同时尊重真实世界的部署约束。我们在跨越心脏、产科、创伤、眼科和筛查表现的100个多样化多模态临床病例上,在三种模拟网络配置文件下进行了评估。该系统在临床准确性上具有竞争性至最佳表现,在所有配置中实现了最强的事实依据,并以显著较低的token成本保持与带宽无关的延迟。关键是,我们发现感知与推理之间的架构边界不仅影响效率,还影响临床错误的性质:混合系统产生更具选择性、更有依据的证据,并且比基于云端的智能体系统和直接对原始数据进行推理的多模态LLM产生更少的幻觉。我们做出以下贡献: - •一种新颖的云边协作架构,用于多模态临床筛查,利用边缘编排器实现选择性检查模态获取,利用领域专用边缘模型实现专家级解读,并利用云端LLM进行跨模态推理。 - •一个针对带宽受限临床AI的新颖评估框架,包括100个具有真实诊断数据的多模态病例(包括真实世界眼科教学病例)、稀疏和密集输入压力设置、三种模拟农村网络配置文件,以及一个四轴临床质量评估,包括oracle指标、工具覆盖指标、KG验证和推理质量分解,全程报告95%置信区间。 - •一个新奇的分析,关于架构如何塑造诊断选择性、事实依据和失败模式特征。 #### 通用洞见 我们表明,感知与推理之间的架构边界不仅是一个效率选择,而且改善了事实依据:将云端LLM限制为在结构化边缘工具输出上推理,而不是在原始医学数据上推理,使临床声明保持在与可验证证据的关联上,并产生比纯云端推理高得多的事实*精确率*。临床上,这种解耦在农村连接下提供了高精度、有良好依据的模态覆盖(覆盖精确率0.95–0.99;KG精确率最高0.96),并具有与带宽无关的延迟(25–38秒),表明低带宽、资源受限的临床环境可能受益于将LLM限制为推理、将感知委托给边缘专用模型的混合架构。 # 2 相关工作 #### 远程医疗、云、边缘和多模态医学AI 远程医疗通过将患者数据传输给集中专家实现远程诊断4 (https://arxiv.org/html/2608.12745#bib.bib21),并在COVID-19期间加速采用15 (https://arxiv.org/html/2608.12745#bib.bib4),基于云的医学AI现已在皮肤病学、放射学和眼科学中达到高准确率8 (https://arxiv.org/html/2608.12745#bib.bib5);31 (https://arxiv.org/html/2608.12745#bib.bib7);12 (https://arxiv.org/html/2608.12745#bib.bib6)——但这些方法传输带宽密集的原始数据,并假设可靠的连接。轻量级领域专用模型的边缘部署能够实现低延迟、成本高效的推理13 (https://arxiv.org/html/2608.12745#bib.bib10);16 (https://arxiv.org/html/2608.12745#bib.bib8);33 (https://arxiv.org/html/2608.12745#bib.bib9);18 (https://arxiv.org/html/2608.12745#bib.bib11),但仅限于单模态推理,没有跨模态整合或更高层次的推理。多模态视觉-语言系统整合图像和文本用于报告生成和VQA42 (https://arxiv.org/html/2608.12745#bib.bib39),但通常局限于图像-文本对,假设集中处理,并且不能泛化到带宽约束下的异质临床模态。 #### LLM编排与基于智能体的系统 LLM已经被探索用于工具使用和多步推理34 (https://arxiv.org/html/2608.12745#bib.bib12)。在医学领域,MedAgent-Pro39 (https://arxiv.org/html/2608.12745#bib.bib35) 使用RAG检索的指南规划和调用专用视觉工具;MedCoAct43 (https://arxiv.org/html/2608.12745#bib.bib36) 使用置信度感知的医生-药剂师协作;而AgentClinic35 (https://arxiv.org/html/2608.12745#bib.bib37) 在不完全信息下对顺序决策进行基准测试。然而,这些*系统*在云端运行,并且如果是多模态的,则假设预先收集的输入包——例如MedAgent-Pro会丢弃其输入缺失的计划步骤,而不是请求它们。我们的编排器而是在就诊期间即席组装证据集,每次调用都是边缘端模态获取,跨轮次扩展状态(§3.4 (https://arxiv.org/html/2608.12745#S3.SS4))——*获取与分析*编排在一个不断增长的数据包上,而不是对固定数据包的分析路由,这是当没有远程专家预先选择输入时的工作模式。23 (https://arxiv.org/html/2608.12745#bib.bib38) 进一步报告了在10–100倍的token成本和2–3倍的延迟下,只有适度的智能体准确性提高(0.5–8.9%),我们的边缘本地设计目标正是针对这种成本概况。如表1 (https://arxiv.org/html/2608.12745#S2.T1) 中总结的,没有现有系统同时支持边缘执行、多模态整合、带宽感知编排和在部署约束下的可靠临床推理;我们的评估单独隔离了每个选择(边缘预处理、动态工具选择、结构化通信)如何影响临床质量。 表1: 与先前工作在一般系统能力上的比较。✓ = 完全支持,△ = 部分支持,✗ = 不支持。 # 3 系统架构 ### 3.1 概述 该系统由两层组成,通过轻量级通信协议连接(图2 (https://arxiv.org/html/2608.12745#S3.F2))。边缘感知层运行在本地硬件上,托管用于医学成像和生理信号的专用模型,而云推理层使用大型语言模型将其输出综合为临床摘要。边缘编排器根据患者上下文选择调用哪些工具,并在收集到足够证据后将结果转发到云端。关键的架构不变量是:原始图像、视频或信号数据不跨越边缘-云边界。所有通信都由结构化JSON负载组成(诊断标签、置信度分数和质量标志),提供独立于输入大小的带宽保证,并将云端LLM限制在可验证证据上。 图注 图2: 提出的云边系统架构。本地部署(虚线外框)将农村技术人员与边缘编排器(§3.4)耦合在一起。在就诊期间,编排器(1)从技术人员处接收原始采集数据和患者上下文,(2)当覆盖不足时从其技能库请求额外工具,可选地将请求路由回技术人员以进行进一步的患者采集(虚线),(3)接收每个调用工具的结构化输出(发现、概率、关键测量),可能跨越多轮。如果即使在回退后输入质量或可用证据仍然不足,编排器将*弃权*作为终止动作(红色虚线),以重采集指导结束病例。一旦证据足够,(4)编排器将结构化病例记录转发给云端LLM(§3.3),(5)云端LLM返回诊断摘要给边缘端。箭头颜色编码通信位置:本地工具使用(蓝色)与云端往返(绿色)。原始采集和工具编排保持在设备上。 ### 3.2 边缘感知层 边缘层由十七个专用诊断工具组成,涵盖心脏、产科、创伤/筛查和眼科模态:颈动脉超声(UltraBot19 (https://arxiv.org/html/2608.12745#bib.bib40))、胎儿超声(FetalCLIP24 (https://arxiv.org/html/2608.12745#bib.bib32);38 (https://arxiv.org/html/2608.12745#bib.bib19))、12导联心电图(ECGNet13 (https://arxiv.org/html/2608.12745#bib.bib10);11 (https://arxiv.org/html
相似文章
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。
MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
以部署为中心的评估:预测临床LLM系统中的查询级拒绝风险
本文对集成在电子健康记录中的LLM系统进行了以部署为中心的评估,训练了一个分类器,利用提供者类型和科室等响应前上下文来预测查询级拒绝风险,在4.5个月的反馈中实现了0.719的AUROC。
基于LLM生成的合成数据训练的模型的临床沟通处理:结构化综述与新型应用案例研究
本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。