ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
摘要
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
查看缓存全文
缓存时间: 2026/07/28 06:33
论文页面 - ClinFusion:面向整体医学理解的视觉中心多模态大语言模型系统
来源:https://huggingface.co/papers/2607.24743 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态大语言模型(MLLMs)在革新临床实践方面潜力巨大,然而将其部署到医疗领域本质上是一个以视觉为中心的挑战:模型必须从异构的2D和3D医学图像中吸收知识,且评估协议需与放射科医生的临床实践保持一致,并提供准确、细粒度且基于事实性的评估。本文中,我们提出ClinFusion——一个专为整体医学理解设计的视觉中心MLLM,系统性地解决了上述局限性。我们提出一种组合式级联视觉编码器架构,其核心为Cascade Spatial-Aware Locality Fusion算子,该算子能在融合编码器内统一处理多样的2D和原生3D医学图像理解。我们进一步引入一个基于视觉的评估框架,包括用于指令遵循评估的MedIF-Bench,以及一种基于感兴趣区域且符合临床实践与事实性的报告生成评估方法。我们证明,ClinFusion在涵盖视觉问答、报告生成和指令遵循的全面2D和3D多模态医学基准测试中——以及在文本医学任务上——均取得了新的最佳性能,在24个基准中的20个上超越了领先的开源医学MLLMs(例如Hulu-Med、Lingshu),并在16个基准中的13个上展现出优于GPT-5.2和Gemini-3-Flash等强大专有模型的多模态能力。此外,ClinFusion还能通过智能体工具使用进一步增强,用于检索增强和工具辅助的临床工作流。由委员会认证的放射科医生进行的盲评证实,ClinFusion生成排名最高的报告,并验证了我们基于RoI的指标在所有考察的自动评估指标中与专家判断的相关性最强。
查看arXiv页面 (https://arxiv.org/abs/2607.24743) 查看PDF (https://arxiv.org/pdf/2607.24743) 项目页面 (https://github.com/alibaba-damo-academy/ClinFusion) GitHub3 (https://github.com/alibaba-damo-academy/ClinFusion) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24743)
在您的智能体中获取此论文:
hf papers read 2607\.24743
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.24743以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.24743以从此页面链接。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.24743以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
Hulu-Med:面向全面医学视觉语言理解的透明通用模型
Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。
@AdinaYakup: ClinFusion 来自阿里巴巴达摩院的新开源医学多模态 LLM - 8B/32B(Apache2.0)- 统一 2D + 3D 图像理解…
ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。