ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统

Hugging Face Daily Papers 论文

摘要

ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。

多模态大语言模型(MLLMs)在革新临床实践方面具有巨大潜力,然而在医疗领域部署它们从根本上是一个以视觉为中心的挑战:模型必须从异质的 2D 和 3D 医学图像中吸收知识,并且评估协议必须与放射科医生的临床实践保持一致,提供准确、细粒度且基于事实的评估。在本文中,我们介绍了 ClinFusion,这是一种以视觉为中心的多模态大语言模型,旨在实现全面医疗理解,系统性地解决了这些局限性。我们提出了一种组合式和级联的视觉编码器架构,其核心是 Cascade Spatial-Aware Locality Fusion 算子,该算子在一个融合编码器内统一了多样化的 2D 和原生 3D 医学图像理解。我们进一步引入了一个基于视觉的评估框架,包括用于指令遵循评估的 MedIF-Bench,以及一种基于感兴趣区域的方法,用于临床对齐且基于事实的报告生成评估。我们展示了 ClinFusion 在一整套 2D 和 3D 多模态医学基准测试中——涵盖视觉问答、报告生成和指令遵循——以及文本医学任务中,取得了新的最先进成果,在 24 个基准测试中的 20 个上优于领先的开源医疗 MLLMs(例如 Hulu-Med、Lingshu),并在 16 个基准测试中的 13 个上展示了比 GPT-5.2 和 Gemini-3-Flash 等强大专有模型更强的多模态能力,并且可以通过代理工具使用进一步增强,用于检索增强和工具辅助的临床工作流程。一项由委员会认证的放射科医生进行的盲法评估证实,ClinFusion 生成了排名最高的报告,并验证了我们基于 RoI 的指标在所有检查的自动评估指标中与专家判断的相关性最强。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - ClinFusion:面向整体医学理解的视觉中心多模态大语言模型系统

来源:https://huggingface.co/papers/2607.24743 作者:

摘要

多模态大语言模型(MLLMs)在革新临床实践方面潜力巨大,然而将其部署到医疗领域本质上是一个以视觉为中心的挑战:模型必须从异构的2D和3D医学图像中吸收知识,且评估协议需与放射科医生的临床实践保持一致,并提供准确、细粒度且基于事实性的评估。本文中,我们提出ClinFusion——一个专为整体医学理解设计的视觉中心MLLM,系统性地解决了上述局限性。我们提出一种组合式级联视觉编码器架构,其核心为Cascade Spatial-Aware Locality Fusion算子,该算子能在融合编码器内统一处理多样的2D和原生3D医学图像理解。我们进一步引入一个基于视觉的评估框架,包括用于指令遵循评估的MedIF-Bench,以及一种基于感兴趣区域且符合临床实践与事实性的报告生成评估方法。我们证明,ClinFusion在涵盖视觉问答、报告生成和指令遵循的全面2D和3D多模态医学基准测试中——以及在文本医学任务上——均取得了新的最佳性能,在24个基准中的20个上超越了领先的开源医学MLLMs(例如Hulu-Med、Lingshu),并在16个基准中的13个上展现出优于GPT-5.2和Gemini-3-Flash等强大专有模型的多模态能力。此外,ClinFusion还能通过智能体工具使用进一步增强,用于检索增强和工具辅助的临床工作流。由委员会认证的放射科医生进行的盲评证实,ClinFusion生成排名最高的报告,并验证了我们基于RoI的指标在所有考察的自动评估指标中与专家判断的相关性最强。

查看arXiv页面 (https://arxiv.org/abs/2607.24743) 查看PDF (https://arxiv.org/pdf/2607.24743) 项目页面 (https://github.com/alibaba-damo-academy/ClinFusion) GitHub3 (https://github.com/alibaba-damo-academy/ClinFusion) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24743)

在您的智能体中获取此论文:

hf papers read 2607\.24743

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.24743以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.24743以从此页面链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.24743以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

ClinLens:面向纵向多模态临床数据科学的长期编码智能体

arXiv cs.AI

ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。