Hulu-Med:面向全面医学视觉语言理解的透明通用模型

Papers with Code Trending 论文

摘要

Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。

现实世界的临床决策需要整合来自多种数据模态的信息,包括医学文本、2D/3D图像和视频,这导致了效率低下和潜在的诊断疏漏。虽然通用视觉语言模型(VLM)展现了前景,但其在医学领域的发展面临着不透明流程、数据稀缺和架构不灵活等挑战。在此,我们提出 Hulu-Med,一个透明的医学 VLM,它统一了对所有这些模态的理解。基于统一的基于补丁的视觉编码器和 LLM 解码器,Hulu-Med 在 1670 万(M)个样本上渐进式训练,从 2D 扩展到 3D 和视频理解。医学感知的令牌缩减实现了高效训练,7B 到 32B 参数变体仅需 4,000 到 40,000 GPU 小时。在 30 个基准测试中的广泛评估展示了最先进的性能,在视觉问答、医学报告生成以及多语言和罕见病场景中的复杂推理等任务上,超越了领先的开源模型,并与专有系统竞争。通过开源我们的完整流程,我们证明高性能医学 VLM 可以透明地实现,为可访问且有影响力的临床 AI 提供了基础工具。代码已发布于 https://github.com/ZJUI-AI4H/Hulu-Med{https://github.com/ZJUI-AI4H/Hulu-Med}。
查看原文
查看缓存全文

缓存时间: 2026/07/04 12:37

论文页面 - Hulu-Med: 面向整体医学视觉语言理解的透明通用模型

来源:https://huggingface.co/papers/2510.08668 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Hulu-Med,一个透明的医学视觉语言模型,整合了多种数据模态,并通过高效训练在各种临床任务中实现了最先进的性能。

现实世界中的临床决策难以整合来自多种数据模态(包括医学文本、2D/3D图像和视频)的信息,这导致了效率低下和潜在的诊断遗漏。尽管通用型视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)(VLM (https://huggingface.co/papers?q=VLMs))展现了前景,但其在医学领域的发展面临着不透明管线、数据稀缺和架构僵化等挑战。在此,我们提出 Hulu-Med,一个透明的医学 VLM,统一了对所有这些模态的理解。基于统一的基于补丁的视觉编码器 (https://huggingface.co/papers?q=unified%20patch-based%20vision%20encoder) 和 LLM 解码器 (https://huggingface.co/papers?q=LLM%20decoder),Hulu-Med 在 1670 万(M)个样本上进行了渐进训练,从 2D 扩展到 3D 及视频理解。医学感知的令牌缩减实现了高效训练,7B 到 32B 参数变体仅需 4,000 到 40,000 GPU 小时。在 30 个基准上的广泛评估展现了最先进的性能,在涉及视觉问答、医学报告生成 (https://huggingface.co/papers?q=medical%20report%20generation) 以及多语言 (https://huggingface.co/papers?q=multilingual) 和罕见病场景 (https://huggingface.co/papers?q=rare%20disease%20scenarios) 下的复杂推理 (https://huggingface.co/papers?q=complex%20reasoning) 等任务中,超越了领先的开源模型,并与专有系统相媲美。通过开源我们完整的管线,我们证明了高性能医学 VLM 可以透明地实现,为可访问且具有影响力的临床 AI 提供了基础工具。代码已发布在 https://github.com/ZJUI-AI4H/Hulu-Med{https://github.com/ZJUI-AI4H/Hulu-Med}。

查看 arXiv 页面 (https://arxiv.org/abs/2510.08668)查看 PDF (https://arxiv.org/pdf/2510.08668)GitHub842 (https://github.com/ZJUI-AI4H/Hulu-Med)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.08668)

通过代理获取此论文:

hf papers read 2510\.08668

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型12

ZJU-AI4H/Hulu-Med-7B Image-Text-to-Text• 8B• 更新于 2025年11月27日 • 6.49k • 104 (https://huggingface.co/ZJU-AI4H/Hulu-Med-7B)

ZJU-AI4H/Hulu-Med-4B Image-Text-to-Text• 5B• 更新于 2025年11月27日 • 5.53k • 84 (https://huggingface.co/ZJU-AI4H/Hulu-Med-4B)

ZJU-AI4H/Hulu-Med-32B Image-Text-to-Text• 33B• 更新于 2025年11月27日 • 1.29k • 58 (https://huggingface.co/ZJU-AI4H/Hulu-Med-32B)

ZJU-AI4H/Hulu-Med-14B Image-Text-to-Text• 15B• 更新于 2025年11月27日 • 111 • 52 (https://huggingface.co/ZJU-AI4H/Hulu-Med-14B)

浏览引用此论文的12个模型 (https://huggingface.co/models?other=arxiv:2510.08668)## 引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。

包含此论文的收藏2

相似文章

Aloe-Vision:面向医疗的鲁棒视觉-语言模型

arXiv cs.CL

Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。