Hulu-Med:面向全面医学视觉语言理解的透明通用模型
摘要
Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。
查看缓存全文
缓存时间: 2026/07/04 12:37
论文页面 - Hulu-Med: 面向整体医学视觉语言理解的透明通用模型
来源:https://huggingface.co/papers/2510.08668 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Hulu-Med,一个透明的医学视觉语言模型,整合了多种数据模态,并通过高效训练在各种临床任务中实现了最先进的性能。
现实世界中的临床决策难以整合来自多种数据模态(包括医学文本、2D/3D图像和视频)的信息,这导致了效率低下和潜在的诊断遗漏。尽管通用型视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)(VLM (https://huggingface.co/papers?q=VLMs))展现了前景,但其在医学领域的发展面临着不透明管线、数据稀缺和架构僵化等挑战。在此,我们提出 Hulu-Med,一个透明的医学 VLM,统一了对所有这些模态的理解。基于统一的基于补丁的视觉编码器 (https://huggingface.co/papers?q=unified%20patch-based%20vision%20encoder) 和 LLM 解码器 (https://huggingface.co/papers?q=LLM%20decoder),Hulu-Med 在 1670 万(M)个样本上进行了渐进训练,从 2D 扩展到 3D 及视频理解。医学感知的令牌缩减实现了高效训练,7B 到 32B 参数变体仅需 4,000 到 40,000 GPU 小时。在 30 个基准上的广泛评估展现了最先进的性能,在涉及视觉问答、医学报告生成 (https://huggingface.co/papers?q=medical%20report%20generation) 以及多语言 (https://huggingface.co/papers?q=multilingual) 和罕见病场景 (https://huggingface.co/papers?q=rare%20disease%20scenarios) 下的复杂推理 (https://huggingface.co/papers?q=complex%20reasoning) 等任务中,超越了领先的开源模型,并与专有系统相媲美。通过开源我们完整的管线,我们证明了高性能医学 VLM 可以透明地实现,为可访问且具有影响力的临床 AI 提供了基础工具。代码已发布在 https://github.com/ZJUI-AI4H/Hulu-Med{https://github.com/ZJUI-AI4H/Hulu-Med}。
查看 arXiv 页面 (https://arxiv.org/abs/2510.08668)查看 PDF (https://arxiv.org/pdf/2510.08668)GitHub842 (https://github.com/ZJUI-AI4H/Hulu-Med)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.08668)
通过代理获取此论文:
hf papers read 2510\.08668
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型12
ZJU-AI4H/Hulu-Med-7B Image-Text-to-Text• 8B• 更新于 2025年11月27日 • 6.49k • 104 (https://huggingface.co/ZJU-AI4H/Hulu-Med-7B)
ZJU-AI4H/Hulu-Med-4B Image-Text-to-Text• 5B• 更新于 2025年11月27日 • 5.53k • 84 (https://huggingface.co/ZJU-AI4H/Hulu-Med-4B)
ZJU-AI4H/Hulu-Med-32B Image-Text-to-Text• 33B• 更新于 2025年11月27日 • 1.29k • 58 (https://huggingface.co/ZJU-AI4H/Hulu-Med-32B)
ZJU-AI4H/Hulu-Med-14B Image-Text-to-Text• 15B• 更新于 2025年11月27日 • 111 • 52 (https://huggingface.co/ZJU-AI4H/Hulu-Med-14B)
浏览引用此论文的12个模型 (https://huggingface.co/models?other=arxiv:2510.08668)## 引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。
包含此论文的收藏2
相似文章
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
Aloe-Vision:面向医疗的鲁棒视觉-语言模型
Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。
MedTVL:利用视觉和语言进行医学时间序列分类
MedTVL是一种文本引导的双路径架构,用于医学时间序列分类,它协同时间模态和视觉模态与文本语义,在各种学习设置中展示优越性。
OpenMedQ:面向医学视觉语言模型的广泛开放预训练
OpenMedQ 是一个完全开放的医学视觉语言模型,在 14 个数据集(约 335 万样本)上进行预训练,在医学 VQA 和分类基准上取得了最先进的结果。
@HuggingModels: 你是否曾想要一个能够‘看到’医学图像并回答相关问题的人工智能?这个模型,llava-medical-8B-clip-vit-…
本文介绍了 llava-medical-8B-clip-vit-stage2,这是一个专为医疗保健领域微调的专用视觉语言模型,使人工智能能够解读 X 光和 MRI 等医学图像并回答相关问题。