Hulu-Med:面向全面医学视觉语言理解的透明通用模型
摘要
Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。
查看缓存全文
缓存时间: 2026/07/04 12:37
论文页面 - Hulu-Med: 面向整体医学视觉语言理解的透明通用模型
来源:https://huggingface.co/papers/2510.08668 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Hulu-Med,一个透明的医学视觉语言模型,整合了多种数据模态,并通过高效训练在各种临床任务中实现了最先进的性能。
现实世界中的临床决策难以整合来自多种数据模态(包括医学文本、2D/3D图像和视频)的信息,这导致了效率低下和潜在的诊断遗漏。尽管通用型视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)(VLM (https://huggingface.co/papers?q=VLMs))展现了前景,但其在医学领域的发展面临着不透明管线、数据稀缺和架构僵化等挑战。在此,我们提出 Hulu-Med,一个透明的医学 VLM,统一了对所有这些模态的理解。基于统一的基于补丁的视觉编码器 (https://huggingface.co/papers?q=unified%20patch-based%20vision%20encoder) 和 LLM 解码器 (https://huggingface.co/papers?q=LLM%20decoder),Hulu-Med 在 1670 万(M)个样本上进行了渐进训练,从 2D 扩展到 3D 及视频理解。医学感知的令牌缩减实现了高效训练,7B 到 32B 参数变体仅需 4,000 到 40,000 GPU 小时。在 30 个基准上的广泛评估展现了最先进的性能,在涉及视觉问答、医学报告生成 (https://huggingface.co/papers?q=medical%20report%20generation) 以及多语言 (https://huggingface.co/papers?q=multilingual) 和罕见病场景 (https://huggingface.co/papers?q=rare%20disease%20scenarios) 下的复杂推理 (https://huggingface.co/papers?q=complex%20reasoning) 等任务中,超越了领先的开源模型,并与专有系统相媲美。通过开源我们完整的管线,我们证明了高性能医学 VLM 可以透明地实现,为可访问且具有影响力的临床 AI 提供了基础工具。代码已发布在 https://github.com/ZJUI-AI4H/Hulu-Med{https://github.com/ZJUI-AI4H/Hulu-Med}。
查看 arXiv 页面 (https://arxiv.org/abs/2510.08668)查看 PDF (https://arxiv.org/pdf/2510.08668)GitHub842 (https://github.com/ZJUI-AI4H/Hulu-Med)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.08668)
通过代理获取此论文:
hf papers read 2510\.08668
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型12
ZJU-AI4H/Hulu-Med-7B Image-Text-to-Text• 8B• 更新于 2025年11月27日 • 6.49k • 104 (https://huggingface.co/ZJU-AI4H/Hulu-Med-7B)
ZJU-AI4H/Hulu-Med-4B Image-Text-to-Text• 5B• 更新于 2025年11月27日 • 5.53k • 84 (https://huggingface.co/ZJU-AI4H/Hulu-Med-4B)
ZJU-AI4H/Hulu-Med-32B Image-Text-to-Text• 33B• 更新于 2025年11月27日 • 1.29k • 58 (https://huggingface.co/ZJU-AI4H/Hulu-Med-32B)
ZJU-AI4H/Hulu-Med-14B Image-Text-to-Text• 15B• 更新于 2025年11月27日 • 111 • 52 (https://huggingface.co/ZJU-AI4H/Hulu-Med-14B)
浏览引用此论文的12个模型 (https://huggingface.co/models?other=arxiv:2510.08668)## 引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2510.08668 即可从此页面链接。
包含此论文的收藏2
相似文章
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
Aloe-Vision:面向医疗的鲁棒视觉-语言模型
Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。
OpenMedQ:面向医学视觉语言模型的广泛开放预训练
OpenMedQ 是一个完全开放的医学视觉语言模型,在 14 个数据集(约 335 万样本)上进行预训练,在医学 VQA 和分类基准上取得了最先进的结果。
MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。