MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架
摘要
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
查看缓存全文
缓存时间: 2026/07/13 15:51
论文页面 - MedPMC:面向基础模型的高保真医学多模态数据扩展系统框架
来源:https://huggingface.co/papers/2607.07673 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
医学本质上是多模态的,需要临床医生综合来自不同数据流的信息。然而,多模态基础模型的开发因难以获取大规模、高质量的临床数据而受到限制。尽管PubMed Central(PMC)提供了专家撰写的图像-文本数据作为补充来源,但现有基于PMC的资源在保真度、可重复性和临床验证方面仍然有限。我们提出MedPMC,这是一个自动化、可持续更新的框架,可将许可开放的文献转化为用于医学多模态模型的高保真基础设施。应用于610万篇PMC文章,MedPMC策划了1100万个医学图像-文本对。组件评估显示,在初步筛选(F1=93.2)、多面板图形检测(F1=96.5)、图形分离(mAP=89.8)、标题分离与对齐(F1=81.4;ROUGE-L=85.3)以及医学图形分类(F1=96.5)方面均表现出色。经过五名标注员(其中三人接受过医学培训)的人工审查,发现MedPMC中95.3%的图像具有医学相关性,而先前基于PMC的数据集仅为19.7%。在涵盖11个专科的26个基准测试中,一个经MedPMC训练的CLIP风格模型,尽管使用的图像-文本对不到一半,但在平均零样本AUC上比最强的架构匹配生物医学CLIP基线提高了7.1个百分点。作为多模态大语言模型中的视觉编码器,它在两个基准测试上分别将医学视觉问答性能提高了1.9和16.9个百分点。在耶鲁纽黑文健康系统的10,524张皮肤科照片中,它将形态学到图像的检索Recall@5提高了11.7个百分点。这些发现表明,高保真文献策展能够增强医学多模态基础模型在基准和临床场景中的表现。我们公开发布了框架、语料库、基准测试和预训练模型。
查看arXiv页面 (https://arxiv.org/abs/2607.07673)查看PDF (https://arxiv.org/pdf/2607.07673)GitHub1 (https://github.com/Yale-BIDS-Chen-Lab/MedPMC)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.07673)
在您的智能体中获取本文:
hf papers read 2607.07673
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接本文
在模型的README.md中引用arxiv.org/abs/2607.07673,即可在此页面中链接到它。
引用本文的数据集 0
无数据集链接本文
在数据集的README.md中引用arxiv.org/abs/2607.07673,即可在此页面中链接到它。
引用本文的Spaces 0
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2607.07673,即可在此页面中链接到它。
收录本文的收藏集 1
相似文章
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
OpenMHC:加速可穿戴基础模型科学研究
OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。
MedMix: 在模态异构性下的专业化一致性联邦稀疏MoEs
MedMix是一个语义对齐框架,用于联邦多模态稀疏MoE,通过协调路由和专家专业化解决模态异构性,在医疗AI数据集上实现性能提升。
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。