Aloe-Vision:面向医疗的鲁棒视觉-语言模型

arXiv cs.CL 论文

摘要

Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。

arXiv:2606.27500v1 Announce Type: cross 摘要:专门面向医疗领域的大型视觉-语言模型(LVLMs)正成为有前景的研究方向,因其在临床和生物医学应用中的潜在影响。然而,进展受到高质量医学多模态数据的稀缺、对安全关键场景中模型鲁棒性的担忧,以及狭窄且可能被污染的评估基准制约,这些因素限制了可靠评估。为解决这些问题,该领域需要最先进的解决方案应是完全开放和可复现的系统,所有组件都可被检查、评估和改进。本工作引入了 Aloe-Vision-Data,一个大规模、经质量过滤的混合数据集,整合了多模态和纯文本来源的医学与通用领域,专为模型微调直接使用而设计。基于该数据集,我们训练了 Aloe-Vision 系列医学 LVLMs,以两种规模(7B 和 72B)公开释放了完整权重、训练配方和数据。通过全面的基准测试,我们证明高质量的混合训练数据能产生平衡的 LVLMs,在保持通用能力的同时,相比基线模型有显著提升,并达到与最先进替代方案相竞争的性能。为支持可靠评估,我们引入了 CareQA-Vision,这是一个精心策划的视觉基准,源自西班牙医学和护理专科住院医师入学考试 MIR 和 EIR,提供了新颖且污染可能性低的视觉问题。最后,我们表明当前的 LVLMs 仍容易受到对抗性和误导性输入的影响,突显了临床环境中的可靠性挑战。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# Aloe-Vision:面向医疗领域的鲁棒性视觉-语言模型

来源:https://arxiv.org/html/2606.27500
\\jmlryear

2026\\jmlrworkshopFull Paper – MIDL 2026\\jmlrvolume– 206\\midlauthor\\NameJaume Guasch\-Martí\\Emailjaume\.guasch@bsc\.es \\NameEnrique Lopez\-Cuena\\Emailenrique\.lopez@bsc\.es \\NameMartín Suárez\-Fernández\\Emailmartin\.suarez@bsc\.es \\NameJordi Bayarri\-Planas\\Emailjordi\.bayarri@bsc\.es \\NameAnna Arias\-Duart\\Emailanna\.ariasduart@bsc\.es \\NameDario Garcia\-Gasulla\\Emaildario\.garcia@bsc\.es \\addrBarcelona Supercomputing Center \(BSC\)

###### 摘要

针对医疗领域的大规模视觉-语言模型(LVLMs)正因其在临床和生物医学应用中的潜在影响而成为一个有前景的研究方向。然而,其进展受到高质量医学多模态数据的稀缺、在安全关键场景下的鲁棒性担忧,以及用于可靠评估的基准测试存在狭窄且可能被污染的问题等制约。为解决这些问题,该领域需要完全开放且可复现的先进系统,其中所有组件都能够被检查、评估和改进。本文引入了 **Aloe-Vision-Data**,这是一个大规模、经过质量过滤的混合数据集,整合了医学和通用领域中的多模态及纯文本数据源,专为直接用于模型微调而设计。基于此数据集,我们训练了 **Aloe-Vision** 系列医疗 LVLM 模型,以两种规模(7B 和 72B)公开了完整权重、训练方案和数据。通过全面的基准测试,我们证明了高质量的训练混合能够产生平衡的 LVLM,在基线模型基础上取得显著提升,且不损害通用能力,在与先进替代方案的竞争中表现优异。为支持可靠的评估,我们引入了 **CareQA-Vision**,这是一个精心策划的视觉基准测试,源自西班牙医学和护理专科住院医师入学考试(MIR 和 EIR 考试),提供了污染可能性极低的全新视觉问题。最后,我们表明当前的 LVLM 在面对对抗性和误导性输入时仍然脆弱,凸显了临床环境中的可靠性挑战。

###### 关键词:

LVLM,医疗,对抗性评估

††editors:Accepted for publication at MIDL 2026## 1 引言

大规模视觉-语言模型(LVLMs)在通用多模态领域取得了显著进展,其联合处理图像和文本的能力使其自然契合医学的多模态本质——在医学中,视觉数据(例如 X 光片、CT 扫描、组织病理切片)需要与临床叙述、病史和诊断报告一并解读。然而,尽管潜力巨大,医疗 LVLM 的进展仍然有限,且尚未达到人类水平 (sun2024pathmmu),这主要源于三个关键挑战。首先,高质量医学图像-文本数据的可用性仍然严重受限,这限制了训练能够跨模态、病理和解剖结构泛化的 LVLM 所需的规模与多样性。其次,评估实践严重依赖医学视觉问答(VQA)基准测试,这些基准测试通常包含噪声,并且公开时间过长,存在污染风险,导致对模型性能的评估不可靠或过于乐观。第三,即使是先进的 LVLM 在面对对抗性、模糊或误导性提示时也表现出明显的脆弱性,暴露了在安全关键的临床环境中不可接受的鲁棒性失败。这些限制共同凸显了对完全开放、文档完善且可复现的 LVLM 的迫切需求,这些模型可以作为临床和生物医学应用的可信基础。

为应对这些挑战,我们引入了 **Aloe-Vision**,一个开放且可复现的医疗 LVLM 系列,实现了与先进水平相竞争的性能。这些模型在 **Aloe-Vision-Data** 上训练,这是一个平衡且经过质量过滤的混合数据集,经过明确策划,可直接用于 LVLM 微调。它整合了四种类型的数据:(1) 用于视觉临床推理的多模态医学数据集,(2) 用于保持视觉能力的通用多模态数据,(3) 用于领域特定知识的医学纯文本数据,以及 (4) 用于维持对话流畅性的通用纯文本数据。每种数据类别的比例由贡献损失的 token 数量而非原始样本数量决定,确保跨数据模态的均匀影响,并防止较长样本主导训练信号。除标准清洗外,我们应用了半自动过滤流程,利用基于 LVLM 的评分和答案困惑度来移除低质量或不一致的注释。我们通过感知哈希消除与基准数据集中的重复项,防止泄露。为获得超越标准医学 VQA 基准的全景视角,我们评估了模型在医学多模态、医学纯文本、通用多模态和通用纯文本任务上的表现。我们还引入了一个新的医学视觉基准 **CareQA-Vision**,该基准专门用于在完全未见过的病例上评估临床推理能力。最后,我们在对抗条件下评估了医疗 LVLM 的鲁棒性,测试了它们在面对误导性或多模态矛盾线索时的可靠性。

总之,本工作的核心贡献是提供完全开放且可复现的医疗 LVLM,供社区在此基础上构建。这通过以下三个组件得以实现,这些组件均已公开发布¹¹¹https://huggingface.co/collections/HPAI-BSC/healthcare-vlms-aloe-vision:

- •**Aloe-Vision-Data**:一个可直接用于训练的平衡混合数据集,涵盖模态(多模态 vs. 纯文本)和领域(医学 vs. 通用)。
- •**Aloe-Vision**:一个开放的医疗 LVLM 系列,对对抗攻击具有改进的鲁棒性,并在医疗和通用领域表现出色。
- •**CareQA-Vision**:一个从西班牙住院医师入学考试中精选的基准测试,用于评估模型在未见数据上的表现。

## 2 相关工作

#### 医学多模态模型

大规模语言模型(LLMs)的发展为处理临床文本奠定了基础 (singhal2023towards; chen2023meditron)。随后,该架构通过集成视觉编码器被扩展为多模态 LLM,以支持混合模态输入的处理 (liu2023visual; bai2023qwen)。这些通用进展已被迁移到医疗领域,用于处理医学影像。早期适配工作如 MedFlamingo (moor2023med)、LLaVA-Med (li2023llava) 和 MedGemini (saab2024capabilities) 证明,在医学图像上微调通用 LVLM 能产生强大的视觉问答(VQA)能力,但它们仍局限于较小的参数和数据规模。后续发展采用了能力更强的基座模型和更大规模训练语料库。HuatuoGPT-Vision (chen2024huatuogpt) 将清洁的 PubMed VQA 对整合到基于 Yi 1.5 (young2024yi) 的模型中,是少数完全开放的工作之一,但其性能现已落后于更近期的系统。GMAI-VL (li2024gmai) 将三阶段对齐流程与 550 万图像-文本对相结合,但其模型仍处于封闭状态。最后,最近的 Lingshu (xu2025lingshu) 和 Hulu-Med (jiang2025hulu) 改进了技术水平,但仅部分开放,限制了透明度和评估。我们的工作引入了 **Aloe-Vision**,其性能与这些先进系统相当,同时提供了 7B 和 72B 规模的完全可复现医疗 LVLM,并发布了完整的训练数据、方案和预处理步骤。

#### 大规模医学多模态数据集

训练语料库已从数千对扩展到数百万对。PubMedVision (chen2024huatuogpt) 过滤并精炼了现有的 PubMed 图像集(PMC-OA、LLaVA-Med PMC、PMC-Inline),生成了 91.5 万张医学图像,并通过 GPT-4V 合成了 130 万个 VQA 对。GMAI-VL-5.5M (li2024gmai) 聚合了 219 个专家数据集,涵盖 13 种成像模态和 18 个专科领域,使用 GPT-4o 将分类和检测注释转换为 550 万个描述和指令样本;然而,该数据集本身并未公开发布。MedTrinity-25M (xiemedtrinity) 采用基于检索的增强生成与领域特定分割模型,自动为 2500 万张图像生成 ROI 锚定的三元组,无需配对的文本描述。近期工作构建了包含医学多模态、医学文本、通用多模态和通用文本的四路混合集:Lingshu (xu2025lingshu) 策划了这样的混合集但未披露类别比例,而 Hulu-Med (jiang2025hulu) 报告了类似的四路组成但未发布混合集。相比之下,我们发布了第一个**可直接用于训练、平衡的混合集**,采用基于损失 token 的加权方案,避免对较长样本的过拟合。

#### 评估基准

传统的医学 VQA 数据集,如 SLAKE (liu2021slake)、PathVQA (he2020pathvqa) 和 VQA-RAD (lau2018dataset),仍被广泛使用,但它们过于局限,无法有效评估现代 LVLM。这一差距推动了更全面、更具挑战性的基准测试的发展。GMAI-MMBench (ye2024gmai) 将 284 个专家数据集整合为 2.6 万个问题,涵盖区域级、框级、遮罩级和图像级推理,跨越 38 种成像模态和 18 个临床科室。OmniMedVQA (hu2024omnimedvqa) 将 73 个医学分类数据集转换为 12.8 万个多项选择题(MCQ),涵盖 12 种模态和 20 多个解剖区域。在病理学领域,PathMMU (sun2024pathmmu) 提供了 3.3 万个经专家验证的 QA 对,证明 LVLM 的性能显著低于经委员会认证的病理学家。ProbMed (yan2025worse) 通过将真实查询与否定幻觉版本配对,引入了对抗性评估。我们组装了一个全面的基准测试套件,统一了医学多模态、医学纯文本、通用多模态和通用纯文本任务,以获得模型质量的全景视角。为此,我们结合了上述基准测试,引入了 **CareQA-Vision** 作为一个无污染的医学视觉基准,并使用 HEART 框架 (heart2025) 在对抗条件下评估 LVLM。

## 3 训练数据

为在提高医学视觉推理能力的同时保持广泛的对话能力,我们沿两个轴构建了一个平衡的训练混合集:模态(多模态 vs. 纯文本)和领域(医学 vs. 通用)。在医学多模态数据中,既包含全局图像理解,也包含细粒度的区域定位推理。最终的 **Aloe-Vision-Data** 混合集来自八个数据集,详见表 1。

表 1:经过预处理、泄露移除、质量过滤和基于 token 的重新平衡后的 SFT 训练混合集最终组成。| 数据集 | 样本数 | 损失 token(百万) | 模态 | 领域 | B. Boxes |
|---|---|---|---|---|---|---|
| PubMedVision (chen2024huatuogpt) | 1.26M | 175.3 | 多模态 | 医学 | 否 |
| MedMax (bansal2024medmax) | 409K | 33.7 | 多模态 | 医学 | 否 |
| MeCoVQA (huang2025towards) | 27.5K | 0.7 | 多模态 | 医学 | 是 |
| Med-GRIT (huang2024refer) | 17.7K | 2.6 | 多模态 | 医学 | 是 |
| MedTrinity-25M (xiemedtrinity) | 330K | 55.5 | 多模态 | 医学 | 是 |
| Cambrian-10M (tong2024cambrian) | 668K | 65.4 | 多模态 | 通用 | 否 |
| Aloe (gururajan2024aloe) | 756K | 190.3 | 文本 | 医学 | – |
| Magpie-Ultra-v1.0 (huggingface_magpie_ultra) | 100K | 116.6 | 文本 | 通用 | – |
| **总计** | **3.57M** | **640.0** | – | – | – |

#### 预处理与标准化

样本被转换为统一的对话模式(交替的 user/assistant 消息),支持多轮对话。该结构支持交错的多模态输入,允许包含多张图像与文本混合的序列。区域级监督使用 Qwen2-VL (wang2024qwen2) 格式进行标准化,使用标记 <|box_start|>(xtl, ytl), (xbr, ybr)<|box_end|>,并将坐标归一化到 [0, 1000)。清洗步骤包括:(1) 移除缺失/损坏的图像,(2) 最小尺寸 50×50,(3) 每个样本最多 5 张图像以避免训练不稳定,以及 (4) 序列长度过滤为 4096 个 token。MedTrinity-25M (xiemedtrinity) 被随机子采样至 40 万个序列,以避免带有渲染框的图像过度代表。

#### 评估泄露防范

我们使用 64 位感知哈希(pHash)(imagehash) 明确控制对评估集的泄露,该哈希可检测所有训练与评估图像之间的近重复图像,即使在缩放或压缩条件下也能生效。这移除了 6273 个训练样本,确保报告的性能提升不会因训练-评估重叠而被高估。

#### 半自动质量过滤

对医学多模态数据集的手动检查揭示了低质量案例(例如,回答写在图像上、图像与问题无关、问答不匹配,见图 4)。鉴于数据规模,我们采用双信号半自动过滤器:

- •**LVLM 标记**:提示 Qwen2.5-VL-72B-Instruct (yang2025qwen2) 根据图像、问题和答案之间的一致性与相关性,为每个样本生成 1-5 的质量评分。提示词摘录见附录 A.1。
- •**答案困惑度**:使用 Qwen2-VL-7B-Instruct (wang2024qwen2) 计算在给定图像和问题条件下答案的困惑度。极低的困惑度通常标记琐碎的答案(例如,答案在图像中可见),而极高的困惑度则表示噪声或错误注释。

每个数据源的质量评分和困惑度阈值均通过手动审查高/低评分/困惑度示例来定义,确保过滤适应每个数据集的特定特征。总共排除了 541,237 个样本。

#### 基于 token 的重新平衡

早期的训练运行显示,尽管样本数量是平衡的,但存在与答案长度相关的偏差。为纠正这一点,我们按**贡献损失的 token**(仅助手 token)而非按示例重新平衡混合集。对于每个数据集,计算 token 统计量(总 token、损失 token、文本 token、图像 token),并对具有长答案(如思维链推理轨迹)的数据源进行子采样,以均衡其有效梯度贡献。此过程保留了预期的模态/领域比例,同时减轻了长格式数据集带来的偏差。

图 1:最终训练混合集在成像模态(行)和医学专科(列)上的类别覆盖分析。

#### 覆盖分析

我们评估数据集沿三个轴的多样性(成像模态、医学专科、解剖结构),重点关注其组合的覆盖度而非每个单独轴的均衡性。在半自动质量过滤(第 3 节)期间,额外提示 Qwen2.5-VL-72B-Instruct 根据三元组(问题、图像、答案)提供的信息为每个样本标记这些轴的类别,从而构建覆盖热力图。图 1 展示了成像模态与医学专科的分布。在排除无意义案例(例如,眼底-骨骼、血管造影-牙科)后,数据集表现出强大且平衡的表示。

#### 最终混合集

最终的 SFT 混合集包含约 357 万个样本和约 6.4 亿个损失 token(见表 1)。按损失 token 计算,分配为:医学多模态 41.8%(2.678 亿),医学纯文本 29.7%(1.903 亿),通用文本

相似文章