llava

#llava

OpenMedQ：面向医学视觉语言模型的广泛开放预训练

arXiv cs.AI ↗ · 2026-06-12 缓存

OpenMedQ 是一个完全开放的医学视觉语言模型，在 14 个数据集（约 335 万样本）上进行预训练，在医学 VQA 和分类基准上取得了最先进的结果。

0 人收藏 0 人点赞

#llava

Hugging Face Daily Papers ↗ · 2026-05-09 缓存

本文介绍了 LLaVA-UHD v4，该模型通过采用基于切片（slice-based）的编码和 ViT 内部早期压缩，提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时，将计算成本降低了 55% 以上。

0 人收藏 0 人点赞