TorchUMM: 一个用于评估、分析和后训练的统一多模态模型代码库
摘要
TorchUMM 是一个统一的代码库,用于评估和分析多模态模型在理解、生成和编辑任务上的表现,采用标准化协议和多样化数据集,能够实现公平比较并深入洞察模型的优势与局限性。
查看缓存全文
缓存时间: 2026/07/21 06:47
论文页面 - TorchUMM:用于评估、分析和后训练的统一多模态模型代码库
来源:https://huggingface.co/papers/2604.10784
摘要
TorchUMM 提供了一个统一代码库,通过标准化协议和多样化数据集,对多模态模型在理解、生成和编辑任务上进行评估与分析。
近年来,统一多模态模型(UMMs)的发展催生了大量能够在视觉和文本模态间进行理解、生成和编辑的架构。然而,由于模型架构的多样性以及训练范式和实现细节的异构性,为 UMMs 构建统一框架仍然充满挑战。在本文中,我们提出 TorchUMM,这是首个用于跨多种 UMM 主干、任务和数据集进行全面评估、分析和后训练的统一代码库。TorchUMM 支持涵盖广泛规模与设计范式的大量模型。我们的基准测试涵盖三大核心任务维度:多模态理解、生成和编辑,并整合了既有和新颖的数据集,以评估感知、推理、组合性和指令跟随能力。通过提供统一接口和标准化评估协议,TorchUMM 实现了异构模型间的公平与可复现比较,促进了对其优缺点的深入洞察,从而有助于开发更强大的统一多模态系统。代码地址:https://github.com/AIFrontierLab/TorchUMM。
查看 arXiv 页面 查看 PDF 项目页面 GitHub 279 添加到收藏
在智能体中使用本文:
hf papers read 2604.10784
没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。
引用本文的数据集0
暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。
引用本文的 Space0
暂无 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。
包含本文的收藏集1
相似文章
UniCorn:通过自生成监督走向自我改进的统一多模态模型
UniCorn 是一个框架,通过使用多智能体系统进行提示生成、图像创建和质量评估,使统一多模态模型能够自我改进,在 TIIF、WISE 和 OneIG-EN 等文本到图像基准上取得了最先进的结果。
LatentUMM:统一多模态模型的双重潜在对齐
LatentUMM 引入了双重潜在对齐,通过对齐转换和稳定潜在动态,来改善统一多模态模型中的跨模态一致性。
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
Lance:通过多任务协同实现统一多模态建模
Lance 是一个统一多模态模型,采用双流混合专家架构和协作式多任务训练,在图像和视频的理解、生成及编辑方面均表现出色,超越了现有的开源统一模型。
文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试
本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。