TorchUMM: 一个用于评估、分析和后训练的统一多模态模型代码库

Papers with Code Trending 论文

摘要

TorchUMM 是一个统一的代码库,用于评估和分析多模态模型在理解、生成和编辑任务上的表现,采用标准化协议和多样化数据集,能够实现公平比较并深入洞察模型的优势与局限性。

近年来,统一多模态模型(UMMs)的进展导致能够理解和生成并编辑视觉与文本模态的架构大量涌现。然而,由于模型架构的多样性以及训练范式和实现细节的异质性,为UMMs开发统一框架仍然具有挑战性。在本文中,我们提出了 TorchUMM,这是首个统一的代码库,用于跨多种UMM骨干网络、任务和数据集的全面评估、分析和后训练。TorchUMM 支持涵盖广泛规模与设计范式的多种模型。我们的基准测试涵盖三个核心任务维度:多模态理解、生成和编辑,并整合了既有和新颖的数据集以评估感知、推理、组合性和指令跟随能力。通过提供统一的接口和标准化的评估协议,TorchUMM 能够实现异构模型间的公平可重复比较,并促进对其优势与局限性的更深入理解,从而推动更强大的统一多模态系统的开发。代码地址:https://github.com/AIFrontierLab/TorchUMM
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

论文页面 - TorchUMM:用于评估、分析和后训练的统一多模态模型代码库

来源:https://huggingface.co/papers/2604.10784

摘要

TorchUMM 提供了一个统一代码库,通过标准化协议和多样化数据集,对多模态模型在理解、生成和编辑任务上进行评估与分析。

近年来,统一多模态模型(UMMs)的发展催生了大量能够在视觉和文本模态间进行理解、生成和编辑的架构。然而,由于模型架构的多样性以及训练范式和实现细节的异构性,为 UMMs 构建统一框架仍然充满挑战。在本文中,我们提出 TorchUMM,这是首个用于跨多种 UMM 主干、任务和数据集进行全面评估、分析和后训练的统一代码库。TorchUMM 支持涵盖广泛规模与设计范式的大量模型。我们的基准测试涵盖三大核心任务维度:多模态理解、生成和编辑,并整合了既有和新颖的数据集,以评估感知、推理、组合性和指令跟随能力。通过提供统一接口和标准化评估协议,TorchUMM 实现了异构模型间的公平与可复现比较,促进了对其优缺点的深入洞察,从而有助于开发更强大的统一多模态系统。代码地址:https://github.com/AIFrontierLab/TorchUMM。

查看 arXiv 页面 查看 PDF 项目页面 GitHub 279 添加到收藏

在智能体中使用本文:

hf papers read 2604.10784

没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无模型关联本文

在模型 README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。

引用本文的数据集0

暂无数据集关联本文

在数据集 README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。

引用本文的 Space0

暂无 Space 关联本文

在 Space README.md 中引用 arxiv.org/abs/2604.10784 即可从本页面链接。

包含本文的收藏集1

相似文章

Lance:通过多任务协同实现统一多模态建模

Hugging Face Daily Papers

Lance 是一个统一多模态模型,采用双流混合专家架构和协作式多任务训练,在图像和视频的理解、生成及编辑方面均表现出色,超越了现有的开源统一模型。