MODUS: 仅解码器的任意到任意多模态建模

Hugging Face Daily Papers 论文

摘要

Modus是一个仅解码器模型,能够从其他模态的任意组合预测任意模态,无需特定模态的头部或损失函数,就在多个基准测试上取得了强劲的性能。

任意到任意模型能够在单一网络内从其他模态的任意组合预测任意模态,这种设计常用于多模态视觉和视觉语言模型,并越来越多地应用于生态学、天文学等科学领域。现有的任意到任意模型通常使用编码器-解码器或扩散架构从头训练,这影响了性能,并阻止它们利用强大的预训练仅解码器模型作为先验。在这项工作中,我们研究了仅解码器的任意到任意多模态建模,该方式对称处理所有模态,支持任意模态作为输入和输出,无需特定模态的头部、损失函数或任务流水线。由于每个模态既是同一模型的输入又是输出,由此产生的模型(名为Modus)能够支持多种应用,例如通过中间模态进行链式生成,或通过使用另一个生成的模态对模型自身输出进行打分来实现跨模态自我验证。Modus展现出强大的开箱即用性能,在使用单一模型的情况下,与专业模型和多任务基线相比,在多个基准测试上具有竞争力。所有材料已开源在 https://modus-multimodal.epfl.ch/。
查看原文
查看缓存全文

缓存时间: 2026/07/29 11:52

论文页面 - MODUS:仅解码器的多种模态任意到任意建模

来源:https://huggingface.co/papers/2607.25948 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

任意到任意(any-to-any)模型能够从任意模态组合中预测任意其他模态,这一范式已被用于多模态视觉和视觉-语言模型中,并越来越多地应用于生态学和天文学等科学领域。现有的任意到任意模型通常使用编码器-解码器或扩散架构从头训练,这影响了它们的性能,并阻止它们利用强大的预训练仅解码器模型作为先验知识。在本工作中,我们研究了仅解码器的任意到任意多模态建模,该方法对称地处理所有模态,并支持任意模态作为输入和输出,而无需特定于模态的头部、损失或任务流程。由于每个模态既是同一模型的输入又是输出,所得到的模型名为Modus,能够支持一系列应用,例如通过中间模态进行链式生成,或通过使用另一种生成的模态对模型自身输出进行评分来实现跨模态自我验证。Modus展现出强大的开箱即用性能,并在多个基准测试中使用单一模型与专业模型和多任务基线模型具有竞争力。所有材料已在 https://modus-multimodal.epfl.ch/ 开源。

查看arXiv页面 (https://arxiv.org/abs/2607.25948) 查看PDF (https://arxiv.org/pdf/2607.25948) 项目页面 (https://modus-multimodal.epfl.ch/) GitHub16 (https://github.com/EPFL-VILAB/Modus) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25948)

在您的agent中获取此论文:

hf papers read 2607\.25948

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.25948以链接至此页面。

引用本文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.25948以链接至此页面。

引用本文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.25948以链接至此页面。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以链接至此页面。

相似文章

从模态到命题:一种以语言为中心的多模态智能框架

arXiv cs.AI

本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。

超越文本主导:理解全模态大语言模型的模态偏好

Hugging Face Daily Papers

# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。