MODUS: 仅解码器的任意到任意多模态建模
摘要
Modus是一个仅解码器模型,能够从其他模态的任意组合预测任意模态,无需特定模态的头部或损失函数,就在多个基准测试上取得了强劲的性能。
查看缓存全文
缓存时间: 2026/07/29 11:52
论文页面 - MODUS:仅解码器的多种模态任意到任意建模
来源:https://huggingface.co/papers/2607.25948 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
任意到任意(any-to-any)模型能够从任意模态组合中预测任意其他模态,这一范式已被用于多模态视觉和视觉-语言模型中,并越来越多地应用于生态学和天文学等科学领域。现有的任意到任意模型通常使用编码器-解码器或扩散架构从头训练,这影响了它们的性能,并阻止它们利用强大的预训练仅解码器模型作为先验知识。在本工作中,我们研究了仅解码器的任意到任意多模态建模,该方法对称地处理所有模态,并支持任意模态作为输入和输出,而无需特定于模态的头部、损失或任务流程。由于每个模态既是同一模型的输入又是输出,所得到的模型名为Modus,能够支持一系列应用,例如通过中间模态进行链式生成,或通过使用另一种生成的模态对模型自身输出进行评分来实现跨模态自我验证。Modus展现出强大的开箱即用性能,并在多个基准测试中使用单一模型与专业模型和多任务基线模型具有竞争力。所有材料已在 https://modus-multimodal.epfl.ch/ 开源。
查看arXiv页面 (https://arxiv.org/abs/2607.25948) 查看PDF (https://arxiv.org/pdf/2607.25948) 项目页面 (https://modus-multimodal.epfl.ch/) GitHub16 (https://github.com/EPFL-VILAB/Modus) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25948)
在您的agent中获取此论文:
hf papers read 2607\.25948
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.25948以链接至此页面。
引用本文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.25948以链接至此页面。
引用本文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.25948以链接至此页面。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以链接至此页面。
相似文章
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架
本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。
MACS: 面向高效多模态MoE推理的模态感知容量缩放
MACS是一个无需训练的推理框架,通过引入熵加权负载和动态模态自适应容量机制,减轻多模态MoE MLLMs在专家并行中的落后效应。
从模态到命题:一种以语言为中心的多模态智能框架
本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。
超越文本主导:理解全模态大语言模型的模态偏好
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。