在原生统一多模态模型中揭示理解-生成协同:从表示、任务到系统

Hugging Face Daily Papers 论文

摘要

本文探讨了统一多模态模型中视觉理解与生成之间的协同效应,表明任务解耦架构和端到端优化可以通过将共存转化为协同来提升性能。

虽然统一多模态模型(UMMs)在单一模型中共同执行视觉理解和生成功能,但功能统一并不保证学习协同:两个目标可能相互强化、竞争容量或仅共存。我们在一个控制性的、结构原生且无预训练视觉先验的设置中,从表示、任务和系统层面研究它们之间的关系。在表示层面,我们发现每个目标都为对方提供了有用的信号:生成丰富了用于理解的视觉特征,而理解则加强了视觉-语言对齐以促进生成。然而,当两个目标被迫通过相同的计算路径时,其中一个往往占据主导地位。一个任务解耦架构通过专门处理冲突的视觉计算同时保持语义交互,避免了这种不对称退化。在任务层面,通过三个案例研究,我们发现当理解和生成任务依赖于共享知识时,存在积极的双向迁移。在系统层面,我们证明端到端的UMMs在明确需要图像理解和生成的复杂任务上优于匹配的规划器-执行器流水线。这些结果共同表明,UMMs的价值超越了统一的接口:适当的专门化、共享的任务知识和端到端优化可以将共存转化为协同。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:45

论文页面 - 揭示原生统一多模态模型中理解与生成的协同效应:从表示、任务到系统

来源:https://huggingface.co/papers/2609.01607

摘要

统一多模态模型通过专业化架构、共享知识和端到端优化,实现了视觉理解与生成之间的协同,而非简单的功能统一。

尽管统一多模态模型(UMMs)在单一模型内同时执行视觉理解和生成,但功能统一并不保证学习协同:两个目标可能相互增强、相互竞争,或仅仅是共存。我们在一个受控的、结构上原生的环境中,从表示、任务和系统层面研究了它们在不依赖预训练视觉先验的情况下的关系。在表示层面,我们发现每个目标都为另一个提供了有用的信号:生成丰富了用于理解的视觉特征,而理解加强了用于生成的视觉-语言对齐。然而,当两个目标被迫通过相同的计算路径时,其中一个往往会占据主导。一个任务解耦架构通过专门处理冲突的视觉计算同时保留语义交互,避免了这种不对称退化。在任务层面,通过三个案例研究,我们发现当理解和生成任务依赖共享知识时,存在积极的双向迁移。在系统层面,我们表明,在明确同时需要图像理解和生成的复杂任务上,端到端的UMM优于匹配的规划器-执行器流程。总之,这些结果表明,UMM的价值超越了统一的接口:适当的专业化、共享的任务知识和端到端优化可以将共存转化为协同。

查看 arXiv 页面 (https://arxiv.org/abs/2609.01607) 查看 PDF (https://arxiv.org/pdf/2609.01607) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01607)

在您的代理中获取此论文:

hf papers read 2609\.01607

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文。

在模型 README.md 中引用 arxiv.org/abs/2609.01607 以从此页面链接它。

引用本文的数据集 0

没有数据集链接本文。

在数据集 README.md 中引用 arxiv.org/abs/2609.01607 以从此页面链接它。

引用本文的空间 0

没有空间链接本文。

在空间 README.md 中引用 arxiv.org/abs/2609.01607 以从此页面链接它。

包含本文的收藏 0

没有收藏包含本文。

将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。

视觉作为统一多模态生成

Hugging Face Daily Papers

本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。

统一多模态模型的语义生成微调

Hugging Face Daily Papers

介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。