用于多模态理解和生成的解耦视觉-语言系统
摘要
本文介绍了Libra,这是一种针对多模态大型语言模型的解耦视觉-语言架构,能够实现图像到文本的理解和文本到图像的生成,在基准测试中表现出色。
arXiv:2608.20382v1 宣布类型:新
摘要:我们为多模态大型语言模型(MLLMs)引入了一种新的架构设计,Libra,它能够进行多模态理解和生成。Libra架构包含一个视觉系统和一个语言系统,通过跨模态桥接相连。这种设计解耦了自模态建模和跨模态交互,使每个模态能够学习其独特的表示,同时保持有效的跨模态理解。解耦主要通过开关注意力模块和开关FFN模块实现,这些模块动态路由自模态建模和跨模态交互场景的计算流程。我们在两个重要设置中评估了其有效性:\textbf{Libra-1}用于仅理解图像到文本的设置,\textbf{Libra-2}用于统一的图像到文本理解和文本到图像生成。除了架构设计,我们还讨论了在分词、位置编码和监督方面的各种改进。实验表明,专用的Libra设计能够在多模态理解和生成方面实现相互提升,在理解和生成基准测试中都取得了强劲的性能。
查看缓存全文
缓存时间: 2026/08/24 04:16
# 解耦视觉-语言系统用于多模态理解与生成 来源:https://arxiv.org/html/2608.20382 Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu 通讯作者:Changsheng Xu。Yifan Xu、Baochen Xiong、Xiaoshan Yang和Changsheng Xu隶属于中国科学院自动化研究所(MAIS)、中国科学院大学(北京 100190,中国),同时隶属于鹏城实验室(深圳 518066,中国)。邮箱:[email protected], [email protected], {xiaoshan.yang, csxu}@nlpr.ia.ac.cn。Donglin Di隶属于理想汽车(北京 101399,中国)。邮箱:[email protected]。Yaowei Wang隶属于鹏城实验室(深圳 518066,中国)。邮箱:[email protected]。 ###### 摘要 我们引入了一种用于多模态大型语言模型(MLLMs)的新型架构设计 **Libra**,该架构能够同时进行多模态理解和生成。Libra架构包含一个视觉系统和一个语言系统,通过跨模态桥接模块连接。这种设计将自模态建模与跨模态交互解耦,使每个模态在保持有效跨模态理解能力的同时,能够学习其独特的表征。解耦主要通过提出的开关注意力模块和开关前馈网络模块实现,它们为自模态建模和跨模态交互场景动态路由计算流。我们在两个重要设置中评估其有效性:Libra-1 用于仅理解的图像到文本设置,Libra-2 用于统一的图像到文本理解和文本到图像生成。除架构设计外,我们还讨论了在分词、位置编码和监督方面的多项改进。实验证明,专门的 Libra 设计使得多模态理解和生成能够相互促进,在理解和生成基准测试上均取得了强劲表现。代码将在此处公开:https://github.com/YifanXu74/Libra。 ## I 引言 过去几年,生成建模,特别是大型语言模型(LLMs)中的自回归范式\[gpt3,llama3,gemini\],已成为通往通用语言系统的有前景的途径。其有效性源于重建数据分布的内在能力,从而隐式地捕捉嵌入在数据中的基础世界知识。更进一步,在多模态大型语言模型(MLLMs)\[libra,llava,flamingo\]领域中,一个直观的想法浮现:如果一个模型能够有效地生成文本和图像,那么它应该已经获得了对多模态世界知识更深刻的理解,同时实现了两种模态之间更强的对齐。这反过来将带来更强大的多模态理解能力。在视觉-语言 MLLMs 中,有两个代表性范式:(i)仅理解模型\[llava,flamingo,blip2\],以图像为条件生成文本,即图像到文本理解;(ii)统一模型\[unified-io,show-o,janus\],同时支持图像到文本理解和文本到图像生成。图像到文本理解是 MLLMs 的基本能力,因为它使模型能够“看见”,而文本到图像生成使模型能够自下而上地学习视觉世界。因此,仅理解模型专注于最基本的图像到文本设置,通常能够实现更高效和稳定的优化;而统一模型在原则上更具通用性和可扩展性,但通常会引入更大的训练复杂性和不稳定性。这两种范式在当前研究中都面临一个基本挑战:视觉和语言之间的模态不平衡。语言数据具有高度结构化的符号表示,可以紧凑地编码抽象概念和关系,而视觉数据则以根本不同的方式组织信息:单个图像承载了丰富的细粒度视觉细节,但其语义密度远低于文本。因此,现有视觉数据集在知识覆盖范围上落后于文本语料库,而文本数据集在描述细粒度外观方面又不及视觉数据。这种不平衡容易导致训练偏差,使模型偏重某一种模态而忽视另一种,从而削弱在不受重视模态上的性能\[flamingo\]。因此,合理的模型设计对于解决模态不平衡至关重要。如图1(https://arxiv.org/html/2608.20382#S1.F1)所示,当前研究提出了几种模型设计: 请参阅图注 图1:生成式 MLLMs 的架构比较。(a) 统一架构在可训练的共享主干中对视觉和语言进行建模。(b) 级联架构通常使用冻结的 LLM 作为语言主干,并添加一个可训练的视觉后端以提供视觉生成能力。(c) Libra 架构结合了级联架构的模块化和统一架构的层间跨模态交互。\((1)\) 统一架构\[llava,unified-io,chameleon,show-o,janus\],如图1(https://arxiv.org/html/2608.20382#S1.F1)\(a\)\) 所示,使用共享主干联合建模视觉和语言。大多数仅理解的 MLLMs\[llava\]也属于此架构,但仅使用语言监督进行训练。这种设计在概念上是最优的,但不太适合当前的数据发展阶段。统一架构引入最少的人类先验,只要有大规模且适当的数据,它就有灵活性学习组织视觉和语言的任意模式。然而,先前的研究一直受到现有视觉-语言数据集的限制,这些数据集通常包含浅层知识和噪声对齐的配对。为克服这一点,如 Unified-IO\[unified-io\]和 Show-O\[show-o\]等工作严重依赖大规模纯文本来保持基本的语言理解能力。这需要规模相当的视觉数据以避免训练偏差,从而对数据平衡施加了严格限制。\((2)\) 级联架构\[emu,dreamllm,lavit\],如图1(https://arxiv.org/html/2608.20382#S1.F1)\(b\)\) 所示,将语言和视觉生成解耦为语言主干和一个大型预训练视觉后端\[ldm\]。使用预训练的视觉后端使得 MLLMs 的预训练可以专注于语言建模,作为应对模态不平衡的一种变通方法。然而,强大的视觉生成后端将语言主干的视觉建模简化为一个简单的角色,仅作为后端的提示生成器,导致多模态理解的可扩展性较差。 我们提出了一种新架构,名为 Libra,因其如图1(https://arxiv.org/html/2608.20382#S1.F1)\(c\)\) 所示的平衡秤状设计而得名。Libra 的核心思想是明确地将视觉和语言计算流解耦为两个流:自模态建模和跨模态交互。在宏观层面,视觉和语言被分离为两个用于自模态建模的双分支,并通过跨模态桥接模块进行层间跨模态交互。这种设计能够在每个模态内像统一架构那样自下而上地学习,同时通过模块化解耦自模态建模和跨模态交互来缓解模态不平衡,类似于级联架构。更具体地说,解耦主要通过提出的开关注意力机制和开关前馈网络机制实现。开关注意力机制为查询-键点积在自模态建模和跨模态交互中诱导不同的计算模式。在自模态情况下,它退化为标准注意力。在跨模态情况下,它通过跨模态桥接将注意力查询、键和值映射到新的特征空间。这种策略避免了直接将一个模态对齐到另一个模态的特征空间,从而保留了模态特定的表征,同时实现了有效的跨模态交互。开关前馈网络也通过为不同场景诱导不同的计算模式来解耦多模态理解和生成。 我们在两种配置中实例化了 Libra 框架:Libra-1,针对仅理解任务定制;Libra-2,设计用于统一的多模态理解和生成。除架构设计外,我们还引入了若干新的分词、表征和监督策略。本文的主要贡献可总结如下: - • 我们介绍了 Libra,一种新的 MLLM 架构,其核心创新包括开关注意力机制和开关前馈网络机制,它们在视觉和语言中都将自模态建模与跨模态交互解耦。这种设计使模型能够自下而上地学习多模态世界知识,同时缓解先前 MLLMs 所遭受的模态不平衡问题。我们以下列两种配置实例化了 Libra 框架。 - • Libra-1 为仅理解任务设计,具有两项关键创新:(1)监督:对视觉和语言使用统一的离散自回归以确保稳定训练;(2)混合分词:我们将连续信号与离散 ID 作为视觉输入集成,实现细粒度感知和训练稳定性。 - • Libra-2 将框架扩展到统一的多模态理解和生成,具有三项关键创新:(1)监督:我们将连续空间的掩码视觉生成集成到统一的 MLLM 中;(2)统一 RoPE 联合表示 2D 图像和 1D 文本,同时与标准 RoPE 原生兼容;(3)连续空间视觉分词:Libra-2 在图像到文本理解和文本到图像生成中仅处理连续视觉特征。 - • Libra 系列在超过 10 个基准测试上展示了强劲性能,包括传统的 VQA、图像描述以及用于图像到文本理解的综合 MLLM 基准测试,以及用于文本到图像生成的 FID 指标和通用文本到图像生成基准测试。进一步分析表明,Libra 架构比常用的 LLaVA\[llava1.5\]架构表现出更低的学习冗余度。 这项工作扩展了我们 ICML 2024 论文\[libra\],该论文提出了在仅理解设置中实现框架的 Libra-1。在本文中,我们进一步发展了 Libra-2,将 Libra 框架实质性地推进到统一的多模态理解和生成。 ## II 相关工作 近年来,研究人员试图将 LLMs 扩展到多模态领域。现有的模型框架大致可分为以下两种范式。 统一架构模型。这类方法通过共享参数空间对视觉-语言模态进行联合建模,实现端到端的多模态学习。这类方法的优势在于赋予模型在统一框架内自适应平衡视觉和语言模态的更大灵活性。然而,这是以复杂的数据混合策略和高昂的训练成本为代价的。大多数仅理解和统一的 MLLMs 都属于此框架。根据仅理解设置,模型通常仅使用语言监督进行训练,并将预训练的视觉编码器与预训练的 LLMs 集成。集成策略包括简单投影\[llava,cogvlm,qwen-vl,otter,dreamllm,emu\]、交叉注意力\[flamingo\]和 Q-Former 投影\[blip2\]。根据统一设置,一个代表性工作是 Unified-IO\[unified-io,unified-io2\],它将图像离散化为视觉 token 序列,并将多模态生成任务统一为序列预测。然而,这种方法需要仔细设计超过 20 种多模态任务数据的混合比例,并且仍然难以确保稳健的多模态理解能力。后续研究,如 Show-O\[show-o\]和 Janus\[janus\],将视觉生成能力注入预训练的大型语言模型,取得了显著改进。然而,它们严重依赖大规模纯文本来保持语言建模性能,这不仅显著增加了训练成本,还 necessitates 细粒度的数据平衡策略。 级联架构模型。另一类方法采用分阶段策略,将文本生成和视觉生成解耦:主干模型专注于语言建模,而视觉建模则由单独的后端模块处理。例如,Emu\[emu,emu2\]提出了一个基于自回归连续视觉特征和离散语言 token 的统一框架。在此框架中,视觉生成通过自回归生成压缩的一维视觉特征来实现,然后将这些特征作为条件输入给后端扩散模型以生成图像。类似地,DreamLLM\[dreamllm\]采用了类似的策略。LaViT\[lavit\]设计了一个动态的视觉编码器-解码器,它首先过滤并离散化输入视觉特征,然后使用扩散模型解码器重建图像。基于此编码器-解码器,LaViT 通过离散自回归实现了视觉和文本的联合生成。NExT-GPT\[nextgpt\]进一步扩展到多模态生成(图像、音频、视频、文本),采用不同的输入编码器,并为视觉、音频和视频模态设计了基于扩散模型的解码器以提高生成质量。这些方法在架构层面适当地解耦了视觉和语言建模,从而避免了训练不平衡问题。然而,它们通常依赖重型后端生成模块来确保高质量的视觉输出。这导致了视觉建模与语言理解之间的脱节:主干语言模型仅将输入视觉特征视为后端视觉生成模块的条件信号,仍然主要通过语言建模方法编码视觉信息,难以真正内化跨模态知识。 ## III 前提知识 ### III-A 多模态大型语言模型的基本流程 MLLMs 通过在文本专用流程中添加视觉感知来扩展标准 LLMs。在 LLM 中,原始文本被分词为子词 token,映射到数字 ID,这称为分词。然后通过学习的查找表将 ID 嵌入。Transformer 在上下文中处理这些嵌入以产生隐藏表示,最后的线性分类器将其转换为词表上的逻辑值;应用 softmax 得到下一个 token 的概率。MLLMs 遵循相同的流程,但通过添加图像路径进行增强:图像编码器(*例如*,CLIP\[clip\])将像素转换为视觉嵌入。然后模型以交错文本和视觉嵌入的序列作为输入。许多仅理解的 MLLMs\[llava,qwen-vl\]仅对语言 token 进行监督,将图像特征作为条件上下文。当统一框架中需要对图像进行生成建模时,一个常见策略是使用向量量化过程\[vqgan\]离散化输入视觉特征,产生视觉 token ID,以便图像和文本都可以使用相同的下一个 token 预测目标进行建模。 ### III-B 无查找量化 量化过程用于将输入视觉特征离散化为 token ID,以便图像和文本都可以使用相同的下一个 token 预测目标进行建模,通常通过与向量量化(VQ)码本中定义的一组可学习向量进行匹配来执行。具体来说,一批图像II首先被……
相似文章
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
LoMo: 局部模态替换以实现更深层的视觉-语言融合
LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。
JoyAI-VL-Interaction: 实时视觉-语言交互智能
本文介绍了JoyAI-VL-Interaction,一个开源8B规模的视觉-语言模型,可实时持续运行,自主决定何时响应或委派。它包含一个完整的可部署系统和一个训练配方,在人类评估中优于Doubao和Gemini。