生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解

Hugging Face Daily Papers 论文

摘要

GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。

尽管多模态大型语言模型(MLLMs)取得了显著进展,但视觉理解和生成通常被视为不同的目标。现有的统一框架通常依赖于离散视觉标记化或扩散目标,其生成目标与视觉理解模型所消耗的连续表示不同,这使得直接迁移以增强现有预训练MLLMs变得不平凡。在这项工作中,我们提出了GAS,一个生成引导的训练框架,将视觉生成重新解释为表示学习的辅助监督。具体来说,GAS在解耦的混合Transformer(MoT)架构中,将下一嵌入预测(NEP)适配为跨模态生成范式。通过保持一个共享的下部主干和并行的上层,GAS让生成损失以更精细的空间精度和更强的视觉保留丰富共享的视觉通路,同时屏蔽上层理解层免受直接生成梯度的影响。为了最大化这种协同作用,我们进一步构建了高度相关的生成任务,这些任务需要深层的认知基础,而不仅仅是通用合成。在不同的模型规模和训练阶段,GAS提高了整体多模态理解,其在感知和空间理解方面的收益最为可靠。关键的是,由于辅助生成分支在训练后被丢弃,这些收益不产生任何推理开销。大量的受控比较和表示级分析进一步阐明了生成引导的训练何时以及为何有益于理解,并证明了生成引导的训练作为增强多模态理解的实际途径的可行性。
查看原文
查看缓存全文

缓存时间: 2026/08/17 03:43

论文页面 - 生成式辅助监督:通过解耦嵌入预测实现零推理开销的视觉理解增强

来源:https://huggingface.co/papers/2608.12209

摘要

GAS通过使用生成作为辅助监督(借助下一嵌入预测与解耦的混合专家架构)来提升多模态理解能力,且不会引入推理开销。

尽管多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)已取得显著进展,但视觉理解与生成通常被视为不同的目标。现有的统一框架往往依赖于离散视觉词元化(https://huggingface.co/papers?q=visual%20tokenization)或扩散目标(https://huggingface.co/papers?q=diffusion%20objectives),这些生成目标与视觉理解模型所使用的连续表征存在差异,使得直接迁移以增强现有预训练MLLMs并非易事。本文提出GAS,这是一种生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)框架,将视觉生成重新阐释为表征学习的辅助监督。具体而言,GAS在解耦的混合专家架构(https://huggingface.co/papers?q=Mixture-of-Transformers)(MoT)内,将下一嵌入预测(https://huggingface.co/papers?q=Next%20Embedding%20Prediction)(NEP)调整为一种跨模态生成(https://huggingface.co/papers?q=cross-modal%20generation)范式。通过保持共享的底层骨干网络与并行的上层网络,GAS使生成损失能以更精细的空间精度和更强的视觉保持性来丰富共享的视觉通路,同时使上层的理解层免受直接生成梯度的影响。为最大化这种协同效应,我们进一步构建了要求深度认知基础而非仅通用合成的高相关性生成任务。在不同模型规模和训练阶段,GAS均提升了聚合多模态理解能力,其中在感知与空间理解方面展现出最可靠的增益。关键的是,由于辅助生成分支在训练后即被丢弃,这些增益不会带来任何推理开销。大量受控比较与表征层级分析进一步阐明了生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)在何种情况下、为何有益于理解,并证明了生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)是实现更强多模态理解的可行实用路径。

查看arXiv页面(https://arxiv.org/abs/2608.12209)查看PDF(https://arxiv.org/pdf/2608.12209)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12209)

在您的代理中获取本文:

hf papers read 2608\.12209

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该模型。

引用此论文的数据集0

无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该数据集。

引用此论文的Spaces0

无Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该Space。

包含此论文的收藏0

无收藏包含此论文

将此论文添加至收藏(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

统一多模态模型的语义生成微调

Hugging Face Daily Papers

介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。

利用自监督指南提升视觉指令调优

Hugging Face Daily Papers

本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。

视频生成模型是通用视觉学习者

Hugging Face Daily Papers

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。