生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
摘要
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
查看缓存全文
缓存时间: 2026/08/17 03:43
论文页面 - 生成式辅助监督:通过解耦嵌入预测实现零推理开销的视觉理解增强
来源:https://huggingface.co/papers/2608.12209
摘要
GAS通过使用生成作为辅助监督(借助下一嵌入预测与解耦的混合专家架构)来提升多模态理解能力,且不会引入推理开销。
尽管多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)已取得显著进展,但视觉理解与生成通常被视为不同的目标。现有的统一框架往往依赖于离散视觉词元化(https://huggingface.co/papers?q=visual%20tokenization)或扩散目标(https://huggingface.co/papers?q=diffusion%20objectives),这些生成目标与视觉理解模型所使用的连续表征存在差异,使得直接迁移以增强现有预训练MLLMs并非易事。本文提出GAS,这是一种生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)框架,将视觉生成重新阐释为表征学习的辅助监督。具体而言,GAS在解耦的混合专家架构(https://huggingface.co/papers?q=Mixture-of-Transformers)(MoT)内,将下一嵌入预测(https://huggingface.co/papers?q=Next%20Embedding%20Prediction)(NEP)调整为一种跨模态生成(https://huggingface.co/papers?q=cross-modal%20generation)范式。通过保持共享的底层骨干网络与并行的上层网络,GAS使生成损失能以更精细的空间精度和更强的视觉保持性来丰富共享的视觉通路,同时使上层的理解层免受直接生成梯度的影响。为最大化这种协同效应,我们进一步构建了要求深度认知基础而非仅通用合成的高相关性生成任务。在不同模型规模和训练阶段,GAS均提升了聚合多模态理解能力,其中在感知与空间理解方面展现出最可靠的增益。关键的是,由于辅助生成分支在训练后即被丢弃,这些增益不会带来任何推理开销。大量受控比较与表征层级分析进一步阐明了生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)在何种情况下、为何有益于理解,并证明了生成引导训练(https://huggingface.co/papers?q=generation-guided%20training)是实现更强多模态理解的可行实用路径。
查看arXiv页面(https://arxiv.org/abs/2608.12209)查看PDF(https://arxiv.org/pdf/2608.12209)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12209)
在您的代理中获取本文:
hf papers read 2608\.12209
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该模型。
引用此论文的数据集0
无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该数据集。
引用此论文的Spaces0
无Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.12209,即可从此页面链接至该Space。
包含此论文的收藏0
无收藏包含此论文
将此论文添加至收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
统一多模态模型的语义生成微调
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
利用自监督指南提升视觉指令调优
本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。
视频生成器作为通用视觉模型(8分钟阅读)
GenCeption 将预训练的视频生成模型重新利用为一个统一的单次前馈视觉模型,在多个任务上以极高的数据效率实现了最先进的性能,标志着向通用视觉智能的转变。
视频生成模型是通用视觉学习者
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。