无瓶颈统一多模态模型的 Representation Forcing
摘要
介绍了 Representation Forcing(RF),一种技术,使得统一多模态模型能够在没有外部VAE潜在空间的情况下端到端地执行感知和生成,在图像生成方面达到最先进的基于VAE的模型水平,同时提升理解能力。
查看缓存全文
缓存时间: 2026/06/01 03:18
论文页面 - Representation Forcing 用于无瓶颈统一多模态模型
来源:https://huggingface.co/papers/2605.31604 发布于 5 月 29 日
#3 当日论文 (https://huggingface.co/papers/date/2026-06-01) 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
Representation Forcing 使统一多模态模型能够在无需依赖外部潜在空间的情况下端到端地执行感知和生成任务,在图像生成方面达到最先进性能,同时提升理解能力。
统一多模态模型 (https://huggingface.co/papers?q=Unified%20multimodal%20models)(UMM)旨在用单一模型处理感知与生成。然而,现有 UMM 仍然依赖一个冻结的、独立预训练的 VAE 进行图像生成,形成了结构性瓶颈。直接移除它会导致质量差距,因为模型必须从原始像素同时学习高层结构和低层细节。本文提出 Representation Forcing (https://huggingface.co/papers?q=Representation%20Forcing)(RF),一种通过使表示预测成为模型原生能力来弥合这一差距的技术。具体来说,RF 强制解码器在像素之前自回归地预测视觉表示 (https://huggingface.co/papers?q=visual%20representations) 作为中间令牌;这些令牌随后保持在上下文中,在同一骨干网络内引导像素扩散 (https://huggingface.co/papers?q=pixel%20diffusion)。通过将表示从感知输出转变为生成目标,RF 消除了对外部生成潜在空间的需求。我们发现 RF 对理解和生成均有裨益。在图像生成上,我们的像素空间模型配合 RF 达到了基于 VAE 的最先进统一模型的水平。在图像理解上,像素空间 RF 通常优于其基于 VAE 的变体。这些结果共同为迈向端到端、无瓶颈的 UMM 提供了有效的一步。
查看 arXiv 页面 (https://arxiv.org/abs/2605.31604) 查看 PDF (https://arxiv.org/pdf/2605.31604) 项目页面 (https://yuqingwang1029.github.io/RepresentationForcing/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31604)
在您的 agent 中获取此论文:
hf papers read 2605\.31604
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.31604 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.31604 以从此页面链接。
引用此论文的 Space 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.31604 以从此页面链接。
包含此论文的收藏集 0
无收藏集包含此论文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@vincieye: 从几张照片生成完整的3D场景通常意味着凭空想象盲点或内存爆炸。SPAR3S s…
SPAR3S是一种稀疏自回归生成模型,能高效地从稀疏多视角图像生成完整的3D场景,无需3D真值数据,使用体素对齐的潜在空间和可微分的3D Gaussian Splatting。
@lightchaserx: WorldSculpt 可编辑的组合世界项目页面: https://alaya-lab.github.io/WorldSculpt/ 代码: https://gith…
WorldSculpt 是一个框架,可以将基于地面视频的杂乱场景重建为组合式的每物体网格,从而实现交互式3D世界生成和编辑。
AuK 技术报告:一个用于语音生成与编辑的开源基础模型
AuK 是一个开源基础模型,通过自然语言指令统一语音生成与编辑,利用蒸馏技术实现高效推理并取得领先性能。
来自比哈尔邦的20岁青年,无团队、无投资者、无计算机学位——一个匿名的'dossier'网站称我是骗子。如今,Arcle V1 (5.84B) 正式上线,开放权重,并已训练完成。
来自比哈尔邦的20岁青年Abhinav Anand发布了Arcle V1,这是一个拥有58.4亿参数的开放权重多模态AI模型,独立训练,无需团队或投资者。
@reach_vb:我让 Astra 复刻了 @LewisHamilton 的 Ferrari!它分析了 F1 技术规格、规则、F1 工程师的视频以及……
一位用户展示了 Google Astra 的多模态能力:让它分析 F1 技术规格、规则、视频和照片,从而在 Blender 中还原 Lewis Hamilton 的 Ferrari,生成精细的 3D 模型,并附带粘土版与线框版的完整拆解。