ARM:采用统一离散表示的自回归大型多模态模型

Hugging Face Daily Papers 论文

摘要

ARM提出了一种统一的基于离散语义标记化和强化学习优化的自回归框架,用于图像理解、生成与编辑,并展示了跨任务协同效果。

本文介绍了ARM,一种基于离散表示的自回归模型,它在下一个词元预测框架内统一了图像理解、生成与编辑。ARM的构建基于三项努力:首先,我们训练了一个离散语义视觉分词器,将图像映射为紧凑的词元序列。我们的分词器使用多个目标进行监督,共同促进语义区分性、语言对齐和忠实重建,从而在共享的潜在空间中支持多种任务。基于此,我们在大规模文本和图像词元序列上训练了一个7B参数的自回归模型,无缝地发展了视觉-语言感知与生成能力。最后,为进一步提升文本到图像生成和指令引导编辑的偏好对齐行为,ARM应用强化学习(RL)来优化任务级目标,如视觉质量、指令遵循和编辑一致性。令人惊讶的是,结果表明RL不仅大幅提升了目标任务的性能(例如,将WISE总分从0.50提升至0.56,GEdit-Bench-EN的G_O分数从5.75提升至6.68),还引发了文本到图像生成与编辑之间的跨任务协同效应。总体而言,这些发现凸显了自回归建模与强大表示和偏好优化相结合,可作为多模态智能的可扩展基础。代码:https://github.com/wdrink/ARM。
查看原文
查看缓存全文

缓存时间: 2026/06/10 05:45

论文页面 - ARM:一种基于统一离散表示的自回归大型多模态模型

来源:https://huggingface.co/papers/2606.11188 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

ARM 通过离散语义分词和强化学习优化,展示了一个用于图像理解、生成和编辑的统一自回归框架。

本文介绍了 ARM,一种基于离散表示的自回归模型 (https://huggingface.co/papers?q=AutoRegressive%20Model),它在下一个词预测 (https://huggingface.co/papers?q=next-token%20prediction) 框架内统一了图像理解、生成和编辑。ARM 建立在三项工作之上:首先,我们训练一个离散语义视觉分词器 (https://huggingface.co/papers?q=discrete%20semantic%20visual%20tokenizer),将图像映射为紧凑的词序列。我们的分词器通过多个目标进行监督,这些目标共同促进语义可辨别性、语言对齐和忠实重建,从而在共享的潜在空间中支持多样化的任务。在此基础上,我们在大规模文本和图像词序列上训练了一个 7B 自回归模型 (https://huggingface.co/papers?q=autoregressive%20model),无缝地发展了视觉-语言感知 (https://huggingface.co/papers?q=vision-language%20perception) 和生成能力。最后,为了进一步改善文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 和指令引导编辑 (https://huggingface.co/papers?q=instruction-guided%20editing) 的偏好对齐行为,ARM 应用强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) (RL) 来优化任务级别的目标,例如视觉质量、指令遵守度和编辑一致性。令人惊讶的是,结果表明 RL 不仅显著提高了目标任务上的性能(例如,WISE 整体得分从 0.50 提高到 0.56,GEdit-Bench-EN G_O 从 5.75 提高到 6.68),而且还引发了文本到图像生成和编辑之间的跨任务协同效应。总的来说,这些发现强调了自回归模型 (https://huggingface.co/papers?q=autoregressive%20model) 在结合强大的表示和偏好优化后,可作为多模态智能 (https://huggingface.co/papers?q=multimodal%20intelligence) 的可扩展基础。代码:https://github.com/wdrink/ARM。

查看 arXiv 页面 (https://arxiv.org/abs/2606.11188)查看 PDF (https://arxiv.org/pdf/2606.11188)GitHub4 (https://github.com/wdrink/ARM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11188)

在您的智能体中获取这篇论文:

hf papers read 2606.11188

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。

引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。

增强多模态推理以对抗视觉退化

Hugging Face Daily Papers

本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。