ARM:采用统一离散表示的自回归大型多模态模型
摘要
ARM提出了一种统一的基于离散语义标记化和强化学习优化的自回归框架,用于图像理解、生成与编辑,并展示了跨任务协同效果。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - ARM:一种基于统一离散表示的自回归大型多模态模型
来源:https://huggingface.co/papers/2606.11188 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
ARM 通过离散语义分词和强化学习优化,展示了一个用于图像理解、生成和编辑的统一自回归框架。
本文介绍了 ARM,一种基于离散表示的自回归模型 (https://huggingface.co/papers?q=AutoRegressive%20Model),它在下一个词预测 (https://huggingface.co/papers?q=next-token%20prediction) 框架内统一了图像理解、生成和编辑。ARM 建立在三项工作之上:首先,我们训练一个离散语义视觉分词器 (https://huggingface.co/papers?q=discrete%20semantic%20visual%20tokenizer),将图像映射为紧凑的词序列。我们的分词器通过多个目标进行监督,这些目标共同促进语义可辨别性、语言对齐和忠实重建,从而在共享的潜在空间中支持多样化的任务。在此基础上,我们在大规模文本和图像词序列上训练了一个 7B 自回归模型 (https://huggingface.co/papers?q=autoregressive%20model),无缝地发展了视觉-语言感知 (https://huggingface.co/papers?q=vision-language%20perception) 和生成能力。最后,为了进一步改善文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 和指令引导编辑 (https://huggingface.co/papers?q=instruction-guided%20editing) 的偏好对齐行为,ARM 应用强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) (RL) 来优化任务级别的目标,例如视觉质量、指令遵守度和编辑一致性。令人惊讶的是,结果表明 RL 不仅显著提高了目标任务上的性能(例如,WISE 整体得分从 0.50 提高到 0.56,GEdit-Bench-EN G_O 从 5.75 提高到 6.68),而且还引发了文本到图像生成和编辑之间的跨任务协同效应。总的来说,这些发现强调了自回归模型 (https://huggingface.co/papers?q=autoregressive%20model) 在结合强大的表示和偏好优化后,可作为多模态智能 (https://huggingface.co/papers?q=multimodal%20intelligence) 的可扩展基础。代码:https://github.com/wdrink/ARM。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11188)查看 PDF (https://arxiv.org/pdf/2606.11188)GitHub4 (https://github.com/wdrink/ARM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11188)
在您的智能体中获取这篇论文:
hf papers read 2606.11188
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。
引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2606.11188 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
ReMMD:面向多模态虚假信息检测的真实多语言多图像智能验证框架
ReMMD 提出了一种面向多模态虚假信息检测的真实多语言多图像智能验证框架,包含一个包含 500 个样本和 2,756 张图像的基准数据集 ReMMDBench,以及一个以更低成本实现更优真实性检测性能的智能体 ReMMD-Agent。
增强多模态推理以对抗视觉退化
本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。