图像即句子:扩展交错指令以实现统一的视觉生成
摘要
本文介绍了 INSET,这是一个统一的多模态模型,它将图像作为原生词汇嵌入到文本指令中,从而提高了在图像生成和编辑任务中处理复杂交错输入的能力。
查看缓存全文
缓存时间: 2026/05/13 04:11
论文页面 - 句子中的图像:为统一视觉生成扩展交错指令
来源: https://huggingface.co/papers/2605.12305
摘要
INSET 是一个统一的多模态模型,它将图像作为原生词汇嵌入文本指令中,通过基于 Transformer 的上下文局部性更好地处理复杂的交错输入,并支持图像生成和编辑任务。
尽管最近多模态语言模型 (https://huggingface.co/papers?q=multimodal%20language%20models) 的进步已经实现了从富有表现力的多图像指令中进行图像生成 (https://huggingface.co/papers?q=image%20generation),但现有方法在处理复杂交错指令 (https://huggingface.co/papers?q=interleaved%20instructions) 时难以保持性能。这一限制源于当前范式中图像与文本的结构分离,这迫使模型跨越困难的长程依赖关系以将描述与视觉目标匹配。为了解决这些挑战,我们提出了 Images iN SEnTences(又称 INSET),这是一个统一生成模型,它将图像无缝地作为原生词汇嵌入文本指令中。通过将视觉特征 (https://huggingface.co/papers?q=visual%20features) 直接放置在其对应的语义槽位上,INSET 利用 Transformer (https://huggingface.co/papers?q=transformers) 的上下文局部性 (https://huggingface.co/papers?q=contextual%20locality) 实现精确的对象绑定,有效地将图像视为密集、富有表现力的语言标记。此外,我们引入了一个可扩展的数据引擎,从标准图像和视频数据集中合成 1500 万个高质量交错样本,利用 VLM (https://huggingface.co/papers?q=VLMs) 和 LLM (https://huggingface.co/papers?q=LLMs) 构建丰富的、长序列数据。在 InterleaveBench (https://huggingface.co/papers?q=InterleaveBench) 上的评估结果表明,INSET 在多图像一致性和文本对齐方面显著优于最先进的方法,随着输入复杂性的增加,性能差距进一步扩大。除了标准生成之外,我们的方法还天然扩展到多模态图像编辑 (https://huggingface.co/papers?q=image%20editing),将视觉内容作为指令的一部分,以支持高度富有表现力和创造性的视觉操作。
查看 arXiv 页面 (https://arxiv.org/abs/2605.12305) 查看 PDF (https://arxiv.org/pdf/2605.12305) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12305)
在你的智能体中获取这篇论文:
hf papers read 2605\.12305
没有最新版本的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有引用此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.12305 以从此页面链接它。
引用此论文的数据集 0
没有引用此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.12305 以从此页面链接它。
引用此论文的 Spaces 0
没有引用此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.12305 以从此页面链接它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
照亮统一多模态模型,实现自由形式交错图文生成
ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。
InterleaveThinker: 增强智能体交错生成
InterleaveThinker 引入了一种多智能体流水线,包含规划器和评论家智能体,使现有图像生成器具备交错文本-图像生成能力,其性能与最先进模型相当,并提升了推理基准测试成绩。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。