外观指针——扩散变换器的多模态区域控制

Hugging Face Daily Papers 论文

摘要

介绍了外观指针,这是一种紧凑的标记,能够引导扩散变换器在指定空间位置应用正确的外观提示,从而无需重新训练基础模型即可实现模态无关的局部多模态控制。

可控图像生成对创意专业人士来说仍然具有挑战性,他们通常需要对材质、物体身份和空间布局进行精确的区域控制,而这些仅通过文本提示无法可靠实现。扩散变换器(DiTs)能够原生处理来自文本和图像的异构标记,但缺乏确定这些标记应如何以及在何处影响输出的机制。我们引入了外观指针,这是一种紧凑的标记,通过将文本或图像输入与用户指定的掩码对齐,引导DiTs在正确的空间位置获得正确的外观提示。外观指针由区域对应网络生成,并通过空间聚合机制进行细化,使模型能够处理多个区域描述而无需显著增加标记负载。我们的方法在不从头重新训练基础模型的情况下,首次在DiT中实现了用于局部多模态控制的模态无关接口。在一系列指标上,我们的单一模型达到或超越了特定模态的最先进方法的性能,为生成式图像合成中精确、区域感知的多模态引导提供了一条简单且可扩展的路径。
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:40

论文页面 - 外观指针 —— 扩散变换器的多模态区域控制

来源:https://huggingface.co/papers/2607.19344

摘要

对于创意专业人士而言,可控图像生成依然是一项挑战,他们通常需要对材质、物体身份和空间布局进行精确的区域控制,而这无法仅通过文本提示可靠实现。扩散变换器(DiTs)能够原生接收来自文本和图像的异构令牌,但缺乏决定这些令牌应在何处以及如何影响输出结果的机制。我们引入了外观指针(appearance pointers)——一种紧凑的令牌,通过将文本或图像输入与用户指定的掩码对齐,引导DiTs在正确的空间位置上获取正确的外观线索。外观指针由区域对应网络生成,并通过空间聚合机制进行精炼,使模型能够处理多个区域描述,而不会显著增加令牌负载。我们的方法引入了首个模态无关的接口,用于DiT中的局部多模态控制,且无需从头重新训练基础模型。在一系列指标上,我们的单一模型达到或超越了特定模态最新方法的性能,为生成式图像合成中精确、区域感知的多模态指导提供了一条简单且可扩展的路径。

查看arXiv页面 (https://arxiv.org/abs/2607.19344)查看PDF (https://arxiv.org/pdf/2607.19344)项目页面 (https://ivl.cs.brown.edu/research/appearance_pointers.html)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19344)

在你的Agent中获取这篇论文:

hf papers read 2607.19344

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用这篇论文的模型

0 暂无模型链接这篇论文

在模型README.md中引用arxiv.org/abs/2607.19344即可从此页面链接到它。

引用这篇论文的数据集

0 暂无数据集链接这篇论文

在数据集README.md中引用arxiv.org/abs/2607.19344即可从此页面链接到它。

引用这篇论文的Space

0 暂无Space链接这篇论文

在Space README.md中引用arxiv.org/abs/2607.19344即可从此页面链接到它。

包含这篇论文的收藏集

0 暂无收藏集包含这篇论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中即可从此页面链接到它。

相似文章

MMDiff: 扩展扩散变换器以实现多模态生成

Hugging Face Daily Papers

MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

寄存器对像素空间扩散变换器的重要性

Hugging Face Daily Papers

本文探讨了在像素空间扩散变换器(DiTs)中使用寄存器令牌的情况,发现尽管DiTs没有补丁令牌异常值,但寄存器令牌仍能提高特征图质量。作者提出了寄存器引导(Register Guidance)技术,用于放大寄存器贡献,以改善视觉结构。