文本-视觉协同指导的图像编辑

Hugging Face Daily Papers 论文

摘要

一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。

现有的图像编辑方法大致可分为基于文本指令和基于视觉提示两类。文本指令在语义表达方面能力强,但受限于编辑结果空间控制的粒度较粗。相比之下,拖拽和点击等视觉提示能提供精确的空间指导,但存在语义意图的固有歧义。为统一文本和视觉提示的优势,我们提出文本-视觉协同指导的图像编辑,将文本指令作为语义意图、稀疏视觉指令作为空间指导共同建模,旨在实现精确且忠实于意图的图像操控。为此,我们首先构建了一个包含超过2.3万个源自动态视频的样本的文本-视觉指令配对数据集,以实现跨模态指令的对齐监督。随后,我们提出TV-Edit,一个文本-视觉指令统一的编辑框架,将拖拽或点击的视觉指令与图像文本语义上下文化,并将其提升为语义感知的控制表示,以适配预训练编辑主干网络。通过整合语义意图和空间约束,TV-Edit相比纯文本或基于拖拽的替代方法,实现了更精确的空间控制、更少的指令歧义和更强的结构一致性。最后,我们构建了TV-Edit-Bench,一个精心设计的基准,用于评估语义忠实度、空间对齐和视觉一致性,并采用真实参考与受控的文本-视觉变化,以确保可靠评估。我们在多个编辑主干网络上的实验表明,TV-Edit一致产生更精确且忠实于意图的编辑,显著优于最先进的基于指令和基于拖拽的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/06/17 11:37

论文页面 - 文本-视觉协同指导的图像编辑

来源: https://huggingface.co/papers/2606.16767

摘要

本文提出了一种统一的文本-视觉图像编辑框架,将文本指令的语义意图与视觉提示的空间指导相结合,以实现更精确、更保真的图像操作。

现有的图像编辑方法通常可分为两类:基于文本指令的方法 (https://huggingface.co/papers?q=textual%20instruction-based) 和基于视觉提示的方法 (https://huggingface.co/papers?q=visual%20prompt-based)。文本指令语义表达力强,但受限于编辑结果的空间控制 (https://huggingface.co/papers?q=spatial%20control) 粒度较粗。相反,拖动、点选等视觉提示可提供精确的空间指导 (https://huggingface.co/papers?q=spatial%20guidance),但受限于语义意图 (https://huggingface.co/papers?q=semantic%20intent) 的固有模糊性。为了融合文本与视觉提示的优势,我们提出了文本-视觉协同指导的图像编辑,该方法将文本指令作为语义意图 (https://huggingface.co/papers?q=semantic%20intent)、稀疏视觉指令作为空间指导 (https://huggingface.co/papers?q=spatial%20guidance) 进行联合建模,旨在实现精确且意图保真的图像操作。为此,我们首先构建了一个包含超过 23K 个样本的文本-视觉指令配对数据集 (https://huggingface.co/papers?q=textual-visual%20instruction%20paired%20dataset),数据源自动态视频,从而为跨模态指令 (https://huggingface.co/papers?q=cross-modal%20instruction) 提供对齐监督。接着,我们提出了 TV-Edit (https://huggingface.co/papers?q=TV-Edit),一个文本-视觉指令统一编辑框架,将拖动或点选类视觉指令与图像-文本语义进行情境化,并将其提升为语义感知的控制表征 (https://huggingface.co/papers?q=semantic-aware%20control%20representations),供预训练编辑主干 (https://huggingface.co/papers?q=pretrained%20editing%20backbones) 使用。通过整合语义意图 (https://huggingface.co/papers?q=semantic%20intent) 和空间约束,TV-Edit (https://huggingface.co/papers?q=TV-Edit) 在空间控制 (https://huggingface.co/papers?q=spatial%20control) 上比纯文本或纯拖动方法更精确,指令歧义更少,结构一致性 (https://huggingface.co/papers?q=structural%20consistency) 更强。最后,我们建立了 TV-Edit-Bench (https://huggingface.co/papers?q=TV-Edit-Bench),一个精心设计的基准,用于评估语义保真度、空间对齐和视觉一致性,包含真实参考及可控的文本-视觉变化,以确保评估的可靠性。我们在多个编辑主干上的实验表明,TV-Edit (https://huggingface.co/papers?q=TV-Edit) 始终能产生更精确、更意图保真的编辑结果 (https://huggingface.co/papers?q=intent-faithful%20edits),显著优于最先进的指令式方法和拖动式基线。

查看 arXiv 页面 (https://arxiv.org/abs/2606.16767)查看 PDF (https://arxiv.org/pdf/2606.16767)项目页面 (https://xiechenxi99.github.io/TVEdit/)GitHub14 (https://github.com/PolyU-VCLab/TVEdit)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.16767)

在您的 agent 中获取此论文:

hf papers read 2606.16767

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。

引用此论文的 Space0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。

包含此论文的收藏0

没有收藏包含此论文

请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中,以在此页面建立链接。

相似文章

TIPSv2:以更强的块-文本对齐推进视觉-语言预训练

Hugging Face Daily Papers

# 论文页面 - TIPSv2:以更强的块-文本对齐推进视觉-语言预训练 来源:[https://huggingface.co/papers/2604.12012](https://huggingface.co/papers/2604.12012) 发布时间:4 月 13 日 · 提交者 [https://huggingface.co/bingyic](https://huggingface.co/bingyic) [![](https://huggingface.co/avatars/05be62f5927b8586ef7cb927d47dcd83.svg)](https://huggingface.co/bingyic) [bingyi](https://huggingface.co/bingyic) 于 4 月 20 日 作者:,,,,,,,,,,,,,,,,,## 摘要