文本-视觉协同指导的图像编辑
摘要
一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。
查看缓存全文
缓存时间: 2026/06/17 11:37
论文页面 - 文本-视觉协同指导的图像编辑
来源: https://huggingface.co/papers/2606.16767
摘要
本文提出了一种统一的文本-视觉图像编辑框架,将文本指令的语义意图与视觉提示的空间指导相结合,以实现更精确、更保真的图像操作。
现有的图像编辑方法通常可分为两类:基于文本指令的方法 (https://huggingface.co/papers?q=textual%20instruction-based) 和基于视觉提示的方法 (https://huggingface.co/papers?q=visual%20prompt-based)。文本指令语义表达力强,但受限于编辑结果的空间控制 (https://huggingface.co/papers?q=spatial%20control) 粒度较粗。相反,拖动、点选等视觉提示可提供精确的空间指导 (https://huggingface.co/papers?q=spatial%20guidance),但受限于语义意图 (https://huggingface.co/papers?q=semantic%20intent) 的固有模糊性。为了融合文本与视觉提示的优势,我们提出了文本-视觉协同指导的图像编辑,该方法将文本指令作为语义意图 (https://huggingface.co/papers?q=semantic%20intent)、稀疏视觉指令作为空间指导 (https://huggingface.co/papers?q=spatial%20guidance) 进行联合建模,旨在实现精确且意图保真的图像操作。为此,我们首先构建了一个包含超过 23K 个样本的文本-视觉指令配对数据集 (https://huggingface.co/papers?q=textual-visual%20instruction%20paired%20dataset),数据源自动态视频,从而为跨模态指令 (https://huggingface.co/papers?q=cross-modal%20instruction) 提供对齐监督。接着,我们提出了 TV-Edit (https://huggingface.co/papers?q=TV-Edit),一个文本-视觉指令统一编辑框架,将拖动或点选类视觉指令与图像-文本语义进行情境化,并将其提升为语义感知的控制表征 (https://huggingface.co/papers?q=semantic-aware%20control%20representations),供预训练编辑主干 (https://huggingface.co/papers?q=pretrained%20editing%20backbones) 使用。通过整合语义意图 (https://huggingface.co/papers?q=semantic%20intent) 和空间约束,TV-Edit (https://huggingface.co/papers?q=TV-Edit) 在空间控制 (https://huggingface.co/papers?q=spatial%20control) 上比纯文本或纯拖动方法更精确,指令歧义更少,结构一致性 (https://huggingface.co/papers?q=structural%20consistency) 更强。最后,我们建立了 TV-Edit-Bench (https://huggingface.co/papers?q=TV-Edit-Bench),一个精心设计的基准,用于评估语义保真度、空间对齐和视觉一致性,包含真实参考及可控的文本-视觉变化,以确保评估的可靠性。我们在多个编辑主干上的实验表明,TV-Edit (https://huggingface.co/papers?q=TV-Edit) 始终能产生更精确、更意图保真的编辑结果 (https://huggingface.co/papers?q=intent-faithful%20edits),显著优于最先进的指令式方法和拖动式基线。
查看 arXiv 页面 (https://arxiv.org/abs/2606.16767)查看 PDF (https://arxiv.org/pdf/2606.16767)项目页面 (https://xiechenxi99.github.io/TVEdit/)GitHub14 (https://github.com/PolyU-VCLab/TVEdit)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.16767)
在您的 agent 中获取此论文:
hf papers read 2606.16767
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。
引用此论文的 Space0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.16767 以在此页面建立链接。
包含此论文的收藏0
没有收藏包含此论文
请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中,以在此页面建立链接。
相似文章
VGGT-Edit: 基于残差场预测的前馈原生3D场景编辑
VGGT-Edit 提出了一种基于深度同步文本注入和残差场预测的前馈框架,用于文本驱动的原生3D场景编辑,相较于2D提升方法,实现了更优的质量和效率。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
TIPSv2:以更强的块-文本对齐推进视觉-语言预训练
# 论文页面 - TIPSv2:以更强的块-文本对齐推进视觉-语言预训练 来源:[https://huggingface.co/papers/2604.12012](https://huggingface.co/papers/2604.12012) 发布时间:4 月 13 日 · 提交者 [https://huggingface.co/bingyic](https://huggingface.co/bingyic) [](https://huggingface.co/bingyic) [bingyi](https://huggingface.co/bingyic) 于 4 月 20 日 作者:,,,,,,,,,,,,,,,,,## 摘要
HP-Edit:面向图像编辑的人类偏好后训练框架
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。