Uni-Edit:智能编辑是统一模型调优的通用任务
摘要
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
查看缓存全文
缓存时间: 2026/05/21 06:20
论文页面 - Uni-Edit:智能编辑作为统一模型调优的通用任务
来源:https://huggingface.co/papers/2605.21487
摘要
Uni-Edit 提出了一种智能图像编辑任务,能够通过单一训练阶段和单一数据集,同时增强统一多模态模型的理解、生成和编辑能力,并利用自动化的数据合成流水线生成复杂编辑指令。
目前,增强统一多模态模型(https://huggingface.co/papers?q=Unified%20Multimodal%20Models)(UMM)的图像理解、生成和编辑能力主要依赖于混合多任务训练(https://huggingface.co/papers?q=multi-task%20training)。由于任务间固有的冲突,这种策略需要复杂的多阶段流水线、海量数据混合以及平衡技巧,最终只能实现性能权衡,而非真正的相互促进。为了打破这一范式,我们提出了Uni-Edit,一种智能图像编辑(https://huggingface.co/papers?q=image%20editing)任务,它作为首个UMM调优的通用任务。与复杂的混合流水线不同,Uni-Edit仅使用一个任务、一个训练阶段和一个数据集,就能一次性提升所有三种能力。具体来说,我们首先发现图像编辑(https://huggingface.co/papers?q=image%20editing)本质上是一种理想的通用任务,因为它自然需要同时具备视觉理解和生成能力。然而,现有的编辑数据依赖于简单的指令,严重低估了模型的理解能力。为解决这一问题,我们引入了首个自动化、可扩展的数据合成流水线(https://huggingface.co/papers?q=data%20synthesis%20pipeline)用于智能编辑,将多样化的VQA数据(https://huggingface.co/papers?q=VQA%20data)转换为包含问题嵌入和嵌套逻辑的复杂而有效的编辑指令。由此产生了Uni-Edit-148k,它将多样化的强推理指令(https://huggingface.co/papers?q=reasoning-intensive%20instructions)与高质量的编辑图像配对。在BAGEL(https://huggingface.co/papers?q=BAGEL)和Janus-Pro(https://huggingface.co/papers?q=Janus-Pro)上的大量实验表明,仅在Uni-Edit上微调,无需任何辅助操作即可在所有三种能力上实现全面增强。
查看arXiv页面(https://arxiv.org/abs/2605.21487)查看PDF(https://arxiv.org/pdf/2605.21487)项目页面(https://zhengdian1.github.io/Uni-Edit-proj/)GitHub2(https://github.com/zhengdian1/Uni-Edit)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21487)
引用本文的模型1
Uni-Edit/Uni-Edit-BAGEL 任意到任意• 15B• 更新于约4小时前 • 14 • 1(https://huggingface.co/Uni-Edit/Uni-Edit-BAGEL)
引用本文的数据集1
Uni-Edit/Train-Data 查看器• 更新于约4小时前 • 8.39k • 24(https://huggingface.co/datasets/Uni-Edit/Train-Data)
引用本文的Space0
没有任何Space链接到此论文
请在Space的README.md中引用 arxiv.org/abs/2605.21487,以使其与此页面建立链接。
包含本文的收藏0
没有任何收藏包含此论文
请将本文添加到一个收藏(https://huggingface.co/new-collection)中,以使其与此页面建立链接。
相似文章
文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试
本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
UniCorn:通过自生成监督走向自我改进的统一多模态模型
UniCorn 是一个框架,通过使用多智能体系统进行提示生成、图像创建和质量评估,使统一多模态模型能够自我改进,在 TIIF、WISE 和 OneIG-EN 等文本到图像基准上取得了最先进的结果。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
UniPath: 统一多模态推理中理解与生成的适应性协调
UniPath 提出了一种框架,用于统一多模态模型中理解与生成的适应性协调,利用协调路径多样性来提升相对于固定策略的性能。