ImIR: 基于图像指令调优的一体化图像修复

Hugging Face Daily Papers 论文

摘要

ImIR 通过使用源自图像的指令,适配预训练图像编辑模型以执行六种图像修复任务,实现高效且任务无关的修复。

图像的退化方式千差万别,因此一个实用的修复系统必须能够用一个模型处理多种退化类型。最近一种有效的方法是使用一个小的低秩适配器和文本提示,将大型预训练图像编辑模型适配到修复任务。我们用源自退化图像本身的指令替代了该提示。图像通过两条路径到达编辑器:其结构来自模型的VAE,语义指令则来自一个轻量级令牌映射器,该映射器将退化图像的视觉语言嵌入向清洁图像可能产生的嵌入方向偏移。因为指令是一个连续向量,对其缩放可以为那些目标不唯一的任务(如低光增强)产生一系列有效的修复结果。我们使用单个适配器在单个GPU上训练约三小时,将一个Qwen-Image-Edit模型适配到六个任务。在匹配比较下,图像指令优于文本条件,并且它支持无需退化标签的任务无关修复,而文本变体则做不到这一点。
查看原文
查看缓存全文

缓存时间: 2026/09/23 11:32

论文页面 - ImIR:面向一体化图像修复的图像-指令调优

来源:https://huggingface.co/papers/2609.25267 ImIR:面向一体化图像修复的图像-指令调优 — ACCV 2026

ImIR 将一个预训练的图像编辑模型适配到六种修复任务中:低光增强、去雨、去雾、去模糊、去噪和 JPEG 伪影去除。其任务无关变体仅使用输入图像进行图像修复,无需文本提示、参考图像或降质标签。

主要亮点如下:

  • 图像衍生指令。 一个轻量级的标记映射器从降质图像的视觉-语言嵌入中预测出干净图像指令,替代了手动编写的修复提示。
  • 一个适配器跨越六项任务。 在匹配的对比中,图像条件优于文本条件,并支持任务无关修复——在这一场景下,中性文本和VLM生成的文本提示效果均不佳。
  • 连续控制。 对于具有非唯一目标的任务(例如低光增强中的曝光),缩放指令可产生不同的合理修复结果。
  • 高效适配。 实验设置使用了688对图像,在一块NVIDIA H100上大约耗时三小时。

推理代码和任务无关的模型权重已公开提供。项目页面包含交互式修复对比和指令尺度示例。

论文 (https://arxiv.org/abs/2609.25267) · 项目页面 (https://suleymanaslan.github.io/imir/) · 代码 (https://github.com/suleymanaslan/imir) · 权重 (https://huggingface.co/suleymanaslan/imir)

@article{aslan2026imirimageinstructiontuningallinone,
  title={{ImIR}: Image-Instruction Tuning for All-in-One Image Restoration},
  author={Süleyman Aslan and Görkay Aydemir and Mısra Yavuz
          and Yunus Bilge Kurt and Nasrin Rahimi and Ahmet Rasim Emirdağı
          and Burak Can Biner and M. Akın Yılmaz},
  journal={arXiv preprint arXiv:2609.25267},
  year={2026},
  url={https://arxiv.org/abs/2609.25267}
}

相似文章

MirrorPPR:基于示例的人像照片修图

Hugging Face Daily Papers

MirrorPPR 提出了一种基于示例的人像修图框架,采用带有 LoRA 适应的扩散变换器和自增强训练数据,实现了卓越的质量和身份保持。

文本-视觉协同指导的图像编辑

Hugging Face Daily Papers

一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。