StableI2I:识别图像到图像转换中的非预期变化

Hugging Face Daily Papers 论文

摘要

本文介绍了 StableI2I,这是一种无需参考图像的评估框架,用于评估图像到图像生成任务中的内容保真度和一致性。此外,本文还提出了 StableI2I-Bench,一个用于评估多模态语言模型在这些评估任务上表现的基准。

在大多数现实世界的图像到图像(I2I)场景中,现有评估主要关注指令遵循以及生成图像的感知质量或美学效果。然而,这些评估往往无法有效判断输出图像是否保留了输入图像的语义对应关系和空间结构。为了克服这一局限性,我们提出了 StableI2I,这是一种统一且动态的评估框架,能够在无需参考图像的情况下,广泛衡量包括图像编辑和图像修复在内的各类 I2I 任务中的内容保真度和前后一致性。此外,我们构建了 StableI2I-Bench,这是一个旨在系统评估多模态大语言模型(MLLMs)在此类保真度和一致性评估任务中准确性的基准测试。大量的实验结果表明,StableI2I 能够提供准确、细粒度且可解释的内容保真度与一致性评估,并且与人类主观判断具有高度的相关性。我们的框架可作为诊断内容一致性和基准测试实际 I2I 系统模型性能的实用且可靠的评估工具。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:14

论文页面 - StableI2I:捕捉图像到图像转换中的非预期变化

来源: https://huggingface.co/papers/2605.04453

摘要

StableI2I 是一个统一评估框架,用于在没有参考图像的情况下评估图像到图像(image-to-image)任务中的内容忠实度(content fidelity)和一致性,提供与人类判断相关且准确、可解释的测量结果。

在大多数现实世界中的图像到图像 (https://huggingface.co/papers?q=image-to-image) (I2I) 场景中,现有的评估方法主要关注指令遵循以及生成图像的感知质量或美学效果。然而,它们大多未能有效评估输出图像是否保留了输入图像的语义对应关系和空间结构。为了解决这一局限性,我们提出了 StableI2I (https://huggingface.co/papers?q=StableI2I),这是一个统一且动态的评估框架,能够在无需参考图像的情况下,显式地衡量广泛 I2I 任务(包括图像编辑 (https://huggingface.co/papers?q=image%20editing) 和图像修复 (https://huggingface.co/papers?q=image%20restoration))中的内容忠实度 (https://huggingface.co/papers?q=content%20fidelity) 和前后一致性。此外,我们构建了 StableI2I-Bench (https://huggingface.co/papers?q=StableI2I-Bench),这是一个旨在系统评估多模态大语言模型 (MLLMs) (https://huggingface.co/papers?q=MLLMs) 在此类忠实度和一致性评估任务上准确性的基准测试。大量的实验结果表明,StableI2I (https://huggingface.co/papers?q=StableI2I) 提供了对内容忠实度 (https://huggingface.co/papers?q=content%20fidelity) 和一致性的准确、细粒度且可解释的评估,与人类主观判断具有强相关性。我们的框架为诊断现实世界 I2I 系统中的内容一致性和基准测试模型性能提供了一个实用且可靠的评估工具。

查看 arXiv 页面 (https://arxiv.org/abs/2605.04453) 查看 PDF (https://arxiv.org/pdf/2605.04453) 项目页面 (https://henry-lee-real.github.io/StableI2I_Page/) GitHub 10 (https://github.com/Henry-Lee-real/StableI2I) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04453)

在你的智能体中获取此论文:

hf papers read 2605\.04453

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 2

lijiayangCS/StableI2I_PLUS 图像-文本-到-文本 • 770k • 1 天前更新 • 45 • 1 (https://huggingface.co/lijiayangCS/StableI2I_PLUS)

lijiayangCS/StableI2I 图像-文本-到-文本 • 770k • 1 天前更新 • 88 • 1 (https://huggingface.co/lijiayangCS/StableI2I)

引用此论文的数据集 1

lijiayangCS/StableI2I_Bench 查看器 • 1 天前更新 • 3k • 765 • 1 (https://huggingface.co/datasets/lijiayangCS/StableI2I_Bench)

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.04453 即可从此页面进行链接。

包含此论文的合集 1

相似文章

i1:一个简单且完全开放的强文本到图像模型配方

Hugging Face Daily Papers

本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。

照亮统一多模态模型,实现自由形式交错图文生成

Hugging Face Daily Papers

ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。