StableI2I:识别图像到图像转换中的非预期变化
摘要
本文介绍了 StableI2I,这是一种无需参考图像的评估框架,用于评估图像到图像生成任务中的内容保真度和一致性。此外,本文还提出了 StableI2I-Bench,一个用于评估多模态语言模型在这些评估任务上表现的基准。
查看缓存全文
缓存时间: 2026/05/08 08:14
论文页面 - StableI2I:捕捉图像到图像转换中的非预期变化
来源: https://huggingface.co/papers/2605.04453
摘要
StableI2I 是一个统一评估框架,用于在没有参考图像的情况下评估图像到图像(image-to-image)任务中的内容忠实度(content fidelity)和一致性,提供与人类判断相关且准确、可解释的测量结果。
在大多数现实世界中的图像到图像 (https://huggingface.co/papers?q=image-to-image) (I2I) 场景中,现有的评估方法主要关注指令遵循以及生成图像的感知质量或美学效果。然而,它们大多未能有效评估输出图像是否保留了输入图像的语义对应关系和空间结构。为了解决这一局限性,我们提出了 StableI2I (https://huggingface.co/papers?q=StableI2I),这是一个统一且动态的评估框架,能够在无需参考图像的情况下,显式地衡量广泛 I2I 任务(包括图像编辑 (https://huggingface.co/papers?q=image%20editing) 和图像修复 (https://huggingface.co/papers?q=image%20restoration))中的内容忠实度 (https://huggingface.co/papers?q=content%20fidelity) 和前后一致性。此外,我们构建了 StableI2I-Bench (https://huggingface.co/papers?q=StableI2I-Bench),这是一个旨在系统评估多模态大语言模型 (MLLMs) (https://huggingface.co/papers?q=MLLMs) 在此类忠实度和一致性评估任务上准确性的基准测试。大量的实验结果表明,StableI2I (https://huggingface.co/papers?q=StableI2I) 提供了对内容忠实度 (https://huggingface.co/papers?q=content%20fidelity) 和一致性的准确、细粒度且可解释的评估,与人类主观判断具有强相关性。我们的框架为诊断现实世界 I2I 系统中的内容一致性和基准测试模型性能提供了一个实用且可靠的评估工具。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04453) 查看 PDF (https://arxiv.org/pdf/2605.04453) 项目页面 (https://henry-lee-real.github.io/StableI2I_Page/) GitHub 10 (https://github.com/Henry-Lee-real/StableI2I) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04453)
在你的智能体中获取此论文:
hf papers read 2605\.04453
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 2
lijiayangCS/StableI2I_PLUS 图像-文本-到-文本 • 770k • 1 天前更新 • 45 • 1 (https://huggingface.co/lijiayangCS/StableI2I_PLUS)
lijiayangCS/StableI2I 图像-文本-到-文本 • 770k • 1 天前更新 • 88 • 1 (https://huggingface.co/lijiayangCS/StableI2I)
引用此论文的数据集 1
lijiayangCS/StableI2I_Bench 查看器 • 1 天前更新 • 3k • 765 • 1 (https://huggingface.co/datasets/lijiayangCS/StableI2I_Bench)
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.04453 即可从此页面进行链接。
包含此论文的合集 1
相似文章
论多语言文本到图像生成中跨语言一致性的局限性
本文介绍了LingT2I,这是一个覆盖10种语言、包含33K个提示词的基准,用于评估文本到图像生成中的跨语言一致性,揭示了内容生成和文本渲染方面的语言不平等及语言依赖的权衡。
图像即句子:扩展交错指令以实现统一的视觉生成
本文介绍了 INSET,这是一个统一的多模态模型,它将图像作为原生词汇嵌入到文本指令中,从而提高了在图像生成和编辑任务中处理复杂交错输入的能力。
i1:一个简单且完全开放的强文本到图像模型配方
本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。
照亮统一多模态模型,实现自由形式交错图文生成
ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。