UFO:多模态图像生成中全条件对齐的链式评估

Hugging Face Daily Papers 论文

摘要

UFO 是一个统一框架,用于多模态图像生成中全条件对齐的同时评估。它引入了原子化链式评估范式和 UFO-Bench 基准测试。

多模态图像生成,特别是主题驱动的定制,近年来引起了越来越多的关注。尽管生成模型发展迅速,但它们的评估仍然大大滞后。现有方法,无论是基于嵌入的还是基于多模态大型语言模型(MLLM)的,都孤立地评估与每个模态条件的对齐,这与多模态图像生成的同步条件对齐目标相矛盾,导致与人类判断的一致性差。为了解决这个挑战,我们提出了 UFO,这是第一个用于全条件对齐同时评估的统一框架。具体来说,UFO 引入了一种新的原子化链式评估范式,即首先将全条件对齐分解为一系列细粒度、解耦的原子评估单元(AEUs)的顺序链,将它们分类为不同的模态相关类别,然后采用通用或专用功能调用来准确验证不同类型的 AEUs。实验结果表明,UFO 实现了与人类评估偏好最高的相关性,平均提高了 15.25%。此外,我们介绍了 UFO-Bench,这是一个专门设计的基准测试,用于全面评估现有定制模型在文本和视觉条件的多样相互作用下的性能。
查看原文
查看缓存全文

缓存时间: 2026/09/18 02:59

论文页面 - UFO:多模态图像生成中全条件对齐的评估链

来源:https://huggingface.co/papers/2609.12397

摘要

近年来,多模态图像生成,尤其是基于主体的定制化生成,受到了越来越多的关注。尽管生成式模型发展迅速,但其评估方法仍普遍滞后。现有方法,无论是基于嵌入的还是基于多模态大语言模型的,都是孤立地评估与各模态条件的一致性,这与多模态图像生成同时满足多条件的目标相悖,导致其与人类判断的一致性较差。为应对这一挑战,我们提出了UFO,这是首个用于全条件对齐同步评估的统一框架。具体而言,UFO引入了一种新颖的原子化评估链范式,即:首先将全条件对齐分解为一系列细粒度、解耦的原子评估单元,并将其归类为不同的模态相关类别,然后利用通用或专用功能调用来精确验证不同类型的原子评估单元。实验结果表明,UFO与人类评估偏好具有最高的相关性,平均提升了15.25%。此外,我们还推出了UFO-Bench,这是一个专用基准测试,旨在全面评估现有定制化模型在文本与视觉条件多样化交互下的性能。

查看 arXiv 页面 (https://arxiv.org/abs/2609.12397) 查看 PDF (https://arxiv.org/pdf/2609.12397) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.12397)

引用本文的模型 0

没有模型链接到本文

在模型的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。

引用本文的数据集 0

没有数据集链接到本文

在数据集的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。

引用本文的 Space 0

没有 Space 链接到本文

在 Space 的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。

包含本文的收藏夹 0

没有收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章