UFO:多模态图像生成中全条件对齐的链式评估
摘要
UFO 是一个统一框架,用于多模态图像生成中全条件对齐的同时评估。它引入了原子化链式评估范式和 UFO-Bench 基准测试。
查看缓存全文
缓存时间: 2026/09/18 02:59
论文页面 - UFO:多模态图像生成中全条件对齐的评估链
来源:https://huggingface.co/papers/2609.12397
摘要
近年来,多模态图像生成,尤其是基于主体的定制化生成,受到了越来越多的关注。尽管生成式模型发展迅速,但其评估方法仍普遍滞后。现有方法,无论是基于嵌入的还是基于多模态大语言模型的,都是孤立地评估与各模态条件的一致性,这与多模态图像生成同时满足多条件的目标相悖,导致其与人类判断的一致性较差。为应对这一挑战,我们提出了UFO,这是首个用于全条件对齐同步评估的统一框架。具体而言,UFO引入了一种新颖的原子化评估链范式,即:首先将全条件对齐分解为一系列细粒度、解耦的原子评估单元,并将其归类为不同的模态相关类别,然后利用通用或专用功能调用来精确验证不同类型的原子评估单元。实验结果表明,UFO与人类评估偏好具有最高的相关性,平均提升了15.25%。此外,我们还推出了UFO-Bench,这是一个专用基准测试,旨在全面评估现有定制化模型在文本与视觉条件多样化交互下的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2609.12397) 查看 PDF (https://arxiv.org/pdf/2609.12397) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.12397)
引用本文的模型 0
没有模型链接到本文
在模型的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。
引用本文的数据集 0
没有数据集链接到本文
在数据集的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。
引用本文的 Space 0
没有 Space 链接到本文
在 Space 的 README.md 文件中引用 arxiv.org/abs/2609.12397 以将其链接至此页面。
包含本文的收藏夹 0
没有收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
UFO: 一种无需域统一的操作符框架,用于通用操作符学习
介绍UFO,一种跨域神经操作符框架,能自适应地学习不同表示域上的操作符,实现与离散化解耦的预测,对分布偏移具有鲁棒性。
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
UniCorn:通过自生成监督走向自我改进的统一多模态模型
UniCorn 是一个框架,通过使用多智能体系统进行提示生成、图像创建和质量评估,使统一多模态模型能够自我改进,在 TIIF、WISE 和 OneIG-EN 等文本到图像基准上取得了最先进的结果。
OmniLoc: 一种几何感知的基础模型,用于跨多样化室内环境的无锚点用户设备定位
OmniLoc是一种几何感知的基础模型,用于跨多样化室内环境的无锚点用户设备定位,它采用统一的令牌化模块、几何感知的Transformer和几何嵌入,显著优于现有方法。
TorchUMM: 一个用于评估、分析和后训练的统一多模态模型代码库
TorchUMM 是一个统一的代码库,用于评估和分析多模态模型在理解、生成和编辑任务上的表现,采用标准化协议和多样化数据集,能够实现公平比较并深入洞察模型的优势与局限性。