一个包含52个文本到图像模型评估的数据集 [P]
摘要
一个新的基准数据集和评估方法已经发布,用于评估52个文本到图像模型,包括结果、排行榜和图库,以测试在复杂提示上的表现。
我创建了一个简单的文本到图像基准测试。我策划了192个提示,这些提示以各种方式对T2I模型具有挑战性:文本渲染、空间推理、人物真实感、否定等等。然后,我要求一个VLM根据预先指定的二元问题对每个输出进行判断,其中包含了真实答案。我正在发布所有结果,包括图像。(大多数公共T2I排行榜不发布实际图像,这在我看来很遗憾)目前已有52个模型被测试!生成并分析了超过9千张图像!完整方法论:https://imagebench.ai/methodology-v1 Hugging Face 数据集:https://huggingface.co/datasets/dh7/imagebench(包含重现结果所需的提示和结果)GitHub:https://github.com/dh7/image-bench-ai 检查结果的图库:https://imagebench.ai/gallery 排行榜:https://imagebench.ai/imagebench-v1 局限性:仅限于文本到图像,且VLM作为评判者并不完美。请告诉我从这里有什么有用的!
相似文章
本地文本到图像模型对比:终极测试。
用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。
@AdinaYakup: Qwen @Alibaba_Qwen 刚刚发布了一个新的文本到图像基准测试和一个评判模型 https://huggingface.co/collections/Qwen/q…
Qwen 发布了一个新的文本到图像基准测试,包含56个细粒度评估维度,衡量超越提示对齐的创造力,并包含一个与人类对齐的评判模型。
@AdinaYakup: 论文:
一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
@drfeifei: 我非常兴奋于这个适用于大规模生成模型新时代的视觉生成新基准数据集…
介绍GPIC(Giant Permissive Image Corpus),一个大规模数据集,包含1亿个VLM标注的图像-文本对用于训练,以及100万个用于基准测试的对,完全许可用于研究和商业用途。