一个包含52个文本到图像模型评估的数据集 [P]

Reddit r/MachineLearning 论文

摘要

一个新的基准数据集和评估方法已经发布,用于评估52个文本到图像模型,包括结果、排行榜和图库,以测试在复杂提示上的表现。

我创建了一个简单的文本到图像基准测试。我策划了192个提示,这些提示以各种方式对T2I模型具有挑战性:文本渲染、空间推理、人物真实感、否定等等。然后,我要求一个VLM根据预先指定的二元问题对每个输出进行判断,其中包含了真实答案。我正在发布所有结果,包括图像。(大多数公共T2I排行榜不发布实际图像,这在我看来很遗憾)目前已有52个模型被测试!生成并分析了超过9千张图像!完整方法论:https://imagebench.ai/methodology-v1 Hugging Face 数据集:https://huggingface.co/datasets/dh7/imagebench(包含重现结果所需的提示和结果)GitHub:https://github.com/dh7/image-bench-ai 检查结果的图库:https://imagebench.ai/gallery 排行榜:https://imagebench.ai/imagebench-v1 局限性:仅限于文本到图像,且VLM作为评判者并不完美。请告诉我从这里有什么有用的!
查看原文

相似文章

本地文本到图像模型对比:终极测试。

Reddit r/LocalLLaMA

用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。

@AdinaYakup: 论文:

X AI KOLs Following

一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。