本地文本到图像模型对比:终极测试。
摘要
用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。
我选择了192个提示词来评估文本到图像模型的各种能力,并为所有能在我的GX10 Spark上运行的本地模型生成了图像。例如:模型在文本处理方面表现如何?人脸呢?人体解剖呢?是否尊重空间构图等?你只需查看图像即可自行判断。你可以在这里看到所有图像:https://imagebench.ai/gallery?g=1_vbohinub2qwsahfzi_c11l7fi3.6wh838_lm 所有提示词都在这里:https://github.com/dh7/image-bench-ai 我还使用了一些VLM来评估图像。VLM并不完美,但足以理解本地模型与前沿API相比的表现。以下是本次测试的结果:https://imagebench.ai/imagebench-v1 希望这对大家有用,我很好奇下一步应该在GX10 Spark上测试什么。https://preview.redd.it/884996abvo8h1.png?width=2472&format=png&auto=webp&s=f5482c5391711a2186d5b4ff0bbd11d724a40aab
相似文章
32个本地模型正面交锋
一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。
@NielsRogge: 优秀的论文,已在此处开放:https://paperswithcode.co/paper/98589 查看它与其他文本到图像模型的对比…
一篇关于文本到图像生成的论文已发布,附有开源代码、模型和完整的训练方案,并与其他模型的性能进行了比较。
@AdinaYakup: Qwen @Alibaba_Qwen 刚刚发布了一个新的文本到图像基准测试和一个评判模型 https://huggingface.co/collections/Qwen/q…
Qwen 发布了一个新的文本到图像基准测试,包含56个细粒度评估维度,衡量超越提示对齐的创造力,并包含一个与人类对齐的评判模型。
@AdinaYakup: 论文:
一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。
最强本地AI图像生成器来了!
Ernie Image,全新开源扩散模型,文字渲染与提示词忠实度全面超越Zage,可在ComfyUI本地运行,仅需约20 GB显存。