本地文本到图像模型对比:终极测试。

Reddit r/LocalLLaMA 新闻

摘要

用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。

我选择了192个提示词来评估文本到图像模型的各种能力,并为所有能在我的GX10 Spark上运行的本地模型生成了图像。例如:模型在文本处理方面表现如何?人脸呢?人体解剖呢?是否尊重空间构图等?你只需查看图像即可自行判断。你可以在这里看到所有图像:https://imagebench.ai/gallery?g=1_vbohinub2qwsahfzi_c11l7fi3.6wh838_lm 所有提示词都在这里:https://github.com/dh7/image-bench-ai 我还使用了一些VLM来评估图像。VLM并不完美,但足以理解本地模型与前沿API相比的表现。以下是本次测试的结果:https://imagebench.ai/imagebench-v1 希望这对大家有用,我很好奇下一步应该在GX10 Spark上测试什么。https://preview.redd.it/884996abvo8h1.png?width=2472&format=png&auto=webp&s=f5482c5391711a2186d5b4ff0bbd11d724a40aab
查看原文

相似文章

32个本地模型正面交锋

Reddit r/LocalLLaMA

一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。

@AdinaYakup: 论文:

X AI KOLs Following

一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。

最强本地AI图像生成器来了!

YouTube AI Channels

Ernie Image,全新开源扩散模型,文字渲染与提示词忠实度全面超越Zage,可在ComfyUI本地运行,仅需约20 GB显存。