标签
作者构建了一个AI技能,该技能使用分类的Text-to-Image Arena数据和排名分数,将图像模型与用户意图匹配,从而能够从一个提示生成并比较多种图像备选方案。
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
AntLing 已开源 Ming-Image-0.1-Design,这是一个6B参数的文本到图像模型,专为UI和文本丰富的视觉设计而设计,支持透明背景,并具备UI/UX设计排行榜。
Qwen-Image-2.1 的蒸馏学生模型,由 Viggle 使用分布匹配蒸馏训练,实现在6步而非40步中完成文本到图像生成和图像编辑,从而在保持竞争力质量的同时,性能提升约5倍。
Supra2-IMG 是一个仅具1亿参数的小型文本到图像模型,它在单块H100显卡上经过不到10小时的从头训练,实现了图像生成领域最先进的质量,并已在Hugging Face上开源发布。
Qwen-Image-2.1 是一个统一的文本到图像生成和图像编辑模型,拥有70亿参数,在效率、透明度、多功能性和真实性方面有所改进。来自 unsloth 的这个 GGUF 量化版本支持高效的本地推理。
本文可能介绍了Bonsai 2 27b AI模型,该模型能生成诸如驴制作咖啡和蘑菇骑驴等异想天开的SVG图像。
Linum AI 推出 JiT-DDT,这是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比之前的方法快3.6倍,同时生成更高分辨率的图像。
本文比较了2025年和2026年各种AI模型根据特定提示生成SVG的性能,详细说明了输出质量、耗时和成本。
Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。
一篇详细的文章,介绍了从头开始在单个GPU上训练一个210M文本到图像扩散Transformer,分享了关于注意力汇聚、损失作为健康信号以及时间步偏移益处的关键测量结果。
本文展示了 Workflow1111,这是一个使用 Gradio Workflow 重构的 AUTOMATIC1111 的 stable diffusion 网络界面,它将多个媒体管道和 AI 模型集成到一个画布中。
GPT Image 2.5 现已在 Martini 上可用,支持文本到图像生成和编辑,最高达 4K 分辨率,并具备多种风格参考。
OpenAI的新AI模型,GPT-Image-2.5-Sunburst和Flare,在文本到图像和图像编辑领域取得了顶级排名,显示出相比前代版本的显著改进。
本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。
Jasper Research 发布了一份从零开始构建文本到图像模型的完整指南与资源,其中包含详细解释、一个1亿图像的数据集以及一个带有微型模型的代码库。
本文介绍了I-CARE,这是一种系统性分析文本到图像模型机器遗忘中干扰的方法,提供了形式化定义和开源框架,以实现可重复研究。
本文详细介绍了使用 Qwen3.8-27b 模型进行端到端应用构建的完整流程,涵盖了提示流设计、文本生成图像以及图像到视频的剪辑处理。
本文介绍了ContextBias和ContextBench,用于评估文本到图像模型中的偏见持续性,发现在语义无关的上下文中偏见会增加。
一个新的基准数据集和评估方法已经发布,用于评估52个文本到图像模型,包括结果、排行榜和图库,以测试在复杂提示上的表现。