text-to-image

标签

Cards List
#text-to-image

一个提示,多种图像模型,多种备选方案

Reddit r/AI_Agents ↗ · 17小时前

作者构建了一个AI技能,该技能使用分类的Text-to-Image Arena数据和排名分数,将图像模型与用户意图匹配,从而能够从一个提示生成并比较多种图像备选方案。

0 人收藏 0 人点赞
#text-to-image

高维潜变量的扩散性

Hugging Face Daily Papers ↗ · 5天前 缓存

本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。

0 人收藏 0 人点赞
#text-to-image

AntLing 开源了 Ming-Image-0.1-Design 系列

Reddit r/LocalLLaMA ↗ · 5天前 缓存

AntLing 已开源 Ming-Image-0.1-Design,这是一个6B参数的文本到图像模型,专为UI和文本丰富的视觉设计而设计,支持透明背景,并具备UI/UX设计排行榜。

0 人收藏 0 人点赞
#text-to-image

Viggle/Qwen-Image-2.1-viggle-turbo

Hugging Face Models Trending ↗ · 6天前 缓存

Qwen-Image-2.1 的蒸馏学生模型,由 Viggle 使用分布匹配蒸馏训练,实现在6步而非40步中完成文本到图像生成和图像编辑,从而在保持竞争力质量的同时,性能提升约5倍。

0 人收藏 0 人点赞
#text-to-image

[重磅发布] Supra2-IMG - 仅1亿参数的文本生成图像模型 - 达到尖端水准并完全开源发布!

Reddit r/LocalLLaMA ↗ · 6天前

Supra2-IMG 是一个仅具1亿参数的小型文本到图像模型,它在单块H100显卡上经过不到10小时的从头训练,实现了图像生成领域最先进的质量,并已在Hugging Face上开源发布。

0 人收藏 0 人点赞
#text-to-image

unsloth/Qwen-Image-2.1-GGUF

Hugging Face Models Trending ↗ · 6天前 缓存

Qwen-Image-2.1 是一个统一的文本到图像生成和图像编辑模型,拥有70亿参数,在效率、透明度、多功能性和真实性方面有所改进。来自 unsloth 的这个 GGUF 量化版本支持高效的本地推理。

0 人收藏 0 人点赞
#text-to-image

Bonsai 2 27b Q2 - 驴制作咖啡SVG与蘑菇骑驴

Reddit r/LocalLLaMA ↗ · 2026-09-18

本文可能介绍了Bonsai 2 27b AI模型,该模型能生成诸如驴制作咖啡和蘑菇骑驴等异想天开的SVG图像。

0 人收藏 0 人点赞
#text-to-image

训练文本到图像模型速度提升3.6倍

Hacker News Top ↗ · 2026-09-16 缓存

Linum AI 推出 JiT-DDT,这是一种新颖的编码器-解码器架构,训练文本到图像模型的速度比之前的方法快3.6倍,同时生成更高分辨率的图像。

0 人收藏 0 人点赞
#text-to-image

Show HN: Pelican-bicycle 替代方案(更新至2026年)

Hacker News Top ↗ · 2026-09-14 缓存

本文比较了2025年和2026年各种AI模型根据特定提示生成SVG的性能,详细说明了输出质量、耗时和成本。

0 人收藏 0 人点赞
#text-to-image

Qwen/Qwen-Image-2.1

Hugging Face Models Trending ↗ · 2026-09-14 缓存

Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。

0 人收藏 0 人点赞
#text-to-image

从头开始在单个GPU上训练一个210M文本到图像DiT:我的测量结果 [P]

Reddit r/MachineLearning ↗ · 2026-09-11

一篇详细的文章,介绍了从头开始在单个GPU上训练一个210M文本到图像扩散Transformer,分享了关于注意力汇聚、损失作为健康信号以及时间步偏移益处的关键测量结果。

0 人收藏 0 人点赞
#text-to-image

使用 Gradio Workflow 重构 AUTOMATIC1111

Hugging Face Blog ↗ · 2026-09-10 缓存

本文展示了 Workflow1111,这是一个使用 Gradio Workflow 重构的 AUTOMATIC1111 的 stable diffusion 网络界面,它将多个媒体管道和 AI 模型集成到一个画布中。

0 人收藏 0 人点赞
#text-to-image

@martini_film: GPT Image 2.5 is on Martini. One bear. One photo. Thirty one-line directions: Lego, 浴缸, 珍珠奶茶, 折纸, 气球, 金色,…

X AI KOLs Timeline ↗ · 2026-09-09 缓存

GPT Image 2.5 现已在 Martini 上可用,支持文本到图像生成和编辑,最高达 4K 分辨率,并具备多种风格参考。

0 人收藏 0 人点赞
#text-to-image

@gdb:团队一直在研发

X AI KOLs Timeline ↗ · 2026-09-08 缓存

OpenAI的新AI模型,GPT-Image-2.5-Sunburst和Flare,在文本到图像和图像编辑领域取得了顶级排名,显示出相比前代版本的显著改进。

0 人收藏 0 人点赞
#text-to-image

研究图像分词器作为统一多模态模型中的视觉语言

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。

0 人收藏 0 人点赞
#text-to-image

从零开始创建文本到图像模型的详细解释 [R]

Reddit r/MachineLearning ↗ · 2026-09-02

Jasper Research 发布了一份从零开始构建文本到图像模型的完整指南与资源,其中包含详细解释、一个1亿图像的数据集以及一个带有微型模型的代码库。

0 人收藏 0 人点赞
#text-to-image

I-CARE:在可控、多样且具代表性的文本到图像模型遗忘设置中干扰相关现象的分析

arXiv cs.AI ↗ · 2026-09-02 缓存

本文介绍了I-CARE,这是一种系统性分析文本到图像模型机器遗忘中干扰的方法,提供了形式化定义和开源框架,以实现可重复研究。

0 人收藏 0 人点赞
#text-to-image

Qwen3.8-27b-UD-IQ3XXS - 端到端构建应用 -> Prompt Flow -> 文本生图 -> 图像转视频 - 剪辑

Reddit r/LocalLLaMA ↗ · 2026-08-30

本文详细介绍了使用 Qwen3.8-27b 模型进行端到端应用构建的完整流程,涵盖了提示流设计、文本生成图像以及图像到视频的剪辑处理。

0 人收藏 0 人点赞
#text-to-image

ContextBias: 文本到图像模型中上下文转变下偏见持续性的受控评估

Hugging Face Daily Papers ↗ · 2026-08-30 缓存

本文介绍了ContextBias和ContextBench,用于评估文本到图像模型中的偏见持续性,发现在语义无关的上下文中偏见会增加。

0 人收藏 0 人点赞
#text-to-image

一个包含52个文本到图像模型评估的数据集 [P]

Reddit r/MachineLearning ↗ · 2026-08-26

一个新的基准数据集和评估方法已经发布,用于评估52个文本到图像模型,包括结果、排行榜和图库,以测试在复杂提示上的表现。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈