text-to-image

标签

Cards List
#text-to-image

LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距

arXiv cs.LG · 2天前 缓存

本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。

0 人收藏 0 人点赞
#text-to-image

面向连贯性的梦境场景可视化

arXiv cs.AI · 2天前 缓存

这篇arXiv论文介绍了梦境场景可视化器(DSV),该系统利用LLM进行叙事拆分,并结合带反馈的文本到图像模型,将书面梦境描述转换为连贯的四面板视觉序列,以确保视觉和语义连贯性。

0 人收藏 0 人点赞
#text-to-image

Qwen 3.0 Image Pro

Hacker News Top · 4天前 缓存

QwenCloud 发布了 Qwen-Image-3.0-Pro,一款强大的图像生成模型,支持密集布局、微小文字渲染和原生多语言输出,将其定位为可部署的生产力工具。

0 人收藏 0 人点赞
#text-to-image

@rohanpaul_ai: 更长的提示词并不是图像生成器所需要的。文生图模型似乎更多受到提示词如何清晰地展现场景的约束,而非提示词长度的影响……

X AI KOLs Following · 4天前 缓存

一篇新论文认为,文生图模型从更长的提示词中获益较少,而更多受益于明确组织的视觉结构,提出使用结构化提示词而非自然语言散文。

0 人收藏 0 人点赞
#text-to-image

Poly-OPD:面向能力可选的流模型的异构多教师同策略蒸馏

Hugging Face Daily Papers · 5天前 缓存

Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。

0 人收藏 0 人点赞
#text-to-image

Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型

Hugging Face Daily Papers · 6天前 缓存

Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。

0 人收藏 0 人点赞
#text-to-image

UniWorld-Design:从像素生成到图层原生设计

Hugging Face Daily Papers · 6天前 缓存

UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#text-to-image

@FinanceYF5: 有人让 Claude 5 Opus 挑战了一次“极限画质”:不使用任何贴图,直接从零生成一辆越野车和泥地赛道。 画面里的车身、轮胎、尘土和环境,全由模型自己完成。 现在的AI做游戏图形,已经开始摆脱现成素材了。

X AI KOLs Following · 2026-07-31 缓存

有人让 Claude 5 Opus 在无贴图条件下从零生成越野车和泥地赛道画面,展示AI生成游戏图形的能力。

0 人收藏 0 人点赞
#text-to-image

@LinusEkenstam:Midjourney V8.2 来了。

X AI KOLs Following · 2026-07-30 缓存

Midjourney V8.2 已发布,标志着这款流行的 AI 图像生成模型迎来了新版本。

0 人收藏 0 人点赞
#text-to-image

MPIE-Bench:面向解剖学合理的多人交互编辑的基准测试

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。

0 人收藏 0 人点赞
#text-to-image

@gudanglifehack: 微软发布了两款新的内部AI模型,MAI Image 2.5 Pro在图像生成质量上实现了显著提升…

X AI KOLs Timeline · 2026-07-28 缓存

微软发布了MAI Image 2.5 Pro,这是一款新的内部AI模型,具备改进的图像生成质量、复杂提示处理、文本渲染和自然语言编辑能力。

0 人收藏 0 人点赞
#text-to-image

@cevenif: 又挖到一个真正能白嫖的AI绘画神器! 无需注册、不用登录,更没有积分限制——主打一个纯粹。 输入一句话,几秒钟就能生成一张图,1:1、16:9、9:16多种比例随便选。 https://imagefree.net/zh

X AI KOLs Timeline · 2026-07-24 缓存

推广ImageFree.net,一款完全免费、无需注册、无使用限制的AI文生图工具,支持多种尺寸,几秒内生成图片。

0 人收藏 0 人点赞
#text-to-image

一次重写解决所有问题?面向文本到图像提示优化的类型感知修复分配

arXiv cs.AI · 2026-07-22 缓存

本文介绍了类型感知修复分配(TARA),这是一个无需训练的框架,将文本到图像提示优化分解为原子修复分配,其中每个失败的命题被路由到类型条件的修复操作符。实验表明,TARA在DSG和TIFA基准测试上跨四个生成器取得了最佳语义准确性,在保持图像质量的同时优于VisualPrompter。

0 人收藏 0 人点赞
#text-to-image

Mage (GitHub 仓库)

TLDR AI · 2026-07-22 缓存

微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。

0 人收藏 0 人点赞
#text-to-image

mindlab-research/Macaron-V1-Venti • HuggingFace

Reddit r/LocalLLaMA · 2026-07-21

MindLab Research 发布了 Macaron-V1-Venti,这是一个新的多模态 AI 模型,在 HuggingFace 上可用,可能用于文本到图像或图像生成任务。

0 人收藏 0 人点赞
#text-to-image

microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending · 2026-07-21 缓存

微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。

0 人收藏 0 人点赞
#text-to-image

microsoft/Mage-Flow

Hugging Face Models Trending · 2026-07-21 缓存

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

0 人收藏 0 人点赞
#text-to-image

文本模板令牌是扩散变换器中的隐式语义寄存器

Hugging Face Daily Papers · 2026-07-21 缓存

本文研究了扩散变换器(DiTs)中的文本模板令牌如何作为隐式语义寄存器,在去噪过程中因果地维持物体身份,并提出了一种无需训练的剪枝规则,该规则移除了20%的注意力FLOPs,且性能下降极小。

0 人收藏 0 人点赞
#text-to-image

用于生成建模的三体散射

Hugging Face Daily Papers · 2026-07-20 缓存

介绍了一种名为三体散射建模(TBSM)的框架,用于学习传输场的一步生成建模。该方法在ImageNet-256上取得了具有竞争力的结果,并扩展到参数量高达200亿的文本到图像模型。

0 人收藏 0 人点赞
#text-to-image

将文本转换为图像以节省Token使用量

Reddit r/ArtificialInteligence · 2026-07-14

DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈