image-generation

标签

Cards List
#image-generation

@LinusEkenstam:Midjourney V8.2 来了。

X AI KOLs Following · 2026-07-30 缓存

Midjourney V8.2 已发布,标志着这款流行的 AI 图像生成模型迎来了新版本。

0 人收藏 0 人点赞
#image-generation

@Google:现在,您可以在@GoogleEarth中直接使用Nano Banana 2的图像生成功能来改变任何地方。想象一下…

X AI KOLs Timeline · 2026-07-30 缓存

Google将Nano Banana 2的图像生成功能集成到Google Earth中,用户只需输入提示词,即可可视化历史场景、重新构想空间以及构思房地产方案。

0 人收藏 0 人点赞
#image-generation

视频生成的并行解码(10分钟阅读)

TLDR AI · 2026-07-30 缓存

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

0 人收藏 0 人点赞
#image-generation

@gudanglifehack: 微软发布了两款新的内部AI模型,MAI Image 2.5 Pro在图像生成质量上实现了显著提升…

X AI KOLs Timeline · 2026-07-28 缓存

微软发布了MAI Image 2.5 Pro,这是一款新的内部AI模型,具备改进的图像生成质量、复杂提示处理、文本渲染和自然语言编辑能力。

0 人收藏 0 人点赞
#image-generation

并行解码蒸馏加速图像与视频生成

Hugging Face Daily Papers · 2026-07-28 缓存

并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。

0 人收藏 0 人点赞
#image-generation

重新思考策略内扩散蒸馏中的无分类器引导

Hugging Face Daily Papers · 2026-07-27 缓存

本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。

0 人收藏 0 人点赞
#image-generation

Comfy-Org/Mage-Flow

Hugging Face Models Trending · 2026-07-24 缓存

来自微软Mage-Flow模型的ComfyUI重新打包模型文件,包含扩散模型、文本编码器和VAE。

0 人收藏 0 人点赞
#image-generation

用于减少扩散模型曝光偏差的频谱先验

Hugging Face Daily Papers · 2026-07-24 缓存

本文提出频谱对齐(SPA),一种轻量级的引导方法,通过校准中间预测的功率谱来减少扩散模型中的曝光偏差,在像素空间、潜在空间和流匹配模型上均展现出持续改进,且计算开销极小。

0 人收藏 0 人点赞
#image-generation

微软推出全新 MAI-Image 和 MAI-Voice(2 分钟阅读)

TLDR AI · 2026-07-24 缓存

微软宣布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览,这是其最新专为图像和语音场景构建的生成式 AI 模型,现已上线 Azure AI,并为必应图像创建器等微软产品提供支持。

0 人收藏 0 人点赞
#image-generation

@DanKornas: 当每个模型和参数都藏在不同的脚本后面时,视觉AI工作流变得难以管理。ComfyUI是一个……

X AI KOLs Timeline · 2026-07-23 缓存

ComfyUI是一款开源的、基于节点的AI创作引擎,让构建者和视觉专业人士无需编码即可设计复杂的生成工作流,支持图像、视频、音频和3D,具备部分重新执行能力和广泛的模型支持。

0 人收藏 0 人点赞
#image-generation

Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测

Reddit r/singularity · 2026-07-23

Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。

0 人收藏 0 人点赞
#image-generation

BFL 推出 FLUX 3 - 支持图像、视频和音频的多模态模型

Reddit r/ArtificialInteligence · 2026-07-23

BFL 推出了 FLUX 3,这是一个能够生成图像、视频和音频的多模态 AI 模型。

0 人收藏 0 人点赞
#image-generation

@MrLarus: GPT-Image2 把“留白”做成了一组东方艺术海报,高级且克制! 重点在主物件、压纹和空间层次,让画面远看简洁,近看又有细节 我尝试了四个主题: 1. 山外 — 矿石裂隙与远山 2. 风经过 — 双层纸艺与竹影 3. 归灯 — 漆器灯…

X AI KOLs Timeline · 2026-07-23 缓存

用户 MrLarus 使用 GPT-Image2 创作了两组艺术海报系列——东方留白风格和器乐回响风格,并强调其高级感与细节处理。

0 人收藏 0 人点赞
#image-generation

Oxygen-TryOn:面向任意单品虚拟试穿的时尚原生基础模型

Hugging Face Daily Papers · 2026-07-23 缓存

Oxygen-TryOn 是一个统一的面向任意单品虚拟试穿的基础模型,通过专用数据引擎和三阶段训练流程,在单件和多件试穿任务上实现了最先进的一致性及逼真度。

0 人收藏 0 人点赞
#image-generation

展示而非讲述:在生成像素而非LLM文本中评估空间认知

Hugging Face Daily Papers · 2026-07-23 缓存

提出了ProVisE,一个与基准无关的框架,用于利用像素空间输出评估图像生成模型的空间认知,并引入了SpatialGen-Bench,用于跨14个空间子任务的统一评估。

0 人收藏 0 人点赞
#image-generation

AI实验室是否在搞'pelicanmaxxing'?

Simon Willison's Blog · 2026-07-22 缓存

Dylan Castillo进行了一项严谨的调查,以确定AI实验室是否在秘密训练模型绘制骑自行车的鹈鹕。通过测试多种动物-车辆组合的多个模型,他没有发现'pelicanmaxxing'的证据。

0 人收藏 0 人点赞
#image-generation

@elonmusk: Grok Imagine 可生成美丽时尚

X AI KOLs Timeline · 2026-07-22 缓存

Elon Musk 宣布,Grok Imagine 可以生成美丽的时尚图像。

0 人收藏 0 人点赞
#image-generation

一次重写解决所有问题?面向文本到图像提示优化的类型感知修复分配

arXiv cs.AI · 2026-07-22 缓存

本文介绍了类型感知修复分配(TARA),这是一个无需训练的框架,将文本到图像提示优化分解为原子修复分配,其中每个失败的命题被路由到类型条件的修复操作符。实验表明,TARA在DSG和TIFA基准测试上跨四个生成器取得了最佳语义准确性,在保持图像质量的同时优于VisualPrompter。

0 人收藏 0 人点赞
#image-generation

Qwen-Image-3.0:丰富内容、真实细节、深度知识(6分钟阅读)

TLDR AI · 2026-07-22

Qwen-Image-3.0 是第三代基础图像生成模型,支持高达 4.5k token 的输入、12 种语言的原生渲染,并能模拟网页、游戏等界面,利用丰富的世界知识实现实际部署。

0 人收藏 0 人点赞
#image-generation

使用 GPT-5.6、Claude、Gemini 和 Grok “绘制”蒙娜丽莎

Hacker News Top · 2026-07-21 缓存

一项实验让四个视觉模型(GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash)在彩铅绘画竞技场中相互较量,要求它们通过工具使用来重现《蒙娜丽莎》和《星夜》等目标。结果显示令人惊讶的成本与质量权衡,其中 Grok 表现挣扎,而 Claude 尽管成本更高却表现不佳。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈