image-generation

标签

Cards List
#image-generation

从SRA到Self-Flow:数据增强还是自监督?

Hugging Face Daily Papers · 2026-07-02 缓存

本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。

0 人收藏 0 人点赞
#image-generation

面向一步式视觉生成的表示分布匹配

Hugging Face Daily Papers · 2026-07-02 缓存

本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。

0 人收藏 0 人点赞
#image-generation

OTCache:扩散模型中基于最优传输的几何感知缓存

arXiv cs.LG · 2026-07-01 缓存

OTCache是一个无需训练的框架,利用最优传输预测扩散模型的缓存调度,在FLUX.1、Qwen-Image和HunyuanVideo上实现了高达4.7倍的加速,同时提高了生成保真度。

0 人收藏 0 人点赞
#image-generation

扩散变换器的质量感知调制

arXiv cs.LG · 2026-07-01 缓存

提出质量表示模块(QRM),一种轻量级Transformer模块,将质量感知信号注入扩散变换器调制中,以改善图像保真度和提示对齐,而无需更改主干网络或采样调度。

0 人收藏 0 人点赞
#image-generation

为什么少步文本隐变量在图像隐变量有效时失败?尖锐类别读出中的非承诺性

arXiv cs.LG · 2026-07-01 缓存

论文指出了为何确定性少步生成在文本上失败而在图像上成功:文本解码器中尖锐的类别读出放大了微小误差,导致词元翻转,而连续图像解码器是平滑的。论文提出了诊断指标(DABI, CCI)以及逃逸机制,如类别承诺和随机重注入。

0 人收藏 0 人点赞
#image-generation

Nano Banana 2 Lite(6分钟阅读)

TLDR AI · 2026-07-01 缓存

Google DeepMind 发布 Nano Banana 2 Lite,这是其最快且最具成本效益的图像模型,以及用于视频生成和对话式编辑的 Gemini Omni Flash,现已在 Google AI Studio 和 API 中提供给开发者。

0 人收藏 0 人点赞
#image-generation

Nano Banana 2 Lite

Simon Willison's Blog · 2026-06-30 缓存

Google DeepMind 发布了 Nano Banana 2 Lite(也称为 Gemini 3.1 Flash Lite Image),定位为最快、最便宜的 Gemini 图像模型,专为速度和规模优化。

0 人收藏 0 人点赞
#image-generation

@Modular:AI工程师世界博览会第二天@aiDotEngineer!在U-G28展位与团队会面,讨论Mojo、MAX和Modu……

X AI KOLs Timeline · 2026-06-30 缓存

Modular正在AI工程师世界博览会上演示Mojo、MAX和Modular Cloud,使用FLUX.2在DGX Spark上进行快速图像生成,以及实时视频生成。

0 人收藏 0 人点赞
#image-generation

Google 推出更快速、更便宜的图像生成器 Nano Banana 2 Lite

TechCrunch AI · 2026-06-30 缓存

Google 发布了 Nano Banana 2 Lite,这是一款更快速、更便宜的 AI 图像生成器,价格为每 1000 张图像 0.034 美元,生成时间为 4 秒。该模型针对高吞吐量工作流进行了优化,可通过 Google AI Studio 和 Gemini API 使用。

0 人收藏 0 人点赞
#image-generation

谷歌新款Nano Banana 2 Lite图像模型:速度最快、价格最低

Ars Technica · 2026-06-30 缓存

Google DeepMind发布了Nano Banana 2 Lite,一款兼顾质量与速度的快速廉价图像生成模型,现已覆盖谷歌生态系统。

0 人收藏 0 人点赞
#image-generation

如果开源图像和视频模型向所有人开放,它们会变得更有吸引力吗?

Reddit r/ArtificialInteligence · 2026-06-30

作者讨论了开源图像和视频模型在技术上已足以应对日常使用,但由于高昂的硬件成本和技术门槛,它们在普通用户中仍不流行,并质疑如果降低使用难度是否会提高普及率。

0 人收藏 0 人点赞
#image-generation

Nano Banana Pro 对比 ChatGPT Image 2

Reddit r/singularity · 2026-06-30

Nano Banana Pro 与 ChatGPT Image 2 的对比,这两款人工智能图像生成工具。

0 人收藏 0 人点赞
#image-generation

Nano Banana 2 Lite

Hacker News Top · 2026-06-30 缓存

DeepMind 推出了 Nano Banana 2 Lite,这是一款快速且成本高效的图像生成模型,具有低延迟和高品质,使设计师和开发者能够快速迭代。

0 人收藏 0 人点赞
#image-generation

@_philschmid: 今日发布:Nano Banana 2 Lite(GA)和 Gemini Omni Flash API(预览版)。Nano Banana 2 Lite(`gemini-3.1-flash-lite…

X AI KOLs Following · 2026-06-30 缓存

Google 发布了用于图像生成的 Gemini 3.1 Flash Lite(GA)以及用于多轮对话式视频编辑的 Gemini Omni Flash API 预览版,价格为 $0.10/秒。

0 人收藏 0 人点赞
#image-generation

@GoogleDeepMind: 通过 Interactions API 将这些模型配对使用。使用 Nano Banana 2 Lite 快速生成图像,然后立即…

X AI KOLs · 2026-06-30 缓存

Google DeepMind 推出了 Interactions API,用于将类似 Nano Banana 2 Lite 的图像生成模型和 Gemini Omni Flash 的动画模型配对使用,支持通过会话历史进行最多三次连续编辑。

0 人收藏 0 人点赞
#image-generation

@GoogleDeepMind: 我们正在发布两项重大更新:Nano Banana 2 Lite:我们最快且最便宜的Gemini图像模型;Gemini Omni Flash:现在…

X AI KOLs · 2026-06-30 缓存

Google DeepMind宣布了两项重大模型发布:Nano Banana 2 Lite,一款快速且便宜的Gemini图像模型;以及Gemini Omni Flash,现可通过API用于视频生成和编辑。

0 人收藏 0 人点赞
#image-generation

开始使用 Nano Banana 2 Lite 和 Gemini Omni Flash 进行构建

Google DeepMind Blog · 2026-06-30 缓存

Google DeepMind 发布 Nano Banana 2 Lite,这是其最快、最具成本效益的图像模型,并将 Gemini Omni Flash 提供给开发者用于视频生成和对话式编辑。

0 人收藏 0 人点赞
#image-generation

Lumo,Proton 注重隐私的 AI 聊天机器人,迎来升级

TechCrunch AI · 2026-06-30 缓存

Proton 的注重隐私的 AI 聊天机器人 Lumo 迎来重大升级(版本 2.0),新增图像识别与生成能力、Projects 的持久记忆、更快的响应时间以及新的思考模式,同时保持零访问加密和隐私保护。

0 人收藏 0 人点赞
#image-generation

艺术图像AI

Reddit r/AI_Agents · 2026-06-30

介绍用于生成和编辑艺术图像的AI工具,可能涵盖流行模型或平台。

0 人收藏 0 人点赞
#image-generation

InstanceControl:无需实例标注的可控复杂图像生成

Hugging Face Daily Papers · 2026-06-30 缓存

InstanceControl利用视觉语言模型在文本提示与视觉条件之间建立实例级对应,无需人工实例标注即可实现多实例可控图像生成,并通过自适应掩码优化提高准确性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈