标签
本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。
本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。
OTCache是一个无需训练的框架,利用最优传输预测扩散模型的缓存调度,在FLUX.1、Qwen-Image和HunyuanVideo上实现了高达4.7倍的加速,同时提高了生成保真度。
提出质量表示模块(QRM),一种轻量级Transformer模块,将质量感知信号注入扩散变换器调制中,以改善图像保真度和提示对齐,而无需更改主干网络或采样调度。
论文指出了为何确定性少步生成在文本上失败而在图像上成功:文本解码器中尖锐的类别读出放大了微小误差,导致词元翻转,而连续图像解码器是平滑的。论文提出了诊断指标(DABI, CCI)以及逃逸机制,如类别承诺和随机重注入。
Google DeepMind 发布 Nano Banana 2 Lite,这是其最快且最具成本效益的图像模型,以及用于视频生成和对话式编辑的 Gemini Omni Flash,现已在 Google AI Studio 和 API 中提供给开发者。
Google DeepMind 发布了 Nano Banana 2 Lite(也称为 Gemini 3.1 Flash Lite Image),定位为最快、最便宜的 Gemini 图像模型,专为速度和规模优化。
Modular正在AI工程师世界博览会上演示Mojo、MAX和Modular Cloud,使用FLUX.2在DGX Spark上进行快速图像生成,以及实时视频生成。
Google 发布了 Nano Banana 2 Lite,这是一款更快速、更便宜的 AI 图像生成器,价格为每 1000 张图像 0.034 美元,生成时间为 4 秒。该模型针对高吞吐量工作流进行了优化,可通过 Google AI Studio 和 Gemini API 使用。
Google DeepMind发布了Nano Banana 2 Lite,一款兼顾质量与速度的快速廉价图像生成模型,现已覆盖谷歌生态系统。
作者讨论了开源图像和视频模型在技术上已足以应对日常使用,但由于高昂的硬件成本和技术门槛,它们在普通用户中仍不流行,并质疑如果降低使用难度是否会提高普及率。
Nano Banana Pro 与 ChatGPT Image 2 的对比,这两款人工智能图像生成工具。
DeepMind 推出了 Nano Banana 2 Lite,这是一款快速且成本高效的图像生成模型,具有低延迟和高品质,使设计师和开发者能够快速迭代。
Google 发布了用于图像生成的 Gemini 3.1 Flash Lite(GA)以及用于多轮对话式视频编辑的 Gemini Omni Flash API 预览版,价格为 $0.10/秒。
Google DeepMind 推出了 Interactions API,用于将类似 Nano Banana 2 Lite 的图像生成模型和 Gemini Omni Flash 的动画模型配对使用,支持通过会话历史进行最多三次连续编辑。
Google DeepMind宣布了两项重大模型发布:Nano Banana 2 Lite,一款快速且便宜的Gemini图像模型;以及Gemini Omni Flash,现可通过API用于视频生成和编辑。
Google DeepMind 发布 Nano Banana 2 Lite,这是其最快、最具成本效益的图像模型,并将 Gemini Omni Flash 提供给开发者用于视频生成和对话式编辑。
Proton 的注重隐私的 AI 聊天机器人 Lumo 迎来重大升级(版本 2.0),新增图像识别与生成能力、Projects 的持久记忆、更快的响应时间以及新的思考模式,同时保持零访问加密和隐私保护。
InstanceControl利用视觉语言模型在文本提示与视觉条件之间建立实例级对应,无需人工实例标注即可实现多实例可控图像生成,并通过自适应掩码优化提高准确性。