标签
Guillermo Rauch 重点介绍了 Grok Imagine Image 2.0,该模型现已登陆 Vercel AI Gateway,并在 Arena.ai 排行榜上位列第二。Vercel 通过 AI CLI 和实时 Playground 提供访问。
Grok announces Imagine Image 2.0, a next-generation image model with precision editing, crisp text rendering, improved factuality, and real-world usefulness.
Grok 发布了 Imagine Image 2.0,这是一款下一代图像模型,具备精准编辑、清晰的文字渲染以及改进的事实准确性,适用于实际应用。
xAI的Grok Imagine Image 2.0(低)在文生图竞技场跃升至第2名,超越了自己旧版的质量模型,显示出显著进步。
一条推文认为,Claude Code 技能可以通过直接调用图像生成 API 来替代 79 美元/月的 Higgsfield 订阅,将每张图像的成本从约 31-34 美分降至约 5 美分,同时让输出保留在本地并由用户所有。
SenseNova U1.5-Lite-Preview 是一个开源的 8B MoT 多模态模型,能够原生生成和编辑 4K 超宽全景、产品海报和商业摄影,具有改进的材质渲染和更少的伪影。
PinkCherry_MiniMax-H3 的 Hugging Face 模型页面,这是一个专注于生成 NSFW 兽人与花卉图像的小众 AI 模型,并包含关于兔子动作、花瓣和独角兽角改进的更新说明。
QwenCloud 发布了 Qwen-Image-3.0-Pro,一款强大的图像生成模型,支持密集布局、微小文字渲染和原生多语言输出,将其定位为可部署的生产力工具。
介绍了ToolArtist,一个基于统一多模态模型构建的完全智能体图像生成模型,利用SFT和强化学习(RAD-GRPO)动态编排推理、工具使用和图像生成。
UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。
使用详细提示词对 Nano Banana 2 和 OpenAI 图像生成进行比较,结果图片分享在评论中。
Google正在测试未发布的变化,以缩小Gemini桌面应用与其网页版之间的功能差距,包括专用于图像/视频生成的标签页、相机拍摄以及针对Spark的自定义MCP服务器支持。
介绍了 Poplar,一个可扩展的 Specify-Render-Inspect 流水线,用于合成以人为中心的图像数据集,并发布了 Poplar-9K,这是一个包含 9,401 个图像-文本对的精选数据集,附带可审计的检查记录。
SenseNova 发布了 U1.5 Lite 模型的预览版,基准测试显示其在图像生成和编辑方面有所提升,支持原生 4K 输出,中文和英文文本渲染得到改进,但已知的弱点仍然存在。
Nous Research已向所有Nous Portal用户(包括免费用户)开放FLUX 3 Preview的免费访问权限,并正在举办一场设有奖品的短片竞赛。
Kroma v0.1 是 Krea 2 的 LoRA 微调版本,以兼容 ComfyUI 的 safetensors 文件形式发布,秩为 256,包含 RMSNorm/调制张量的权重增量,采用 MIT 许可。
本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。
Midjourney V8.2 已发布,标志着这款流行的 AI 图像生成模型迎来了新版本。
Google将Nano Banana 2的图像生成功能集成到Google Earth中,用户只需输入提示词,即可可视化历史场景、重新构想空间以及构思房地产方案。
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。