标签
Elon Musk 强调 Grok Imagine 的图像编辑能力已大幅提升,其精确的局部编辑工具让用户能够针对图像的特定部分进行修改,而无需重新生成整张图片。
Grok 发布了 Imagine Image 2.0,这是一款下一代图像模型,具备精准编辑、清晰的文字渲染以及改进的事实准确性,适用于实际应用。
SenseNova U1.5-Lite-Preview 是一个开源的 8B MoT 多模态模型,能够原生生成和编辑 4K 超宽全景、产品海报和商业摄影,具有改进的材质渲染和更少的伪影。
Adrian Sieber 宣布 Perspec 1.0 发布,这是一款用于校正图像透视的桌面应用,适用于文档和收据照片。
UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。
介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
GIMP 3.0, its first major release in seven years, fixes long-standing issues like the confusing floating selection mechanism and introduces non-destructive editing for most GEGL-based effects, significantly improving the user experience.
Boogu-Image-0.1是一个开源的统一多模态理解与生成模型系列,在文本到图像生成、快速推理、基于指令的编辑和双语文本渲染方面实现了有竞争力的性能,训练成本仅约40万美元。
本文介绍了RINO(RGB In and RGB Out),一个统一框架,将各种视觉信息(如掩码、深度图等)表示为RGB图像,并将视觉任务转换为RGB到RGB的图像编辑,从而让单一模型能够在任务间进行零样本迁移。
Seedream 5.0 Pro 是一款高度可控的 AI 图像编辑模型,可通过 BytePlusGlobal API 和 Lumina 平台访问,能够对人物、物品和动物进行精确编辑。
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
用户测试了GPT 5.6-Terra的前端能力,制作了一个可交互的三国人物关羽卡片网页,效果出色,尤其在抠图和处理景深透视方面。
Krea 2 Raw 的社区微调版本,支持基于指令的身份保留图像编辑。它能在编辑图像的同时保留脸部等细节,并使用自定义的 ComfyUI 节点包。
Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。