标签
CPI-Bench 是一个针对真实世界图像编辑的全面基准,评估多图像任务、实际应用和基于推理的编辑,以更好地区分模型性能。
Higgsfield 推出了 Layers,这是一款图像编辑器,可将任何图像分解为文本、主体和背景的可编辑图层,无需重新生成整个图像即可独立编辑,并原生支持 4K。
xAI发布了Imagine Image 2.0,作为Grok的新质量模式,具备受控布局、精确编辑工具、可复用模板,以及在Arena排行榜上的强劲表现(文生图和编辑均排名第二)。
UniSpace引入了一种统一的视觉表示,通过使用重新参数化的ViT,在单一空间中统一了语义理解、高保真重建和图像生成,消除了对独立VAE的需求。
Elon Musk 强调 Grok Imagine 的图像编辑能力已大幅提升,其精确的局部编辑工具让用户能够针对图像的特定部分进行修改,而无需重新生成整张图片。
Grok 发布了 Imagine Image 2.0,这是一款下一代图像模型,具备精准编辑、清晰的文字渲染以及改进的事实准确性,适用于实际应用。
SenseNova U1.5-Lite-Preview 是一个开源的 8B MoT 多模态模型,能够原生生成和编辑 4K 超宽全景、产品海报和商业摄影,具有改进的材质渲染和更少的伪影。
Adrian Sieber 宣布 Perspec 1.0 发布,这是一款用于校正图像透视的桌面应用,适用于文档和收据照片。
UniWorld-Design 是一个以语义 RGBA 图层为原子单元重新定义图像生成的框架,包含用于生成分层资产的 T2RGBA 和用于将图像分解为可编辑图层的 I2L,在 Crello 基准测试上取得了最先进的结果。
一个三阶段多模态框架改进了对话式图像生成系统中的后续编辑推荐,利用SFT、多目标强化学习和视觉验证来减少视觉不一致性,并在实时A/B测试中提升参与度指标。
介绍了MPIE-Bench——一个包含2,500个样本的多人交互图像编辑基准,以及MPIE-Eval,一种基于网格的评估方法,在十个编辑器中比VLM检查表更贴近人类判断。
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
GIMP 3.0, its first major release in seven years, fixes long-standing issues like the confusing floating selection mechanism and introduces non-destructive editing for most GEGL-based effects, significantly improving the user experience.
Boogu-Image-0.1是一个开源的统一多模态理解与生成模型系列,在文本到图像生成、快速推理、基于指令的编辑和双语文本渲染方面实现了有竞争力的性能,训练成本仅约40万美元。
本文介绍了RINO(RGB In and RGB Out),一个统一框架,将各种视觉信息(如掩码、深度图等)表示为RGB图像,并将视觉任务转换为RGB到RGB的图像编辑,从而让单一模型能够在任务间进行零样本迁移。