标签
Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。
感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。
SenseNova-U1-8b-MoT-Infographic-V2 是商汤科技(SenseTime)发布的一款开源的SOTA模型,用于信息图设计和图像编辑任务。
MirrorPPR 提出了一种基于示例的人像修图框架,采用带有 LoRA 适应的扩散变换器和自增强训练数据,实现了卓越的质量和身份保持。
整理了50个实用网站,涵盖绕过付费墙、免费下载论文、图片视频编辑、代码美化、隐私安全、音乐音频、科研工具、开发者工具等类别,提供日常工作和生活的便利。
本技术报告介绍了 Qwen-Image-2.0-RL,这是一个基于强化学习与人类反馈及在策略蒸馏的后训练流程,旨在提升图像生成与编辑任务中的视觉质量和指令遵循能力。
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
Boogu 发布了一系列开源统一图像生成与编辑模型,包括 Base、Turbo 和 Edit 变体。
展示了一种结合 Codex 和 Excalidraw 的工作流:在 Codex 内置浏览器中打开 Excalidraw,粘贴图片并标注,然后截图让 Codex 修改,实现“指哪修哪”的创意编辑。
ImageWAM 提出在世界动作模型中用预训练图像编辑模型替代视频生成用于机器人控制,在将计算量降至视频方法的 1/6、延迟降至 1/4 的同时实现了更优性能。
Boogu-Image-0.1 是一个基于 Apache-2.0 开源协议的统一图像生成与编辑模型家族,包含文本到图像、快速生成、编辑以及中英文文本渲染等变体,作为研究项目发布于 Hugging Face。
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。
一个使用 Kotlin 和 Jetpack Compose 构建的开源 Android 图像编辑工具箱,提供多种图像处理工具。
HiLo-Token 提出了一种面向扩散变换器的输入自适应令牌压缩框架,为高频区域分配更多令牌,在图像编辑任务中实现高达 3.13 倍的加速且无质量损失。
Apple在WWDC 2026上宣布为其Photos应用推出新的AI驱动编辑功能,包括Reframe、Extend以及升级版Cleanup工具,这些功能均基于Apple Intelligence。