Moebius:0.2B轻量级图像修复框架,具备10B级性能
摘要
Moebius是一个0.22B参数的图像修复框架,媲美FLUX.1-Fill-Dev等10B级别模型,通过新颖的局部-全局交互模块和自适应蒸馏策略,实现超过15倍的推理加速。
查看缓存全文
缓存时间: 2026/06/20 14:30
论文页面 - Moebius:0.2B轻量级图像修复框架,性能媲美10B级模型
来源:https://huggingface.co/papers/2606.19195
摘要
一种轻量级图像修复框架,通过新颖的局部-全局交互模块和自适应蒸馏策略,在显著减少参数和推理时间的同时,实现了高保真结果。
虽然10B级别的工业基础模型已推动图像修复的边界,但其高昂的计算成本严重阻碍了实际部署。构建高度优化的任务专用专家模型是一个有前景的解决方案;然而,极端的结构压缩不可避免地会引发严重的表示瓶颈(https://huggingface.co/papers?q=representation%20bottleneck)。为解决这一问题,我们提出Moebius,一个高效的轻量级修复框架。我们通过引入Local-λ Mix Interaction(https://huggingface.co/papers?q=Local-%CE%BB%20Mix%20Interaction)(LλMI)模块,系统地重构了扩散主干网络(https://huggingface.co/papers?q=diffusion%20backbone)。该模块由Local-λ和Interactive-λ组成,优雅地将空间上下文(https://huggingface.co/papers?q=spatial%20contexts)和全局语义先验(https://huggingface.co/papers?q=global%20semantic%20priors)总结为固定大小的线性矩阵(https://huggingface.co/papers?q=fixed-size%20linear%20matrices),在保持复杂潜在交互的同时大幅削减参数。此外,为释放这种高度紧凑架构的全部表征能力,我们将其与自适应多粒度蒸馏(https://huggingface.co/papers?q=adaptive%20multi-granularity%20distillation)策略协同使用。该策略严格在潜在空间(https://huggingface.co/papers?q=latent%20space)内操作,避免昂贵的像素空间解码,动态平衡多种基于梯度的损失函数(https://huggingface.co/papers?q=gradient-based%20losses),以实现高保真对齐。在自然和人像基准上的大量实验表明,这种最优协同使Moebius能够媲美甚至超越10B级别工业通用模型FLUX.1-Fill-Dev的生成质量。值得关注的是,Moebius仅使用不到2%的参数(0.22B vs 11.9B),同时实现超过15倍的推理加速,为高保真修复(https://huggingface.co/papers?q=high-fidelity%20inpainting)树立了新的效率标杆。项目页面:https://hustvl.github.io/Moebius。
查看 arXiv 页面(https://arxiv.org/abs/2606.19195)查看 PDF(https://arxiv.org/pdf/2606.19195)项目页面(https://hustvl.github.io/Moebius)GitHub66(https://github.com/hustvl/Moebius)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.19195)
在您的智能代理中获取此论文:
hf papers read 2606.19195
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型引用此论文
在模型README.md中引用arxiv.org/abs/2606.19195以从此页面链接。
引用此论文的数据集0
无数据集引用此论文
在数据集README.md中引用arxiv.org/abs/2606.19195以从此页面链接。
引用此论文的Space0
无Space引用此论文
在Space README.md中引用arxiv.org/abs/2606.19195以从此页面链接。
包含此论文的收藏2
相似文章
使用Claude Code将Moebius 0.2B图像修复模型移植到浏览器中运行
Simon Willison借助Claude Code,将Moebius 0.2B图像修复模型移植到浏览器中运行,使用了WebGPU和ONNX Runtime。最终的演示允许用户上传图片并通过修复移除物体。
@Modular: Modular 现已在 @ArtificialAnlys 上线,图像生成速度比竞争对手快3倍。MAX推理服务运行 @bfl_ai…
根据 Artificial Analysis 的基准测试,Modular 的 MAX 推理服务在 FLUX.2-dev 上实现了比竞争对手快3倍的图像生成速度。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
@modal:在 Modal 上对 Inkling-Small 的 Day 0 支持。 - 276B 参数 MoE,12B 激活 - 1M 上下文 - 可变思考强度 …
Thinking Machines 发布了 Inkling-Small,这是一个 276B 参数的混合专家模型,具有 12B 激活参数、1M 上下文以及原生图像/音频理解能力,现已在 Modal 上可用,并支持 NVIDIA B300。
@hank_aibtc: WTF?图像生成彻底变天了! PrismML 刚刚放出 Bonsai Image 4B —1-bit 二值和三值量化扩散模型! - 模型才 ~3GB(1-bit 版甚至压到 0.93GB), 而同参数的 FLUX.2 Klein 4B 要…
PrismML 发布了 Bonsai Image 4B,一种 1-bit 二值和三值量化扩散模型,大小仅为 3GB(1-bit 版 0.93GB),相比同参数 FLUX.2 Klein 4B 的 16GB 压缩了 8 倍以上,并支持完全本地化浏览器运行。