Moebius:0.2B轻量级图像修复框架,具备10B级性能

Hugging Face Daily Papers 论文

摘要

Moebius是一个0.22B参数的图像修复框架,媲美FLUX.1-Fill-Dev等10B级别模型,通过新颖的局部-全局交互模块和自适应蒸馏策略,实现超过15倍的推理加速。

尽管10B级别的工业基础模型推动了图像修复的边界,但其高昂的计算成本严重阻碍了实际部署。构建高度优化的任务专用模型是一种有前景的解决方案;然而,极端的结构压缩不可避免地会引发严重的表征瓶颈。为了克服这一问题,我们提出了Moebius,一个高效的轻量级修复框架。我们通过引入局部-λ混合交互(LλMI)模块,系统性地重构了扩散主干网络。该模块由Local-λ和Interactive-λ组成,巧妙地将空间上下文和全局语义先验总结为固定大小的线性矩阵,在大幅减少参数的同时保留了复杂的潜在交互。此外,为了释放这种高度紧凑架构的全部表征能力,我们协同应用了一种自适应多粒度蒸馏策略。该策略严格在潜在空间中运行,以避免昂贵的像素空间解码,动态平衡多个基于梯度的损失,实现高保真对齐。在自然图像和人像基准上的大量实验表明,这种最佳协同使得Moebius能够在生成质量上媲美甚至超越10B级别的工业通用模型FLUX.1-Fill-Dev。值得注意的是,Moebius仅使用不到2%的参数(0.22B对比11.9B)就实现了这一性能,同时总推理时间加速超过15倍,为高保真修复树立了新的效率标准。项目页面:https://hustvl.github.io/Moebius。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:30

论文页面 - Moebius:0.2B轻量级图像修复框架,性能媲美10B级模型

来源:https://huggingface.co/papers/2606.19195

摘要

一种轻量级图像修复框架,通过新颖的局部-全局交互模块和自适应蒸馏策略,在显著减少参数和推理时间的同时,实现了高保真结果。

虽然10B级别的工业基础模型已推动图像修复的边界,但其高昂的计算成本严重阻碍了实际部署。构建高度优化的任务专用专家模型是一个有前景的解决方案;然而,极端的结构压缩不可避免地会引发严重的表示瓶颈(https://huggingface.co/papers?q=representation%20bottleneck)。为解决这一问题,我们提出Moebius,一个高效的轻量级修复框架。我们通过引入Local-λ Mix Interaction(https://huggingface.co/papers?q=Local-%CE%BB%20Mix%20Interaction)(LλMI)模块,系统地重构了扩散主干网络(https://huggingface.co/papers?q=diffusion%20backbone)。该模块由Local-λ和Interactive-λ组成,优雅地将空间上下文(https://huggingface.co/papers?q=spatial%20contexts)和全局语义先验(https://huggingface.co/papers?q=global%20semantic%20priors)总结为固定大小的线性矩阵(https://huggingface.co/papers?q=fixed-size%20linear%20matrices),在保持复杂潜在交互的同时大幅削减参数。此外,为释放这种高度紧凑架构的全部表征能力,我们将其与自适应多粒度蒸馏(https://huggingface.co/papers?q=adaptive%20multi-granularity%20distillation)策略协同使用。该策略严格在潜在空间(https://huggingface.co/papers?q=latent%20space)内操作,避免昂贵的像素空间解码,动态平衡多种基于梯度的损失函数(https://huggingface.co/papers?q=gradient-based%20losses),以实现高保真对齐。在自然和人像基准上的大量实验表明,这种最优协同使Moebius能够媲美甚至超越10B级别工业通用模型FLUX.1-Fill-Dev的生成质量。值得关注的是,Moebius仅使用不到2%的参数(0.22B vs 11.9B),同时实现超过15倍的推理加速,为高保真修复(https://huggingface.co/papers?q=high-fidelity%20inpainting)树立了新的效率标杆。项目页面:https://hustvl.github.io/Moebius。

查看 arXiv 页面(https://arxiv.org/abs/2606.19195)查看 PDF(https://arxiv.org/pdf/2606.19195)项目页面(https://hustvl.github.io/Moebius)GitHub66(https://github.com/hustvl/Moebius)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.19195)

在您的智能代理中获取此论文:

hf papers read 2606.19195

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型引用此论文

在模型README.md中引用arxiv.org/abs/2606.19195以从此页面链接。

引用此论文的数据集0

无数据集引用此论文

在数据集README.md中引用arxiv.org/abs/2606.19195以从此页面链接。

引用此论文的Space0

无Space引用此论文

在Space README.md中引用arxiv.org/abs/2606.19195以从此页面链接。

包含此论文的收藏2

相似文章

Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。