Marigold V2 将图像编辑 DiT 转换为单步模型,用于生成清晰、详细的密集预测。Apache 2.0。https…
摘要
Marigold V2 将图像编辑 DiT 转换为单步模型,用于清晰密集预测,在深度估计及相关任务中实现了最佳零样本结果,采用 Apache 2.0 许可证。
查看缓存全文
缓存时间: 2026/09/14 11:26
Marigold V2 将图像编辑 DiT 转化为单步模型,实现清晰、细节丰富的稠密预测。📜 Apache 2.0 许可协议。 🤖 https://modelscope.ai/models/huawei-bayerlab/marigold-v2-0… 📄 https://modelscope.ai/papers/2609.08084…
🏆 在所有评估的深度数据集中,采用可比数据训练的模型中实现了最佳零样本结果。在 KITTI 和 ETH3D 数据集上,AbsRel 相较于先前最佳结果提升了 16%–26%。 🔍 毛皮、植被、细线和物体边界均保持清晰。两阶段 iREPA 和 SinkLoss 方案有效解决了基于扩散的深度模型常见的平滑和飞点伪影问题。 🧩 该框架在深度补全、透视深度、表面法线和本征图像分解方面也达到了领先水平。深度补全在所有四个基准测试中创下最低 RMSE 记录。 ⚡ 预训练的 Qwen-Image-Edit DiT 通过轻量化适配成为单步稠密预测器。在 32GB GPU 上训练仅需不到一周时间。
相似文章
Marigold V2:重新审视扩散变换器在单目深度估计中的应用
Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。
LLaDA-Image: 构建强大图像生成器的完全开放训练方案
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测
ReChannel通过将令牌直接映射到像素空间块,适配预训练的扩散变换器(如FLUX-Klein)用于密集预测任务,在无三元图的抠图、KITTI深度和指代分割上以极少的额外参数取得了最先进的成果。
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。