Marigold V2 将图像编辑 DiT 转换为单步模型,用于生成清晰、详细的密集预测。Apache 2.0。https…

X AI KOLs Timeline 模型

摘要

Marigold V2 将图像编辑 DiT 转换为单步模型,用于清晰密集预测,在深度估计及相关任务中实现了最佳零样本结果,采用 Apache 2.0 许可证。

Marigold V2 将图像编辑 DiT 转换为单步模型,用于生成清晰、详细的密集预测。📜 Apache 2.0。 🤖 https://modelscope.ai/models/huawei-bayerlab/marigold-v2-0… 📄 https://modelscope.ai/papers/2609.08084… 🏆 在所有评估的深度数据集中,在可比数据训练的模型中实现了最佳零样本结果。AbsRel 在 KITTI 和 ETH3D 上比之前的最佳结果提高了 16%–26%。 🔍 毛皮、树叶、细线和物体边界保持清晰。两阶段 iREPA 和 SinkLoss 方案解决了扩散深度模型中常见的平滑和飞点伪影。 🧩 同一框架在深度补全、透视深度、表面法线和本征图像分解方面达到了 SOTA 结果。深度补全在所有四个报告的基准中记录了最低的 RMSE。 ⚡ 一个预训练的 Qwen-Image-Edit DiT 通过轻量级适应转变为单步密集预测器。训练在单个 32 GB GPU 上耗时不到一周。
查看原文
查看缓存全文

缓存时间: 2026/09/14 11:26

Marigold V2 将图像编辑 DiT 转化为单步模型,实现清晰、细节丰富的稠密预测。📜 Apache 2.0 许可协议。 🤖 https://modelscope.ai/models/huawei-bayerlab/marigold-v2-0… 📄 https://modelscope.ai/papers/2609.08084…

🏆 在所有评估的深度数据集中,采用可比数据训练的模型中实现了最佳零样本结果。在 KITTI 和 ETH3D 数据集上,AbsRel 相较于先前最佳结果提升了 16%–26%。 🔍 毛皮、植被、细线和物体边界均保持清晰。两阶段 iREPA 和 SinkLoss 方案有效解决了基于扩散的深度模型常见的平滑和飞点伪影问题。 🧩 该框架在深度补全、透视深度、表面法线和本征图像分解方面也达到了领先水平。深度补全在所有四个基准测试中创下最低 RMSE 记录。 ⚡ 预训练的 Qwen-Image-Edit DiT 通过轻量化适配成为单步稠密预测器。在 32GB GPU 上训练仅需不到一周时间。

相似文章

LLaDA-Image: 构建强大图像生成器的完全开放训练方案

Hugging Face Daily Papers

LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。

MMDiff: 扩展扩散变换器以实现多模态生成

Hugging Face Daily Papers

MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。