αDepth:学习单次软边界分解用于立体转换
摘要
αDepth 引入了一种带有圆形Alpha表示(CAR)的分层表示,以解决立体转换中的软边界挑战,无需手动指导即可实现最先进的性能。
查看缓存全文
缓存时间: 2026/06/03 11:37
Paper page - αDepth: Learning Single-Pass Soft Boundary Decomposition for Stereo Conversion
来源:https://huggingface.co/papers/2606.00386
摘要
αDepth 提出了一种基于循环 Alpha 表示(Circular Alpha Representation,CAR)的分层表示,通过局部边界分解与高效场景级推理,解决了立体转换中的软边界挑战。
准确建模软边界(soft boundaries)(https://huggingface.co/papers?q=soft%20boundaries),如毛发和散焦模糊,是立体转换(stereo conversion)(https://huggingface.co/papers?q=stereo%20conversion)中的根本性难题,这是因为前景与背景的混合具有模糊性。现有深度模型主要预测单层深度,导致在软边界(soft boundaries)(https://huggingface.co/papers?q=soft%20boundaries)处深度对应关系模糊。抠图技术(matting techniques)(https://huggingface.co/papers?q=matting%20techniques)虽能捕获不透明度以进行分层建模,但在包含多个目标物的复杂场景中常表现不佳,且通常需要用户交互。本文介绍 αDepth,一种分层表示(layered representation)(https://huggingface.co/papers?q=layered%20representation),通过分解软边界(soft boundaries)(https://huggingface.co/papers?q=soft%20boundaries)来实现高保真立体转换(stereo conversion)(https://huggingface.co/papers?q=stereo%20conversion)。具体地,我们首先通过估计软边界(soft boundaries)(https://huggingface.co/papers?q=soft%20boundaries)处的分层颜色与深度值,解决混合颜色与深度的歧义。针对复杂多目标场景,我们设计了循环 Alpha 表示(Circular Alpha Representation,CAR)(https://huggingface.co/papers?q=Circular%20Alpha%20Representation),将范式从全局目标提取转向局部边界分解。与受限于单一前景/背景的既往抠图方法不同,CAR 无需人工引导即可实现高效的场景级推理(scene-level inference)(https://huggingface.co/papers?q=scene-level%20inference)。大量评估表明,αDepth 在立体转换(stereo conversion)(https://huggingface.co/papers?q=stereo%20conversion)中达到最先进性能,消除了软边界(soft boundaries)(https://huggingface.co/papers?q=soft%20boundaries)处的背景溢出(background bleeding)(https://huggingface.co/papers?q=background%20bleeding)与结构畸变(structural distortions)(https://huggingface.co/papers?q=structural%20distortions)。
查看 arXiv 页面(https://arxiv.org/abs/2606.00386) 查看 PDF(https://arxiv.org/pdf/2606.00386) 添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.00386)
在您的 Agent 中获取本篇论文:
hf papers read 2606.00386
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型链接本篇论文
请在模型 README.md 中引用 arxiv.org/abs/2606.00386 以从本页链接。
引用本文的数据集0
暂无数据集链接本篇论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.00386 以从本页链接。
引用本文的 Spaces0
暂无 Space 链接本篇论文
请在 Space README.md 中引用 arxiv.org/abs/2606.00386 以从本页链接。
包含本文的收藏集0
暂无收藏集包含本篇论文
请将本论文添加至收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
同一场景,两种深度:探索单目基础模型中的几何模糊性
引入MultiDepth-3k基准,用于评估单目深度基础模型中的深度层偏好,并展示拉普拉斯视觉提示(Laplacian Visual Prompting)可以改变报告的深度层,表明不同模型之间存在互补的几何假设。
chenxwh/depth-anything-v2
Depth Anything V2 是一种单目深度估计模型,在细节丰富度和鲁棒性方面显著优于 V1,同时提供比基于 SD 的模型更快的推理速度和更高的准确性。它在 Replicate 上以不同许可证提供。
@RuohanZhang76:很高兴介绍由 @EvansXuHan 主导的 StereoPolicy。StereoPolicy 是一种为现代机器人策略模型添加几何线索的有效方法……
介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。
Lite Any Stereo V2:更快更强的高效零样本立体匹配
Lite Any Stereo V2 提出了一种高效的立体匹配方法,通过优化的架构和训练策略(包括仅2D成本聚合框架和三阶段训练策略),在显著降低延迟的同时实现了最先进的精度。
Patil/Krea-2-depth-controlnet
该模型为Krea-2引入了一个深度条件化的ControlNet-LoRA,能够实现深度图引导的图像生成,具有高深度一致性(皮尔逊相关系数0.98-0.99)。它支持Raw和Turbo两种变体,并包含简易推理脚本和Comfy UI集成。