SAM2Matting: 通用图像与视频抠图
摘要
SAM2Matting 引入了一种从追踪到抠图的框架,通过区域建议桥接和抠图头增强 SAM2 等基础追踪器,即使在仅用图像训练的情况下,也能实现最先进的视频抠图性能,并在多样场景中展现出强大的泛化能力。
查看缓存全文
缓存时间: 2026/06/30 15:37
论文页面 - SAM2Matting:通用图像与视频抠图
来源:https://huggingface.co/papers/2606.27339
摘要
SAM2Matting 通过追踪器到抠图框架推进了视频抠图技术,该框架利用带有区域提议桥接的基础追踪器和专用抠图头,将追踪与抠图任务解耦。
尽管图像抠图取得了显著进展,但由于高层追踪(需要帧级理解)与低层抠图(专注于极其精细的细节)之间存在固有差距,视频抠图(https://huggingface.co/papers?q=video%20matting)仍然具有挑战性。现有方法使用昂贵且范围狭窄的视频抠图(https://huggingface.co/papers?q=video%20matting)数据集,这可能会限制领域外泛化(https://huggingface.co/papers?q=out-of-domain%20generalization)并损害追踪鲁棒性。我们重新思考这一范式,提出了 SAM2(https://huggingface.co/papers?q=SAM2)Matting,这是一种追踪器到抠图框架,将 VOS 追踪器(https://huggingface.co/papers?q=VOS%20trackers)提升至高清视频抠图(https://huggingface.co/papers?q=video%20matting)。具体而言,它通过使用区域提议桥接(https://huggingface.co/papers?q=region-proposal%20bridge)和专用抠图头(https://huggingface.co/papers?q=matting%20heads)增强基础追踪器(例如 SAM2(https://huggingface.co/papers?q=SAM2)、SAM3(https://huggingface.co/papers?q=SAM3))来解耦任务,使未妥协的追踪器能够处理时间一致性(https://huggingface.co/papers?q=temporal%20consistency),而抠图组件则解决精细细节。值得注意的是,尽管仅使用图像进行训练,SAM2(https://huggingface.co/papers?q=SAM2)Matting 在视频抠图(https://huggingface.co/papers?q=video%20matting)上建立了新的最先进性能,支持多种提示类型(https://huggingface.co/papers?q=prompt%20types),保持了强大的时间一致性(https://huggingface.co/papers?q=temporal%20consistency),并展示了在人类中心及野外场景中的稳健泛化能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.27339)查看 PDF(https://arxiv.org/pdf/2606.27339)项目页面(https://henghuiding.com/SAM2Matting/)GitHub27(https://github.com/FudanCVL/SAM2Matting)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27339)
在您的代理中获取此论文:
hf papers read 2606.27339
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)可从此页面链接。
相似文章
SAM-MT: 实时交互式多目标视频分割
本文介绍了SAM-MT,它是SAM2的一个扩展,用于实时交互式多目标视频分割,实现了与目标数量无关的高帧率(FPS)。
SAM 3.1:通过多路复用和全局推理实现更快、更易用的实时视频检测与跟踪
Meta AI 发布了 SAM 3.1,这是 Segment Anything Model(分割一切模型)的一次更新,通过引入多路复用和全局推理能力,增强了实时视频检测与跟踪性能。
@skalskip92: 没有陷阱;SAM3是开源的,真的很棒,它在物体追踪方面表现出色,即便在……
SAM3(Segment Anything Model 3)是开源的,在物体追踪方面表现异常出色,即使在像篮球这样复杂的场景中也是如此,使其成为一款杰出的计算机视觉模型。
SAM 3D Animal:基于提示的野外动物三维重建
SAM 3D Animal提出了一个基于提示的框架,用于从单张野外图像中进行多动物三维重建,该框架基于SMAL+模型,在多个数据集上取得了最先进的结果。
SAM 3: Segment Anything with Concepts
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。