SAM2Matting: 通用图像与视频抠图
摘要
SAM2Matting 引入了一种从追踪到抠图的框架,通过区域建议桥接和抠图头增强 SAM2 等基础追踪器,即使在仅用图像训练的情况下,也能实现最先进的视频抠图性能,并在多样场景中展现出强大的泛化能力。
查看缓存全文
缓存时间: 2026/06/30 15:37
论文页面 - SAM2Matting:通用图像与视频抠图
来源:https://huggingface.co/papers/2606.27339
摘要
SAM2Matting 通过追踪器到抠图框架推进了视频抠图技术,该框架利用带有区域提议桥接的基础追踪器和专用抠图头,将追踪与抠图任务解耦。
尽管图像抠图取得了显著进展,但由于高层追踪(需要帧级理解)与低层抠图(专注于极其精细的细节)之间存在固有差距,视频抠图(https://huggingface.co/papers?q=video%20matting)仍然具有挑战性。现有方法使用昂贵且范围狭窄的视频抠图(https://huggingface.co/papers?q=video%20matting)数据集,这可能会限制领域外泛化(https://huggingface.co/papers?q=out-of-domain%20generalization)并损害追踪鲁棒性。我们重新思考这一范式,提出了 SAM2(https://huggingface.co/papers?q=SAM2)Matting,这是一种追踪器到抠图框架,将 VOS 追踪器(https://huggingface.co/papers?q=VOS%20trackers)提升至高清视频抠图(https://huggingface.co/papers?q=video%20matting)。具体而言,它通过使用区域提议桥接(https://huggingface.co/papers?q=region-proposal%20bridge)和专用抠图头(https://huggingface.co/papers?q=matting%20heads)增强基础追踪器(例如 SAM2(https://huggingface.co/papers?q=SAM2)、SAM3(https://huggingface.co/papers?q=SAM3))来解耦任务,使未妥协的追踪器能够处理时间一致性(https://huggingface.co/papers?q=temporal%20consistency),而抠图组件则解决精细细节。值得注意的是,尽管仅使用图像进行训练,SAM2(https://huggingface.co/papers?q=SAM2)Matting 在视频抠图(https://huggingface.co/papers?q=video%20matting)上建立了新的最先进性能,支持多种提示类型(https://huggingface.co/papers?q=prompt%20types),保持了强大的时间一致性(https://huggingface.co/papers?q=temporal%20consistency),并展示了在人类中心及野外场景中的稳健泛化能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.27339)查看 PDF(https://arxiv.org/pdf/2606.27339)项目页面(https://henghuiding.com/SAM2Matting/)GitHub27(https://github.com/FudanCVL/SAM2Matting)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27339)
在您的代理中获取此论文:
hf papers read 2606.27339
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.27339 可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)可从此页面链接。
相似文章
SAM-MT: 实时交互式多目标视频分割
本文介绍了SAM-MT,它是SAM2的一个扩展,用于实时交互式多目标视频分割,实现了与目标数量无关的高帧率(FPS)。
SAM 3.1:通过多路复用和全局推理实现更快、更易用的实时视频检测与跟踪
Meta AI 发布了 SAM 3.1,这是 Segment Anything Model(分割一切模型)的一次更新,通过引入多路复用和全局推理能力,增强了实时视频检测与跟踪性能。
Segment Anything Model (SAM) 3.1(2分钟阅读)
SAM 3.1可以使用Meta Model API上的文本提示来检测、分割和跟踪图像和视频中的对象,并具有指定的推理费用。
Show HN: MultiMatte,一个可提示的图像背景移除模型
MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。
@skalskip92: 没有陷阱;SAM3是开源的,真的很棒,它在物体追踪方面表现出色,即便在……
SAM3(Segment Anything Model 3)是开源的,在物体追踪方面表现异常出色,即使在像篮球这样复杂的场景中也是如此,使其成为一款杰出的计算机视觉模型。