AuralSAM2: 通过金字塔视听特征提示赋予SAM2听觉能力

Hugging Face Daily Papers 论文

摘要

AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块从视听特征生成稀疏和密集提示,在保持交互效率的同时增强跨模态分割。

Segment Anything Model 2 (SAM2) 在视频片段的可提示分割方面表现出很强的泛化能力;然而,其与音频模态的集成仍未被充分探索。现有方法要么通过基础模型将音频转换为视觉提示(例如框),要么将适配器注入图像编码器以实现视听融合。然而,这两种方向在人在回路场景中都存在不足,原因是提示精度有限且推理开销增加。特别是,这些基于适配器的方法常常受到音频提示稀释的影响,即信号在通过网络传播时逐渐减弱。在这项工作中,我们提出了AuralSAM2,它将音频集成到SAM2中,同时很大程度上保留了其可提示分割能力。其核心模块AuralFuser融合音频和视觉特征,生成稀疏和密集提示。这些提示以音频为指导,基于SAM2的特征金字塔,在视觉层之间传播听觉线索,增强跨模态影响。为了进一步对齐模态,我们引入了一种音频引导对比损失,强调主要视觉特征中的听觉相关性。我们的方法在公共基准上实现了显著的准确率提升,同时对可提示分割的交互效率影响极小。我们的代码可在https://github.com/yyliu01/AuralSAM2获取。
查看原文
查看缓存全文

缓存时间: 2026/05/18 18:27

论文页面 - AuralSAM2:通过金字塔视听特征提示让SAM2听见声音

来源:https://huggingface.co/papers/2506.01015

摘要

AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块生成稀疏和密集提示,增强跨模态影响,同时保持交互式分割的效率。

Segment Anything Model 2(SAM2)在视频剪辑的可提示分割方面表现出强大的泛化能力;然而,它与音频模态的集成仍未被充分探索。现有方法要么通过基础模型将音频转换为视觉提示(例如,边界框),要么向图像编码器注入适配器以进行视听融合。然而,这两种方向在人在回路场景中均存在不足,原因是提示精度有限且推理开销增加。特别是,这些基于适配器的方法常常遭受音频提示稀释问题,即信号在网络传播过程中逐渐减弱。在这项工作中,我们提出AuralSAM2,它在很大程度上保留SAM2的可提示分割能力的同时,将音频集成到其中。其核心模块AuralFuser融合音频和视觉特征以生成稀疏和密集提示。在音频引导下,并基于SAM2的特征金字塔,这些提示将听觉线索传播到视觉层中,强化跨模态影响。为了进一步对齐模态,我们引入了音频引导对比损失,该损失强调主导视觉特征中的听觉相关性。我们的方法在公共基准上取得了显著的精度提升,同时对可提示分割的交互效率影响甚微。我们的代码可在 https://github.com/yyliu01/AuralSAM2 获取。

查看arXiv页面 (https://arxiv.org/abs/2506.01015)查看PDF (https://arxiv.org/pdf/2506.01015)GitHub9 (https://github.com/yyliu01/AuralSAM2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2506.01015)

在你的代理中获取这篇论文:

hf papers read 2506.01015

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

yyliu01/AuralSAM2 3天前更新 (https://huggingface.co/yyliu01/AuralSAM2)

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2506.01015以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2506.01015 以从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到收藏集中以从此页面链接。

相似文章

当视觉为声音代言

Hugging Face Daily Papers

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。

SAM 3: Segment Anything with Concepts

Papers with Code Trending

SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。

StepAudio 2.5 技术报告

Hugging Face Daily Papers

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。