AuralSAM2: 通过金字塔视听特征提示赋予SAM2听觉能力
摘要
AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块从视听特征生成稀疏和密集提示,在保持交互效率的同时增强跨模态分割。
查看缓存全文
缓存时间: 2026/05/18 18:27
论文页面 - AuralSAM2:通过金字塔视听特征提示让SAM2听见声音
来源:https://huggingface.co/papers/2506.01015
摘要
AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块生成稀疏和密集提示,增强跨模态影响,同时保持交互式分割的效率。
Segment Anything Model 2(SAM2)在视频剪辑的可提示分割方面表现出强大的泛化能力;然而,它与音频模态的集成仍未被充分探索。现有方法要么通过基础模型将音频转换为视觉提示(例如,边界框),要么向图像编码器注入适配器以进行视听融合。然而,这两种方向在人在回路场景中均存在不足,原因是提示精度有限且推理开销增加。特别是,这些基于适配器的方法常常遭受音频提示稀释问题,即信号在网络传播过程中逐渐减弱。在这项工作中,我们提出AuralSAM2,它在很大程度上保留SAM2的可提示分割能力的同时,将音频集成到其中。其核心模块AuralFuser融合音频和视觉特征以生成稀疏和密集提示。在音频引导下,并基于SAM2的特征金字塔,这些提示将听觉线索传播到视觉层中,强化跨模态影响。为了进一步对齐模态,我们引入了音频引导对比损失,该损失强调主导视觉特征中的听觉相关性。我们的方法在公共基准上取得了显著的精度提升,同时对可提示分割的交互效率影响甚微。我们的代码可在 https://github.com/yyliu01/AuralSAM2 获取。
查看arXiv页面 (https://arxiv.org/abs/2506.01015)查看PDF (https://arxiv.org/pdf/2506.01015)GitHub9 (https://github.com/yyliu01/AuralSAM2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2506.01015)
在你的代理中获取这篇论文:
hf papers read 2506.01015
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
yyliu01/AuralSAM2 3天前更新 (https://huggingface.co/yyliu01/AuralSAM2)
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2506.01015以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2506.01015 以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到收藏集中以从此页面链接。
相似文章
介绍 SAM Audio:首个用于音频分离的统一多模态模型
SAM Audio 是首个用于音频分离的统一多模态模型,使用户能够利用文本、视觉或时间提示,从复杂的混合音频中分离出特定的声音。
当视觉为声音代言
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。
SAM 3: Segment Anything with Concepts
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。
StepAudio 2.5 技术报告
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
@lillyguisnet: 哇塞!!!我还没有机会尝试SAM3.1,但仅仅用"worm"这个提示就能完美分割我的图像!…
一位用户分享了关于SAM 3.1的热情反馈:仅用'worm'等简单文本提示即可精准分割图像,相比SAM 1有显著提升。