AudioMosaic:对比掩码音频表示学习

arXiv cs.LG 论文

摘要

AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。

arXiv:2605.14231v1 Announce Type: new Abstract: 音频自监督学习旨在从大规模无标签音频数据中学习通用表示。尽管近期进展主要由生成式重构目标驱动,但对比学习方法由于设计有效音频增广的难度以及对比预训练所需的大批量大小而探索较少。我们提出了 \textbf{AudioMosaic},一种基于对比学习的音频编码器,用于通用音频理解。在预训练期间,AudioMosaic 通过对频谱图块应用结构化时频掩码来构建正样本对,从而降低内存使用并实现高效的大批量训练。与生成式方法相比,AudioMosaic 编码器学习到更具判别性的语句级表示,在数据集、领域和声学条件下展现出强大的可迁移性。大量实验表明,AudioMosaic 在多个标准音频基准测试的线性探测和微调设置下均达到最先进性能。我们进一步证明,将预训练的 AudioMosaic 编码器集成到音频-语言模型中可提升其在音频-语言任务上的表现。代码已公开在我们的 \href{https://github.com/HanxunH/AudioMosaic}{GitHub 仓库} 中。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:28

# AudioMosaic: 对比式掩码音频表示学习
来源: https://arxiv.org/html/2605.14231
###### 摘要

音频自监督学习旨在从大规模无标签音频数据中学习通用表示。虽然最近的进展主要依赖于生成式重建目标,但对比式方法由于设计有效音频增强的困难以及对比预训练所需的大批量大小,仍探索较少。我们提出AudioMosaic,一种基于对比学习的音频编码器,用于通用音频理解。在预训练过程中,AudioMosaic通过将结构化的时频掩码应用于声谱图块来构建正样本对,这降低了内存使用并实现了高效的大批量训练。与生成式方法相比,AudioMosaic编码器学习到更具判别性的语句级表示,这些表示在数据集、领域和声学条件下展现出强大的可迁移性。大量实验表明,AudioMosaic在几个标准音频基准测试中,在线性探测和微调两种设置下均达到了最先进的性能。我们进一步证明,将预训练的AudioMosaic编码器集成到音频-语言模型中可以提升音频-语言任务的性能。代码已公开在我们的GitHub仓库 (https://github.com/HanxunH/AudioMosaic) 中。

机器学习,ICML

## 1 引言

自监督学习已成为跨模态表示学习的基石,推动了自然语言处理 (Radford et al., (https://arxiv.org/html/2605.14231#bib.bib77); Devlin et al.,2019 (https://arxiv.org/html/2605.14231#bib.bib20))、计算机视觉 (Chen et al.,2020c (https://arxiv.org/html/2605.14231#bib.bib16); He et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib44); Oquab et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib70); Fan et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib27)) 和音频处理 (Baevski et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib6); Fei et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib28); Ahmed et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib1); Kong et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib58); Lee et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib60); Ghosh et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib33); Goel et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib34); Dong et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib21)) 的进步。现有的音频自监督学习方法主要分为两种范式:掩码建模和对比学习。掩码建模方法,特别是掩码声谱图建模,已被广泛探索用于通用音频理解 (Niizumi et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib68); Huang et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib48); Chong et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib18); Chen et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib17); Alex et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib2))。相比之下,对比学习主要集中于原始波形输入和以语音为中心的任务 (Oord et al.,2018 (https://arxiv.org/html/2605.14231#bib.bib69); Baevski et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib6); Hsu et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib45))。尽管在视觉和语言领域取得了成功,但基于声谱图表示的对比学习在音频理解中的应用仍相对未被充分探索。

这一差距并非由于缺乏努力,而是反映了将对比学习应用于声谱图时所面临的根本性挑战。有效的对比学习依赖于精心设计的数据增强来生成信息丰富的正样本对 (Wang et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib91); Zhai et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib100))。然而,增强设计高度依赖于具体领域 (Blankemeier et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib10); Zhou et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib103)),并且通常需要对变换组合进行昂贵的搜索 (Chen et al.,2020c (https://arxiv.org/html/2605.14231#bib.bib16))。此外,对比方法通常依赖大批量来提供足够的负样本,导致计算成本高昂。尽管 SpecAugment (Park et al.,2019 (https://arxiv.org/html/2605.14231#bib.bib72)) 在监督学习中非常有效,但已证明对于自监督掩码建模目标并非最佳选择 (Huang et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib48))。这些观察共同突显了将现有方法直接应用于声谱图的难度。

参见图注图1:AudioMosaic 概览。(a) 先前音频自监督学习方法中常用的非结构化掩码与本文的时频掩码策略的比较。(b) AudioMosaic 首先将输入声谱图转换为带位置编码的块令牌,然后应用时频掩码来构建对比学习的正样本对。被掩码的块被忽略,仅将可见块以随机顺序输入编码器。在这项工作中,我们引入AudioMosaic,这是一种使用对比目标和受 SpecAugment 启发的定制增强策略进行预训练的音频编码器。与 SpecAugment 直接对声谱图区域应用零值掩码用于监督学习不同,AudioMosaic 操作于声谱图块,并通过沿时间和频率维度应用独立的掩码来构建正样本对。这产生了同一语句的互补视图,如图1 (https://arxiv.org/html/2605.14231#S1.F1) (a) 所示。与基于重建的模型中用于捕获局部相关性的非结构化随机掩码相反,AudioMosaic 中的结构化掩码专为对比设置设计,以鼓励学习全局的、判别性的表示。在预训练过程中,编码器仅处理可见块,并在共享嵌入空间内跨掩码视图执行对比学习。框架概览如图1 (https://arxiv.org/html/2605.14231#S1.F1) (b) 所示。这种时频掩码策略不同于先前基于波形的对比方法 (Oord et al.,2018 (https://arxiv.org/html/2605.14231#bib.bib69); Baevski et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib6)),后者侧重于对比短时时间视图,也不同于掩码声谱图建模方法 (Huang et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib48)),后者依赖局部上下文进行重建。

我们进一步分析了为什么这种增强策略更有效。声谱图在时间和频率维度上都表现出强烈的局部相关性。对于基于重建的目标,保留局部结构的非结构化掩码是有益的,因为准确的重建严重依赖局部上下文。然而,在对比学习中,如果正样本视图共享太多的局部结构,对比任务会变得过于简单,无法鼓励学习信息丰富的特征。这可能导致维度坍缩 (Jing et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib53); Huang et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib47))。这种坍缩的特征是有效秩低 (Roy & Vetterli,2007 (https://arxiv.org/html/2605.14231#bib.bib81)) 和表示质量下降。结构化的时频掩码通过减少正样本视图之间共享的局部冗余,同时保留更广泛的时频谱模式,从而缓解了这个问题。通过对比同一语句的互补时频掩码视图,模型被鼓励依赖更全局的结构,从而学习到语句不变的表示,这些表示更具判别性且跨领域可迁移。

在包括 AudioSet (Gemmeke et al.,2017 (https://arxiv.org/html/2605.14231#bib.bib32)), ESC-50 (Piczak,2015 (https://arxiv.org/html/2605.14231#bib.bib74)), Speech Commands (Warden,2018 (https://arxiv.org/html/2605.14231#bib.bib92)), 和环境声音深度伪造检测 (EnvSDD) (Yin et al.,2025a (https://arxiv.org/html/2605.14231#bib.bib98),b (https://arxiv.org/html/2605.14231#bib.bib99)) 在内的标准基准测试上的大量实验表明,AudioMosaic 在多个任务上达到了最先进的性能,同时降低了预训练内存成本和模型复杂度。此外,继 Gong et al. (2024 (https://arxiv.org/html/2605.14231#bib.bib39)) 之后,我们展示了将 AudioMosaic 编码器与大型语言模型对齐可以进一步提升音频-语言任务的性能。

总之,我们的主要贡献如下:

- •我们引入AudioMosaic,一种对比式音频预训练框架,它将掩码重新构想为构建信息丰富的正样本对的机制,而不是用于重建的噪声。通过使用结构化的、独立的时频掩码,AudioMosaic 创建了互补但非平凡视图,使得在声谱图上进行有效的对比学习成为可能,同时保持计算高效。
- •我们使用有效秩对掩码策略进行了表示层面的分析,揭示了正样本对中过多的共享局部结构如何导致退化的对比解。这一分析有助于解释为什么结构化的时频掩码对于声谱图上的对比学习特别有效。
- •我们证明了 AudioMosaic 学习到的判别性语句级表示能够跨数据集、领域和声学条件泛化,在几个标准基准测试上取得了最先进的结果,并在其他基准上表现强劲,同时还支持内存高效的大批量预训练并改进音频-语言模型。

## 2 相关工作

掩码建模。掩码建模因其简单性和有效性而成为一种流行的自监督预训练范式:通过重建被掩码或缺失的内容,模型可以学习到上下文感知的表示。这一概念最早由掩码语言建模 (Devlin et al.,2019 (https://arxiv.org/html/2605.14231#bib.bib20)) 推广,随后被计算机视觉社区在掩码图像建模中采用 (Chen et al.,2020b (https://arxiv.org/html/2605.14231#bib.bib14); Feichtenhofer et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib29); Wei et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib93),2023 (https://arxiv.org/html/2605.14231#bib.bib94); Tong et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib87); Xie et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib96); Huang et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib50))。例如,MAE (He et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib44)) 提出使用连续回归目标重建被掩码的图像块,而 BEiT (Bao et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib8)) 则预测由预训练 VAE (Ramesh et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib79)) 生成的离散视觉令牌。最近的工作将这一范式扩展到了用于音频自监督学习的掩码声谱图建模 (Niizumi et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib68); Baade et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib5); Chong et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib18))。Audio-MAE (Huang et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib48)) 将 MAE 框架调整到音频领域,并系统地研究了不同的掩码策略,发现非结构化随机掩码优于结构化的时频掩码。类似地,BEATs (Chen et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib15)) 采用了一种离散令牌预测目标,类似于 BEiT,通过学习预测被掩码的声学令牌。掩码声谱图建模范式也已扩展到教师-学生蒸馏框架 (Chen et al.,2024 (https://arxiv.org/html/2605.14231#bib.bib17); Alex et al.,2025 (https://arxiv.org/html/2605.14231#bib.bib2))。虽然基于重建的目标鼓励模型捕获声谱图内细粒度的局部相关性,但它们本质上依赖于相邻的可见区域来推断被掩码的内容。

对比学习。对比学习是另一种流行的自监督表示学习框架,它通过鼓励同一样本不同增强视图(正样本)的嵌入相似,同时推开来自不同样本(负样本)的嵌入。这一范式在计算机视觉 (Oord et al.,2018 (https://arxiv.org/html/2605.14231#bib.bib69); He et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib43); Chen et al.,2020c (https://arxiv.org/html/2605.14231#bib.bib16); Grill et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib40); Bardes et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib9)) 和多模态学习 (Radford et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib78); Elizalde et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib25); Gong et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib38); Jenni et al.,2023 (https://arxiv.org/html/2605.14231#bib.bib52)) 中取得了显著成功。在音频领域,先前的工作集中于对掩码音频片段的潜在表示进行对比学习,以学习通用的语音表示 (Oord et al.,2018 (https://arxiv.org/html/2605.14231#bib.bib69); Baevski et al.,2020 (https://arxiv.org/html/2605.14231#bib.bib6))。这些方法通常操作于原始波形或中间特征序列,强调时间连续性作为自监督的主要来源。对于基于声谱图的学习,COLA (Saeed et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib82)) 提出使用来自同一片段的片段作为正样本,使用来自不同片段的片段作为负样本。BYOL-A (Niizumi et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib67)) 使用增强和引导扩展了这一思想。SSAST (Gong et al.,2022a (https://arxiv.org/html/2605.14231#bib.bib36)) 进一步探索了掩码声谱图建模中的块级对比目标,以联合学习判别性和重建性表示。

与之前的掩码建模和对比学习方法相反,我们的方法在声谱图上执行语句级对比预训练,将掩码用作视图生成机制。通过对比同一语句的互补时频掩码视图,模型学习全局的、语句不变的表示。

音频的域外预训练。迁移 ImageNet 监督预训练模型 (Deng et al.,2009 (https://arxiv.org/html/2605.14231#bib.bib19); He et al.,2016 (https://arxiv.org/html/2605.14231#bib.bib42); Tan & Le,2019 (https://arxiv.org/html/2605.14231#bib.bib85); Dosovitskiy et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib22); Touvron et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib88)) 已成为音频表示学习中的常见实践 (Gong et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib35); Nagrani et al.,2021 (https://arxiv.org/html/2605.14231#bib.bib66); Koutini et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib59); Chen et al.,2022 (https://arxiv.org/html/2605.14231#bib.bib13))。这些模型通常通过将输入层从三个 RGB 通道修改为单通道声谱图输入来调整以适应音频声谱图。相反,我们

相似文章