通过干预后训练语音基础模型学习任务特定子空间
摘要
本文提出了一种利用干预对比学习的后训练优化方法,将语音基础模型的表示解耦为独立的内容和说话人子空间。该方法在域外说话人验证任务上表现出更优性能,并提供了成功分离的证据。
arXiv:2606.17967v1 Announce Type: new
摘要:语音基础模型在大量未标记语音数据上进行预训练,生成适用于多种任务的通用表示。然而,这些表示以分布式方式编码了关于显著语音变量的信息,而下游语音任务仅依赖其中的部分变量。本文提出了一种利用干预对比学习的后训练优化方法。通过使用干预数据集和多部分对比损失,我们从语音基础模型的纠缠表示空间中学习一种转换,将其分离为独立的内容和说话人子空间。我们在说话人验证和关键词识别任务上评估了学到的表示,结果显示域外说话人验证性能提升,并证明了说话人和内容信息在学习的子空间中得到了分离。
查看缓存全文
缓存时间: 2026/06/17 05:42
# 学习任务特定子空间:通过干预性后训练语音基础模型 来源:https://arxiv.org/abs/2606.17967 查看 PDF (https://arxiv.org/pdf/2606.17967) > 摘要:语音基础模型在大量无标注语音数据上进行预训练,能够生成适用于多种任务的通用表示。然而,这些表示以分布式方式编码了有关显著语音变量的信息,而下游语音任务仅依赖其中部分变量。本文提出一种基于干预性对比学习的后训练微调方法。通过利用干预性数据集和多部分对比损失,我们学习从语音基础模型的纠缠表示空间到独立的内容和说话人子空间的变换。我们在说话人验证和关键词检测任务上评估了所学表示,结果显示其改善了跨领域说话人验证性能,并证明了说话人和内容信息在所学子空间中实现了分离。 ## 提交历史 来自:Jack Cox \[查看邮箱 (https://arxiv.org/show-email/8f301d11/2606.17967)\] **\[v1\]** 2026年6月16日星期二 14:18:20 UTC (39 KB)
相似文章
基于对比 LLM 微调对齐对话附和信号与语境表征
KTH Royal Institute of Technology 的研究人员提出了一种两阶段框架,通过在对话转写文本上微调 LLMs,并结合对比学习构建联合嵌入空间,以实现对对话附和信号与语境的精准对齐。结果表明,相较于以往方法,该方案显著提升了语境与附和信号的匹配检索性能。
重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
非语言发声中的说话人身份识别:条件蒸馏与专家混合方法
本文提出了一种新颖的说话人确认框架,该框架结合了冻结的自监督特征、ECAPA-TDNN和专家混合模块,通过条件蒸馏和对比损失来改进语音和非语言发声中的身份确认,同时防止灾难性遗忘。
WavAlign:通过自适应混合后训练提升口语对话模型的智能与表现力
WavAlign 提出一种模态感知的自适应后训练方法,利用受限偏好更新与显式锚定,在端到端口语对话模型中同步提升语义质量与语音表现力。
路由子空间:微调语言模型中评估与部署行为偏差的审计
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。