通过干预后训练语音基础模型学习任务特定子空间

arXiv cs.CL 论文

摘要

本文提出了一种利用干预对比学习的后训练优化方法,将语音基础模型的表示解耦为独立的内容和说话人子空间。该方法在域外说话人验证任务上表现出更优性能,并提供了成功分离的证据。

arXiv:2606.17967v1 Announce Type: new 摘要:语音基础模型在大量未标记语音数据上进行预训练,生成适用于多种任务的通用表示。然而,这些表示以分布式方式编码了关于显著语音变量的信息,而下游语音任务仅依赖其中的部分变量。本文提出了一种利用干预对比学习的后训练优化方法。通过使用干预数据集和多部分对比损失,我们从语音基础模型的纠缠表示空间中学习一种转换,将其分离为独立的内容和说话人子空间。我们在说话人验证和关键词识别任务上评估了学到的表示,结果显示域外说话人验证性能提升,并证明了说话人和内容信息在学习的子空间中得到了分离。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:42

# 学习任务特定子空间:通过干预性后训练语音基础模型
来源:https://arxiv.org/abs/2606.17967
查看 PDF (https://arxiv.org/pdf/2606.17967)

> 摘要:语音基础模型在大量无标注语音数据上进行预训练,能够生成适用于多种任务的通用表示。然而,这些表示以分布式方式编码了有关显著语音变量的信息,而下游语音任务仅依赖其中部分变量。本文提出一种基于干预性对比学习的后训练微调方法。通过利用干预性数据集和多部分对比损失,我们学习从语音基础模型的纠缠表示空间到独立的内容和说话人子空间的变换。我们在说话人验证和关键词检测任务上评估了所学表示,结果显示其改善了跨领域说话人验证性能,并证明了说话人和内容信息在所学子空间中实现了分离。

## 提交历史

来自:Jack Cox \[查看邮箱 (https://arxiv.org/show-email/8f301d11/2606.17967)\] **\[v1\]** 2026年6月16日星期二 14:18:20 UTC (39 KB)

相似文章

基于对比 LLM 微调对齐对话附和信号与语境表征

arXiv cs.CL

KTH Royal Institute of Technology 的研究人员提出了一种两阶段框架,通过在对话转写文本上微调 LLMs,并结合对比学习构建联合嵌入空间,以实现对对话附和信号与语境的精准对齐。结果表明,相较于以往方法,该方案显著提升了语境与附和信号的匹配检索性能。