非语言发声中的说话人身份识别:条件蒸馏与专家混合方法
摘要
本文提出了一种新颖的说话人确认框架,该框架结合了冻结的自监督特征、ECAPA-TDNN和专家混合模块,通过条件蒸馏和对比损失来改进语音和非语言发声中的身份确认,同时防止灾难性遗忘。
查看缓存全文
缓存时间: 2026/06/25 17:13
论文页面 - 非语言发声中的说话人身份:条件蒸馏与专家混合方法
来源:https://huggingface.co/papers/2606.21215
摘要
一种新颖的说话人验证框架,将冻结的自监督特征与 ECAPA-TDNN 和 MoE 模块相结合,在语音和非语言发声场景下均能提升身份验证性能,同时保持语音任务的原有表现。
随着富有表现力的文本转语音(TTS)和语音转换(VC)系统越来越多地生成非语言发声(NVVs)以增强自然度,可靠的说话人验证(SV)对于客观评估语音和非语言片段中的身份一致性变得至关重要。然而,当前的 SV 系统在 NVV 上泛化能力较差,而在 NVV 数据上微调又会导致语音性能灾难性遗忘。我们首次对 10 种 NVV 类型进行了系统研究,并提出一个框架:将冻结的 Data2Vec 自监督特征与 ECAPA-TDNN 结合,并通过一个带有学习型领域感知路由的专家混合(MoE)模块进行增强。通过预训练教师模型对语音输入施加条件蒸馏损失,保持了语音到语音的准确性;同时,对比损失弥合了语音与 NVV 之间的领域差距。我们的方法将语音到 NVV 的等错误率(EER)从预训练基线的 38.93% 降至 22.66%,并通过蒸馏将语音 EER 从 13.17% 提升至 9.24%。
查看 arXiv 页面 (https://arxiv.org/abs/2606.21215) 查看 PDF (https://arxiv.org/pdf/2606.21215) GitHub (https://github.com/wiizzz/nonverbal-sv) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.21215)
在您的 agent 中获取此论文:
hf papers read 2606.21215
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.21215 可从此页面链接。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.21215 可从此页面链接。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.21215 可从此页面链接。
包含此论文的收藏 0
没有收藏包含此论文
添加此论文到一个收藏 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
多模态说话人验证对说话人匿名化的威胁
本文研究使用音频、韵律和语言线索的多模态说话人验证如何显著降低说话人匿名化效果,仅用五个语音片段即可将等错误率降低超过15%。
课堂环境下的多模态说话人识别
本文评估了一种用于K-12课堂说话人识别的多模态框架,通过将声学嵌入(ECAPA-TDNN)与基于LLM的转录本语义上下文相结合,将整体准确率从39%提升至50.3%,对于较长话语,准确率从64.9%提升至76.9%。
共识作为无标签自蒸馏的特权上下文
一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。
通过干预后训练语音基础模型学习任务特定子空间
本文提出了一种利用干预对比学习的后训练优化方法,将语音基础模型的表示解耦为独立的内容和说话人子空间。该方法在域外说话人验证任务上表现出更优性能,并提供了成功分离的证据。
EchoDistill: 对齐噪声到干净的自蒸馏用于鲁棒音频大语言模型
EchoDistill 是一种基于对齐的噪声到干净的自蒸馏框架,通过使用冻结的干净音频教师模型,利用组相对策略优化 (GRPO) 指导学生模型,从而提高音频大语言模型 (ALLMs) 在现实噪声下的鲁棒性。实验表明,在强噪声下,该方法显著提升了语义可靠性和任务性能,且无需额外推理成本。