说话人解耦的分块回归用于音节标记化

Hugging Face Daily Papers 论文

摘要

本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。

无监督音节标记化旨在从原始语音中学习离散的音节标记,以捕捉潜在的语言内容相关结构。最近的音节标记化方法采用预训练HuBERT的师生蒸馏,将潜在语音帧表示组织成音节片段。然而,当使用语句级交叉熵目标进行训练时,模型预测的是说话人身份而非语言内容,从而损害了音节标记的纯净性。为解决此问题,我们提出了一种说话人解耦的音节标记器,在固定长度的分块内将说话人扰动的学生表示回归到干净的教师目标。实验结果表明,我们的方法在音节边界检测和音节片段聚类上达到了最先进的性能。此外,基于我们的音节标记训练的语音语言模型在句法和语义理解上相比音素级别的SpiRit-LM取得了7%的相对提升。
查看原文
查看缓存全文

缓存时间: 2026/07/07 06:42

论文页面 - 面向音节分词的说话人解耦分块回归

来源:https://huggingface.co/papers/2607.04064

摘要

一种说话人解耦的音节分词器,通过将受扰动的学生表示回归至干净的教师目标,以提升音节边界检测和语音语言建模性能。

无监督音节分词(https://huggingface.co/papers?q=syllabic%20tokenization)旨在从原始语音中学习离散的音节标记,以捕捉潜在的与语言内容相关的结构。最新的音节分词(https://huggingface.co/papers?q=syllabic%20tokenization)方法采用预训练 HuBERT(https://huggingface.co/papers?q=HuBERT)的师生蒸馏(https://huggingface.co/papers?q=teacher-student%20distillation),将潜在语音帧表示(https://huggingface.co/papers?q=latent%20speech%20frame%20representations)组织成音节片段。然而,当使用话语级交叉熵目标(https://huggingface.co/papers?q=cross-entropy%20objective)进行训练时,模型会预测说话人身份而非语言内容,从而损害了音节标记的纯净性。为了解决这一问题,我们提出了一种说话人解耦(https://huggingface.co/papers?q=speaker-disentangled)音节分词器,将受说话人扰动的学生表示在固定长度的分块内回归至干净的教师目标。实验结果表明,我们提出的方法在音节边界检测(https://huggingface.co/papers?q=syllable%20boundary%20detection)和音节片段聚类(https://huggingface.co/papers?q=syllabic%20segment%20clustering)方面达到了最先进水平。此外,基于我们的音节标记训练的语音语言模型(https://huggingface.co/papers?q=speech%20language%20model)在句法和语义理解上相比基于音素的 SpiRit-LM(https://huggingface.co/papers?q=SpiRit-LM)取得了 7% 的相对提升。

查看 arXiv 页面(https://arxiv.org/abs/2607.04064)查看 PDF(https://arxiv.org/pdf/2607.04064)项目页面(https://ryota-komatsu.github.io/speaker_disentangled_hubert/)GitHub46(https://github.com/ryota-komatsu/speaker_disentangled_hubert)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04064)

社区

在这篇 IEEE OJSP 论文中,我们介绍了 SylReg-LM 7B,一种高效可扩展的交错音节-文本语言模型!结果(https://cdn-uploads.huggingface.co/production/uploads/66815cb077ed01ba88279b1d/7eXmuwWDMlVyJQ0eGZIZR.png)

通过拖拽文本输入、粘贴或点击此处来上传图像、音频和视频。

点击或粘贴此处以上传图片

在你的智能体中获取此论文:

hf papers read 2607.04064

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型3

ryota-komatsu/SylReg-Distill 0.1B• 更新于约3小时前 • 300(https://huggingface.co/ryota-komatsu/SylReg-Distill)

ryota-komatsu/SylReg-LM-7B 文本生成• 8B• 更新于约4小时前 • 199(https://huggingface.co/ryota-komatsu/SylReg-LM-7B)

ryota-komatsu/SylReg-LM-7B-Instruct 文本生成• 8B• 更新于约4小时前 • 199(https://huggingface.co/ryota-komatsu/SylReg-LM-7B-Instruct)

引用本论文的数据集1

ryota-komatsu/SylReg 查看器• 更新于约3小时前 • 35.8M • 262(https://huggingface.co/datasets/ryota-komatsu/SylReg)

引用本论文的 Space 0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.04064 以从本页链接到它。

包含本论文的收藏1

相似文章

说话人解耦的分块回归音节标记化

arXiv cs.CL

提出了一种说话人解耦的音节标记化方法,利用分块回归从原始语音中学习语言内容标记,在音节边界检测和聚类方面达到最先进水平,并提升了语音语言模型的性能。

随机分词法提高模型鲁棒性

arXiv cs.CL

本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。

通过干预后训练语音基础模型学习任务特定子空间

arXiv cs.CL

本文提出了一种利用干预对比学习的后训练优化方法,将语音基础模型的表示解耦为独立的内容和说话人子空间。该方法在域外说话人验证任务上表现出更优性能,并提供了成功分离的证据。