标签
本文提出使用来自HuBERT的自监督语音表示来追踪听力损失/听障婴儿和儿童口语向成人模式的趋同,展示了一种可扩展、语言中立的语言发展评估方法。
本文介绍了PINT,一种不变语音分词方法,该方法通过平行话语间的对齐损失微调SSL编码器以提取语言内容,实现了说话者探测准确率和语言模型困惑度的显著降低。
提出了一种说话人解耦的音节标记化方法,利用分块回归从原始语音中学习语言内容标记,在音节边界检测和聚类方面达到最先进水平,并提升了语音语言模型的性能。
本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。
本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。
一个没有运行时依赖的 distilHuBERT C++ 实现,权重编译入库,支持动态大小,性能与 ONNX Runtime 相当,便于集成到 CMake 项目中。