基于音系激活映射的音素分割与识别

Hugging Face Daily Papers 论文

摘要

本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。

音素分割与识别本质上是相互关联的任务,但现代方法通常将它们分开建模。我们认为音系结构已经在自监督语音模型(S3M)的表示中潜伏着,只需引导模型即可同时解决这两个任务。我们利用基于S3M的音系激活映射(SPAM),将每个S3M表示帧映射到音系特征激活向量,例如浊音和鼻音。在SPAM之上,我们引入了两个简单而有效的轻量级、免梯度下降的预测头:一个识别头和一个分割头。我们的方法需要不到一分钟的音标转录数据,并且能够泛化到训练中未见过的音素。在多样化数据集上,我们的方法取得了强大的分割和识别性能。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:49

论文页面 - 通过音系激活映射进行音素分割与识别

来源:https://huggingface.co/papers/2607.09020
作者:

摘要

音素分割与识别本质上是相关联的任务,然而现代方法通常分别对它们进行建模。我们认为,音系结构已经潜在地存在于自监督语音模型(S3Ms)的表征中,我们只需要引导它们来解决这两个任务。我们利用基于S3M的音系激活映射(SPAM),它将每个S3M表征帧映射到一组音系特征激活向量(例如发声和鼻音)。在SPAM之上,我们引入了两个简单但有效的轻量级、无需梯度下降的预测头:一个识别头和一个分割头。我们的方法只需要不到一分钟的音素标注,并且能够在训练期间泛化到未见过的音素。在多种数据集上,我们的方法取得了强大的分割和识别性能。

查看arXiv页面 (https://arxiv.org/abs/2607.09020) 查看PDF (https://arxiv.org/pdf/2607.09020) GitHub1 (https://github.com/stephenmac7/phone-metrics) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.09020)

在您的代理中获取这篇论文:

hf papers read 2607.09020

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。

引用此论文的Space0

没有Space链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章

基于Transformer的巴西葡萄牙语韵律边界分割

arXiv cs.CL

本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。

SAM 3: Segment Anything with Concepts

Papers with Code Trending

SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。

手语模型的音系感知

arXiv cs.CL

本文通过使用最小对立对来探测手语识别模型,评估它们是否展现出音系敏感性,揭示了架构上的权衡以及涌现但有限的音系感知。

越南语音中方言变化的语音建模

arXiv cs.CL

本文提出了一种方言感知的语音框架,用于建模越南语自动语音识别(ASR)中的语音变化,将音节分解为结构化组件,并将其映射到特定方言的国际音标(IPA)表示。该方法在UIT-ViMD多方言数据集上,以更少的参数且无需外部预训练,匹配了预训练基线的性能。