基于音系激活映射的音素分割与识别
摘要
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
查看缓存全文
缓存时间: 2026/07/13 07:49
论文页面 - 通过音系激活映射进行音素分割与识别
来源:https://huggingface.co/papers/2607.09020
作者:
,
,
,
,
,
,
,
,
,
摘要
音素分割与识别本质上是相关联的任务,然而现代方法通常分别对它们进行建模。我们认为,音系结构已经潜在地存在于自监督语音模型(S3Ms)的表征中,我们只需要引导它们来解决这两个任务。我们利用基于S3M的音系激活映射(SPAM),它将每个S3M表征帧映射到一组音系特征激活向量(例如发声和鼻音)。在SPAM之上,我们引入了两个简单但有效的轻量级、无需梯度下降的预测头:一个识别头和一个分割头。我们的方法只需要不到一分钟的音素标注,并且能够在训练期间泛化到未见过的音素。在多种数据集上,我们的方法取得了强大的分割和识别性能。
查看arXiv页面 (https://arxiv.org/abs/2607.09020) 查看PDF (https://arxiv.org/pdf/2607.09020) GitHub1 (https://github.com/stephenmac7/phone-metrics) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.09020)
在您的代理中获取这篇论文:
hf papers read 2607.09020
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
引用此论文的Space0
没有Space链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
基于Transformer的巴西葡萄牙语韵律边界分割
本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。
SAM 3: Segment Anything with Concepts
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。
手语模型的音系感知
本文通过使用最小对立对来探测手语识别模型,评估它们是否展现出音系敏感性,揭示了架构上的权衡以及涌现但有限的音系感知。
越南语音中方言变化的语音建模
本文提出了一种方言感知的语音框架,用于建模越南语自动语音识别(ASR)中的语音变化,将音节分解为结构化组件,并将其映射到特定方言的国际音标(IPA)表示。该方法在UIT-ViMD多方言数据集上,以更少的参数且无需外部预训练,匹配了预训练基线的性能。
基于音素的自动语音识别系统中的偏见评估:对IPA转录模型的分析
本文使用音素错误率和新的Soft PER指标,评估了基于音素的自动语音识别系统(特别是WhisperIPA和ZIPA)中的人口统计和口音偏见,揭示了跨语言和群体的持续差异。