基于音系激活映射的音素分割与识别
摘要
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
查看缓存全文
缓存时间: 2026/07/13 07:49
论文页面 - 通过音系激活映射进行音素分割与识别
来源:https://huggingface.co/papers/2607.09020
作者:
,
,
,
,
,
,
,
,
,
摘要
音素分割与识别本质上是相关联的任务,然而现代方法通常分别对它们进行建模。我们认为,音系结构已经潜在地存在于自监督语音模型(S3Ms)的表征中,我们只需要引导它们来解决这两个任务。我们利用基于S3M的音系激活映射(SPAM),它将每个S3M表征帧映射到一组音系特征激活向量(例如发声和鼻音)。在SPAM之上,我们引入了两个简单但有效的轻量级、无需梯度下降的预测头:一个识别头和一个分割头。我们的方法只需要不到一分钟的音素标注,并且能够在训练期间泛化到未见过的音素。在多种数据集上,我们的方法取得了强大的分割和识别性能。
查看arXiv页面 (https://arxiv.org/abs/2607.09020) 查看PDF (https://arxiv.org/pdf/2607.09020) GitHub1 (https://github.com/stephenmac7/phone-metrics) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.09020)
在您的代理中获取这篇论文:
hf papers read 2607.09020
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
引用此论文的Space0
没有Space链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.09020 以将其链接至此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
更优、更强、更快、更广:面向基于MLLM分割的结构化全掩码预测
本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。
通过年龄感知训练实现儿童语音的边缘音素识别
提出了一种用于儿童语音音素识别的年龄感知多任务学习方法,使轻量级94M参数模型能够超越更大的模型,并在手机等边缘设备上运行。
基于Transformer的巴西葡萄牙语韵律边界分割
本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。
SAM 3: Segment Anything with Concepts
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。
手语模型的音系感知
本文通过使用最小对立对来探测手语识别模型,评估它们是否展现出音系敏感性,揭示了架构上的权衡以及涌现但有限的音系感知。