希腊歌曲自动歌词转录:Whisper适配中的规模和任务组合效应

arXiv cs.CL 论文

摘要

本文介绍了首个针对希腊歌曲自动歌词转录的基准,表明通过多任务学习和两阶段训练适配Whisper,达到了27.2%的词错误率,显著优于零样本基线。

arXiv:2609.11302v1 公告类型:新 摘要:自动歌词转录 (ALT) 由于旋律变异性、节奏不规则性和伴奏干扰,仍然比语音识别更具挑战性。这在希腊语等低资源语言中更为突出,因为目前尚无ALT的基准。我们首次对Whisper适配用于希腊ALT进行受控研究,调查模型规模效应、通过多任务训练在转录-翻译比例中的任务组合,以及两阶段语音到歌声适配。我们还基于希腊音频数据集 (GAD) 使用源分离和CTC强制对齐,整理了一个片段级对齐的歌唱数据集。结果显示,规模扩大始终能提高性能,而多任务学习主要对较小容量模型起到有益的正则化作用。Whisper Large-v3的两阶段适配达到了27.2%的词错误率 (WER),显著优于零样本基线,建立了首个希腊ALT基准。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:27

# 希腊语歌曲自动歌词转录:Whisper 适配中的规模扩展与任务组合效应
来源:https://arxiv.org/html/2609.11302
Frangiadaki Damianos Kritsis Katsouros

###### 摘要

由于旋律变化、节奏不规则以及伴奏干扰,自动歌词转录(ALT)始终比语音识别更具挑战性。在希腊语这类低资源语言中,这种挑战尤为突出,目前尚无现成的ALT基准。我们首次对Whisper在希腊语ALT上的适配进行了对照研究,探讨了模型规模效应、基于多任务训练的转录-翻译比例任务组合,以及两阶段的语音-歌声适配。我们还基于希腊语音频数据集(GAD)使用音源分离和CTC强制对齐,策划了一个片段级对齐的歌声数据集。结果表明,规模扩展能持续提升性能,而多任务学习主要对较小容量的模型起到有益的正则化作用。Whisper Large-v3的两阶段适配实现了27.2%的词错率(WER),相比零样本基线有显著改进,建立了首个希腊语ALT基准。

###### 关键词

自动歌词转录(ALT),自动语音识别(ASR),歌词对齐,Whisper微调,多任务学习,低资源语言

††地址:1希腊雅典娜研究中心语言与语音处理研究所
††邮箱:\{maria\.frangiadaki, d\.damianos, kosmas\.kritsis, vsk\}@athenarc\.gr

## 1引言

自动语音识别(ASR)以及大规模多语言预训练模型的最新进展,催生了广泛的日常应用。然而,当部署领域与训练分布不同时,ASR系统性能往往会下降。歌声是一种特别具有挑战性且尚未充分探索的领域偏移形式。将歌唱音频转换为文本的任务被称为自动歌词转录(ALT),它处于ASR和音乐信息检索(MIR)的交叉点,且远比传统的语音识别困难。歌声在声学和语言结构上与语音有根本性差异。大幅度的音高变化、持续的元音、花腔(元音跨越多个音符延长)、节奏不规则、乐器伴奏以及富有表现力的发音,都违背了从以语音为主导的语料库中学到的假设。因此,主要针对口语训练的模型难以泛化到歌唱人声。

这种声学领域偏移在低资源语言中更为严重。虽然英语歌唱数据集推动了ALT的近期进展,但许多语言缺乏系统整理的歌唱语料库、对齐的标注和可复现的评估协议。希腊语,尽管拥有丰富的音乐传统和形态复杂性,尚未在对照的ALT环境中被研究。目前尚无公认的希腊语歌声ASR基准,且多语言模型在歌声领域适配下的行为仍不明确。

本工作致力于解决希腊语歌声的ALT问题,重点关注Whisper模型作为强大的多语言预训练基线。我们研究在资源匮乏的歌声场景中,从语音到歌声的迁移过程中,Whisper等多语言预训练ASR模型的适配能在多大程度上提高歌词转录准确性。为回答此问题,我们开发了一个完整的端到端希腊语ALT流程,并进行了一项对照实验研究,包括在不同检查点对Whisper进行纯转录训练微调,以及评估多任务和两阶段学习策略。本工作的贡献如下:

1. 我们提出了首个希腊语ALT的系统基准。
2. 我们策划了希腊语音频数据集(GAD)的完整处理和对齐版本,包括音源分离和对齐的分割、翻译对,以及可复现的训练-验证-测试划分。
3. 我们在低资源语言中对歌声领域适配的模型规模和任务组合进行了对照研究。
4. 我们引入了一种具有语言感知预处理的纯净任务批处理方案,以稳定歌声训练。
5. 我们提出了针对希腊语歌词的定量和定性错误分类法,突出了歌声特定的错误。
6. 我们证明大规模纯转录和两阶段适配是希腊语ALT最有效的策略,而多任务学习可有效作为正则化手段,并提高了较小容量模型的词错率(WER)结果。
代码、模型和可复现的数据集资源可在https://github.com/athena-ilsp/lyrics-transcription和https://huggingface.co/collections/ilsp/ilsp-greek-whisper-alt-models获取,采用Apache 2.0和CC-BY 4.0许可协议。

## 2相关工作

### 2.1 ALT

早期的ALT方法依赖于为音乐定制的传统ASR流程,通常采用隐马尔可夫模型(HMM)结合高斯混合模型(GMM)或在歌唱数据上适配的深度神经网络(DNN)。基准数据集(如DALI和DAMP-Sing)的发布促进了系统评估,凸显了语音与歌唱之间持续存在的声学失配。向端到端深度学习架构(如连接时序分类CTC和基于注意力的编码器-解码器AED模型)的转变,统一了声学建模和对齐。最近的工作也将这些扩展到多模态设置,证明辅助线索(如唇部动作或音符级转录)可以在低信噪比条件下进一步稳定解码。尽管取得了这些进展,歌词转录仍然是一项具有挑战性的任务,需要鲁棒的领域适配。

### 2.2 基础模型与适配

大规模自监督基础模型的出现重新定义了语音处理的最先进水平。像wav2vec 2.0及其跨语言扩展XLS-R这样的架构,学习了通用的声学表示,可以通过微调有效地迁移到歌声。最近,OpenAI的Whisper由于其大规模多语言预训练,展现了显著的零样本鲁棒性。在MIR背景下,尽管Whisper在干净人声上表现强劲,但其零样本准确性在多声部音频上显著下降。为缓解此问题,有方法提出将Whisper与大型语言模型(LLM)级联进行错误校正。进一步的ASR技术,如采用参数高效调优(例如LoRA)进行可扩展的专门化,或利用语音-文本联合预训练(例如SpeechLM),进一步整合了声学和语言信息。然而,大多数现有研究集中在高资源语言上,导致此类基础模型在低资源歌唱语言上的有效性在很大程度上未经探索。

将ASR模型适配到低资源领域通常需要专门的训练策略。多任务学习,即模型在翻译等辅助任务上联合优化,充当正则化器,防止在小型目标数据集上过拟合。在Whisper的背景下,其转录和翻译标记之间的相互作用为多任务适配提供了独特的途径。此外,分阶段微调策略已被证明可以稳定低资源场景下的ASR训练。以数据为中心的策略通过语音到歌声增强和一致性损失正则化,进一步弥合了语音到歌声的差距。

### 2.3 希腊语语音与歌声识别

希腊语的自动语音识别通过近期的口语语料库取得了进展,这些语料库加强了ASR基础设施。基准测试表明,虽然像Whisper这样的通用模型在希腊口语中表现尚可,但它们在方言变化和快速清晰发音方面存在困难。为克服数据稀缺,近期框架利用无监督领域适配。例如,M2DS2和MSDA结合了自监督预训练和基于伪标签的教师-学生训练,有效减少了现代希腊语ASR中的领域失配。在文献中,希腊语ASR与歌声分析的交集几乎不存在。迄今为止,尚无标准化的希腊语ALT基准,也没有研究系统评估多语言基础模型向希腊语歌声的迁移性。虽然现有的希腊音乐数据集,如Lyra、GAD和希腊音乐数据集(GMD),为通用的音乐信息检索(MIR)任务提供了宝贵的声学资源,但它们缺乏端到端音频到歌词转录所需的片段级对齐文本标注。本工作通过首次对照评估Whisper在希腊语歌声上的表现,弥合了这一空白,为低资源ALT的未来研究建立了基线。

## 3 GAD-ALT数据集

本工作的核心贡献之一是策划了GAD-ALT语料库。ALT需要音频和文本之间的时间同步,因此我们扩展了最初为流派分类设计的GAD,使其成为可用于ASR的数据集。GAD包含1000首流行希腊歌曲,涵盖多种流派(都市、民谣、摇滚、嘻哈流行)。所有条目都附有流派标注、歌词、手动标注的情绪标签、元数据、提取的音频特征以及相应歌曲在YouTube上的链接,从而使研究人员在需要时可以获取原始音频。

### 3.1 音源分离

为了将其转化为可复现的ALT基准,需要进行大量整理以解决缺失的元数据、纠正不匹配并标准化歌词格式。由于音乐录音是多声部的,我们使用混合Transformer Demucs(htdemucs_ft)进行双声道音源分离,提取人声和伴奏音轨。提取的人声被降混为单声道,重采样至16 kHz以匹配Whisper的输入要求,并转换为Kaldi格式。

### 3.2 强制对齐与双语增强

为进行时间对齐,我们采用了定制版本的开源CTC强制对齐器。录音在30秒的重叠窗口中处理。为过滤低质量的对齐,我们计算一个自定义置信度分数,结合了对齐标记百分比(50%)、平均CTC对数概率(30%)和时长规律性惩罚(20%)。为支持多任务实验,每个对齐的希腊语片段使用gpt-4o-mini模型通过OpenAI API在片段级别翻译为英语,采用零样本提示,温度设置为0,最大限制为128个标记,同时保留时间对齐。最终整理的歌唱语料库采用Hugging Face格式,包含17,458个对齐的歌词片段(19.65小时)。为防止数据泄露,在歌曲级别进行划分,将数据集分为13,750个训练片段(78.8%)、1,892个验证片段(10.8%)和1,816个测试片段(10.4%),平均时长为4秒。每个最终条目包含:(i) 对齐的音频片段,(ii) 归一化的希腊语转录文本,以及(iii) 英语翻译。

参考说明 图1:提出的针对2:1转录:翻译比例的多任务训练框架概览。

## 4方法与实验设置

### 4.1 概述

所提出的方法引入了一个完整的端到端希腊语ALT流程。在策划GAD-ALT数据集后,多语言预训练的Whisper模型在控制设置下适配到歌声领域,这些设置在模型规模、任务组合和分阶段语音到歌声适配方面有所不同。

### 4.2 Whisper适配策略

使用预训练模型的零样本推理作为我们的域外基线。我们在两种监督微调制度下评估三种模型规模(Small、Medium、Large-v3)。纯转录任务(希腊语音频→希腊语文本)和多任务设置(希腊语音频→希腊语转录+英语翻译)。对于后者,任务特定的批次以固定比例(2:1,4:1)交错,使用确定性采样器确保任务同质的批次,使我们能够研究翻译是否起到正则化器的作用。所提出的多任务训练框架如图1所示。为减少语音到歌声的领域差距,我们还评估了分阶段适配策略。为此,我们还利用了Mozilla Common Voice(v23.0)的希腊语子集,该子集包含约37.5小时的经验证的朗读语音。在第一阶段,我们仅在希腊语语音上微调Whisper,同时冻结整个编码器,以便更新仅针对解码器以进行语言适配。最后,在第二阶段,模型完全解冻并在歌唱语料库上进行微调。

### 4.3 训练细节

所有模型都使用Hugging Face Seq2SeqTrainer在多GPU NVIDIA A100节点上训练。使用AdamW优化器训练5个轮次。Whisper Small和Medium的学习率设为5×10⁻⁵效果更好,而Whisper Large-v3则更适合3×10⁻⁵。每个GPU的批大小根据模型规模在4到8个片段之间变化,采用混合精度(FP16)以提高效率。为便于未来研究,我们完整的训练流程和模型配置将作为开源发布。

## 5结果

评估在归一化词错率(WER)上进行,包括小写转换、标点移除和标准文本归一化后计算。WER使用jiwer库在聚合的片段级预测上计算。

表1:希腊语歌唱测试集上的归一化词错率(WER %)。该表对比了模型规模扩展与任务组合(多任务比例)和分阶段适配的效果。

相似文章

Whisper 介绍

OpenAI Blog

OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。

使基础ASR模型适应构音障碍语音:一项案例研究

arXiv cs.CL

本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。

构建生产级希腊语-英语语音识别系统

Hugging Face Daily Papers

本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。