MUSCAT:多语言科学对话基准
摘要
MUSCAT是一个新的多语言科学对话基准数据集,用于评估ASR系统在具有挑战性的多语言场景中的表现,包括代码混合、特定领域词汇和混合语言输入。该数据集包含使用不同语言的说话者之间关于科学论文的双语讨论,结果表明当前的最先进系统在应对这些多语言挑战时存在困难。
查看缓存全文
缓存时间: 2026/04/20 08:29
# MUSCAT: MUltilingual, SCientific ConversATion Benchmark 来源:https://arxiv.org/html/2604.15929 ###### 摘要 多语言语音技术的目标是便利不同语言使用者之间的无缝沟通,创造出每个人都是多语言使用者的体验。为了实现这一体验,语音技术需要解决几个挑战:处理混合多语言输入、特定词汇和代码混用。然而,目前没有针对这种情况的基准数据集。我们提出了一个新的基准来评估当前自动语音识别(ASR)系统是否能够应对这些挑战。该基准包含多个使用者之间关于科学论文的双语讨论,每个使用者使用不同的语言。我们提供了超越词错误率(WER)的标准评估框架,能够一致地比较不同语言的ASR性能。实验结果表明,提议的数据集对最先进的ASR系统来说仍然是一个开放性挑战。数据集可在 https://huggingface.co/datasets/goodpiku/muscat-eval 获取 关键词:多语言、语音识别、音频分割、说话人分离 ## 1. 引言 跨越语言边界的无缝沟通是人类的长期梦想。终极目标是实现自然的多语言对话,其中每个参与者用自己偏好的语言交谈,并能够理解所有其他语言。虽然在高资源语言的多语言语音识别方面取得了显著进展,以及低资源设置方面也有所改善,但据我们所知,目前还没有逼真的基准来评估多语言对话场景中的系统性能。 为了满足对逼真、高质量多语言数据集日益增长的需求,我们呈现了一套独特的音频录音集合,旨在作为自动语音识别的基准。为了在该基准上构建强大的系统,需要解决几个挑战:多语言语音输入、说话人分割、音频条件、领域特定词汇和代码混用。 为了收集数据,我们设置了两个双语使用者关于科学出版物的讨论。每个说话者只用一种语言交谈,但理解两种语言。虽然英语在全球科学交流中占主导地位,但我们的目标是开发基于AI的解决方案,使研究人员能够用母语交流科学内容而不做任何妥协。为了研究这一点,我们使用双语使用者进行了受控模拟。 我们的评估显示当前AI系统的局限性。该技术尚不足以支持科学领域的多语言沟通。在图1中,上部分说明了MUSCAT数据集创建过程的示例场景,其中在两个说话者之间记录自发对话,一个说英语,另一个说德语。下部分突出显示了最先进(SOTA)ASR模型面临的关键挑战:它们在自发多语言语音中准确检测语言切换的困难。在这些情况下,模型通常要么将话语翻译成前置上下文的语言,要么完全无法转录某些片段。这为语音翻译技术带来了一个预言式的设置。 **图1:**一个说明MUSCAT创建过程(图的上部分)及其多语言多样性对最先进ASR系统构成的挑战(图的下部分)的示例。ASR无法准确检测自发对话中由红色表示的语言切换。蓝色虚线(−−−−)表示ASR无法转录的对话部分。 本文的主要贡献是: - 提出了一个新的多语言科学对话基准数据集 - 对所提基准挑战的详细分析 - 突显任务困难的最先进基线结果 ## 2. 数据收集 我们的目标是构建高质量的多语言数据集。为了实现这一目标,我们首先创建了一个对话设置,突出多语言科学对话的挑战。接下来,我们设计了一个录音设置,使我们能够分别调查不同的挑战。 ### 2.1. 对话设置 数据集中的每个实例都包含两个说话者之间关于科学论文的对话。说话者对所讨论的论文具有先验知识。我们通过让说话者用两种不同语言交谈来为该场景创建语音翻译的预言情况。为了进行对话,说话者需要精通两种语言。在我们的情况下,从事自然对话的说话者分别精通C1级别的英语,并且是另一种语言的母语使用者。 这种独特的设置允许有意义的交流,其中说话者完全相互理解,但仅用两种语言之一作出回应。这些对话提供了英语-德语、英语-越南语、英语-中文和英语-土耳其语等语言对的配对语音和转录。 ### 2.2. 录音设置 与ASR相关的挑战因录音环境而异。为了联合评估不同的条件,我们用三种不同的设备同步录制对话。第一台设备是Meeting Owl 3,这是一个流行的视频会议系统,可以捕捉360°视频和音频。第二台设备ReSpeaker USB麦克风是一个为高保真多向音频捕捉而设计的紧凑阵列麦克风。第三个是Meta的Aria智能眼镜,作为一种可穿戴设备,可以记录第一人称音频以及来自说话者环境的音频。 Meeting Owl 3(在本文的其余部分中简称为OWL)通过USB连接到笔记本电脑,并使用OBS Studio进行录制。ReSpeaker USB麦克风阵列与Raspberry Pi 3配对,也通过USB连接,以提供额外的音频源。为简洁起见,我们在本文的其余部分将此设置称为Pi。最后,Meta的Aria眼镜由其中一个说话者佩戴,用于从其角度记录整个对话。由于Aria只能由一个人在录制时佩戴,我们随机选择了一个说话者。这导致三个德语、一个中文、一个越南语和一个英语说话者佩戴Aria。其他音频录音设备大致保持在中间位置,距离说话者等距。 录音的采样率为44.1kHz,使用上述多个麦克风。数据收集后,所有设备的录音都使用Audacity手动对齐,以确保完美同步。这种设备组合和细致的对齐确保数据集捕捉了广泛的音频视角,增加了深度和多样性。所有使用的软件都是录制时可用的最新版本。为确保外部声音的干扰最少,录音使用了适当隔离的房间。 ## 3. 人工标注 我们对收集的数据进行标注,将其用作最先进ASR系统的基准。首先,我们进行音频录音的手动分割,作为评估和比较两种自动分割方法的预言。接下来,我们创建音频的多语言转录。 ### 3.1. 手动分割 我们按照两个约束进行手动分割。首先,由于我们的每个录音都包含两种不同语言的对话,我们优先考虑语言特定的分割。这确保每个片段包含单一语言的录音。其次,为了支持最优的模型性能,我们将每个片段的最大持续时间限制为30秒。手动分割过程使用Label Studio(一个开源数据标注工具)进行。 ### 3.2. 人工后期编辑 从派生的手动片段开始,我们遵循两步过程以获得数据集的人工转录。首先,为了简化录音的手动转录,我们使用最先进的ASR模型Whisper对语言特定的片段进行自动转录。其次,相应的说话者手动更正ASR模型所犯的任何错误,确保高质量的转录。采用这一策略是为了克服找到既精通特定语言又熟悉论文中讨论的复杂科学话题的外部标注者的挑战。使用说话者执行这样的任务确保了技术术语和领域特定背景被准确标注。 在标注过程中,我们经常观察到录制语音中代码混用的实例。由于混合语言的话语已知会对当前语音识别系统造成特殊挑战,标注者还被指示在发生代码混用时标记所有属于嵌入式语言的单词。 ## 4. MUSCAT数据集 MUSCAT数据集由六个录音中跨越十一个说话者的多语言对话组成。每个录音是两个说话者之间的对话,存在一个说话者出现在两个录音中。所有六个录音都至少有一个英语说话者,而另一个说话者来自德语、土耳其语、中文和越南语。在六个录音中,一半的对话是在英语和德语说话者对之间进行的,另一半是在英语和其他语言之间进行的。我们在数据集中的说话者之间保持性别多样性。为此,在MUSCAT数据集的十一个说话者中,六个是男性,其余五个是女性。 为了评估与此基准相关的不同挑战,我们提供了6种不同的数据集变体。首先,每个说话者使用不同设备的三个不同录音。其次,对于每个对话,都有分割和未分割的音频录音版本。 表1总结了数据集的主要方面。数据集的总时长约为65分钟,其中英语-越南语对话包含17分钟,而英语-中文、英语-土耳其语和英语-德语对话分别包含15、12和21分钟。每个说话者说出的单词被归属到其相应语言的单词计数中,总共9,066个单词。 **表1:数据集统计** | 录音 | 语言 | 总时长 | 单词数 | |------|------|--------|--------| | 录音1 | 英语 | 4.69分钟 | 463 | | | 德语 | 1.92分钟 | 288 | | 录音2 | 英语 | 1.39分钟 | 162 | | | 德语 | 2.74分钟 | 427 | | 录音3 | 英语 | 7.51分钟 | 1344 | | | 土耳其语 | 3.94分钟 | 447 | | 录音4 | 英语 | 11.90分钟 | 1362 | | | 中文 | 2.79分钟 | 623 | | 录音5 | 英语 | 7.47分钟 | 972 | | | 德语 | 3.00分钟 | 426 | | 录音6 | 英语 | 10.04分钟 | 1489 | | | 越南语 | 6.83分钟 | 1063 | | 总计 | | 64.22分钟 | 9,066 | ## 5. 基线 本部分概述了我们实验中采用的基线配置,详细说明了所使用的ASR模型和预处理中应用的分割策略。 ### 5.1. ASR模型 我们的目标是评估SOTA ASR模型在MUSCAT数据集上的性能。为此,我们采用了四个SOTA模型:Whisper、SALMONN、Phi-4多模态和Wav2Vec2,并评估它们生成的转录质量。这些模型代表了多样的ASR范式,包括编码器-解码器架构(Whisper)、多模态大型语言模型(SALMONN和Phi-4多模态)和基于CTC的系统(Wav2Vec2)。 #### Whisper Whisper是由OpenAI开发的基于Transformer的编码器-解码器模型,主要为自动语音识别(ASR)和语音翻译任务而设计。它已在从互联网收集的约680k小时的语音数据上进行了训练。模型的编码器处理输入语音以生成音频特征,然后将其传递给解码器。解码器使用这些音频特征以及位置编码来生成相应的转录。Whisper还采用了一组上下文标记,通过指定语言、要执行的任务和转录的起点和终点来指导模型。 #### SALMONN 由清华大学和字节跳动开发的SALMONN模型扩展了大型语言模型(LLMs)(如Vicuna)的功能,使其能够直接感知和解释一般音频输入。这种增强使LLMs能够在一系列语音和音频处理任务中具有竞争力。SALMONN整合了来自两个专门编码器的信息,Whisper用于语音,BEATs用于一般音频,使用窗口级Q-Former模块。生成的增强音频标记与LLM的内部表示对齐,实现无缝的多模态理解。 #### Phi-4多模态 Phi-4多模态(简称为Phi)是由微软开发的5.6B参数指令调优多模态Transformer。它被设计用于文本、图像和音频输入的统一处理,使其能够处理跨越视觉-语言、视觉-语音和语音-语言领域的任务。该模型支持长达128K标记的上下文长度,并利用32个配备分组查询注意力(GQA)的Transformer层,实现高效的长上下文处理。视觉和音频模态通过两层多层感知机(MLPs)映射到文本嵌入空间。Phi在广泛的多语言和多模态基准上展示了强大的性能。 #### Wav2Vec2 Wav2Vec2是一个自监督学习框架,设计用于直接从原始音频学习语音表示。该模型包括一个卷积特征编码器,将音频转换为潜在表示,随后是一个捕捉时间上下文的Transformer网络。 我们使用wav2vec2-large-960h-lv60-self模型
相似文章
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语
本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。
SEA-SpeechBench: 东南亚语音理解的大规模多任务基准测试
SEA-SpeechBench是首个大规模多任务基准测试,用于评估11种东南亚语言的语音理解,揭示了当前模型的性能差距。
连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。