Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准
摘要
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
查看缓存全文
缓存时间: 2026/07/28 06:30
# Indic DiarBench:面向印度语言的联合说话人日记化与ASR多语言基准测试 来源:https://arxiv.org/html/2607.23808 Mehendale Mehndiratta Rathi Bhogale Khapra ###### 摘要 本文介绍Indic DiarBench,一个说话人日记化与ASR基准测试数据集,涵盖印度全部22种官方语言。该语料库包含约108小时的自然多说话人音频,来自近场会议、远场录音以及野外音频。所有标注均由人工纠正,提供时间对齐的说话人归属转写。数据集捕捉了印度口语中常见的对话特征,如英语语码混合、方言差异以及频繁的说话人重叠。为了建立联合ASR与日记化能力的基线,我们评估了包括商业语音API和多模态大语言模型在内的领先系统。Indic DiarBench作为开放资源发布,旨在推动印度语言包容性多语言语音技术研究。 ###### 关键词:说话人日记化,印度语言,多语言基准测试,说话人归属ASR,语码混合 ## 1 引言 近年来,印度语言的自动语音识别(ASR)取得了显著进展。IndicVoices[javed2024indicvoices]等大规模数据收集工作使多语言ASR系统开始覆盖印度的语言多样性。然而,这些进展主要聚焦于单说话人语音,而现实场景(如会议、访谈、小组讨论和日常对话)往往涉及多个互动说话人。在实际的多说话人转写流程中,首先使用说话人日记化来识别和划分说话人,然后对每个片段应用ASR。尽管说话人日记化研究取得了重大进展[park2021review],现有数据集和基准测试仍高度集中于英语和其他少数高资源语言,缺乏针对印度语言多说话人语音处理的标准基准。这一差距尤为关键,因为在实际部署中日记化与ASR必须协同工作。单独评估二者会掩盖重要的失败模式:当应用于日记化系统产生的短片段、碎片化和重叠语音时,ASR性能往往急剧下降。因此,要推动现实对话转写领域的进步,需要能在真实多说话人条件下评估说话人归属ASR的基准测试,而对于涵盖22种宪法承认语言和四大语系的印度语言,这一能力在很大程度上仍未被探索。 为填补这一空白,我们推出Indic DiarBench,一个开放获取的基准测试,用于评估多语言印度会话语音中的说话人归属ASR。我们的贡献可总结如下: - • 约108小时的会话语音语料库,涵盖全部22种印度官方语言,收集自近场会议、远场录音和野外YouTube对话。 - • 会议录音包含来自印度189个地区的485名独特说话人(图1)。野外数据进一步包含约750名说话人,覆盖10种最广泛使用的印度语言。 - • 人工纠正的、说话人归属的、片段级转写,附带对齐的说话人时间标注(RTTM格式),支持联合评估日记化与ASR性能。 - • 来自多个最先进的商业API、多模态LLM和印度语专用系统的基线结果,建立跨语言和声学条件的参考性能。 Indic DiarBench及其所有标注、评估协议和基线系统均公开发布,以支持可重复的研究并推动印度语言说话人归属ASR与日记化的进步。 图1:按地区和语言分布的说话人数据收集 ## 2 相关工作 早期的日记化基准测试如AMI[carletta2005ami]和ICSI[janin2003icsi]会议语料库提供了受控房间内的多通道英语录音。CALLHOME[callhome]将覆盖范围扩展到六种语言,但仅限于2-6位说话人的电话语音。DIHARD挑战系列[ryant2021dihard3]将评估推向退化和多样化领域,而VoxConverse[chung2020voxconverse]引入了带有音视频标注的野外YouTube音频。对于普通话,AliMeeting[yu2022m2met]和AISHELL-4[fu2021aishell4]提供了会议风格的语料库。LibriCSS[chen2020libricss]针对具有受控重叠比例的连续语音分离。最近,SDBench[durmus2025sdbench]将13个数据集统一在单一评估框架下,NOTSOFAR-1[vinnikov2024notsofar]引入了带有tcpWER评估的逼真会议数据。尽管取得了这些进展,但这些基准测试均未提供印度语言的实质性覆盖。表1总结了关键数据集。 在更广泛的多语言ASR层面,Common Voice[ardila2020commonvoice]和FLEURS[conneau2022fleurs]显著扩展了语言覆盖范围,但两者主要设计用于单说话人识别,并未提供说话人归属的会话日记化标签。对于印度语言,DISPLACE挑战[baghel2023displace,kalluri2024displace2]代表了日记化基准测试的首次尝试。DISPLACE 2023提供了七种语言共32小时的会话音频,而2024版扩展至158小时(其中38小时已标注)。然而,2024年的ASR赛道是在一个独立的12小时较干净近场单说话人音频子集上评估的。通过将日记化与ASR解耦,并且仅覆盖部分印度语言,DISPLACE在多说话人对话场景中对印度语言的说话人归属转写评估留下了关键空白。 表1:日记化评估数据集的比较。Indic DiarBench是首个覆盖全部22种印度官方语言并提供联合ASR+日记化标签的数据集。 ## 3 Indic DiarBench语料库 Indic DiarBench是一个多语言会话语音基准测试,旨在评估印度语言在真实多说话人环境下的说话人归属ASR。以下小节描述数据收集过程、标注流程和数据集统计。 ### 3.1 数据收集 我们首先描述语料库中代表的录音条件,然后是音频选择标准和说话人群体特征。 #### 3.1.1 录音条件 - • 近场会议(约53小时):使用每位说话人近距麦克风录制,旨在捕捉自发互动、频繁插话和重叠语音。参与者不共处一地,通过在线会议平台虚拟加入。该设置通过组合单独麦克风流准确捕捉说话人轮次。此子集覆盖全部22种官方语言。按母语人口排名前八的语言(印地语、孟加拉语、马拉地语、泰卢固语、泰米尔语、古吉拉特语、旁遮普语、卡纳达语)各贡献约4小时,其余14种语言各贡献约1.5小时。 - • 远场会议(约27小时):使用远距麦克风录制,引入混响、背景噪声和变化的说话人-麦克风距离。此子集涵盖前八种语言每语言约1.4至4.2小时,会话包含2-8位说话人。 - • 野外音频(约28小时):从公开YouTube视频中策划,捕捉非受控声学环境。为十种最广泛使用的印度语言各收集约2小时。所选片段强调持续的多说话人互动,避免单一说话人主导的广播式内容。 #### 3.1.2 数据策划与质量控制 为鼓励自然对话并避免脚本式轮换,参与者提前获得辩论主题和问卷,并自由发言。每段录音的初始热身部分被丢弃,仅保留自发互动。包括同性别说话人的会话以增加说话人混淆度。收集后,所有录音经过策划和质量控制流程,确保适合多说话人评估。对于会议录音,训练有素的语言专家审查会话的录音质量、词汇多样性、说话人重叠和对话自发性。过于脚本化或音质较差的会话被丢弃。录音时尽可能保持“低”降噪,保留自然的环境声音和对话痕迹。对于野外音频,从公开视频中策划片段,这些视频需满足:(i)包含持续的多说话人互动,(ii)避免广告和非语音主导的音乐,(iii)提供清晰的当前说话人视觉线索,以便在标注期间进行可靠的说话人识别。 #### 3.1.3 说话人群体 遵循IndicVoices[javed2024indicvoices]建立的数据收集原则,我们从印度各地的不同地理、人口和方言背景招募说话人。图1显示了按地区和语言分布的说话人数据收集情况。近场和远场条件下的会议录音包含来自22种语言、189个地区的485名独特说话人,涵盖城乡人口,捕捉了明显的口音和方言变化。说话人身份及相关元数据(如语言、地区、人口统计信息)通过唯一说话人ID和会话级元数据文件追踪,这些文件将与会议数据集一同发布。说话人群体实现了性别平衡,并涵盖广泛的教育背景。对于野外音频,通过限制每个频道只有一个视频来确保说话人唯一性。随后对说话人嵌入进行聚类以识别视频间的潜在重叠,并通过人工验证确保说话人身份的唯一性。 ### 3.2 标注流程 所有录音均使用统一的人机交互流程进行标注,旨在产生高质量的说话人归属转写。该流程结合了自动转写和三个阶段的人工验证,以确保转写、时间戳和说话人标签的准确性。 1. 1. 初始转写:使用多个独立的ASR系统生成初始转写,包括公开可用的模型和闭源API。标注者将这些假设作为可编辑草稿,减少了标注工作量,同时避免了单一系统的偏差。 2. 2. 人工转写与说话人归属:专业标注者通过验证和纠正单词序列、时间戳和说话人标签,生成时间对齐的说话人归属转写。未经人工验证的机器生成标注不会被保留。对于会议录音,已知说话人数量且单独麦克风通道提供可靠的说话人时机,标注者可以调整时间戳或说话人标签,但不能引入新说话人。对于野外音频,可用视觉线索时,标注者可在必要时添加、合并或移除说话人标签。 3. 3. 语码混合转写:印度会话语音频繁出现与英语的语码混合。为适应这一点,标注者生成两种转写格式。第一种是本地文字形式,所有文本(包括英语单词)均以印度文字呈现。第二种是规范化形式,英语单词用罗马文字书写,数字用阿拉伯数字。两种格式在词错误率计算中均被接受,以避免惩罚输出约定不同的模型。 4. 4. 质量控制:专门的质量检查员(每语言2-3人)验证转写一致性、语码混合约定、数字表示、非语音标签(、、等)以及说话人时间戳和标签。特别关注重叠语音片段,这些片段通常需要多轮审查。在此阶段进行小幅修正,重大问题则返回标注者进行修订。 5. 5. 专家审查:最后,每个文件由内部专家(超级检查员)进行特定语言的质量检查。专家不直接修正实例,而是识别系统性问题,并将不达标标注退回修订,直至达到质量标准。 ### 3.3 数据集统计 Indic DiarBench包含约108小时已标注音频,覆盖全部22种印度官方语言。表2按语言呈现统计信息,包括按声学条件划分的时长、说话人数量和重叠比例。 表2:Indic DiarBench按语言统计。所有时长以小时为单位。时长按声学条件细分(NF=近场,FF=远场,ITW=野外)。重叠百分比为所有条件的平均值。“–”表示该条件对该语言不可用。 局限性:野外子集覆盖22种语言中的10种;计划扩展至所有语言。我们未提供野外子集的说话人ID。该数据集设计用于评估而非训练。 表3:所有三种声学条件的时长加权聚合指标(%)。最佳值以粗体显示。 ## 4 评估设置 指标:我们沿两个互补维度报告评估指标:声学日记化和词级说话人归属。对于声学分割,我们报告不计 forgiveness collar 并包含重叠语音的日记化错误率(DER)。为联合评估ASR和日记化性能,我们使用拼接最小置换词错误率(cpWER)[watanabe2020chime6]和词日记化错误率(WDER)[shafey2019wder]。cpWER主要反映解决说话人置换后的转写准确性,而WDER明确惩罚说话人归属错误,因此更直接地捕捉日记化质量。 模型:我们评估多个知名的ASR-日记化系统,包括商业语音API(Sarvam AI[sarvam_asr_blog]、Deepgram Nova-3[deepgram_nova3]、ElevenLabs Scribe[elevenlabs_stt]、AssemblyAI Universal-2[assemblyai_universal2]、Azure STT[azure_stt]、AWS Transcribe[aws_transcribe])和多模态大语言模型(Gemini 3 Pro[gemini3_blog]和GPT-4o Transcribe[gpt4o_transcribe_api])。评估仅限于能够产生联合ASR和日记化输出的系统,因为独立于转写评估日记化日益与现代语音应用的需求脱节。因此,纯日记化模型(如Pyannote[Bredin23])被排除。各系统的语言覆盖范围不同,因为并非所有商业提供商都支持全部22种官方语言。 (a) cpWER (%) < 30 30–44 45–59 60–74 ≥75 N/A (b) WDER (%) < 15 15–24 25–34 35–49 ≥50 N/A 图2:按语言(a)cpWER和(b)WDER(%)热力图。 ## 5 结果与分析 在评估中,所有系统均使用相同的单通道混合音频以确保公平性。图2显示……
相似文章
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。
利用多模态特征融合联合改进印度语言中的方言识别与语音识别
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
SCRIBE:面向Indic ASR的诊断评估与富转录模型
SCRIBE 是一个用于自动语音识别的诊断评估框架,为印度语言提供分类错误分解,并发布了 Hindi、Malayalam 和 Kannada 的基准和开源权重富转录模型。
IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。
商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语
本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。