ESCUCHA:面向异质声学条件的西班牙语语音基准
摘要
介绍了ESCUCHA,这是首个用于评估大型音频语言模型在异质声学条件和推理能力方面的西班牙语语音理解基准,包含来自多种真实世界来源的1000个精选问题。
arXiv:2607.17812v1 公告类型: 新
摘要:随着大型音频语言模型(LALMs)的发展,鲁棒的评估框架变得至关重要。然而,在真实声学条件下的西班牙语语音理解受到的关注尤其有限。我们提出了ESCUCHA,这是首个旨在评估LALMs在异质声学条件和推理能力方面的西班牙语语音理解基准。ESCUCHA包含1000个人工精选的问答对,附有音频,总计162.9小时,这些音频直接取自真实环境而非现有数据集,时长从几秒到超过80分钟不等。该基准强调推理,涵盖9个感知类别和10个推理类别,并通过多种西班牙语口音和非标准语音捕捉语言多样性。ESCUCHA还包括多音频问题、口语问题及音频指令,并标注了哪些问题支持开放式评估。对几种最先进的多模态和语音模型进行的基准测试表明,与经过训练的人类相比,仍存在显著的性能差距。
查看缓存全文
缓存时间: 2026/07/21 06:46
# ESCUCHA:一种面向异构声学条件的西班牙语语音评测基准 来源:https://arxiv.org/html/2607.17812 **第2作者 Ana Ayala† 第3作者 Guillermo Segovia 第4作者 Fernando Ibáñez 第5作者 Ana Martínez 第6作者 Pablo Gómez 第7作者 Jordi Luque** ###### 摘要 随着大型音频语言模型(LALMs)的不断进步,稳健的评估框架变得愈发重要。然而,在现实声学条件下的西班牙语语音理解领域,相关研究尤为匮乏。我们提出 **ESCUCHA**,这是首个专门用于评估 LALMs 在异构声学条件和推理能力方面表现的西班牙语语音理解基准。ESCUCHA 包含 1,000 个人工筛选的问题并配有音频,总时长 162.9 小时,音频直接采集自“野外环境”,而非来自现有数据集,时长从几秒到超过 80 分钟不等。该基准强调推理能力,涵盖 9 个感知类别和 10 个推理类别,并通过多种西班牙语口音及非规范性语音来捕捉语言多样性。ESCUCHA 还包含多音频问题、语音问题、音频指令,并标注了哪些问题支持开放式评估。对多个最先进的多模态和语音模型进行基准测试显示,与经过训练的人类相比,存在显著的性能差距。 ## I. 引言 理解听觉信息对于机器智能至关重要。为此,涌现了大量大型音频语言模型(LALMs),包括 LTU[1 (https://arxiv.org/html/2607.17812#bib.bib1)]、SALMONN[2 (https://arxiv.org/html/2607.17812#bib.bib2)]、GAMA[3 (https://arxiv.org/html/2607.17812#bib.bib3)]、Qwen3-Omni[4 (https://arxiv.org/html/2607.17812#bib.bib4)]、Kimi-Audio[5 (https://arxiv.org/html/2607.17812#bib.bib5)] 以及 Audio Flamingo 3[6 (https://arxiv.org/html/2607.17812#bib.bib6)]。评估这些模型对于排定其性能排名、揭示其局限性,从而推动该领域的发展至关重要。早期的基准测试主要针对基础任务,如语音识别和语音翻译[7 (https://arxiv.org/html/2607.17812#bib.bib7),8 (https://arxiv.org/html/2607.17812#bib.bib8),9 (https://arxiv.org/html/2607.17812#bib.bib9),10 (https://arxiv.org/html/2607.17812#bib.bib10)]。近期的努力则更侧重于联合评估感知与推理能力,包括 MMAU[11 (https://arxiv.org/html/2607.17812#bib.bib11)]、MMAR[12 (https://arxiv.org/html/2607.17812#bib.bib12)]、SAKURA[13 (https://arxiv.org/html/2607.17812#bib.bib13)]、MMSU[14 (https://arxiv.org/html/2607.17812#bib.bib14)] 和 MMAU-Pro[15 (https://arxiv.org/html/2607.17812#bib.bib15)]。然而,尽管有了这些发展,目前尚不清楚在现有基准上的强劲表现能否在模型脱离英语和规范性语音后依然保持。在规范性的、以英语为中心的条件下取得的高分,并不能保证模型能泛化到其他语言和说话者特征,而当前的基准测试对于性能预期的下降程度提供了很少的指导。对于非规范性语音,这一问题尤为突出:诸如肌萎缩侧索硬化症(ALS)和中风后遗症等神经运动障碍常常导致构音障碍,这会损害言语的神经肌肉控制、降低发音清晰度、改变韵律、并产生可变的可懂度,这些都给语音识别系统带来了挑战[16 (https://arxiv.org/html/2607.17812#bib.bib16),17 (https://arxiv.org/html/2607.17812#bib.bib17)]。对于那些希望将 LALMs 部署在非英语环境中的从业者来说,这一差距尤其令人担忧。多语言基准测试提供的缓解作用有限:GlobeAudio 涵盖六种语言,但排除了西班牙语[18 (https://arxiv.org/html/2607.17812#bib.bib18)];而 Fleurs-SLU[19 (https://arxiv.org/html/2607.17812#bib.bib19)] 评估语音 LLM 时,仅将西班牙语作为众多语言之一,并且仅通过一组从文本派生出的、答案可从转录文本中恢复的阅读理解问题进行评估。具体到西班牙语,最初的努力如 IberoBench[20 (https://arxiv.org/html/2607.17812#bib.bib20)] 针对的是伊比利亚语言,但 IberoBench 是面向大型语言模型(LLM)自然语言理解的多任务文本基准,而非语音基准。同时,对于非规范性语音,先前的工作主要集中在转录上,语音理解领域仍存在空白[21 (https://arxiv.org/html/2607.17812#bib.bib21)]。更广泛地说,现有基准测试集中在英语和规范性语音上,依赖朗读或精心策划的音频而非野外音频,局限于有限的问题类型,并且由于源自现有数据集,存在训练-测试数据污染的风险。为弥补这一差距,我们提出了 **ESCUCHA**,这是首个用于评估 LALMs 在西班牙语中表现的语音理解基准,涵盖了在真实世界条件下采集的规范性和非规范性语音。ESCUCHA 遵循多项选择题回答(MCQA)协议,并额外包含多音频比较问题、音频指令跟随(AIF)和语音问题,这些共同刻画了 LALMs 在不同条件下使用西班牙语的表现。我们的主要贡献如下: - • **首个面向大型音频语言模型的野外西班牙语基准**(音频和问题)。¹¹¹下载代码和注释:https://github.com/ferugit/ESCUCHA - • **首个评估对非规范性病理语音进行语音理解和推理的 LALM 基准**,涵盖肌萎缩侧索硬化症(ALS)和中风。 - • **对当前 LALM 在西班牙语上的行为进行广泛评估**,覆盖了开放权重和闭源模型、纯文本基线以及人类表现。 ## II. ESCUCHA 基准 ### II-A 概述 ESCUCHA 包含 1,000 个专家精心策划的问题,这些问题基于 162.9 小时从公开录音中获取的野外西班牙语音频。遵循 MMAU-Pro[15 (https://arxiv.org/html/2607.17812#bib.bib15)] 的设计理念,我们沿两个互补的轴对每个问题进行标注:从信号中提取信息所需的**感知**技能,以及将该信息转化为答案所需的**推理**技能,从而形成了一个包含 9 个感知类别和 10 个推理类别的多标签分类体系。每个问题平均带有 1.44 个感知标签和 1.14 个推理标签,这反映了真实音频理解所具有的组合性质:一个条目常常同时需要,例如,副语言情感识别以及关于说话者意图的因果推理。一个示例见图 1 (https://arxiv.org/html/2607.17812#S2.F1):该条目将来自 ALS 患者的非规范性语音与时间推理和定量推理相结合,要求模型识别两个数值,将它们置于共同的时间线上并进行比较。 **示例问题** **音频上下文**:一段 96 秒的证词,其中 Irene(一位 28 岁、患有 ALS(ELA)的女性,其语音为非规范性语音)回忆了确诊日期,并引用了通常给与这种疾病患者的预期寿命。 **问题**:¿Desde que le diagnosticaron la ELA, ha vivido Irene más tiempo del que se menciona en el vídeo como esperanza de vida para las personas con esta enfermedad? (自从确诊 ALS 以来,Irene 的寿命是否比视频中提到的这种疾病患者的预期寿命更长?) **感知**:词汇与短语级别识别 **推理**:定量推理(计数/算术比较) · 时间与顺序推理 **图 1:链接式跨类别推理示例。** 该问题需要三个步骤:识别两个数值(Irene 确诊以来的时间和她所引用的预期寿命),将它们映射到共同的时间线上并进行比较。最常见的错误是选择 (C) "No puede saberse"(无法得知),这混淆了音频中缺乏显式比较与真正的不可知性。 ESCUCHA 还包含一个**比较**子集:254 个问题(占 25.4%)涉及两个独立的录音,要求模型将它们关联起来,比较不同片段中的说话者、方言、声学条件或内容。这种跨片段比较在专业听力任务中很常见。表 I (https://arxiv.org/html/2607.17812#S2.T1) 总结了该基准的主要统计数据。 **表 I:ESCUCHA 概览。** AIF:音频指令跟随;MCQA:多项选择题回答。比较、语音和非规范性是非排他性的标签,并不划分总数。 ### II-B 基准创建流程 我们通过如图 2 (https://arxiv.org/html/2607.17812#S2.F2) 所示的四阶段流水线构建 ESCUCHA。 **见标题图 2:构建 ESCUCHA 基准的流水线。** 该流程包括四个阶段:(i) 目标设定以及感知和推理类别的细化;(ii) 音频选择以及问题和干扰项的编写;(iii) LLM 辅助审核;(iv) 模型和人类评估。 - • **目标和类别细化**。我们定义每种问题类型的目标、类别以及要收集的音频类型,然后修订感知和推理分类法。第 II-C (https://arxiv.org/html/2607.17812#S2.SS3) 节提供了更多细节。 - • **音频选择与问题编写**。我们从野外的 YouTube 录音中获取音频,偏向于自发性语音。标注员识别候选视频,筛选内容,编写相应的问题和干扰项,将每个条目与音频关联,并为其分配感知和推理标签。对于非规范性语音,我们使用针对构音障碍语音的西班牙语查询(如特定病症关键词、访谈和纪录片)来检索视频,并优先选择访谈;然后根据自我报告的诊断、视频元数据和非规范性语音的感知证据来筛选候选者。由此得到的语料库涵盖了多种声学条件,包括背景噪声、音乐和异构的录音设置。 - • **LLM 辅助审核**。我们使用一个 LLM(Gemma-4-31B-IT)沿四个维度审核每个问题,该模型返回它标记为需要标注员手动验证的条目标识符。审核检查:类别分配是否正确、是否需要音频才能回答问题、干扰项是否足够有挑战性、问题或干扰项中是否存在语法错误。 - • **模型与人类评估**。我们对一系列 LALM、纯文本 LLM 和级联系统进行基准测试,并收集人类判断以建立参考性能。在所有四个阶段中,标注团队由三名语言学家和三名技术专家组成,均为西班牙语母语者。每个条目都带有元数据,包括源URL、测量时长、多标签类别、干扰项,以及(如适用)病理说话者属性和 AIF 验证器标识符。 ### II-C 分类法 我们的分类法源自 MMAU-Pro[15 (https://arxiv.org/html/2607.17812#bib.bib15)],保留了其感知和推理轴,同时对它们进行了轻微重新定义。表 II (https://arxiv.org/html/2607.17812#S2.T2) 展示了我们基准中的类别计数。 **表 II:每个感知和推理类别的问题计数。** 计数总和超过 1,000,因为分类法是多标签的。 | 类别 | #Q | | :--- | :--- | | **感知** | | | 词汇与短语级别识别 | 506 | | 说话者识别 | 324 | | 副语言/情感识别 | 181 | | 语音活动、话轮转换与重叠检测 | 115 | | 语言识别 | 87 | | 音频质量、伪影与信道特征 | 84 | | 韵律检测 | 74 | | 说话者人口统计特征 | 50 | | 句法与句子结构处理 | 18 | | **推理** | | | 说话者意图、语用与因果推理 | 221 | | 语义抽象与总结 | 177 | | 逻辑/一致性推理 | 159 | | 事实与常识知识整合 | 133 | | 定量推理 | 121 | | 时间与顺序推理 | 105 | | 社会角色与关系推断 | 94 | | 比较与偏好判断 | 62 | | 跨边界实体关联 | 38 | | 连贯性与话语结构 | 29 | 我们没有强制执行均匀分布,而是优先选择那些在每个录音中具有挑战性且基础良好的问题,而不是那些仅仅为了填补代表性不足的单元格的问题。这既保持了难度,又覆盖了所有类别。共现矩阵(图 3 (https://arxiv.org/html/2607.17812#S2.F3))描述了由此产生的分布。该矩阵密集填充而非块对角矩阵:词汇识别与所有十个推理类别共现,最高峰出现在语义抽象与总结(158),而其他感知技能的配对更具选择性,例如语言识别与事实以及常识知识整合(53)。这种一个宽行与多个局部配对相结合表明,许多问题结合了感知与推理,而非孤立单一技能。少数特定的配对仍未填充,这留待未来工作处理。 **见标题图 3:900 个 MCQA 问题中感知×推理的共现情况。** 排除了仅带有感知标签的 AIF 问题。每个单元格统计问题标签对的数量;带有多个感知或推理标签的问题会贡献到多个单元格,因此单元格总数超过问题数量,且行和列的总和不是互斥的。 ### II-D 其他任务 除了常规涵盖的任务外,ESCUCHA 还包含两个额外的子集。 **非规范性语音**。一个包含 158 个问题(15.8%)的子集专门针对病理语音,并带有每位说话者的元数据,涵盖诊断、性别和可懂度。它包括 ALS 患者(114 个问题)和中风后语音(44 个问题),并按性别标注(123 名男性,35 名女性)。我们还为 158 个条目中的 145 个提供了可懂度级别,范围从低(53)和中/低(71)到中(9)和高/中(12);其余 13 个 ALS 条目缺少可懂度标注。 **语音问题**。我们从现有的 ESCUCHA 池中抽取了 100 个问题,使用感知和推理类别上的逆频率加权,以优先考虑代表性不足的类别。由于语音问题以第二个关联音频的形式存储,因此只有单音频条目符合条件。原始问题文本被输入 OmniVoice[22 (https://arxiv.org/html/2607.17812#bib.bib22)] 文本转语音(TTS)系统,该系统会产生不同的说话者和西班牙语口音。在评估时,书面提示是固定的("Contesta a la pregunta en el audio",即"回答音频中的问题"),因此模型必须从语音音频中完全恢复出实际问题。选项则以文本形式保留。 ### II-E 音频时长 该基准跨越了四个数量级的时长范围,每个问题从 6.7 秒到 85 分钟不等(中位数 86.2 秒,平均值 586.5 秒;对于比较型条目,时长是两个片段的累加)。每个问题被分配到五个时长区间之一,见表 III (https://arxiv.org/html/2607.17812#S2.T3)。“长”和“超长”区间合计占基准的四分之一,使得 ESCUCHA 能够对长上下文音频理解进行压力测试。图 4 (https://arxiv.org/html/2607.17812#S2.F4) 显示了完整的时长分布。 **表 III:问题在五个时长区间中的分布。** **见标题图 4:每个问题的音频时长分布(对数刻度)。** 虚线表示中位数(86.2 秒)。 ### II-F 评估格式 ESCUCHA 包含两种评估格式。基准的大部分(900 个问题,90%)遵循 MCQA 协议,提供 2-4 个选项(848 个四选一,45 个三选一,7 个二选一),从而可以进行确定性评分。无论格式如何,每个问题都
相似文章
SEA-SpeechBench: 东南亚语音理解的大规模多任务基准测试
SEA-SpeechBench是首个大规模多任务基准测试,用于评估11种东南亚语言的语音理解,揭示了当前模型的性能差距。
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
S-DiverSe: 西班牙语多样语音
S-DiverSe 是一个3.2小时的西班牙语音语料库,来自22位患有神经系统疾病(肌萎缩侧索硬化症、帕金森病、中风)的说话者,旨在支持病理语音的ASR评估。基线实验表明,在该领域,启发式后处理优于微调。
SpeechEQ:在社交感知语音对话模型中评估情商指数的基准
SpeechEQ引入了一个用于评估语音语言模型情商的基准和数据集,涵盖2,265个对话中的15个情商子量表。实验表明,当前模型在处理副语言线索时存在困难,表现出依赖文本的捷径以及其他局限性。