SEA-SpeechBench: 东南亚语音理解的大规模多任务基准测试
摘要
SEA-SpeechBench是首个大规模多任务基准测试,用于评估11种东南亚语言的语音理解,揭示了当前模型的性能差距。
arXiv:2609.09672v1 公告类型:新
摘要:音频和多模态大语言模型的快速发展解锁了变革性的语音理解能力,但评估框架仍以英语为中心,导致东南亚语言严重缺乏代表性。我们推出SEA-SpeechBench,据我们所知,这是首个大规模多任务基准测试,通过97,194个样本、99个评估集和597小时的精选音频数据,评估11种东南亚语言的语音理解。我们的基准测试包含3个类别中的9项多样任务:语音处理(自动语音识别、语音翻译、口语问答)、副语言分析(情感、性别、年龄、说话人识别)和时间理解,这是一个新维度,具有时间戳内容查询和在长达3分钟的扩展音频序列中的时间定位。我们采用多语言提示,使用东南亚原生语言和英语,以反映用户与音频语言模型的交互。对领先开源和专有系统的评估揭示了显著的性能差距。在所有模型中,时间理解、情感识别和语音翻译的性能仍然不尽如人意。在低资源语言如缅甸语和泰米尔语中的提示比英语落后高达41个百分点。我们的发现暴露了关键模型限制,并强调了包容性模型开发的必要性。SEA-SpeechBench基准测试可在https://zwenyu.github.io/SEA-SpeechBench/获取。
查看缓存全文
缓存时间: 2026/09/10 08:12
# SEA-SpeechBench:覆盖东南亚的大规模多任务语音理解基准测试 来源:https://arxiv.org/html/2609.09672 Jingyi Liao††thanks:Equal contribution\.Affiliation:Institute of Advanced Intelligence and Computing, A*STARAffiliation:Nanyang Technological UniversityCorrespondence:[liao\_jingyi@a\-star\.edu\.sg](mailto:[email protected]),[wen\.projectz@gmail\.com](mailto:[email protected]) Wenyu Zhang11footnotemark:1††thanks:Work done at Institute for Infocomm Research \(now Institute of Advanced Intelligence and Computing\), A*STAR\. Zhuohan LiuAffiliation:Institute of Advanced Intelligence and Computing, A*STAR Yingxu HeAffiliation:Institute of Advanced Intelligence and Computing, A*STAR Geyu LinAffiliation:Institute of Advanced Intelligence and Computing, A*STAR Xunlong ZouAffiliation:Institute of Advanced Intelligence and Computing, A*STAR Shuo SunAffiliation:Institute of Advanced Intelligence and Computing, A*STAR Syed Ali Redha Alsagoff22footnotemark:2Affiliation:Nanyang Technological UniversityCorrespondence:[liao\_jingyi@a\-star\.edu\.sg](mailto:[email protected]),[wen\.projectz@gmail\.com](mailto:[email protected]) Ai Ti AwAffiliation:Institute of Advanced Intelligence and Computing, A*STAR ###### 摘要 音频与多模态大语言模型的快速发展带来了革命性的语音理解能力,但现有评估框架仍以英语为主导,导致东南亚语言在其中严重缺乏代表性。我们提出 **SEA-SpeechBench**,据我们所知,这是首个大规模多任务基准测试,通过 97,194 个样本、99 个评估集和 597 小时精选音频数据,评估 11 种东南亚语言的语音理解能力。该基准涵盖 3 大类别共 9 项多样化任务:语音处理(自动语音识别、语音翻译、语音问答)、副语言分析(情感、性别、年龄、说话人识别)以及时间理解——这是一项新维度,包括带时间戳的内容查询和在最长 3 分钟的扩展音频序列中进行时间定位。我们采用东南亚本地语言和英语进行多语言提示,以模拟用户与音频-语言模型的交互。对领先开源和闭源系统的评估显示,各模型性能存在显著差距。所有模型在时间理解、情感识别和语音翻译任务上表现仍不尽人意。在缅甸语、泰米尔语等低资源语言上的提示性能落后英语最多达 41 个百分点。研究结果揭示了当前模型的关键局限性,并强调了包容性模型开发的必要性。**SEA-SpeechBench** 基准测试可在 zwenyu\.github\.io/SEA\-SpeechBench (https://zwenyu.github.io/SEA-SpeechBench/) 获取。 ## 1 引言 参见图注 图 1:SEA\-SpeechBench 任务套件概览。该套件涵盖三大类别的九项任务:语音处理、副语言分析和时间推理。 音频大语言模型(AudioLLMs)的最新进展催生了语音助手、转录、无障碍技术和多模态推理等变革性应用(Wu et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib6); Gemini Team, 2025 (https://arxiv.org/html/2609.09672#bib.bib23); Zhang et al., 2023 (https://arxiv.org/html/2609.09672#bib.bib4))。尽管取得了这些进展,语音理解的研究仍过度集中于高资源语言,特别是英语及少数欧洲和东亚语言(Yang et al., 2021 (https://arxiv.org/html/2609.09672#bib.bib51); Wang et al., 2021 (https://arxiv.org/html/2609.09672#bib.bib50); Bu et al., 2017 (https://arxiv.org/html/2609.09672#bib.bib52))。虽然近期基准测试工作(Sakshi et al., 2025 (https://arxiv.org/html/2609.09672#bib.bib13); Wang et al., 2025 (https://arxiv.org/html/2609.09672#bib.bib11); Yang et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib12))在评估跨多样任务和模态的音频-语言模型方面取得了显著进展,但它们普遍忽视了东南亚语言,使得拥有超过 **6.5 亿使用者** 的整个语言区域未被充分探索。为东南亚语言开发全面基准也面临独特的技术挑战。该地区的语音景观特点是非凡的语言多样性、丰富的声调和语音结构,以及语言间显著的资源差距:这些因素带来了以英语为中心的基准测试中不存在的评估复杂性。许多东南亚语言在低资源环境下运行,标注数据有限且数字表征稀疏,使得稳健的评估既具有方法学挑战性,又对技术公平发展至关重要。虽然近期举措如针对新加坡多语言环境的 MERaLiON(MERaLiON Team, 2024 (https://arxiv.org/html/2609.09672#bib.bib15))、专注于泰语的 Typhoon2\-Audio(Pipatanakul et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib49))以及将能力扩展至部分东南亚语言的 SeaLLMs\-Audio(Liu et al., 2025 (https://arxiv.org/html/2609.09672#bib.bib16))已开始为东南亚地区构建通用语音-语言模型,但这些努力在范围和语言覆盖上仍有限。关键是,它们缺乏系统评估全范围东南亚语音理解任务能力所需的综合评估框架。同时,各研究团队分散的数据收集工作产生了异构的东南亚数据集(Lovenia et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib32); Pham et al., 2023 (https://arxiv.org/html/2609.09672#bib.bib38); Bustamin et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib40); Magic Data Technology, 2025 (https://arxiv.org/html/2609.09672#bib.bib39)),但由于缺乏统一的任务定义、提示和规范化框架,标准化比较仍然困难。 在本工作中,据我们所知,我们推出了首个针对东南亚语言语音理解的全面基准测试,旨在评估通用语音-文本大语言模型的能力。我们聚焦东南亚国家的官方语言,如表 1 (https://arxiv.org/html/2609.09672#S1.T1) 所示,以平衡广泛的地区覆盖和实际相关性。 | 国家 | 官方语言 | ISO 639-1 代码 | | :--- | :--- | :--- | | 新加坡 | 英语、马来语、华语、泰米尔语 | en, ms, zh, ta | | 马来西亚 | 马来语 (Bahasa Melayu) | ms | | 印度尼西亚 | 印尼语 (Bahasa Indonesia) | id | | 菲律宾 | 菲律宾语/塔加洛语、英语 | tl, en | | 泰国 | 泰语 | th | | 柬埔寨 | 高棉语 (柬埔寨语) | km | | 老挝 | 老挝语 | lo | | 缅甸 | 缅甸语 (缅甸语) | my | | 越南 | 越南语 | vi | 表 1:东南亚国家及其官方语言。注:若干国家在次国家层面承认其他区域或少数民族语言;此表列出与我们基准中使用的语言代码相对应的国家级官方语言。 我们的基准涵盖 11 种东南亚语言,包含超过 597 小时的音频数据,这些数据从现有来源策划,并通过系统处理合成为新任务和数据集。该基准涵盖 3 大类共 9 项多样化任务:语音处理、副语言分析和时间推理。我们引入了两项评估模型在音频流中时间推理和定位能力的任务,解决了音频大语言模型评估中先前未探索的维度。这些任务测试模型导航时间相关信息和从特定时间位置提取内容的能力。完整的任务套件如图 1 (https://arxiv.org/html/2609.09672#S1.F1) 所示。 为更好反映真实使用场景,我们使用英语和母语文本提示评估每项任务。 本文的主要贡献有三方面。 第一,我们呈现 **SEA-SpeechBench**,据我们所知,这是首个大规模多任务基准测试,系统性地评估东南亚语言的语音处理、副语言分析和时间推理能力。它共包含 99 个评估集,超过 97,000 个音频样本。 第二,我们引入时间推理任务,评估模型在扩展音频序列中推理时间相关信息的能力。 第三,我们全面评估了开源和闭源模型,为其优势、局限性以及未来研究方向提供了关键见解。 ## 2 SEA\-SpeechBench 评估套件 ### 2\.1 任务套件 SEA\-SpeechBench 包含 3 大类别共 9 项核心任务:语音处理、副语言分析和时间推理。所有任务均要求模型在给定音频输入和文本查询的情况下生成文本响应。 | 任务 | 语言 | #数据集 | #样本 | 总时长 (h) | 最小长度 (s) | 最大长度 (s) | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | ASR | en, id, km, lo, ms, my, ta, vi, zh, th | 33 | 26,863 | 52.88 | 0.47 | 30.00 | | ST | en, id, km, lo, ms, my, vi, th | 9 | 7,189 | 26.46 | 3.06 | 30.00 | | SQA | en, zh, th, id, vi | 7 | 5,462 | 40.57 | 20.00 | 30.00 | | ER | zh, th, id, en, ta | 7 | 5,356 | 5.33 | 0.12 | 29.86 | | GR | zh, th, id, en, ta, vi, km, my | 16 | 13,599 | 22.02 | 0.12 | 29.90 | | AgeR | zh, th, en, ta, vi | 5 | 4,608 | 6.55 | 0.58 | 20.78 | | SpkR | zh, th, en, ta, vi, my | 8 | 7,827 | 19.72 | 2.10 | 30.38 | | TCQ | zh, en, th, id, vi | 7 | 13,145 | 211.98 | 20.00 | 180.00 | | TLoc | zh, en, th, id, vi | 7 | 13,145 | 211.98 | 20.00 | 180.00 | | **总计** | – | **99** | **97,194** | **597.49** | – | – | 表 2:SEA\-SpeechBench 策划数据集摘要。对于多语言数据集,每个语言特定子数据集在 \#数据集 中单独计数。\* **语音处理**涵盖三项基本能力:自动语音识别(ASR)、从东南亚语言到英语的语音翻译(ST),以及基于东南亚语音输入的语音问答(SQA)。 **副语言分析**研究超越语言内容的声音线索。它包括四项任务:情感识别(ER),将每个语句分类为闭集九类情感(中性、快乐、愤怒、悲伤、惊讶、厌恶、恐惧、沮丧、失望);性别识别(GR),根据声音特征预测性别;年龄识别(AgeR),将说话人分类为青少年(10–19岁)、成人(20–59岁)或老年人(60–100岁);以及说话人识别(SpkR),判断两个片段是否来自同一说话人。 **时间推理**将音频视为可搜索的时间空间,模拟用户如何通过“这个时间说了什么”和“何时提到这个”等查询与长篇录音交互。我们引入两项互补任务来探查时间-内容映射的双向性。**带时间戳的内容查询(TCQ)**测试从时间到内容的方向:给定一个区间 \[t_{s}, t_{e}\],模型提取该窗口内的语音内容,评估局部检索。**时间定位(TLoc)**测试从内容到时间的方向:给定一个文本查询,模型预测其出现的精确时间段 \(\hat{y}=[\hat{t}_{s}, \hat{t}_{e}]\),评估边界检测和时间定位。 前两个类别使用短片段(不超过 30 秒)以适应大多数当前模型的输入限制。随着真实世界音频应用越来越多地涉及需要时间导航的长篇录音,SEA\-SpeechBench 引入了时间推理任务,以评估模型在最长 3 分钟的扩展序列上进行推理和定位的能力。 ### 2\.2 数据策划与处理 ##### 来源选择与标注使用 SEA\-SpeechBench 从公共和社区语音语料库中策划,来源包含是针对特定任务的,如表 3 (https://arxiv.org/html/2609.09672#S2.T3) 所示。对于 ASR 和 ST,我们保留那些在短片段条件下具有可靠的逐话语转录或翻译参考的来源。长形式的 YouTube 来源语料库 Li et al. (2023) (https://arxiv.org/html/2609.09672#bib.bib43) 因此仅用于 SQA、TCQ 和 TLoc 的构建,在这些任务中过滤后的转录片段足以满足需求,但排除在需要黄金逐话语参考的 ASR 评估之外。对于 AgeR、GR、ER 和 SpkR,我们仅使用来源提供的元数据,如年龄、性别、情感和说话人身份,而不事后推断缺失属性。说话人标签还额外用于强制执行说话人不相交划分并构建相同/不同说话人对。对于 SQA、TCQ 和 TLoc,我们需要转录元数据,对于时间任务,还需要时间戳或对齐信息。完整的来源-语言-任务映射、数据集详情、元数据可用性和许可证在附录 A (https://arxiv.org/html/2609.09672#A1) 中报告。 | 任务 | 来源数据集 | 纳入任务所需的标注 | | :--- | :--- | :--- | | ASR / ST | FLEURS (Conneau et al., 2022 (https://arxiv.org/html/2609.09672#bib.bib27)), Commonvoice (Ardila et al., 2020 (https://arxiv.org/html/2609.09672#bib.bib26)), OpenSLR (Sodimana et al., 2018 (https://arxiv.org/html/2609.09672#bib.bib28); He et al., 2020 (https://arxiv.org/html/2609.09672#bib.bib29); Oo et al., 2020 (https://arxiv.org/html/2609.09672#bib.bib30)), Bloom\-Speech (Leong et al., 2022 (https://arxiv.org/html/2609.09672#bib.bib31)), Thai Elderly Speech (VISAI AI Company Limited and Data Wow Company Limited, 2022 (https://arxiv.org/html/2609.09672#bib.bib56)), THAI SER (Wongpithayadisai et al., 2025 (https://arxiv.org/html/2609.09672#bib.bib55)), ASR\-SMalDuSC (Magic Data Technology, 2023b (https://arxiv.org/html/2609.09672#bib.bib57)), VietMed (Le\-Duc, 2024 (https://arxiv.org/html/2609.09672#bib.bib35)), Bud500 (Pham et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib37)), LOTUS (Chotimongkol et al., 2009 (https://arxiv.org/html/2609.09672#bib.bib33)), SG Streets (Khassanov et al., 2019 (https://arxiv.org/html/2609.09672#bib.bib34)), ASR\-SgpCCSC (Magic Data Technology (), ASR\-MALCSC (Magic Data Technology, 2025 (https://arxiv.org/html/2609.09672#bib.bib39)), MIG (Myanmar Innovative Group (2025) (https://arxiv.org/html/2609.09672#bib.bib48)), ESD (Zhou et al., 2022 (https://arxiv.org/html/2609.09672#bib.bib44)) | 逐话语转录或段级翻译;不超过 30 秒的短片段。 | | AgeR / GR / ER | FLEURS, Commonvoice, OpenSLR, M3ED (Zhao et al., 2022 (https://arxiv.org/html/2609.09672#bib.bib45)), EmoTa (Thevakumar et al., 2025 (https://arxiv.org/html/2609.09672#bib.bib41)), Thai Elderly Speech, THAI SER, ASR\-SMalDuSC, SG Streets, ESD, TEC (Thanushs25 (2024) (https://arxiv.org/html/2609.09672#bib.bib47)), SFDUSC (Magic Data Technology, 2023a (https://arxiv.org/html/2609.09672#bib.bib42)), Vietnam\-Celeb (Pham et al., 2023 (https://arxiv.org/html/2609.09672#bib.bib38)), IndoWaveSentiment (Bustamin et al., 2024 (https://arxiv.org/html/2609.09672#bib.bib40)) | 年龄、性别或情感标签;不超过 30 秒的短片段。 | | SpkR | ESD, EmoTa | 说话人身份标签;不超过 30 秒的短片段。 |
相似文章
SEATauBench: 将工具-智能体-用户评估适配到低资源东南亚语言
介绍了SEATauBench,这是首个面向东南亚语言的智能体评估框架,将τ²-Bench适配到中文、越南语、泰语、印尼语和菲律宾语,并揭示了从英语迁移到本地化设置时存在显著的能力差距。
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
SEA-Embedding:面向东南亚的开放可复现文本嵌入
SEA-Embedding 提出了一个完全开放且可复现的东南亚语言文本嵌入流水线,仅使用公开数据训练,在 SEA-BED 基准测试上取得了最先进的结果。
KoALa-Bench:评估大型音频语言模型在韩语语音理解与忠实度上的表现
KoALa-Bench 推出了一套聚焦韩语的基准测试,从六个维度评估大型音频语言模型,包括全新的语音忠实度指标与韩国本土文化内容。