语音到语音翻译模型基准测试
摘要
COMPASS是一个统一的语音到语音翻译(S2ST)基准测试框架,它整合了八个维度的46个指标,并在1,248个模型-语言配置上进行了评估。该框架识别了互补的架构优势,并提出了精简的指标子集,在保持排名的同时减少了评估时间。
arXiv:2606.03241v1 公告类型:新
摘要:语音到语音翻译(S2ST)发展迅速,但离线评估缺乏统一协议:研究报告的指标子集互不重叠,阻碍了直接比较。我们提出COMPASS,一个统一且可复现的基准测试框架,整合了八个维度的46个指标,并在来自FLEURS和CVSS的1,248个模型-语言配置上进行了部署,涵盖级联和端到端架构,涉及十种语言对。不同架构展现出互补优势:最佳与最差之间的差距在自然性和说话人保持方面超过30%,但在翻译质量方面仅相差几个百分点,因此单一指标的排名系统性地歪曲了系统质量。相关性过滤将46个指标减少到每个方向10个,其中三个轴在X$\to$EN和EN$\to$X方向上需要不同的指标(例如,TER/UTMOS vs. ChrF++/NISQA-MOS);这些子集保留了排名(Spearman's $\rho>0.80$),同时将评估时间减少了约2.5倍。在配音、播客和医疗领域进行的人工验证表明,独立的MOS预测器无法预测听众偏好,而顶级领域特定指标与人类判断相关($\rho \geq 0.90$)。我们发布COMPASS作为领域感知S2ST评估的基础。
查看缓存全文
缓存时间: 2026/06/03 09:37
# 语音到语音翻译模型基准测试 来源:https://arxiv.org/html/2606.03241 Alkis Koudounas†\\daggerHayato Futami†\\daggerQuentin Jodelet†\\dagger Osamu Take†\\daggerShinji Watanabe‡\\ddaggerEmiru Tsunoo†\\dagger †\\dagger索尼集团公司,日本‡\\ddagger卡内基梅隆大学,美国 Alkis\.Koudounas@sony\.com ###### 摘要 语音到语音翻译(S2ST)发展迅速,但离线评估缺乏统一协议:各研究使用的指标子集互不重叠,导致无法直接比较。我们引入COMPASS,一个统一且可复现的基准测试框架,整合了涵盖八个维度的46个指标,并将其部署在来自FLEURS和CVSS的1,248个模型-语言配置上,涵盖了级联和端到端架构,涉及十种语言对。各架构展现出互补优势:最佳与最差模型在自然度和说话人保留方面的差距超过30%,但在翻译质量上仅相差几个百分点,因此单一指标排名系统性地扭曲了系统质量。相关性过滤将46个指标缩减为每个方向10个,其中三个轴线在X→\\toEN和EN→\\toX上需要不同指标(如TER/UTMOS vs. ChrF++/NISQA-MOS);这些子集在保持排名(Spearman’s ρ\>0.80\\rho\>0.80)的同时将评估时间减少约2.5倍。在配音、播客和医疗领域进行的人工验证表明,独立的MOS预测器无法预测听众偏好,而顶级领域特定指标与人工判断相关(ρ≥0.90\\rho\\geq 0.90)。我们发布COMPASS作为领域感知S2ST评估的基础。 语音到语音翻译模型基准测试 Alkis Koudounas†\\daggerHayato Futami†\\daggerQuentin Jodelet†\\daggerOsamu Take†\\daggerShinji Watanabe‡\\ddaggerEmiru Tsunoo†\\dagger†\\dagger索尼集团公司,日本‡\\ddagger卡内基梅隆大学,美国Alkis\.Koudounas@sony\.com 表1:各类S2ST用例的关联性分类(⋆⋆⋆\{\\star\\star\\star\}:关键,⋆\{\\star\}:次要,×\{\\times\}:无关)。级别反映了结构性应用约束(例如,配音的视觉同步与医疗对话的严格语义保真度)。我们选择了三个带*的领域进行人工评估,以观察与COMPASS的相关性。## 1引言 语音到语音翻译(S2ST)是通信的核心技术Lee等人(2022 (https://arxiv.org/html/2606.03241#bib.bib52));Ahmad等人(2024 (https://arxiv.org/html/2606.03241#bib.bib73));Abdulmumin等人(2025 (https://arxiv.org/html/2606.03241#bib.bib72)),驱动着从视频配音、直播到实时对话和无障碍访问等应用。最近的进展涵盖了级联管道(串联自动语音识别(ASR)、机器翻译(MT)和文本到语音合成(TTS))Bentivogli等人(2021 (https://arxiv.org/html/2606.03241#bib.bib54)),以及端到端模型Barrault等人(2023a (https://arxiv.org/html/2606.03241#bib.bib13));Xu等人(2025a (https://arxiv.org/html/2606.03241#bib.bib15),b (https://arxiv.org/html/2606.03241#bib.bib16))。然而,尽管流式和同声传译设置已取得进展Gaido等人(2025 (https://arxiv.org/html/2606.03241#bib.bib45)),离线S2ST评估仍然缺乏广泛采用的统一协议。一个稳健的系统必须确保准确的翻译、自然的语音、说话人和情感的保留以及时间对齐。由于每个维度使用各自的指标家族,研究通常报告互不重叠的子集,阻碍了跨论文比较。没有标准化的工具包能保证一致的指标计算,并且目前尚不清楚每个用例中哪些指标重要。如表1 (https://arxiv.org/html/2606.03241#S0.T1)所示,虽然翻译准确性在各个方面都很重要,但部署场景的额外优先项不同:配音需要唇形同步和等时性,播客强调说话人一致性和自然度,而医疗场景要求最严格的准确性。没有统一的指标集适用于所有用例,现有框架也未能将这些领域差异操作化,使得从业者无法选择合适的系统。 为弥补这一差距,我们引入了首个用于离线S2ST系统基准测试的**全面评估套件**(COMPASS)。COMPASS整合了涵盖8个维度的40多个指标:翻译质量(通过中间翻译文本评估以隔离翻译和合成错误,以及通过合成语音的ASR转录评估以捕获端到端输出质量)、音频自然度、说话人一致性、韵律与情感、等时性、等长性以及唇形同步。该框架是模块化的,允许用户根据用例选择指标,并通过单一工具包实现可复现。我们将COMPASS部署到迄今为止最大规模的S2ST评估实证研究中,在FLEURSConneau等人(2023 (https://arxiv.org/html/2606.03241#bib.bib34))和CVSSJia等人(2022b (https://arxiv.org/html/2606.03241#bib.bib40))上对级联和端到端架构进行了1,248个模型-语言配置、十种语言和两个方向(EN↔\\leftrightarrowX)的基准测试。我们的分析显示没有架构占主导地位:最佳与最差模型在自然度和说话人保留方面的差距超过30%,但在翻译质量上仅相差几个百分点,这使得单一指标排名具有误导性。许多广泛使用的指标也高度相关;通过基于相关性的过滤,我们识别出保持判别力的紧凑子集,其中X→\\toEN和EN→\\toX在三个轴线上需要不同的指标(文本质量:TER vs. ChrF++;自然度:UTMOS vs. NISQA-MOS;说话人/韵律:说话人相似度 vs. 能量轮廓),这是由于源语言变异性与目标语言合成的非对称瓶颈。最后,在配音、播客和医疗背景下进行的人工评估表明,独立的MOS预测器可能与情感保真度**负相关**,而顶级领域特定指标与人工判断强相关(Spearman’s ρ≥\\rho\\geq0.90),且COMPASS排名在多个领域与人类偏好排名一致。 **贡献**。我们的主要贡献是:(i) 我们引入COMPASS,首个用于离线S2ST评估的统一、模块化框架,整合了跨8个轴线的40多个指标;(ii) 我们进行了一项大规模评估研究,涵盖了FLEURS和CVSS上的1,248个模型-语言配置;(iii) 我们通过相关性过滤识别出紧凑的、数据驱动的指标子集,将46个指标减少为每个方向10个(其中3个轴线在X→\\toEN和EN→\\toX上不同),在保持排名(Spearman’s ρ\>\\rho\>0.80)的同时将评估时间减少约2.5倍;(iv) 我们进行了一项人工评估,证明自动指标必须具有领域感知性;(v) 我们发布了COMPASS工具包,以支持公平、可复现且具备领域感知的S2ST评估。 ## 2相关工作 **S2ST模型**。早期的S2ST系统通过级联管道将ASR、MT和TTS串联起来Lavie等人(1997 (https://arxiv.org/html/2606.03241#bib.bib8));Nakamura等人(2006 (https://arxiv.org/html/2606.03241#bib.bib9))。现代的端到端模型Jia等人(2019 (https://arxiv.org/html/2606.03241#bib.bib10),2022a (https://arxiv.org/html/2606.03241#bib.bib11));Nachmani等人(2024 (https://arxiv.org/html/2606.03241#bib.bib12))以及大型多语言系统(如SeamlessM4TBarrault等人(2023a (https://arxiv.org/html/2606.03241#bib.bib13),b (https://arxiv.org/html/2606.03241#bib.bib14))和Qwen-Omni系列Xu等人(2025a (https://arxiv.org/html/2606.03241#bib.bib15),b (https://arxiv.org/html/2606.03241#bib.bib16))如今将语音和文本翻译统一在单一架构中。级联系统通过结合WhisperRadford等人(2023 (https://arxiv.org/html/2606.03241#bib.bib17))、NLLBCosta-Jussà等人(2022 (https://arxiv.org/html/2606.03241#bib.bib18))、GemmaKamat等人(2025 (https://arxiv.org/html/2606.03241#bib.bib19))和CosyVoiceDu等人(2025 (https://arxiv.org/html/2606.03241#bib.bib21))等专用模型,仍然具有竞争力。COMPASS在统一协议下评估这两种范式。 **S2ST评估指标**。S2ST评估借鉴了相邻领域,通常选择最成熟或与人工判断相关性最高的指标。翻译质量通过BLEUPapineni等人(2002 (https://arxiv.org/html/2606.03241#bib.bib22))和ChrF++Popović(2017 (https://arxiv.org/html/2606.03241#bib.bib61))以及COMETRei等人(2020 (https://arxiv.org/html/2606.03241#bib.bib24))和BLASERChen等人(2023 (https://arxiv.org/html/2606.03241#bib.bib25))等学习指标进行评估。音频自然度通常使用UTMOSaeki等人(2022 (https://arxiv.org/html/2606.03241#bib.bib26))和NISQAMittag等人(2021 (https://arxiv.org/html/2606.03241#bib.bib27))(VoiceMOS挑战赛的顶级参赛者)来测量,尽管存在替代方案Cooper等人(2022 (https://arxiv.org/html/2606.03241#bib.bib57))。说话人保留通常使用ECAPA-TDNNDesplanques等人(2020 (https://arxiv.org/html/2606.03241#bib.bib29))或WavLMChen等人(2022 (https://arxiv.org/html/2606.03241#bib.bib28))的嵌入相似度,而韵律和情感一致性则依赖于AutoPCPBarrault等人(2023b (https://arxiv.org/html/2606.03241#bib.bib14))和情感识别模型Ma等人(2024 (https://arxiv.org/html/2606.03241#bib.bib30))。时序方面(等时性、等长性)主要在配音领域得到研究Lakew等人(2022 (https://arxiv.org/html/2606.03241#bib.bib31));Effendi等人(2022 (https://arxiv.org/html/2606.03241#bib.bib33));Chronopoulou等人(2023 (https://arxiv.org/html/2606.03241#bib.bib32))。 **走向统一评估**。相邻领域已趋向于共享评估协议,并有FLEURSConneau等人(2023 (https://arxiv.org/html/2606.03241#bib.bib34))和CVSSJia等人(2022b (https://arxiv.org/html/2606.03241#bib.bib40))等标准语料库以及MELD-STChen等人(2024 (https://arxiv.org/html/2606.03241#bib.bib43))和MultiMed-STLe-Duc等人(2025 (https://arxiv.org/html/2606.03241#bib.bib44))等特定领域集的支持。文本翻译依赖标准化指标套件(BLEU, chrF, COMET),尽管存在对人工相关性的持续担忧Mathur等人(2020 (https://arxiv.org/html/2606.03241#bib.bib48));Freitag等人(2021 (https://arxiv.org/html/2606.03241#bib.bib47))。语音到文本翻译(S2TT)也遵循了类似趋势:最近的IWSLT离线赛道采用了共享集合(COMET, BLEU, chrF, TER),自2024年以来COMET成为主要排名指标Ahmad等人(2024 (https://arxiv.org/html/2606.03241#bib.bib73));Abdulmumin等人(2025 (https://arxiv.org/html/2606.03241#bib.bib72)),而同声S2TT则围绕统一的流式工具包达成了一致Gaido等人(2025 (https://arxiv.org/html/2606.03241#bib.bib45))。离线S2ST缺乏类似的协议:最先进的模型在异构的、论文特定的轴线上报告性能;例如,SeamlessM4T评估ASR-BLEU、BLASER和AutoPCPBarrault等人(2023a (https://arxiv.org/html/2606.03241#bib.bib13)),TransVIP增加了基于持续时间的指标Le等人(2024 (https://arxiv.org/html/2606.03241#bib.bib68)),其他系统则混合或省略了感知和时序维度Cheng等人(2025 (https://arxiv.org/html/2606.03241#bib.bib50));Hu等人(2025 (https://arxiv.org/html/2606.03241#bib.bib42)),此外指标实现也存在不一致(例如,ASR-BLEU的ASR后端)。COMPASS通过将46个指标统一到单个工具包中来填补这一空白。 ## 3 COMPASS-S2ST框架 COMPASS结合了结构化评估分类法、统一指标目录以及数据驱动的过滤管道,以选择紧凑的指标子集。 ### 3.1 设计目标 COMPASS针对4个核心原则:(i)**多维度性**:捕获不同的质量轴线,因为单一指标无法适用于所有应用;(ii)**模块化**:使用自包含组件,使用户能够根据其用例自定义或扩展特定指标;(iii)**可复现性**:提供包含固定检查点和确定性配置的单一工具包;(iv)**领域感知性**:启用由人工判断验证的特定领域指标子集。 ### 3.2 S2ST评估的先验分类法 我们将S2ST评估组织为八个轴线,映射到实际应用需求(表1 (https://arxiv.org/html/2606.03241#S0.T1))。这些涵盖了核心交际需求(翻译、自然度)以及专门的上下文驱动约束(例如,配音的时序与有声书的韵律丰富度)。 1. 1.**翻译质量(文本)**:文本级别的翻译充分性和流利度,在文本输出上测量。²²对于端到端系统,我们使用与合成语音一起产生的中间文本;对于级联系统,我们使用输入到TTS模块的MT文本。这确保了基于文本的指标在两者之间得到一致应用。 2. 2.**翻译质量(ASR)**:在合成音频的ASR转录上测量的翻译质量,以及基于音频的度量,例如BLASER和音素级别准确率。 3. 3.**音频自然度**:合成语音的感知质量。 4. 4.**说话人一致性**:源说话人身份的保留。 5. 5.**韵律与情感**:音高、能量、节奏、发音和情感一致性。 6. 6.**等时性**:源语音和目标语音之间的时间对齐。 7. 7.**等长性**:源和目标之间的长度压缩以及字符或单词比率。 8. 8.**唇形同步**:通过视素匹配实现的源和目标语音之间的视觉-声学对齐。 这些轴线整合了近期S2ST系统和综述所采用的评估维度Barrault等人(2023a (https://arxiv.org/html/2606.03241#bib.bib13),b (https://arxiv.org/html/2606.03241#bib.bib14));Le等人(2024 (https://arxiv.org/html/2606.03241#bib.bib68));Brannon等人(2023 (https://arxiv.org/html/2606.03241#bib.bib67)),共同涵盖了翻译、感知、身份、韵律和时序方面。实证上,我们的数据将这些维度压缩为六个非冗余的维度(第5节 (https://arxiv.org/html/2606.03241#S5))。然而,原始的八个维度仍然是不同的,因为这种压缩反映了**当前可用的**系统配置文件,而非概念轴线的冗余。 参见说明 图1:COMPASS指标的数据驱动过滤管道。 ### 3.3 指标目录 COMPASS整合了来自已建立的ASR、MT、TTS和S2TT评估的46个指标。翻译质量通过BLEUPapineni等人(2002 (https://arxiv.org/html/2606.03241#bib.bib22))、ChrF/ChrF++Popović(2015 (https://arxiv.org/html/2606.03241#bib.bib60),2017 (https://arxiv.org/html/2606.03241#bib.bib61))、TERSnover等人(2006 (https://arxiv.org/html/2606.03241#bib.bib23))、COMET-DA和COMET-KiwiRei等人(2022 (https://arxiv.org/html/2606.03241#bib.bib62))以及语义得分Phukon等人(2025 (https://arxiv.org/html/2606.03241#bib.bib63))在翻译文本和ASR转录上测量。语音翻译质量也通过BLASERChen等人(2023 (https://arxiv.org/html/2606.03241#bib.bib25))评估,而WER衡量可理解性。音频自然度使用UTMOSaeki等人(2022 (https://arxiv.org/html/2606.03241#bib.bib26))和NISQA-MOSMittag等人(2021 (https://arxiv.org/html/2606.03241#bib.bib27))——VoiceMOS顶级预测器和事实上的S2ST标准Le等人(2024 (https://arxiv.org/html/2606.03241#bib.bib68));Cheng等人(2025 (https://arxiv.org/html/2606.03241#bib.bib50))。说话人一致性通过说话人嵌入余弦相似度Ch进行追踪。相似文章
OpenSTBench:超越语义评估的语音翻译
OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。
OpenCompass:大语言模型通用评测平台
OpenCompass是一个一站式、可扩展、高并发的大语言模型评测平台,支持多种基准测试和模块化设计,旨在统一和标准化LLM评估。
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
文本转语音(TTS)基准测试更新:引入客观标准和盲投票(已涵盖46个模型,持续增加中)
更新后的TTS基准测试引入了客观标准和实时盲投票机制,为46+模型创建ELO排名,并向社区开放参与。