多场景长篇语音生成的综合基准评测

Hugging Face Daily Papers 论文

摘要

Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。

近期语音生成技术的进步实现了高保真合成,但在长上下文条件下对模型的系统评估仍很大程度上未被探索。长篇语音的全面评估基准不可或缺,原因有二:1)现有测试场景往往局限于有限领域,与多样化的下游应用之间存在显著差距;2)现有指标忽略了连贯性和一致性等关键长文本因素,无法可靠地推广。为此,我们提出了Swanbench-Speech,一个将长篇语音质量分解为具体、解耦维度的综合基准。SwanBench-Speech具有三个关键特性。1)丰富的语音场景:聚焦长篇语音生成和对话生成,SwanBench-Speech涵盖声学、语义和表现力挑战,包含1101个样本,覆盖17种常见语音场景;2)全面的评估维度:沿声学、语义和表现力轴线,SwanBench-Speech定义了包含七个指标的自动化评估协议,以提供全面、准确、标准化的评估;3)有价值的洞察:通过大量实验,我们发现当前模型在高表现力场景中仍存在困难,并与真实录音在一致性和层次结构方面存在显著差距。
查看原文
查看缓存全文

缓存时间: 2026/06/01 07:18

论文页面 - 多场景长语音生成的综合基准测试

来源:https://huggingface.co/papers/2605.28618 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

最近,语音生成领域的进展使得高保真合成成为可能,然而,对模型在长上下文条件下的系统性评估仍然很大程度上未被探索。建立一个针对长语音的综合评估基准至关重要,原因有二:1)现有的测试场景通常局限于有限的领域,与多样化的下游应用之间存在显著差距;2)现有指标忽视了诸如一致性和连贯性等关键长文本因素,无法可靠地泛化。为此,我们提出了Swanbench-Speech,一个将长语音质量分解为具体、解耦维度的综合基准。SwanBench-Speech具有三个关键特性。1)丰富的语音场景:专注于长语音生成和对话生成,SwanBench-Speech涵盖声学、语义和表现力挑战,包含1,101个样本,跨越17个常见语音场景;2)全面的评估维度:沿着声学、语义和表现力轴线,SwanBench-Speech定义了一个包含七个指标的自动评估协议,以提供全面、准确和标准化的评估;3)有价值的见解:通过大量实验,我们发现当前模型在高表现力场景中仍然困难,并且在与真实录音相比时,在一致性和层次性方面表现出显著差距。

查看arXiv页面 (https://arxiv.org/abs/2605.28618)查看PDF (https://arxiv.org/pdf/2605.28618)项目页面 (https://swanaigc.github.io//#bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.28618)

在你的代理中获取本论文:

hf papers read 2605\.28618

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型链接本论文

在模型README.md中引用arxiv.org/abs/2605.28618以从本页面链接。

引用本论文的数据集0

没有数据集链接本论文

在数据集README.md中引用arxiv.org/abs/2605.28618以从本页面链接。

引用本论文的Spaces0

没有Space链接本论文

在Space README.md中引用arxiv.org/abs/2605.28618以从本页面链接。

包含本论文的收藏0

没有收藏包含本论文

将本论文添加到一个收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。

OpenSTBench:超越语义评估的语音翻译

Hugging Face Daily Papers

OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。

语音到语音翻译模型基准测试

arXiv cs.CL

COMPASS是一个统一的语音到语音翻译(S2ST)基准测试框架,它整合了八个维度的46个指标,并在1,248个模型-语言配置上进行了评估。该框架识别了互补的架构优势,并提出了精简的指标子集,在保持排名的同时减少了评估时间。