多场景长篇语音生成的综合基准评测
摘要
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
查看缓存全文
缓存时间: 2026/06/01 07:18
论文页面 - 多场景长语音生成的综合基准测试
来源:https://huggingface.co/papers/2605.28618 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
最近,语音生成领域的进展使得高保真合成成为可能,然而,对模型在长上下文条件下的系统性评估仍然很大程度上未被探索。建立一个针对长语音的综合评估基准至关重要,原因有二:1)现有的测试场景通常局限于有限的领域,与多样化的下游应用之间存在显著差距;2)现有指标忽视了诸如一致性和连贯性等关键长文本因素,无法可靠地泛化。为此,我们提出了Swanbench-Speech,一个将长语音质量分解为具体、解耦维度的综合基准。SwanBench-Speech具有三个关键特性。1)丰富的语音场景:专注于长语音生成和对话生成,SwanBench-Speech涵盖声学、语义和表现力挑战,包含1,101个样本,跨越17个常见语音场景;2)全面的评估维度:沿着声学、语义和表现力轴线,SwanBench-Speech定义了一个包含七个指标的自动评估协议,以提供全面、准确和标准化的评估;3)有价值的见解:通过大量实验,我们发现当前模型在高表现力场景中仍然困难,并且在与真实录音相比时,在一致性和层次性方面表现出显著差距。
查看arXiv页面 (https://arxiv.org/abs/2605.28618)查看PDF (https://arxiv.org/pdf/2605.28618)项目页面 (https://swanaigc.github.io//#bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.28618)
在你的代理中获取本论文:
hf papers read 2605\.28618
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
在模型README.md中引用arxiv.org/abs/2605.28618以从本页面链接。
引用本论文的数据集0
没有数据集链接本论文
在数据集README.md中引用arxiv.org/abs/2605.28618以从本页面链接。
引用本论文的Spaces0
没有Space链接本论文
在Space README.md中引用arxiv.org/abs/2605.28618以从本页面链接。
包含本论文的收藏0
没有收藏包含本论文
将本论文添加到一个收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
SwanVoice: 面向独白和对话的表现力长文本零样本语音合成
SwanVoice 是一种零样本文本转语音模型,专为富有表现力的长文本独白和对话合成而设计,结合了 VAE、流匹配 DiT 和扩散后训练,在丰富度和层次感得分上均优于现有基线模型。
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
OpenSTBench:超越语义评估的语音翻译
OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。
SpeechDx:临床语音AI的多任务基准
SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。
语音到语音翻译模型基准测试
COMPASS是一个统一的语音到语音翻译(S2ST)基准测试框架,它整合了八个维度的46个指标,并在1,248个模型-语言配置上进行了评估。该框架识别了互补的架构优势,并提出了精简的指标子集,在保持排名的同时减少了评估时间。