SpeechEditBench:面向指令引导语音编辑的双语多属性基准
摘要
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
相似文章
SEA-SpeechBench: 东南亚语音理解的大规模多任务基准测试
SEA-SpeechBench是首个大规模多任务基准测试,用于评估11种东南亚语言的语音理解,揭示了当前模型的性能差距。
OpenSTBench:超越语义评估的语音翻译
OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。
Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.