S³-Bench: 评估语音交互模型作为科学语音助手
摘要
本文介绍了S³-Bench,一个系统化的评估框架,用于评估语音交互模型作为科学语音助手,涵盖10个主要学科,并分析科学交互中的性能权衡。
查看缓存全文
缓存时间: 2026/09/10 08:16
# $S^3$-Bench:评估语音交互模型作为科学语音助手的能力 来源:https://arxiv.org/abs/2609.09852 作者:Heyang Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+H), Jiayi Huang (https://arxiv.org/search/cs?searchtype=author&query=Huang,+J), Wenyang Xiao (https://arxiv.org/search/cs?searchtype=author&query=Xiao,+W), Ziyang Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+Z), Lixin Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L), Zhen Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Z), Miao He (https://arxiv.org/search/cs?searchtype=author&query=He,+M), Ronghua Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+R), Qunshan Gu (https://arxiv.org/search/cs?searchtype=author&query=Gu,+Q), Yanfeng Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), Yu Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y) 查看 PDF (https://arxiv.org/pdf/2609.09852) > 摘要:多模态大语言模型(MLLMs)的发展从根本上重塑了人机交互的范式,尤其是能够进行无缝对话的语音交互模型。尽管作为通用语音助手表现出色,但它们在专业领域的性能,特别是在科学领域,仍有待深入探索。科学交互带来了严峻挑战,涉及罕见的技术术语、缩写的口语化规范以及符号特殊表达的自然语音化表达。在本文中,我们推出了 S$^3$-Bench,这是一个涵盖10个主要学科的系统化评估框架,包括用于语音问答的知识集,以及与模拟用户代理进行多轮渐进式交互的对话集。通过将一个完整的原子轮次分解为语音识别、感知、知识利用与推理以及响应发音等阶段,我们系统性地刻画了现有方法的常见挑战和性能权衡。此外,关于多轮交互的实验揭示了其在用户适应性以及生成准确、全面且高效的响应方面仍然存在持续性的局限。 ## 提交历史 来自:Heyang Liu [查看邮件 (https://arxiv.org/show-email/c6b38463/2609.09852)] **[v1]** 星期三,2026年9月9日 08:06:28 UTC (16,768 KB)
相似文章
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。
Conv-to-Bench: 通过用户-助手对话评估语言模型在代码任务中的表现
Conv-to-Bench 是一个多阶段框架,能够自动将多轮用户-助手对话转化为结构化的、可验证的需求清单,用于评估大型语言模型在代码任务上的表现,以较低的计算成本实现了与人工编写的基准近乎完美的对齐。
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
OpenSTBench:超越语义评估的语音翻译
OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。