S³-Bench: 评估语音交互模型作为科学语音助手

arXiv cs.CL 论文

摘要

本文介绍了S³-Bench,一个系统化的评估框架,用于评估语音交互模型作为科学语音助手,涵盖10个主要学科,并分析科学交互中的性能权衡。

arXiv:2609.09852v1 Announce Type: new 摘要:多模态大型语言模型(MLLMs)的进展从根本上重塑了人机交互的范式,特别是能够进行无缝对话的语音交互模型。尽管作为通用语音助手表现出色,但它们在专业领域的表现仍未得到充分探索,特别是在科学领域。科学交互带来了严峻的挑战,涉及罕见的技术术语、缩写的口头规范,以及符号特殊表达的自然口语化。在本文中,我们介绍了S³-Bench,一个涵盖10个主要学科的系统化评估框架,包括用于语音问答的知识集和用于与模拟用户代理进行多轮渐进交互的对话集。通过将完整的原子轮分解为语音识别、感知、知识利用与推理和响应发音等阶段,我们系统地描述了现有方法的共同挑战和性能权衡。此外,对多轮交互的实验揭示了用户适应性和生成准确、全面和高效响应方面的持续局限性。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:16

# $S^3$-Bench:评估语音交互模型作为科学语音助手的能力
来源:https://arxiv.org/abs/2609.09852
作者:Heyang Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+H), Jiayi Huang (https://arxiv.org/search/cs?searchtype=author&query=Huang,+J), Wenyang Xiao (https://arxiv.org/search/cs?searchtype=author&query=Xiao,+W), Ziyang Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+Z), Lixin Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L), Zhen Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Z), Miao He (https://arxiv.org/search/cs?searchtype=author&query=He,+M), Ronghua Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+R), Qunshan Gu (https://arxiv.org/search/cs?searchtype=author&query=Gu,+Q), Yanfeng Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), Yu Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y)

查看 PDF (https://arxiv.org/pdf/2609.09852)

> 摘要:多模态大语言模型(MLLMs)的发展从根本上重塑了人机交互的范式,尤其是能够进行无缝对话的语音交互模型。尽管作为通用语音助手表现出色,但它们在专业领域的性能,特别是在科学领域,仍有待深入探索。科学交互带来了严峻挑战,涉及罕见的技术术语、缩写的口语化规范以及符号特殊表达的自然语音化表达。在本文中,我们推出了 S$^3$-Bench,这是一个涵盖10个主要学科的系统化评估框架,包括用于语音问答的知识集,以及与模拟用户代理进行多轮渐进式交互的对话集。通过将一个完整的原子轮次分解为语音识别、感知、知识利用与推理以及响应发音等阶段,我们系统性地刻画了现有方法的常见挑战和性能权衡。此外,关于多轮交互的实验揭示了其在用户适应性以及生成准确、全面且高效的响应方面仍然存在持续性的局限。

## 提交历史

来自:Heyang Liu [查看邮件 (https://arxiv.org/show-email/c6b38463/2609.09852)] **[v1]** 星期三,2026年9月9日 08:06:28 UTC (16,768 KB)

相似文章

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。

EVA-Bench:评估语音代理的新型端到端框架

Hugging Face Daily Papers

EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。

OpenSTBench:超越语义评估的语音翻译

Hugging Face Daily Papers

OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。