MTR-DuplexBench:全双工语音语言模型多轮对话的综合评估基准
摘要
MTR-DuplexBench为全双工语音语言模型在多轮对话中的评估引入了一个综合基准,解决轮转边界模糊和上下文不一致等挑战,同时评估对话特征、对话质量、指令遵循和安全性。
查看缓存全文
缓存时间: 2026/04/20 08:31
# MTR-DuplexBench:全双工语音语言模型多轮对话全面评估基准
来源:https://arxiv.org/html/2511.10262
He Zhang1,Wenqian Cui211脚注1,Haoning Xu2,Xiao-Hui Li3,Lei Zhu3, Haoli Bai3,Shaohua Ma122脚注2,Irwin King2
1清华大学,2香港中文大学,3华为技术
###### 摘要
全双工语音语言模型(FD-SLM)能够实现实时、重叠的对话交互,相比传统半双工模型提供了更动态的用户体验。然而,现有基准主要关注单轮交互评估,忽视了多轮通信的复杂性。在多轮设置中评估FD-SLM面临重大挑战,包括通信中的轮次边界模糊和模型推理期间的上下文不一致。此外,现有基准通常仅关注对话特征评估,忽视了其他关键方面。为了解决这些问题,我们引入了MTR-DuplexBench,一个专为FD-SLM全面多轮评估设计的新型基准。MTR-DuplexBench不仅将连续全双工对话分割成离散轮次进行逐轮评估,还包含多种评估维度,包括对话特征、对话质量、指令跟随和安全性。实验结果表明,当前FD-SLM在保持多轮和多评估维度间性能一致性方面面临困难,突出了我们基准的必要性和有效性。111代码和数据可在https://github.com/ZhangHe0918/MTR-DuplexBench获取
## 1 引言

语音语言模型(SLM)是旨在通过语音实现与用户无缝端到端交互的基础模型(Cui等人,2024)。这些模型擅长理解用户语音的多个方面,包括含义、韵律、语音特征,并能生成适当的响应。大多数SLM支持**半双工通信**(HD-SLM),其中模型首先"听取"完整的用户查询,然后"说出"相应的响应。一类更高级的SLM被称为**全双工语音语言模型**(FD-SLM),专门用于启用全双工通信。该功能使模型能够在实时交互中同时听取和说话,促进了中断和反馈确认等复杂对话特征,从而创造了更加动态和吸引人的用户体验。
在评估FD-SLM时,现有基准主要评估模型在单轮交互中的能力。例如,Full-Duplex-Bench(Lin等人,2025c)生成用户在一轮中持续说话、中途暂停或打断助手的场景。Full-Duplex-Bench v1.5(Lin等人,2025b)在此基础上引入了带有重叠中断、反馈确认和类似动态的语音输入。然而,现实世界的对话通常以**多轮格式**展开,在这种设置中评估FD-SLM对于确保模型在多轮通信后持续提供及时、高质量的语音至关重要。
FD-SLM的多轮通信评估具有挑战性,主要是由于全双工对话中的以下特性:
1) **轮次边界模糊**。与HD-SLM不同,其中对话自然按轮次组织,全双工通信自发发生,不遵循严格的轮次结构。因此,没有明确的标记指示用户或助手各自说话轮次的开始或结束。这种边界的缺乏使得难以评估特定通信轮次的响应质量。
2) **上下文不一致**。在自然全双工通信数据集中,每轮用户语音取决于前几轮的地面真实助手响应。然而,在评估期间,模型对较早轮次的响应可能与地面真实值显著偏离,造成上下文不匹配。这种不一致导致模型在现实世界对话中永远不会出现的场景中运行,最终降低了评估的可靠性。
表1列出了两个挑战的示意图。
另一个值得注意的现有基准限制是其主要关注评估FD-SLM管理各种对话特征的能力,同时很大程度上忽视了模型的其他关键功能,如指令跟随(Lou等人,2024;Zhou等人,2023;Zeng等人,2023)和确保安全输出(Shi等人,2024;Sun等人,2025;Li等人,2024)。这些功能需要相应的评估,因为它们对FD-SLM构成独特的挑战。例如,如果用户在多轮中持续中断模型,模型是否仍能维持预期行为(例如,正确遵循指令)?
**表1:MTR-DuplexBench与其他全双工基准支持特征的比较**。MRD、TE、CF、DQ、IF分别代表多轮对话、逐轮评估、对话特征、对话质量和指令跟随。
为了解决上述挑战和限制,我们引入了一个新型基准MTR-DuplexBench,设计用于在多轮通信设置中全面评估FD-SLM。首先,我们的基准采用创新方法将连续全双工对话分割成离散轮次,实现对FD-SLM的有效逐轮评估。这一方法直接应对轮次边界模糊和上下文不一致的关键挑战。其次,与现有基准相比,我们的基准提供了更全面的评估框架,涵盖对话质量、对话特征、指令跟随和安全性等方面。这种整体方法确保了对FD-SLM的全面和可靠的评估。
表1比较了MTR-DuplexBench与其他已有基准。
总结我们的贡献:
1. 1. 我们提出了MTR-DuplexBench新型基准,用于FD-SLM在多轮交互中的全面评估,涵盖对话特征、对话质量、指令跟随和安全性。
2. 2. 我们引入了轮次分割方法,用于将连续全双工对话分割成离散轮次,实现对FD-SLM的逐轮评估。
3. 3. 我们通过实验展示了现有FD-SLM在保持多轮和多评估维度间性能一致性方面的困难,突出了我们提出基准的必要性和有效性。
## 2 相关工作
### 2.1 语音语言模型
语音语言模型(SLM)是指支持端到端语音对话交互的语音基础自回归模型(Cui等人,2024)。如前所述,SLM可分为HD-SLM和FD-SLM。
**半双工语音语言模型**(HD-SLM)是指支持轮次交替方式"听取"和"说话"的SLM。在这种设置中,用户向模型提供完整查询,模型随后生成相应的语音响应(Lakhotia等人,2021;Kharitono等人,2021;Zhang等人,2023)。因此,HD-SLM被设计用于处理由用户查询和助手响应组成的连接序列。HD-SLM通常通过两阶段过程在现有文本大语言模型(TLM)(Zhao等人,2023;Achiam等人,2023)检查点基础上持续训练。
1) **预训练**。在这个初始阶段,模型使用大量语音数据进行自回归语音生成。这可能涉及纯语音数据的无监督学习(Zhang等人,2023;Wang等人,2025a)或文本-语音对齐对(Nguyen等人,2025;Zeng等人,2024)以从文本向语音迁移知识。
2) **指令调优**。预训练后,模型在语音指令调优数据集上进行训练,使其能够有效响应语音查询(Xie和Wu,2024;Fang等人,2024)。推理期间,一些HD-SLM直接以语音响应(Hassid等人,2023;Nguyen等人,2025),而其他先生成文本响应作为指引,然后生成相应语音(Long等人,2025;Chen等人,2025;Xu等人,2025)。
**全双工语音语言模型**(FD-SLM)是指支持同步"听取"和"说话"以支持中断和反馈确认等高级对话特征的SLM。FD-SLM通常建立在HD-SLM基础上,可分为两类(Cui等人,2025b)。
1) **级联FD-SLM**将全双工对话分为不同状态。SLM随后根据当前对话状态决定听取或说话(Ma等人,2025;Xie和Wu,2024;Wang等人,2024)。级联FD-SLM通常在合成全双工数据上训练以启用简单的对话特征如中断。
2) **端到端FD-SLM**直接从真实全双工数据学习以启用更自然、人性化的对话动态(Wang等人,2025a;Défossez等人,2024;Cui等人,2025b)。
### 2.2 全双工基准
全双工基准关注于评估FD-SLM在与全双工通信相关的各种特征上的表现。大多数全双工基准关注于评估一轮语音交互。具体来说,Full-Duplex-Bench(Lin等人,2025c)设计单轮语音提示来评估FD-SLM在暂停处理、反馈确认、平顺轮次交替和用户中断方面的能力。Full-duplex-bench v1.5(Lin等人,2025b)将评估场景扩展至重叠语音,但仍限于一轮交互。
其他全双工基准采用多轮语音提示但优先考虑总体模型响应质量而非单轮性能。它们也关注单一场景,限制了对FD-SLM多轮交互能力的全面评估。例如,FD-Bench(Peng等人,2025)使用多达五轮用户提示,主要处理带有合成语音的用户中断。相比之下,我们的基准使用自然和合成对话数据为多轮全双工通信提供多样化评估。
类似地,Talking Turns(Arora等人,2025)包含多轮数据但仅预测轮次时机而无轮次对轮次的对话评估。此外,它们的数据收集依赖于人类与各种模型的交互,使其资源密集,难以扩展和适应新模型。而我们的基准实现了带有轮次级指标的自动评估管道,无需人工干预。
此外,Lin等人(2025a)的并行工作评估了四个场景(日常、纠正、实体跟踪和安全)中的多轮全双工交互,关注任务级成果而非轮次级行为。它利用单独的语音LLM作为自动审查员,不能保证同一任务的一致交互数据,限制了评估稳定性。相比之下,我们的基准为每轮使用相同的评估数据,允许稳定的评估和公平的模型比较。
## 3 MTR-DuplexBench
本部分阐述了我们提出的MTR-DuplexBench基准的技术细节。我们首先介绍全双工轮次分割方法,该方法将连续全双工对话分割成离散轮次以实现逐轮评估。随后,我们概述了基准的整体结构,涵盖所有评估维度。
### 3.1 全双工轮次分割方法

全双工轮次分割方法旨在应对真实全双工对话中轮次边界模糊和上下文不一致的挑战,并实现逐轮评估。它包含一个识别全双工对话中各用户轮次边界起点和终点的算法。随后,相应确定助手响应的适当时间段。我们下面提供算法概述,完整版本详见算法1。
轮次分割算法旨在应对**轮次边界模糊**挑战,可分为四个步骤。
1) **信息提取**。初始时,给定来自两个通道的语音音频A_c,其中c∈{user, assistant},我们采用Whisper-timestamped包(Louradour,2023)结合Silero语音活动检测(VAD)(Team,2024)和中等大小的Whisper模型(Radford等人,2023)。这些工具提取转录文本和各VAD片段的起始/结束时间戳,表示为S^c ← Extract(A_c) = {(T_j^{start}, T_j^{end}, text_j^c)}_{j=1}^n。VAD片段是碎片化的,通常共存相似文章
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
MTR-Suite:一个用于评估和合成对话检索基准的框架
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。
Omni-DuplexEval: 评估实时双工全模态交互
本文介绍了Omni-DuplexEval,这是一个用于多模态大语言模型中实时双工交互的基准测试和自动评估框架,旨在评估流式场景下的连续响应生成和主动事件检测。
BayLing-Duplex: 单一自回归大语言模型实现原生全双工语音对话
BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。
Hy-MultiTurn:面向深度多轮对话理解的六维基准
介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。