DuplexSpeechBench-IFEval: 评估全双工语音代理中的隐式指令遵循
摘要
本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。
查看缓存全文
缓存时间: 2026/09/04 06:04
# DuplexSpeechBench–IFEval:评估全双工语音助手中的隐式指令遵循 来源:https://arxiv.org/html/2609.03423 Dinesh Manocha 项目主页:dsb\-ifeval\.github\.io (https://dsb-ifeval.github.io/) ###### 摘要 全双工语音助手必须持续决定何时倾听、给出反馈信号、打断、处理语音重叠、获取话语权及让出话语权。现有基准测试大多通过显式的轮流管理指令来检验这些行为,而实际部署的代理通常通过角色或人设来配置,必须从中推断出适当的对话行为。我们引入了DuplexSpeechBench–IFEval(DSB–IFEval),用于评估实时语音交互中的隐式指令遵循。DSB–IFEval包含1,038个测试用例,涵盖八种不同的助手角色,并评估了五种指令遵循的条件协议:默认行为、显式行为指令、角色设定隐含行为、组合角色–规则条件以及指令冲突。我们使用确定性的指令遵守分数(IAS)衡量实时话语权管理,并使用LLM评判的角色设定遵守分数(PAS)衡量角色一致的内容。在六个实时语音系统中,我们发现了依赖于架构的权衡。像F-Actor和PersonaPlex这样的全双工模型对对话行为是明确说明还是必须从角色设定中推断更为敏感,在仅角色设定条件下,其遵守度分别下降了9.7%和4.5%。相比之下,GPT-Realtime、MiniCPM-o和Fun-Audio-Chat强烈遵守角色一致的内容,但其话语权行为在显式指令和仅角色设定指令之间变化不大,并且在几种主动行为上仍然受到限制。我们进一步发现,即使系统能可靠地遵循与其规定角色相冲突的良性指令,它们在需要推翻这些指令的安全冲突情况下仍然挣扎。这些结果表明,推断角色隐含的行为、在适当的对话时刻执行它,以及解决竞争指令,仍然是全双工语音助手面临的不同挑战。参见标题图1:DuplexSpeechBench–IFEval(DSB–IFEval)为实时语音代理提供用户端语音交互和不同的指令/角色设定条件,并通过五种互补协议评估显式指令遵循、角色隐含行为和指令冲突。 ## 1 引言 全双工(FD)语音对话系统可以同时听和说,支持自然的轮流发言、反馈信号、打断和语音重叠(Défossez et al., 2024; Ge et al., 2025; Roy et al., 2026)。然而,能够产生这些行为并不足够:哪种行为合适以及何时合适,很大程度上取决于代理扮演的角色。苏格拉底式的导师可能需要打断推理错误,而悲伤咨询师可能保持长时间的反思性停顿;同声传译员可能会在短暂重叠中继续,而紧急调度员可能需要立即让出话语权。因此,可靠的全双工交互不仅需要流畅的语音生成,还需要角色适当的话语权控制。 表1:相关基准测试。与先前工作不同,DSB–IFEval在实时语音交互中联合评估显式轮流指令、对话动态、指令遵循、角色隐含的话语权行为和指令层级。 最近的工作将轮流管理视为一个指令遵循问题。INSTRUCT-FD(Tang et al., 2026)评估全双工系统能否遵循管理何时打断、反馈信号、倾听或继续的显式自然语言指令。然而,在实际部署中,这些行为通常不是作为明确规则指定的。语音代理而是通过角色或人设来配置——例如导师、咨询师、调度员或翻译员——必须从中推断出适当的对话行为。这增加了一个独特的挑战:模型必须首先推断角色应如何行为,然后在实时对话约束下执行该行为。 参见标题图2:DuplexSpeechBench–IFEval(DSB–IFEval)。我们使用五种互补协议评估实时语音代理:L0,默认话语权行为;L1,执行显式行为指令;L2,推断并执行角色设定隐含的行为;L3,附带重述蕴含规则的角色设定条件;L4,指令冲突,包括良性冲突(L4a),其中指令应优先,以及安全冲突(L4b),其中角色设定隐含行为应优先。 我们引入了DuplexSpeechBench–IFEval(图1),这是一个评估全双工语音代理中*隐式指令遵循*的基准。DSB–IFEval评估模型能否遵循明确陈述的行为指令、从角色设定中推断等效行为、在同时提供角色和规则时做出响应,并解决显式指令与角色隐含行为之间的冲突。DSB–IFEval包含1,038个测试用例,源自240个独特的对话设置,涵盖八个助手角色和六种对话探测。时序关键事件(如停顿、打断和重叠机会)在构建过程中插入,为评估提供精确的时间参考。 我们使用确定性的指令遵守分数(IAS)衡量实时话语权管理,并使用LLM评判的角色设定遵守分数(PAS)单独评估角色一致的内容和语域。这种区分区分了模型是否产生角色适当的语言与是否在对话话语权上执行相应行为。该基准在条件设置中使用匹配的用户交互,使得直接陈述的行为与必须从角色推断的行为之间可以进行受控比较。 我们使用蕴含差距总结这种差异,它衡量显式指令与仅角色设定条件之间指令遵守度的变化。在六个实时语音系统中,我们发现了架构间的显著差异。像PersonaPlex(Roy et al., 2026)和F-Actor(Züfle et al., 2026)这样的全双工模型对对话行为是明确说明还是必须从角色设定中推断更为敏感。相比之下,GPT-Realtime(OpenAI, 2026)、MiniCPM-o-4.5(Cui et al., 2026)和Fun-Audio-Chat(Chen et al., 2025)表现出更强的角色一致内容,但其话语权管理行为在显式指令和仅角色设定条件之间变化相对较小。更广泛地说,角色一致的内容和实时话语权控制成为不同的能力:在回应中强烈跟踪角色设定的模型可能在主动行为(如反馈信号和打断)上仍然受限,而更强的全双工控制并不一定产生角色适当的内容。最后,那些在良性冲突中可靠遵循显式指令的系统,在安全需要覆盖这些指令时仍然挣扎。 总之,这些结果表明,推断角色隐含的行为、实时执行它以及解决竞争指令是当前系统尚未联合解决的不同能力。我们的主要贡献是: - •一个用于全双工交互中隐式指令遵循的基准。我们引入了DSB–IFEval,包含1,038个测试用例,涵盖八个助手角色和五种条件协议,区分默认行为、显式指令执行、角色隐含行为、组合角色–规则条件以及指令冲突。 - •对行为和角色设定遵守度的受控评估。我们使用确定性的IAS评估实时话语权管理,并使用PAS单独衡量角色一致的内容,蕴含差距量化了行为必须从角色推断而非明确说明时遵守度的变化。 - •对实时语音架构的系统分析。评估六个系统揭示了角色设定条件的话语权控制、主动行为和内容遵守度上依赖于架构的差异,而我们的冲突协议暴露了安全感知指令层级中的一个单独弱点。 ## 2 相关工作 #### 全双工语音评估。最近的基准测试评估了实时语音交互的互补方面。Full-Duplex-Bench及其扩展研究了轮流发言、停顿处理、反馈信号、重叠、多轮交互和工具使用(Lin et al., 2025; Lin et al., 2026c; Lin et al., 2026b; Lin et al., 2026a),而FD-Bench评估了打断处理、延迟和鲁棒性(Peng et al., 2025)。MTR-DuplexBench将评估扩展到多轮对话质量、指令遵循和安全性(He et al., 2026),τ-Voice在基于真实世界任务和领域策略的全双工代理上进行评估(Ray et al., 2026)。DuplexWorld(Bhosale et al., 2026)在企业设置和导航设置的日常任务上评估语音代理,但不研究指令遵循或角色设定引起的话语权管理行为。这些基准主要测量对话动态或任务性能,而不是话语权管理行为如何随角色设定条件变化。 #### 语音和语音代理中的指令遵循。最近的基准测试在任务、语义、表达和对话设置中评估语音中的指令遵循。VoiceBench(Chen et al., 2026)和SpeechInstructBench(Wang et al., 2025)研究通用的语音指令遵循,而S2S-Arena(Jiang et al., 2026)评估语音到语音模型中的语义和副语言遵守度。VCB Bench(Hu et al., 2026)将评估扩展到真实人类语音和多轮对话,CAVA(Held et al., 2025)包括系统提示遵循、轮流发言和安全性。这些基准主要测试语音指令是否被遵循,而不是对话行为是否可以从角色推断。INSTRUCT-FD(Tang et al., 2026)是最接近的先前工作,评估全双工对话中打断、反馈信号、倾听和继续的显式自然语言指令。DSB–IFEval将此设置从显式执行扩展到隐式指令遵循:它测试相同的话语权管理行为是否可以从角色设定推断,重述隐含规则是否改变行为,以及模型如何解决显式指令与角色隐含指令之间的冲突。 ## 3 DuplexSpeechBench–IFEval 我们现在描述DuplexSpeechBench–IFEval(DSB–IFEval),这是一个评估全双工语音代理在不同程度行为规范下指令遵循的基准。我们使用*全双工行为策略*来指管理代理何时应倾听、给出反馈信号、打断、获取话语权、在重叠中继续说话或让出话语权的对话行为。DSB–IFEval并不假设此行为总是通过显式指令指定,而是评估语音代理能否执行所述的全双工行为策略,从角色设定中推断适当的行为,并解决角色隐含行为与显式指令冲突的情况。 给定固定的用户端对话刺激,我们仅改变模型的条件提示,并评估其实时行为是否符合相应的预期行为。这种受控设计将指令和角色设定条件的效果与对话内容隔离,使我们能够分别评估显式指令执行、隐式行为推断和指令层级。 ### 3.1 基准设计与分类法 DSB–IFEval中的主要实验轴是*期望的全双工行为策略传达给模型的特异性程度*。我们在五个条件级别下实例化每个交互,总结于图2。这些条件区分了模型的默认行为、其执行明确陈述行为策略的能力、其从角色设定推断适当行为的能力,以及其在角色隐含行为与显式指令冲突时的行为。 #### L0:基础助手。模型未收到角色设定或显式的轮流管理指令。L0表征了模型在缺乏行为条件下的默认全双工行为,并为确定剩余条件中观察到的行为是由提示引发的还是反映现有模型默认值提供了基线。 #### L1:显式指令。模型收到一个明确的自然语言指令,指定期望的全双工行为,没有角色设定。L1隔离了模型执行直接陈述的行为策略的能力,并提供了与INSTRUCT-FD(Tang et al., 2026)等显式轮流发言指令遵循基准的最接近比较。 #### L2:仅角色设定。模型收到角色描述,但没有明确指令指定它应在何时或如何管理对话话语权。相反,期望的全双工行为由角色隐含。因此,L2要求模型首先从角色设定中推断适当的行为,然后在语音交互中执行它。这是DSB–IFEval中的主要隐式指令遵循条件。 #### L3:角色设定加蕴含指令。模型收到与L2相同的角色设定,以及一个明确的指令,陈述该角色设定隐含的全双工行为策略。比较L3与L2测量明确重述原本隐含的行为策略是否改善执行,而比较L3与L1测量角色设定条件是否影响已陈述行为策略的执行。 #### L4:冲突指令。模型收到一个角色设定,以及一个与该角色设定隐含的全双工行为策略冲突的显式指令。我们考虑两种形式的冲突。L4a:良性冲突,冲突是琐碎的:一个显式的对话偏好修改了角色的默认行为,且指令应优先。L4b:安全冲突,遵循指令会抑制安全对齐或角色关键的响应,而角色设定隐含的安全相关行为应优先。总之,这些条...
相似文章
Instruct-FD:你的全双工语音系统能遵循轮换指令吗?
介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。
MTR-DuplexBench:全双工语音语言模型多轮对话的综合评估基准
MTR-DuplexBench为全双工语音语言模型在多轮对话中的评估引入了一个综合基准,解决轮转边界模糊和上下文不一致等挑战,同时评估对话特征、对话质量、指令遵循和安全性。
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
VCIFBench:评估视频理解中的复杂指令遵循能力
VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。