Instruct-FD:你的全双工语音系统能遵循轮换指令吗?

arXiv cs.CL 论文

摘要

介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。

arXiv:2607.20460v1 公告类型:新 摘要:当前的全双工(FD)口语对话系统可以产生流畅的交互,但仍不清楚它们在被明确指示时是否能调整其轮换行为。这对于现实部署至关重要,因为不同应用的对话策略各不相同(例如,主动辅导 vs. 被动咨询)。我们引入了Instruct-FD,一个用于评估全双工系统中可控轮换管理的指令条件基准。为此,我们开发了一个经人工验证、可扩展的合成管道,用于生成指令条件对话,以及一个与部署无关的多轮评估协议和一个基于LLM的评判器。对六个最先进的全双工系统进行基准测试,揭示了在遵循指令的轮换管理方面存在显著差距:最佳模型仅达到64.4%的遵从率。性能在不同行为和场景之间高度不均,主动行为如模型回注和中断仍然特别具有挑战性。这些发现将遵循指令的轮换管理确立为构建适应性强且可部署的全双工对话系统的关键方向。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:17

# Instruct-FD:你的全双工语音系统能遵循轮流指令吗?  
来源:https://arxiv.org/html/2607.20460  
Yuzhi Tang , Wentao Ma , Xiling Zhao , Ahmad Salimi , Sepehr Harfi Moridani, Dongming Shen , Jixuan Wang , Abdulrahman Abdulrazzag , Murdock Aubry , Yu\-Hua Chen , Daniel Lee , Jaewon Lee , Jonah Mackey , Silin Meng , Nicholas Stranges , Chenxu Xiong , Hao Yu , Yi Zhu , Mu Li , Alex Smola  
Boson AI, Santa Clara, CA 95054  

###### 摘要  
当前的全双工(FD)语音对话系统能够产生流畅的交互,但仍不清楚它们能否在收到明确指令时调整自身的轮流行为。这对于实际部署至关重要,因为不同应用场景(例如,主动式辅导 vs. 被动式咨询)的对话策略各不相同。我们提出了 **Instruct-FD**,一个用于评估 FD 系统中可控制轮流管理的指令条件基准。为此,我们开发了一个经过人工验证、可扩展的合成管道,生成指令条件对话,并配套了一个与部署无关的多轮评估协议以及一个基于 LLM 的评判器。对六个最先进的全双工系统进行基准测试显示,在遵循指令的轮流管理方面存在巨大差距:表现最好的模型也仅达到 64.4% 的遵循程度。不同行为和场景下的表现极不均衡,其中模型回馈和打断等主动行为仍然特别具有挑战性。这些发现将遵循指令的轮流管理确立为构建可适配、可部署的全双工对话系统的关键方向。  
††footnotetext:通讯作者:yuzhi\.tang@boson\.ai\.

## 1 引言

全双工(FD)语音对话系统 [Défossez等人,2024 (https://arxiv.org/html/2607.20460#bib.bib6); Roy等人,2026 (https://arxiv.org/html/2607.20460#bib.bib20); Google,2026 (https://arxiv.org/html/2607.20460#bib.bib9); Wang等人,2024 (https://arxiv.org/html/2607.20460#bib.bib29); Yao等人,2024 (https://arxiv.org/html/2607.20460#bib.bib30)] 能够同时聆听和说话,是迈向自然语音交互的关键一步。与严格的轮流制系统不同,FD 模型必须实时管理对话空间:何时继续聆听,何时回馈,何时打断,何时继续说话,以及何时让渡发言权。这些决策对于部署系统至关重要,例如:(1) 辅导代理在学生出现事实错误时应尽早打断。(2) 相比之下,咨询代理应保守地倾听,尽量减少打断。两种行为都是合理的,区别在于轮流管理策略。如果模型无法根据明确的对话指令可靠地调整其轮流行为,那么将其部署到如此多样的应用场景中将变得不切实际。因此,一个核心的评估需求是 **遵循指令的轮流管理**:模型在被要求时能否改变其轮流方式?

最近的 FD 基准测试 [Lin等人,2025b (https://arxiv.org/html/2607.20460#bib.bib13); 2026 (https://arxiv.org/html/2607.20460#bib.bib14); Arora等人,2025 (https://arxiv.org/html/2607.20460#bib.bib2); Zhang等人,2026 (https://arxiv.org/html/2607.20460#bib.bib31); Lin等人,2025a (https://arxiv.org/html/2607.20460#bib.bib12)] 评估了标准的轮流质量,但在模型需要决定是否在用户说话期间发言的场景上缺乏标准化:现有测试将回馈和打断的质量与固定先验或狭窄的安全场景绑定 [Ge等人,2025 (https://arxiv.org/html/2607.20460#bib.bib7)],并且没有测试对任意轮流指令的遵从性。因此,我们将轮流评估问题框架化为一个指令遵循问题,并解决另外两个空白:(i) 数据稀缺——我们构建了一个合成管道,生成策略条件化 FD 对话,具有可控制的轮流触发器;(ii) 上下文和可移植性——现有的多轮基准测试 [Zhang等人,2026 (https://arxiv.org/html/2607.20460#bib.bib31); Arora等人,2025 (https://arxiv.org/html/2607.20460#bib.bib2); Lin等人,2025a (https://arxiv.org/html/2607.20460#bib.bib12)] 依赖双流接口,限制了可部署性,因此我们将上下文相关的两轮测试用例与一个多轮编排器配对,通过统一的 WebRTC 兼容接口流式传输用户音频,以实现可扩展、与架构无关的评估。

参照图注  
图 1:Instruct-FD 评估协议概览。左侧为主动行为,右侧为响应行为。

我们提出了 **Instruct-FD**,一个将提供特定轮流管理机会的用户音频流与明确的自然语言指令配对的基准测试。我们评估两种互补的情况:(1) 当用户正在说话时(模型应保持沉默、给出简短确认,还是打断?);(2) 当模型正在说话而用户重叠时(模型应继续还是确认并调整?)。我们在图 1 (https://arxiv.org/html/2607.20460#S1.F1) 中展示了通用评估协议。这种设计将评估重点放在可控的对话行为上,而不是模仿单一时间分布,并通过可扩展的生成方案扩展到 29 个对话场景。我们的贡献如下:

- **指令条件化评估框架**。我们将轮流管理评估形式化为指令遵循,明确涵盖主动行为(模型在用户说话期间回馈/打断)和响应行为。我们使用一个兼容 WebRTC 的多轮用户编排器进行与架构无关的多轮评估,并使用 LLM 作为审判官评估指令遵循程度。
- **合成指令遵循测试用例生成管道**。我们引入了一个可扩展的管道,用于构建指令条件化 FD 对话,覆盖广泛且可扩展的场景(29 个),包括上下文相关的两轮用例,其中轮流决策取决于先前的对话上下文;人工验证证实生成的用例是自然的,指令是可执行的。
- **全面的模型基准测试与案例研究诊断**。我们在 Instruct-FD 上对六个最先进的全双工系统进行基准测试,并使用有针对性的案例研究来识别当前局限性,表明遵循指令的轮流管理控制仍然是一个重大的开放挑战。

## 2 Instruct-FD

详细相关工作请参阅附录 A.1 (https://arxiv.org/html/2607.20460#A1.SS1)。我们现在描述 **Instruct-FD**,一个将全双工语音对话中的轮流管理视为指令遵循问题的评估框架。给定一组以自然语言指令表达的轮流策略,该框架生成有针对性的测试场景,在实时模型上执行它们,并判断模型的行为是否符合指定策略。

### 2.1 轮流管理指令分类

| 类别 | 指令 | 模板 | 示例指令 |
|------|------|------|----------|
| 主动 | 回馈 | “当 {trigger} 时回馈,否则聆听。” | “您倾向于在用户仍在说话但似乎寻求确认时(例如,短暂停顿、升调、情绪强调)简短回馈。在这些时刻之外,不要打断并继续聆听。” |
| 主动 | 打断 | “当 {trigger} 时打断,否则聆听。” | “当用户做出的陈述与之前对话内容直接矛盾时,立即打断以指出不一致……” |
| 主动 | 聆听 | “聆听,不要回馈或打断。” | “您倾向于在用户说话时静默聆听。不要打断或回馈,只有在用户明确完成其轮次后才开始发言。” |
| 响应 | 继续 | “用户回馈时继续。” | “当您说话时,如果用户给出简短确认或继续信号(例如,“嗯哼”、“是的”、“明白”),将其视为支持而非停止请求,并继续您的回应,不放弃发言权。” |
| 响应 | 回应 | “用户打断时回应。” | “当您说话时,如果用户插话进行更正、限制、澄清或重定向,立即回应并相应调整您的回应。” |

表 1:Instruct-FD 中使用的轮流管理指令分类。

我们将轮流管理评估按照 **当前谁持有发言权** 来组织,分为 **主动** 行为(用户正在说话,模型决定是否/如何干预)和 **响应** 行为(模型正在说话,对用户重叠做出反应)。受先前 FD 基准分类的启发,特别是 FullDuplexBench v1 [Lin等人,2025b (https://arxiv.org/html/2607.20460#bib.bib13)],我们进一步将每种行为条件化于明确的策略指令(表 1 (https://arxiv.org/html/2607.20460#S2.T1))。这种设计评估了基本的、可控的轮流能力,而不是假设单一的固定交互风格,并且支持同一对话不同指令的比较,从而将指令遵循与对话内容隔离开。下面我们描述每个指令类别:

(1) **回馈**:模型在用户说话期间适时提供简短确认(例如,停顿、确认信号),但不占据发言权。  
(2) **打断**:模型在存在明确触发条件(例如,矛盾、安全关键信号)时主动占据发言权,要求时机恰当且内容功能相关。  
(3) **聆听**:模型在用户说话期间保持沉默,抑制回馈和打断,直到清晰的轮次结束。  
(4) **继续**:当用户在模型说话期间发出简短继续信号(例如,“嗯哼”)时,模型保持发言权并完成其思路,而非放弃。  
(5) **回应**:当用户在模型说话期间插话进行更正或重定向时,模型识别打断并相应调整。

### 2.2 测试用例生成管道

这里我们解释如何生成合成的多轮对话,其中重叠事件通过内联转录标记明确编写,使得在 TTS 合成后能精确恢复地面真值插入时间戳。如图 2 (https://arxiv.org/html/2607.20460#S2.F2) 所示,管道包含四个阶段。

参照图注  
图 2:四步测试用例生成管道。

(1) **文本生成**。每个对话由一个 **场景规范** 控制,该规范定义了轮次数、说话人分配、每轮内容提示,以及可选的插话类型。对于人格条件化场景,一个 **人格压缩器** 将一个来自抽样的 Nemotron-Personas-USA 档案 [Meyer & Corneil, 2025 (https://arxiv.org/html/2607.20460#bib.bib15)] 的具体属性与场景描述融合成一个单句基础。然后,一个 LLM 轮次代理为两个说话人生成逐轮对话,以累积历史和每轮提示为条件。对于插话轮次,代理在前一个说话者的文本中插入结构化的内联标记(例如 `<barge-in>`),指定意图的切入时间点。详细模板和设置在附录中提供。

(2) **语音合成与声学验证**。每轮使用 Gemini TTS 合成,插话子片段从内联标记中提取并单独合成。然后应用 ASR 和强制对齐来恢复词级时间戳,并定位每个插话标记在合成音频中的确切插入点,从而得到地面真值标签时间戳。丢弃缺少音频或对齐失败的案例。

(3) **测试用例组装**。转录结构和声学元数据被合并成评估就绪的测试用例。一个关键的设计属性是:同一对话与多个轮流管理指令配对,每个指令产生不同的有效目标行为。这种同一对话不同指令的设置将指令遵循能力与对话内容变化隔离开。对于每个对话,在场景的策略列表中为每个指令实例化一个测试用例,外加一个无指令的基线。

(4) **均衡采样**。跨场景类型采样均衡子集以确保覆盖。经过过滤和采样后,最终的 Instruct-FD 基准测试包含 29 个场景中的 912 个测试用例。表 2 (https://arxiv.org/html/2607.20460#S2.T2) 总结了按指令分组分布的概况。值得注意的是,唯一对话与测试用例数量之间的差距(例如,96 个对话在“聆听”下产生 312 个测试用例)反映了指令复用设计:单个对话作为多个评估条件的基础。

表 2:按指令分组的场景和测试用例分布。

### 2.3 多轮用户编排器

为了在现实的多轮设置中评估轮流管理行为,我们引入了一个 **多轮用户编排器**,它控制用户端音频流,同时让模型行为完全不受约束(图 3 (https://arxiv.org/html/2607.20460#S2.F3))。每个测试用例包含 (i) 一个编码轮流管理策略的系统指令,以及 (ii) 一个轮次清单——一系列预录的用户音频片段及其相关元数据。编排器通过在单个持久模型会话中实时流式传输音频来执行此清单,因此模型上下文会跨轮次累积。编排器有三个组件。

(1) **轮次管理器**:每个轮次是两种类型之一。**拿取轮次 (take-turn)** 等待 VAD 检测到的模型静默(默认:1.5 秒)或每轮超时,然后流式传输用户音频。**插话轮次 (barge-in)** 等待模型开始说话,然后在相对于语音起始的可配置延迟后注入用户音频,模拟真实的用户重叠。每个用户轮次后附加尾部静默,以可靠触发模型的响应。我们在附录 A.7 (https://arxiv.org/html/2607.20460#A1.SS7) 中展示了一个演示测试用例方案。

(2) **VAD 模块**:一个 Silero VAD [Silero Team, 2024 (https://arxiv.org/html/2607.20460#bib.bib24)] 实例扮演三个角色:(a) 检测模型静默以指示轮次完成,(b) 定位用户音频中的语音起始以计算插话时机,(c) 跟踪模型在用户音频流式传输期间是否正在积极说话,这决定了插话处理策略——**保持**(无论是否继续流式传输)或 **让渡**(停止流式传输并放弃发言权)。

(3) **双通道录音**:用户和模型音频块根据共享会话时钟打上时间戳,并并行累积记录。每个片段结束后,记录被渲染成时间对齐的双通道 WAV(ch0 = 用户,ch1 = 模型),作为下游分析和评判的人工制品(§2.4 (https://arxiv.org/html/2607.20460#S2.SS4))。上下文轮次(类型 `take-turn`)首先通过正常交换建立对话状态;触发轮次则在受控的时间点暴露策略相关的重叠线索,生成的联合音频被捕获在共享时间线上。由于编排器只控制用户通道,从不注入到模型的响应流中,每个模型都使用相同的流式逻辑、时间结构和用户内容进行评估,从而确保跨异构系统的可重复性和公平比较,而无需访问模型内部。

参照图注  
图 3:多轮用户编排器协议。轮次管理器通过 `take-turn` 或 `barge-in` 动作流式传输脚本化的用户音频;VAD 模块管理轮次边界和插话时机;用户和模型音频被记录成时间对齐的双通道 WAV 以供评判。

### 2.4 用于指令遵循评估的 LLM 评判

我们使用 LLM 评判器来评估模型对轮流管理指令的遵循程度。我们使用 Qwen3-ASR 获取用户和模型音频的词级时间戳。

相似文章

面向IWSLT 2026指令跟随的FBK长时SpeechLLMs

arXiv cs.CL

本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。

VCIFBench:评估视频理解中的复杂指令遵循能力

arXiv cs.CL

VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。