通过通用风格感知全双工框架实现主动语音轮换

arXiv cs.CL 论文

摘要

本文提出了一种通用风格感知全双工框架,包含一个轻量级的轮换控制器LPS-TC;引入了一个大规模数据集WildTurn,用于真实世界对话;并提出了一种两级评估方案,以增强对话系统中的主动语音交互和响应质量。

arXiv:2608.28630v1 公告类型:新 摘要:与半双工对话系统(系统等待用户轮次完成后再响应)相比,自然的全双工对话系统要求代理实时主动行动,包括及时的打断和反向通道。这带来了关键挑战:在不牺牲响应质量的情况下改善轮换时机。为了解决现实主动轮换中的局限性,我们构建了一个通用风格感知全双工框架,包含三个关键组件。首先,我们提出了LPS-TC,一个用于即插即集成的轻量级主动语音轮换控制器。它具有细粒度的动作空间,涵盖反应性和主动性轮换行为,为半双工模型赋予全双工能力,并为现有全双工模型增强卓越的时机控制。其次,我们构建了WildTurn,一个大规模、真实世界的英语数据集,包含约2,981小时的经过筛选的多轮立体对话,来自面对面和电话对话,标注了五种轮换风格和五种反向通道风格。第三,我们引入了一种两级评估方案,用于评估在现实流约束下的块级时机精度和轮次级交互质量。我们的实验将LPS-TC与半双工模型如Qwen2.5-Omni和全双工模型如Freeze-Omni集成,展示了其在时机适当性和响应质量方面的卓越性能。我们的框架还展示了细粒度的风格可控性和强大的泛化能力,使语音交互更加自然和人性化。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:56

# 通过泛化风格感知全双工框架实现主动发言轮次
来源:https://arxiv.org/html/2608.28630
潘天睿,张清林¹,邓冲¹,程璐瑶¹,陈倩¹,王雯¹,唐杰,吴干山,刘杰* ¹ 通义实验室,阿里巴巴集团

###### 摘要\.

与等待用户发言完毕才响应的半双工对话系统相比,自然的全双工对话系统要求智能体实时主动行动,包括及时的打断和反馈应答。这带来了一个关键挑战:在不牺牲响应质量的情况下改善发言轮次的时机。为解决现实场景中主动轮次控制的局限性,我们构建了一个泛化风格感知全双工框架,其包含三个核心组件。首先,我们提出了轻量级主动发言轮次控制器LPS-TC,它支持即插即用集成。该控制器具备细粒度的动作空间,覆盖反应式和主动式轮次行为,能够为半双工模型赋予全双工能力,并为现有全双工模型增强时机控制能力。其次,我们构建了大规模真实英语数据集WildTurn,包含约2,981小时经筛选的多轮立体对话,涵盖面对面及电话对话场景,标注了五种轮次交接和五种反馈应答风格。在WildTurn上训练的LPS-TC展现出现有静态全双工基准未能捕捉的丰富语音动态特性。第三,我们引入双层评估方案,在真实流式约束下同时评估语块级时机精度和轮次级交互质量。我们的实验将LPS-TC分别与半双工模型(如Qwen2.5-Omni)及全双工模型(如Freeze-Omni)集成,展示了其在时机恰当性和响应质量上的卓越性能。该框架还表现出细粒度的风格可控性和强大的泛化能力,能够实现更自然、更拟人化的语音交互。

风格感知全双工对话、主动语音交互

††ccs:以人为中心的计算 协作交互

## 1\引言

参见图注 图1\.提出的泛化全双工对话框架。我们轻量级的即插即发言次控制器LPS-TC(i)可与现成的半/全双工语音大语言模型无缝集成,(ii)支持风格条件的主动语音行为,如反馈应答和打断。语音对话系统已从强调上下文理解(Chen等人,2022 (https://arxiv.org/html/2608.28630#bib.bib179); Liao等人,2021 (https://arxiv.org/html/2608.28630#bib.bib180); Wu等人,2020 (https://arxiv.org/html/2608.28630#bib.bib182))和响应生成(Roller等人,2021 (https://arxiv.org/html/2608.28630#bib.bib181); Ye等人,2022 (https://arxiv.org/html/2608.28630#bib.bib183))的文本对话框架,发展为对时机敏感、表达丰富的对话智能体。尽管部分研究将基于轮次的半双工语音助手(Nguyen等人,2023 (https://arxiv.org/html/2608.28630#bib.bib161); Wu等人,2025a (https://arxiv.org/html/2608.28630#bib.bib110))发展为能够同时收听和发声的全双工模型(Wang等人,2024c (https://arxiv.org/html/2608.28630#bib.bib113),https://arxiv.org/html/2608.28630#bib.bib151),但另一些研究方向则探索了多样化的语音行为风格,包括不同的个性和细粒度的情感表达(Tu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib174); Gong等人,2025 (https://arxiv.org/html/2608.28630#bib.bib173); Cui等人,2025 (https://arxiv.org/html/2608.28630#bib.bib175))。不同于被动跟随用户主导的对话,自然的全双工系统应能管理实时的主动轮次行为,例如为澄清而打断、主动提供信息,或通过反馈应答表示参与。这些行为使助手不仅能机械地,还能在社会和情感层面支持人类。然而,关于语音对话中主动性的研究仍然不足。部分工作(Deng等人,2025 (https://arxiv.org/html/2608.28630#bib.bib178),https://arxiv.org/html/2608.28630#bib.bib186)关注文本响应的语义,而其他工作(Nguyen等人,2023 (https://arxiv.org/html/2608.28630#bib.bib161); Mitsui等人,2023 (https://arxiv.org/html/2608.28630#bib.bib187); Sehun Lee,2025 (https://arxiv.org/html/2608.28630#bib.bib169))则难以应对异质的用户偏好,因为相同的主动响应可能被某些用户视为支持,却被另一些视为侵扰。要在自然语音对话中实现策略性和动机性的轮次,需要细粒度的时序定位,同时考虑语义、韵律和交互风格,然而现有的语音对话模型仍缺乏这种能力(Chang等人,2025 (https://arxiv.org/html/2608.28630#bib.bib164))。现有的研究仍分散在轮次控制方法、数据集和评估协议中,未能统一支持主动的、风格可控的全双工交互。为弥合这一差距,我们提出了一个包含三个核心组件的泛化全双工框架。

首先,我们提出LPS-TC,通过其架构设计平衡高质量响应与自然发言轮次交互之间的权衡。先进的半双工语音大语言模型(LLM)(Wu等人,2025a (https://arxiv.org/html/2608.28630#bib.bib110); Yang等人,2025 (https://arxiv.org/html/2608.28630#bib.bib125))在响应质量上表现优异,但其严格的顺序轮次交接限制了实时处理和自然的发言动态。同时,开发有效的全双工模型仍具挑战。一些专有的商业智能体(OpenAI,2024 (https://arxiv.org/html/2608.28630#bib.bib135); Intelligence,2025 (https://arxiv.org/html/2608.28630#bib.bib136))为实现精确时机需要高昂成本,而开源解决方案(Wang等人,2024c (https://arxiv.org/html/2608.28630#bib.bib113); Chen等人,2025b (https://arxiv.org/html/2608.28630#bib.bib165))则受限于交互建模不足和响应质量下降。我们如图1 (https://arxiv.org/html/2608.28630#S1.F1)所示的LPS-TC平衡了这一权衡。它是一个轻量级、即插即用的发言轮次控制器,用于轮次时机预测和风格条件化的语音交互。它自回归地处理来自用户和助手的双声道音频流,这使其能够捕获关键的副语言线索和对话动态,而这些通常在以文本为中心或单流模型中丢失。LPS-TC既可以为半双工语音LLM装备全双工能力,也可以通过更优的时机控制来增强现有的全双工模型。

其次,我们介绍了包含细粒度主动发言动态的英语数据集WildTurn。大多数可用的语音对话数据集(Lee等人,2023 (https://arxiv.org/html/2608.28630#bib.bib171); Lin等人,2024 (https://arxiv.org/html/2608.28630#bib.bib170); Tu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib174); Gong等人,2025 (https://arxiv.org/html/2608.28630#bib.bib173); Cui等人,2025 (https://arxiv.org/html/2608.28630#bib.bib175))主要关注话语级的行为或副语言风格,很少捕捉如语音重叠等交互动态。尽管Behavior-SD(Sehun Lee,2025 (https://arxiv.org/html/2608.28630#bib.bib169))包含了轮次行为,但它是合成的,可能无法捕捉真实对话的多样性。为解决这些局限,我们从真实交互中整理了WildTurn,并用全面的标签空间进行标注,涵盖五种动作类别:正常轮次交接(NTT)、打断式轮次交接(ITT)、反馈应答(BC)、插话(BI)和无动作(NA)。其中,NTT和BC进一步细化为风格标签:我们基于静默或重叠时长以及动作频率等统计指标,为NTT定义了五种轮次交接风格,为BC定义了五种反馈应答风格。然后,我们使用GPT-5.2(Singh等人,2025 (https://arxiv.org/html/2608.28630#bib.bib172))生成风格条件的指令。此外,为捕捉人-人对话中的时机,我们采用了基于人机交互研究(Wang等人,2025 (https://arxiv.org/html/2608.28630#bib.bib139); Chen等人,2024 (https://arxiv.org/html/2608.28630#bib.bib140))中关于真实意图到语音延迟的基于时间段标注,每个标签从线索延伸至响应开始。

第三,我们解决当前全双工基准测试的局限性,并构建了旨在实现更全面和实时交互的新评估协议。先前的全双工基准(Lin等人,2025c (https://arxiv.org/html/2608.28630#bib.bib155); Peng等人,2025 (https://arxiv.org/html/2608.28630#bib.bib154); Arora等人,2025a (https://arxiv.org/html/2608.28630#bib.bib123))常忽略两个方面。第一,它们排除了先进的半双工语音LLM,如Qwen3-Omni(Yang等人,2025 (https://arxiv.org/html/2608.28630#bib.bib125)):当使用主动提示进行适配时,这些模型可以作为强大的主动控制器,以进行公平比较。第二,它们依赖静态的、预先录制的对话,这造成了根本性的上下文失配:在多轮设置中,每个后续用户轮次都受到先前真实助手响应在时序和内容上的影响。为解决这些问题,我们提出了一个双层框架,在真实流式约束下评估语块级时机精度和轮次级交互质量,涵盖轮次交接、反馈应答和轮次让渡。我们通过标准化的主动提示,与广泛的半双工基线进行基准测试。为解决上下文失配问题,我们通过将多轮对话分割成单独的轮次来重构测试集。然后将每个轮次连同其真实的前置上下文一起呈现给模型。实验结果表明,基于我们的标注空间,LPS-TC在语块级时机准确性上优于其他轮次控制器。当与半双工和全双工语音LLM集成时,它也提升了轮次级交互质量。此外,LPS-TC展示了卓越的风格可控性和强大的指令遵循能力。

## 2\.相关工作

全双工发言轮次控制器。端到端全双工模型(Défossez等人,2024 (https://arxiv.org/html/2608.28630#bib.bib147); Zhang等人,2025b (https://arxiv.org/html/2608.28630#bib.bib148); Wang等人,(https://arxiv.org/html/2608.28630#bib.bib151); Yu等人,2024 (https://arxiv.org/html/2608.28630#bib.bib150))可以处理重叠语音,但其紧密耦合的设计训练成本高昂,且可能降低响应质量(Xie和Wu,2024 (https://arxiv.org/html/2608.28630#bib.bib137); Chen等人,2025a (https://arxiv.org/html/2608.28630#bib.bib188); Arora等人,2025b (https://arxiv.org/html/2608.28630#bib.bib189); Roy等人,2026 (https://arxiv.org/html/2608.28630#bib.bib193))。为解决此问题,其他工作添加了轮次控制器,要么基于VAD(Wang等人,2024a (https://arxiv.org/html/2608.28630#bib.bib149); Fu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib145); Mai和Carson-Berndsen,2025 (https://arxiv.org/html/2608.28630#bib.bib117); Wang等人,2024c (https://arxiv.org/html/2608.28630#bib.bib113))进行二元状态建模,要么基于隐状态(Chang等人,2022 (https://arxiv.org/html/2608.28630#bib.bib168); Ma等人,2025 (https://arxiv.org/html/2608.28630#bib.bib163); Chen等人,2025c (https://arxiv.org/html/2608.28630#bib.bib146); Liu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib166); Lu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib142))进行更丰富的轮次预测。与仅建模二元轮次状态的标准VAD方法(Team,2024 (https://arxiv.org/html/2608.28630#bib.bib121); Wu等人,2025b (https://arxiv.org/html/2608.28630#bib.bib153); Xu等人,2026 (https://arxiv.org/html/2608.28630#bib.bib192))相比,最近的控制器(Zhang等人,2025a (https://arxiv.org/html/2608.28630#bib.bib116); Li等人,2025 (https://arxiv.org/html/2608.28630#bib.bib124); Liao等人,2025 (https://arxiv.org/html/2608.28630#bib.bib138))添加了诸如等待和空闲等状态,以更好地处理反馈应答和背景噪声。相比之下,LPS-TC将时序控制与响应生成解耦,使得无需牺牲响应质量即可实现打断和反馈应答等细粒度助手行为。

主动语音交互。尽管对话智能体中的主动性已引起越来越多的关注(Zarghami等人,2022 (https://arxiv.org/html/2608.28630#bib.bib198); Deng等人,2023 (https://arxiv.org/html/2608.28630#bib.bib200); Liao等人,2023 (https://arxiv.org/html/2608.28630#bib.bib197); Zhang等人,2024 (https://arxiv.org/html/2608.28630#bib.bib199)),但大多数先前工作聚焦于文本,而语音发言权交接仍未被充分探索(Viswanath和Buschmeier,2026 (https://arxiv.org/html/2608.28630#bib.bib195))。现有研究要么关注实时智能体框架(Qiu等人,2026 (https://arxiv.org/html/2608.28630#bib.bib201); LiveKit,2024 (https://arxiv.org/html/2608.28630#bib.bib202); Daily.co,2024 (https://arxiv.org/html/2608.28630#bib.bib203); Hugging Face,2024 (https://arxiv.org/html/2608.28630#bib.bib204)),要么关注句子级说话风格(Tu等人,2025 (https://arxiv.org/html/2608.28630#bib.bib174); Gong等人,2025 (https://arxiv.org/html/2608.28630#bib.bib173); Cui等人,2025 (https://arxiv.org/html/2608.28630#bib.bib175)),但对话流畅度也依赖于多样化的发言轮次行为。因此,我们专注于轮次级的主动语音交互,包括及时的反馈应答、预测性轮次交接和平滑的轮次让渡。然而,现有的包含主动行为的语音对话数据集(Nguyen等人,2023 (https://arxiv.org/html/2608.28630#bib.bib161); Mitsui等人,2023 (https://arxiv.org/html/2608.28630#bib.bib187); Sehun Lee,2025 (https://arxiv.org/html/2608.28630#bib.bib169); Zhou等人,2025 (https://arxiv.org/html/2608.28630#bib.bib205))仍然有限。它们依赖合成数据,无法捕捉真实对话的细微动态(Sehun Lee,2025 (https://arxiv.org/html/2608.28630#bib.bib169))。我们基于大规模真实面对面及电话对话,构建并标注了WildTurn,包含多样化的轮次交接和反馈应答风格。

全双工基准测试。现有的全双工基准测试主要关注孤立的或有限的语音交互。早期工作如Full-Duplex-Bench(Lin等人,2025c (https://arxiv.org/html/2608.28630#bib.bib155),b (https://arxiv.org/html/2608.28630#bib.bib156))评估停顿处理、中断响应和重叠管理,但主要局限于单轮设置。后续基准测试扩展到多轮场景,但仍缺乏两方面:在流式输入下评估泛化的语音LLM作为实时轮次交接模型的能力,以及在真实流式条件下建模多轮动态交互。例如,Talking Turns(Arora等人,2025a (https://arxiv.org/html/2608.28630#bib.bib123))专注于时机预测,FD-Bench(Peng等人,2025 (https://arxiv.org/html/2608.28630#bib.bib154))强调打断密集的案例,而Full-Duplex-Bench-v2(Lin等人,2025a (https://arxiv.org/html/2608.28630#bib.bib157))依赖单独的语音LLM作为评审者。相比之下,我们提出了一个双层实时评估框架,在真实多轮流式场景下,同时在语块和轮次级别评估泛化的语音LLM。

相似文章