将轮次转换与语义解耦:基于有限状态机的全双工对话的解耦数据方法
摘要
本文提出一种解耦数据方法,通过从真实口语对话中学习轮次转换,同时利用文本处理语义,借助神经有限状态机框架来增强自然性并保留语义能力。
arXiv:2609.03321v1 公告类型:新
摘要:神经有限状态机(NFSM)框架通过将轮次转换控制和响应生成序列化到单个因果带上,并遵循标准的下一个标记预测目标,提供了一条实现全双工对话的务实路径,从而在低微调成本下保留了语义能力。然而,它对合成文本数据的依赖从根本上限制了轮次转换的自然性,因为大型语言模型(LLMs)无法真实模拟真实人类对话的精细声学时间动态。在这项工作中,我们提出了一种解耦数据方法,从真实的人人(HH)口语对话中学习轮次转换,同时通过可配置的人机(HA)文本对话来塑造语义行为。为了实现这一方法,我们引入了一种基于规则的事件引导数据转换方法,通过分类轮次转换事件并应用确定性映射规则,将HH口语对话序列化到FSM带上,从而实现无需LLM生成标注的可扩展监督。我们进一步提出了一种源感知校准(SAC)损失,该损失联合校准状态转换标记的长尾分布,并将每个数据源引导到其最适合监督的能力上。实验表明,我们的方法显著提高了轮次转换能力,同时恢复了基础LLM的语义能力。我们的代码和模型可在https://github.com/Liyht/def-fsm获取。
查看缓存全文
缓存时间: 2026/09/04 05:57
# 将话轮转换与语义解耦:基于有限状态机的全双工对话解耦数据方法 来源:https://arxiv.org/html/2609.03321 Chenhui Chu 机构:[email protected], [email protected] ###### 摘要 神经有限状态机(NFSM)框架通过将话轮转换控制和响应生成序列化到单一因果序列带上(基于标准的下一词元预测目标),为全双工对话提供了一条务实路径,从而在较低微调成本下保留了语义能力。然而,其对合成文本数据的依赖从根本上限制了话轮转换的自然性,因为大型语言模型(LLMs)无法忠实模拟真实人类对话中精细的声学时间动态。本研究提出一种解耦数据方法:从真实人类-人类(HH)口语对话中学习话轮转换,同时通过可配置的人类-智能体(HA)文本对话塑造语义行为。为实现该方法,我们引入基于规则的事件引导数据转换方法,通过分类话轮转换事件并应用确定性映射规则,将HH口语对话序列化为有限状态机序列带,从而实现无需LLM生成标注的可扩展监督。我们进一步提出源感知校准(SAC)损失函数,联合校准状态转换词元的长尾分布,并将各数据源定向引导至其最擅长监督的能力维度。实验表明,本方法显著提升了话轮转换熟练度,同时恢复了基础LLM的语义能力。代码与模型已开源:https://github.com/Liyht/def-fsm ## 1 引言 大型语言模型(LLMs)的近期进展极大增强了语音助手的语义能力(Ji et al., 2024)。然而,其话轮转换自然性仍受限于僵化的半双工模式——即双方必须等待对方说完才能发言。为迈向真正类人交互,全双工对话正成为研究方向(Chen and Yu, 2025),允许智能体同时聆听与发声,从而实时处理打断、声学反馈信号及动态话轮转换。参见图1:耦合与解耦数据方法对比。 当前全双工对话研究主要分为端到端与模块化两大范式。端到端范式(Nguyen et al., 2023; Défossez et al., 2024; Veluri et al., 2024; Zhang et al., 2025; Lee et al., 2025)通过直接理解与生成语音表征,实现了精细的话轮转换控制与低延迟,但强制性的跨模态对齐常导致底层LLM语义能力显著下降(Xiang et al., 2025; Chen et al., 2024)。模块化范式则通过外部控制器(Liao et al., 2025)、分类头(Wang et al., 2025; Chen et al., 2025)或词汇内有限状态机控制词元(Wang et al., 2024b)为LLM配备辅助状态管理。其中,NFSM(Wang et al., 2024b)占据独特地位:它未引入任何辅助模块,而是将状态转换与响应内容序列化至单一因果“序列带”,完全通过标准下一词元预测目标处理全双工控制,且不增加参数。此外,它使LLM能在后续决策时显式感知并基于完整的话轮转换动态历史进行条件判断。 然而,这种极简设计将话轮转换能力的全部负担转移至序列带的文本内容——而原始NFSM的数据方法无法充分应对这一负担。具体而言,如图1(左)所示,NFSM从LLM生成的转录文本构建训练序列带,试图同时提炼复杂话轮转换动态与丰富语义。但基础LLM主要在结构化非重叠文本上预训练,缺乏模拟真实人类交互精细声学与时间动态的固有能力。更甚者,在单一对话中联合控制现实话轮转换与丰富语义加剧了此难度,使此类合成数据作为监督信号存在根本性缺陷。 为应对此挑战,我们倡导解耦数据方法(如图1右所示),将每种能力与其最适宜的数据源对齐:精细话轮转换动态从真实HH口语对话语料库中获取,而易得的HA文本对话则作为塑造语义行为的灵活杠杆。实施该方法的核心挑战在于将真实HH口语对话转换为NFSM序列化序列带(作为真值),其中需插入状态转换词元以忠实反映复杂声学话轮转换动态。为此,我们提出*事件引导的数据转换*策略:将对话时间轴分割并分类为离散话轮转换事件,随后应用确定性映射规则将各段序列化至序列带。核心见解在于:状态转换词元插入可作为话轮转换动态的近似,而话轮转换动态等同于话轮转换事件的时间序列。关键是,整个流程完全基于规则,无需LLM标注,可轻松扩展至任意规模的HH语料库。在HA侧,语料库可自由替换以针对特定语义目标。本文采用通用HA语料库以保留LLM的固有语义能力,将特定能力适配留作自然延伸。 尽管解耦数据方法提供了清晰监督信号,但在生成的异构序列带上联合训练引入两个挑战:首先,状态转换词元呈现极端长尾分布,其中稀少但关键的状态切换词元易在标准交叉熵训练中被边缘化;其次,两个数据源具有不对称监督价值:HH序列带对话轮转换权威但语义嘈杂,HA序列带语义可靠但话轮转换结构简单。为在单一目标中同时解决这两个问题,我们引入源感知校准(SAC)损失函数,结合对状态转换词元受限词表的逻辑值调整与源感知加权机制,将各数据源定向引导至其最擅长监督的能力维度。实验表明,在严格限制HH口语对话语料库词元量的条件下,本模型在话轮转换熟练度与语义能力上均显著优于合成数据基线,SAC进一步缓解了严重的类别不平衡问题。当扩展至通过按比例上采样各数据源以保持混合比例构建的更大训练语料库时,本方法成功恢复了基础LLM的固有语义能力。 总结而言,我们的贡献有三方面: - •提出基于有限状态机的全双工对话解耦数据方法,其中话轮转换从真实HH口语对话学习,语义能力通过可配置HA数据独立塑造。 - •设计完全基于规则的事件引导转换方法,将复杂声学交互序列化为因果有限状态机序列带,实现真实HH对话数据的可扩展构建。 - •引入SAC损失函数,校准状态转换词元的长尾分布并在数据源间专业化优化。 ## 2 相关工作 **话轮转换事件分类**:话轮转换事件分类是沿对话时间轴构建真值事件标签的标注方案,支持事件预测与分析等下游任务(Patamia et al., 2025; Castillo-López et al., 2025; Heldner and Edlund, 2010; Arora et al., 2025; Threlkeld et al., 2022)。现有方案可根据事件定义的时间单元组织:基于分块的方法将时间轴分割为等长帧并分配每帧标签(Heldner and Edlund, 2010; Ekstedt and Skantze, 2022; Arora et al., 2025),提供适合帧级神经架构的精细时间分辨率。基于话轮间停顿单元(IPU)的方法则在由静音阈值界定的IPU边界定义事件(Ekstedt and Skantze, 2020; Wang et al., 2024a),生成与文本分块边界自然对齐的语言学连贯单元。我们采用IPU方法,因其特性使规则化序列化至有限状态机序列带变得简便。 **全双工监督数据策略**:全双工监督数据沿两条路径构建。第一条依赖*合成生成*:通过提示LLM生成标注有指定话轮转换控制词元的对话(Wang et al., 2024b),或通过基于规则的流程(如在预定位置插入用户打断)组装对话(Xie and Wu, 2024)。根本困难在于LLM主要在结构化非重叠文本上训练,缺乏模拟真实人类对话精细话轮转换动态的能力。第二条路径采用*真实口语对话语料库*。端到端模型通过隐式监督利用此类语料库,直接从原始交错音频词元中学习而无需显式状态标签(Nguyen et al., 2023; Défossez et al., 2024)。模块化方法则应用语音活动检测和启发式规则从真实音频导出状态标签,在固定声学分块上训练专用状态分类器(Liao et al., 2025; Chen et al., 2025)。我们的设定提出质性不同的挑战:无需在固定声学分块上分类状态,而是必须在交错文本词元流中插入离散状态转换词元——这是一种无法仅从语音活动推导、需要显式话轮转换事件识别的监督形式。 参见图2:话轮转换事件分类与事件引导序列带序列化示例。绿色、蓝色和橙色块分别表示用户内容、智能体内容和状态转换词元(缩写形式,如\[C\.L\]表示\[C\.LISTEN\])。每个用户块前的角色前缀词元为简洁起见已省略。 ## 3 数据转换 基于NFSM框架,我们将两个互补语料库序列化为单一因果有限状态机序列带格式:真实HH口语对话用于精细话轮转换动态,适配口语风格的HA文本对话用于保留语义能力。本节先简要回顾NFSM,再描述两个语料库的转换流程。 ### 3.1 预备知识:NFSM框架 NFSM(Wang et al., 2024b)将对话话轮转换建模为由LLM直接管理的显式状态转换问题,该LLM操作由`SPEAK`状态和`LISTEN`状态组成的双状态机。转换通过词表词元实现:`[C\.SPEAK]`和`[C\.LISTEN]`用于延续当前状态,`[S\.SPEAK]`和`[S\.LISTEN]`用于切换至相反状态。状态转换与响应生成均序列化至单一因果序列带,遵循标准下一词元预测范式。关键的是,该序列带上的每个自回归解码步骤由三类事件按优先级递减触发:语音驱动词元的生成、新感知分块的到达或运动处理的完成。此统一序列异步同步感知与运动模块,允许标准文本LLM无需架构修改即可控制实时全双工交互。 ### 3.2 事件引导的人类-人类数据转换 基于解耦数据方法,HH数据转换的主要目标是构建严格镜像人类话轮转换行为的真值序列带。核心见解在于:状态转换词元插入可作为话轮转换动态的近似,而话轮转换动态等同于话轮转换事件的时间序列。因此,我们提出事件引导的转换策略。 转换策略遵循两个原则:(1) 将时间轴分类为离散话轮转换事件以指导词元插入;(2) 与推理时实际遇到的有限状态机条件对齐。 **非对称预处理**:HH对话的两个通道分别指定为用户通道和智能体通道,并进行非对称处理以镜像NFSM推理时条件(如图2所示)。用户通道由NFSM部署的相同感知模块转录,生成带时间戳的细粒度文本分块及固定时长的静音词元,使LLM接触现实ASR粒度与识别错误模式。智能体通道则使用细粒度时间戳真值转录,确保LLM学习生成清洁文本而非模仿ASR伪影。分块保持尽可能细粒度——理想情况下为词级——以便后续精确事件分割。更多预处理细节见附录B.2。 | 事件 | 发起者=用户 | 发起者=智能体 | |------|------------|--------------| | T | \[S\.LISTEN\.N\] | \[S\.SPEAK\] | | C | \[C\.LISTEN\] | \[C\.SPEAK\] | | P | \[C\.LISTEN\] | \- | | G | \[C\.LISTEN\] | \[S\.LISTEN\.N\] | | BC | \[C\.SPEAK\] | \[S\.SPEAK\] | | FTI | \[C\.SPEAK\] | \[S\.LISTEN\.I\] | | BI | \[C\.SPEAK\] | \[S\.SPEAK\] | 表1:话轮转换事件与发起者14种组合的事件引导序列带序列化映射规则。和分别表示用户与智能体的文本内容。
相似文章
全双工语音对话模型中的同步与话轮转换
本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。
DuplexGen:自适应合成人机话轮切换对话
DuplexGen 引入了一种自适应合成人机话轮切换对话的方法,解决了对话式 AI 中自然交互时机的挑战。
通过通用风格感知全双工框架实现主动语音轮换
本文提出了一种通用风格感知全双工框架,包含一个轻量级的轮换控制器LPS-TC;引入了一个大规模数据集WildTurn,用于真实世界对话;并提出了一种两级评估方案,以增强对话系统中的主动语音交互和响应质量。
TurnNat:双人对话中轮流发言自然性的自动评估
TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。
X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction
This paper introduces X2-Turn, a frame-synchronous dual-head model that jointly performs streaming ASR and turn state prediction on shared representations, improving turn-taking accuracy and latency in spoken dialogue systems.