继续、适应或让步:全双工代理中对重叠语音的轮内适应
摘要
论文介绍了Duplex Cue,一个评估全双工语音代理轮内适应的框架,通过比较人类和模型对重叠语音的反应。
arXiv:2609.13117v1 Announce Type: new
摘要:全双工评估通常强调代理是继续说话还是停止。这种二元性无法表达人类常用的第三种响应:在继续说话的同时,融入听者刚刚贡献的内容。这种贡献可能是一个缺失的词、一个更正或一个澄清。我们介绍了Duplex Cue,这是对全双工语音代理中这种\emph{轮内适应}的评估。Duplex Cue 将听者意图(反向通道、合作或干扰)与说话者行为分离:继续不变、在轮内适应或让步。适应包括确认和内容修订。在一个使用300个人工确认线索的单模型案例研究中,这些线索来自未经脚本的英语对话,我们比较了录制的人类响应与重放听者音频时生成的PersonaPlex延续。我们保留了208对,其中持续说话者在线索开始时活跃,并且在每种条件下都有可评分的响应。在66对合作线索中,录制的说话者在68.2\%的情况下适应,而PersonaPlex为34.8\%。模型在其他情况下继续不变(42.4\%)或让步(22.7\%)。这些发现表明了为什么评估自然语音交互需要衡量代理对听者贡献的响应方式,以及它是否继续说话。
查看缓存全文
缓存时间: 2026/09/14 08:44
# 全双工智能体中应对重叠语音的话轮内适配 来源:https://arxiv.org/html/2609.13117 ## 继续、适配或让出:全双工智能体中应对重叠语音的话轮内适配 Tyler Baumgartner, Nikhil Johri 附属机构: Brandon Tai, Candice Fan, Luc Debaupte, 附属机构: Ruben Aguilar, Bill Wang, 和 Yi Zhong 附属机构:Besimple AI, 加州圣马特奥市 电子邮箱:[[email protected]](mailto:) ###### 摘要 全双工评估通常关注智能体是继续发言还是停止发言。这种二元分类无法表达人类日常使用的第三种回应方式:在继续发言的同时,整合听者刚刚提供的内容。该贡献可能是一个缺失的词汇、一个纠正或一个澄清。我们引入了“双工提示”(Duplex Cue),用于评估全双工语音智能体中的这种*话轮内适配*。双工提示将听者的意图(反馈信号、协作或打断)与说话者的行为区分开来:保持不变地继续、在话轮内适配或让出话轮。适配包括确认和内容修订。在一个使用300个人工确认提示(源自未经脚本化的英语对话)的单模型案例研究中,我们比较了记录的人类回应与在回放听者音频时生成的PersonaPlex延续。我们保留了208对样本,其中持续发言者在提示开始时处于活动状态,并且在每种条件下都有可评分的回应。在66对协作性样本中,记录的说话者在68.2%的情况下进行了适配,而PersonaPlex的比例为34.8%。模型在其他情况下选择保持不变地继续(42.4%)或让出(22.7%)。这些发现表明,评估自然语音交互不仅需要衡量智能体是否继续发言,还需要衡量它如何回应听者的贡献。 ## 1 引言 在我们录制的一段对话中,一个说话者在搜寻一个名字时说到一半卡住了;听者在其仍在思考时提供了该名字的第一个音节,然后提供了全名。说话者完成了这个名字并继续讨论,将这一贡献视为需要采纳的内容,而非停止发言的请求。这一贡献帮助塑造了当前的语句,而无需开启新的话轮。一个全双工智能体面对同样的提示,可能继续其原本的思路,采纳建议,或停止发言让听者说话。每种回应都意味着不同的交互。 我们研究*话轮内适配*:在当前话轮内,对重叠贡献的有据回应,包括确认、改写和实质性修订。这一区分对于必须在发言时倾听的全双工语音智能体至关重要。当听者试图取得发言权时,及时停止可能有用,但协作性的完成或澄清反而可能邀请智能体调整其当前语句。反之,不间断的发言可能会掩盖未被察觉的贡献。 现有框架无法清晰区分在保持发言权的同时进行适配的情况。最近的一项全双工综述[19]从结构上体现了这一缺失。它在其意图轴上定义了“修复”(Repair),但该术语并未出现在其任何诊断单元格、状态机转换或覆盖表中。其回应轴(继续、停止、等待、反馈信号、忽略、发起)没有为“带修订的继续”设置对应选项。 “双工提示”用两个独立的判断来描述每个事件。在两人对话中,假设说话者A持有发言权,说话者B的贡献根据其局部意图被标记为“反馈信号”(Backchannel)、“协作”(Collaboration)或“打断”(Interruption)。说话者A的回应被标记为“继续”(Continued)、“适配”(Adapted)或“让出”(Yielded)。由此产生的矩阵将所做出的贡献与其所接受的行为区分开来。录制的回应为人们如何处理相同提示提供了参考;与参考的差异通过各个回应类别进行解读。 我们做出三项贡献:操作性地区分话轮内采纳与话轮交接;一个包含2,591个提示(来自20.32小时未经脚本化的对话)的、与证据关联的清单;以及一个配对的PersonaPlex案例研究,展示了在协作性提示上,保持不变的继续和让出各自如何导致巨大的适配差距。该评估使用了有条件对话延续与录制搭档的设置[22, 23]。其主要输出是针对每种提示类型的回应分布。 ## 2 相关工作 #### 听者贡献与重叠话语 听者在话语生成过程中帮助塑造话语。Goodwin在延长话轮中区分了延续语(continuers)与评价语(assessments)[14],而Lerner则研究了协作性完成,以及原始说话者如何接受、整合或忽略它们[15]。Jefferson区分了显性纠正与嵌入正在进行的谈话中的纠正[13]。重叠本身并不意味着争夺发言权:Schegloff描述了非竞争性重叠以及参与者用来解决竞争性谈话的实践[16]。Bavelas等人也提供了实验证据,表明分心的听者会减少其具体内容回应并损害叙述者讲故事[17]。这些发现促使我们同时考察听者的贡献和说话者的回应。会话分析的重叠分类学和近期的全双工研究进一步区分了重叠言语的时序和功能[18, 19]。“双工提示”借鉴了这些区分,为语音智能体评估定义了操作性的提示意图和回应标签。 #### 全双工与话轮转换评估 现有基准测试衡量了应对重叠语音的几个方面。Full-Duplex-Bench评估话轮行为和回应语义[1, 2],后续版本测试了交互式纠正处理[3]和非流利情况下的工具使用[4]。HumDial-FDBench评估表演对话中的打断和拒绝[5],而EchoChain测试了中断下的状态更新[8]。FD-Bench和MTR-DuplexBench评估了多轮交互中的回应质量[10, 12];FLEXI包含了语义话题转换和智能体发起的打断[11]。相关工作评估了语义中断点和停止成本[6]、话轮事件理解与预测[9],以及用于话轮结束和中断检测的事件分类学[7]。“双工提示”关注的是持续发言者是否保持不变地继续、在话轮内适配或让出发言权。它针对来自未经脚本化对话的反馈信号、协作性贡献和打断,分别衡量这些回应,并区分当前话轮内的采纳与交接后的采纳。 #### 有条件对话延续 dGSLM和SyncLLM从真实的两通道对话前缀生成延续[20, 21]。NTPP和TurnGuide评估了这样一种设置:一个说话者的录制音频继续播放,而模型生成另一个说话者的回应[22, 23]。我们采用了这种设置,在听者贡献之前立即选择生成切换点,并将生成的回应与相应的录制回应进行比较。我们的案例研究评估了PersonaPlex,它为Moshi语音-文本架构添加了语音和角色条件[24, 25]。 ## 3 定义 在两人对话中,说话者A持有发言权,说话者B在A仍在思考时做出贡献。我们称B的贡献为*提示*(cue),称A随后的行为为*回应*(response)。每个事件由两个独立的标签描述:B的提示意图和A的观察回应。 ### 3.1 提示意图 *反馈信号*(Backchannel)支持A的持续发言,不要求其内容或方向发生改变。*协作*(Collaboration)提供答案、纠正、澄清请求、约束或完成,以帮助塑造A的当前语句,而不试图取得发言权。*打断*(Interruption)试图从A处取得或保留发言权。 ### 3.2 观察回应 *继续*(Continued)描述A如同B未做出贡献般继续发言。*适配*(Adapted)描述A在当前话轮内通过确认、改写或实质性修订来回应B。适配关注的是局部采纳,而非纠正的正确性。*让出*(Yielded)描述A将发言权交给B以作回应。 ## 4 方法 ### 4.1 语料库与提示审核 该语料库包含80段双通道英语对话,总计20.32小时,有39名年龄在18-64岁之间的参与者。录音平均时长15.24分钟(范围14.99-30.36)。收集说明要求进行自然的、未经脚本化的对话。 基于能量的语音活动检测(VAD)识别每条音轨上的区间。ElevenLabs Scribe v2提供了转录稿和单词时间戳。单词被分配到包含其中点或最近区间的VAD区间,平局则分配到较早的区间;时间戳被裁剪或移动以适应该区间。跨说话者片段比较提出了在较早说话者活动期间或其最后一个词之后0.5秒内开始的贡献。 单个模型审核筛选了所有10,478个提案的资格。B开始时,A必须持有发言权并处于思考状态,且有证据表明A的话轮延续到了B的第一个词。A的词之间允许小于0.5秒的停顿,包括在A话轮内的短暂间隙中开始的提示。A在生成切换点(B开始前80毫秒)也必须处于句子中间。这些标准适用于录制对话;生成的A活动则单独评估。 合格的贡献随后根据意图进行分类,模棱两可、不可用、重复和不符合分类学的案例被拒绝。审核员考虑了B在周围源语流(包括A随后的回应)中正在发展的贡献,并独立于A是否配合来确定B的意图。每个决定都保留了带时间戳的证据、理由和最接近的替代选项。对于打断,审核员还确定了B最早明确表示要取得发言权的词。生成仍然相对于B的第一个词开始。恢复的提示审核会话使用OpenAI Codex(使用gpt-6-astra模型,推理强度设为中或高)。清单包含1,896个反馈信号,361个协作,334个打断;附录A报告了拒绝计数。 一位人类审核员标记了一个包含60个提示的平衡音频样本,模型标签被隐藏。一致性为49/60(81.7%):19/20个反馈信号,14/20个协作,16/20个打断。十一个分歧中有七个跨越了协作-打断的边界。此验证样本来自前十个对话,并与评估选择队列分开(附录B.1)。 ### 4.2 选择与资格 多位人类审核员对更广泛的候选提示池进行了额外的音频审核,模型分配的标签被隐藏。审核优先考虑与A的持续语音在时序上明显重叠,且B在目标提示之外做出的额外贡献较少的情况,以减少将A的回应归因于该提示的歧义。最终的队列包含300个人工确认的试次,在三个提示类别间平衡,来自65个对话和38个参与者。 在生成窗口期间,B的录制通道保持可听。回应的判断锚定于所选提示。对于主要比较,我们进一步要求在两种条件下,A在提示开始时都处于活动状态,并且两个回应都可评分。表1说明了最终样本的情况。对于每种提示类别,我们比较了录制回应和生成回应中,针对相同提示的“继续”、“适配”和“让出”的计数和比例。因此,选择定义了一个受控的人工确认提示集,而非保留它们在整个语料库中的比例。 表1:300个选定试次的资格统计。生成后的活动和转录稿资格筛选出208对试次(416个回应)用于主要比较。 ### 4.3 有条件生成 在模型条件设定之前,我们将A的完整源音轨转换为ElevenLabs的固定预制“George”语音,以尊重贡献者不进行克隆的承诺,同时不构建特定参与者的语音模型。转换后的音轨在切换点间重复使用。B的输入和A的录制参考回应保留了其原始语音。 我们遵循NTPP和TurnGuide[22, 23]中使用的有条件对话延续方法:模型继续一个说话者的通道,而另一个说话者的录制音频作为输入。对于每个试次,我们将nvidia/personaplex-7b-v1模型条件设定为在生成切换点之前最多120秒的双说话者同步音频。B的录制音频被提供给模型的输入流,而A转换语音的音频令牌通过教师强制(teacher forcing)提供给其输出流。这建立了之前的对话作为模型的倾听和发言历史,其中A占据了模型将要继续的角色。在切换点(B提示开始前80毫秒,并裁剪为零),我们停止提供A的录制令牌,并允许模型在同一输出流上生成自己的延续,持续十秒。B的音频(包括目标提示)在整个生成过程中按其原始时间线继续播放。未提供提示标签、任务类别或角色文本。A在相同窗口内的原始录制延续构成“源”条件。附录D指定了转换和推理设置。 ### 4.4 回应审核与人工验证 我们使用ElevenLabs Scribe v2获得了被评估输出的逐词时间戳转录稿。每个审核包结合了最多15秒的先前输入和输出转录稿,与需要评分的十秒输出,以及B在相同时间间隔内的输入。这为评分者提供了A先前的对话轨迹、B正在发展的贡献,以及A在共享时间线上的回应。模型回应包仅包含模型在试次开始后的延续;源延续被隐藏。 每个包由OpenAI Codex(使用gpt-6-astra模型,推理强度设为中)单独审核,使用回应分类技能:一套书面指令,指定了标签定义、证据要求和结构化审核格式。相同的技能应用于两种条件,提示标签、预期动作和配对回应判断被隐藏。
相似文章
DuplexGen:自适应合成人机话轮切换对话
DuplexGen 引入了一种自适应合成人机话轮切换对话的方法,解决了对话式 AI 中自然交互时机的挑战。
DuplexSpeechBench-IFEval: 评估全双工语音代理中的隐式指令遵循
本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。
全双工 vs 半双工——AI语音模型的频谱 [D]
对AI语音模型中半双工与全双工架构的分析,讨论了重叠、反馈和打断等关键特性,这些特性使语音助手听起来很机械。
全双工语音对话模型中的同步与话轮转换
本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。
Omni-DuplexEval: 评估实时双工全模态交互
本文介绍了Omni-DuplexEval,这是一个用于多模态大语言模型中实时双工交互的基准测试和自动评估框架,旨在评估流式场景下的连续响应生成和主动事件检测。