全双工语音模型在被问及时发言,而非在需要时

arXiv cs.CL 论文

摘要

本文评估了全双工语音模型在决定何时发言方面的能力,发现像Moshi和PersonaPlex这样的模型主要响应被提及或沉默,而不是内容驱动的触发器,如错误声明或危险,从而识别出内容理解上的差距。

arXiv:2609.19596v1 公告类型:新 摘要:全双工语音模型同时监听和发言,承诺提供始终在线的助手。然而,它们还必须决定何时应该发言。人类听众在被提及或说话者停止时发言,但也自行选择以纠正错误声明、补充缺失单词或警告危险。我们询问全双工模型是否做同样的事情。为了将发言的原因与机会分离,我们构建了上下文匹配的英语独白,其中在主题内只有触发语句变化,根据轮次分配规则定义了10个条件,并压缩词间停顿以限制沉默创造的机会。在五个模型家族中,被提及和沉默远比错误事实或危险更可靠的触发器。在Moshi和PersonaPlex中,错误事实的帧级文本令牌概率在触发结束后的前2秒内平均低于中性。停顿或允许中断也无法缩小这一差距。给予发言机会后,Moshi和PersonaPlex回答大多数直接问题,但非空错误事实回复中挑战声明的比例仅为.14--.15,危险回复中警告危险的比例为.04--.07。因此,本文识别出在发言启动和响应内容方面的差距。缩小这一差距需要真正的内容理解和基于此的干预决策。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:58

# 全双工语音模型:被提问时开口,而非需要时发言
来源:https://arxiv.org/html/2609.19596
###### 摘要

全双工语音模型能够同时听和说,有望实现始终在线的助手功能。但它们同样需要决定何时应开口说话。人类听者会在被指名时或说话者停顿时发言,但也会主动选择纠正错误主张、补充遗漏词汇或发出危险警告。本文探究全双工模型是否具备同样的能力。为区分“发言理由”与“发言时机”,我们构建了语境匹配的英语独白语料,其中仅触发语句在主题内变化。基于轮次分配规则定义了10种实验条件,并通过压缩词间停顿来限制静音带来的发言机会。在五个模型家族的测试中,“被指名”和“静音”作为触发信号的可靠性远高于“错误事实”或“危险提示”。Moshi和PersonaPlex模型在触发语句结束后的前2秒内,对错误事实的文本词元帧级概率平均值低于中性条件。插入停顿或允许打断也无法弥合这一差距。当获得发言权时,Moshi和PersonaPlex虽能回答大多数直接问题,但针对错误事实的非空回复中仅有0.14-0.15的比例会质疑该主张,而针对危险提示的回复中仅有0.04-0.07的比例会发出警告。本文揭示了语音发起机制与响应内容两方面的缺陷,弥合缺陷需要基于真正的内容理解进行干预决策111刺激材料、模型输出和评估代码已发布于https://github.com/vocaliodmiku/take-the-floor。

###### 索引词:

全双工语音对话、轮次转换、主动选择、内容驱动干预

††地址:1康涅狄格大学2德克萨斯大学奥斯汀分校3X Square机器人公司
4牛津大学
linkai\.peng@uconn\.edu## 1引言

Moshi\[4 (https://arxiv.org/html/2609.19596#bib.bib8)\]、PersonaPlex\[17 (https://arxiv.org/html/2609.19596#bib.bib9)\]和VoiceChat\[14 (https://arxiv.org/html/2609.19596#bib.bib10)\]等全双工语音模型允许用户和系统同时听说。系统必须决定何时*让出发言权*(当用户开始说话时)以及何时*获取发言权*。在某些场景中,用户的话语在未明确请求或停顿前就需要回应。例如,导师可能需要在学生解释推理过程时纠正其误解,若等到学生寻求帮助,错误观点可能已影响后续解释。面试教练也可能在学习者卡顿时提供帮助。警告则更具紧迫性,助手需在用户执行危险操作前发声。

现有评估主要关注轮次转换和用户发起事件。FD-Bench\[16 (https://arxiv.org/html/2609.19596#bib.bib5)\]与HumDial\[24 (https://arxiv.org/html/2609.19596#bib.bib6)\]衡量停顿处理、用户中断和多轮对话连续性。模型主动发言在FLEXI的紧急中断场景\[7 (https://arxiv.org/html/2609.19596#bib.bib7)\]和Instruct-FD\[22 (https://arxiv.org/html/2609.19596#bib.bib4)\]中有所涉及,后者评估模型遵循中断指令的能力。本文关注的是:模型是否在无中断指令时自主发言?是内容还是停顿驱动该决策?我们通过系统控制匹配语境中的停顿来检验这一区别。

图1:表1 (https://arxiv.org/html/2609.19596#S3.T1)中每组条件的一个触发示例,显示用户语音(灰色,触发部分以组别颜色阴影标记)和模型回复(彩色),其中t0标记触发语句结束。触发语句摘自*睡眠*刺激材料,模型回复仅为示例。为此,我们借鉴了Sacks、Schegloff和Jefferson\[18 (https://arxiv.org/html/2609.19596#bib.bib1)\]的轮次分配规则:当前说话者可选择下一位发言者;若未选择,其他参与者可主动选择;若两者皆未发生,当前说话者可继续发言。我们区分了“被指名”与“主动选择”,并使用“让出”条件测试语言轮次结束和静音场景。主动选择使听者能在无直接请求时提供纠正、警告或补充词汇。这可能发生在词汇检索期间\[8 (https://arxiv.org/html/2609.19596#bib.bib19),10 (https://arxiv.org/html/2609.19596#bib.bib20)\]或轮次结束后\[18 (https://arxiv.org/html/2609.19596#bib.bib1)\]。他人纠正虽不受欢迎\[19 (https://arxiv.org/html/2609.19596#bib.bib2)\],但可能发生在迫在眉睫的行动前。此处“内容驱动干预”指无需被问及即对潜在问题做出回应。词汇检索可能本身邀请介入,而错误事实和危险提示则需要判断是否值得干预。这些条件将发言理由与停顿提供的机会分离。额外指令则测试明确允许打断的情况。

我们在五个模型家族和七种配置中比较了控制停顿的匹配刺激材料(表1 (https://arxiv.org/html/2609.19596#S3.T1)、图1 (https://arxiv.org/html/2609.19596#S1.F1))。实验得出三个主要发现:首先,错误事实和危险提示的开启率接近中性条件,而直接问题和静音显著提高开启率。文本词元帧级概率进一步显示错误事实激活均值较低。其次,插入静音或保留自然停顿会提升整体开启率,但内容线索与中性条件的差异取决于模型及停顿设置。插入静音时,Moshi的错误事实与危险提示开启率超过中性条件,但PersonaPlex仍低于中性条件。明确打断指令再次影响甚微。第三,给予Moshi和PersonaPlex发言权会增加其发言频率,但无法确保有效干预——它们能回答大多数直接问题,却很少纠正错误主张或警告危险。

## 2相关工作

全双工模型与轮次转换评估。全双工对话模型包括dGSLM\[13 (https://arxiv.org/html/2609.19596#bib.bib11)\]、Moshi\[4 (https://arxiv.org/html/2609.19596#bib.bib8)\]、SyncLLM和Freeze-Omni\[23 (https://arxiv.org/html/2609.19596#bib.bib12),25 (https://arxiv.org/html/2609.19596#bib.bib13)\]。Moshi采用并行音频流与内部文本独白架构。PersonaPlex增加角色控制,VoiceChat则添加工具调用功能\[17 (https://arxiv.org/html/2609.19596#bib.bib9),14 (https://arxiv.org/html/2609.19596#bib.bib10)\]。近期后训练工作聚焦于停顿处理、轮次转换、反馈信号和中断处理\[15 (https://arxiv.org/html/2609.19596#bib.bib23)\]。评估主要集中在模型发言时机及其处理用户发起事件的方式。Full-Duplex-Bench、Talking Turns、FD-Bench和HumDial衡量停顿处理、反馈信号、轮次切换、用户中断及多轮连续性\[12 (https://arxiv.org/html/2609.19596#bib.bib14),1 (https://arxiv.org/html/2609.19596#bib.bib15),16 (https://arxiv.org/html/2609.19596#bib.bib5),24 (https://arxiv.org/html/2609.19596#bib.bib6)\]。FLEXI\[7 (https://arxiv.org/html/2609.19596#bib.bib7)\]与Instruct-FD\[22 (https://arxiv.org/html/2609.19596#bib.bib4)\]也评估模型主动干预,但均未在控制停顿的相同语境中比较不同触发条件。我们的实验通过该比较检验错误事实、危险提示等线索是否影响语音开启。

轮次分配与内容驱动干预。轮次时机研究表明听者会预判轮次结束并规划回应\[21 (https://arxiv.org/html/2609.19596#bib.bib16),11 (https://arxiv.org/html/2609.19596#bib.bib3)\],TurnGPT和VAP可预测发言机会\[5 (https://arxiv.org/html/2609.19596#bib.bib17),6 (https://arxiv.org/html/2609.19596#bib.bib18)\]。回应的功能则是另一问题。词汇检索会引发候选词或协作完成\[8 (https://arxiv.org/html/2609.19596#bib.bib19),10 (https://arxiv.org/html/2609.19596#bib.bib20)\],完成标记邀请主动选择\[18 (https://arxiv.org/html/2609.19596#bib.bib1)\],反馈信号使听者保持参与而不占用发言权\[26 (https://arxiv.org/html/2609.19596#bib.bib21),20 (https://arxiv.org/html/2609.19596#bib.bib22)\],他人纠正相对自我纠正更不受欢迎\[19 (https://arxiv.org/html/2609.19596#bib.bib2)\]。这些区分促使我们评估回复是否提供触发条件所需的帮助,而不仅衡量模型是否获取发言权。

## 3方法

### 3.1刺激材料与条件

我们编写了40篇关于日常话题的第一人称英语独白。每篇包含引导语、*触发语句*和延续部分,中位总时长为50.3秒。同一话题内仅触发语句变化,其余文本完全一致。触发后用户继续说话(插入静音除外),模型需决定是否获取发言权。两个TTS语音各覆盖20个固定话题。主实验使用词级时间戳将所有词间间隙压缩至最多0.12秒,限制基于停顿的发言机会。自然停顿实验保留原始间隙,典型句末停顿约0.88秒。表1 (https://arxiv.org/html/2609.19596#S3.T1)列出九种触发条件,“中性”作为第十种条件和基线。第4.3节 (https://arxiv.org/html/2609.19596#S4.SS3)通过停顿和线索特定开场指令(如“若我有错请打断”)增加对照。由于提问后用户继续说话,“被指名”条件测试明确请求在持续语音中是否被接收,而非听者是否应在轮次中途回应。

表1:触发条件,按发言理由分组。被指名(说话者选择模型):直接问题指向模型;请求:与陈述句相同的请求;反问:问句形式但未指向模型。主动选择(听者决定):词汇检索:无法回忆某词;错误事实:归因于权威的错误主张;重复:逐字重复前句;危险:迫在眉睫的危险行动。让出(说话者让出发言权):“以上就是我的全部内容”,随后继续说话无停顿;静音:中性句子后插入1.5秒静音。

### 3.2系统与规模

主分析中的七种配置包括:Moshi基础模型(Moshiko和Moshika检查点)、Moshika-RL、PersonaPlex基础模型(PPlex)、PPlex-RL\[15 (https://arxiv.org/html/2609.19596#bib.bib23)\]、NVIDIA VoiceChat-11B、MiniCPM-o 4.5\[2 (https://arxiv.org/html/2609.19596#bib.bib24)\]和Raon-SpeechChat\[9 (https://arxiv.org/html/2609.19596#bib.bib25)\]。所有模型均使用官方默认解码设置。PersonaPlex采用默认语音和中性人格提示词“享受愉快对话”,无任何打断指令。主实验矩阵为40话题×10条件,每种配置对每个刺激材料使用5个种子(共2000次试验),Moshi则合并每个检查点的5个种子。

### 3.3测量与分析

语音开启率指在触发语句结束(t0)后4秒内\[t0, t0+4秒\),模型启动至少包含四个词的语音片段的试验比例。前1.5秒内出现此类语音的试验仍计入分母,但不计为新开启。Moshi、PersonaPlex和Raon每80毫秒音频帧生成一个文本词元,语音片段定义为词元词序列中间隙不超过0.64秒的连续段。VoiceChat和MiniCPM-o分别通过轮次边界标记和1赫兹听/说输出确定片段。

表2:五类模型在全部试验中按触发条件的语音开启率。图2:PPlex、Moshi和Raon-SpeechChat在错误事实、问题和静音条件下的试验时序图。每行代表一次试验,条形标记实质性语音,阴影带为4秒响应窗口,数字为全部试验的语音开启率。

## 4结果

### 4.1语音开启追踪“被指名”与“静音”

表2 (https://arxiv.org/html/2609.19596#S3.T2)总结了七种配置在10种条件下的语音发起率。基于中性基线及各条件相对于基线的变化,配置分为三类模式:第一类Raon-SpeechChat频繁发言,其中性基线为0.42,持续语音条件下产出0.26至0.47。相对于该基线,“被指名”和“主动选择”条件均未显示明显开启率提升,唯有静音条件将开启率提升至0.68。第二类VoiceChat和MiniCPM-o 4.5在持续语音期间保持近零开启率,仅在插入静音时主要启动。第三类四款Moshi和PersonaPlex配置介于两者之间,中性率为0.01-0.10,但能响应持续语音中的部分线索,成为主要对比组。

在四款Moshi和PersonaPlex配置中,模型发言取决于两个表层线索:被直接指名和语音中的停顿。直接问题使开启率提升+0.08至+0.24,插入1.5秒静音则从中性条件下最多0.10提升至最高0.83。两项对照实验证实这些确为表层线索:反问句(具问句形式但未指向模型)几乎无效,说明模型响应的是被提问而非问句形式;“轮次结束”语句(说话者说“以上就是我的全部内容”但继续说话)同样几乎无效,说明模型响应的是说话者实际停止而非让步词语。相比之下,需理解内容以决定是否发言的线索(错误事实、逐字重复、危险提示)与中性条件差异在七种配置中最大不超过0.06。唯一例外是词汇检索,其在PPlex和PPlex-RL中使开启率提升0.12和0.18。

为检验触发前后的语音时序动态,图2 (https://arxiv.org/html/2609.19596#S3.F2)绘制三个模型的单次试验语音片段。Raon许多片段始于触发结束前并跨越响应窗口,其高开启率反映近乎连续的说话而非对触发的响应,这也是其各条件差异小的原因。PPlex和Moshi在问题与静音条件下呈现更多触发后语音,错误事实列则稀疏。

图3:Moshi与PPlex相对于中性条件的非静音文本词元概率。绘制的P(word)表示Ptext,曲线显示与中性条件的平均差异。
### 4.2文本词元概率追踪“请求”与“静音”

需注意未发言可能意味着模型对内容线索无感。生成倾向可能已变化但未达启动阈值。因此我们检查Moshi和PPlex的文本通道非静音词元帧级概率,计算公式为:

Ptext(t)=1−P(⟨PAD⟩|t)−P(⟨EPAD⟩|t)
其中⟨PAD⟩和⟨EPAD⟩为填充文本流词间间隙的填充符与结束填充符。

我们将四种条件与中性条件对比。“问题”

相似文章