标签
论文介绍了TACT,一个用于评估全双工口语对话模型中话轮转换的基准,它使用基于意图条件的连续评分来替代二元规则,展示了与人类判断更好的一致性。
本文评估了全双工语音模型在决定何时发言方面的能力,发现像Moshi和PersonaPlex这样的模型主要响应被提及或沉默,而不是内容驱动的触发器,如错误声明或危险,从而识别出内容理解上的差距。
TurnBench介绍了一个多领域基准测试,用于评估口语对话中的话轮转换动态,特点是拥有手工标注的语料库和标准化的评估协议,用于检测话轮结束和中断。
本文提出利用从大型语言模型派生的语义不确定性来预测口语对话中话轮转换的相关位置,在对话系统中展示了优于基线的性能。
本文提出一种解耦数据方法,通过从真实口语对话中学习轮次转换,同时利用文本处理语义,借助神经有限状态机框架来增强自然性并保留语义能力。
本文提出了一种多任务学习方法,通过利用轮次交替动态来增强多方对话中的意图识别,其性能优于忽略交互模式的现有方法。
一篇关于 AI 语音代理难以应对现实客户行为(如打断、自我纠正和句中改变话题)的观察文章,指出话轮转换是企业级语音 AI 面临的关键挑战。
This paper introduces X2-Turn, a frame-synchronous dual-head model that jointly performs streaming ASR and turn state prediction on shared representations, improving turn-taking accuracy and latency in spoken dialogue systems.
DuplexGen 引入了一种自适应合成人机话轮切换对话的方法,解决了对话式 AI 中自然交互时机的挑战。
介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。
本文探讨了话轮转换中的沉默阈值如何在人类与AI生成的话语中有所不同,采用远距观看方法分析对话模式。
本文重新审视多方对话中的受话者识别,提出用连续指向级别替代离散标签,并表明指向不仅与话轮转换相关,还涉及目光注视和反馈信号,暗示了层级结构。
提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。
TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。
一位开发者描述了构建一个多智能体语音社交推理游戏的过程,通过一个中央指挥解决了轮流发言问题,但在共享记忆以及在将对话历史压缩为结构化状态时保留社交潜台词方面遇到了困难。
本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。
本文评估了大语言模型(LLMs)和多模态大语言模型在多方会议对话中的收件人检测、话轮转换预测和下一说话人预测能力。结果表明,基于文本的LLMs在下一说话人预测上优于监督模型和人类,而多模态LLMs在其他任务上比纯文本模型有所提升,但表现仍低于人类。
BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。