标签
OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。
本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。
NVIDIA 推出了 Nemotron 3 VoiceChat,这是一个AI模型,能够实现实时全双工语音交互,允许自然中断,可通过实时演示体验,作为其开源 NeMo Speech 框架的一部分。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
OpenAI 描述了如何构建 GPT-Live,一个全双工实时语音 AI 系统,它消除了轮流检测器,实现了自然的连续对话。文章详细介绍了六个月内推理、上下文管理和媒体传输方面的架构改进。
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。
介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。
OpenAI将GPT-Live的全双工语音控制集成到Codex和ChatGPT桌面应用中,实现免提智能编码与多线程任务执行。
本文评估了Gemini模型作为音频裁判对全双工语音代理对话进行评分的可靠性,发现Gemini 2.5 Flash在多数维度上与人类评分者一致性较强,但模型替换需要重新验证。
OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。
TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。
BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。
本文识别了全双工语音语言模型中的"状态惯性",即在用户打断时,模型的内部预测焦点滞后,并提出了一种无需训练的激活引导方法来改善打断处理。
Kyutai Labs 发布了一篇新论文,使用强化学习对语音模型(Moshi 和 PersonaPlex)进行后训练,以实现更像人类的交互,包括何时回应、等待或发出倾听提示。
对AI语音模型中半双工与全双工架构的分析,讨论了重叠、反馈和打断等关键特性,这些特性使语音助手听起来很机械。
Raon-Speech是一个9B参数的语音语言模型,支持英语和韩语的理解、回答和生成,并具有全双工扩展Raon-SpeechChat,可实现自然的实时对话。它在42个基准测试上取得了强劲的性能,并且完全开源。
本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。