full-duplex-speech

标签

Cards List
#full-duplex-speech

FD-VAD:面向流式全双工语音的语义端点检测

arXiv cs.CL ↗ · 昨天 缓存

FD-VAD 提出一种无需 ASR、流式运行的语义端点检测方法,将因果音频窗口直接映射为 Continue/Stop 决策,适用于全双工语音智能体。该方法结合冻结的语音编码器与参数高效适配的语言模型,在 TurnBench 上取得了最先进(state-of-the-art)的 EOT 召回率。

0 人收藏 0 人点赞
#full-duplex-speech

全双工语音模型在被问及时发言,而非在需要时

arXiv cs.CL ↗ · 2026-09-18 缓存

本文评估了全双工语音模型在决定何时发言方面的能力,发现像Moshi和PersonaPlex这样的模型主要响应被提及或沉默,而不是内容驱动的触发器,如错误声明或危险,从而识别出内容理解上的差距。

0 人收藏 0 人点赞
#full-duplex-speech

我刚刚说了什么?——面向全双工语音模型的自我监听机制

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

本文提出"自我聆听"方法,应用于全双工口语模型。该方法将模型生成的语音反馈作为输入,以增强对话打断时的恢复能力,并提升生成语音与实际口语回应的一致性。

0 人收藏 0 人点赞
#full-duplex-speech

释放全双工语音模型中LLM的能力

Hugging Face Daily Papers ↗ · 2026-05-04 缓存

提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。

0 人收藏 0 人点赞
#full-duplex-speech

OmniFlatten:一种用于无缝语音对话的端到端 GPT 模型

Papers with Code Trending ↗ · 2024-10-23 缓存

OmniFlatten 是一种新颖的基于 GPT 的模型,通过一种多阶段后训练技术整合语音和文本,在不改变原始架构的情况下实现实时全双工语音对话。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈