full-duplex

标签

Cards List
#full-duplex

OpenAI推出GPT-Live-1用于全双工语音代理(阅读时间2分钟)

TLDR AI · 昨天 缓存

OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。

0 人收藏 0 人点赞
#full-duplex

DuplexSpeechBench-IFEval: 评估全双工语音代理中的隐式指令遵循

arXiv cs.AI · 2026-09-04 缓存

本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。

0 人收藏 0 人点赞
#full-duplex

@simplifyinAI: 大多数语音助手都需要你等待轮次,你说话,然后它回应,来回交替。NVIDIA 刚刚打造了一个不这样的助手……

X AI KOLs Timeline · 2026-08-22 缓存

NVIDIA 推出了 Nemotron 3 VoiceChat,这是一个AI模型,能够实现实时全双工语音交互,允许自然中断,可通过实时演示体验,作为其开源 NeMo Speech 框架的一部分。

0 人收藏 0 人点赞
#full-duplex

nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)

Reddit r/LocalLLaMA · 2026-08-03 缓存

NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。

0 人收藏 0 人点赞
#full-duplex

OpenAI:我们如何在六个月内构建响应式语音AI的实时系统

Reddit r/singularity · 2026-08-03 缓存

OpenAI 描述了如何构建 GPT-Live,一个全双工实时语音 AI 系统,它消除了轮流检测器,实现了自然的连续对话。文章详细介绍了六个月内推理、上下文管理和媒体传输方面的架构改进。

0 人收藏 0 人点赞
#full-duplex

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

arXiv cs.CL · 2026-08-03 缓存

M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.

0 人收藏 0 人点赞
#full-duplex

微软测试新的 MAI Realtime 语音模型(2分钟阅读)

TLDR AI · 2026-08-03 缓存

微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。

0 人收藏 0 人点赞
#full-duplex

Instruct-FD:你的全双工语音系统能遵循轮换指令吗?

arXiv cs.CL · 2026-07-24 缓存

介绍了Instruct-FD,一个用于评估全双工语音系统能否遵循显式轮换指令的基准。结果显示最佳模型仅达到64.4%的遵从率,凸显了在遵循指令的轮换管理方面存在显著差距。

0 人收藏 0 人点赞
#full-duplex

智能编码实现免提操作:OpenAI将GPT-Live的全双工语音控制引入Codex和桌面版ChatGPT(5分钟阅读)

TLDR AI · 2026-07-24 缓存

OpenAI将GPT-Live的全双工语音控制集成到Codex和ChatGPT桌面应用中,实现免提智能编码与多线程任务执行。

0 人收藏 0 人点赞
#full-duplex

LALM音频裁判用于全双工语音代理的可靠性评估

arXiv cs.CL · 2026-07-10 缓存

本文评估了Gemini模型作为音频裁判对全双工语音代理对话进行评分的可靠性,发现Gemini 2.5 Flash在多数维度上与人类评分者一致性较强,但模型替换需要重新验证。

0 人收藏 0 人点赞
#full-duplex

GPT‑Live

Hacker News Top · 2026-07-08 缓存

OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。

0 人收藏 0 人点赞
#full-duplex

OpenAI 发布新语音模型,实现更自然的实时对话

TechCrunch AI · 2026-07-08 缓存

OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。

0 人收藏 0 人点赞
#full-duplex

层次化声学-语义建模:全双工SLM的模态分离与语义一致性

arXiv cs.CL · 2026-07-08 缓存

本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。

0 人收藏 0 人点赞
#full-duplex

TurnNat:双人对话中轮流发言自然性的自动评估

arXiv cs.CL · 2026-07-03 缓存

TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。

0 人收藏 0 人点赞
#full-duplex

BayLing-Duplex: 单一自回归大语言模型实现原生全双工语音对话

arXiv cs.CL · 2026-06-15 缓存

BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。

0 人收藏 0 人点赞
#full-duplex

通过激活引导克服全双工语音语言模型中的状态惯性

arXiv cs.CL · 2026-06-11 缓存

本文识别了全双工语音语言模型中的"状态惯性",即在用户打断时,模型的内部预测焦点滞后,并提出了一种无需训练的激活引导方法来改善打断处理。

0 人收藏 0 人点赞
#full-duplex

@kyutai_labs: 新论文:全双工语音模型中的多面互动对齐 我们使用强化学习对语音模型(Mo…

X AI KOLs Following · 2026-06-10 缓存

Kyutai Labs 发布了一篇新论文,使用强化学习对语音模型(Moshi 和 PersonaPlex)进行后训练,以实现更像人类的交互,包括何时回应、等待或发出倾听提示。

0 人收藏 0 人点赞
#full-duplex

全双工 vs 半双工——AI语音模型的频谱 [D]

Reddit r/MachineLearning · 2026-06-01

对AI语音模型中半双工与全双工架构的分析,讨论了重叠、反馈和打断等关键特性,这些特性使语音助手听起来很机械。

0 人收藏 0 人点赞
#full-duplex

Raon-Speech 技术报告

arXiv cs.CL · 2026-05-26 缓存

Raon-Speech是一个9B参数的语音语言模型,支持英语和韩语的理解、回答和生成,并具有全双工扩展Raon-SpeechChat,可实现自然的实时对话。它在42个基准测试上取得了强劲的性能,并且完全开源。

0 人收藏 0 人点赞
#full-duplex

全双工语音对话模型中的同步与话轮转换

arXiv cs.CL · 2026-05-21 缓存

本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈