OmniFlatten:一种用于无缝语音对话的端到端 GPT 模型
摘要
OmniFlatten 是一种新颖的基于 GPT 的模型,通过一种多阶段后训练技术整合语音和文本,在不改变原始架构的情况下实现实时全双工语音对话。
查看缓存全文
缓存时间: 2026/05/08 08:51
论文页面 - OmniFlatten:一种用于无缝语音对话的端到端 GPT 模型
来源:https://huggingface.co/papers/2410.17799 发布于 2024 年 10 月 23 日
摘要
一种基于 GPT 的新型模型 OmniFlatten,通过一种多阶段后训练技术整合语音和文本,无需更改原始模型架构,即可实现实时的、自然的、全双工口语对话。
全双工口语对话系统相比传统的基于轮次的对话系统有了显著进步,因为它们允许同时进行双向通信,更加贴近人与人之间的互动。然而,在全双工对话系统中实现低延迟和自然交互仍然是一个重大挑战,特别是考虑到人类对话的动态特性,如打断、反馈(backchannels)和重叠语音。在本文中,我们介绍了一种用于全双工对话的新型端到端 GPT 基础模型 OmniFlatten,它能够以低延迟有效模拟自然对话中固有的复杂行为。为了实现全双工通信能力,我们提出了一种多阶段后训练方案,逐步将一个基于文本的大型语言模型(LLM)骨干网络适配为语音-文本对话 LLM,能够在不修改骨干 LLM 架构的情况下实时生成文本和语音。训练过程包括三个阶段:模态对齐、半双工对话学习以及全双工对话学习。在所有训练阶段中,我们使用展平操作标准化数据,这使得我们能够统一不同模态和任务下的训练方法和模型架构。我们的方法提供了一种直观的建模技术,并为开发高效且自然的端到端全双工口语对话系统提供了有前景的研究方向。由 OmniFlatten 生成的对话音频样本可在此网站找到:https://omniflatten.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2410.17799) 查看 PDF (https://arxiv.org/pdf/2410.17799) GitHub57.7kauto (https://github.com/karpathy/nanogpt) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2410.17799)
在你的 Agent 中获取这篇论文:
hf papers read 2410\.17799
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2410.17799 以从此页面建立链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2410.17799 以从此页面建立链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2410.17799 以从此页面建立链接。
包含此论文的收藏集 5
浏览包含此论文的 5 个收藏集 (https://huggingface.co/collections?paper=2410.17799)
相似文章
GPT‑Live
OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。
GPT新语音模型简直太疯狂了。
OpenAI 的新 GPT 语音模型实现了高度逼真、低延迟的实时语音对话,并具备情感表达能力,标志着 AI 语音交互的一次重大飞跃。
OpenAI 发布新语音模型,实现更自然的实时对话
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。
Natural Conversations with GPT-Live
OpenAI 展示新版语音模型在个性化和自然度上的突破,能够进行自然的头脑风暴式对话,表现出共情和适时插话能力,接近人类对话节奏。
k2-fsa/OmniVoice
OmniVoice 是一款大规模多语言零样本文本转语音模型,支持超过 600 种语言,基于扩散语言模型架构构建,具备快速推理和语音克隆能力。