一个模型,多种延迟:面向多样化实时应用的通用语音增强

Hugging Face Daily Papers 论文

摘要

一种通用语音增强模型,通过并行卷积和提前退出机制,允许对算法延迟和计算延迟进行可配置控制,使得单一模型无需重新训练即可服务于多种实时应用。

不同的实时语音应用对延迟预算有不同的要求,通常需要为每种场景单独训练增强模型。在本文中,我们提出一种全能型、实时的通用语音增强模型,该模型能够对算法延迟和计算延迟进行显式控制。算法延迟通过可配置的前瞻帧数灵活调整。为避免因不同填充配置导致的学习效率低下,我们引入了对应于不同前瞻设置的并行卷积层。计算延迟通过提前退出机制进行控制,使得推理可以在不同的网络深度进行。为了缩小专用模型与灵活模型之间的性能差距,我们提出了一种共享到多解码器过渡的两阶段训练策略。总体而言,所提出的框架使得单一模型无需重新训练即可部署到不同的延迟预算中。
查看原文
查看缓存全文

缓存时间: 2026/06/30 15:36

论文页面 - 一个模型,多种延迟:面向多样化实时应用的通用语音增强

来源:https://huggingface.co/papers/2606.25621

摘要

一种采用并行卷积与早退机制的通用语音增强模型,可配置算法延迟与计算延迟控制。

不同的实时语音应用对延迟预算有各自严格的要求,往往需要针对每种场景单独训练增强模型。本文提出一个“一统全局”的实时通用语音增强模型,能够显式控制算法延迟与计算延迟。算法延迟可通过可配置的前瞻帧灵活调整。为避免因填充配置变化导致的学习效率低下,我们引入了对应不同前瞻设置的并行卷积层。计算延迟则通过早退机制进行控制,允许在不同网络深度进行推理。为了缩小专用模型与灵活模型之间的性能差距,我们提出了一种两阶段训练策略,并采用“共享到多解码器过渡”结构。总体而言,所提框架使得单个模型能够在不同延迟预算下部署,而无需重新训练多个独立模型。

查看 arXiv 页面 (https://arxiv.org/abs/2606.25621)查看 PDF (https://arxiv.org/pdf/2606.25621)项目页面 (https://huggingface.co/nvidia/Real-time_RE-USE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.25621)

社区

论文提交者

14分钟前 (https://huggingface.co/papers/2606.25621#6a43df4f08125d98ebd3645f)

编辑于13分钟前 (https://huggingface.co/papers/2606.25621#6a43df4f08125d98ebd3645f)

通过拖拽、粘贴或点击此处上传图片、音频和视频。

在此处点击或粘贴以上传图片

在您的代理中获取此论文:

hf papers read 2606\.25621

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

nvidia/Real-time_RE-USE 音频到音频• 13.5M• 更新于约6小时前 • 49 • 10 (https://huggingface.co/nvidia/Real-time_RE-USE)

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.25621 以从此页面链接。

引用此论文的 Spaces1

包含此论文的合集0

无合集包含此论文

添加此论文到合集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

在构建 AI 辅导系统时,延迟比模型选择更重要

Reddit r/AI_Agents

一位从业者认为,在 AI 辅导系统中,语音启动延迟才是关键因素,而非模型的选择。他建议将语音启动延迟控制在 1 秒以内,并强调流式 TTS 是优化效果最显著的手段。文章梳理了从 ASR 到 TTS 再到虚拟形象同步的完整处理链路,并指出延迟叠加最严重的环节。

降低LLM延迟

Reddit r/AI_Agents

用于降低大语言模型延迟、提高推理速度的技术和方法。