一个模型,多种延迟:面向多样化实时应用的通用语音增强
摘要
一种通用语音增强模型,通过并行卷积和提前退出机制,允许对算法延迟和计算延迟进行可配置控制,使得单一模型无需重新训练即可服务于多种实时应用。
查看缓存全文
缓存时间: 2026/06/30 15:36
论文页面 - 一个模型,多种延迟:面向多样化实时应用的通用语音增强
来源:https://huggingface.co/papers/2606.25621
摘要
一种采用并行卷积与早退机制的通用语音增强模型,可配置算法延迟与计算延迟控制。
不同的实时语音应用对延迟预算有各自严格的要求,往往需要针对每种场景单独训练增强模型。本文提出一个“一统全局”的实时通用语音增强模型,能够显式控制算法延迟与计算延迟。算法延迟可通过可配置的前瞻帧灵活调整。为避免因填充配置变化导致的学习效率低下,我们引入了对应不同前瞻设置的并行卷积层。计算延迟则通过早退机制进行控制,允许在不同网络深度进行推理。为了缩小专用模型与灵活模型之间的性能差距,我们提出了一种两阶段训练策略,并采用“共享到多解码器过渡”结构。总体而言,所提框架使得单个模型能够在不同延迟预算下部署,而无需重新训练多个独立模型。
查看 arXiv 页面 (https://arxiv.org/abs/2606.25621)查看 PDF (https://arxiv.org/pdf/2606.25621)项目页面 (https://huggingface.co/nvidia/Real-time_RE-USE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.25621)
社区
论文提交者
14分钟前 (https://huggingface.co/papers/2606.25621#6a43df4f08125d98ebd3645f)
•
编辑于13分钟前 (https://huggingface.co/papers/2606.25621#6a43df4f08125d98ebd3645f)
通过拖拽、粘贴或点击此处上传图片、音频和视频。
在此处点击或粘贴以上传图片
在您的代理中获取此论文:
hf papers read 2606\.25621
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
nvidia/Real-time_RE-USE 音频到音频• 13.5M• 更新于约6小时前 • 49 • 10 (https://huggingface.co/nvidia/Real-time_RE-USE)
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.25621 以从此页面链接。
引用此论文的 Spaces1
包含此论文的合集0
无合集包含此论文
添加此论文到合集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
HybridCodec: 面向高效语音语言模型的离散与连续表示建模
提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。
在构建 AI 辅导系统时,延迟比模型选择更重要
一位从业者认为,在 AI 辅导系统中,语音启动延迟才是关键因素,而非模型的选择。他建议将语音启动延迟控制在 1 秒以内,并强调流式 TTS 是优化效果最显著的手段。文章梳理了从 ASR 到 TTS 再到虚拟形象同步的完整处理链路,并指出延迟叠加最严重的环节。
降低LLM延迟
用于降低大语言模型延迟、提高推理速度的技术和方法。
EvoLP:面向实时边缘系统模型压缩的自进化延迟预测器
EvoLP 是一种面向边缘设备上神经网络模型的自进化延迟预测器,旨在指导模型压缩同时满足严格的延迟约束。它在多个边缘设备和模型变体上均优于先前的方法。