@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……
摘要
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
查看缓存全文
缓存时间: 2026/07/09 11:36
UniSE: 统一语音增强——高质量开源模型,让音频更清晰、在多说话人对话中分离说话人,终于有了开源的Adobe Podcast替代品 模型:https://huggingface.co/QuarkAudio/QuarkAudio-UniSE… 演示:https://huggingface.co/spaces/hugging-apps/unise-speech-enhancement…
QuarkAudio/QuarkAudio-UniSE · Hugging Face
来源:https://huggingface.co/QuarkAudio/QuarkAudio-UniSE
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#unise-a-unified-framework-for-decoder-only-autoregressive-lm-based-speech-enhancementUniSE:基于仅解码器自回归语言模型的统一语音增强框架
论文 (https://arxiv.org/abs/2510.20441)GitHub (https://github.com/alibaba/unified-audio/tree/main/QuarkAudio-UniSE)Hugging Face (https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)ModelScope (https://www.modelscope.cn/models/QuarkAudio/QuarkAudio-UniSE/)
🔊 UniSE:基于仅解码器语言模型的统一、无提示、自回归语音增强框架
🚀关键亮点:
- ✅统一且无提示:无需显式指令即可处理多种任务。
- ⚙️仅解码器AR-LM骨干:利用LLM风格的自回归生成进行语音令牌预测。
- 🔄端到端兼容:将WavLM(特征提取器)、BiCodec(离散编解码器)和LM集成到单一流水线中。
- 🌍多任务支持:语音增强、语音恢复、目标说话人提取、语音分离等——全部在一个模型中完成。
📄论文:arXiv:2510.20441 (https://arxiv.org/abs/2510.20441) | 🤗模型:[Hugging Face Spaces]https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#%F0%9F%93%8B-supported-tasks📋 支持的任务
任务全称状态描述SR语音恢复✅ 稳定通用去噪和清晰度提升(如噪声、混响、丢包)TSE目标说话人提取✅ 稳定使用参考注册音频提取目标说话人SS语音分离✅ 稳定分离混合说话人或声源AEC声学回声消除⏳ 开发中即将在下一版本发布
💡 与需要任务特定提示或模块的传统模型不同,UniSE根据输入上下文自主推断任务类型——得益于强大的LLM理解能力。
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#%F0%9F%8E%AF-quick-start-run-inference-in-3-minutes🎯 快速入门:3分钟运行推理
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#1-clone-repository1. 克隆仓库
git clone https://github.com/alibaba/unified-audio.git cd QuarkAudio-UniSE
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#2-create-a-conda-environment-and-install-dependencies2. 创建Conda环境并安装依赖
conda create -n unise python=3.10 conda activate unise pip install -r requirements.txt
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#3-download-checkpoints3. 下载检查点
QuarkAudio-UniSE需要从Hugging Face额外下载三个WavLM和BiCodec预训练模型以及中间LM的检查点才能正常运行。你可以使用提供的Shell脚本下载其中一个:
cd checkpoints bash download.sh
另外,从此URL (https://huggingface.co/microsoft/wavlm-base-plus)下载WavLM-Large.pt,并将其放置在./ckpt/WavLM-Large.pt。
或者,你也可以手动下载并将它们放置在./model/bicodec/目录下。
下载完成后,目录结构应如下所示:
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#train训练
- 快速开始
#!/bin/bash python ./train.py --config conf/config.yaml
参数描述resume如需恢复训练,指定检查点路径simulation_config数据模拟配置speech_scp_path干净音频文件的SCPnoise_scp_path噪声音频文件的SCPrir_scp_pathRIR音频文件的SCPmode任务类型:se(噪声抑制、语音恢复、丢包隐藏)、tse(目标说话人提取)、SS(语音分离)
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#inference推理
- 快速开始 主要推理脚本是**
test.py**。推理过程分为两个阶段:
- 从所有WavLM层提取隐藏状态,并对它们进行逐层平均以获得单一表示。
- 使用语言模型(LM)预测语音令牌,然后使用BiCodec将它们解码为音频。
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#running-inference运行推理
- 快速开始 要运行test.py,请在
./conf/config.yaml中配置参数:
参数描述ckpt_path预训练权重enroll_duration推理迭代次数data_src_dir处理后的音频文件目录data_tgt_dir处理后的音频文件目录mode任务类型:se(噪声抑制、语音恢复、丢包隐藏)、se(目标说话人提取)、SS(语音分离)
运行推理的命令:
python test.py
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#model-checkpoints模型检查点
我们的预训练模型可在Hugging Face (https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)上获取。
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#hints提示
我们的方法侧重于利用LLM的理解能力来实现任务类型的自主判断,但在某些场景下可能表现出不稳定性。更稳定、更健壮的迭代版本将在后续版本中发布。
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#citation引用
@misc{yan2025uniseunifiedframeworkdecoderonly, title={UniSE: A Unified Framework for Decoder-only Autoregressive LM-based Speech Enhancement}, author={Haoyin Yan and Chengwei Liu and Shaofei Xue and Xiaotao Liang and Zheng Xue}, year={2025}, eprint={2510.20441}, archivePrefix={arXiv}, primaryClass={cs.SD}, url={https://arxiv.org/abs/2510.20441}, }
https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#contact联系方式
如有任何疑问,请联系:[email protected]
相似文章
一个模型,多种延迟:面向多样化实时应用的通用语音增强
一种通用语音增强模型,通过并行卷积和提前退出机制,允许对算法延迟和计算延迟进行可配置控制,使得单一模型无需重新训练即可服务于多种实时应用。
介绍 SAM Audio:首个用于音频分离的统一多模态模型
SAM Audio 是首个用于音频分离的统一多模态模型,使用户能够利用文本、视觉或时间提示,从复杂的混合音频中分离出特定的声音。
UniCorn:通过自生成监督走向自我改进的统一多模态模型
UniCorn 是一个框架,通过使用多智能体系统进行提示生成、图像创建和质量评估,使统一多模态模型能够自我改进,在 TIIF、WISE 和 OneIG-EN 等文本到图像基准上取得了最先进的结果。
UniSD:面向大型语言模型的统一自蒸馏框架
本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。
@multimodalart: @StabilityAI 的 Stable Audio 3 刚刚发布。主要提供3种开源变体:- Stable Audio 3 Medium (2B) - …
Stability AI发布了Stable Audio 3,提供用于音乐和VFX的开源变体,具备快速且高质量的音频生成能力。