@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……

X AI KOLs Following 模型

摘要

UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。

UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者,终于有了一个开源的 Adobe Podcast 替代品。模型:https://huggingface.co/QuarkAudio/QuarkAudio-UniSE… 演示:https://huggingface.co/spaces/hugging-apps/unise-speech-enhancement…
查看原文
查看缓存全文

缓存时间: 2026/07/09 11:36

UniSE: 统一语音增强——高质量开源模型,让音频更清晰、在多说话人对话中分离说话人,终于有了开源的Adobe Podcast替代品 模型:https://huggingface.co/QuarkAudio/QuarkAudio-UniSE… 演示:https://huggingface.co/spaces/hugging-apps/unise-speech-enhancement…


QuarkAudio/QuarkAudio-UniSE · Hugging Face

来源:https://huggingface.co/QuarkAudio/QuarkAudio-UniSE

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#unise-a-unified-framework-for-decoder-only-autoregressive-lm-based-speech-enhancementUniSE:基于仅解码器自回归语言模型的统一语音增强框架

论文 (https://arxiv.org/abs/2510.20441)GitHub (https://github.com/alibaba/unified-audio/tree/main/QuarkAudio-UniSE)Hugging Face (https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)ModelScope (https://www.modelscope.cn/models/QuarkAudio/QuarkAudio-UniSE/)

🔊 UniSE:基于仅解码器语言模型的统一、无提示、自回归语音增强框架

🚀关键亮点

  • 统一且无提示:无需显式指令即可处理多种任务。
  • ⚙️仅解码器AR-LM骨干:利用LLM风格的自回归生成进行语音令牌预测。
  • 🔄端到端兼容:将WavLM(特征提取器)、BiCodec(离散编解码器)和LM集成到单一流水线中。
  • 🌍多任务支持:语音增强、语音恢复、目标说话人提取、语音分离等——全部在一个模型中完成。

📄论文:arXiv:2510.20441 (https://arxiv.org/abs/2510.20441) | 🤗模型:[Hugging Face Spaces]https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)


https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#%F0%9F%93%8B-supported-tasks📋 支持的任务

任务全称状态描述SR语音恢复✅ 稳定通用去噪和清晰度提升(如噪声、混响、丢包)TSE目标说话人提取✅ 稳定使用参考注册音频提取目标说话人SS语音分离✅ 稳定分离混合说话人或声源AEC声学回声消除⏳ 开发中即将在下一版本发布

💡 与需要任务特定提示或模块的传统模型不同,UniSE根据输入上下文自主推断任务类型——得益于强大的LLM理解能力。


https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#%F0%9F%8E%AF-quick-start-run-inference-in-3-minutes🎯 快速入门:3分钟运行推理

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#1-clone-repository1. 克隆仓库

git clone https://github.com/alibaba/unified-audio.git cd QuarkAudio-UniSE

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#2-create-a-conda-environment-and-install-dependencies2. 创建Conda环境并安装依赖

conda create -n unise python=3.10 conda activate unise pip install -r requirements.txt

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#3-download-checkpoints3. 下载检查点

QuarkAudio-UniSE需要从Hugging Face额外下载三个WavLMBiCodec预训练模型以及中间LM的检查点才能正常运行。你可以使用提供的Shell脚本下载其中一个:

cd checkpoints bash download.sh

另外,从此URL (https://huggingface.co/microsoft/wavlm-base-plus)下载WavLM-Large.pt,并将其放置在./ckpt/WavLM-Large.pt

或者,你也可以手动下载并将它们放置在./model/bicodec/目录下。

下载完成后,目录结构应如下所示:

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#train训练

  • 快速开始

#!/bin/bash python ./train.py --config conf/config.yaml

参数描述resume如需恢复训练,指定检查点路径simulation_config数据模拟配置speech_scp_path干净音频文件的SCPnoise_scp_path噪声音频文件的SCPrir_scp_pathRIR音频文件的SCPmode任务类型:se(噪声抑制、语音恢复、丢包隐藏)、tse(目标说话人提取)、SS(语音分离)

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#inference推理

  • 快速开始 主要推理脚本是**test.py**。推理过程分为两个阶段:
  1. 从所有WavLM层提取隐藏状态,并对它们进行逐层平均以获得单一表示。
  2. 使用语言模型(LM)预测语音令牌,然后使用BiCodec将它们解码为音频。

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#running-inference运行推理

  • 快速开始 要运行test.py,请在./conf/config.yaml中配置参数:

参数描述ckpt_path预训练权重enroll_duration推理迭代次数data_src_dir处理后的音频文件目录data_tgt_dir处理后的音频文件目录mode任务类型:se(噪声抑制、语音恢复、丢包隐藏)、se(目标说话人提取)、SS(语音分离) 运行推理的命令:

python test.py

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#model-checkpoints模型检查点

我们的预训练模型可在Hugging Face (https://huggingface.co/QuarkAudio/QuarkAudio-UniSE/)上获取。

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#hints提示

我们的方法侧重于利用LLM的理解能力来实现任务类型的自主判断,但在某些场景下可能表现出不稳定性。更稳定、更健壮的迭代版本将在后续版本中发布。

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#citation引用

@misc{yan2025uniseunifiedframeworkdecoderonly, title={UniSE: A Unified Framework for Decoder-only Autoregressive LM-based Speech Enhancement}, author={Haoyin Yan and Chengwei Liu and Shaofei Xue and Xiaotao Liang and Zheng Xue}, year={2025}, eprint={2510.20441}, archivePrefix={arXiv}, primaryClass={cs.SD}, url={https://arxiv.org/abs/2510.20441}, }

https://huggingface.co/QuarkAudio/QuarkAudio-UniSE#contact联系方式

如有任何疑问,请联系:[email protected]

相似文章

UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。