OpenVoice:多功能即时语音克隆

Papers with Code Trending 论文

摘要

OpenVoice是一种多功能语音克隆方法,它能够使用单个音频片段实现灵活的语音风格控制和高效率的零样本跨语言克隆。

我们推出OpenVoice,一种多功能语音克隆方法,它仅需参考说话者的一个简短音频片段即可复制其声音并生成多种语言的语音。OpenVoice在解决该领域的以下开放性挑战方面取得了重大进展: 1) 灵活的语音风格控制。OpenVoice能够对语音风格进行细粒度控制,包括情感、口音、节奏、停顿和语调,此外还能复制参考说话者的音色。语音风格并非直接复制并受限于参考说话者的风格。先前的方法在克隆后缺乏灵活操纵语音风格的能力。 2) 零样本跨语言语音克隆。OpenVoice实现了零样本跨语言语音克隆,适用于未包含在大规模说话者训练集中的语言。与先前通常需要为所有语言提供大规模说话者多语言(MSML)数据集的方法不同,OpenVoice无需任何该语言的大规模说话者训练数据即可将声音克隆到新语言中。OpenVoice在计算上也更高效,成本比性能更差的市售API低数十倍。为了促进该领域的进一步研究,我们已公开源代码和训练模型。我们还在演示网站上提供了定性结果。在公开发布之前,我们的内部版OpenVoice在2023年5月至10月期间被全球用户使用了数千万次,作为MyShell的后端。
查看原文
查看缓存全文

缓存时间: 2026/08/24 10:08

论文页面 - OpenVoice:多功能即时语音克隆

来源:https://huggingface.co/papers/2312.01479

摘要

OpenVoice 仅需一段音频片段,即可实现灵活的语音风格控制与零样本跨语言语音克隆,且效率极高。

我们推出了 OpenVoice,一种多功能的语音克隆方法。该方法仅需目标说话者的短音频片段,便能复制其声音,并生成多种语言的语音。OpenVoice 在解决该领域以下开放挑战方面取得了显著进展:1)灵活的语音风格控制。OpenVoice 除了能复制参考说话者的音色外,还实现了对包括情感、口音、节奏、停顿和语调在内的语音风格的精细控制。其语音风格并非直接复制或受限于参考说话者的风格。此前的方法在克隆后缺乏灵活操纵语音风格的能力。2)零样本跨语言语音克隆。OpenVoice 对未包含在大规模说话者训练集中的语言,也能实现零样本跨语言语音克隆。与以往通常需要针对所有语言使用大规模说话者多语言(MSML)数据集的方法不同,OpenVoice 可以在没有任何该语言大规模说话者训练数据的情况下,将语音克隆到新语言中。OpenVoice 在计算上同样高效,成本仅为性能更差的商业可用 API 的几十分之一。为进一步推动该领域研究,我们已公开提供源代码和训练模型。我们还在演示网站上提供了定性结果。在公开发布之前,我们内部版本的 OpenVoice 在 2023 年 5 月至 10 月期间已被全球用户使用了数千万次,作为 MyShell 的后端服务。

查看 arXiv 页面 (https://arxiv.org/abs/2312.01479) 查看 PDF (https://arxiv.org/pdf/2312.01479) GitHub37.3k 自动 (https://github.com/myshell-ai/openvoice) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2312.01479)

在您的代理中获取此论文:

hf papers read 2312\.01479

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 4

rsxdalv/OpenVoiceV2 (https://huggingface.co/rsxdalv/OpenVoiceV2)

ameerazam08/Udiff 更新于 2023年12月16日 (https://huggingface.co/ameerazam08/Udiff)

IrieDinamik/OpenVoice 更新于 5月12日 (https://huggingface.co/IrieDinamik/OpenVoice)

ayodkay-hf/soninho-voice 更新于 18 天前 (https://huggingface.co/ayodkay-hf/soninho-voice)

引用此论文的数据集 5

tsinghua-ee/QualiSpeech 查看者• 更新于 2025年8月4日 • 14.6k • 571 • 24 (https://huggingface.co/datasets/tsinghua-ee/QualiSpeech)

dlxjj/Openvoice 查看者• 更新于 2025年5月8日 • 10 • 217 (https://huggingface.co/datasets/dlxjj/Openvoice)

Pendrokar/open_tts_tracker 查看者• 更新于 2月20日 • 60 • 175 • 30 (https://huggingface.co/datasets/Pendrokar/open_tts_tracker)

purdueviperlab/diffssd 查看者• 更新于 2024年9月30日 • 283k • 152 • 2 (https://huggingface.co/datasets/purdueviperlab/diffssd)

浏览 5 个引用此论文的数据集 (https://huggingface.co/datasets?other=arxiv:2312.01479)### 引用此论文的 Spaces 8

包含此论文的收藏夹 2

相似文章

k2-fsa/OmniVoice

Hugging Face Models Trending

OmniVoice 是一款大规模多语言零样本文本转语音模型,支持超过 600 种语言,基于扩散语言模型架构构建,具备快速推理和语音克隆能力。