MisoLabs/MisoTTS

Hugging Face Models Trending 模型

摘要

Miso Labs 发布了 Miso TTS 8B,这是一个基于 Sesame CSM 架构和类似 Llama 3.2 骨干网络的文本转语音模型,旨在生成高质量对话语音及实现语音延续。

任务:文本转语音 Tags: pytorch, safetensors, text-to-speech, speech-synthesis, voice, audio, sesame, mimi, llama, license:other, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:09

MisoLabs/MisoTTS · Hugging Face

来源:https://huggingface.co/MisoLabs/MisoTTS

https://huggingface.co/MisoLabs/MisoTTS#miso-tts-8bMiso TTS 8B

https://huggingface.co/MisoLabs/MisoTTS#model-introduction模型简介

Miso TTS 8B 是一个基于 Sesame CSM 架构的文本到语音模型。它从文本和可选的音频上下文中生成 Mimi 音频编码,使用一个大型的 Llama 3.2 风格的主干网络和一个较小的自回归音频解码器。

该模型专为高质量对话语音生成和基于提示音频的语音延续而设计。本仓库包含推理代码、模型定义以及在本地运行 Miso TTS 的设置说明。


https://huggingface.co/MisoLabs/MisoTTS#quickstart快速开始

要运行模型,请使用我们公共仓库(https://github.com/MisoLabsAI/MisoTTS)中的推理代码,或访问 misolabs.ai 试用我们的演示。

https://huggingface.co/MisoLabs/MisoTTS#model-summary模型总结

项目
模型Miso TTS 8B
组织Miso Labs
任务文本到语音
架构Sesame 风格 CSM
骨干网络llama-8B
音频解码器llama-300M
文本词汇表128,256
音频词汇表2,051
音频码本32
音频分词器Mimi
最大序列长度2,048

https://huggingface.co/MisoLabs/MisoTTS#architecture架构

Miso TTS 8B 使用两个 Transformer 组件:

  • 一个大型主干 Transformer,用于处理文本/音频帧嵌入。
  • 一个较小的解码器 Transformer,在每个帧内自回归地预测更高阶的音频码本。

码本 0 由主干隐藏状态预测,而码本 1 到 31 由音频解码器在码本深度上自回归预测。


https://huggingface.co/MisoLabs/MisoTTS#links链接

  • 网站:misolabs.ai (https://misolabs.ai/)
  • Hugging Face:MisoLabs/MisoTTS (https://huggingface.co/MisoLabs/MisoTTS)
  • GitHub:MisoLabsAI (https://github.com/MisoLabsAI)
  • X:@MisoLabsAI (https://x.com/MisoLabsAI)

相似文章

OpenMOSS-Team/MOSS-TTS-Nano-100M

Hugging Face Models Trending

MOSS-TTS-Nano是一个开源的多语言语音生成模型,仅0.1B参数,专为实时TTS设计,可直接在CPU上运行而无需GPU。由OpenMOSS团队和MOSI.AI发布,它支持简单的本地部署,用于Web服务和产品集成。

OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face

Reddit r/LocalLLaMA

MOSS-TTS v1.5是一个更新的开源文本转语音模型,具有改进的多语言合成(支持31种语言)、更稳定的零样本语音克隆以及显式的内联停顿控制。

kyutai-labs/pocket-tts

GitHub Trending (daily)

Kyutai 发布了 Pocket TTS,这是一个轻量级的文本转语音模型,可高效在 CPU 上运行,拥有 1 亿参数、低延迟和语音克隆功能,支持多种语言。