MisoLabs/MisoTTS
摘要
Miso Labs 发布了 Miso TTS 8B,这是一个基于 Sesame CSM 架构和类似 Llama 3.2 骨干网络的文本转语音模型,旨在生成高质量对话语音及实现语音延续。
查看缓存全文
缓存时间: 2026/06/05 08:09
MisoLabs/MisoTTS · Hugging Face
来源:https://huggingface.co/MisoLabs/MisoTTS
https://huggingface.co/MisoLabs/MisoTTS#miso-tts-8bMiso TTS 8B
https://huggingface.co/MisoLabs/MisoTTS#model-introduction模型简介
Miso TTS 8B 是一个基于 Sesame CSM 架构的文本到语音模型。它从文本和可选的音频上下文中生成 Mimi 音频编码,使用一个大型的 Llama 3.2 风格的主干网络和一个较小的自回归音频解码器。
该模型专为高质量对话语音生成和基于提示音频的语音延续而设计。本仓库包含推理代码、模型定义以及在本地运行 Miso TTS 的设置说明。
https://huggingface.co/MisoLabs/MisoTTS#quickstart快速开始
要运行模型,请使用我们公共仓库(https://github.com/MisoLabsAI/MisoTTS)中的推理代码,或访问 misolabs.ai 试用我们的演示。
https://huggingface.co/MisoLabs/MisoTTS#model-summary模型总结
| 项目 | 值 |
|---|---|
| 模型 | Miso TTS 8B |
| 组织 | Miso Labs |
| 任务 | 文本到语音 |
| 架构 | Sesame 风格 CSM |
| 骨干网络 | llama-8B |
| 音频解码器 | llama-300M |
| 文本词汇表 | 128,256 |
| 音频词汇表 | 2,051 |
| 音频码本 | 32 |
| 音频分词器 | Mimi |
| 最大序列长度 | 2,048 |
https://huggingface.co/MisoLabs/MisoTTS#architecture架构
Miso TTS 8B 使用两个 Transformer 组件:
- 一个大型主干 Transformer,用于处理文本/音频帧嵌入。
- 一个较小的解码器 Transformer,在每个帧内自回归地预测更高阶的音频码本。
码本 0 由主干隐藏状态预测,而码本 1 到 31 由音频解码器在码本深度上自回归预测。
https://huggingface.co/MisoLabs/MisoTTS#links链接
- 网站:misolabs.ai (https://misolabs.ai/)
- Hugging Face:MisoLabs/MisoTTS (https://huggingface.co/MisoLabs/MisoTTS)
- GitHub:MisoLabsAI (https://github.com/MisoLabsAI)
- X:@MisoLabsAI (https://x.com/MisoLabsAI)
相似文章
@omarsar0: 又一个超棒的开源发布。Miso One 是一个8B参数文本转语音模型,具备真实情感范围,因此配音…
Miso One 是一个开源的8B参数文本转语音模型,具备真实情感范围和110毫秒延迟,专为配音工作设计。
OpenMOSS-Team/MOSS-TTS-Nano-100M
MOSS-TTS-Nano是一个开源的多语言语音生成模型,仅0.1B参数,专为实时TTS设计,可直接在CPU上运行而无需GPU。由OpenMOSS团队和MOSI.AI发布,它支持简单的本地部署,用于Web服务和产品集成。
OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face
MOSS-TTS v1.5是一个更新的开源文本转语音模型,具有改进的多语言合成(支持31种语言)、更稳定的零样本语音克隆以及显式的内联停顿控制。
kyutai-labs/pocket-tts
Kyutai 发布了 Pocket TTS,这是一个轻量级的文本转语音模型,可高效在 CPU 上运行,拥有 1 亿参数、低延迟和语音克隆功能,支持多种语言。
@lmsysorg: SGLang-Omni 现已于第0天提供来自 @Open_MOSS 的 MOSS-TTS-Local Transformer v1.5!这是一个开源的 48 kHz 立体声 TTS 模式…
MOSS-TTS-Local Transformer v1.5 是一个开源的 48 kHz 立体声 TTS 模型,具有零样本语音克隆、原生流式传输,并支持31种语言,基于 Qwen3-4B 骨干网构建,通过 SGLang-Omni 提供。