@multimodalart: 他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,实现了SOTA级别的TTS情感控制???试试看……
摘要
LTX-2.3模型音频组件的微调版本在文本转语音中实现了最先进的情感控制,现已在Hugging Face Space上以DramaBox(由ResembleAI提供)的形式提供。
查看缓存全文
缓存时间: 2026/05/15 23:09
他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,并实现了SOTA级别的TTS情感控制???
亲自试试吧。到目前为止,我印象深刻!
https://t.co/A8qD9dc78b
DramaBox - 由ResembleAI创建的Hugging Face Space
来源:https://huggingface.co/spaces/ResembleAI/Dramabox 正在从HF Docker仓库获取元数据……
相似文章
DramaBox - 基于LTX 2.3的最具表现力语音模型
DramaBox是一个基于LTX 2.3的高度表现力语音模型,由Resemble AI发布,其开源代码和模型可在GitHub和Hugging Face上获取。
ResembleAI/Dramabox
Dramabox 是 Resemble AI 开发的一个富有表现力的文本转语音模型,通过提示驱动控制来实现说话人身份、情感和表达方式,并可选地使用 10 秒参考音频进行声音克隆。该模型基于 LTX-2.3 音频扩散变换器构建,已在 Hugging Face 上开源。
DramaBox:基于舞台提示构建的开源权重TTS模型
DramaBox是一个基于LTX-2.3微调的开源权重TTS模型,利用舞台提示(stage directions)生成富有表现力的语音,并支持通过10秒样本进行可选的语音克隆。
huggingface/speech-to-speech
Hugging Face 的 speech-to-speech 是一个开源、模块化的语音代理流水线(VAD->STT->LLM->TTS),提供与 OpenAI Realtime 兼容的 WebSocket API,支持可交换的组件以及本地或托管模型。
我们构建了NeuTTS-2E,一个支持7种可控情感的开源设备端TTS模型
NeuTTS-2E是一个支持7种可控情感的开源设备端TTS模型。