@multimodalart: 他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,实现了SOTA级别的TTS情感控制???试试看……

X AI KOLs Following 工具

摘要

LTX-2.3模型音频组件的微调版本在文本转语音中实现了最先进的情感控制,现已在Hugging Face Space上以DramaBox(由ResembleAI提供)的形式提供。

他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,实现了SOTA级别的TTS情感控制??? 自己试试看吧。到目前为止,我印象非常深刻! https://t.co/A8qD9dc78b
查看原文
查看缓存全文

缓存时间: 2026/05/15 23:09

他们只提取了LTX-2.3的音频部分,针对TTS任务进行了微调,并实现了SOTA级别的TTS情感控制???

亲自试试吧。到目前为止,我印象深刻!

https://t.co/A8qD9dc78b


DramaBox - 由ResembleAI创建的Hugging Face Space

来源:https://huggingface.co/spaces/ResembleAI/Dramabox 正在从HF Docker仓库获取元数据……

相似文章

ResembleAI/Dramabox

Hugging Face Models Trending

Dramabox 是 Resemble AI 开发的一个富有表现力的文本转语音模型,通过提示驱动控制来实现说话人身份、情感和表达方式,并可选地使用 10 秒参考音频进行声音克隆。该模型基于 LTX-2.3 音频扩散变换器构建,已在 Hugging Face 上开源。

huggingface/speech-to-speech

GitHub Trending (daily)

Hugging Face 的 speech-to-speech 是一个开源、模块化的语音代理流水线(VAD->STT->LLM->TTS),提供与 OpenAI Realtime 兼容的 WebSocket API,支持可交换的组件以及本地或托管模型。