@Open_MOSS: MOSS-Transcribe-Diarize 在 @huggingface 上跻身热门模型之列。发布数周后,该模型已…
摘要
MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。
查看缓存全文
缓存时间: 2026/07/16 18:21
MOSS-Transcribe-Diarize 是 @huggingface 上最热门的模型之一。
发布几周后,该模型已被全球开发者和研究人员广泛探索。@MosiAI_Official
采用端到端的音频到结构化转录范式构建: • 0.9B 开源 ASR 模型 • Apache 2.0 许可证 • 128k 长上下文转录 • 支持最长约 90 分钟的音频输入 • 单次生成输出说话人标签 + 时间戳 • 支持会议、打断和重叠语音的多说话人识别 • 热词偏置,针对姓名、术语和领域特定词汇 • 在 NVIDIA RTX 4090 上约 100 token/s,RTF 约 0.017
如果你还没有
相似文章
@MosiAI_Official: MOSS-Transcribe-Diarize-0.9B 现已在 @huggingface 上开源。采用端到端音频到结构化转录…
MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。
@MosiAI_Official: MOSS-TTS-v1.5 刚刚以 20.6K 下载量登上 Hugging Face 热门排行榜的 Text-to-Speech 分类第一。一个多语言、可控…
MOSS-TTS-v1.5 是一个多语言可控 TTS 模型,支持语音克隆和长文本生成,以 20.6K 下载量登上 Hugging Face 热门排行榜第一名。
OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face
MOSS-TTS v1.5是一个更新的开源文本转语音模型,具有改进的多语言合成(支持31种语言)、更稳定的零样本语音克隆以及显式的内联停顿控制。
@cohere:我们的开源语音识别模型 Cohere Transcribe 在新的 @huggingface 远场ASR基准测试中排名第一。
Cohere Transcribe 是一款开源语音识别模型,在 Hugging Face 新的远场ASR基准测试中荣获第一名。
我微调了Cohere Transcribe以支持说话人分离和时间戳
微调了最佳开源语音转文字模型Cohere Transcribe,使其支持说话人分离和时间戳。新模型已在Hugging Face上发布。