我微调了Cohere Transcribe以支持说话人分离和时间戳

Reddit r/LocalLLaMA 模型

摘要

微调了最佳开源语音转文字模型Cohere Transcribe,使其支持说话人分离和时间戳。新模型已在Hugging Face上发布。

你好,长话短说:[Cohere-transcribe](https://huggingface.co/CohereLabs/cohere-transcribe-03-2026) 是目前最好的开源语音转文字模型(甚至可能优于其他专有模型)。但它不支持说话人分离(说话人识别)和时间戳,尽管分词器中已有相关词元。因此我训练了模型来支持这些功能。它遵循标准的时间戳格式。现在的输出如下:<|spltoken0|><|t:0.0|> Welcome back. <|t:1.5|><|spltoken1|><|t:1.5|> Thanks. <|t:2.4|> 这是一种易于解析的格式。时间戳平均误差在0.097秒内,90%的误差在0.006秒内。该模型每30秒最多支持4个说话人,使用diarize_long.py脚本,可以准确识别多达32人。该模型可在Hugging Face上[免费获取](https://huggingface.co/syvai/cohere-transcribe-diarize)。尽情使用吧!
查看原文

相似文章

CohereLabs/cohere-transcribe-arabic-07-2026

Hugging Face Models Trending

Cohere 发布了一个开源的 2B 参数阿拉伯语 ASR 模型,该模型基于 Conformer 编码器-解码器架构,针对阿拉伯方言性能和阿拉伯语-英语代码切换进行了优化。

rafaelgalle/whisper-diarization-advanced

Replicate Explore

一个可自定义的语音说话人日志流水线,基于Replicate平台,使用Whisper和Pyannote实现快速的多人转录,具备高级音频预处理、降噪和声道分离功能。