我微调了Cohere Transcribe以支持说话人分离和时间戳
摘要
微调了最佳开源语音转文字模型Cohere Transcribe,使其支持说话人分离和时间戳。新模型已在Hugging Face上发布。
你好,长话短说:[Cohere-transcribe](https://huggingface.co/CohereLabs/cohere-transcribe-03-2026) 是目前最好的开源语音转文字模型(甚至可能优于其他专有模型)。但它不支持说话人分离(说话人识别)和时间戳,尽管分词器中已有相关词元。因此我训练了模型来支持这些功能。它遵循标准的时间戳格式。现在的输出如下:<|spltoken0|><|t:0.0|> Welcome back. <|t:1.5|><|spltoken1|><|t:1.5|> Thanks. <|t:2.4|> 这是一种易于解析的格式。时间戳平均误差在0.097秒内,90%的误差在0.006秒内。该模型每30秒最多支持4个说话人,使用diarize_long.py脚本,可以准确识别多达32人。该模型可在Hugging Face上[免费获取](https://huggingface.co/syvai/cohere-transcribe-diarize)。尽情使用吧!
相似文章
@cohere:我们的开源语音识别模型 Cohere Transcribe 在新的 @huggingface 远场ASR基准测试中排名第一。
Cohere Transcribe 是一款开源语音识别模型,在 Hugging Face 新的远场ASR基准测试中荣获第一名。
@Open_MOSS: MOSS-Transcribe-Diarize 在 @huggingface 上跻身热门模型之列。发布数周后,该模型已…
MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。
CohereLabs/cohere-transcribe-arabic-07-2026
Cohere 发布了一个开源的 2B 参数阿拉伯语 ASR 模型,该模型基于 Conformer 编码器-解码器架构,针对阿拉伯方言性能和阿拉伯语-英语代码切换进行了优化。
@MosiAI_Official: MOSS-Transcribe-Diarize-0.9B 现已在 @huggingface 上开源。采用端到端音频到结构化转录…
MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。
rafaelgalle/whisper-diarization-advanced
一个可自定义的语音说话人日志流水线,基于Replicate平台,使用Whisper和Pyannote实现快速的多人转录,具备高级音频预处理、降噪和声道分离功能。