Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源
摘要
WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。
暂无内容
查看缓存全文
缓存时间: 2026/07/25 18:17
一个近乎实时的 OpenAI Whisper 实现。
相似文章
Whisper 介绍
OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。
如果应用需要实时语音转文字,Whisper 是否仍是最佳默认选择?
探讨在考虑替代方案和性能权衡的情况下,OpenAI 的 Whisper 是否仍是实时语音转文字应用的首选。
开源、免费层级可用的Whispr,使用Cloudflare AI
VoiceBox是一款开源的桌面语音转文本工具,它捕获语音,通过Cloudflare AI上的Whisper进行转录,并使用LLM格式化输出,自动将结果粘贴到当前活动应用中。
vaibhavs10/incredibly-fast-whisper
一个高度优化的OpenAI Whisper Large v3版本,使用Transformers、Optimum和Flash Attention 2,能够在Replicate上在2分钟内转录150分钟的音频。
@tom_doerr: 以70倍实时速度转录音频 https://github.com/m-bain/whisperX
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。