标签
AudioNotes 是一款本地运行的音视频转文字和智能笔记工具,强调隐私保护和离线使用,支持通过 Docker 或 Python 部署。
filewizard是一个自托管的网页工具,集成了FFmpeg、LibreOffice、Pandoc等成熟工具,支持文件格式转换、OCR和音频转录,用户可通过Docker一键部署,文件处理在本地完成。
Kyutai Labs 与 MireloAI 发布了 MuScriptor,这是迄今最佳的多乐器转录开源模型,能够将任意流派的录音转录为各乐器的 MIDI 音轨。
MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。
LingoChunk 是一款工具,能将母语音频转换为 Anki 记忆卡和影子跟读练习,支持 15 种输入语言和超过 30 种输出语言。
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。
OpenBrief 是一款开源桌面应用,让用户下载视频、转录音频、生成有依据的摘要,以及与媒体内容对话,所有操作都在本地计算机上进行。
一个开源的Obsidian命令行工具,提供沙盒化的AI代理,用于音频转录、深度研究和思维导图,旨在加速笔记记录,同时不修改用户的知识库。
在 macOS 上使用 Gemma 4 E2B 模型、MLX 和 mlx-vlm 进行音频转录的实用指南,包含 uv run 方法及工作流程演示。