标签
本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。
Athena 是一款完全离线、隐私优先的语音助手,完全运行在本地硬件上,结合了多种AI模型用于语音识别、语言理解和情感感知语音合成,具备长期记忆和可中断性。
WhisperSubTranslate 是一个开源桌面应用,利用 OpenAI 的 Whisper 和腾讯的 Hy-MT2 模型实现本地视频字幕生成与翻译,无需联网或注册。
Claude Code 现在可以观看视频了,它利用 FFmpeg 场景检测在屏幕内容变化的关键时刻捕获帧,并集成从 YouTube 免费提取字幕或使用 Whisper 处理 Zoom/Loom 视频的字幕提取功能,使用户能够分析录制内容并将洞察保存到知识库中。
介绍开源工具claude-real-video,它通过场景变化检测和音频转录,让任何LLM都能在本地分析视频,解决了固定帧采样和云上传的痛点。
claude-real-video 是一个Python工具,通过场景检测提取关键帧,并在本地生成视频音频转录文本,使任何大语言模型都能在不经云端上传的情况下分析视频内容。
用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。
介绍了一个名为 audio-to-text 的开源工具,它利用 AI 和本地工具(如 faster-whisper 和 ffmpeg)帮助用户自动生成、校对和烧录字幕,解决剪映等软件成本高、错误多、流程繁琐的问题。
本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。
本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。
Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。
介绍了 NagaTranslate,一个使用 Whisper、VITS 和 LLMs 针对低资源的那加兰克里奥尔语的翻译和语音合成流水线。
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
探讨在考虑替代方案和性能权衡的情况下,OpenAI 的 Whisper 是否仍是实时语音转文字应用的首选。
A developer showcases a fully local voice chatbot running Qwen3.5-397B, Whisper-small, and Orpheus TTS with real-time streaming and interruption recovery. The chatbot, named Athena, engages in deep philosophical discussions about consciousness and self-preservation.
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。
一个本地CLI工具,利用OpenAI的Whisper检测并去除音频录音中的填充词(um、uh、erm),采用技术避免点击声和背景嘶嘶声等音频伪影。
本文讲解了如何为语音转录模型实现ASR偏置(ASR biasing),并借助Groq和本地模型的示例进行说明,同时介绍了集成该功能的开源项目Freestyle。
提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。
本文展示了Whisper在面对静音、噪声或音乐时产生的幻觉故障,可以完全通过内部激活和稀疏自编码器来检测和缓解,无需微调即可大幅降低幻觉率。