whisper

标签

Cards List
#whisper

基于Transformer的巴西葡萄牙语韵律边界分割

arXiv cs.CL ↗ · 2026-07-09 缓存

本文提出了SAMPA,一种基于Whisper的分割器,在巴西葡萄牙语语音数据上微调,可自动标记终端韵律边界,在留出集和分布外数据集上取得了具有竞争力的F1分数。

0 人收藏 0 人点赞
#whisper

正如承诺,这是我的100%本地语音到语音助手的GitHub链接

Reddit r/LocalLLaMA ↗ · 2026-07-06

Athena 是一款完全离线、隐私优先的语音助手,完全运行在本地硬件上,结合了多种AI模型用于语音识别、语言理解和情感感知语音合成,具备长期记忆和可中断性。

0 人收藏 0 人点赞
#whisper

@GitHub_Daily: 下载的日语视频没字幕,到处找字幕文件又老对不上时间轴,看视频心情都不好。 于是找到 WhisperSubTranslate 这个开源桌面应用,拖进视频就能生成 SRT 字幕,还能顺手翻译成中文。 语音识别用的是 OpenAI 开源的 Wh…

X AI KOLs Timeline ↗ · 2026-07-05 缓存

WhisperSubTranslate 是一个开源桌面应用,利用 OpenAI 的 Whisper 和腾讯的 Hy-MT2 模型实现本地视频字幕生成与翻译,无需联网或注册。

0 人收藏 0 人点赞
#whisper

@PrajwalTomar_: 等等,这真的太疯狂了。Claude Code 现在可以真正地观看视频了。YouTube、Zoom 通话、Loom 录制。你粘…

X AI KOLs Timeline ↗ · 2026-07-04 缓存

Claude Code 现在可以观看视频了,它利用 FFmpeg 场景检测在屏幕内容变化的关键时刻捕获帧,并集成从 YouTube 免费提取字幕或使用 Whisper 处理 Zoom/Loom 视频的字幕提取功能,使用户能够分析录制内容并将洞察保存到知识库中。

0 人收藏 0 人点赞
#whisper

@Stephen4171127: 最近发现个开源工具Claude-real-video,直接戳中了现在LLM视频分析的死结。 之前全行业都在死卷「把视频能力原生炼进大模型」,相当于每家都要从头造一台带屏幕的手机——要么等大厂挤牙膏更功能,要么自己烧钱炼小模型,普通开发者根…

X AI KOLs Timeline ↗ · 2026-07-03 缓存

介绍开源工具claude-real-video,它通过场景变化检测和音频转录,让任何LLM都能在本地分析视频,解决了固定帧采样和云上传的痛点。

0 人收藏 0 人点赞
#whisper

Claude-real-video - 任何大语言模型都能观看视频

Hacker News Top ↗ · 2026-07-02 缓存

claude-real-video 是一个Python工具,通过场景检测提取关键帧,并在本地生成视频音频转录文本,使任何大语言模型都能在不经云端上传的情况下分析视频内容。

0 人收藏 0 人点赞
#whisper

@reach_vb: 我有大量个人副项目想用Sol处理:1. 优化llama.cpp中的MTP支持(寻找低垂果实…)

X AI KOLs Timeline ↗ · 2026-07-02 缓存

用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。

0 人收藏 0 人点赞
#whisper

@mogician301: https://x.com/mogician301/status/2072250774332285073

X AI KOLs Timeline ↗ · 2026-07-01 缓存

介绍了一个名为 audio-to-text 的开源工具,它利用 AI 和本地工具(如 faster-whisper 和 ffmpeg)帮助用户自动生成、校对和烧录字幕,解决剪映等软件成本高、错误多、流程繁琐的问题。

0 人收藏 0 人点赞
#whisper

使基础ASR模型适应构音障碍语音:一项案例研究

arXiv cs.CL ↗ · 2026-07-01 缓存

本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。

0 人收藏 0 人点赞
#whisper

LOPA:通过潜在序数原型对齐提升口语评估

arXiv cs.CL ↗ · 2026-07-01 缓存

本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。

0 人收藏 0 人点赞
#whisper

压缩 Whisper large-v3-turbo 至 368 MB 采用 Q3_K 匹配的量化感知训练 — 多语言 WER 结果

Reddit r/openclaw ↗ · 2026-06-28

Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。

0 人收藏 0 人点赞
#whisper

NagaTranslate: 为低资源的那加兰克里奥尔语构建翻译与语音流水线 (Whisper, VITS, LLMs) [P]

Reddit r/MachineLearning ↗ · 2026-06-28

介绍了 NagaTranslate,一个使用 Whisper、VITS 和 LLMs 针对低资源的那加兰克里奥尔语的翻译和语音合成流水线。

0 人收藏 0 人点赞
#whisper

Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统

arXiv cs.CL ↗ · 2026-06-25 缓存

本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。

0 人收藏 0 人点赞
#whisper

如果应用需要实时语音转文字,Whisper 是否仍是最佳默认选择?

Reddit r/AI_Agents ↗ · 2026-06-23

探讨在考虑替代方案和性能权衡的情况下,OpenAI 的 Whisper 是否仍是实时语音转文字应用的首选。

0 人收藏 0 人点赞
#whisper

Voice-to-voice chatbot update

Reddit r/LocalLLaMA ↗ · 2026-06-14 缓存

A developer showcases a fully local voice chatbot running Qwen3.5-397B, Whisper-small, and Orpheus TTS with real-time streaming and interruption recovery. The chatbot, named Athena, engages in deep philosophical discussions about consciousness and self-preservation.

0 人收藏 0 人点赞
#whisper

@tom_doerr: 以70倍实时速度转录音频 https://github.com/m-bain/whisperX

X AI KOLs Timeline ↗ · 2026-06-12 缓存

WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。

0 人收藏 0 人点赞
#whisper

从录音中去除'um'比听起来更难

Hacker News Top ↗ · 2026-06-12 缓存

一个本地CLI工具,利用OpenAI的Whisper检测并去除音频录音中的填充词(um、uh、erm),采用技术避免点击声和背景嘶嘶声等音频伪影。

0 人收藏 0 人点赞
#whisper

我如何为语音转录模型实现ASR偏置 [开源]

Reddit r/LocalLLaMA ↗ · 2026-06-11

本文讲解了如何为语音转录模型实现ASR偏置(ASR biasing),并借助Groq和本地模型的示例进行说明,同时介绍了集成该功能的开源项目Freestyle。

0 人收藏 0 人点赞
#whisper

用于鲁棒代码切换语音识别的基于LLM生成的近失对比训练

arXiv cs.CL ↗ · 2026-06-08 缓存

提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。

0 人收藏 0 人点赞
#whisper

基于隐层表示引导和稀疏自编码器的Whisper幻觉检测与缓解

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

本文展示了Whisper在面对静音、噪声或音乐时产生的幻觉故障,可以完全通过内部激活和稀疏自编码器来检测和缓解,无需微调即可大幅降低幻觉率。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈