whisper

标签

Cards List
#whisper

BanglaTurn: 一个用于 Bangla 语音回合结束检测的基准与 Whisper 基础模型

arXiv cs.CL ↗ · 9小时前 缓存

论文介绍了 BanglaTurn,这是一个用于 Bangla 语音回合结束检测的基准语料库和基于 Whisper 的模型,实现了 84.33% 的准确率,而基线为 69.28%。

0 人收藏 0 人点赞
#whisper

减少六层:Whisper编码器剪枝与无标签恢复

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。

0 人收藏 0 人点赞
#whisper

用于多语言语音识别的令牌合并:跨模型规模与微调的系统研究

arXiv cs.CL ↗ · 2026-09-15 缓存

本文系统地评估了在Whisper模型系列上用于多语言语音识别的令牌合并技术,展示了在低资源语言和微调模型中,计算效率得到提升而准确性损失最小。

0 人收藏 0 人点赞
#whisper

希腊歌曲自动歌词转录:Whisper适配中的规模和任务组合效应

arXiv cs.CL ↗ · 2026-09-11 缓存

本文介绍了首个针对希腊歌曲自动歌词转录的基准,表明通过多任务学习和两阶段训练适配Whisper,达到了27.2%的词错误率,显著优于零样本基线。

0 人收藏 0 人点赞
#whisper

BuzzASR:100+单语语音识别模型的集群

arXiv cs.CL ↗ · 2026-09-10 缓存

BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。

0 人收藏 0 人点赞
#whisper

SpeakPay:面向低资源尼泊尔语金融语音识别的领域自适应LoRA微调Whisper

arXiv cs.CL ↗ · 2026-09-03 缓存

本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。

0 人收藏 0 人点赞
#whisper

用于米佐语自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 的形态感知评估微调

arXiv cs.CL ↗ · 2026-08-21 缓存

本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。

0 人收藏 0 人点赞
#whisper

@Ryrenz: 炸裂,在浏览器里就能给视频生成字幕、剪掉废话 GitHub 上 1.7K stars 剪口播视频最枯燥的两件事:一句句对着音频打字幕,以及把中间那些停顿、吸气、重复的废话一段段裁掉。这两件事加起来能占掉整个剪辑时间的一大半。 FlyCut…

X AI KOLs Timeline ↗ · 2026-08-16 缓存

FlyCut Caption 是一款基于浏览器的AI视频编辑工具,可以自动生成字幕和剪掉视频中的废话,使用 Whisper 和 FunASR 模型在本地处理,无需上传素材。

0 人收藏 0 人点赞
#whisper

@Ryrenz: 我去,用一句话就能从几小时素材里找出想要的片段 MIT 协议,Whisper 转录加大模型分析 剪长视频最痛苦的一步是找素材。几个小时的录像,想找出所有讲到某个话题的片段,只能拖时间轴一段段试听,一下午就耗在这上面。 PreenCut 把…

X AI KOLs Timeline ↗ · 2026-08-11 缓存

PreenCut 是一个基于 Whisper 转录和大模型分析的开源工具(MIT 协议),让用户用自然语言搜索长视频中的片段,支持批量处理、导出合并及 REST API。

0 人收藏 0 人点赞
#whisper

在HN上展示:Vocal Slice – 通过选中文本剪切音频,完全在设备端运行

Hacker News Top ↗ · 2026-08-10 缓存

Vocal Slice 是一款桌面音频编辑应用,利用设备端的 Whisper 转录功能,用户可以通过在转录文本中高亮来选择和导出片段,专为播客制作人和语音专业人士设计。

0 人收藏 0 人点赞
#whisper

@hank_aibtc: 卧槽,真的被这个东西惊到了。 挖到一个叫 KrillinAI 的本地工具,免费,视频翻译、精准字幕、超自然配音、声音克隆,全流程一条龙搞定。 中英互翻效果特别稳, Whisper识别准确率高得离谱, LLM按段翻译上下文不乱, CosyV…

X AI KOLs Timeline ↗ · 2026-08-10 缓存

介绍 KrillinAI,一个免费本地运行的视频翻译工具,支持精准字幕、自然配音和声音克隆,集成了 Whisper、LLM 和 CosyVoice,支持 Win/Mac 及 yt-dlp。

0 人收藏 0 人点赞
#whisper

如何识别新词:上下文偏置方法与语音大语言模型的比较

arXiv cs.CL ↗ · 2026-08-07 缓存

本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。

0 人收藏 0 人点赞
#whisper

使用Whisper进行波斯语语音情感识别中的ASR适应与表示降维研究

arXiv cs.CL ↗ · 2026-08-07 缓存

本文研究了使用Whisper进行波斯语语音情感识别,表明基于PCA的降维方法提升了性能和效率,而ASR微调仅带来有限的改进。

0 人收藏 0 人点赞
#whisper

房间混响和低信噪比对STT准确性的影响远大于模型大小

Reddit r/ArtificialInteligence ↗ · 2026-07-30

房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。

0 人收藏 0 人点赞
#whisper

Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源

Reddit r/artificial ↗ · 2026-07-25 缓存

WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。

0 人收藏 0 人点赞
#whisper

@xiangxiang103: B站一兄弟做的赛博女友,太有感觉了! 纯本地运行的 AI 女友,不联网,不用 API key。 VAD:Silero VAD v5 STT:Whisper LLM:本地 llama.cpp TTS:Qwen3-TTS 四个模型全部塞进 1…

X AI KOLs Timeline ↗ · 2026-07-25 缓存

介绍了一个B站开发者制作的纯本地运行AI女友项目,集成Silero VAD、Whisper、llama.cpp和Qwen3-TTS四个模型,全部塞入15G显存并可热切换。

0 人收藏 0 人点赞
#whisper

开源、免费层级可用的Whispr,使用Cloudflare AI

Hacker News Top ↗ · 2026-07-16 缓存

VoiceBox是一款开源的桌面语音转文本工具,它捕获语音,通过Cloudflare AI上的Whisper进行转录,并使用LLM格式化输出,自动将结果粘贴到当前活动应用中。

0 人收藏 0 人点赞
#whisper

为LLM智能体设计的音频感知层,拥有随使用而增长的记忆

Reddit r/LocalLLaMA ↗ · 2026-07-15

一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。

0 人收藏 0 人点赞
#whisper

Apple 新 SpeechAnalyzer API 与 Whisper 及前代产品的基准测试对比

Hacker News Top ↗ · 2026-07-13 缓存

Apple 的新 SpeechAnalyzer API 在英语设备端转录的准确性和速度上,显著优于其前代 SFSpeechRecognizer 和 OpenAI 的 Whisper 模型,该基准测试在 M2 Pro 机器上进行。新 API 在清晰语音上的词错误率为 2.12%,而 Whisper Small 为 3.74%,且运行速度快三倍。

0 人收藏 0 人点赞
#whisper

是否有对言语障碍具有极高敏感度的AI?

Reddit r/ArtificialInteligence ↗ · 2026-07-12

一位用户寻求关于AI语音识别模型的建议,这些模型能够准确理解严重受损的言语,例如其患有唐氏综合症和自闭症、几乎没有语言能力的兄弟的言语,并指出当前像Whisper这样的系统无法识别。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈