speech-recognition

标签

Cards List
#speech-recognition

构建生产级希腊语-英语语音识别系统

Hugging Face Daily Papers · 2026-09-11 缓存

本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。

0 人收藏 0 人点赞
#speech-recognition

netease-youdao/Confucius4-R2T2

Hugging Face Models Trending · 2026-09-10 缓存

Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。

0 人收藏 0 人点赞
#speech-recognition

BuzzASR:100+单语语音识别模型的集群

arXiv cs.CL · 2026-09-10 缓存

BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。

0 人收藏 0 人点赞
#speech-recognition

Desert Ant Labs

Product Hunt · 2026-09-09 缓存

Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。

0 人收藏 0 人点赞
#speech-recognition

倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别

arXiv cs.CL · 2026-09-04 缓存

本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。

0 人收藏 0 人点赞
#speech-recognition

@rohanpaul_ai: 多年来,我购买科技产品的标准发生了很大变化。智能手机最大的局限性可能是它……

X AI KOLs Following · 2026-09-03 缓存

这条推文讨论了AI硬件如何通过利用情境理解来减少对屏幕的依赖,并强调HojoAI的开源多语言ASR模型是一个重要发布。

0 人收藏 0 人点赞
#speech-recognition

SpeakPay:面向低资源尼泊尔语金融语音识别的领域自适应LoRA微调Whisper

arXiv cs.CL · 2026-09-03 缓存

本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。

0 人收藏 0 人点赞
#speech-recognition

微软发布VibeVoice-ASR-Streaming流式语音识别模型

Reddit r/LocalLLaMA · 2026-09-03 缓存

微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。

0 人收藏 0 人点赞
#speech-recognition

@tryaircaps: 今日,我们正式发布 AirCaps Audio Research Lab。现实音频的理解难度是数字世界的 10 倍……

X AI KOLs Following · 2026-09-02 缓存

AirCaps Audio Research Lab 推出专为复杂现实环境设计的流式语音和音频模型,声称在边缘硬件上的性能优于领先的云模型。

0 人收藏 0 人点赞
#speech-recognition

真实世界ASR转录本中的主题匹配:基准测试与经验教训

arXiv cs.CL · 2026-09-02 缓存

本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。

0 人收藏 0 人点赞
#speech-recognition

VibeVoice-ASR-Streaming 技术报告

Hugging Face Daily Papers · 2026-09-02 缓存

VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。

0 人收藏 0 人点赞
#speech-recognition

Vellium v1.1.0 — 实时语音、本地 STT/TTS 与更简便的 llama.cpp 设置

Reddit r/LocalLLaMA · 2026-09-01

Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。

0 人收藏 0 人点赞
#speech-recognition

用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制

arXiv cs.CL · 2026-09-01 缓存

本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。

0 人收藏 0 人点赞
#speech-recognition

VoiceCodeBench: 评估自动语音识别中的精确结构化令牌恢复

arXiv cs.CL · 2026-09-01 缓存

VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。

0 人收藏 0 人点赞
#speech-recognition

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
#speech-recognition

PromptKWS:一种基于提示引导的开放词汇关键词识别新框架

arXiv cs.CL · 2026-09-01 缓存

本文介绍了PromptKWS,一种新颖的提示引导开放词汇关键词识别框架,利用提示嵌入和交叉注意力来提高准确性,在唤醒率和准确率方面分别比基线系统提高了超过10%和15%。

0 人收藏 0 人点赞
#speech-recognition

@SunbirdAI:大多数AI系统只服务于世界上一小部分语言。在非洲,这种差距意味着对技术的访问有限……

X AI KOLs Following · 2026-08-31 缓存

Sunbird AI宣布将Sunflower扩展至67种非洲语言,支持实时语音和离线访问,并将于2026年9月24日举办直播网络研讨会。

0 人收藏 0 人点赞
#speech-recognition

@rohanpaul_ai: Open ASR 排行榜 - https://huggingface.co/spaces/hf-audio/open_asr_leaderboard… 技术发布博客 - https://hu…

X AI KOLs Timeline · 2026-08-28 缓存

Open ASR 排行榜是 Hugging Face 推出的基准测试工具,用于评估自动语音识别模型,并附有技术博客文章,链接到 Voice Arena 排行榜。

0 人收藏 0 人点赞
#speech-recognition

@doodlestein: FrankenWhisper 应用终于通过了苹果的审核!在这里下载,完全免费(零广告,零应用内购买!)……

X AI KOLs Timeline · 2026-08-27 缓存

FrankenWhisper 是一款开源的 iOS 应用,具备说话人识别和降噪功能,现已通过苹果审核并免费提供。

0 人收藏 0 人点赞
#speech-recognition

他们试图打造一个机器之神 | Timnit Gebru

Reddit r/ArtificialInteligence · 2026-08-27 缓存

Timnit Gebru 批评了构建巨型'机器之神'的主流AI范式,并倡导更小、更专业、社区拥有的AI工具,这些工具应高效、合乎伦理且适应特定上下文。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈