speech-recognition

标签

Cards List
#speech-recognition

用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制

arXiv cs.CL ↗ · 2026-09-01 缓存

本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。

0 人收藏 0 人点赞
#speech-recognition

VoiceCodeBench: 评估自动语音识别中的精确结构化令牌恢复

arXiv cs.CL ↗ · 2026-09-01 缓存

VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。

0 人收藏 0 人点赞
#speech-recognition

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL ↗ · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
#speech-recognition

PromptKWS:一种基于提示引导的开放词汇关键词识别新框架

arXiv cs.CL ↗ · 2026-09-01 缓存

本文介绍了PromptKWS,一种新颖的提示引导开放词汇关键词识别框架,利用提示嵌入和交叉注意力来提高准确性,在唤醒率和准确率方面分别比基线系统提高了超过10%和15%。

0 人收藏 0 人点赞
#speech-recognition

@SunbirdAI:大多数AI系统只服务于世界上一小部分语言。在非洲,这种差距意味着对技术的访问有限……

X AI KOLs Following ↗ · 2026-08-31 缓存

Sunbird AI宣布将Sunflower扩展至67种非洲语言,支持实时语音和离线访问,并将于2026年9月24日举办直播网络研讨会。

0 人收藏 0 人点赞
#speech-recognition

@rohanpaul_ai: Open ASR 排行榜 - https://huggingface.co/spaces/hf-audio/open_asr_leaderboard… 技术发布博客 - https://hu…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

Open ASR 排行榜是 Hugging Face 推出的基准测试工具,用于评估自动语音识别模型,并附有技术博客文章,链接到 Voice Arena 排行榜。

0 人收藏 0 人点赞
#speech-recognition

@doodlestein: FrankenWhisper 应用终于通过了苹果的审核!在这里下载,完全免费(零广告,零应用内购买!)……

X AI KOLs Timeline ↗ · 2026-08-27 缓存

FrankenWhisper 是一款开源的 iOS 应用,具备说话人识别和降噪功能,现已通过苹果审核并免费提供。

0 人收藏 0 人点赞
#speech-recognition

他们试图打造一个机器之神 | Timnit Gebru

Reddit r/ArtificialInteligence ↗ · 2026-08-27 缓存

Timnit Gebru 批评了构建巨型'机器之神'的主流AI范式,并倡导更小、更专业、社区拥有的AI工具,这些工具应高效、合乎伦理且适应特定上下文。

0 人收藏 0 人点赞
#speech-recognition

@GoogleDeepMind: 这是最新消息:在嘈杂环境中,对复杂电话号码、邮政编码和订单 ID 的理解能力更强了

X AI KOLs ↗ · 2026-08-26 缓存

Google DeepMind 宣布对其 AI 模型进行改进,增强了在嘈杂环境中理解复杂电话号码、邮政编码和订单 ID 的能力,同时加入了去除填充词和识别自定义词汇等功能

0 人收藏 0 人点赞
#speech-recognition

Google的新型AI转录功能自动移除你的'呃'和'啊'

The Verge ↗ · 2026-08-26 缓存

Google发布Gemini 3.5 Transcribe,这是一种AI模型,通过自动移除填充词、支持超过85种语言以及提供自定义词汇和说话人归属来改善音频转录。

0 人收藏 0 人点赞
#speech-recognition

Granite Speech 5.0 Turbo CTC: 极快且准确的转录

Reddit r/LocalLLaMA ↗ · 2026-08-25 缓存

IBM发布两款新的紧凑型AI模型Granite Speech 5.0 Turbo CTC,用于极快且准确的英语语音转录,在NVIDIA H200 GPU上实现超过12,600 RTFx。

0 人收藏 0 人点赞
#speech-recognition

@iamcheyan: small-int8 和paraformer-zh 都只有两百兆,日常使用 paraformer-zh,跟Agent沟通完全够用。速度也很快。如果只是一两句话的那种,基本上就是按下键说话,松开秒出结果。

X AI KOLs Following ↗ · 2026-08-22 缓存

small-int8和paraformer-zh都是轻量级AI模型,体积仅两百兆左右,适用于日常与Agent的交互,速度快速,响应及时。

0 人收藏 0 人点赞
#speech-recognition

Loqua

Product Hunt ↗ · 2026-08-21 缓存

Loqua 是一款产品,它使用户能够通过自然语音将想法转化为文字、理解屏幕内容,并通过语音命令自动化工作流程,从而减少打字和上下文切换,提升生产力。

0 人收藏 0 人点赞
#speech-recognition

测量语音识别中的基准优化

Hugging Face Blog ↗ · 2026-08-21 缓存

本文探讨了关于测量语音识别中基准优化的研究,指出某些语音识别模型可能针对测试基准进行优化而非真实场景性能,并介绍了用于量化该现象的测试方法。

0 人收藏 0 人点赞
#speech-recognition

量化ASR模型中的基准优化

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。

0 人收藏 0 人点赞
#speech-recognition

谁拥有你的声音?

Reddit r/ArtificialInteligence ↗ · 2026-08-19 缓存

本文探讨在开发用于语音识别的AI语言技术时,个人语音数据所有权与集体利益之间的伦理平衡。

0 人收藏 0 人点赞
#speech-recognition

Wispr 以20亿美元估值融资2.8亿美元,着眼于超越听写功能

TechCrunch AI ↗ · 2026-08-17 缓存

Wispr,一家AI听写初创公司,以20亿美元估值获得2.8亿美元B轮融资,并推出名为Canto的新模型,以提高语音理解准确性。

0 人收藏 0 人点赞
#speech-recognition

针对第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

arXiv cs.CL ↗ · 2026-08-17 缓存

本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。

0 人收藏 0 人点赞
#speech-recognition

@tornikegomareli: 我希望 macOS 上的语音听写能感觉即时且原生,于是我构建了 Talkify,一个 8.2 MB 的 macOS 听写应用,具有 12…

X AI KOLs Timeline ↗ · 2026-08-15 缓存

Talkify 是一款免费、开源的 macOS 听写应用,基于 Apple 的 SpeechAnalyzer 构建,支持即时、设备内语音转录,具有低延迟和多语言功能,位于刘海屏中。

0 人收藏 0 人点赞
#speech-recognition

多语言预训练模型在尼泊尔自动语音识别中的比较分析

arXiv cs.CL ↗ · 2026-08-14 缓存

本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈