speech-recognition

标签

Cards List
#speech-recognition

Speechka

Product Hunt · 14小时前 缓存

Speechka是一款实时语音翻译工具,能够模仿用户的声音,支持44种语言,适用于macOS、Windows和浏览器。

0 人收藏 0 人点赞
#speech-recognition

总词错误率(WER)在语音代理生产环境中毫无用处

Reddit r/AI_Agents · 昨天

文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。

0 人收藏 0 人点赞
#speech-recognition

将强制对齐扩展到终端设备

arXiv cs.CL · 2天前 缓存

论文通过使用Hirschberg算法和约束随机游走对Viterbi算法进行优化,将内存使用从140 GB减少到5 MB并提高速度,使得强制对齐能够在终端设备上运行,从而提升语音处理的可扩展性。

0 人收藏 0 人点赞
#speech-recognition

超越WER:带口音对话式ASR中的实体和不流畅性召回率

arXiv cs.CL · 2天前 缓存

本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。

0 人收藏 0 人点赞
#speech-recognition

@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…

X AI KOLs Timeline · 2天前 缓存

R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。

0 人收藏 0 人点赞
#speech-recognition

稳定性与速度:为语音智能体时代重新思考ASR

Reddit r/artificial · 4天前

文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。

0 人收藏 0 人点赞
#speech-recognition

TypeDash

Product Hunt · 5天前 缓存

TypeDash是一款桌面应用程序,允许用户通过语音命令控制计算机并听写文本,功能包括应用启动、网络搜索,以及可选的由ChatGPT驱动的语音识别清理功能。

0 人收藏 0 人点赞
#speech-recognition

T-SANDHI:一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,采用解耦混合注入

arXiv cs.CL · 6天前 缓存

该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。

0 人收藏 0 人点赞
#speech-recognition

@NetEaseYouDaoAI: 大多数流式ASR能快速给你文本。R2T2 给你可操作的文本。我们正在开源 Confucius4-R2T2,一个1.7B…

X AI KOLs Following · 6天前 缓存

NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。

0 人收藏 0 人点赞
#speech-recognition

DiaWhisper-DPO:通过失败挖掘的偏好优化实现临床访谈的角色归因转录

arXiv cs.CL · 2026-09-16 缓存

本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。

0 人收藏 0 人点赞
#speech-recognition

@FinanceYF5: 语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包…

X AI KOLs Timeline · 2026-09-16 缓存

这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。

0 人收藏 0 人点赞
#speech-recognition

AI惠及所有人,支持所有语言

Google AI Blog · 2026-09-15 缓存

Google通过新的Gemini模型推进AI语言支持,实现实时翻译和转录,旨在通过Universal Speech Model等举措覆盖1000种语言。

0 人收藏 0 人点赞
#speech-recognition

展示HN: Jexxa: 设备上高速听写

Hacker News Top · 2026-09-15 缓存

Jexxa 是一款适用于 macOS 的高速听写工具,完全在设备上运行,确保隐私和快速性能,无需上传数据。

0 人收藏 0 人点赞
#speech-recognition

用于多语言语音识别的令牌合并:跨模型规模与微调的系统研究

arXiv cs.CL · 2026-09-15 缓存

本文系统地评估了在Whisper模型系列上用于多语言语音识别的令牌合并技术,展示了在低资源语言和微调模型中,计算效率得到提升而准确性损失最小。

0 人收藏 0 人点赞
#speech-recognition

语音AI架构讨论

Reddit r/AI_Agents · 2026-09-14

本文讨论了语音AI架构中延迟与控制之间的权衡,比较了传统级联系统与端到端模型,并寻求社区对当前实践的反馈。

0 人收藏 0 人点赞
#speech-recognition

Orukeet,基于Parakeet的新语音识别模型

Reddit r/LocalLLaMA · 2026-09-11 缓存

Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。

0 人收藏 0 人点赞
#speech-recognition

联邦多语言语音LLMs的组件感知差分隐私

arXiv cs.CL · 2026-09-11 缓存

本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。

0 人收藏 0 人点赞
#speech-recognition

Interspeech 2026 MLC-SLM 挑战赛任务2的Eloquence提交

arXiv cs.CL · 2026-09-11 缓存

本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。

0 人收藏 0 人点赞
#speech-recognition

评估低资源语言公共语音资源的重用性:以中部库尔德语为案例研究

arXiv cs.CL · 2026-09-11 缓存

本文评估了公开可用的低资源语言语音资源的重用性,重点以中部库尔德语为案例进行研究。

0 人收藏 0 人点赞
#speech-recognition

构建生产级希腊语-英语语音识别系统

Hugging Face Daily Papers · 2026-09-11 缓存

本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈