speech-recognition

标签

Cards List
#speech-recognition

脑语言解码:任务、信号、方法、评估、实际应用及其他

arXiv cs.CL · 9小时前 缓存

本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。

0 人收藏 0 人点赞
#speech-recognition

Ruby-ASR:一种用于联合字形与词汇阅读识别的证据保持监督方法

arXiv cs.CL · 9小时前 缓存

Ruby-ASR 提出了一种新的监督方法,用于日语自动语音识别,该方法将字形跨度与其词汇阅读绑定,在保持转录准确性的同时改进阅读识别。

0 人收藏 0 人点赞
#speech-recognition

@SamuelZengML: 语音识别很容易——直到你要求它永远倾听。今日我们开源 Audio8 ASR Infinite:超低延迟…

X AI KOLs Following · 昨天 缓存

开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。

0 人收藏 0 人点赞
#speech-recognition

半监督联邦ASR的实用方案:在线伪标签与服务器更新稳定化

arXiv cs.LG · 昨天 缓存

本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。

0 人收藏 0 人点赞
#speech-recognition

@xiangxiang103: 这太令人印象深刻了!Hugging Face本周放出了一匹黑马——同时在两个赛道上占据主导地位。Spe…

X AI KOLs Timeline · 昨天 缓存

NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。

0 人收藏 0 人点赞
#speech-recognition

Speechka

Product Hunt · 昨天 缓存

Speechka是一款实时语音翻译工具,能够模仿用户的声音,支持44种语言,适用于macOS、Windows和浏览器。

0 人收藏 0 人点赞
#speech-recognition

总词错误率(WER)在语音代理生产环境中毫无用处

Reddit r/AI_Agents · 3天前

文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。

0 人收藏 0 人点赞
#speech-recognition

将强制对齐扩展到终端设备

arXiv cs.CL · 3天前 缓存

论文通过使用Hirschberg算法和约束随机游走对Viterbi算法进行优化,将内存使用从140 GB减少到5 MB并提高速度,使得强制对齐能够在终端设备上运行,从而提升语音处理的可扩展性。

0 人收藏 0 人点赞
#speech-recognition

超越WER:带口音对话式ASR中的实体和不流畅性召回率

arXiv cs.CL · 3天前 缓存

本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。

0 人收藏 0 人点赞
#speech-recognition

@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…

X AI KOLs Timeline · 3天前 缓存

R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。

0 人收藏 0 人点赞
#speech-recognition

稳定性与速度:为语音智能体时代重新思考ASR

Reddit r/artificial · 6天前

文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。

0 人收藏 0 人点赞
#speech-recognition

TypeDash

Product Hunt · 6天前 缓存

TypeDash是一款桌面应用程序,允许用户通过语音命令控制计算机并听写文本,功能包括应用启动、网络搜索,以及可选的由ChatGPT驱动的语音识别清理功能。

0 人收藏 0 人点赞
#speech-recognition

T-SANDHI:一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,采用解耦混合注入

arXiv cs.CL · 2026-09-17 缓存

该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。

0 人收藏 0 人点赞
#speech-recognition

@NetEaseYouDaoAI: 大多数流式ASR能快速给你文本。R2T2 给你可操作的文本。我们正在开源 Confucius4-R2T2,一个1.7B…

X AI KOLs Following · 2026-09-17 缓存

NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。

0 人收藏 0 人点赞
#speech-recognition

DiaWhisper-DPO:通过失败挖掘的偏好优化实现临床访谈的角色归因转录

arXiv cs.CL · 2026-09-16 缓存

本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。

0 人收藏 0 人点赞
#speech-recognition

@FinanceYF5: 语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包…

X AI KOLs Timeline · 2026-09-16 缓存

这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。

0 人收藏 0 人点赞
#speech-recognition

AI惠及所有人,支持所有语言

Google AI Blog · 2026-09-15 缓存

Google通过新的Gemini模型推进AI语言支持,实现实时翻译和转录,旨在通过Universal Speech Model等举措覆盖1000种语言。

0 人收藏 0 人点赞
#speech-recognition

展示HN: Jexxa: 设备上高速听写

Hacker News Top · 2026-09-15 缓存

Jexxa 是一款适用于 macOS 的高速听写工具,完全在设备上运行,确保隐私和快速性能,无需上传数据。

0 人收藏 0 人点赞
#speech-recognition

用于多语言语音识别的令牌合并:跨模型规模与微调的系统研究

arXiv cs.CL · 2026-09-15 缓存

本文系统地评估了在Whisper模型系列上用于多语言语音识别的令牌合并技术,展示了在低资源语言和微调模型中,计算效率得到提升而准确性损失最小。

0 人收藏 0 人点赞
#speech-recognition

语音AI架构讨论

Reddit r/AI_Agents · 2026-09-14

本文讨论了语音AI架构中延迟与控制之间的权衡,比较了传统级联系统与端到端模型,并寻求社区对当前实践的反馈。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈