speech-recognition

标签

Cards List
#speech-recognition

超越单次运行的公平性:语音大模型适配中的训练随机种子变异性

arXiv cs.CL ↗ · 17小时前 缓存

该论文表明,在语音大模型适配中,训练随机种子的变异性对人口统计学公平性差距的影响可能超过音频压缩方案的选择,因此仅基于单次运行的公平性报告是不可靠的。方差分解结果显示,Fair-Speech 数据集上的种族差距差异中有 85.3% 可归因于种子效应,且即使扩大适配数据规模,这些效应依然存在。

0 人收藏 0 人点赞
#speech-recognition

TutlAit v1:一个带有阿拉伯语转写和区域口音标签的众包摩洛哥Tamazight语音数据集

arXiv cs.CL ↗ · 17小时前 缓存

TutlAit v1 提供了一个众包的摩洛哥 Tamazight 语音数据集,包含 13,384 个音频文件(约 20.9 小时),并配有现代标准阿拉伯语转写和区域口音标签。该数据集通过一个专门构建的 Web 应用程序收集,面向低资源语音技术研究。

0 人收藏 0 人点赞
#speech-recognition

使用ASR对齐与停顿建模的运动神经元病患者言语流畅性指数自动估计

arXiv cs.CL ↗ · 17小时前 缓存

该论文提出了一种自动估计运动神经元病患者言语流畅性指数的系统,该系统结合WhisperX语音识别对齐、Silero VAD与停顿建模,其性能优于传统声学特征和自监督嵌入方法,采用具有临床可解释性的指标,R²最高可达0.9。

0 人收藏 0 人点赞
#speech-recognition

五个本地模型,6.8 GB 权重:我的开源 Mac 会议记录器

Reddit r/LocalLLaMA ↗ · 昨天

开发者发布了 LokalBot 0.9.2,一款免费、开源的 Mac 会议记录应用,完全在本地设备上运行,整个技术栈由五个本地模型组成(Qwen3-ASR 用于转写、Nemotron 3 用于说话人分离、Qwen3.5 4B 用于生成笔记、Harrier 用于嵌入向量、LFM2.5 用于自动补全),同时在 M4 Max 上取得了基准测试改进。

0 人收藏 0 人点赞
#speech-recognition

Oído:在 5 美元微控制器上运行、性能超越 Whisper-tiny 的语音识别系统(开源)

Reddit r/LocalLLaMA ↗ · 昨天

Oído 是 Lokutor 推出的开源语音识别系统,可在 5 美元的 ESP32-S3 微控制器上运行 NVIDIA 的 Conformer-CTC Small(1300 万参数、int8),在 LibriSpeech 和嘈杂环境基准测试中均超越 Whisper tiny.en,且无需 GPU 或 NPU。

0 人收藏 0 人点赞
#speech-recognition

谁说了什么,而且会被记住吗?评估跨会议的持续说话人归属

Hugging Face Daily Papers ↗ · 昨天 缓存

本文提出了 SI-cpWER——一种面向跨会议持续说话人归属的语料级评测指标,并在 NOTSOFAR 和 CHiME-6 上对 5 个商用说话人分离+语音识别 API、2 个开源基线(以及作者自己的 ThyVoice 系统)进行了评估,结果表明,单场会议内的排名并不能反映跨会议的身份一致性。短版本已被 IEEE SLT 2026 Demo Track 接收。

0 人收藏 0 人点赞
#speech-recognition

getcta.store

Product Hunt ↗ · 2天前 缓存

getcta.store 是一款适用于 macOS 的 AI 提词器,可定位在 MacBook 刘海下方,提供脚本生成、语音跟随高亮以及视频通话中隐藏操作等功能。

0 人收藏 0 人点赞
#speech-recognition

Zumbo

Product Hunt ↗ · 3天前 缓存

Zumbo 是一款适用于 Mac 的开源本地 AI 语音转文本工具,提供私密语音转文本转换,具有高精度、多种词汇包和离线功能。

0 人收藏 0 人点赞
#speech-recognition

I-Parakeet: 专为移动NPU优化的纯整数Conformer ASR模型

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了I-Parakeet,一个专为移动NPU优化的纯整数Conformer ASR模型,实现了高效的设备端语音识别。

0 人收藏 0 人点赞
#speech-recognition

音频大语言模型能知晓何时听不清你的声音

arXiv cs.AI ↗ · 3天前 缓存

本文探讨了音频大语言模型检测不可靠转录的能力,并提出一种基于音频编码器表示的轻量级预测器,用于触发澄清请求。

0 人收藏 0 人点赞
#speech-recognition

基于LLM的ASR中的推理时目标说话人遗忘

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了目标说话人遗忘ASR(TSU-ASR),并提出了一种新颖的注册条件门控模块,用于在基于LLM的ASR中推理时动态退出说话人,以增强在线会议的隐私性。

0 人收藏 0 人点赞
#speech-recognition

Pruned CTC:内存高效的大词汇量自动语音识别训练

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了Pruned CTC,这是一种通过限制对齐计算来降低大词汇量自动语音识别中连接时序分类训练内存使用的方法,证明了其与全词汇量CTC的等价性,并展示了在离线和流式设置下与LLM适配的强大性能。

0 人收藏 0 人点赞
#speech-recognition

@omarsar0: 推荐基准。我预计语音将成为人们与机器人和物理AI交互的主要方式之一。那个…

X AI KOLs Timeline ↗ · 6天前 缓存

BRIDGE ASR 2.0 是一个基准,评估语音识别模型在21种语言的真实双人对话中的表现,重点关注语码转换和多语言性能,以增强AI和机器人中的语音交互。

0 人收藏 0 人点赞
#speech-recognition

Agentic-GER:利用全局上下文在长语音中恢复术语

arXiv cs.CL ↗ · 6天前 缓存

Agentic-GER 提出一个基于大语言模型的智能体,用于在长语音转录中利用全局上下文和选择性重转录修正领域特定术语,实现了中英文语音识别准确率的显著提升。

0 人收藏 0 人点赞
#speech-recognition

Whisper模型后训练压缩导致的时序税累积

arXiv cs.CL ↗ · 6天前 缓存

本文研究Whisper ASR模型后训练权重压缩如何加剧转录错误的人口统计学差异,导致边缘化说话者更正时间增加。

0 人收藏 0 人点赞
#speech-recognition

脑语言解码:任务、信号、方法、评估、实际应用及其他

arXiv cs.CL ↗ · 2026-09-24 缓存

本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。

0 人收藏 0 人点赞
#speech-recognition

Ruby-ASR:一种用于联合字形与词汇阅读识别的证据保持监督方法

arXiv cs.CL ↗ · 2026-09-24 缓存

Ruby-ASR 提出了一种新的监督方法,用于日语自动语音识别,该方法将字形跨度与其词汇阅读绑定,在保持转录准确性的同时改进阅读识别。

0 人收藏 0 人点赞
#speech-recognition

@SamuelZengML: 语音识别很容易——直到你要求它永远倾听。今日我们开源 Audio8 ASR Infinite:超低延迟…

X AI KOLs Following ↗ · 2026-09-23 缓存

开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。

0 人收藏 0 人点赞
#speech-recognition

半监督联邦ASR的实用方案:在线伪标签与服务器更新稳定化

arXiv cs.LG ↗ · 2026-09-23 缓存

本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。

0 人收藏 0 人点赞
#speech-recognition

@xiangxiang103: 这太令人印象深刻了!Hugging Face本周放出了一匹黑马——同时在两个赛道上占据主导地位。Spe…

X AI KOLs Timeline ↗ · 2026-09-23 缓存

NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈