speech-recognition

标签

Cards List
#speech-recognition

语音AI架构讨论

Reddit r/AI_Agents · 2026-09-14

本文讨论了语音AI架构中延迟与控制之间的权衡,比较了传统级联系统与端到端模型,并寻求社区对当前实践的反馈。

0 人收藏 0 人点赞
#speech-recognition

Orukeet,基于Parakeet的新语音识别模型

Reddit r/LocalLLaMA · 2026-09-11 缓存

Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。

0 人收藏 0 人点赞
#speech-recognition

联邦多语言语音LLMs的组件感知差分隐私

arXiv cs.CL · 2026-09-11 缓存

本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。

0 人收藏 0 人点赞
#speech-recognition

Interspeech 2026 MLC-SLM 挑战赛任务2的Eloquence提交

arXiv cs.CL · 2026-09-11 缓存

本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。

0 人收藏 0 人点赞
#speech-recognition

评估低资源语言公共语音资源的重用性:以中部库尔德语为案例研究

arXiv cs.CL · 2026-09-11 缓存

本文评估了公开可用的低资源语言语音资源的重用性,重点以中部库尔德语为案例进行研究。

0 人收藏 0 人点赞
#speech-recognition

构建生产级希腊语-英语语音识别系统

Hugging Face Daily Papers · 2026-09-11 缓存

本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。

0 人收藏 0 人点赞
#speech-recognition

netease-youdao/Confucius4-R2T2

Hugging Face Models Trending · 2026-09-10 缓存

Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。

0 人收藏 0 人点赞
#speech-recognition

BuzzASR:100+单语语音识别模型的集群

arXiv cs.CL · 2026-09-10 缓存

BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。

0 人收藏 0 人点赞
#speech-recognition

Desert Ant Labs

Product Hunt · 2026-09-09 缓存

Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。

0 人收藏 0 人点赞
#speech-recognition

倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别

arXiv cs.CL · 2026-09-04 缓存

本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。

0 人收藏 0 人点赞
#speech-recognition

@rohanpaul_ai: 多年来,我购买科技产品的标准发生了很大变化。智能手机最大的局限性可能是它……

X AI KOLs Following · 2026-09-03 缓存

这条推文讨论了AI硬件如何通过利用情境理解来减少对屏幕的依赖,并强调HojoAI的开源多语言ASR模型是一个重要发布。

0 人收藏 0 人点赞
#speech-recognition

SpeakPay:面向低资源尼泊尔语金融语音识别的领域自适应LoRA微调Whisper

arXiv cs.CL · 2026-09-03 缓存

本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。

0 人收藏 0 人点赞
#speech-recognition

微软发布VibeVoice-ASR-Streaming流式语音识别模型

Reddit r/LocalLLaMA · 2026-09-03 缓存

微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。

0 人收藏 0 人点赞
#speech-recognition

@tryaircaps: 今日,我们正式发布 AirCaps Audio Research Lab。现实音频的理解难度是数字世界的 10 倍……

X AI KOLs Following · 2026-09-02 缓存

AirCaps Audio Research Lab 推出专为复杂现实环境设计的流式语音和音频模型,声称在边缘硬件上的性能优于领先的云模型。

0 人收藏 0 人点赞
#speech-recognition

真实世界ASR转录本中的主题匹配:基准测试与经验教训

arXiv cs.CL · 2026-09-02 缓存

本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。

0 人收藏 0 人点赞
#speech-recognition

VibeVoice-ASR-Streaming 技术报告

Hugging Face Daily Papers · 2026-09-02 缓存

VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。

0 人收藏 0 人点赞
#speech-recognition

Vellium v1.1.0 — 实时语音、本地 STT/TTS 与更简便的 llama.cpp 设置

Reddit r/LocalLLaMA · 2026-09-01

Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。

0 人收藏 0 人点赞
#speech-recognition

用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制

arXiv cs.CL · 2026-09-01 缓存

本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。

0 人收藏 0 人点赞
#speech-recognition

VoiceCodeBench: 评估自动语音识别中的精确结构化令牌恢复

arXiv cs.CL · 2026-09-01 缓存

VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。

0 人收藏 0 人点赞
#speech-recognition

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈