标签
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
OpenAI 发布了两个新的转录模型:GPT Live Transcribe 用于低延迟场景,GPT Transcribe 用于批处理工作负载,错误率降低高达 41%,并通过上下文提高了语义准确性。
本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。
伊隆·马斯克宣布推出Grok Build,这是一项新功能,允许用户像跟人说话一样通过语音转文字与Grok对话来完成各种任务,包括编码任务。
Speech To Markdown 是一款使用本地AI将语音转换为markdown格式的产品,专为笔记记录而设计。
作者构建了callitdone.today,一个能拨打真实电话、导航IVR菜单、等待通话并与人交谈的AI语音代理,分享了关键的技术挑战和经验教训。
Simulstream 是一个开源框架,用于评估和演示流式语音到文本翻译系统,支持长语音的增量解码和重新翻译解码,并具备细粒度日志记录和交互式 Web 界面。
本文介绍了从2000美元到40000美元的本地大模型硬件配置方案,包括双RTX 3090到四RTX PRO 6000的详细设置,涵盖PCIe交换机、GPU通信、Docker配置和语音转文字等。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。
EdgeSpeak 正式发布,一款本地优先、保护隐私的精准转录工具,支持语义分段和时间戳,兼容 OpenAI Audio API 等,后续将增加说话人标记和语音生成功能。
一款新的语音转文字工具声称可与 Windows 上的 Dragon Professional 媲美,为语音识别提供了一个有竞争力的替代方案。
对领先STT模型在1000多个嘈杂真实世界片段上的评估显示,大多数在嘈杂环境中表现不佳,其中DG Nova表现最佳。应用噪声消除显著提高了准确性。
作者认为,对于实时语音代理,STT延迟和实时行为比原始转录准确性更为关键,并提出了不同的评估记分卡。
探讨在考虑替代方案和性能权衡的情况下,OpenAI 的 Whisper 是否仍是实时语音转文字应用的首选。
Google AI Edge Eloquent 现已支持 Mac,作为完全本地的 Wispr Flow 替代品,基于最新 Gemma 模型实现实时语音转录和语音命令编辑文本,免费、无订阅且隐私全本地。