标签
Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。
将融合的实时语音AI栈拆分为独立的STT、LLM和TTS阶段,成本降低了约14倍,但延迟增加,意外的好处是内容护栏的可检查性提升。
本文介绍了ZENDAYA,这是一种用于流式多模态解码器的闭式带宽调节器,它动态调整输入读取以提高实时文本生成性能。研究表明,在视频和音频基准测试中,减少输入消耗可以增强流式设置下的质量和效率。
Grok Voice Transcribe 2.0 是 x.ai 推出的新语音转文本模型,其准确性较前代产品翻倍,在多语言和真实世界音频转录方面表现出色,并在公共排行榜上名列第一。
RayFernando1337 宣布推出 SayRay,这是一款本地 AI 驱动的工具,可将语音转换为文本并在设备上处理。它旨在为基本无障碍需求提供一种经济实惠的替代方案,以取代价格过高的订阅服务。
Shall We Talk 是一款适用于 iPhone 和 Mac 的开源语音听写工具,它能将语音转换为干净的文本,提供带说话人标签的转录文本,并包含清理功能,同时保留用户的原始措辞。
Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。
文章强调,低延迟对于语音AI代理维持自然的类人对话至关重要,因为处理链中的延迟会使交互感觉人工化,尤其在客户支持和销售应用中。
Ink-2 在新的 VoiceCodeBench 基准测试中排名第二,展示了其实时消费者应用的适用性,GPT Live Transcribe 获得了第一名。
Vercel 宣布 Google 的 Gemini 3.5 Transcribe 模型现已在 AI Gateway 上可用,支持实时和录音音频转录,涵盖超过 85 种语言,具有自动语言检测和自定义词汇功能。
Google已宣布Gemini 3.5 Transcribe,这是一款用于语音转文本的AI模型,通过移除如“嗯”这样的填充词并支持85种语言来提高速度和准确性,正在其生态系统中推出。
Gemini 3.5 Transcribe 被宣布为目前最精确的语音转文本模型,并在Product Hunt上提供了讨论链接。
Google DeepMind 宣布 Gemini 3.5 Transcribe,这是一个新的语音转文本模型,用于精确和智能的转录。
Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。
superwhisper/s1-mini 是一个从Qwen3-0.6B微调而来的0.6B参数文本规范化模型,用于清理语音转文本记录,通过去除填充词、纠正错误并应用标点和格式,在英语数据上达到94.8%的准确率。
S1-mini 是一个拥有600M参数的大语言模型,用于清理语音转文本的记录,通过移除错误和添加标点,在浏览器中通过 WebGPU 和 Transformers.js 本地运行。
Speko是一个基于用户约束优化并路由语音AI模型栈(STT、LLM、TTS)的平台,提供公开基准测试和开源网关。
本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。
一份关于评估语音转文本API的指南,通过根据转录错误对用户的实际影响进行排序,而不是仅看原始准确率指标。