speech-to-text

标签

Cards List
#speech-to-text

@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…

X AI KOLs Timeline ↗ · 昨天 缓存

Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。

0 人收藏 0 人点赞
#speech-to-text

拆分了我们的实时语音栈(STT -> LLM -> TTS),成本降低约14倍。代价是延迟增加,外加一个我未预料到的好处。

Reddit r/AI_Agents ↗ · 3天前

将融合的实时语音AI栈拆分为独立的STT、LLM和TTS阶段,成本降低了约14倍,但延迟增加,意外的好处是内容护栏的可检查性提升。

0 人收藏 0 人点赞
#speech-to-text

少读多写:一种用于流式多模态解码器的闭式带宽调节器

arXiv cs.CL ↗ · 5天前 缓存

本文介绍了ZENDAYA,这是一种用于流式多模态解码器的闭式带宽调节器,它动态调整输入读取以提高实时文本生成性能。研究表明,在视频和音频基准测试中,减少输入消耗可以增强流式设置下的质量和效率。

0 人收藏 0 人点赞
#speech-to-text

推出 Grok Voice Transcribe 2.0(3分钟阅读)

TLDR AI ↗ · 5天前 缓存

Grok Voice Transcribe 2.0 是 x.ai 推出的新语音转文本模型,其准确性较前代产品翻倍,在多语言和真实世界音频转录方面表现出色,并在公共排行榜上名列第一。

0 人收藏 0 人点赞
#speech-to-text

@RayFernando1337: 订阅模式已死……本地模型已足够智能,可在设备上执行任务,而大多数人却为基本功能支付过高费用……

X AI KOLs Timeline ↗ · 2026-09-18 缓存

RayFernando1337 宣布推出 SayRay,这是一款本地 AI 驱动的工具,可将语音转换为文本并在设备上处理。它旨在为基本无障碍需求提供一种经济实惠的替代方案,以取代价格过高的订阅服务。

0 人收藏 0 人点赞
#speech-to-text

我们聊聊吧 (Shall We Talk)

Product Hunt ↗ · 2026-09-14 缓存

Shall We Talk 是一款适用于 iPhone 和 Mac 的开源语音听写工具,它能将语音转换为干净的文本,提供带说话人标签的转录文本,并包含清理功能,同时保留用户的原始措辞。

0 人收藏 0 人点赞
#speech-to-text

Meta的Muse Voice Transcribe(阅读时长4分钟)

TLDR AI ↗ · 2026-09-02 缓存

Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。

0 人收藏 0 人点赞
#speech-to-text

语音AI中的延迟:为何毫秒决定通话是否感觉人性化

Reddit r/AI_Agents ↗ · 2026-09-01

文章强调,低延迟对于语音AI代理维持自然的类人对话至关重要,因为处理链中的延迟会使交互感觉人工化,尤其在客户支持和销售应用中。

0 人收藏 0 人点赞
#speech-to-text

Voiskey

Product Hunt ↗ · 2026-08-31 缓存

Voiskey是一款AI语音输入工具,能将语音转换为符合上下文的文本,支持多种平台和语言,输入速度比打字快5倍。

0 人收藏 0 人点赞
#speech-to-text

看到我们在这项新基准测试中开箱即用排名第二(很快将是第一)太酷了,这让 Ink-2 非常适合消费者应用…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

Ink-2 在新的 VoiceCodeBench 基准测试中排名第二,展示了其实时消费者应用的适用性,GPT Live Transcribe 获得了第一名。

0 人收藏 0 人点赞
#speech-to-text

@vercel_dev:Gemini 3.5 Transcribe 已在 AI Gateway 上线,支持 85+ 种语言的自动检测。实时音频 + 录音:• 𝚐𝚘…

X AI KOLs Following ↗ · 2026-08-26 缓存

Vercel 宣布 Google 的 Gemini 3.5 Transcribe 模型现已在 AI Gateway 上可用,支持实时和录音音频转录,涵盖超过 85 种语言,具有自动语言检测和自定义词汇功能。

0 人收藏 0 人点赞
#speech-to-text

Google宣布推出Gemini 3.5 Transcribe,用于AI驱动的语音转文本

Ars Technica ↗ · 2026-08-26 缓存

Google已宣布Gemini 3.5 Transcribe,这是一款用于语音转文本的AI模型,通过移除如“嗯”这样的填充词并支持85种语言来提高速度和准确性,正在其生态系统中推出。

0 人收藏 0 人点赞
#speech-to-text

Gemini 3.5 Transcribe

Product Hunt ↗ · 2026-08-26

Gemini 3.5 Transcribe 被宣布为目前最精确的语音转文本模型,并在Product Hunt上提供了讨论链接。

0 人收藏 0 人点赞
#speech-to-text

@GoogleDeepMind: Gemini 3.5 Transcribe 是我们最新的语音转文本模型,用于精确和智能的转录。

X AI KOLs ↗ · 2026-08-26 缓存

Google DeepMind 宣布 Gemini 3.5 Transcribe,这是一个新的语音转文本模型,用于精确和智能的转录。

0 人收藏 0 人点赞
#speech-to-text

Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog ↗ · 2026-08-26 缓存

Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。

0 人收藏 0 人点赞
#speech-to-text

superwhisper/s1-mini (阅读约8分钟)

TLDR AI ↗ · 2026-08-20 缓存

superwhisper/s1-mini 是一个从Qwen3-0.6B微调而来的0.6B参数文本规范化模型,用于清理语音转文本记录,通过去除填充词、纠正错误并应用标点和格式,在英语数据上达到94.8%的准确率。

0 人收藏 0 人点赞
#speech-to-text

S1-mini 由 Superwhisper 开发,在浏览器中通过 WebGPU 和 Transformers.js 100%本地运行

Reddit r/LocalLLaMA ↗ · 2026-08-19

S1-mini 是一个拥有600M参数的大语言模型,用于清理语音转文本的记录,通过移除错误和添加标点,在浏览器中通过 WebGPU 和 Transformers.js 本地运行。

0 人收藏 0 人点赞
#speech-to-text

发布 HN: Speko (YC S26) – 语音AI的OpenRouter

Hacker News Top ↗ · 2026-08-17 缓存

Speko是一个基于用户约束优化并路由语音AI模型栈(STT、LLM、TTS)的平台,提供公开基准测试和开源网关。

0 人收藏 0 人点赞
#speech-to-text

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL ↗ · 2026-08-06 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#speech-to-text

在选择STT API之前,先对真正会影响用户的转录错误进行优先级排序。

Reddit r/AI_Agents ↗ · 2026-08-02

一份关于评估语音转文本API的指南,通过根据转录错误对用户的实际影响进行排序,而不是仅看原始准确率指标。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈