标签
Google Gemini 现已支持从视频转写手语,这是 AI 模型在无障碍方面的一项显著进步。
PreenCut 是一个基于 Whisper 转录和大模型分析的开源工具(MIT 协议),让用户用自然语言搜索长视频中的片段,支持批量处理、导出合并及 REST API。
讨论语音代理在转录为文本时如何丢失语调、犹豫和说话人身份等副语言信号,并质疑这些特征是否以及如何在下游被捕获和使用。
Wired 重点介绍了 Meetily,一款免费的开源应用,可在本地转录和总结会议,无需订阅费用或云端上传,并支持各大视频会议平台。
《Wired》对2026年最佳AI笔记设备的盘点,评测了Plaud NotePin S、HiDock P1和SpeakON等设备,并附有价格、电池和转录质量方面的说明。
Santiago Perez指出,每3个线上课程学员中就有1个使用AI笔记助手,然后重点介绍了Wispr Flow的新Notetaker功能,该功能可以从你的电脑上聆听,提供准确的转录和简洁的摘要,而无需AI加入会议。
LiveTranscriber 是一款开源 iOS 应用,可在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron、MOSS 和 Qwen3,提供语音转写、多说话人支持、摘要和实时翻译。开发者分享了工程挑战,并邀请 ASR 和端侧 AI 社区提供反馈。
Wispr Flow 发布了 Notetaker,这是一款 AI 会议记录工具,承诺提供准确的、带有说话人归属的转录,并支持跨会议、消息和邮件的搜索。
一份关于评估语音转文本API的指南,通过根据转录错误对用户的实际影响进行排序,而不是仅看原始准确率指标。
OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。
OpenAI 发布了两个新的转录模型:GPT Live Transcribe 用于低延迟场景,GPT Transcribe 用于批处理工作负载,错误率降低高达 41%,并通过上下文提高了语义准确性。
Vexa是一个开源、自托管的会议机器人及转录API,使开发者能够捕获实时对话并将其转化为自有知识。
一位开发者开源了一个由10个AI智能体组成的系统,可从播客片段自动生成YouTube Shorts,包括转录、剪辑、字幕、排程,并设有一个质量检测智能体。
演示了音频输入LLM可以通过优化噪声以匹配期望的转录来生成语音,类似于DeepDream对语音的处理。生成的音频听起来像是一个可怕的恶魔。
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
文章强调了AI笔记应用日益普及,这些应用会自动记录会议和对话,引发了抵制——例如一位风险投资人将Zoom名改为明确拒绝同意。文章探讨了全程录音的社会、法律及实际影响。
MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。
NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。
VoiceBox是一款开源的桌面语音转文本工具,它捕获语音,通过Cloudflare AI上的Whisper进行转录,并使用LLM格式化输出,自动将结果粘贴到当前活动应用中。