@rohanpaul_ai: 喜欢这个,Meta的又一重大发布。推出Muse Voice Transcribe用于实时语音转写,具有最低的…

X AI KOLs Timeline 模型

摘要

Meta发布了Muse Voice Transcribe,这是一款实时语音转文本模型,具有3.1%的词错误率和自适应流功能,使其适用于语音代理。

喜欢这个,Meta的又一重大发布。 推出Muse Voice Transcribe用于实时语音转写,具有最低的3.1%最终转录词错误率和自适应延迟。这在竞争模型中遥遥领先。 - 重要的是,Muse不仅仅转录语音;它学会何时等待、何时提交单词、何时说话者切换以及何时一轮对话真正结束,所有这些都在同一个流模型中进行。这使得它比传统的语音转文本API更接近语音代理的实时感知层。 - Muse以80毫秒的块处理音频,并在每个块后选择是输出文本还是继续监听。 Meta通过Meta Model API、Meta AI for Mac和Muse Code提供了该模型。
查看原文
查看缓存全文

缓存时间: 2026/09/01 17:49

太棒了,Meta又带来了一个重磅更新。

他们推出了Muse Voice Transcribe,实现实时语音转录,最终转录字错误率仅3.1%,并支持自适应延迟。 这一性能显著领先于其他竞争模型。

  • 其重大意义在于:Muse不仅完成了语音转录,更在一个统一的流式模型中学会了何时等待、何时确认单词、何时切换说话者以及何时对话真正结束。这使其相比传统语音转文字API,更接近于语音智能体的实时感知层。

  • Muse以80毫秒为单位处理音频,并在每个片段后决定输出文本还是继续收听。

Meta通过Meta Model API、Meta AI for Mac以及Muse Code开放了此服务。

马克·扎克伯格 (@finkd): Muse Voice Transcribe是MSL首个实时音频感知模型——今日正式推出。作为流式语音转文字的SOTA方案,它在单一模型中原生支持说话人识别和端点检测。

相似文章

Meta 在其应用中推出 Muse Image(3 分钟阅读)

TLDR AI

Meta 已推出 Muse Image,这是来自 Meta Superintelligence Labs 的首个图像生成模型,现已在其应用的 Meta AI 中可用。该模型支持高级推理、多参考组合,并在 Arena 上排名第二,同时计划推出 Muse Video 和 Content Seal 水印。