@rohanpaul_ai: 喜欢这个,Meta的又一重大发布。推出Muse Voice Transcribe用于实时语音转写,具有最低的…
摘要
Meta发布了Muse Voice Transcribe,这是一款实时语音转文本模型,具有3.1%的词错误率和自适应流功能,使其适用于语音代理。
查看缓存全文
缓存时间: 2026/09/01 17:49
太棒了,Meta又带来了一个重磅更新。
他们推出了Muse Voice Transcribe,实现实时语音转录,最终转录字错误率仅3.1%,并支持自适应延迟。 这一性能显著领先于其他竞争模型。
-
其重大意义在于:Muse不仅完成了语音转录,更在一个统一的流式模型中学会了何时等待、何时确认单词、何时切换说话者以及何时对话真正结束。这使其相比传统语音转文字API,更接近于语音智能体的实时感知层。
-
Muse以80毫秒为单位处理音频,并在每个片段后决定输出文本还是继续收听。
Meta通过Meta Model API、Meta AI for Mac以及Muse Code开放了此服务。
马克·扎克伯格 (@finkd): Muse Voice Transcribe是MSL首个实时音频感知模型——今日正式推出。作为流式语音转文字的SOTA方案,它在单一模型中原生支持说话人识别和端点检测。
相似文章
Meta的Muse Video模型早期输出(3分钟阅读)
Meta正在测试其Muse Video模型,该模型展示了生成带有原生音频支持的高质量10秒视频的先进能力。
Meta将在语音模式和Meta眼镜中发布Muse Spark(1分钟阅读)
Meta推出Muse Spark,这是一款基础AI模型,支持Meta AI进行语音对话、购物辅助以及跨应用和智能眼镜的实时视觉识别。该模型首先在美国和加拿大推出,并计划扩展至Ray-Ban Meta和Oakley Meta眼镜。
@DeRonin_: 突发:Meta刚刚发布了Muse Spark 1.1 大家都读错了Meta的Muse Spark 1.1,它不是GPT-5.5的竞争对手……
Meta发布了Muse Spark 1.1,这是一款低成本模型,在工具使用和金融代理等智能体任务上超越了竞争对手,但在编程基准测试中落后。定价为每百万输入token 1.25美元、每百万输出token 4.25美元,它定位为代理工作流的预算模型。
Meta 在其应用中推出 Muse Image(3 分钟阅读)
Meta 已推出 Muse Image,这是来自 Meta Superintelligence Labs 的首个图像生成模型,现已在其应用的 Meta AI 中可用。该模型支持高级推理、多参考组合,并在 Arena 上排名第二,同时计划推出 Muse Video 和 Content Seal 水印。
@cline: Muse Spark 1.1 刚刚发布,是他们迄今为止最强大的编码代理模型。在 Terminal-Bench 2.1 上得分 80.0%,……
Meta 发布了 Muse Spark 1.1,这是一款升级的编码代理模型,在 Terminal-Bench 2.1 上得分 80.0%,同时还公开预览了 Meta Model API。