Meta的Muse Voice Transcribe(阅读时长4分钟)

TLDR AI 模型

摘要

Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。

Muse Voice Transcribe是Meta的首款实时音频感知模型。它支持流式语音识别、超过20位说话人的分离、端点检测、多语言语码转换以及上下文偏置。
查看原文
查看缓存全文

缓存时间: 2026/09/02 23:42

# 介绍 Muse Voice Transcribe 来源:https://research.meta.ai/blog/introducing-muse-voice-transcribe 我们很高兴地介绍 Muse Voice Transcribe,这是由 Meta 超级智能实验室开发的首个实时音频感知模型。 Muse Voice Transcribe 标志着我们将实时语音模型带给用户的重要里程碑。它提供实时流式语音识别、支持 20 多位说话人的说话人分离,以及端点检测。该模型支持多语言并能无缝切换语言,同时通过语言、关键词和上下文偏置来提升准确度。 在流式语音转文本和公开的说话人分离基准测试中,我们在 Artificial Analysis 排名第一。模型包含情况及排名截至 2026 年 9 月 1 日。 柱状图展示了最终转录流式词错误率,其中 Muse Voice Transcribe 最低,为 3.1%,其他七个系统在 3.4% 到 4.0% 之间。 柱状图展示了在 AMI-IHM、AMI-SDM 和 VoxConverse 上的平均说话人分离错误率,其中 Muse Voice Transcribe 最低,为 17.5%,其他五个系统在 21.1% 到 28.6% 之间。 Muse Voice Transcribe 八位说话人朗读回放位置 0:00,总时长 3:06 说话者 A:今天,我们很高兴地介绍 Muse Voice Transcribe,这是由 Meta 超级智能实验室开发的首个实时音频感知模型。说话者 B:Muse Voice Transcribe 实时执行流式语音识别、说话人分离和端点检测,它原生处理 25 种以上语言的多语言输入,并能无缝识别语码转换。它还可以利用语言关键词和上下文偏置。说话者 C:是的,而且最厉害的是实时延迟特别低,基本上你说完它就出来了。还有就是说话人分离能分清是谁在说。说话者 D:你们现在在屏幕上看到的是实时画面。我们八个人在一个房间里说话,它完全知道谁说了什么。这就是它的个性化之处。说话者 E:这正是为什么这很重要,因为马克在《AI 未来属于每个人》中写道。问题不是超级智能是否会存在,而是谁将能够访问它。说话者 F:对。他认为不能是一个单一的中心化超级智能试图一次性与所有人保持一致。它必须是每个人的个性化超级智能。说话者 G:而要让它个性化,它就必须像人类一样在 AI 眼镜的实时对话中倾听,而不仅仅是语音命令。这就是交互模型。说话者 H:现实对话是混乱的。有重叠、打断、口音。这就是为什么流式端点检测和说话人分离如此重要。说话者 A:马克围绕三个观点来阐述:个人赋权推动繁荣、创新是首要目的、以及权力平衡是安全的基础。语音识别是这三者的基础。说话者 C:没错,如果只能听懂英文,那怎么叫“属于每个人”呢?像我妈平时就是中文加英文,比如明天九点有个 doctor appointment,你的你记得叫我一下,这种才是最真实的对话。如果听不懂,怎么能叫个性化呢?说话者 B:确实如此。这就是为什么一句话内的无缝语码转换是必不可少的。加上上下文偏置,当你说 Meta、Muse 或 Menlo Park 时,它就能正确识别,因为它了解你的世界。说话者 D:对。它需要知道你的联系人、你的关键词、你的地点。这样它才能成为你的专属工具。说话者 E:这是关于创新,而不仅仅是自动化。如果耳朵能完美运作,你就能创造、表达想法、学习任何东西。它是一个创作工具。说话者 F:这很难。八位说话者是对说话人分离最严苛的考验,而它实时跟踪了我们所有人。说话者 G:Muse Voice Transcribe 在流式语音识别和流式说话人分离方面表现强劲。说话者 H:所以,马克描述的未来——每个人都拥有一个个性化智能体——始于一双真正为每个人工作的耳朵。说话者 C:对,这才是真正的个性化超级智能,能实时听懂,分清是谁说的,而且不管是中文还是英文都能无缝理解,这才是“属于每个人”。说话者 A:我们将在本文中深入探讨我们如何构建 Muse Voice Transcribe。 ## 流式语音识别作为基础 Muse Voice Transcribe 是来自 Muse Spark 系列的自回归多模态模型。 音频以 80 毫秒的块进行处理(12.5 Hz),每个块被转换为一个软令牌。在每个音频块处,模型决定是继续收听下一个音频块还是输出一个文本令牌。当模型决定继续收听时,它会预测一个 `<|next_audio|>` 特殊令牌,并在下一个输入中用实际的音频块替换 `<|next_audio|>`。 当音频流停止时,我们插入一个特殊的 `<|empty_audio|>` 令牌,通知模型没有更多的音频块。模型在看到 `<|empty_audio|>` 后,会输出所有剩余的文本令牌,而不会产生任何 `<|next_audio|>` 令牌。 由于模型完全控制何时收听,它会决定在转录一个单词前需要多少音频上下文(我们称之为“延迟”)。准确度和延迟之间存在权衡。模型等待预测的时间越长,转录越准确,但延迟也越高。Muse Voice Transcribe 具有“自适应延迟”,会根据每个单词的难度动态改变延迟。这是通过强化学习实现的,其中词错误率奖励和延迟奖励以乘法方式结合。 通过自适应延迟,Muse Voice Transcribe 在速度-准确度权衡上达到了帕累托前沿,该权衡以最终转录时间衡量。 散点图比较了最终转录词错误率与最终转录时间。Muse Voice Transcribe 在 0.16 秒时达到约 3.0% 的错误率,低于之前由 Soniox、Cartesia 和 ElevenLabs 系统形成的虚线帕累托前沿;图中显示的其它当前系统具有更高的错误率或延迟。 ## 在语音识别之上构建说话人分离和端点检测 以流式语音识别为基础,我们可以通过引入额外的特殊令牌轻松支持其他音频感知任务。 对于说话人分离,我们引入一个 `<|start_of_turn|>` 令牌来标记可能的说话人切换,并使用 `<|speaker_{A-Z}|>` 标签来区分说话人。`<|start_of_turn|>` 会在说话人切换时立即预测,而说话人标签的预测则延迟到块结束时。来自同一说话人的音频也可能被 `<|start_of_turn|>` 分割,但所有这些片段的说话人标签都是相同的。 以下是说话人分离的令牌序列示例(为简化,省略 `<|next_audio|>`): ``` <|start_of_turn|>你好,你怎么样?<|speaker_A|><|start_of_turn|> 周末有什么好玩的吗?<|speaker_A|><|start_of_turn|> 嘿,我很好!<|speaker_B|> ``` 对于端点检测,我们引入一个 `<|speech_onset|>` 令牌来标记语音开始,以及一个 `<|speech_endpoint|>` 令牌来标记用户何时说完。 以下是端点检测的令牌序列示例(为简化,省略 `<|next_audio|>`): ``` <|speech_onset|>嘿 Meta,门洛帕克天气怎么样?<|speech_endpoint|> [静音] <|speech_onset|>今天我该穿什么?<|speech_endpoint|> ``` 我们将这两个任务与流式语音识别一起训练,并在语音识别奖励的基础上,分别为说话人分离和端点检测添加额外的奖励。 ## 功能 ### 语言覆盖 Muse Voice Transcribe 使用 70 多种语言训练,其中 25 种经过了广泛验证。在初始发布中,我们建议尝试这 25 种经过验证的语言 (https://dev.meta.ai/docs/speech-to-text#language-biasing),同时也支持其他语言。 我这个月去了十二次健身房,体重从78.5公斤直接降到75公斤,体脂率也掉了2.5%。我今天早上跑完五公里,花了28分钟,算一算平均心率是145,感觉体能比三个月前好多了。 Muse Voice Transcribe 中文转录演示回放位置 0:00,总时长 0:19 我这个月去了十二次健身房,体重从 78.5 公斤直接降到 75 公斤,体脂率也掉了 2.5%。我今天早上跑完五公里,花了 28 分钟,算一算平均心率是 145,感觉体能比三个月前好多了。 ### 语码转换 语码转换对于双语者来说非常常见。Muse Voice Transcribe 原生支持任意语码转换,无论是句内还是句间。在这个音频片段中,它还使用了上下文偏置来进一步提高识别准确度。 昨天我在local desktop上用Ollama跑了下Meta 的Muse Glimmer直接deploy在我的NVIDIA RTX 3090上,整个setup非常smooth,把quantize之后的4bit GGUF load进24GB的GDDR6X VRAM完全没压力,配合DFlash跑speculative decoding,token generation 的throughput相当丝滑,不过唯一worry 的就是power consumption,跑multi-turn 的agentic workflow 时,整个board power几乎顶着350瓦的TDP跑满,wattage 和thermals 飙得有点高,长期run daemon 感觉电费和散热挺感人的。 Muse Voice Transcribe 普通话与英语语码转换演示回放位置 0:00,总时长 0:47 昨天我在 local desktop 上用 Ollama 跑了下 Meta 的 Muse Glimmer 直接 deploy 在我的 NVIDIA RTX 3090 上, 整个 setup 非常 smooth, 把 quantize 之后的 4bit GGUF load 进 24GB 的 GDDR6X VRAM 完全没压力, 配合 DFlash 跑 speculative decoding, token generation 的 throughput 相当丝滑, 不过唯一 worry 的就是 power consumption, 跑 multi-turn 的 agentic workflow 时, 整个 board power 几乎顶着 350 瓦的 TDP 跑满, wattage 和 thermals 飙得有点高, 长期 run daemon 感觉电费和散热挺感人的。 ### 长上下文 我们的模型原生支持超过一小时、多达 20 多位说话人的长音频输入,无需后处理。 Muse Voice Transcribe 长对话回放位置 0:00,总时长 1:00:52 录音中的说话者 - 说话者 A - 说话者 B - 说话者 C - 说话者 D - 说话者 E - 说话者 F - 说话者 G - 说话者 H - 说话者 I - 说话者 J - 说话者 K 说话者 A:然后我们之前聊到,他们在 Runyon 底部建了这些非常漂亮的卫生间。说话者 B:我听说了,前几天晚上在新闻上看到的。说话者 C:那他们能有多好?说话者 A:不,他们是,他们是……说话者 C:在峡谷尽头?说话者 A:不,他们,不,他们很好。他们……我早些时候跟她说,他们是在国家公园里。说话者 D:是的,就像这里是国家公园、国家纪念碑一样,好到有卫生间。说话者 B:等等,我听新闻说他们在上面花了一大笔钱。随便吧。说话者 D:哦,真的吗?说话者 C:所以这不是一个……说话者 A:有争议吗?说话者 B:不,它真的很好。说话者 A:人们是不是对此不满……说话者 B:我不知道,我听说有些人很不满,因为他们不想……我不知道……说话者 E:洋葱峡谷是如此独特的地方,因为在洛杉矶没有那么多可以遛狗的地方,我的意思是,我每天带我的狗去那里。说话者 F:那它像公园一样吗?我不是洛杉矶本地人,所以不知道它长什么样。说话者 E:峡谷,你在里面徒步,它可以是……说话者 C:像一条小径?说话者 G:它可以是徒步,它可以是一条小径,可以上下,或者它们有像小的……说话者 C:支路?说话者 G:支路,就像……说话者 F:所以类似于马里布那边,但更偏向住宅区?说话者 A:那是好莱坞。说话者 G:好莱坞。说话者 E:不,是好莱坞。说话者 G:就像,就像,就像你能看到,你可以从远处看到好莱坞标志,然后你也能看到格里菲斯公园天文台。说话者 F:哦等等,那它连接到好莱坞标志吗?说话者 B:不。说话者 G:不。说话者 F:好吧。说话者 G:就像你可以从远处看到它。说话者 H:但这就像滑雪。有不同的难度路线。有一个……说话者 F:好的。说话者 C:哦,这个比喻好。说话者 E:这个比喻好。说话者 H:有一条铺好的路。我见过……说话者 G:一个蓝钻石……说话者 H:穿着高跟鞋(走)。说话者 A:今天就有一个人只穿着袜子在铺好的路上,所以同样的氛围。说话者 C:绝对。说话者 G:我见过,我见过人们,我见过,我见过人们用轮滑之类的东西,是的。说话者 C:我想这就是为什么我可能……说话者 A:早?说话者 C:是的,因为 Runyon 变成了这样一个场景,而 Fryman,你 literally 走下去,那是……说话者 I:我通常……说话者 D:我讨厌 Runyon,我是个喷子。说话者 C:什么?说话者 I:我走 Nichols Canyon。说话者 C:哦等等,为什么?说话者 D:它就是很恶心,就像你在太阳下炙烤,全是灰尘。说话者 G:是的,你能晒成很好看的小麦色,是的,晒得很好看。说话者 A:你们……说话者 H:但这就是我之前说的,这可能是最“洛杉矶”的事情了。说话者 D:是的。说话者 H:在 Runyon 底部有一个代客泊车,你可以,是的。说话者 C:你认真的吗?说话者 J:在你去徒步之前。说话者 H:你可以代客泊车。说话者 C:那也是新的吗?说话者 H:然后去徒步。说话者 J:哦什么?说话者 G:我不知道,我有我自己的小停车位,我都不知道,我之前都不懂,老实说。说话者 C:那是最“洛杉矶”的事了。说话者 E:不,那是新的,还没持续多久。说话者 G:他们需要在底部加一个小抹茶摊,让它更“洛杉矶”。说话者 A:顶部也是。说话者 B:在顶部?说话者 A:是的。说话者 I:真的?说话者 A:真的?是的,我觉得这家伙在尝试,是咖啡,但我说的是拿铁,你知道的。说话者 G:他很聪明,他很聪明。说话者 I:突然之间,她喜欢她喜欢 Runyon Canyon 了。说话者 G:她就像,太可爱了。太小众了。我喜欢这个。说话者 D:你在那里找到我。说话者 B:你不喜欢 Fryman,我以为你说过。说话者 D:我确实喜欢 Fryman。说话者 C:是的。说话者 D:因为那里有遮蔽,比如树木。说话者 C:是的。说话者 D:你不是仅仅,你知道,有……说话者 B:我糊涂了。我明白了。说话者 C:Fryman 在 Laurel Canyon 那边。你向右转。所以没有抹茶拿铁粉丝,你知道的,但结束后有个卖水果的家伙。说话者 D:是的。说话者 F:那挺好。说话者 B:总是有一个。说话者 H:它靠近胡迪尼的房子吗?往上?说话者 C:不不不,没那么远,更靠近 Studio City。说话者 H:好的。说话者 G:好的。说话者 B:就像,是的。说话者 C:而且这是一次很好的徒步,他们也有所有支路,但我不做……说话者 D:我在小径上看到一条巨大的[****]蛇。说话者 C:那些是土狼吗?说话者 B:土狼。说话者 E:特别是现在小径上很热,哦天哪,那会让我紧张。说话者 I:土狼变得很糟糕,它们就在我的社区里,就像,我住得离山不远。说话者 C:是的。说话者 H:它们占据了一栋建筑。说话者 C:在西好莱坞。我听说了,我在……说话者 I:它们占据了一栋,我社区里有栋废弃的房子。说话者 C:就像一个家庭,然后他们就……说话者 B:就是那个。说话者 H:是的,有一栋正在施工的建筑,像一栋公寓楼,所有这些土狼都搬进去了。说话者 C:因为没人在那里。说话者 H:晚上就像有50只在嚎叫。说话者 C:而且你,它们都有一个房间,视频……说话者 A:字面上全在那里。说话者 C:有幼崽,有幼崽和家庭,我想我这辈子从没见过那么多,它们只是……说话者 G:哇。说话者 I:我想是火灾把它们都赶下来了。说话者 C:哦是的,因为它们……说话者 I:住在下面。说话者 C:找水,是的,而且很热。说话者 I:就像,我会遛狗,然后我会看到街区尽头有两只,我开始像,有点像快走或带着我的狗朝相反方向跑,这样它们就不会……说话者 C:嗯,因为以前你会想,哦,土狼,你制造很多噪音,像熊一样,它们就会走开,不。说话者 G:它们变得无情了。说话者 C:感恩节那天有一只在我前院,因为又热又累,它不怕我和我的狗,她认为这是一个你知道的感恩节点心。说话者 H:但我们在西好莱坞有各种各样的疯狂事。前几天有只猪逃跑了。说话者 G:是的,我看到了。说话者 A:收养了那只猪。说话者 G:他们收养了。说话者 A:整个故事。说话者 I:它就像一只小茶杯猪到处跑。说话者 C:是的。说话者 G:人们在追它。说话者 I:有人骑着鸟滑板车在追。说话者 G:很有趣。说话者 C:恐吓它。说话者 I:不不,他是想抓住它,救它。说话者 G:它就像在跑,在车流里跑,它,它做了很多。说话者 H:他们给它取名叫威尔伯。说话者 G:做了很多。说话者 F:它从哪里来的?说话者 H:他们就是不知道。

相似文章

Meta 在其应用中推出 Muse Image(3 分钟阅读)

TLDR AI

Meta 已推出 Muse Image,这是来自 Meta Superintelligence Labs 的首个图像生成模型,现已在其应用的 Meta AI 中可用。该模型支持高级推理、多参考组合,并在 Arena 上排名第二,同时计划推出 Muse Video 和 Content Seal 水印。