Canto: 专为现实世界打造的语音模型

Hacker News Top 模型

摘要

Wispr Flow推出Canto,这是一款专为实时听写设计的语音模型,即使在嘈杂和复杂的现实环境中也能表现出色,并在与竞争对手的评估中达到了最低的字错误率。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/17 21:15

# Canto:为真实世界打造的语音模型 | Wispr Flow 来源:https://wisprflow.ai/canto 语音识别模型在转录受控环境下录制的清晰音频方面已变得极为出色。但真实的听写通常并非发生在这些条件下。数百万人使用 Wispr Flow 来发送消息、撰写邮件、编程以及在办公桌前、会议间隙、通勤途中和繁忙的办公室里整理思路。他们通过笔记本电脑麦克风、耳机和耳麦进行语音输入,背景中往往夹杂着其他人的声音、音乐或交通噪音。 今天,Wispr 先进界面实验室(https://wisprflow.ai/lab)推出了 Canto,我们最新的实时听写语音模型。在真实世界听写场景的评估中,Canto 在我们测试的所有模型中实现了最低的词错误率。我们将 Canto 与来自 Google、OpenAI、AssemblyAI 和 Deepgram 的模型进行了对比。 Canto 是 Wispr 先进界面实验室更广泛研发计划中的首个模型。在本文中,我们将分享它的表现、我们如何训练它以应对充满挑战的真实世界条件,以及哪些研究已经在塑造未来的发展。 > *“今天,Wispr 先进界面实验室推出了 Canto,我们最新的实时听写语音模型。”* —— Ariya Rastrow,Wispr Flow 首席安全官 ## 在真实世界条件下评估 Canto 为了在真实世界条件下测试 Canto,我们创建了一个包含 10 小时英语 Wispr Flow 听写内容的评估集,语音样本来自 2,300 多位不同的说话者,并随机采样自不同的应用程序和使用场景。我们小心地确保训练集和测试集中说话者的严格分离,以避免在说话者特征上过拟合。每个样本都来自选择加入 Wispr 数据共享设置的用户,该设置允许匿名使用其数据来评估和改进我们的模型。有关此设置的更多信息,请参阅我们的数据控制文档(https://wisprflow.ai/data-controls)。 Canto 在我们的对比模型中取得了最低的词错误率(WER)。WER 衡量的是相对于人工转录参考文本的单词替换、省略和插入(越低越好)。 基于随机采样自不同应用程序和使用场景的 10 小时 Wispr Flow 听写音频的词错误率。 ## 在最具挑战性的条件下的表现 该模型在随机采样数据上表现良好,但我们同样感兴趣的是研究其在最极端情况下的表现。我们构建了一个单独的、包含 3 小时音频的挑战评估集,其中包含了最容易导致听写失败的那些条件。 该数据集包括受邻近语音、音乐、交通、风声、低录制音量以及耳语或远场语音影响的音频。还包括非常简短的听写内容,这使得模型几乎没有周围的上下文和语言信息来帮助消除歧义。在完整的挑战集上,Canto 排名第二,仅次于 Gemini 3.1 Pro——这是一个规模大得多的前沿级多模态模型,并不适合实时低延迟应用。在我们评估的实时转录模型中,Canto 实现了最低的 WER。 基于一个包含 3 小时音频的挑战数据集的词错误率,该数据集旨在压力测试转录模型在最困难的真实世界条件下的表现。 我们进一步分析了这个数据集,以理解不同模型的行为差异。Gemini 3.1 Pro 在嘈杂音频上取得了最低的 WER。Canto 在低音量语音和简短听写内容上并列最低 WER。在所有对比中,简短听写内容产生的错误率最高。当一段话语只包含几个单词时,单个错误对 WER 的影响更大,并且模型可用于消除歧义的语言上下文也更少。 基于音频挑战数据集三个子集的词错误率。嘈杂音频定义为存在显著背景噪音(即交通、风声、竞争性背景语音)的低信噪比听写内容。低音量样本由耳语或远场语音组成。简短听写内容是指只有 1-2 个单词、几乎没有周围上下文的样本。 ## 在公开基准上的性能比较 我们还在三个公开的英语数据集上评估了 Canto:LibriSpeech、FLEURS 和 Common Voice。Canto 在 LibriSpeech 上并列取得了最低的 WER。它在 FLEURS 和 Common Voice 上保持了竞争力,尽管未能在这两项评估中领先。 我们在评估中使用的英语子集上的词错误率:FLEURS、LibriSpeech 和 Common Voice。模型在没有上下文提示的情况下进行评估。 这些公开数据集提供了有用且可重现的对比,但它们主要包含朗读语音。LibriSpeech 来自有声读物,而 FLEURS 和 Common Voice 主要由人们朗读准备好的句子组成。它们捕捉到的分布与日常的“野外”听写不同,在后者中,人们自发说话、停顿、修改想法,并且通常提供很少的语言上下文。这种对比有助于解释为什么我们在公开数据集和真实的 Wispr 使用场景上都对 Canto 进行评估。 ## 通过监督微调和强化学习对 Canto 进行后训练 Canto 起始于一个在数百万小时语音和文本上预训练的模型。然后,我们分两个阶段训练 Canto。首先,我们向其展示音频及其对应的参考转录。模型学习预测每个转录中的单词,一次一步。这个阶段被称为监督微调(SFT),教会它如何执行转录任务。接下来,我们训练它比较完整转录的质量。对于相同的音频,模型生成多个可能的转录。我们根据参考文本为每一个打分,然后利用这些分数使得在未来训练中更有可能生成更好的转录。这被称为强化学习(RL)。 区别在于模型如何接收反馈。监督微调在每一步提供期望的单词。强化学习则评估由模型生成的完整转录。这使我们能够围绕我们关心的结果进行训练,例如在困难的录音条件下减少识别错误。我们的方法使用群组相对策略优化(GRPO)。核心思想很简单:比较每个群组内的候选转录,并从它们的相对分数中学习。对于每个音频示例,我们从被训练的模型中采样多个候选转录。我们将这些候选称为“展开”。每个候选都获得一个奖励:一个数值分数,衡量其满足训练目标的程度。 GRPO 将每个候选的奖励与同一音频其他候选的奖励进行比较。所得的相对分数称为优势值,它表明该候选的表现是优于还是劣于其所在群组。这些优势值指导训练更新。 序列级训练在语音识别领域有着悠久的历史。研究人员此前使用最小词错误率训练和策略梯度方法优化 ASR 系统。GRPO 最近在 DeepSeekMath 中被提出,直接应用于自回归语音识别的工作直到最近才在关于 ASR 的 GRPO 和语音领域适应的研究中出现。 > *“我们构建了能够大规模生成和评分语音展开的基础设施,使我们能够围绕特定的行为和失败模式构建训练环境。”* 对于 Wispr 而言,强化学习的价值不仅在于降低了整体错误率。我们构建了能够大规模生成和评分语音展开的基础设施,使我们能够围绕特定的行为和失败模式构建训练环境。该系统现在支持在上下文语音识别、个性化、说话人分离以及困难音频条件方面的实验。下文描述的研究超出了已发布的 Canto 模型所使用的训练范围,并已经在指导我们下一代模型的研发。 ## 从纠正中学习 名字和词汇的使用变化速度比语音模型重新训练的速度要快。像“Claude”这样的词可能曾经是“cloud”一个不常见的替代写法。随着其使用方式的变化,一个实用的听写模型需要一种方法来学习区分。 对于选择加入数据共享的用户,纠正可以为改进识别提供宝贵的信号。但并非每一次编辑都指向转录错误。人们也会更改格式、重写句子或仅仅改变主意。 下面的假设示例说明了这个问题。模型将“Claude”转录为“cloud”,用户进行了纠正。他们同时也改变了主意,重写了句子的结尾。只有第一次更改代表识别错误。 一个假设性示例。从“cloud”到“Claude”的局部纠正被保留,而无关的重写被丢弃。我们可以有选择地将 ASR 错误“嫁接”到强化学习的训练目标中。 我们使用音频和编辑本身的信号来识别最可能代表识别错误的纠正。这些信号包括强制对齐置信度(衡量候选词与音频的匹配程度)以及编辑的位置和形状。然后,我们只将可能的纠正部分嫁接到原始转录中,其余部分保持不变。 由此产生的转录成为用于评分 GRPO 展开的参考文本。当假设做出预期的纠正时,它会获得更高的奖励。由于 GRPO 将优势值计算集中在每个群组内部,高奖励假设和低奖励假设共享的单词会收到相互抵消的信号。这并未提供完美的标记级信用分配,但它使得最强的对比更加局部化,针对我们关心的决策。“嫁接”将嘈杂的文档级编辑转化为更聚焦的序列级训练信号,同时保留了 GRPO 的策略内性质。 一个示意性的包含六个模型生成转录的群组。每个展开获得 1-WER 的奖励(基于嫁接的参考文本)。奖励随后在群组内标准化以计算优势值。 ## 学习有选择地使用上下文 在运行时,Canto 会获得来自用户个人词典的专用词汇表。这有助于模型恢复那些仅从音频中难以识别的人名和罕见词汇。提供短语来指导识别是一个长期存在的上下文 ASR 研究领域。困难的部分在于决定模型应该在多大程度上信任该上下文。 假设“Barry”出现在某人的词典中,并且他们听写道:“I want to make a berry salad.” 在录音条件不佳时,这两个词在声学上可能都合理。一个过于急切的模型可能会选择“Barry”,因为它出现在词典中,尽管用户说的是“berry”。 为了衡量这种行为,我们从一个 SFT 检查点开始,并在训练中使用强化学习,同时在 10% 的训练样本上提供真实的上下文。然后我们用合成干扰项测试模型,这些干扰项与正确单词的语音相似度各不相同。当添加其中一个错误建议导致模型采用它时,就发生了“干扰项翻转”。 强化学习训练前后的上下文采用情况。在训练期间向模型提供真实上下文,相比 SFT 检查点(左图),能带来更好的真实上下文采用率。同时训练会导致模型倾向于使用过于急切的上下文。在转录过程中,语音相似的干扰项更可能被选中。 经过强化学习训练后,模型对上下文的响应性增强了,包括当上下文错误时也是如此。在语音最相似的术语中,它采用干扰项的频率几乎是初始 SFT 模型的五倍。训练使上下文变得更有用,但模型有时过于轻易地相信它。 为了将上下文采用与上下文区分分离开来,我们从同一个 SFT 检查点进行了三组训练。在“始终真实”(always true)组中,提供的上下文仅包含正确的术语。在“干扰项+真实”(distractors + true)组中,正确的术语与语音相似的备选项一起出现。在“仅干扰项”(distractors only)组中,选定的样本包含合理的近似错误项而非正确术语,同时奖励机制继续倾向于由音频支持的转录。 在每个检查点,我们运行两个探针测试。纵轴衡量正确上下文的采用率,而横轴衡量错误上下文改变转录的频率。理想的轨迹是向上移动而不向右移动。 强化学习训练过程中的上下文采用率和错误上下文跟随率。每组训练都从同一个 SFT 检查点开始。在带有上下文的训练中,模型将学会既采用正确上下文,同时也容易受到语音相似干扰项的影响。在训练期间提供语音相似干扰项(红色)有助于减少干扰项的采用。 轨迹表明,每种混合方式都教会了模型与上下文之间不同的关系。在“始终真实”组中,模型可以学习一个简单的捷径:当提供的术语与音频相似时,就使用它。这提高了正确术语的采用率,但也增加了错误上下文的跟随。在“干扰项+真实”组中,上下文变成了一个选择问题。正确答案存在,但它必须从合理的备选项中区分出来。模型因选择最被音频支持的候选词而获得奖励,而不仅仅是因为从列表中复制。在“仅干扰项”组中,上下文变成了对抗性的。盲目采用任何提供的术语现在会损失奖励,因此成功需要解决冲突并倾向于音频。这进一步将错误上下文的跟随率向左推移,同时保持了相似水平的正确上下文采用率。 这些实验尚未定义最终的上下文策略,但它们表明这种权衡本身是可训练的。目标不仅仅是让模型遵循上下文,还要教会模型何时应该遵循上下文。 ## 接下来是什么 Canto 是一个更大模型家族中的首个模型。我们已经在训练其后续版本,规模是 Canto 的十倍以上,目标是改善困难音频条件下的识别、改进多人语音识别(为我们最近推出的笔记产品服务)、更好地利用上下文词汇,并在更多语言上达到相同标准。本文描述的后训练方法也将使我们能够在模型规模增长时引入更专门的奖励和更难的训练环境。 一个重点是用于转录和说话人分离的统一架构。会议转录系统通常在不同的阶段识别单词和识别说话者,导致一个阶段的错误会加剧另一个阶段的错误。联合模型可以同时推理说了什么、谁说的以及说话者何时发生变化。说话者结构还可以在嘈杂环境中提供有用的证据,帮助区分正在转录的对话与背景中无关的语音。 随着时间的推移,我们的语音模型将需要做更多工作,而不仅仅是识别单词。它们将需要有选择地使用上下文,理解用户说话的应用场景,并将所说的话与用户试图实现的目标联系起来。Canto 为我们提供了语音模型、训练方法和评估框架,以追求更广泛的接口目标。 这些仍然是开放的研究问题。如果您从事语音识别、强化学习、说话人分离、多语言建模或多模态接口的工作,Wispr 先进界面实验室正在招聘(https://wisprflow.ai/careers)。

相似文章

OpenWhispr/openwhispr

GitHub Trending (daily)

OpenWhispr 是一款开源、隐私优先的桌面应用,支持语音转文字听写、会议转录和 AI 辅助笔记,同时支持离线本地转录与云端处理。