Myovox:从面部肌肉中解读语音
摘要
Myovox 从记录自面部肌肉的 31 通道表面肌电图中解码开放词汇英文文本,通过解码纠正、双向 Conformer 训练与跨模态蒸馏以及语言模型重排序,在 emg2speech 通用语料库上实现了 18.53% 的词错误率。
arXiv:2609.17548v1 Announce Type: new
摘要:Myovox,源自 myo(肌肉)和 vox(声音),从语音发声期间记录自面部肌肉的 31 通道表面肌电图(sEMG)中解码开放词汇英文文本。它将单被试 emg2speech 通用语料库从已发表的 51.17% 词错误率降低到 18.53%,通过三个可分离的步骤,每个步骤均单独测量。首先,我恢复了公开发布中缺失的开放词汇解码设置,并达到了忠实的 40.63% WER / 39.02% PER 基线,其音素错误率与已发表的误差在 0.8 点以内,因此声学模型被忠实重现。其次,我用双向 Conformer 替换了因果编码器,该编码器通过与并行音频的 WavLM-Large 第 9 层特征进行四项跨模态蒸馏训练,仅从肌电图达到了 26.14% WER / 22.34% PER。第三,我集成了两个声学模型,合并它们的多尺度 n-best 列表,并使用 QLoRA 微调的 7B 语言模型进行重排序,达到了 18.53% WER,这是该语料库上报告的最佳结果,尽管不是其他语料库上 sEMG 到文本的最佳报告(第 2 节)。然后我报告了限制整个方法的负面结果:重排序在 18.5% 时耗尽,因为绑定约束是肌电图声学音素错误率(约 20.9%),而不是语言模型。正确的词完全缺失于声学后验中,因此没有重排序器能达到 9.30% 的 n-best oracle。所有测试数据均基于作者官方 8,500 / 760 / 400 顺序划分下的 400 句保留测试集;每个超参数在验证集上调整一次,并在测试集上应用一次。
查看缓存全文
缓存时间: 2026/09/17 08:49
# Myovox:从面部肌肉解读语音 来源:https://arxiv.org/html/2609.17548 ###### 摘要 Myovox(由 *myo*(肌肉)和 *vox*(声音)组成)可从发声言语期间面部肌肉采集的31通道表面肌电信号(sEMG)中解码开放词库英语文本。该系统在单被试 *emg2speech* 通用语料库上,通过三个独立评估的步骤,将词错误率从已发表的51.17%降至18.53%。首先,我恢复了公开版本中缺失的开放词库解码设置,建立了40.63%词错误率(WER)/39.02%音素错误率(PER)的基线,其音素错误率与已发表结果的差异在0.8个百分点以内,从而忠实复现了声学模型。其次,我用双向Conformer模型替代因果编码器,通过四项跨模态蒸馏损失(基于并行音频的WavLM-Large第9层特征)进行训练,仅凭肌电信号实现了26.14%WER/22.34%PER。第三,我集成了两个声学模型,合并其多尺度n-best列表,并使用QLoRA微调的7B语言模型进行重排序,最终达到18.53%WER——这是该语料库报告的最佳结果(尽管并非sEMG转文本在其他语料库上的最佳表现,见第2节)。随后,我报告了限制该方法上限的负面结果:重排序在18.5%处已饱和,因为关键约束在于肌电*声学*音素错误率(约20.9%),而非语言模型。正确词项在声学后验概率中完全缺失,因此任何重排序器都无法达到9.30%的n-best预言值。所有测试数据基于作者官方的8,500/760/400顺序划分,测试集为400句留出数据;所有超参数在验证集上调整一次,测试集上应用一次。 ## 1 引言 当你说话时,要说某个词的决定早在声音从口中发出之前,就已到达面部、下颌和喉咙的肌肉。这些肌肉放电,放电表现为皮肤上微弱的电压变化。Myovox读取的正是这种电信号。一个由31个传感器组成的网格以每秒数千次的频率记录电压,一系列模型将记录转化为一行行英语文本。其命名直译:*myo*代表肌肉,*vox*代表肌肉所指向的声音。肌电语音解码的长期目标是帮助因ALS或喉切除术等疾病无法发声的人。但本报告并未证明这一点。Myovox完全由健康且正常发声的说话者训练,因此无法声称其适用于失去声音的人群。我能说明的是,它展示了另一种用例:允许健康人在不产生可听语音的情况下进行交流,即从面部肌肉活动而非声音中解码说话意图。我将其视为迈向真正静默语音系统的垫脚石,而非最终目标。 本报告围绕单一学科展开:从一个已发表的强结果出发,在应用下一步之前单独衡量每项改动的效果。这使得最终数字可分解为解码修正、模型增益和提取增益,而非单一的总体差异。起点是Gowda等人发表的 *emg2speech* 研究,其附录D.4(“emg2text”)在通用语料库上报告了51.17%WER和38.19%PER。后续三个部分追踪三个步骤:解码修正,在匹配原始音素错误率的前提下恢复了大部分已发表差距(第4节);全语境声学模型训练,模仿并行音频(第5节);解码时的集成、n-best合并与语言模型重排序技术栈(第6节)。表1集中呈现了整个报告。第7节提出本报告的核心发现:系统为何在18.5%处停止改进,以及下一步增益从何而来。术语表收集于术语部分(第10节),正文中所有术语首次出现均链接至其词条;项目实际引发的质疑在第11节予以回应。两个数字贯穿全文:*词错误率*(WER)是读者关心的指标:替换、插入和删除操作后错误单词的比例;*音素错误率*(PER)是声学模型的客观度量:错误音素的比例,通过无词典、无语言模型的贪心解码测量。PER无法通过更好的解码器或语言模型改进。事实证明,PER限制了整个系统。 表1:整个报告汇总表。所有测试数据基于作者的8,500/760/400顺序划分留出的400句测试集。PER是解码器无关的贪心CTC音素错误率。粗体标记每阶段核心词错误率。†管道底层声学集成的音素错误率。重排序作用于单词,无法改变PER,这正是第7节要说明的要点。 ## 2 相关工作 两条非侵入性路线可从人的说话意图通向文本,其差异在于接入运动链条的位置:*表面肌电*读取构音时的面部和颈部肌肉(发声前的最后一环),*脑电/磁电图*读取皮层(更早的环节)。Myovox属于前者。表2将其置于两类方法中进行比较。侵入性皮内解码器在此被排除:它们代表性能天花板,但并非Myovox竞争的对象。 ### 表面肌电转文本:Gaddy路线 开放词库sEMG语音解码的参考语料库由Gaddy和Klein发布:8通道面部肌电,采样率1kHz,约19小时数据,来自单一英语说话者,包含静音和发声两种模式,发声部分伴有音频。其首个系统从静音肌电合成语音,并通过转录该语音评分;后续的Transformer前端和辅助音素损失显著降低了开放词库错误率。Gaddy的博士论文从合成转向直接肌电转文本,将静音肌电WER设为28.8%、发声肌电23.3%的先前最佳水平。MONA LISA随后结合跨模态对齐(将肌电与音频潜在变量绑定的对比目标,加上仅音频LibriSpeech的训练)与LLM重排序器,在静音肌电上达到12.2%WER,发声肌电3.7%。该系统的两个部分在此均有直接延续:第5节的跨模态蒸馏和第6节的LIFT式重排序器。近期研究则探讨更困难的问题:从无配对发声录音或完全没有音频的未发声肌电中能实现什么,这正是患者实际面对的场景。 ### Myovox并非最佳sEMG转文本系统,但它是该语料库上的最佳系统 这一区别至关重要,需在表格前列出而非表格之后。MONA LISA在发声肌电上的3.7%比本文报告的18.53%低15个百分点,且早两年获得。两者并非在相同录音上测量,不可直接比较:Gaddy语料库为8通道、约19小时、包含单说话者两种说话模式,而 *emg2speech* 通用语料库为31通道、9,660句、来自不同说话者且仅一种模式;MONA还额外训练了Myovox未使用的纯音频语料库。能明确表述的范围更窄:在 *emg2speech* 通用语料库上,18.53%是我所知的最佳结果(对比已发表的51.17%)。剩余差距究竟源于语料库、协方差前端还是模型,这并非单一语料库所能解决;第11节将直接探讨此问题。 ### 非侵入性脑转文本 并行研究路线解码皮层而非肌肉。Brain2Qwerty从35名志愿者中解码键入句子,基于脑磁图(MEG)达32%CER,基于脑电图(EEG)达67%。其后续版本将数据扩展至约22,000句、9名被试,基于MEG达39%WER。此处有两点值得关注:第一是架构趋同:该系统独立采用了CTC训练的Conformer编码器与顶部微调的LLM,与第5、6节组件一致,却源自不同信号。第二是它独立复现了第7节的发现:仅编码器达55%WER;n-gram语言模型降至43%;微调LLM进一步降至39%。在此,LLM*恶化*了字符级指标(31%CER vs. 编码器的28%),却改善了词级指标,作者因此得出结论:最终性能主要受上游编码器质量主导。传递至第7节的是结论而非机制,且差异值得说明:他们的LLM自回归生成句子,条件依赖于MEG派生的词嵌入及编码器字符,因此能够且确实劣化了字符指标;而第6节的重排序器位于贪心CTC输出下游,根本无法改变PER。他们纯文本的消融实验(仅保留编码器字符供LLM使用)是更接近的类比,比单独编码器高出约6个WER百分点。无论如何,附加在弱编码器上的语言模型只能带来有限的个位数WER增益。这正是相同的瓶颈,只是在不同信号上被发现。 表2:非侵入性语音与语言解码,按语料库分组。数字引自各报告,*组间不可比*:语料库、电极数、说话模式、被试数、度量指标均不同。“Aud.”标记是否使用并行或外部音频作为训练信号(推理时从不使用)。侵入性皮内系统按设计排除。 | 系统 | 模式 | 词库 | 音频 | WER↓ | PER↓ | CER↓ | |------|------|------|------|------|------|------| | *面部sEMG→文本:Gaddy语料库*(8通道,1kHz,~19小时,1说话者) | | | | | | | | Gaddy & Klein 2020 | 静音 | 开放 | ✓ | 68.0 | – | – | | Gaddy & Klein 2021 | 静音 | 开放 | ✓ | 42.2 | – | – | | Gaddy 2022 | 静音 | 开放 | ✓ | 28.8 | – | – | | Gaddy 2022 | 发声 | 开放 | ✓ | 23.3 | – | – | | MONA LISA | 静音 | 开放 | ✓ | 12.2 | – | – | | MONA LISA | 发声 | 开放 | ✓ | 3.7 | – | – | | *面部sEMG→文本:emg2speech通用语料库*(31通道,5kHz,9,660句,1说话者) | | | | | | | | Gowda等 2026,附录D.4 | 发声 | 开放 | ✓ | 51.17 | 38.19 | – | | Myovox,解码修正(§4) | 发声 | 开放 | ✓ | 40.63 | 39.02 | – | | Myovox,Conformer + 蒸馏(§5) | 发声 | 开放 | ✓ | 26.14 | 22.34 | – | | Myovox,Conformer,纯肌电(§5) | 发声 | 开放 | – | 26.10 | 23.71 | – | | Myovox,完整管道(§6) | 发声 | 开放 | ✓ | 18.53 | 20.90† | – | | *非侵入性脑→文本*(键入句子,健康志愿者) | | | | | | | | Brain2Qwerty v1, EEG | 键入 | 开放 | – | – | – | 67 | | Brain2Qwerty v1, MEG | 键入 | 开放 | – | – | – | 32 | | Brain2Qwerty v2, MEG | 键入 | 开放 | – | 39 | – | 31 | ∗这两个系统*合成语音*,通过转录合成音频评分,因此其WER是可懂度度量而非直接文本解码分数。Brain2Qwerty v1仅报告CER;v2两者均报告。v1平均35名被试(最佳19%CER);v2平均9名被试(最佳22%WER)。 †完整管道底层声学集成的PER,并非管道本身的PER:重排序作用于单词,无法改变PER。 ### 本文创新点 在此背景下,本报告贡献三点,均非新架构:提供 *emg2speech* 发布中缺失的开放词库解码设置(否则解码WER约75%,而非此处报告的40.63%),并通过匹配的音素错误率证明声学模型未变(第4节);打印一项对照实验证明自身偏好组件的局限:仅在肌电上训练的编码器在词级性能上匹配音频蒸馏版本,因此并行音频并非掩盖在标题数字下的隐性支撑(第5节);并通过三条独立证据定位解码时机制失效的节点(第7节)。 ## 3 数据 录音来自 *emg2speech* 发布的健康被试 *通用语料库*。其属性总结于表3。三个事实塑造了报告剩余部分。 ### 单一说话人 整个系统基于单一健康说话者的录音训练和评估。因此,我不知道它如何泛化至其他人、解剖结构或说话风格。本报告的结果应解读为针对单一说话者可能性的证明,而非相同性能将转移至他人的证据。 ### 存在并行音频 被试说话时,麦克风同时录音;逐句肌电与音频时长相关性为1.000。该音频是第5节最依赖的训练信号,也是静音语音推理时不存在的支撑,因此我仅将其视为训练阶段教师,并在最后检查系统的依赖程度。 ### 开放词库 解码器基于34,546词的LibriSpeech派生词典工作,约为语料库词库的五倍,因此系统能发出训练中从未见过的词项。2,429个测试词符中有12个超出词典范围,构成0.49%的WER下限,任何建模都无法消除此底限。 表3:*emg2speech* 通用语料库。划分采用作者原始顺序,我完全保留。本报告所有超参数在760句验证集上调整
相似文章
ChildVox:理解与表征儿童声音的语音、音频及大型音频语言模型基准
ChildVox 提出了一个全面的基准,用于分析儿童在不同发育阶段的声学交流,整合了来自17个以儿童为中心的音频和语音数据集的20多个子任务。
从非侵入式脑电记录中准确解码自然语句
本文介绍了Brain2Qwerty v2,这是一个AI模型,能从非侵入式脑磁图记录中准确解码自然语句,词错误率为39%,证明了数据规模化有助于缩小与侵入式方法之间的性能差距。
Vokenization:面向视觉与语言的多模态学习
本文介绍了“Vokenization”,这是一种多模态学习技术,通过利用弱监督将视觉数据与语言标记联系起来,从而架起计算机视觉与自然语言处理之间的桥梁。文章将其与 GPT-3 和 BERT 等纯文本模型进行了对比,强调了视觉定位如何提升语言理解能力。
@FakeMaidenMaker: 炸裂!这个开源项目免费文字转无 AI 味人声,还能克隆任何人的嗓音,并且用文字调整音色! GitHub 狂揽 30K star,出自面壁智能 OpenBMB,VoxCPM 之前拿过 GitHub 和 HuggingFace 双榜第一。 做…
VoxCPM2是OpenBMB开源的语音合成模型,采用无分词器的扩散自回归架构,支持30种语言、语音设计和可控语音克隆,仅需一句话即可克隆音色,或用文字创建全新声音,输出48kHz高质量音频,可商用。
MoVE:通过语音专家混合模型在语音到语音翻译中保留笑声与哭泣
MoVE 提出一种 Mixture-of-LoRA-Experts 架构,在仅 30 分钟精选数据下即可在语音到语音翻译中保留 76% 的非语言发声(笑声、哭泣)。