无声语音与超声波
摘要
一个基于舌头超声波记录训练的模型能够以15.6%的词错误率解码无声语音,尽管数据集较小,但其性能已接近唇读水平。
暂无内容
查看缓存全文
缓存时间: 2026/07/11 07:23
# 无声语音与超声波技术——来自Aleph
来源:https://alephneuro.com/blog/silent-speech
我们训练了一个模型,能够根据说话者保持无声时舌头超声记录来预测语音。在开放词汇语音上,该系统实现了15.6%的词错误率。
作为对比,唇读技术在百万小时数据集上的词错误率为12.5%。我们感到兴奋的是,尽管这只是一项初期探索,仅用50小时数据集、耗时一个月训练,我们的系统已接近现有方法的性能。
我们将超声探头置于下巴后方,捕捉到如下舌头视频:
图示:下巴下方放置超声探头,旁边显示器展示舌头影像
然后将其转化为文字。以下是快速演示:
您的浏览器不支持视频标签。
几天前,我们发现该模型还能泛化到新人身上(只要他们带有美式口音 🇺🇸🦅1 (https://alephneuro.com/blog/silent-speech#fn-1)1我们东欧的朋友对此不太兴奋)。我们的朋友可以走进来,拿起探头,立即开始使用该系统。我们没想到这样少的数据就能奏效。
您的浏览器不支持视频标签。
## 无声说话
说话速度大约是打字的四倍,使其成为与计算机通信的最快方式之一。随着AI对自然语言的理解日益增强,我们开始像科幻小说中设想的那样与计算机交互:只需与之对话。我们已经看到这一趋势的萌芽,例如Wispr Flow和ChatGPT语音。
但常规语音有一个主要限制:大多数时候,我们周围有其他人。无论是与同事或陌生人坐在一起,还是在咖啡馆或地铁里,我们都不希望别人听到我们与计算机的对话。
就像耳机让聆听变得私密一样,无声说话可以让说话变得私密。
检测无声说话有多种方式:EMG、雷达、唇读等2 (https://alephneuro.com/blog/silent-speech#fn-2)2Andy Matuschak有一篇很好的简短综述,可参见这里 (https://notes.andymatuschak.org/zFNrLkCqVyTK22wRfDKDsqy)及其Patreon (https://www.patreon.com/quantumcountry/posts/prospects-for-69855805)。超声波的特殊之处在于,你可以直接、清晰地看到舌头图像——无需像EMG或雷达那样从嘈杂的间接测量中推断。并且它实现了*隐形*无声说话,原则上你甚至无法察觉有人在无声地说话。
此外,舌头承载了大量关于语音的信息。在英语的40个音素中,舌头构成约34个不同音素类别3 (https://alephneuro.com/blog/silent-speech#fn-3)3有些音素对如/t/和/d/或/s/和/z/主要区别在于发声而非舌头位置,但它们仍会在舌根 (https://pmc.ncbi.nlm.nih.gov/articles/PMC2856513/)产生细微差异,超声波可以检测到。,而相比之下,视觉上可区分的唇形只有约10–14种。
下颌下超声波脉冲从口腔底部向上传播进入舌头。可拖动旋转。
## 数据与基础设施
我们自行收集了无声说话时的舌头超声影像数据集。
要训练一个好的模型,数据必须满足两个条件:(1) 超声记录应实际显示舌头;(2) 说话者应实际说出指定文本。这两者都颇具挑战性,因为人们会疲劳、喃喃自语、以及未能正确握住探头。
在设置数据收集时,首要问题是:人们应该无声说话还是出声说话?
我们最终关心的是解码无声说话,但可听见的语音使我们能够轻松验证人们是否正确说出了单词。通过观察舌头记录,我们发现无声和有声说话显示出相似的舌头运动。这使我们相信,我们可以收集有声超声语音数据,用音频进行质量控制,并训练出一个能够泛化到无声语音的模型。
为了对有声数据进行质量控制,我们让人们出声说话,转录音频,并检查其是否与应读的句子匹配。我们还使用实时超声波质量分类器检测探头位置不佳或耦合不良,并安排一位监督员通过实时仪表板监控会话。
我们收集了50小时的数据——人们大声朗读合成生成的短篇故事。
数据收集设置:一个人坐在桌前,阅读笔记本电脑上的提示,同时将超声探头放在下巴下方,桌上放有超声凝胶
我们使用故事而非孤立短语,因为故事更容易朗读,且能产生更自然的语音。人们能够保持阅读的流畅性,同时我们仍能控制数据中的内容:广泛的词汇、不同的句子结构,以及冠词和缩略语等难点。
## 训练
任务描述简单但解决困难:给定舌头超声视频,预测所说的文本。
我们没有从头训练所有内容,而是从已经具备某些知识的模型入手:ResNet-18 2+1D用于视频,Whisper Base用于将类语音嵌入解码为文本。
Whisper是一个强大的语音转文本模型。我们发现其解码器很有用,因为它是一个预训练模型,能够将语音嵌入转换为文本。我们只需将视频嵌入转换到Whisper的嵌入空间。为此,我们训练舌部视频编码器的嵌入,使其尽可能接近Whisper编码器对相应口语音频输出的嵌入。
由于我们的数据集仍然有限,我们使用了最小的Whisper解码器。早期训练不稳定:模型要么崩溃,要么过于依赖语言先验。但在大约20,000个样本之后,我们开始看到我们希望出现的错误:"a key stick"代替"acoustic","heart"代替"hard"等等。
这些错误比我们之前看到的许多正确答案更令人鼓舞。它们表明模型开始从信号本身进行泛化,学习音素结构,而不仅仅是预测可能的词序列。
两阶段训练:第一阶段匹配超声视频和音频嵌入;第二阶段使用小型Whisper解码器将视频嵌入解码为文本
通过收集更多数据、运行更多消融实验、训练更好的模型以及改进后处理(例如生成多个候选输出、使用束搜索、加入句子长度感知、或使用LLM作为评判者),我们在内部开放词汇跨说话者验证集上达到了15.6%的词错误率(WER)4 (https://alephneuro.com/blog/silent-speech#fn-4)4无声语音的数字比较混乱,因为不同论文的任务差异很大。许多低WER系统使用固定指令集、可见唇部视频或植入传感器。我们找到的最接近的仅超声跨说话者基线报告的WER为83.8%(在TaL上)。我们的系统仅凭约50小时的舌头超声数据就达到了15.6%的WER。
词错误率从15k训练样本时的102%下降至50k时的15.6%
词错误率随着数据集增长持续下降——从15k样本时的102%到50k时的15.6%——且尚未出现平缓趋势。
## 未来
这仍然是一个早期原型,尚未成为消费产品。两个最大的硬件挑战是:减小超声探头的尺寸和重量,以及用更实用的耦合材料(如水凝胶)替代超声凝胶。我们认为两者均可解决,最终使探头成为轻量级可穿戴设备或贴片。
凭借约50小时的数据和一个月内构建的系统,我们已经看到了能够跨人泛化的开放词汇转录。当前版本在非美式口音上仍有困难。然而,更多数据、更好的模型以及更小的超声硬件应能将这一研究演示推向人们日常生活中实际可用的产品。
## 致谢
感谢Evan和Angelina监督数据收集并保持高质量,也感谢所有前来将故事读入下巴下方探头的人。
我们还感谢Charlie Wang防止数据收集崩溃、Cynthia Kwan搭建数据收集设置、Thomas Ribeiro帮助制作动画、Alex Pokras通宵拍摄视频、Claire Wang帮助建立数据整理流程、Mustafa Toumi制作了许多探头、Artem Brustovetskii帮助搭建基础设施、Galen Mead就产品、演示和模型架构提供了很好的想法,以及Donald Jewkes指导视频拍摄和发布准备工作。
相似文章
是否有对言语障碍具有极高敏感度的AI?
一位用户寻求关于AI语音识别模型的建议,这些模型能够准确理解严重受损的言语,例如其患有唐氏综合症和自闭症、几乎没有语言能力的兄弟的言语,并指出当前像Whisper这样的系统无法识别。
从神经活动进行端到端的大脑皮层内语音解码
本文提出了一种端到端的基于Conformer的神经解码器,用于从一位肌萎缩侧索硬化症(ALS)参与者的皮层内记录进行语音解码,在没有任何外部语言模型的情况下,字符错误率达到23.80%。该研究表明,在完全端到端的框架中实现有意义的字符级解码是可行的。
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。
嘈杂环境中的语音代理
一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。
@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。