是否有对言语障碍具有极高敏感度的AI?

Reddit r/ArtificialInteligence 新闻

摘要

一位用户寻求关于AI语音识别模型的建议,这些模型能够准确理解严重受损的言语,例如其患有唐氏综合症和自闭症、几乎没有语言能力的兄弟的言语,并指出当前像Whisper这样的系统无法识别。

大家好,我的弟弟患有唐氏综合症和自闭症。他几乎没有语言能力,言语严重受损。我曾想过开发一款类似Duolingo的应用程序,采用游戏化体验:它会显示一个单词,他尝试说出它,应用会倾听、提供反馈,并随着他的进步逐渐增加难度。最大的挑战是他的言语非常难以理解。我的家人能听懂他,因为我们和他一起生活了12年,但几乎其他人都无法理解。像Whisper这样的语音转文字模型和其他AI系统几乎无法识别他说的话,因此这个应用无法按预期工作。您是否知道有足够灵敏的AI模型或语音识别系统能够处理这样的言语?或者还有其他可行的技术方法?谢谢!
查看原文

相似文章

无声语音与超声波

Hacker News Top

一个基于舌头超声波记录训练的模型能够以15.6%的词错误率解码无声语音,尽管数据集较小,但其性能已接近唇读水平。

实时语音AI听得见但听不懂(arXiv:2606.26083)

Reddit r/artificial

本文评估了四个领先的实时语音AI系统(GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus、Omni Flash),发现它们始终根据词语而非语气采取行动,即使能够感知到痛苦、恐惧或讽刺也忽略不计——这被称为语音AI的“情商鸿沟”。

转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。