标签
PD-GS提出了一种用于音频驱动说话头的音素驱动3D高斯泼溅方法,利用语言融合模块改善嘴唇发音并减少闭合违例。
本文研究了音素与字符目标以及选择性状态空间模型(Mamba)对皮层内脑到文本解码的影响,发现基于GRU的循环解码器在Brain-to-Text '25基准测试中仍是表现最强的模型。
本文使用音素错误率和新的Soft PER指标,评估了基于音素的自动语音识别系统(特别是WhisperIPA和ZIPA)中的人口统计和口音偏见,揭示了跨语言和群体的持续差异。