标签
这个 Twitter 话题展示了 Astra AI 模型从频谱图图像识别声音的能力,说明了对其功能的持续发现。
NAPE是一个自监督音频学习框架,使用因果Transformer预测下一频谱图补丁嵌入,在多个音频和语音基准测试中实现最先进的性能,采用极简设计。