@iScienceLuvr: Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过…"

X AI KOLs Following 论文

摘要

本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。

Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过将音乐视为一个由动作条件化的系统:音频作为状态,钢琴卷帘作为乐器动作。" "实验表明,学习到的模型捕捉了音乐动作与其产生声音之间的关系。得到的表示支持下游任务,包括节拍跟踪、作曲家识别和调性估计,并通过规划实现钢琴转录——即搜索最能解释目标声音的动作。"
查看原文
查看缓存全文

缓存时间: 2026/07/28 16:36

Music-JEPA:通过动作学习声音的世界模型

“我们提出通过将音乐构建为动作条件系统,使用JEPA学习钢琴声音的世界模型:将音频视为状态,钢琴卷帘视为乐器动作。”

“实验表明,学习到的模型捕捉了音乐动作与其产生声音之间的关系。得到的表示支持下游任务,包括节拍跟踪、作曲家识别和调性估计,并通过搜索最能解释目标声音的动作,实现了基于规划的钢琴转录。”

相似文章

DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]

Reddit r/MachineLearning

DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。

AV-JEPA: 将LeJEPA扩展到音视频自监督学习

arXiv cs.AI

AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。