@iScienceLuvr: Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过…"
摘要
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
查看缓存全文
缓存时间: 2026/07/28 16:36
Music-JEPA:通过动作学习声音的世界模型
“我们提出通过将音乐构建为动作条件系统,使用JEPA学习钢琴声音的世界模型:将音频视为状态,钢琴卷帘视为乐器动作。”
“实验表明,学习到的模型捕捉了音乐动作与其产生声音之间的关系。得到的表示支持下游任务,包括节拍跟踪、作曲家识别和调性估计,并通过搜索最能解释目标声音的动作,实现了基于规划的钢琴转录。”
相似文章
DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]
DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
@AbdelStark: 是时候让世界服下JEPA药丸了!awesome-jepa:一份精心整理的论文、模型、代码、数据集和学习资源列表……
一份精心整理的关于Joint Embedding Predictive Architectures(JEPA)的论文、模型、代码、数据集和学习资源列表,这是Yann LeCun提出的用于世界模型的自监督方法。
@iScienceLuvr:学习稀疏潜在预测基础模型用于多模态神经影像 本文介绍了Neuro-JEPA,一个基…
本文介绍了Neuro-JEPA,一个基础模型,它使用潜在预测目标和混合专家架构来编码跨T1w、T2w和FLAIR序列的脑部MRI扫描,并在包含155万次扫描的大型数据集上进行了预训练。
AV-JEPA: 将LeJEPA扩展到音视频自监督学习
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。