标签
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
PianoKontext 通过在潜在空间中利用动态时间规整对齐音频和MIDI,以及使用DiT模块的流匹配,从平淡的MIDI乐谱中生成可变长度的富有表现力的钢琴演奏。
一条推文分享了OpenAI的Codex被用于教钢琴,并附有演示链接。