标签
一位开发者训练了一个1.25亿参数的transformer模型,使用MIDI数据和DPO后训练,在设备上实时自动完成钢琴演奏,并发布了适用于iOS的RollTab应用。
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
PianoKontext 通过在潜在空间中利用动态时间规整对齐音频和MIDI,以及使用DiT模块的流匹配,从平淡的MIDI乐谱中生成可变长度的富有表现力的钢琴演奏。