帮助音乐共创代理“听”得更好:用于理解与生成的分层自监督世界模型

Hugging Face Daily Papers 论文

摘要

这篇预印本介绍了用于音乐共创代理的分层自监督世界模型,具有对CPU友好的快速模型,以及用于MIDI修补和生成的实时演示。

协作音乐代理需要足够丰富的内部表示,以同时支持理解和生成,同时又要足够灵活,以适应人类保留主导权的工作流程。我们提出了一种用于符号音乐的分层自监督“世界模型”:一个255万参数的Swin V2编码器,在MIDI钢琴卷帘图像上使用JEPA风格的目标(音高和时间平移等变性、掩码嵌入预测以及分布正则化器)进行训练,不使用任何标签,也不依赖音乐理论词汇。对冻结嵌入的探测表明,音乐属性变得可解码的层级与其音乐时间尺度相对应:乐句边界从最粗粒度层级读取,音符密度和和声细节从最细粒度层级读取。时间和乐句结构仅通过自监督目标即可涌现,而和声内容则需要额外引导;一个小的和弦监督头将联合和弦恢复率从.18提高到.54,并且从未被监督的调性检测从.16提高到.70。遵循表示自编码器(Representation AutoEncoder)范式,一个条件流匹配模型代替了训练好的解码器,从PCA降维的条件在像素空间中流动:它以像素F1 0.996复现目标窗口,而同样的逐层级条件丢弃机制——它控制变体偏离的程度——也支持通过图形提示进行掩码修补,无需专门的修补采样器。该流水线在CPU上运行,生成一个建议需要2.8秒,在Apple MPS上为0.6秒,我们在实时交互演示中展示了这一点。与基于LLM的“大脑”协同工作时,这些能力构成了协作音乐创作代理的核心,服务于人类主导权,而非取代人类主导权。
查看原文
查看缓存全文

缓存时间: 2026/08/07 01:54

论文页面 - 帮助音乐共创代理“听”得好:用于理解与生成的层级自监督世界模型

来源:https://huggingface.co/papers/2608.04378

很高兴分享一篇新的预印本和实时演示(LIVE DEMO)!这是我这2年多的心血——构建快速、轻量、CPU友好的模型,以帮助词曲作者的迭代工作流程,其中的表示(Representations)可用于理解与生成,并以自监督方式训练。首先,演示链接:https://drscotthawley-midi-rae-jepa-son.hf.space/

结果变得非常有趣,以至于我不得不暂停写论文,把它改造成一个方便朋友使用的应用程序!你可以绘制一个修复掩码(inpainting mask)来控制空间 dropout 发生的位置,而那些看似均衡器(EQ)的滑块则用于调节抽象层级。

预印本在此:https://arxiv.org/abs/2608.04378 前6页加参考文献已提交至 NeurIPS Creative AI Track(“单盲,预印本允许” 👍)。预印本额外包含10页补充材料:消融研究、超参数调查等。

你可能几周前见过我的另一篇预印本(https://arxiv.org/abs/2607.14537),那是2026年4月中旬的项目状态,已提交至 ISMIR(双盲,有封口令)。但新预印本是更成熟的版本(尽管它叫“-SON”)。

故事的起点是大约2024年1月的“Pictures of MIDI”中的“图形提示”(https://picturesofmidi.github.io/PicturesOfMIDI/),但那又大又慢。为了简化它,我先后探索了流模型(Flow Models,快速采样)、表示自编码器(Representation AutoEncoders,可复用的表示)和 LeJEPA(以抵抗坍缩)。

你可以翻阅我杂乱的“midi-rae”工作仓库,但最好还是等我未来几周发布一个干净的发行仓库。敬请关注项目网站上的链接:https://drscotthawley.github.io/midi-rae-jepa-son/ 权重目前暂未公开;我大概会在 NeurIPS 临近时公开它们。

相似文章