帮助音乐共创代理“听”得更好:用于理解与生成的分层自监督世界模型
摘要
这篇预印本介绍了用于音乐共创代理的分层自监督世界模型,具有对CPU友好的快速模型,以及用于MIDI修补和生成的实时演示。
查看缓存全文
缓存时间: 2026/08/07 01:54
论文页面 - 帮助音乐共创代理“听”得好:用于理解与生成的层级自监督世界模型
来源:https://huggingface.co/papers/2608.04378
很高兴分享一篇新的预印本和实时演示(LIVE DEMO)!这是我这2年多的心血——构建快速、轻量、CPU友好的模型,以帮助词曲作者的迭代工作流程,其中的表示(Representations)可用于理解与生成,并以自监督方式训练。首先,演示链接:https://drscotthawley-midi-rae-jepa-son.hf.space/
结果变得非常有趣,以至于我不得不暂停写论文,把它改造成一个方便朋友使用的应用程序!你可以绘制一个修复掩码(inpainting mask)来控制空间 dropout 发生的位置,而那些看似均衡器(EQ)的滑块则用于调节抽象层级。
预印本在此:https://arxiv.org/abs/2608.04378 前6页加参考文献已提交至 NeurIPS Creative AI Track(“单盲,预印本允许” 👍)。预印本额外包含10页补充材料:消融研究、超参数调查等。
你可能几周前见过我的另一篇预印本(https://arxiv.org/abs/2607.14537),那是2026年4月中旬的项目状态,已提交至 ISMIR(双盲,有封口令)。但新预印本是更成熟的版本(尽管它叫“-SON”)。
故事的起点是大约2024年1月的“Pictures of MIDI”中的“图形提示”(https://picturesofmidi.github.io/PicturesOfMIDI/),但那又大又慢。为了简化它,我先后探索了流模型(Flow Models,快速采样)、表示自编码器(Representation AutoEncoders,可复用的表示)和 LeJEPA(以抵抗坍缩)。
你可以翻阅我杂乱的“midi-rae”工作仓库,但最好还是等我未来几周发布一个干净的发行仓库。敬请关注项目网站上的链接:https://drscotthawley.github.io/midi-rae-jepa-son/ 权重目前暂未公开;我大概会在 NeurIPS 临近时公开它们。
相似文章
@iScienceLuvr: Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过…"
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
Live Music Diffusion Models: 交互式扩散音乐生成器的高效微调与后训练
本文介绍了Live Music Diffusion Models(LMDMs),它通过修改扩散过程,实现了高效的块式处理以及新颖的训练范式,从而在消费级硬件上进行实时交互式音乐生成,在推理复杂度上超越了离散自回归模型,并实现了稳定的后训练对齐。
Wan-Dancer: 一种用于分钟级别连贯音乐到舞蹈生成的层次化框架
Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。
从多智能体演示中学习隐式因果世界模型
本文提出了一种从多智能体演示中学习隐式因果世界模型的方法,使智能体能够从观察到的行为中推断因果结构。
新AI音乐模型发布,演示效果惊人逼真
一款新AI音乐模型已发布,其演示音频听起来异常真实。