MuSViT:面向乐谱表示的基础视觉模型
摘要
MuSViT是首个面向乐谱的基础视觉模型,通过掩码自编码器在数百万页乐谱上预训练,在乐谱识别和符号检测任务中取得卓越性能。
查看缓存全文
缓存时间: 2026/07/01 11:42
论文页 - MuSViT:一种用于乐谱表示的基础视觉模型
来源:https://huggingface.co/papers/2606.31811
摘要
MuSViT 是一种基于视觉变换器的基础模型,在数百万张乐谱页面上进行了预训练。通过线性探测和微调两种方法,该模型在乐谱识别和符号检测任务中展现出卓越性能。
基础模型(https://huggingface.co/papers?q=Foundation%20model)通过提供丰富、可复用的表示,并能在不同任务间迁移,已经改变了视觉和语言处理领域。乐谱(https://huggingface.co/papers?q=Sheet%20music)作为音乐语言的视觉编码形式,却缺乏这样一个强大的领域专用骨干网络。我们提出了 MuSViT(Music Score Vision Transformer,https://huggingface.co/papers?q=Vision%20Transformer):首个用于乐谱(https://huggingface.co/papers?q=sheet%20music)表示的基础视觉模型——它是一个 ViT 编码器(https://huggingface.co/papers?q=ViT%20encoder),通过掩码自编码器(https://huggingface.co/papers?q=Masked%20Autoencoders)在来自 IMSLP(https://huggingface.co/papers?q=IMSLP)的 970 万页数据上进行预训练。为了处理真实乐谱的复杂性,我们采用了两阶段课程:先对排版乐谱进行合成预热(https://huggingface.co/papers?q=synthetic%20warm-up),然后在完整的 IMSLP(https://huggingface.co/papers?q=IMSLP)语料库上进行大规模训练。我们在四个下游任务上评估了 MuSViT——整页和谱表级别的乐谱识别(https://huggingface.co/papers?q=music%20score%20recognition)、音乐符号检测(https://huggingface.co/papers?q=music%20symbol%20detection)以及谱面难度分类——在两种场景下:线性探测(https://huggingface.co/papers?q=linear%20probing)(冻结编码器)和微调(https://huggingface.co/papers?q=fine-tuning)。在线性探测(https://huggingface.co/papers?q=linear%20probing)下,MuSViT 始终优于现代视觉编码器,这表明通用表示,无论规模大小,在音乐记谱的结构化符号属性上系统性地存在不足。在微调(https://huggingface.co/papers?q=fine-tuning)下,MuSViT 普遍优于特定任务的最新方法。一项额外的嵌入-转录一致性(https://huggingface.co/papers?q=embedding-transcription%20consistency)分析揭示,MuSViT 直接在其表示空间中编码了符号音乐结构——而其他编码器的嵌入与音乐记谱内容并不相关。这些结果确立了 MuSViT 作为乐谱(https://huggingface.co/papers?q=sheet%20music)理解的基础骨干网络。
查看 arXiv 页面(https://arxiv.org/abs/2606.31811)查看 PDF(https://arxiv.org/pdf/2606.31811)项目页面(https://grfia.dlsi.ua.es/musvit/)GitHub0(https://github.com/OMR-PRAIG-UA-ES/MuSViT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.31811)
在你的代理中获取该论文:
hf papers read 2606.31811
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型2
PRAIG/musvit-light 39.4M• 25分钟前更新(https://huggingface.co/PRAIG/musvit-light)
PRAIG/musvit 0.1B• 25分钟前更新 • 124(https://huggingface.co/PRAIG/musvit)
引用该论文的数据集0
暂无与该论文相关联的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2606.31811,以从该页链接到它。
引用该论文的空间0
暂无与该论文相关联的空间
请在空间的 README.md 中引用 arxiv.org/abs/2606.31811,以从该页链接到它。
包含该论文的合集1
相似文章
MuScriptor:一个用于多乐器音乐转录的开放模型
MuScriptor 是一个开源的多乐器音乐转录模型,能够将录音转录为每种乐器的 MIDI 音符,无需事先知道存在的乐器。
多任务多帧视觉钢琴转录
本文介绍了V2N,这是首个完整的视觉钢琴转录系统,可联合从视频中预测起音、释音、按键保持和力度,在PianoVAM和R3基准上取得了最先进的结果。
ViMU:视频隐喻理解基准
ViMU是首个旨在评估视频理解模型超越字面视觉理解、解读隐喻、讽刺及社会意义能力的基准,采用无提示的开放式和多项选择题。
@kyutai_labs: 我们发布了 MuScriptor,迄今最佳的多乐器转录开源模型,由我们与 @MireloAI 合作开发。
Kyutai Labs 与 MireloAI 发布了 MuScriptor,这是迄今最佳的多乐器转录开源模型,能够将任意流派的录音转录为各乐器的 MIDI 音轨。
@honualx: 音乐缺少了自己的“openai-whisper”。是时候让我们可以把任何音乐转成音符,就像语音转写现在已经成为理所当然的事情一样。
Kyutai 发布了 MuScriptor,这是一个用于多乐器转录的开源模型,能将任何音乐录音转换为 MIDI 音符,类似于 OpenAI Whisper 对语音的处理。