多任务多帧视觉钢琴转录
摘要
本文介绍了V2N,这是首个完整的视觉钢琴转录系统,可联合从视频中预测起音、释音、按键保持和力度,在PianoVAM和R3基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/05 13:45
论文页面 - 多任务多帧视觉钢琴转录
来源:https://huggingface.co/papers/2608.03419
摘要
基于音频的钢琴转录在起音、音高和力度上表现良好,但延音踏板会让声音在琴键释放后持续很久,因此音频系统预测的是踏板延长的偏移,而非物理上的琴键释放。然而,现有的视觉钢琴转录(VPT)系统专注于从短视频窗口中进行起音检测,偏移准确度远落后于起音,且音符级别的力度尚未有报告。为了解决这些不足,我们提出了V2N(视频到音符),这是首个完整的VPT系统:一个共享的时间骨干网络为起音、偏移、琴键保持和力度等任务特定的头提供特征,并通过逐帧监督进行联合训练,而不仅仅是在窗口中心进行监督。消融实验表明,多任务监督能够实现偏移和力度的预测,同时提高起音准确度;更长的时域上下文带来进一步的改进。V2N在PianoVAM和R3上取得了新的最先进结果。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03419)查看 PDF (https://arxiv.org/pdf/2608.03419)项目页面 (https://huggingface.co/spaces/PianoVAM/V2N)GitHub3 (https://github.com/yonghyunk1m/V2N)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03419)
在你的智能体中获取此论文:
hf papers read 2608\.03419
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.03419 即可从此页面链接到它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.03419 即可从此页面链接到它。
引用此论文的 Spaces1
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
PianoKontext: 从平淡上下文中生成富有表现力的演奏
PianoKontext 通过在潜在空间中利用动态时间规整对齐音频和MIDI,以及使用DiT模块的流匹配,从平淡的MIDI乐谱中生成可变长度的富有表现力的钢琴演奏。
Show HN: 我训练了一个1.25亿参数模型,在设备上实现钢琴自动补全
一位开发者训练了一个1.25亿参数的transformer模型,使用MIDI数据和DPO后训练,在设备上实时自动完成钢琴演奏,并发布了适用于iOS的RollTab应用。
MuSViT:面向乐谱表示的基础视觉模型
MuSViT是首个面向乐谱的基础视觉模型,通过掩码自编码器在数百万页乐谱上预训练,在乐谱识别和符号检测任务中取得卓越性能。
MuScriptor:一个用于多乐器音乐转录的开放模型
MuScriptor 是一个开源的多乐器音乐转录模型,能够将录音转录为每种乐器的 MIDI 音符,无需事先知道存在的乐器。
@iScienceLuvr: Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过…"
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。