多任务多帧视觉钢琴转录

Hugging Face Daily Papers 论文

摘要

本文介绍了V2N,这是首个完整的视觉钢琴转录系统,可联合从视频中预测起音、释音、按键保持和力度,在PianoVAM和R3基准上取得了最先进的结果。

基于音频的钢琴转录在起音、音高和力度上表现良好,但延音踏板使得声音在琴键释放后仍会持续很久,因此音频系统预测的是踏板延长的释音时间,而非物理上的琴键释放。然而,现有的视觉钢琴转录(VPT)系统仅关注于从短时视频窗口中检测起音,释音精度与起音相差甚远,且尚未有报告给出音符级别的力度预测。为解决这些问题,我们提出了V2N(Video to Notes),这是首个完整的VPT系统:一个共享的时间主干网络为起音、释音、按键保持和力度分别提供任务特定的预测头,并以逐帧监督而非仅在窗口中心进行联合训练。消融实验表明,多任务监督能够实现释音和力度的预测,同时提升起音精度;更长的时序上下文带来进一步提升。V2N在PianoVAM和R3上取得了新的最先进结果。
查看原文
查看缓存全文

缓存时间: 2026/08/05 13:45

论文页面 - 多任务多帧视觉钢琴转录

来源:https://huggingface.co/papers/2608.03419

摘要

基于音频的钢琴转录在起音、音高和力度上表现良好,但延音踏板会让声音在琴键释放后持续很久,因此音频系统预测的是踏板延长的偏移,而非物理上的琴键释放。然而,现有的视觉钢琴转录(VPT)系统专注于从短视频窗口中进行起音检测,偏移准确度远落后于起音,且音符级别的力度尚未有报告。为了解决这些不足,我们提出了V2N(视频到音符),这是首个完整的VPT系统:一个共享的时间骨干网络为起音、偏移、琴键保持和力度等任务特定的头提供特征,并通过逐帧监督进行联合训练,而不仅仅是在窗口中心进行监督。消融实验表明,多任务监督能够实现偏移和力度的预测,同时提高起音准确度;更长的时域上下文带来进一步的改进。V2N在PianoVAM和R3上取得了新的最先进结果。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03419)查看 PDF (https://arxiv.org/pdf/2608.03419)项目页面 (https://huggingface.co/spaces/PianoVAM/V2N)GitHub3 (https://github.com/yonghyunk1m/V2N)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03419)

在你的智能体中获取此论文:

hf papers read 2608\.03419

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.03419 即可从此页面链接到它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.03419 即可从此页面链接到它。

引用此论文的 Spaces1

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

MuSViT:面向乐谱表示的基础视觉模型

Hugging Face Daily Papers

MuSViT是首个面向乐谱的基础视觉模型,通过掩码自编码器在数百万页乐谱上预训练,在乐谱识别和符号检测任务中取得卓越性能。