@wildmindai: VIBE - 视频的AI背景音乐生成器;生成尝试匹配视频的情绪、时机、风格等的音乐…
摘要
VIBE是一个AI系统,通过文本指令生成视频的背景音乐,使用连续潜在建模和强化学习来更好地同步视频的情绪、时机和风格。
查看缓存全文
缓存时间: 2026/09/02 11:54
VIBE - 适用于视频的AI背景音乐生成器; 生成能匹配视频情绪、节奏、风格、速度和调性的音乐。
- 10秒同步器乐曲目
- MiniCPM4-0.5B
- SongBloom VAE (48 kHz音频)
- 为社交媒体、广告和原型制作自动生成背景配乐
https://huggingface.co/aryanvibhosale/vibe…
aryanvibhosale/vibe · Hugging Face
来源:https://huggingface.co/aryanvibhosale/vibe VIBE:遵循视频指令的背景音乐生成系统
VIBE:遵循视频指令的背景音乐生成
🎉 被EMNLP 2026收录为Findings论文
描述
https://huggingface.co/aryanvibhosale/vibe#description
VIBE为视频生成遵循明确文本指令的背景音乐,而不仅仅是“适合该视频的音乐“,而是既适合视频又完成用户要求的音乐。它扩展了无分词器、连续潜空间的音乐模型,通过多模态LLM判断器和基于规则的可验证奖励进行强化学习,使生成的音乐同时符合视频和指令。
VIBE不将音频转换为离散标记,而是在连续潜空间中建模音乐:多模态语义语言模型生成规划潜在向量,RITE(残差集成Transformer编码器)堆栈对其进行精炼,局部扩散变换器(LocDiT)在条件流匹配下降噪,然后48kHz立体声VAE解码为音频。视频条件通过基于CLIP的编码器输入,语义路由将视频和指令信号合并为单一条件流。
基于VoxCPM (https://github.com/OpenBMB/VoxCPM)(Apache-2.0)构建,从语音改编为音乐。
- 遵循指令的音乐生成: 根据视频和自由形式文本指令进行条件生成,因此可以显式请求速度、调性、情绪和配器,而不仅仅从视频推断。
- 基于多模态判断器的强化学习: 使用GRPO对Qwen2.5-Omni-7B (https://huggingface.co/Qwen/Qwen2.5-Omni-7B)进行训练,该模型观看视频并听取生成的音乐,对音乐性、文本-音乐对齐和视频-音乐对齐进行评分。分数来自约束数字对数解码,因此不存在JSON解析失败。
- 硬性可验证奖励: 基于规则的速度/BPM和调性一致性,使用librosa/essentia在生成的音频上测量,并根据从指令解析的目标评分。确定性、仅CPU、无学习参数,免疫奖励黑客攻击。
- 连续潜在表示,无音频分词器: 通过音乐VAE实现48kHz立体声输出,避免了离散分词的质量上限和码本伪影。
模型架构
https://huggingface.co/aryanvibhosale/vibe#model-architecture
VIBE架构
VIBE架构。 视频帧、文本提示和先前生成的块嵌入被传递给多模态语义语言模型。通过每个DiT层可学习的线性系数组合逐层隐藏状态,形成条件连接器,这些连接器与残差集成嵌入一起路由到每个LocDiT层,以生成每个音乐块。
语义语言模型:MiniCPM4-0.5B架构:24层,隐藏维度1024,16头,词表大小73,448 RITE:8层,隐藏维度1024 LocDiT:8层,条件流匹配,欧拉求解器 语义路由:8个LocDiT块 × 24个语言模型层的可学习softmax 潜在表示:块大小4,特征维度64,FSQ潜在维度256 视频编码器:CLIP ViT-B/32,8个采样帧,投影维度512(冻结,权重嵌入) 音频解码器:SongBloom / Stable Audio VAE(冻结,外部) 输出:48kHz立体声 参数:873个张量共953.5M参数(3.51 GB) 精度:推理时bf16;生成器以fp32存储,CLIP编码器为bf16
VIBE是自定义架构。不能用transformers.AutoModel加载;请使用VIBE仓库(https://github.com/aryanvibhosale/vibe)中的推理脚本。
训练
https://huggingface.co/aryanvibhosale/vibe#training
VIBE训练课程 训练课程概述。
训练数据:JamendoMaxCaps (https://huggingface.co/datasets/amaai-lab/JamendoMaxCaps)(文本到音乐预训练),MusicBench (https://huggingface.co/datasets/amaai-lab/MusicBench)(文本到音乐SFT),CMI-Pref (https://huggingface.co/datasets/HaiwenXia/cmi-pref)(用于文本到音乐偏好优化的字幕),和HarmonySet (https://huggingface.co/datasets/Zzitang/HarmonySet)(视频到音乐)。评估在ReelBench (https://huggingface.co/datasets/ReelBench/ReelBench)上进行。
来源
https://huggingface.co/aryanvibhosale/vibe#provenance
这是第5阶段强化学习策略。RL LoRA适配器(r=8, α=16,应用于语言模型和LocDiT的q_proj和v_proj)已经使用W += (α/r) · B·A折叠到基础权重中,因此作为普通模型加载,无需LoRA机制。
⚠️**请勿对此检查点使用
--lora_weights_path。**适配器已合并;再次提供会导致二次应用。
用法
https://huggingface.co/aryanvibhosale/vibe#usage
此仓库仅包含权重,无代码。克隆代码仓库,然后将--ckpt_dir指向此模型的下载位置。
git clone https://github.com/aryanvibhosale/vibe.git && cd vibe
conda env create -f environment.yml && conda activate vibe
**需要
transformers>=5.0.0。**视频编码器依赖CLIPModel.get_image_features()返回池化输出对象,这是v5行为。在transformers 4.x上,视频到音乐会因AttributeError: 'Tensor' object has no attribute 'pooler_output'而失败。如果环境创建因transformers版本要求失败,请单独安装:pip install "transformers>=5.0.0"。
下载权重和外部音乐VAE:
hf download aryanvibhosale/vibe --local-dir ./vibe_ckpt
hf download rsxdalv/SongBloom \
--include "autoencoder_music_dsp1920.ckpt" "stable_audio_1920_vae.json" \
--local-dir ./music_vae_cache
视频到音乐。 视频加指令输入,音乐输出:
python scripts/infer_v2m.py \
--ckpt_dir ./vibe_ckpt \
--audiovae_path ./music_vae_cache \
--text "An ambient electronic track at 125 BPM in B Minor." \
--video_path /path/to/input_video.mp4 \
--output v2m_out.wav
文本到音乐。 仅指令,无视频。使用scripts/infer_ttm.py,相同--ckpt_dir和--audiovae_path。
使用--cfg_value(默认2.0)和--inference_timesteps(视频到音乐默认10,文本到音乐默认20)调整质量。
仅使用
--video_path的前10秒;从该窗口均匀采样8帧。较长片段会被截断。
本仓库中的文件
https://huggingface.co/aryanvibhosale/vibe#files-in-this-repository
文件model.safetensors:3.51 GB,873个张量,953.5M参数
config.json:模型配置
tokenizer.json, tokenizer_config.json, special_tokens_map.json:LlamaTokenizerFast
static/:模型卡图片,模型不使用
所需外部组件
https://huggingface.co/aryanvibhosale/vibe#required-external-components
| 组件 | 来源 | 传递为 |
|---|---|---|
| SongBloom / Stable Audio音乐VAE | rsxdalv/SongBloom (https://huggingface.co/rsxdalv/SongBloom)(Apache-2.0) | --audiovae_path |
openai/clip-vit-base-patch32预处理器配置 | Hugging Face,初始化时获取(几kB) | 无 |
--audiovae_path是包含autoencoder_music_dsp1920.ckpt和stable_audio_1920_vae.json的目录。特意未包含在此处:音频VAE从不从检查点目录读取,其权重有独立许可证。
CLIP权重嵌入在model.safetensors中。初始化时仅从Hub获取小的图像预处理器配置,因此填充的HF_HOME缓存足以离线使用。无需下载MiniCPM4-0.5B:语义语言模型权重在model.safetensors中,分词器在此提供。
局限性
https://huggingface.co/aryanvibhosale/vibe#limitations
- 指令遵循在速度方面最强。 自动调性检测整体不可靠,包括在真实参考音频上,因此调性一致性不应作为主要指标。
- 强化学习在分布指标与遵循性和多样性之间权衡。 强化学习策略未针对最小化FAD或最大化ImageBind相似度进行优化,不应据此排名或框定为“最接近真实情况“。
- 生成的音频可能出人意料或包含伪影,特别是对于远离训练分布的指令。为研究目的发布;在未经进一步测试的情况下,我们不建议生产使用。
- 短形式器乐。 为背景音乐片段训练,非完整编曲或人声。输出为器乐;
en语言标签指文本指令,而非音频。 - 尊重输入中的权利。 基于您无权使用的视频生成音乐,或生成模仿特定艺术家受保护作品的音乐,可能构成侵权。我们建议清晰标记生成的音频为AI生成。
许可证
https://huggingface.co/aryanvibhosale/vibe#license
在Apache-2.0 (https://www.apache.org/licenses/LICENSE-2.0)许可证下发布。
这些权重源自MiniCPM4-0.5B (https://huggingface.co/openbmb/MiniCPM4-0.5B)(Apache-2.0)并嵌入冻结的CLIP ViT-B/32 (https://huggingface.co/openai/clip-vit-base-patch32)(MIT)视频编码器。Qwen2.5-Omni (https://huggingface.co/Qwen/Qwen2.5-Omni-7B)判断器和CMI-RM (https://huggingface.co/HaiwenXia/CMI-RM)(CMI-RewardBench (https://github.com/Haiwen-Xia/CMI-RewardBench))仅作为奖励信号塑造训练,未蒸馏到这些权重中;均未在此重新分发。CMI-RM发布的权重供非商业使用;请查阅上游仓库获取其当前条款。完整的第三方归属在NOTICE (https://github.com/aryanvibhosale/vibe/blob/main/NOTICE)文件中。音频VAE未包含;参见所需外部组件 (https://huggingface.co/aryanvibhosale/vibe#required-external-components)。
致谢
https://huggingface.co/aryanvibhosale/vibe#acknowledgements
这项工作建立在开源研究和代码之上。感谢:VoxCPM (https://github.com/OpenBMB/VoxCPM) · MiniCPM-4 (https://github.com/OpenBMB/MiniCPM) · CosyVoice (https://github.com/FunAudioLLM/CosyVoice) · DAC (https://github.com/descriptinc/descript-audio-codec) · Qwen2.5-Omni (https://github.com/QwenLM/Qwen2.5-Omni) · MuQ / MuQ-MuLan (https://github.com/tencent-ailab/MuQ) · CMI-RewardBench (https://github.com/Haiwen-Xia/CMI-RewardBench)
相似文章
Vibe Directing - 人工智能视频创作的Claude Code时刻
介绍‘Vibe Directing’作为AI视频创作的新范式,类比Claude Code如何变革编码工作流程。
Vibe Buddy
Vibe Buddy 是一款专为 AI 编程设计的硬件产品,旨在改善开发者工作流程。
datawhalechina/easy-vibe
easy-vibe 是由 Datawhale China 推出的一款开源、面向初学者的学习资源与教程框架,旨在通过自然语言(vibe coding)引导用户构建 AI 驱动的应用程序。它包含互动教程、学习路线图以及多语言支持。
VIBE:通过真实世界语音对大型音频语言模型的语音诱导开放式偏见评估
VIBE是一个框架,通过使用人类录制的语音进行开放式任务来评估大型音频语言模型中的生成偏差,揭示了由性别和口音线索触发的系统性偏差。
MusiChat:音乐创作的氛围式创作
MusiChat 提出了一种用于人机音乐协作创作的对话系统,通过自然语言交互实现迭代优化,在多轮编辑中达到了高准确率。