我训练了一个游戏音乐生成器

Reddit r/LocalLLaMA 模型

摘要

我训练了一个1.2B DiT模型用于器乐游戏音乐生成,使用Stable Audio的VAE,旨在覆盖多样化的风格。该项目是开源的,包含一个WebUI和可在HuggingFace上获取的样本。

我训练了一个器乐游戏音乐生成器。1.2B DiT在1个云H100上从零开始训练了8天;我使用了Stable Audio 3的VAE。 https://huggingface.co/Localsong/Localsong https://huggingface.co/Localsong/Localsong/tree/main/samples https://huggingface.co/Localsong/Localsong/blob/main/samples_new/The%20First%20Climb.mp3 我的目标是覆盖比Ace-Step、Minimax M3或Stable Audio 3更广泛的器乐风格。(无歌词)该仓库包含一个WebUI和一些MP3样本 - 克隆它并运行uv run webui.py 请告诉我您的想法。
查看原文

相似文章

通过人类偏好奖励改进文本到音乐生成

Hugging Face Daily Papers

本文提出了一种文本到音乐生成系统,利用奖励条件、专家迭代和偏好调优,在120M参数模型中提升音频质量,该模型提交至ICME 2026 ATTM Grand Challenge。