标签
VIBE是一个AI系统,通过文本指令生成视频的背景音乐,使用连续潜在建模和强化学习来更好地同步视频的情绪、时机和风格。
论文指出了为何确定性少步生成在文本上失败而在图像上成功:文本解码器中尖锐的类别读出放大了微小误差,导致词元翻转,而连续图像解码器是平滑的。论文提出了诊断指标(DABI, CCI)以及逃逸机制,如类别承诺和随机重注入。