标签
本文讨论了AI视频提示的结构化,并介绍了一种‘white model’,它有助于减少空间关系中的随机性,建议具有电影感的用户使用它以增强对生成的控制。
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。