标签
视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。
本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。
作者发起了一个每周视频模型期刊俱乐部,涵盖视频生成、世界模型、物理推理、扩散模型、流匹配等。首次线下讲座将由 Yilun Du 主讲,主题为“基于世界模型的具身推理”。
LongCat 发布了 WBench,这是一个用于视频世界模型的基准测试,通过 289 个案例和 20 个模型,测试了控制、记忆、指令遵循和物理合理性,发现没有模型在所有维度上都表现出色,凸显了视频质量与真实世界模拟之间的差距。
一条推文串揭示,谷歌的Omni与Veo和Seedance等视频模型不同,DeepMind的Jeff Dean澄清了其独特的输入/输出能力,描述为一种变革性的视频AR滤镜。