标签
ControlNet作者敏神开源了FramePack视频生成模型,仅需6GB显存即可运行13B模型,生成1分钟30帧视频,RTX 4090上每帧1.5秒,并提供Windows一键包。
本文提出可识别令牌对应(Identifiable Token Correspondence)方法,通过建模跨时间帧的令牌对应关系,提升基于Transformer的世界模型在视觉强化学习中的时间一致性,在多个基准测试中取得最先进结果。