PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试

Hugging Face Daily Papers 论文

摘要

PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。

视频世界模型根据当前观测和用户动作来模拟未来状态。近期系统在长序列上展示了令人印象深刻的视频一致性和动作可控性。然而,公平地比较这些交互式模型仍然具有挑战性。在实践中,人类玩家通常通过交互来追求长时程目标,从而评估世界模型。例如,用户可能旋转360度以检查环境是否保持一致,或走入水中并观察是否生成逼真的水波纹。由于不同模型实现同一目标所需的动作序列可能有很大差异,固定的动作条件评估不适合跨模型比较。为解决这一问题,我们使用多模态智能体玩家(Agent Players)与世界模型交互,以完成指定的长时程目标。基于这一范式,我们推出了PlayWorld基准测试,提供171个场景,每个场景都配有指定的目标。为全面评估性能,我们从四个核心维度评估模型:几何一致性、交互保真度、视野外演化和洞察演化。此外,我们还引入了视频质量和可控性的基础能力指标。对九个最先进的世界模型的实验表明,当前模型在长时程交互目标上仍不可靠,特别是在保持空间一致性和持续状态演化方面。代码和数据可在https://github.com/kxding/PlayWorld获取。
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:26

论文页面 - PlayWorld:使用智能体玩家在长时程目标上评测世界模型

来源:https://huggingface.co/papers/2608.13552 作者:

摘要

PlayWorld 通过使用多模态智能体实现长时程目标,对交互式视频世界模型进行基准测试,评估几何一致性、交互保真度和状态演化。

视频世界模型(https://huggingface.co/papers?q=world%20models)根据当前观测和用户动作模拟未来状态。最近的系统已在长序列上展示出令人印象深刻的视频一致性和动作可控性。然而,公平地比较这些交互式模型仍然具有挑战性。在实践中,人类玩家通常通过交互追求长时程目标来评估世界模型。例如,用户可能会旋转 360 度以查看环境是否保持一致,或者走进水中检查是否生成逼真的水波纹。实现相同目标所需的动作序列在不同模型之间可能有很大差异,这使得固定动作条件下的评估不适合跨模型比较。为了解决这个问题,我们采用多模态智能体玩家(https://huggingface.co/papers?q=multi-modal%20Agent%20Players)与世界模型(https://huggingface.co/papers?q=world%20models)交互,以实现指定的长时程目标。在此范式的基础上,我们引入了 PlayWorld(https://huggingface.co/papers?q=PlayWorld),这是一个提供 171 个场景的基准,每个场景都有指定的目标。为了全面评估性能,我们从四个核心维度评估模型:几何一致性(https://huggingface.co/papers?q=geometry%20consistency)、交互保真度(https://huggingface.co/papers?q=interaction%20fidelity)、视野外演化(https://huggingface.co/papers?q=out-of-sight%20evolution)和洞察演化(https://huggingface.co/papers?q=insight%20evolution)。此外,我们纳入了视频质量和可控性的基本能力指标。对九种最先进的世界模型(https://huggingface.co/papers?q=world%20models)的实验表明,当前模型在长时程交互目标上仍不可靠,尤其是在保持空间一致性和持续性状态演化方面。代码和数据可在 https://github.com/kxding/PlayWorld(https://huggingface.co/papers?q=PlayWorld)获取。

查看 arXiv 页面(https://arxiv.org/abs/2608.13552)查看 PDF(https://arxiv.org/pdf/2608.13552)项目页面(https://kxding.github.io/project/PlayWorld/)GitHub8(https://github.com/kxding/PlayWorld)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13552)

在您的智能体中获取此论文:

hf papers read 2608\.13552

没有最新的 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文。

在模型 README.md 中引用 arxiv.org/abs/2608.13552,即可从此页面关联该模型。

引用此论文的数据集 1

jocelynd/playworld-bench 查看器• 约 2 小时前更新 • 171 • 1 • 1(https://huggingface.co/datasets/jocelynd/playworld-bench)

引用此论文的 Spaces 1

包含此论文的收藏 0

没有收藏包含此论文。

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面关联它。

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。