PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
摘要
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。
查看缓存全文
缓存时间: 2026/08/14 03:26
论文页面 - PlayWorld:使用智能体玩家在长时程目标上评测世界模型
来源:https://huggingface.co/papers/2608.13552 作者:
,
,
,
,
,
,
,
,
,
,
摘要
PlayWorld 通过使用多模态智能体实现长时程目标,对交互式视频世界模型进行基准测试,评估几何一致性、交互保真度和状态演化。
视频世界模型(https://huggingface.co/papers?q=world%20models)根据当前观测和用户动作模拟未来状态。最近的系统已在长序列上展示出令人印象深刻的视频一致性和动作可控性。然而,公平地比较这些交互式模型仍然具有挑战性。在实践中,人类玩家通常通过交互追求长时程目标来评估世界模型。例如,用户可能会旋转 360 度以查看环境是否保持一致,或者走进水中检查是否生成逼真的水波纹。实现相同目标所需的动作序列在不同模型之间可能有很大差异,这使得固定动作条件下的评估不适合跨模型比较。为了解决这个问题,我们采用多模态智能体玩家(https://huggingface.co/papers?q=multi-modal%20Agent%20Players)与世界模型(https://huggingface.co/papers?q=world%20models)交互,以实现指定的长时程目标。在此范式的基础上,我们引入了 PlayWorld(https://huggingface.co/papers?q=PlayWorld),这是一个提供 171 个场景的基准,每个场景都有指定的目标。为了全面评估性能,我们从四个核心维度评估模型:几何一致性(https://huggingface.co/papers?q=geometry%20consistency)、交互保真度(https://huggingface.co/papers?q=interaction%20fidelity)、视野外演化(https://huggingface.co/papers?q=out-of-sight%20evolution)和洞察演化(https://huggingface.co/papers?q=insight%20evolution)。此外,我们纳入了视频质量和可控性的基本能力指标。对九种最先进的世界模型(https://huggingface.co/papers?q=world%20models)的实验表明,当前模型在长时程交互目标上仍不可靠,尤其是在保持空间一致性和持续性状态演化方面。代码和数据可在 https://github.com/kxding/PlayWorld(https://huggingface.co/papers?q=PlayWorld)获取。
查看 arXiv 页面(https://arxiv.org/abs/2608.13552)查看 PDF(https://arxiv.org/pdf/2608.13552)项目页面(https://kxding.github.io/project/PlayWorld/)GitHub8(https://github.com/kxding/PlayWorld)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.13552)
在您的智能体中获取此论文:
hf papers read 2608\.13552
没有最新的 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文。
在模型 README.md 中引用 arxiv.org/abs/2608.13552,即可从此页面关联该模型。
引用此论文的数据集 1
jocelynd/playworld-bench 查看器• 约 2 小时前更新 • 171 • 1 • 1(https://huggingface.co/datasets/jocelynd/playworld-bench)
引用此论文的 Spaces 1
包含此论文的收藏 0
没有收藏包含此论文。
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面关联它。
相似文章
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
WorldLines:长周期有状态具身智能体的基准测试与建模
WorldLines 提出了一个针对长周期具身家务辅助的基准,包含记忆问答和部分可观察条件下的具身任务规划,并提出了 ObsMem,一个可见性感知的记忆框架。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
WBench:面向交互式视频世界模型评估的综合多轮基准
WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。