WorldOlympiad:您的世界模型能通过三项全能测试吗?
摘要
WorldOlympiad 提出了一个全面的基准测试,用于评估基于视频的世界模型在物理真实性、几何一致性和交互保真度方面的表现,揭示了当前生成模型的显著差距。
查看缓存全文
缓存时间: 2026/06/10 05:44
论文页面 - WorldOlympiad:您的世界模型能经受三项全能考验吗?
来源:https://huggingface.co/papers/2606.11129 作者:
,
,
,
,
,
,
,
,
,
摘要
WorldOlympiad 提出了一个全面的基准测试,用于评估基于视频的世界模型在物理真实性、几何一致性和交互保真度方面的表现,揭示了当前生成模型能力上的显著差距。
我们引入了 WorldOlympiad,一个用于诊断基于视频的世界模型在物理真实性、几何一致性和交互保真度方面的基准测试。现有基准测试通常侧重于视觉质量、语义对齐或短期时间一致性,但在判断生成视频是否遵循物理规律、保持连贯的三维结构以及维持可控的长时间交互方面提供的洞察有限。为解决这一差距,WorldOlympiad 将世界模型评估分解为三个互补维度。物理轨道使用目标分割和多模态大语言模型作为裁判,评估生成视频是否遵循力学、热现象和材料属性方面的可解释规则。几何轨道通过高斯泼溅重建生成视频,并评估结构一致性、跨视角连贯性和相机轨迹对齐。交互轨道评估生成视频是否遵循复杂的动作提示,并在连续视频片段之间保持平滑、连贯的过渡。WorldOlympiad 还覆盖了三个主要下游场景,包括游戏、机器人和通用真实世界视频,捕捉了从交互控制和具身操作到开放领域运动与相机动力学的多样化挑战。这些轨道和场景共同构成了一个可扩展且可解释的评估套件,暴露了超出通用视频质量的失败模式。在最新模型上的实验揭示了物理推理、三维一致性和长时程交互方面的显著差距,凸显了对生成式世界模型采用更结构化评估协议的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11129)查看 PDF (https://arxiv.org/pdf/2606.11129)项目页面 (https://alibaba-damo-academy.github.io/WorldOlympiad/)GitHub7 (https://github.com/alibaba-damo-academy/WorldOlympiad)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11129)
在您的代理中获取此论文:
hf papers read 2606\.11129
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.11129 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.11129 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.11129 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
WorldExam:从表观外观到内在反应性的世界模型基准评测
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
@omarsar0: 大多数世界模型在几秒后就会崩溃。常见故障模式包括纹理涂抹、几何扭曲以及…
LingBot-World 2.0实现了稳定的720p 60fps世界模型模拟,可持续长达一小时,克服了纹理涂抹和几何扭曲等常见故障模式。
PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。