WorldExam:从表观外观到内在反应性的世界模型基准评测

Hugging Face Daily Papers 论文

摘要

WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。

可控视频生成模型正越来越多地被开发为世界模型。因此,在评估它们扮演这一角色时,不能仅限于生成视频的表观外观,还要考察其所描绘世界的内在反应性:即从场景状态推断世界应如何反应,并生成输入中未明确描述的合理后果的能力。然而,现有基准主要评估视觉质量或显式指令完成情况,通过检查所请求的动作和交互结果是否实现,而内在反应性仍未得到充分检验。我们提出了WorldExam,一个分层诊断基准,涵盖四个层级:视觉质量、控制遵循、空间一致性和世界反应性。它包含1,474个案例,分布在八个专门任务中,并支持对相机驱动、动作驱动和语言驱动模型范式的统一评估。世界反应性层级评估的是超出输入明确规定的场景条件反应和目标导向行为。对20个代表性模型的评估揭示了明显的能力分化。相机驱动模型在相机控制方面表现出色,但其接口不支持动态交互;动作驱动模型能更精确地控制主体,但往往使世界缺乏响应;语言驱动模型在交互方面表现更好,但在遵循复杂控制方面不够忠实。没有模型能够兼具广泛的任务覆盖和持续强劲的性能,这表明高视觉质量和显式指令完成并不能保证内在反应性。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

来源:https://huggingface.co/papers/2608.02603

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

可控视频生成模型正越来越多地被开发为世界模型。相应地,评估它们在这一角色中的表现,不仅涉及生成视频的表观外观,还涉及它们所描绘世界的内在反应性:即从场景状态推断世界应如何反应,并生成输入中未明确描述的合理后果的能力。然而,现有基准主要评估视觉质量或显式指令完成度——通过检查请求的动作和交互结果是否实现,而内在反应性则未得到充分考察。我们提出WorldExam,一个分层诊断基准,涵盖四个层级:视觉质量、控制遵从性、空间一致性和世界反应性。它包含八个专门任务下的1,474个案例,并支持对相机驱动、动作驱动和语言驱动模型范式的统一评估。世界反应性层级评估超出输入明确规定的场景条件反应和目标导向行为。对20个代表性模型的评估揭示了明显的能力分化:相机驱动模型在相机控制上表现出色,但其接口不支持动态交互;动作驱动模型能更精确地控制主体,但往往让世界无响应;语言驱动模型在交互上表现更好,但对复杂控制的遵从性较差。没有模型能同时兼顾广泛任务覆盖和持续强劲的性能,这表明高视觉质量和显式指令完成并不保证内在反应性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.02603) 查看 PDF (https://arxiv.org/pdf/2608.02603) 项目页面 (https://worldexam.github.io/) GitHub (https://github.com/YuxueYang1204/worldexam) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02603)

在你的 agent 中获取此论文:

hf papers read 2608\.02603

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。

包含此论文的集合 0

没有包含此论文的集合

将论文添加到集合 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。

WorldReward: 针对相机条件化世界模型的奖励建模

Hugging Face Daily Papers

WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。

HappyWorld-Bench

Hugging Face Daily Papers

HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。