WorldExam:从表观外观到内在反应性的世界模型基准评测
摘要
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
来源:https://huggingface.co/papers/2608.02603
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
可控视频生成模型正越来越多地被开发为世界模型。相应地,评估它们在这一角色中的表现,不仅涉及生成视频的表观外观,还涉及它们所描绘世界的内在反应性:即从场景状态推断世界应如何反应,并生成输入中未明确描述的合理后果的能力。然而,现有基准主要评估视觉质量或显式指令完成度——通过检查请求的动作和交互结果是否实现,而内在反应性则未得到充分考察。我们提出WorldExam,一个分层诊断基准,涵盖四个层级:视觉质量、控制遵从性、空间一致性和世界反应性。它包含八个专门任务下的1,474个案例,并支持对相机驱动、动作驱动和语言驱动模型范式的统一评估。世界反应性层级评估超出输入明确规定的场景条件反应和目标导向行为。对20个代表性模型的评估揭示了明显的能力分化:相机驱动模型在相机控制上表现出色,但其接口不支持动态交互;动作驱动模型能更精确地控制主体,但往往让世界无响应;语言驱动模型在交互上表现更好,但对复杂控制的遵从性较差。没有模型能同时兼顾广泛任务覆盖和持续强劲的性能,这表明高视觉质量和显式指令完成并不保证内在反应性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.02603) 查看 PDF (https://arxiv.org/pdf/2608.02603) 项目页面 (https://worldexam.github.io/) GitHub (https://github.com/YuxueYang1204/worldexam) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02603)
在你的 agent 中获取此论文:
hf papers read 2608\.02603
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.02603 即可从本页面链接到它。
包含此论文的集合 0
没有包含此论文的集合
将论文添加到集合 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
WBench:面向交互式视频世界模型评估的综合多轮基准
WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。
WorldReasonBench:将视频生成器作为未来世界状态预测器进行人类对齐的压力测试
本文介绍了 WorldReasonBench 和 WorldRewardBench,这两个新基准旨在评估视频生成模型对世界状态演变和物理一致性的推理能力。研究突显了当前商业视频生成器在视觉合理性与真实逻辑推理之间存在的差距。
世界模型应如何评估?一种以决策为中心的立场
本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。
WorldReward: 针对相机条件化世界模型的奖励建模
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。
HappyWorld-Bench
HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。