PAWBench:我们离概率对齐的世界建模还有多远?
摘要
本文形式化了世界模型的概率对齐,并引入PAWBench和PAWEval来评估视频生成器作为随机采样器的表现,发现当前模型未能匹配参考行为分布。
查看缓存全文
缓存时间: 2026/08/28 03:23
论文页面 - PAWBench:我们距离概率对齐的世界建模还有多远?
来源:https://huggingface.co/papers/2608.27345
发布于8月27日
#2 当日论文 (https://huggingface.co/papers/date/2026-08-28)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
本研究形式化了世界模型的概率对齐概念,引入了PAWBench和PAWEval来评估视频生成器作为随机采样器的性能,并发现当前模型未能匹配参考行为分布。
近期视频生成模型日益被构建为(https://huggingface.co/papers?q=world%20models)世界模型(https://huggingface.co/papers?q=world%20models)。许多物理过程可以以不止一种合理方式展开。因此,世界模型不仅应重现合理的轨迹,还应复现相同初始观察和操作下的可能行为分布。我们将此分布层面的要求称为(https://huggingface.co/papers?q=probabilistic%20alignment)概率对齐(https://huggingface.co/papers?q=probabilistic%20alignment)。然而,现有评估大多只评估单个视频的合理性,并未检验重复生成是否能恢复正确的分布。这引发了一个核心问题:当前的(https://huggingface.co/papers?q=video%20generators)视频生成器(https://huggingface.co/papers?q=video%20generators)距离概率对齐的世界建模还有多远?为回答此问题,我们将(https://huggingface.co/papers?q=probabilistic%20alignment)概率对齐(https://huggingface.co/papers?q=probabilistic%20alignment)形式化为(https://huggingface.co/papers?q=world%20models)世界模型(https://huggingface.co/papers?q=world%20models)的(https://huggingface.co/papers?q=distributional%20criterion)分布标准(https://huggingface.co/papers?q=distributional%20criterion),并引入了(https://huggingface.co/papers?q=PAWBench)PAWBench(https://huggingface.co/papers?q=PAWBench)——一个用于评估(https://huggingface.co/papers?q=video%20generators)视频生成器(https://huggingface.co/papers?q=video%20generators)作为世界动态(https://huggingface.co/papers?q=stochastic%20samplers)随机采样器(https://huggingface.co/papers?q=stochastic%20samplers)的基准测试。我们进一步引入了(https://huggingface.co/papers?q=PAWEval)PAWEval(https://huggingface.co/papers?q=PAWEval),这是一种结果级协议,能将重复的视频生成转化为对可能物理行为的经验分布。在涵盖50个场景和11个当前系统的测试中,没有模型能持续匹配参考概率并恢复有效行为的范围。在确定了这一差距后,我们测试了语言提示、初始噪声采样或模型训练是否能够重塑模型的预测分布。我们相信,我们的工作可以为未来实现概率对齐的世界建模奠定基础。
查看 arXiv 页面 (https://arxiv.org/abs/2608.27345)查看 PDF (https://arxiv.org/pdf/2608.27345)项目页面 (https://pawbench.github.io/)GitHub0 (https://github.com/Andrew0613/PAWBench)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27345)
在您的代理中获取此论文:
hf papers read 2608\.27345
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。
引用本文的数据集0
暂无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。
引用本文的 Spaces0
暂无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。
包含本文的收藏夹0
暂无收藏夹包含本文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接。
相似文章
WorldReasonBench:将视频生成器作为未来世界状态预测器进行人类对齐的压力测试
本文介绍了 WorldReasonBench 和 WorldRewardBench,这两个新基准旨在评估视频生成模型对世界状态演变和物理一致性的推理能力。研究突显了当前商业视频生成器在视觉合理性与真实逻辑推理之间存在的差距。
WBench:面向交互式视频世界模型评估的综合多轮基准
WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。
PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。
PAIWorld: 面向机器人操作的三维一致世界基础模型
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。