PAWBench:我们离概率对齐的世界建模还有多远?

Hugging Face Daily Papers 论文

摘要

本文形式化了世界模型的概率对齐,并引入PAWBench和PAWEval来评估视频生成器作为随机采样器的表现,发现当前模型未能匹配参考行为分布。

最近的视频生成模型越来越多地被构想为世界模型。许多物理过程可以以多种有效方式展开。因此,世界模型不仅应重现合理的轨迹,还应在相同初始观察和动作下重现可能行为的分布。我们将这种分布层面的要求称为概率对齐。然而,现有评估主要评估单个视频的合理性,并未测试重复生成是否能恢复正确的分布。这就引出了一个核心问题:当前的视频生成器距离概率对齐的世界建模还有多远?为了回答这个问题,我们将概率对齐形式化为世界模型的分布标准,并引入PAWBench,一个评估视频生成器作为世界动态随机采样器的基准。我们进一步引入PAWEval,一个将重复视频展开转换为可能物理行为的经验分布的结果级协议。在50个场景和当前十一个系统中,没有模型在恢复有效行为范围的同时持续匹配参考概率。在建立这一差距后,我们测试了语言提示、初始噪声采样或模型训练是否能重塑模型的预测分布。我们相信我们的工作可以作为未来朝着概率对齐世界建模努力的基础。
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:23

论文页面 - PAWBench:我们距离概率对齐的世界建模还有多远?

来源:https://huggingface.co/papers/2608.27345
发布于8月27日

#2 当日论文 (https://huggingface.co/papers/date/2026-08-28)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

本研究形式化了世界模型的概率对齐概念,引入了PAWBench和PAWEval来评估视频生成器作为随机采样器的性能,并发现当前模型未能匹配参考行为分布。

近期视频生成模型日益被构建为(https://huggingface.co/papers?q=world%20models)世界模型(https://huggingface.co/papers?q=world%20models)。许多物理过程可以以不止一种合理方式展开。因此,世界模型不仅应重现合理的轨迹,还应复现相同初始观察和操作下的可能行为分布。我们将此分布层面的要求称为(https://huggingface.co/papers?q=probabilistic%20alignment)概率对齐(https://huggingface.co/papers?q=probabilistic%20alignment)。然而,现有评估大多只评估单个视频的合理性,并未检验重复生成是否能恢复正确的分布。这引发了一个核心问题:当前的(https://huggingface.co/papers?q=video%20generators)视频生成器(https://huggingface.co/papers?q=video%20generators)距离概率对齐的世界建模还有多远?为回答此问题,我们将(https://huggingface.co/papers?q=probabilistic%20alignment)概率对齐(https://huggingface.co/papers?q=probabilistic%20alignment)形式化为(https://huggingface.co/papers?q=world%20models)世界模型(https://huggingface.co/papers?q=world%20models)的(https://huggingface.co/papers?q=distributional%20criterion)分布标准(https://huggingface.co/papers?q=distributional%20criterion),并引入了(https://huggingface.co/papers?q=PAWBench)PAWBench(https://huggingface.co/papers?q=PAWBench)——一个用于评估(https://huggingface.co/papers?q=video%20generators)视频生成器(https://huggingface.co/papers?q=video%20generators)作为世界动态(https://huggingface.co/papers?q=stochastic%20samplers)随机采样器(https://huggingface.co/papers?q=stochastic%20samplers)的基准测试。我们进一步引入了(https://huggingface.co/papers?q=PAWEval)PAWEval(https://huggingface.co/papers?q=PAWEval),这是一种结果级协议,能将重复的视频生成转化为对可能物理行为的经验分布。在涵盖50个场景和11个当前系统的测试中,没有模型能持续匹配参考概率并恢复有效行为的范围。在确定了这一差距后,我们测试了语言提示、初始噪声采样或模型训练是否能够重塑模型的预测分布。我们相信,我们的工作可以为未来实现概率对齐的世界建模奠定基础。

查看 arXiv 页面 (https://arxiv.org/abs/2608.27345)查看 PDF (https://arxiv.org/pdf/2608.27345)项目页面 (https://pawbench.github.io/)GitHub0 (https://github.com/Andrew0613/PAWBench)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27345)

在您的代理中获取此论文:

hf papers read 2608\.27345

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。

引用本文的数据集0

暂无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。

引用本文的 Spaces0

暂无 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2608.27345 以从本页链接。

包含本文的收藏夹0

暂无收藏夹包含本文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接。

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。