worldproof:诊断世界模型预测在何处失效,以及像素指标何时完全无法对模型进行排名的测量 [P]

Reddit r/MachineLearning 论文

摘要

介绍了 worldproof,一个用于诊断世界模型的开源工具,并发现像素指标通常无法在真实机器人视频上对模型进行排名,因为评估视野缺乏区分能力;确定了一个可用的 8-24 步窗口。

我一直在构建一个用于诊断世界模型的开源工具,这类模型从起始上下文和一系列动作预测未来帧。它将 rollout 与地面真值和物理不变量进行比较,然后告诉你预测在何处以及为何崩溃。它故意不评分任务成功或规划质量,因为已经有针对这些的基准测试。在验证它的过程中,我遇到了一些我认为比工具本身更有趣的事情。 ## 真实机器人视频上的像素指标通常完全无法对模型进行排名 我运行了一个复制最后一帧的基线,也就是“预测什么都不变”,针对一个真实的 SO-101 机械臂录制。30fps,三个摄像头,64 个 rollout,6 步视野,只对运动区域评分,这样静态背景就不会夸大数字。它得到 0.983 SSIM 和 53.9 dB PSNR。但真正重要的部分是误差不会随着视野增长: step 1 2 3 4 5 6 SSIM 0.972 0.923 0.893 0.943 0.920 0.950 这是平坦的。它会游荡,但不会退化。如果预测 6 步并不比预测 1 步更难,那么就没有什么好的模型可以做得更好。每个模型都落在同一个地方,评估无法对它们进行排名。这里的指标没有坏,它在精选数据上通过了排序测试。是评估设置没有区分能力,这是一个不同的问题,而且更容易被忽视。 ## 所以我测量了可用窗口实际在哪里 同样的基线在 DROID(真实操作视频,15fps)上,64 个 rollout,这次一直到 48 步: step 1 3 6 12 18 24 28 36 47 SSIM@dynamic 0.873 0.797 0.676 0.446 0.350 0.260 0.204 0.192 0.216 这里有三个区间。第 1 到 3 步,一切几乎完美并打平。第 4 到 24 步,陡峭的单调下降,这是模型真正可区分的唯一一段。第 28 步之后,它在 0.20 SSIM 和 10.3 dB 附近触底,无趋势地振荡,预测完全去相关,所有模型再次在底部打平。所以两端都是死的,对于这类视频,值得评估的视野大约在 8 到 24 步。这是帧率乘以任务速度的一个属性,而不是一个普适数字,这正是为什么值得在你的数据上测量,而不是从使用其他设置的论文中继承默认值。这是预测与实际情况的对比,同样的 48 步,预测在左边:https://raw.githubusercontent.com/BuceaGeorgia/worldproof/main/docs/img/droid-pred-vs-true.gif ## 方法 每个配置 64 个 rollout。聚合使用四分位均值并带有分层自举置信区间,而不是均值和标准差,遵循 Agarwal et al. 2021。保真度指标在可用掩码时也产生动态区域掩码变体。每个指标都附带一个它必须响应的损坏测试,以及一个排序测试,其中真实模型必须击败朴素基线,而朴素基线必须击败损坏模型。值得提及的是:早期 n=8 版本的 SO-101 运行给出的动态 PSNR 为 48.2 dB,而 n=64 给出 53.9,并且 n=8 的区间宽到足以完全重叠 DROID。这就是为什么上面所有内容都是 n=64。如果我停在那里,我会发布错误的数字。 ## 注意事项 四个像素指标以非重叠的自举置信区间区分两个数据集。LPIPS 不能,并且在掩码变体上它指向另一个方向。我对此还没有一个清晰解释,如果能听到一个我会很高兴。这是一个微不足道的基线,所以 8 到 24 是“什么都不做”的预测器变得可区分的范围。一个真正的模型会保持更长时间的相关性,并将该范围的上限推得更远。我在写这篇文章时发现的另一件事:包含第 0 步会夸大每个汇总标量,因为当帧率相对于场景移动速度较高时,复制基线几乎可以免费获得第一步。在 30fps 录制中,第 0 步得分 119.8 dB,这会将视野平均标量从约 32 拉高到 53.9。因此,该标量部分是在奖励帧率而不是模型质量。曲线是诚实的报告方式,我把我自己工具中的标量定义视为一个开放问题。 ## 工具 Apache-2.0,`pip install worldproof`。核心安装是 numpy、torch 和 pillow,它可以在没有 GPU 的笔记本电脑上运行,因为评估路径从不运行模型。它直接从 parquet 和 mp4 读取 LeRobotDataset v3.0,因此可以在 Python 3.10 上处理来自 HF Hub 的数据集,而无需 lerobot 包。较重的组件(LPIPS、FVD、跟踪器)是可选的额外功能,会被惰性导入。它测量:PSNR、SSIM 和 LPIPS 作为视野曲线加上动态区域变体,潜变量预测误差和动作可恢复性(用于潜变量模型),通过 ECE 和 MCE 进行校准,反事实发散,故障保真度,对象计数守恒和对象持久性,以及 FVD 明确报告为弱参考而不是头条数字。 https://github.com/BuceaGeorgia/worldproof 它是 v0.1,README 中有一个“尚未完成”部分,涵盖未完成的内容。不变量背后的跟踪器是一个干净的场景 numpy 跟踪器,无法处理混乱的真实视频,默认的 FVD 提取器不是已发表 FVD 数字所用的 I3D,因此那些数字无法与论文进行比较。如果这个视野结果很明显或在某处已知,我真的很想被告知。我在任何地方都找不到它被测量过,这也是我发布它的部分原因。
查看原文

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。