Dream.exe:视频生成模型能否梦想可执行的机器人操控?

Hugging Face Daily Papers 论文

摘要

Dream.exe 提出了一种评估框架,利用机器人操控任务来评估视频生成模型对物理现实的理解,结果发现视觉质量并不能预测可执行运动的准确性。

视频生成模型在合成视觉上令人信服的内容方面取得了显著进展,但其输出仍局限于虚拟领域。一个自然的问题随之而来:当这些模型生成的视频离开屏幕进入现实时,它们能多好地反映物理世界?我们提出将机器人操控作为一个具体且可测量的窗口来探讨这个问题:如果模型真正内化了物理定律,那么它描绘的运动应该能转化为可执行的机器人行为。我们引入了 Dream.exe,这是一个评估框架,通过视频到执行的流水线来具体化这一标准。给定场景图像和任务描述,Dream.exe 合成一个操控视频,将生成的运动转化为机器人轨迹,并在物理模拟器中执行,从而提供纯粹的视觉指标无法给出的接地信号。利用这一流水线,我们评估了 8 个模型,涵盖前沿闭源生成器、开源生成器和机器人专用模型。我们的基准测试包含 101 个手工策划的操控任务,分为三个物理复杂度级别,并从视觉质量、轨迹保真度和执行成功率三个方面进行衡量。令人鼓舞的是,多个模型取得了可衡量的执行成功率,这表明从互联网规模数据中学习到的生成先验已经编码了有意义的物理知识。然而,视觉质量并不能很好地预测可执行性,这揭示了标准视觉评估未能捕捉到的模型能力维度。Dream.exe 将在 https://github.com/showlab/Dream.exe 开源。
查看原文
查看缓存全文

缓存时间: 2026/06/05 14:08

论文页面 - Dream.exe:视频生成模型能否幻化出可执行的机器人操作?

来源:https://huggingface.co/papers/2606.04811

摘要

通过机器人操作任务评估视频生成模型反映物理现实的能力,结果揭示视觉质量并不能预测可执行运动的准确性。

视频生成模型在合成视觉惊艳内容方面取得了瞩目进展,但其输出仍局限于虚拟领域。一个自然而然的疑问随之而来:当这些模型生成的视频脱离屏幕、进入现实世界时,它们对物理世界的反映究竟如何?我们提出以机器人操作作为具体可测量的窗口来审视这一问题:如果一个模型真正内化了物理定律,那么它所描绘的运动应当能够转化为可执行的机器人行为。我们引入 Dream.exe,这是一个评估框架,通过视频到执行流水线将该标准付诸实践。给定场景图像和任务描述,Dream.exe 合成一段操作视频,将生成的运动转换为机器人轨迹,并在物理模拟器中执行,从而提供纯视觉指标无法给出的基于真实世界的信号。利用这一流水线,我们评估了8个模型,涵盖了前沿闭源生成器、开源生成器以及专用机器人模型。我们的基准测试包含101个精心整理的操作任务,分为三个物理复杂度等级,从视觉质量、轨迹保真度执行成功率三个维度进行衡量。令人鼓舞的是,多个模型取得了可观的执行成功率,这表明从互联网规模数据中学习的生成先验已经编码了有意义的物理知识。然而,视觉质量被证明是执行能力的糟糕预测指标,这暴露了标准视觉评估无法捕捉到的模型能力维度。Dream.exe 将在 https://github.com/showlab/Dream.exe 开源。

查看 arXiv 页面 (https://arxiv.org/abs/2606.04811)查看 PDF (https://arxiv.org/pdf/2606.04811)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.04811)

在你的 Agent 中获取此论文:

hf papers read 2606.04811

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。

引用该论文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。

引用该论文的 Spaces0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。

包含该论文的收藏0

无收藏包含此论文

将该论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模

Hugging Face Daily Papers

Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。

DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。