Dream.exe:视频生成模型能否梦想可执行的机器人操控?
摘要
Dream.exe 提出了一种评估框架,利用机器人操控任务来评估视频生成模型对物理现实的理解,结果发现视觉质量并不能预测可执行运动的准确性。
查看缓存全文
缓存时间: 2026/06/05 14:08
论文页面 - Dream.exe:视频生成模型能否幻化出可执行的机器人操作?
来源:https://huggingface.co/papers/2606.04811
摘要
通过机器人操作任务评估视频生成模型反映物理现实的能力,结果揭示视觉质量并不能预测可执行运动的准确性。
视频生成模型在合成视觉惊艳内容方面取得了瞩目进展,但其输出仍局限于虚拟领域。一个自然而然的疑问随之而来:当这些模型生成的视频脱离屏幕、进入现实世界时,它们对物理世界的反映究竟如何?我们提出以机器人操作作为具体可测量的窗口来审视这一问题:如果一个模型真正内化了物理定律,那么它所描绘的运动应当能够转化为可执行的机器人行为。我们引入 Dream.exe,这是一个评估框架,通过视频到执行流水线将该标准付诸实践。给定场景图像和任务描述,Dream.exe 合成一段操作视频,将生成的运动转换为机器人轨迹,并在物理模拟器中执行,从而提供纯视觉指标无法给出的基于真实世界的信号。利用这一流水线,我们评估了8个模型,涵盖了前沿闭源生成器、开源生成器以及专用机器人模型。我们的基准测试包含101个精心整理的操作任务,分为三个物理复杂度等级,从视觉质量、轨迹保真度和执行成功率三个维度进行衡量。令人鼓舞的是,多个模型取得了可观的执行成功率,这表明从互联网规模数据中学习的生成先验已经编码了有意义的物理知识。然而,视觉质量被证明是执行能力的糟糕预测指标,这暴露了标准视觉评估无法捕捉到的模型能力维度。Dream.exe 将在 https://github.com/showlab/Dream.exe 开源。
查看 arXiv 页面 (https://arxiv.org/abs/2606.04811)查看 PDF (https://arxiv.org/pdf/2606.04811)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.04811)
在你的 Agent 中获取此论文:
hf papers read 2606.04811
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。
引用该论文的数据集0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。
引用该论文的 Spaces0
无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.04811 即可从此页面链接。
包含该论文的收藏0
无收藏包含此论文
将该论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,利用几何注意力编码、深度估计和蒸馏来预测未来的观察结果,在 WorldArena 2.0 挑战赛中取得了顶尖成绩。
StressDream:引导视频世界模型实现鲁棒的策略评估与改进
StressDream通过优化噪声初始化结合语义目标与合理性目标,将基于扩散的想象引导至具有高影响力且合理的结果,从而增强视频世界模型,实现鲁棒的策略评估与改进。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模
Qwen-RobotWorld是一个语言条件视频世界模型,利用双流扩散变换器和860万视频-文本语料库,预测多个机器人领域的未来视觉轨迹。它统一了机器人操作、自动驾驶、室内导航和人机迁移的具身世界建模,在EWMBench和DreamGen Bench上取得了顶尖基准成绩。
DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。