层次化去噪用于多步视觉推理

Hugging Face Daily Papers 论文

摘要

HDR 是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步视觉推理。与基线方法相比,它实现了更好的推理一致性、更低的延迟和强大的数据效率。

视频模型正演变为视觉基础模型,但尚未具备类似人类的多步推理能力。流式自回归扩散模型效率高但推理能力有限,而双向扩散能够进行全局修正,但由于密集的帧级去噪导致推理成本高昂。这两种范式都难以在复杂推理任务中实现逻辑一致性和低延迟流式处理。我们提出了 HDR(Hierarchical Denoising for Visual Reasoning,视觉推理的层次化去噪),这是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步推理。HDR 将视频潜变量组织成树状层次结构,在流式输出之前实现从粗到细的推理。粗去噪层保留不确定的假设用于全局规划,而更精细的层则逐步将其细化为具体的视觉状态。稀疏层次化注意力模式(SHAP)进一步降低了时间注意力成本。我们引入了一个分层多步视频推理基准,包含分布外案例,涵盖六项任务:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子(Sokoban)和倒水。与流式自回归扩散基线相比,HDR 将成功率从 34.22 提升至 60.29(相对提升 76.2%),并将平均进度从 76.00 提升至 89.56,展示了更一致的推理轨迹。HDR 保持每个潜变量 0.70 秒的低延迟流式处理,推理速度比双向扩散快 54.2 倍。此外,仅使用 2% 的训练数据,HDR 就保留了全数据性能的 82.9%,而双向扩散仅为 52.0%。真实世界的机器人实验进一步证明了 HDR 在物理交互和世界建模方面的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:41

论文页面 - 面向多步视觉推理的分层去噪

来源:https://huggingface.co/papers/2607.15278 作者:

,

,

,

,

,

,

,

,

,

,

摘要

视频模型正逐步演化为视觉基础模型,但其仍缺乏类似人类的多步推理能力。流式自回归扩散模型效率高但推理能力有限,而双向扩散虽能实现全局修正,但因密集的帧级去噪导致推理成本高昂。这两种范式在处理复杂推理任务时均难以兼顾逻辑一致性与低延迟流式输出。我们提出HDR(面向视觉推理的分层去噪),一个将分层潜变量集成到因果视频生成中的统一框架,以支持多步推理。HDR将视频潜变量组织成树状层次结构,在流式输出之前实现从粗到细的推理。粗去噪层保留不确定性假设用于全局规划,而细粒度层则逐步将其精炼为具体视觉状态。稀疏分层注意力模式(SHAP)进一步降低了时间注意力成本。我们引入了一个层分层的多步视频推理基准(包含分布外案例),涵盖六项任务:迷宫导航、汉诺塔、一笔画、滑块拼图、推箱子及倒水问题。与流式自回归扩散基线相比,HDR将成功率从34.22提升至60.29(相对提升76.2%),并将平均进度从76.00提升至89.56,展示了更一致的推理轨迹。HDR保持低延迟流式输出(每个潜变量0.70秒),推理速度比双向扩散快54.2倍。在仅使用2%训练数据的情况下,HDR仍能保留82.9%的全数据性能,而双向扩散仅能保留52.0%。真实机器人实验进一步证明了HDR在物理交互和世界建模方面的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。

查看 arXiv 页面(https://arxiv.org/abs/2607.15278)查看 PDF(https://arxiv.org/pdf/2607.15278)项目页面(https://hierarchical-diffusion-reasoning.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.15278)

在您的代理中获取此论文:

hf papers read 2607.15278

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.15278 以从此页面链接。

引用该论文的数据集0

无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.15278 以从此页面链接。

引用该论文的 Spaces0

无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.15278 以从此页面链接。

包含该论文的收藏0

无收藏包含此论文

请将此论文添加到一个收藏(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

表征先于像素:语义引导的分层视频预测

Hugging Face Daily Papers

Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。