闭环:无训练的自回归生成渲染重访一致性

Hugging Face Daily Papers 论文

摘要

本文介绍了一种无训练的方法,通过利用3D引擎提供的时空对应,在相机重访位置时保持外观一致性,从而改进自回归生成渲染中的重访一致性。

最近的条件视频生成模型展示了将3D引擎渲染(如深度图和无纹理几何)转化为照片级真实感视频的潜力,用于游戏和沉浸式内容创作。这些应用需要长程自回归生成,连续合成新帧同时保持持久的3D世界。自回归生成器使用有界的KV缓存逐块合成视频,因此当相机在其上下文被驱逐后重访某一位置时,即使条件渲染(如深度)与底层几何保持完美对齐,模型也常常会生成不一致的外观。我们通过利用3D引擎已经提供的对应来解决这种重访不一致性,无需任何后训练:时间对应将姿态匹配的历史潜在块作为闭环记忆检索到KV缓存中,而来自相机姿态和深度重投影的空间对应则将token级别的注意力偏向检索块中的几何对应区域。我们在从TartanAir和TartanGround数据集中挖掘的闭环轨迹上演示了我们的方法,以模拟复杂的真实应用场景,该方法在重访一致性上优于现有的无训练基线,且不损失整体视频质量。项目页面:https://wenchao-m.github.io/ClosetheLoop.github.io/
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - 闭环:无需训练的自回归生成渲染重访一致性

来源:https://huggingface.co/papers/2607.21848

摘要

近期条件视频生成模型展示出了将三维引擎渲染(如深度图和无纹理几何体)转化为游戏和沉浸式内容创作所需的逼真视频的潜力。这些应用需要长视界自回归生成,即在连续合成新帧的同时保持持久的三维世界。自回归生成器通过有界的KV缓存逐块合成视频,因此当相机在其上下文被驱逐后重新访问某个位置时,即使条件渲染(例如深度)仍与底层几何体完美对齐,模型往往也会生成不一致的外观。我们通过利用三维引擎已提供的对应关系来解决这种重访不一致性,且无需任何后训练:时间对应关系将姿态匹配的历史潜在块作为闭环记忆检索到KV缓存中,而相机姿态和深度重投影的空间对应关系则使词元级注意力偏向检索块中几何对应的区域。我们在从TartanAir和TartanGround数据集中挖掘的闭环轨迹上演示了我们的方法,以模拟复杂的真实应用场景,该方法在重访一致性上优于现有的无训练基线,且不损失整体视频质量。项目页面:https://wenchao-m.github.io/ClosetheLoop.github.io/

查看 arXiv 页面 (https://arxiv.org/abs/2607.21848) 查看 PDF (https://arxiv.org/pdf/2607.21848) 项目页面 (https://wenchao-m.github.io/ClosetheLoop.github.io/#) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21848)

在你的代理中获取这篇论文:

hf papers read 2607.21848

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接该论文

请在模型 README.md 中引用 arxiv.org/abs/2607.21848 以在此页面中链接。

引用该论文的数据集0

没有数据集链接该论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.21848 以在此页面中链接。

引用该论文的 Spaces0

没有 Space 链接该论文

请在 Space README.md 中引用 arxiv.org/abs/2607.21848 以在此页面中链接。

包含该论文的收藏集0

没有收藏集包含该论文

请将该论文添加到收藏集 (https://huggingface.co/new-collection) 以在此页面中链接。

相似文章

GenRecon:结合生成先验的多视图3D场景重建

Hugging Face Daily Papers

GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。

一致性模型

OpenAI Blog

OpenAI 推出一致性模型,这是一类新的生成模型,通过直接将噪声映射到数据,支持快速单步图像生成,同时支持多步采样和零次学习编辑任务(如图像修复和超分辨率)。该方法在 CIFAR-10 和 ImageNet 64x64 上的单步生成中实现了最先进的 FID 分数。

将3D生成模型用于自回归布局生成

Hugging Face Daily Papers

LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。

改进的一致性模型训练技术

OpenAI Blog

OpenAI 展示了改进的一致性模型训练技术,无需蒸馏即可实现高质量单步图像生成,通过新型损失函数和训练策略在 CIFAR-10 和 ImageNet 64×64 上取得显著的 FID 改进。