Geo-Align: 基于度量几何奖励的视频生成对齐

Hugging Face Daily Papers 论文

摘要

Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。

近年来,相机可控视频生成取得了显著进展。然而,现有的视频到视频重新渲染方法主要依赖于使用合成数据集进行监督微调。目前,同步的多视角真实世界视频数据极为稀缺。因此,当处理分布外的真实世界视频时,当前主流范式通常表现出有限的泛化能力,模型难以准确遵循物理尺度和相机轨迹。为了弥补这一差距,我们提出了 Geo-Align,这是首个专门为相机可控视频重新渲染设计的强化学习框架。在预训练模型的基础上,我们通过尺度感知的感知奖励机制来优化模型。具体而言,我们引入了一个度量三维估计器,从生成的视频中提取精确的相机轨迹,并明确惩罚旋转和平移中的偏差。此外,我们精心设计了一种基于真实世界条件视频和从合成数据导出的目标相机轨迹的数据管道策略,消除了对配对数据的依赖。大量实验表明,Geo-Align 在精确的相机可控性和视觉保真度方面均持续优于现有的监督学习基线,证明了我们方法的有效性。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - Geo-Align:通过度量几何奖励实现视频生成对齐

来源:https://huggingface.co/papers/2605.23903

摘要

Geo-Align 提出了一种用于相机控制视频重新渲染的强化学习框架,通过尺度感知感知奖励和用于相机轨迹提取的度量3D估计来提升泛化能力。

近年来,相机控制视频生成取得了显著进展。然而,现有的视频到视频重新渲染方法主要依赖于使用合成数据集(https://huggingface.co/papers?q=synthetic%20datasets)的监督微调(https://huggingface.co/papers?q=Supervised%20Fine-Tuning)。目前,同步的多视角真实世界视频数据(https://huggingface.co/papers?q=real-world%20video%20data)极度匮乏。因此,主流范式在处理分布外的真实世界视频时泛化能力往往有限,模型难以准确遵循物理尺度和相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)。为填补这一空白,我们提出了 Geo-Align,这是首个专门为相机控制视频重新渲染(https://huggingface.co/papers?q=camera-controlled%20video%20re-rendering)设计的强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning)框架。基于预训练模型(https://huggingface.co/papers?q=pretrained%20model),我们通过一种尺度感知感知奖励(https://huggingface.co/papers?q=scale-aware%20perceptual%20reward)机制来优化模型。具体而言,我们引入了一个度量3D估计器(https://huggingface.co/papers?q=metric%203D%20estimator)来从生成的视频中提取精确的相机轨迹(https://huggingface.co/papers?q=camera%20trajectories),并显式惩罚旋转和平移中的偏差。此外,我们精心设计了一种基于真实世界条件视频和源自合成数据的目标相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)的数据管道策略(https://huggingface.co/papers?q=data%20pipeline%20strategy),从而消除对配对数据的依赖。大量实验表明,Geo-Align 在精确的相机可控性和视觉保真度方面始终优于现有的监督学习基线,验证了我们方法的有效性。

查看 arXiv 页面(https://arxiv.org/abs/2605.23903)查看 PDF(https://arxiv.org/pdf/2605.23903)项目页面(https://lizizun.github.io/geo-align-page/)GitHub3(https://github.com/LiZizun/GeoAlign)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23903)

在你的 agent 中获取此论文:

hf papers read 2605\.23903

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。

相似文章

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。