Geo-Align: 基于度量几何奖励的视频生成对齐
摘要
Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - Geo-Align:通过度量几何奖励实现视频生成对齐
来源:https://huggingface.co/papers/2605.23903
摘要
Geo-Align 提出了一种用于相机控制视频重新渲染的强化学习框架,通过尺度感知感知奖励和用于相机轨迹提取的度量3D估计来提升泛化能力。
近年来,相机控制视频生成取得了显著进展。然而,现有的视频到视频重新渲染方法主要依赖于使用合成数据集(https://huggingface.co/papers?q=synthetic%20datasets)的监督微调(https://huggingface.co/papers?q=Supervised%20Fine-Tuning)。目前,同步的多视角真实世界视频数据(https://huggingface.co/papers?q=real-world%20video%20data)极度匮乏。因此,主流范式在处理分布外的真实世界视频时泛化能力往往有限,模型难以准确遵循物理尺度和相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)。为填补这一空白,我们提出了 Geo-Align,这是首个专门为相机控制视频重新渲染(https://huggingface.co/papers?q=camera-controlled%20video%20re-rendering)设计的强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning)框架。基于预训练模型(https://huggingface.co/papers?q=pretrained%20model),我们通过一种尺度感知感知奖励(https://huggingface.co/papers?q=scale-aware%20perceptual%20reward)机制来优化模型。具体而言,我们引入了一个度量3D估计器(https://huggingface.co/papers?q=metric%203D%20estimator)来从生成的视频中提取精确的相机轨迹(https://huggingface.co/papers?q=camera%20trajectories),并显式惩罚旋转和平移中的偏差。此外,我们精心设计了一种基于真实世界条件视频和源自合成数据的目标相机轨迹(https://huggingface.co/papers?q=camera%20trajectories)的数据管道策略(https://huggingface.co/papers?q=data%20pipeline%20strategy),从而消除对配对数据的依赖。大量实验表明,Geo-Align 在精确的相机可控性和视觉保真度方面始终优于现有的监督学习基线,验证了我们方法的有效性。
查看 arXiv 页面(https://arxiv.org/abs/2605.23903)查看 PDF(https://arxiv.org/pdf/2605.23903)项目页面(https://lizizun.github.io/geo-align-page/)GitHub3(https://github.com/LiZizun/GeoAlign)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23903)
在你的 agent 中获取此论文:
hf papers read 2605\.23903
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.23903 即可从本页链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。
相似文章
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
迈向一致视频几何估计
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。
MVTrack4Gen:多视角点跟踪作为4D视频生成的几何监督
MVTrack4Gen提出了一种训练框架,利用多视角点跟踪作为几何监督来增强运动感知扩散模型,在从单目视频生成新视角视频中实现了最先进的几何一致性和运动保真度。
PhyMotion: 面向物理驱动人体视频生成的结构化3D运动奖励
PhyMotion 提出一种基于物理的奖励系统,评估生成视频中人体运动的运动学合理性、接触一致性和动态可行性,与人类判断具有更强的相关性,并在基于强化学习的后训练中提升运动真实感。
面向序列观测的轨迹感知跨视角地理定位
提出了SeqGeo-VL数据集和TrajLoc框架,用于基于序列观测(视频片段或路径描述)的轨迹感知跨视角地理定位,在性能上显著优于现有方法。