CityRAG:基于空间锚定的视频生成,步入真实城市
摘要
CityRAG 提出一种视频生成模型,利用地理注册数据生成长时、物理一致、3D 连贯的真实城市视频,为机器人与自动驾驶提供可导航、可仿真的逼真环境。
查看缓存全文
缓存时间: 2026/04/22 14:41
论文页面 - CityRAG:通过空间锚定的视频生成步入一座城市
来源:https://huggingface.co/papers/2604.19741
摘要
CityRAG 生成长时、物理一致的视频序列,保持环境连贯性,并支持在真实地理环境中复杂导航,其上下文使用地理配准数据。
我们致力于生成一个 3D 一致、可导航且空间锚定的环境:对真实地点的仿真。现有的视频生成模型(https://huggingface.co/papers?q=video%20generative%20models)能够产生与文本(T2V)或图像(I2V)提示相符的合理序列,但在任意天气与动态物体配置下重建真实世界的能力,对自动驾驶与机器人仿真等下游应用至关重要。为此,我们提出 CityRAG,一种视频生成模型,它利用大规模地理配准数据(https://huggingface.co/papers?q=geo-registered%20data)作为上下文,把生成锚定到物理场景,同时保留对复杂运动和外观变化的先验。CityRAG 采用时间未对齐的训练数据,使模型语义上将基础场景与其瞬时属性解耦。实验表明,CityRAG 可生成连贯、数分钟级、物理一致的视频序列,在数千帧内保持天气与光照条件,实现闭环(https://huggingface.co/papers?q=loop%20closure),并沿复杂轨迹导航以重建真实地理。
查看 arXiv 页面(https://arxiv.org/abs/2604.19741)
查看 PDF(https://arxiv.org/pdf/2604.19741)
项目主页(https://cityrag.github.io/)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.19741)
在智能体中阅读该论文:
hf papers read 2604.19741
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用
在模型 README.md 中引用 arxiv.org/abs/2604.19741,即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用
在数据集 README.md 中引用 arxiv.org/abs/2604.19741,即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用
在 Space README.md 中引用 arxiv.org/abs/2604.19741,即可在此页面显示链接。
包含该论文的收藏 0
暂无收藏包含
将该论文添加到收藏(https://huggingface.co/new-collection),即可在此页面显示链接。
相似文章
WildCity: 一个真实世界城市规模的渲染、仿真与空间智能测试平台
WildCity 引入了由自动驾驶车队收集的大规模多模态数据集,用于城市规模的导航与空间表征。该数据集包含 18 条长轨迹,并建立了重建与闭环仿真的基线,以推动能够感知和推理城市规模环境的 AI 系统发展。
360CityArena:面向具身智能体的逼真虚拟城市导航基准
360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。
LongLive-RAG:一种通用的检索增强长视频生成框架
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。
Sat3DGen:基于单张卫星图像的全面街景级3D场景生成
Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。
重新思考长视频中的RAG:检索什么以及如何使用?
本文介绍了V-RAGBench,一个用于评估长自我中心视频中检索增强生成的基准,以及CARVE,一种自适应地为每个片段选择检索配置以提升VideoRAG性能的方法。