@rsasaki0109: PriorEye: 端到端自动驾驶中的地理空间视觉先验 ECCV 2026 https://github.com/ori-mrg/PriorEye… Mos…

X AI KOLs Timeline 论文

摘要

PriorEye 为端到端自动驾驶引入了地理空间视觉先验,通过双重记忆架构增强了预见性和鲁棒性,如在 ECCV 2026 上所展示。

PriorEye: 端到端自动驾驶中的地理空间视觉先验 ECCV 2026 https://github.com/ori-mrg/PriorEye… 大多数端到端自动驾驶方法仅依赖于瞬时传感器观测,这限制了它们只能做出反应性行为,而缺乏人类驾驶员通过先前经验所运用的预见性洞察。我们引入了地理空间视觉先验,即锚定于预定驾驶路线的街道级视觉上下文,提供独立于实时传感器的视觉空间预见性。我们提出一个记忆增强模块,具有双重记忆架构和自适应记忆门控,可以轻松集成到现有的端到端方法中。该设计将用于检索先验的上下文记忆与持久的回退记忆配对,并基于当前状态兼容性动态调节记忆的影响。在 NAVSIM-v2 基准测试上评估,我们的方法在各种端到端基线上持续提高了性能。此外,由于这些先验独立于车载传感器,我们的方法固有地提高了对传感器损坏的鲁棒性,而双重记忆设计确保在检索到的先验本身变得不可靠时能够安全回退。
查看原文
查看缓存全文

缓存时间: 2026/08/24 01:45

🎉 ECCV 2026 Spotlight 🎉

相似文章

PixelEyes:解耦感知与推理,实现精准视觉证据搜寻

Hugging Face Daily Papers

PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。

先见后码:面向空间感知的教育动画生成中的视觉先验学习

arXiv cs.AI

本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。

表征先于像素:语义引导的分层视频预测

Hugging Face Daily Papers

Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。