@rsasaki0109: PriorEye: 端到端自动驾驶中的地理空间视觉先验 ECCV 2026 https://github.com/ori-mrg/PriorEye… Mos…
摘要
PriorEye 为端到端自动驾驶引入了地理空间视觉先验,通过双重记忆架构增强了预见性和鲁棒性,如在 ECCV 2026 上所展示。
PriorEye: 端到端自动驾驶中的地理空间视觉先验 ECCV 2026 https://github.com/ori-mrg/PriorEye… 大多数端到端自动驾驶方法仅依赖于瞬时传感器观测,这限制了它们只能做出反应性行为,而缺乏人类驾驶员通过先前经验所运用的预见性洞察。我们引入了地理空间视觉先验,即锚定于预定驾驶路线的街道级视觉上下文,提供独立于实时传感器的视觉空间预见性。我们提出一个记忆增强模块,具有双重记忆架构和自适应记忆门控,可以轻松集成到现有的端到端方法中。该设计将用于检索先验的上下文记忆与持久的回退记忆配对,并基于当前状态兼容性动态调节记忆的影响。在 NAVSIM-v2 基准测试上评估,我们的方法在各种端到端基线上持续提高了性能。此外,由于这些先验独立于车载传感器,我们的方法固有地提高了对传感器损坏的鲁棒性,而双重记忆设计确保在检索到的先验本身变得不可靠时能够安全回退。
查看缓存全文
缓存时间: 2026/08/24 01:45
🎉 ECCV 2026 Spotlight 🎉
相似文章
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
PixelEyes:解耦感知与推理,实现精准视觉证据搜寻
PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。
先见后码:面向空间感知的教育动画生成中的视觉先验学习
本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。
表征先于像素:语义引导的分层视频预测
Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。
HyperEyes:面向并行多模态搜索代理的双粒度效率感知强化学习
HyperEyes 是一种并行多模态搜索代理,它利用双粒度强化学习来优化推理效率,与现有代理相比,在显著减少工具调用轮次的同时实现了更高的准确率。