自动驾驶 VLM 中用于可验证推理的未来轨迹延迟暴露
摘要
介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - 自动驾驶 VLM 中可验证推理的未来轨迹延迟暴露
来源:https://huggingface.co/papers/2608.01755 发布于 8 月 3 日
·
提交者 https://huggingface.co/hzxllll
hzx (https://huggingface.co/hzxllll) 于 8 月 4 日
摘要
近年来,用于自动驾驶(AD)的视觉-语言-动作(VLA)模型日益利用思维链(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,然而现有的标注流程通常让教师模型接触到记录的基真(GT)未来轨迹。我们通过实验证明,这会导致轨迹锚定偏差:教师模型倾向于为已揭示的结果进行合理化解释,而非从场景证据中推断决策,从而生成因果保真度较低的 CoT,并产生严重得多的幻觉,尤其是在具有因果挑战的场景中。移除 GT 轨迹可以消除这一捷径,但开放式轨迹生成会将高层决策与精确的几何合成和低层动力学纠缠在一起。为了在不要求开放式轨迹合成的情况下使轨迹级驾驶决策可验证,我们提出了自动驾驶多项选择题(AD-MCQ),将规划建模为在显式轨迹候选项中进行选择。更进一步,我们提出了面向 RLVR 的未来轨迹延迟暴露(DEFT-RLVR),将未来轨迹从决策前锚点转变为决策后验证目标。实验结果表明,DEFT-RLVR 提升了 AD 推理能力,同时保持甚至增强了通用视觉能力。借助纯 VLM 推理和通过候选构造实现的可控难度,AD-MCQ 为未来可验证 AD 推理研究提供了灵活、可伸缩且可扩展的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01755) 查看 PDF (https://arxiv.org/pdf/2608.01755) GitHub0 (https://github.com/hzx122/DEFT-RLVR) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01755)
在您的代理中获取此论文:
hf papers read 2608\.01755
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
hzxllll/DEFT-RLVR-model-HF Image-Text-to-Text • 9B • 更新于约 3 小时前 (https://huggingface.co/hzxllll/DEFT-RLVR-model-HF)
引用此论文的数据集 1
hzxllll/AD-MCQ Viewer • 更新于约 3 小时前 • 5.5k • 7 (https://huggingface.co/datasets/hzxllll/AD-MCQ)
引用此论文的 Spaces 0
没有关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.01755,即可从此页面关联它。
包含此论文的收藏 0
没有包含此论文的收藏
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中,即可从此页面关联它。
相似文章
Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs
介绍了Neuro-Symbolic Drive,一个使用来自经典规划器的基于规则推理轨迹来微调驾驶VLA(Qwen3.5-4B)的框架,与标准CoT推理相比,显著降低了平均位移误差和漏检率。
揭示VLM可解释的故障模式
本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。
LIDAR-AD:一种用于自动驾驶的无解码器潜在交互Dreamer与动作残差链
LIDAR-AD提出了一种用于自动驾驶的无解码器潜在交互世界模型,通过减少冗余的潜在对齐和残差动作更新,改进了风险感知的状态抽象和长时域动态预测,在模拟和真实场景中优于基线世界模型。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。