自动驾驶 VLM 中用于可验证推理的未来轨迹延迟暴露

Hugging Face Daily Papers 论文

摘要

介绍了 AD-MCQ 和 DEFT-RLVR,一种用于自动驾驶 VLM 可验证推理的方法,将未来轨迹暴露延迟到决策后验证,从而提高推理忠实度并减少幻觉。

近年来,用于自动驾驶(AD)的视觉-语言-动作(VLA)模型越来越多地利用思维链(CoT)监督来增强其视觉语言模型(VLM)组件的推理能力,然而现有的标注流程通常会让教师模型接触到记录在案的真实(GT)未来轨迹。我们通过实验表明,这会导致轨迹锚定偏差:教师模型会对已揭示的结果进行合理化解释,而不是从场景证据中推断决策,从而产生因果忠实度较低的 CoT,并在因果挑战性场景中产生明显更严重的幻觉。移除 GT 轨迹可以消除这一捷径,但开放式轨迹生成将高层决策与精确的几何合成和低层动态纠缠在一起。为了使轨迹级驾驶决策可验证而无需开放式轨迹合成,我们引入了自动驾驶多项选择题(AD-MCQ),将规划转化为在显式轨迹候选项中进行选择。更进一步,我们提出了用于 RLVR 的未来轨迹延迟暴露(DEFT-RLVR),将未来轨迹从决策前锚点转变为决策后验证目标。实验结果表明,DEFT-RLVR 改善了 AD 推理,同时保持甚至增强了通用视觉能力。凭借仅使用 VLM 的推理以及通过候选项构造实现的可控难度,AD-MCQ 为未来可验证 AD 推理研究提供了灵活、可扩展且可拓展的基础。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - 自动驾驶 VLM 中可验证推理的未来轨迹延迟暴露

来源:https://huggingface.co/papers/2608.01755 发布于 8 月 3 日

·

提交者 https://huggingface.co/hzxllll

hzx (https://huggingface.co/hzxllll) 于 8 月 4 日

摘要

近年来,用于自动驾驶(AD)的视觉-语言-动作(VLA)模型日益利用思维链(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,然而现有的标注流程通常让教师模型接触到记录的基真(GT)未来轨迹。我们通过实验证明,这会导致轨迹锚定偏差:教师模型倾向于为已揭示的结果进行合理化解释,而非从场景证据中推断决策,从而生成因果保真度较低的 CoT,并产生严重得多的幻觉,尤其是在具有因果挑战的场景中。移除 GT 轨迹可以消除这一捷径,但开放式轨迹生成会将高层决策与精确的几何合成和低层动力学纠缠在一起。为了在不要求开放式轨迹合成的情况下使轨迹级驾驶决策可验证,我们提出了自动驾驶多项选择题(AD-MCQ),将规划建模为在显式轨迹候选项中进行选择。更进一步,我们提出了面向 RLVR 的未来轨迹延迟暴露(DEFT-RLVR),将未来轨迹从决策前锚点转变为决策后验证目标。实验结果表明,DEFT-RLVR 提升了 AD 推理能力,同时保持甚至增强了通用视觉能力。借助纯 VLM 推理和通过候选构造实现的可控难度,AD-MCQ 为未来可验证 AD 推理研究提供了灵活、可伸缩且可扩展的基础。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01755) 查看 PDF (https://arxiv.org/pdf/2608.01755) GitHub0 (https://github.com/hzx122/DEFT-RLVR) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01755)

在您的代理中获取此论文:

hf papers read 2608\.01755

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 1

hzxllll/DEFT-RLVR-model-HF Image-Text-to-Text • 9B • 更新于约 3 小时前 (https://huggingface.co/hzxllll/DEFT-RLVR-model-HF)

引用此论文的数据集 1

hzxllll/AD-MCQ Viewer • 更新于约 3 小时前 • 5.5k • 7 (https://huggingface.co/datasets/hzxllll/AD-MCQ)

引用此论文的 Spaces 0

没有关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.01755,即可从此页面关联它。

包含此论文的收藏 0

没有包含此论文的收藏

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中,即可从此页面关联它。

相似文章

揭示VLM可解释的故障模式

arXiv cs.AI

本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。