面向AV2 2026场景挖掘挑战赛的AutoMine解决方案
摘要
AutoMine是一种强大的自优化场景挖掘方法,利用LLM和VLM从自动驾驶日志中挖掘高价值场景,在CVPR 2026的Argoverse 2场景挖掘竞赛中取得了最高分数。
arXiv:2606.11874v1 公告类型:新
摘要:随着自动驾驶系统的发展,从大规模驾驶日志中挖掘高价值、安全关键且与规划相关的场景对于数据驱动的评估变得至关重要。在本文中,我们提出AutoMine,一种基于LLM和VLM的鲁棒自优化场景挖掘方法。AutoMine使用语义保持的提示增强来降低LLM提示敏感性,结合鲁棒的轨迹原子函数和基于VLM的函数来处理感知噪声和开放世界视觉线索,并通过真实日志的执行反馈来优化生成的代码。在CVPR 2026的Argoverse 2场景挖掘竞赛中,AutoMine获得了36.38的HOTA-Temporal分数和77.21的Timestamp BA分数。
查看缓存全文
缓存时间: 2026/06/11 13:49
# AV2 2026 场景挖掘挑战的 AutoMine 解决方案
来源:https://arxiv.org/html/2606.11874
宋良 Cao¹,² 赵杰乐¹¹¹footnotemark:1 王雨茹¹ 李浩¹ 刘大奇¹ 张泽涵¹ 李方正¹²²footnotemark:2 王宇 张悦 王冰¹ 陈光¹ 陆昊² 叶杭俊¹ ¹小米汽车²华中科技大学
###### 摘要
随着自动驾驶系统的发展,从大规模驾驶日志中挖掘高价值、安全关键且规划相关的场景已成为数据驱动评估的关键。本文提出 **AutoMine**,一种基于 LLM 和 VLM 的鲁棒自优化场景挖掘方法。AutoMine 使用语义保持的提示增强来降低 LLM 对提示的敏感性,结合鲁棒的轨迹原子函数与基于 VLM 的函数来处理感知噪声和开放世界视觉线索,并通过真实日志的执行反馈优化生成的代码。在 CVPR 2026 的 Argoverse 2 场景挖掘挑战赛中,AutoMine 取得了 **36.38** 的 HOTA-时间得分和 **77.21** 的时间戳 BA 得分。
## 1 引言
自动驾驶数据集包含大量传感器日志,但罕见且安全关键的事件仍然稀疏。场景挖掘通过检索与自然语言描述匹配的日志、时间戳和 3D 智能体,实现有针对性的评估。
这项任务具有挑战性,因为查询措辞需要精确、预测轨迹存在噪声,且某些场景需要超出 3D 轨迹的视觉证据。例如,“通过”和“超车”可能隐含不同条件,而轨迹可能包含缺失检测、航向噪声、碎片化和 ID 切换。
LLM 和 VLM 的快速发展为场景挖掘带来了新的可能性。RefProg [1] 表明,LLM 可以将自然语言描述翻译为可组合的原子函数调用,用于可解释的基于轨迹的挖掘。然而,手动指定的原子函数很难扩展到开放世界视觉概念。此外,一次性生成的代码在 LLM 误解提示、选错类别、颠倒关系或施加错误约束时可能会失败;这与先前关于 LLM 对语义保持的提示设计选择敏感性的发现一致 [3]。
我们提出 **AutoMine**,一个多模态场景挖掘框架,通过语义保持的提示增强、鲁棒的原子函数、基于 VLM 的视觉函数、感知后处理和执行驱动的自我优化来强化 LLM 生成的程序。AutoMine 在真实日志上执行生成的代码,总结观察到的输出,并利用反馈修复系统性错误,提高了对语言歧义和感知噪声的鲁棒性。
参见图注 图 1:\(a\):AutoMine 框架概览,采用双路径设计(感知 + 语言)。\(b\):语义保持的提示增强。\(c\):执行驱动的自我优化循环。
## 2 方法
### 2.1 概览
给定自然语言描述、驾驶日志和传感器数据,AutoMine 输出所引用的智能体和有效时间戳。如图 1 所示,AutoMine 首先优化感知轨迹,然后结合语义保持的提示增强、LLM 生成的原子函数、在轨迹、地图和图像上的多模态执行,以及基于执行反馈的代码优化。下面几节描述每个模块。
### 2.2 轨迹优化
AutoMine 使用 Le3DE2E [5] 的检测与跟踪结果作为初始轨迹输入。尽管这些结果提供了强大的 3D 轨迹,但我们观察到 ID 切换、碎片化轨迹、缺失检测、假阳性和重复框,这些直接影响时间定位和引用智能体的选择。
受 Immortal Tracker [4] 启发,我们保持短未匹配轨迹段存活而不是立即终止,并使用空间、时间、类别和尺寸一致性重新连接兼容的片段。我们还应用反向跟踪来恢复早期片段,这些片段更容易从后续帧中关联。此外,我们使用 Qwen3.5-27B [2] 的地面化能力验证相机视图中的投影框,并移除额外的假阳性。这种轨迹优化改善了轨迹连续性,为下游原子函数提供了更可靠的输入。
### 2.3 语义保持的提示增强
如上所述,先前工作表明 LLM 对提示措辞和格式敏感 [3],我们在生成场景挖掘代码时也观察到同样问题。为了减少这种不稳定性,AutoMine 在代码生成前增强自然语言场景描述。
增强被限制为保持原始语义,而不是自由改写查询。改写提示明确要求保持所有实体、类别、数量、方向、道路上下文、时空关系、数值和引用目标不变。它也禁止不安全的替换,例如“通过”≠“超车”、“刹车”≠“减速”、“变道”≠“并线”、“停止”≠“停车”,以及“附近”≠“旁边”。为了避免误导 LLM 对引用对象、相关对象和关系方向的判断,我们还施加约束,防止主客体互换、将引用智能体降级为修饰语、改变类别粒度或引入模糊代词。我们还限制改写长度,以防止引入冗余形容词或额外背景。
### 2.4 鲁棒的基于轨迹的原子函数
AutoMine 将场景逻辑表示为原子函数的组合,这些函数作用于轨迹、自车位姿、地图和时间窗口。由于预测轨迹存在噪声,我们重构运动和关系函数,使用时间聚合的证据而不是脆弱的单帧测量。方向和空间关系在多个有效帧上评估,采用宽松的连续性检查和自车相关几何。
我们还扩展了库,以涵盖基线函数未覆盖的以规划为中心的行为,包括 U 型转弯、三点转弯、侧方停车、特殊停车行为、物体交互和地图感知的道路约束。我们使用 LLM 对所有描述进行聚类,以识别缺失的函数类别,然后手动修订并实现最终函数集。
### 2.5 VLM 增强的原子函数
某些场景需要超出 3D 轨迹和地图的视觉证据。因此,AutoMine 提供 VLM 增强的原子函数,用于细粒度的物体类型、视觉属性、环境、路面、区域、行人动作、交通灯、遮挡和附着物体。我们使用 Qwen3.5-27B [2] 作为所有视觉推理调用的底层视觉语言模型。
对于候选智能体的视觉推理,我们收集候选出现的所有相机视图,并在原始图像上绘制投影的 3D 框而不是裁剪,从而在投影噪声下保留上下文。对于环境级条件,我们使用代表性的前视图图像,因为每个日志很短且环境通常稳定。对于道路和区域条件,我们将候选可见帧拼接成一个面板,并标注相机名称和时间戳索引,VLM 返回有效时间戳。与自车相关的视觉函数使用单独的提示,因为自车不由普通的投影物体框表示。
VLM 增强的函数库包括表 1 中的函数。这些函数使 AutoMine 能够保持符号程序执行的优点,同时将覆盖范围扩展到开放世界视觉概念。
表 1:VLM 增强的原子函数。
### 2.6 执行驱动的自我优化
LLM 生成的挖掘代码通常以系统性的方式失败,例如选择错误的引用类别、颠倒关系函数的参数、缺少 `reverse_relationship`、使用过于严格的阈值,或误判前/后和左/右几何。由于这些错误仅从代码中难以识别,AutoMine 使用真实执行的反馈优化代码。
在每一轮中,代码生成器生成场景挖掘代码,执行器在最多 `max_logs` 个日志上运行,使用轨迹和 VLM 原子函数。AutoMine 然后总结代码检索到的内容,包括每个轨迹的类别、时间覆盖范围、尺寸、自车-物体几何,以及跨日志统计信息,如引用类别分布、空日志比例和关联物体分布。这些诊断暴露了类别混淆、噪声短轨迹、过度约束逻辑和关系方向错误。
下一个优化提示包括原始描述、函数库、类别定义、先前代码、结构化反馈,以及来自 `REFERRED_DICT` 的引用类别作为硬性约束。如果反馈一致,LLM 保持代码不变;否则,它修复函数选择、参数顺序、反向关系、阈值、类别过滤器或空间推理。这形成了一个基于执行的自我优化循环。
表 2:在 Argoverse 2 验证集上的消融结果。表 3:AV2 2026 场景挖掘挑战赛在 HOTA-时间赛道上的官方排行榜结果。
## 3 实验
### 3.1 数据集与评估指标
我们在 CVPR 2026 Argoverse 2 场景挖掘挑战赛的官方基准上进行实验。该基准基于 Argoverse 2 传感器数据集 [6],包含 1000 个驾驶日志(700 个训练、150 个验证、150 个测试),总计约 4.2 小时的驾驶数据。每个日志持续约 15 秒。传感器套件包括两个 32 线激光雷达(10 Hz)、九个全局快门相机(20 fps)、高清地图和六自由度自车姿态。数据集提供 10,000 个以规划为中心的自然语言查询。评估指标如下:
**HOTA-时间**(↑)。主要排名指标,仅在场景描述成立的时间窗口上计算。对于每个提示,预测按类别和每个提示的置信度阈值(从 10 个基于召回率的候选中选择)进行过滤,并使用中心距离相似度(零距离 = 2 米)计算标准 HOTA 得分。HOTA 联合衡量检测和关联质量:
\[
\left\{
\begin{aligned}
&\text{HOTA}_{\alpha} = \sqrt{\text{DetA}_{\alpha} \cdot \text{AssA}_{\alpha}},\\
&\text{HOTA} = \frac{1}{|A|} \sum_{\alpha \in A} \text{HOTA}_{\alpha},
\end{aligned}
\right.
\]
其中 \(A = \{0.05, 0.10, \dots, 0.95\}\) 是定位阈值集合,DetA 和 AssA 分别表示检测和关联准确性。每个提示的最终得分是 10 个候选阈值上的最大 HOTA。
**HOTA-轨迹**(↑)。与 HOTA-时间相同,不同之处在于序列中任何曾被标记为 `REFERRED_OBJECT` 的轨迹在其所有帧中都被视为被引用。这评估了引用轨迹的完整生命周期,而不仅仅是描述有效区间。
**时间戳 BA**(↑)。一个帧级检索指标,询问每个时间戳中是否存在任何被引用对象,与定位无关。使用 HOTA-时间的最优阈值,每帧被分类为正例当且仅当它包含至少一个 `REFERRED_OBJECT`。对于每个提示,我们聚合帧级的 TP/FP/TN/FN 并计算平衡准确率:
\[
\text{Timestamp BA} = \frac{1}{2} \left( \frac{\text{TP}}{\text{TP} + \text{FN}} + \frac{\text{TN}}{\text{TN} + \text{FP}} \right).
\]
**日志 BA**(↑)。时间戳 BA 的日志级对应。一个 \((\text{log}, \text{prompt})\) 序列是正例当且仅当任何帧包含被引用对象。BA 然后使用与上述相同的公式在所有序列上计算。
### 3.2 消融研究
为了验证 AutoMine 中每个设计的贡献,我们在验证集上进行消融研究,使用公开可用的 Le3DE2E [5] 轨迹作为初始输入。我们首先在单查询基线设置下比较三种最先进的 LLM,并采用 Claude-Sonnet-4.6 作为默认代码生成器,因为它在关系参数排序和细粒度类别选择上最为稳定。对于所有 VLM 增强的原子函数,我们使用 Qwen3.5-27B [2] 作为底层视觉语言模型。然后我们在此基线基础上逐步添加每个组件。结果见表 2。
我们观察到,每个组件通过截然不同的机制改进系统,而不是简单地均匀提升所有指标。轨迹优化带来的 HOTA-轨迹增益远大于 HOTA-时间增益,表明重新连接碎片化轨迹段主要延长了已正确引用的对象的生命周期,而不是扩大新场景的时间窗口。原子函数优化带来了最大的单次跳跃,因为时间聚合的关系谓词吸收了方向查询上的逐帧航向噪声,而 VLM 增强的函数覆盖了仅从 3D 框无法观察到的属性(例如,交通灯状态、路面、附着货物);两者在很大程度上互补,并在不同的查询子集上失败。
执行驱动的自我优化通过修复我们在第 0 轮代码中观察到的三种重复错误模式进一步改进了所有指标:缺少 `reverse_relationship` 调用、产生零候选的过度严格阈值,以及根据 `REFERRED_DICT` 捕获的错误引用类别。语义保持的提示增强在原始基线上仅带来边际增益,但一旦堆叠到优化后的流程上就变得有效,因为它减少了语义等价改写之间的提示诱导方差,而不是引入新能力——当下游流程已经强大时,这种效果自然会被放大。
### 3.3 排行榜结果
我们的最终提交 AutoMine 在 CVPR 2026 Argoverse 2 场景挖掘挑战赛的测试集上取得了优秀结果。表 3 显示了按主要指标 HOTA-时间排序的排行榜:我们在 **36.38** 的得分下排名 **第3**,HOTA-轨迹得分为 49.32。表 4 显示了按时间戳 BA 排序的排行榜:我们以 **77.21** 得分排名 **第1**,展示了 AutoMine 在时间定位准确性上的优势。
表 4:AV2 2026 场景挖掘挑战赛在时间戳 BA 赛道上的官方排行榜结果。
## 4 结论
在本报告中,我们介绍了 **AutoMine**,一个针对 AV2 2026 场景挖掘挑战赛的鲁棒多模态场景挖掘框架。AutoMine 解决了自然语言驱动场景挖掘中的几个关键挑战,包括 LLM 提示敏感性、噪声和碎片化的感知轨迹、模糊的时空关系,以及无法仅通过 3D 轨迹捕获的开放世界视觉概念。为此,AutoMine 优化原始轨迹,应用语义保持的提示增强,构建鲁棒的基于轨迹和 VLM 增强的原子函数,并进一步改进代码。相似文章
Sim2Schedule:一种模拟器引导的LLM框架,用于自主露天矿调度
本文介绍Sim2Schedule,一种由模拟器引导的LLM框架,用于自主露天矿调度。该框架在计算时间线性扩展的情况下,能达到MILP最优净现值的94%-99%,且无需微调即可零样本运行。
AutoDev:自动化 AI 驱动开发
AutoDev 是一个由 AI 驱动的软件开框架,能够在安全的 Docker 环境中自动化执行复杂的工程任务,例如代码和测试生成。它通过实现复杂软件工程任务的自主规划和执行,在 HumanEval 数据集上取得了高性能表现。
Chat2Scenic:一种基于迭代RAG的自动驾驶场景生成框架
Chat2Scenic是一种基于迭代RAG的框架,能够从法规描述中生成可执行的领域特定语言场景脚本,用于自动驾驶测试,实现了76.42%的编译成功率,优于现有方法。
基于真实世界故障记录的自动驾驶系统测试场景生成
本文提出了一种模块化的LLM流水线,利用历史故障记录(例如NHTSA碰撞数据)生成多样化的自动驾驶系统测试场景,从而在有限的测试预算内实现有效的故障发现。
Procgen 和 MineRL 竞赛
OpenAI 联合组织 MineRL 2020 竞赛,推进样本高效的强化学习算法研究,这些算法能够利用人类示范。参赛者需要在仅有 800 万个模拟器样本和 4 天单 GPU 训练时间的限制下,在 Minecraft 中获得钻石,同时可以访问 6000 多万帧的人类示范数据集。