CMU-Drive 与 V2V-VLA:基于推理基准和车对车视觉-语言-行动模型的协同多智能体统一驾驶

arXiv cs.AI 论文

摘要

介绍了 CMU-Drive,一个用于协同多智能体自动驾驶的闭环基准,以及 V2V-VLA,一个联合生成驾驶动作、路径点、推理和通信策略的视觉-语言-行动模型。这为协同 VLA 驾驶提供了首个基准和基线。

arXiv:2608.07621v1 公告类型:新 摘要:视觉-语言-行动(VLA)模型最近在端到端自动驾驶中取得了令人瞩目的性能,但现有方法主要针对单个自动驾驶智能体设计,对协同感知、推理和规划的支持有限。我们提出了带推理的协同多智能体统一驾驶(CMU-Drive),一个用于评估多辆网联自动驾驶汽车(CAV)在安全关键驾驶场景中与背景交通参与者协同运行的闭环端到端基准。我们进一步提出了车对车视觉-语言-行动(V2V-VLA),一种协同 VLA 模型,通过联合生成驾驶动作、未来路径点、语言推理和通信策略,将协同驾驶集成到单次前向传播中。在 CMU-Drive 上的实验为协同 VLA 驾驶建立了首个基准和基线,并为未来多智能体、闭环、端到端协同自动驾驶研究奠定了基础。我们的代码、基准和模型检查点将公开发布,以促进开源研究。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:02

# 协同多智能体统一驾驶:推理基准与车对车视觉-语言-动作模型

Source: https://arxiv.org/html/2608.07621
11卡内基梅隆大学,机器人研究所

###### 摘要

视觉-语言-动作(Vision-Language-Action, VLA)模型最近在端到端自动驾驶中取得了令人瞩目的性能,然而现有方法主要为单个自动驾驶智能体设计,对协同感知、推理和规划的支持有限。我们提出了Cooperative Multi-agent Unified Driving with Reasoning(CMU-Drive),一个用于在具有背景交通参与者的安全关键驾驶场景中评估多个网联自动驾驶车辆(Connected Autonomous Vehicles, CAVs)协同自动驾驶的闭环端到端基准。我们进一步提出了Vehicle-to-Vehicle Vision-Language-Action(V2V-VLA),一种协同VLA模型,通过在单次前向传播中联合生成驾驶动作、未来路径点、语言推理和通信策略,将协同驾驶整合为统一的过程。在CMU-Drive上的实验建立了协同VLA驾驶的首个基准和基线,并为未来多智能体、闭环、端到端协同自动驾驶研究奠定了基础。我们的代码、基准和模型检查点将公开发布,以促进开源研究。

## 1 引言

视觉-语言-动作(VLA)模型最近通过在端到端自动驾驶中联合执行视觉感知、语言推理和车辆控制,展示了强大的能力[Renz2025simlingo,jia2024bench,nvidia2025alpamayo,li2025spacedrive,zhou2025autovla,hwang2024emma,tian2024DriveVLM,hu2025vla4ad,xing2024openemma]。尽管现有VLA系统主要在单智能体环境中进行评估,协同自动驾驶[xu2023v2v4real,xiang2024v2xreal,luo2025mixed,zimmer2024tumtraf,coscoy2026mdrive,liu2025colmdriver,zhou2024v2xpnp,zhou2025turbotrain,zhao2025coopre,zhao2025quantv2x,cho2025cocoon,chiu2026v2vllm,chiu2026v2vgot]要求多个自动驾驶车辆在部分可观测条件下进行感知、推理和协调。这带来了一个新的挑战:使VLA模型能够主动从相邻车辆获取互补观测,同时保持高效的闭环驾驶。

现有基准和方法分别处理了这一问题的不同方面。Bench2Drive[jia2024bench]建立了针对单智能体端到端驾驶的全面闭环评估,覆盖了车辆、行人和自行车之间交互的多种城市场景;SimLingo[Renz2025simlingo]通过将驾驶、视觉-语言理解和语言-动作对齐统一到单个模型中,在该基准上取得了最先进的性能。CoLMDriver[liu2025colmdriver]通过构建InterDrive[liu2025colmdriver]基准,将端到端评估扩展到多智能体驾驶,所提出的模型使用基于LLM的多轮协商来解决冲突的驾驶意图。然而,该工作对包含背景交通参与者和弱势道路使用者的安全关键驾驶场景考虑较少。MDrive[coscoy2026mdrive]创建了智能体生成的交互场景,并进一步结合InterDrive[liu2025colmdriver]和V2X场景[zhou2024v2xpnp]进行协同驾驶评估,但主要对先前工作[liu2025colmdriver,liu2025toward]中的现有方法进行基准测试,没有为协同驾驶引入新模型或算法。此外,上述现有协同基准[liu2025colmdriver,coscoy2026mdrive]涉及的协同自动驾驶智能体数量相对较少,如表1所示。协同自动驾驶智能体的数量少于繁忙城市交叉口中的典型车辆数量。这种基准设计限制了评估场景的复杂性和真实性。

为了弥补这些差距,我们引入了Cooperative Multi-agent Unified Driving with Reasoning(CMU-Drive),这是一个基于Bench2Drive[jia2024bench]构建的闭环、端到端协同驾驶基准。CMU-Drive在保留与背景交通参与者丰富交互的同时,将每个场景扩展为包含2到16辆网联自动驾驶车辆,从而实现协同车辆、非协同车辆、行人和自行车之间的同时交互。此外,我们采用了与先前工作[liu2025colmdriver,coscoy2026mdrive]不同的编码架构设计来实现我们的基准,因此CMU-Drive仅需要单张GPU即可运行至多16个协同驾驶智能体的闭环评估。表1显示了CMU-Drive与其他协同多智能体、闭环、端到端驾驶基准相比的统计信息。

表1:CMU-Drive中评估路线的统计信息,以及其他协同多智能体、端到端、闭环驾驶基准的比较。# Routes:评估路线的数量。# CAVs:每条路线中网联自动驾驶车辆的数量。# GPUs:运行每条路线评估所需的GPU数量。

我们进一步提出了Vehicle-to-Vehicle Vision-Language-Action(V2V-VLA),一种整合了协同感知、推理和规划的协同基础模型。与基于协商的方法[liu2025colmdriver]需要多轮语言交互和LLM推理不同,V2V-VLA联合生成驾驶动作、未来路径点、语言推理和通信策略,使每辆车能够推理何时通信是有益的,以及哪个相邻车辆能够提供互补观测以做出驾驶决策。CMU-Drive和V2V-VLA共同为研究推理引导的协同多智能体、闭环、端到端自动驾驶建立了统一的基准和基线。

## 2 CMU-Drive:协同多智能体统一驾驶与推理基准

### 2.1 基准构建

CMU-Drive扩展了广泛采用的Bench2Drive[jia2024bench]基准,将其单智能体仿真和评估协议转化为协同多智能体设置,同时保留其多样化的城市交通场景。具体来说,CMU-Drive继承了Bench2Drive[jia2024bench]中的44类场景,如行人过街、紧急车辆闯红灯以及其他安全关键的城市驾驶场景。每个场景在五种不同的天气和光照条件下实例化,共产生220条评估路线。

与Bench2Drive[jia2024bench]中每条路线仅仿真和评估一辆自动驾驶车辆不同,CMU-Drive在同一闭环CARLA[dosovitskiy2017carla]环境中同时仿真和评估2到16辆协同自动驾驶车辆。每辆协同车辆被分配独立的起点和目的地,同时共享包含背景车辆、行人和自行车的动态交通环境。第一辆协同车辆遵循原始Bench2Drive[jia2024bench]路线配置,以保持基准一致性,并按照Bench2Drive[jia2024bench]中配置的相同条件触发安全关键背景交通参与者的行为。额外协同车辆的起点和目的地根据每个场景的道路拓扑自动生成。例如,在交叉口场景中,协同车辆从不同的入口车道初始化,并对应相应的出口目的地,从而实现多个自主智能体之间的多样化交互。为确保有效评估,我们避免在可能干扰原始Bench2Drive[jia2024bench]基准所定义的安全关键事件触发条件的车道上设置额外协同驾驶智能体的起点,从而保留预期的交互式交通行为和多能力基准测试。图1展示了CMU-Drive评估路线的示例。

图1:CMU-Drive中不同类型安全关键场景和不同数量网联自动驾驶车辆(CAVs)下的评估路线样本。每条实线箭头表示从配置起点到某辆CAV目的地的可行路径。每条虚线箭头表示每个安全关键驾驶场景中配置的背景交通参与者的交通流。每个场景还包括附近行驶的额外非协同背景车辆。
(a) 从停放车辆后方穿行的行人。CAV总数:3。
(b) 紧急车辆闯红灯。CAV总数:8。
(c) 自行车横穿道路。CAV总数:12。
(d) 车辆在繁忙交叉口直行或转弯。CAV总数:16。

### 2.2 多智能体评估指标

我们将CarlaLeaderboard2.0[dosovitskiy2017carla]、Bench2Drive[jia2024bench]和Simlingo[Renz2025simlingo]采用的单智能体评估协议扩展到支持CMU-Drive中的多智能体协同驾驶评估。具体来说,对于CMU-Drive评估路线\(j\)中的每个协同自动驾驶智能体\(i\),我们计算智能体级别的路线完成得分\(RC_i^j\)和违规得分\(IS_i^j\)。路线完成度\(RC_i^j\)定义为智能体\(i\)在路线\(j\)中完成指定路线的百分比。违规得分\(IS_i^j\)以基础得分\(1.0\)初始化,每当智能体发生驾驶违规时进行乘法惩罚,包括与行人、自行车、车辆或静态物体碰撞、闯红灯或停止标志、驶离道路以及未避让紧急车辆等。

接下来,对于每条路线\(j\),路线级别的路线完成得分\(RC^j\)定义为路线\(j\)中所有自动驾驶智能体的智能体级别路线完成得分的平均值,路线级别的违规得分\(

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。