基于结构化自回归建模的长期交通仿真
摘要
介绍了 RosettaSim,一种采用结构化自回归建模进行长期交通仿真的框架,在 Waymo Open Sim Agent Challenge 上取得了最先进的性能。同时提出了基于检索的交通评估(Retrieval-based Traffic Evaluation, RTE),用于更好地评估长时域保真度。
arXiv:2606.31209v1 公告类型:新
摘要:交互式交通仿真对于自动驾驶来说是一个至关重要的世界模型。长时域仿真的核心挑战在于建模持续的多智能体交互,而随着智能体不断进入和退出场景,动态令牌基数进一步加剧了这一挑战。在这项工作中,我们提出解决方案在于大规模序列模型(例如大语言模型,LLMs)的架构归纳偏差与统计先验之间的协同作用。我们的探测实验表明,注意力机制的可转移性以及运动令牌与自然语言之间的分布一致性使得小规模、大部分冻结的LLM能够快速适应交通建模。基于这一发现,我们引入了 RosettaSim,这是一个统一框架,将场景拓扑、智能体状态和生成意图投射到可变长度的结构化自回归流中,从而在短时预测准确性和长时仿真保真度方面都取得了优异性能。此外,评估长时间展开也构成了另一个障碍,因为一对一的智能体对应关系会随时间不可避免地消失。为了解决这个问题,我们提出了基于检索的交通评估(Retrieval-based Traffic Evaluation, RTE),该方法检索语义相似的真实场景作为上下文感知的参考锚点。在 Waymo Open Sim Agent Challenge (WOSAC) 上的实验表明,RosettaSim 在短时和长时仿真中均取得了最先进的性能。此外,RTE 与标准指标的相关性($r=0.83$)强于现有方法($r=0.74$),表明其与长时仿真保真度的对齐程度更高。
查看缓存全文
缓存时间: 2026/07/01 05:37
# 基于结构化自回归建模的长期交通仿真
**来源**: https://arxiv.org/html/2606.31209
11institutetext:香港大学,薄扶林,香港 11email:\{lingyu.xiao,zexinfeng\}@connect.hku.hk 11email:[email protected] 11email:https://sephirex-x.github.io/rosettasim/
###### 摘要
交互式交通仿真是自动驾驶的关键世界模型。长期仿真中的核心挑战在于对持续的多智能体交互进行建模,而智能体不断进出场景导致动态令牌基数进一步加剧了这一挑战。本文提出,解决方案在于大规模序列模型(如大语言模型LLMs)的架构归纳偏置与统计先验之间的协同作用。我们的探测实验揭示,注意力机制的可迁移性以及运动令牌与自然语言之间的分布一致性,使得小规模、高度冻结的LLM能够快速适应交通建模。基于这一发现,我们提出RosettaSim——一个统一框架,将场景拓扑、智能体状态和生成意图投射到可变长度的结构化自回归流中,同时实现强大的短期准确性和稳定的长期仿真保真度。此外,评估扩展展开带来了另一个难题:随着时间推移,一对一的智能体对应关系不可避免地会模糊。为解决此问题,我们引入基于检索的交通评估(RTE),该方法检索语义相似的真实世界场景作为上下文感知的参考锚点。Waymo开放模拟智能体挑战赛(WOSAC)上的实验表明,RosettaSim在短期和长期仿真中均达到最优性能。此外,RTE与标准指标的相关性(r=0.83)优于现有方法(r=0.74),表明其与长期仿真保真度的对齐更好。
## 1 引言
参见图1说明
图1:性能。(a) 与infgen_iccv对比的长期仿真可视化。纯演示视频可在网页上查看。(b) WOMD上闭环短期/长期仿真的定量性能对比。
交通仿真是自动驾驶系统可扩展、安全开发的基石[yan2023learning, feng2023dense, liu2025autonomous, feng2026breaking]。尽管先前工作[philion2023trajeglish, nips24smart, zhang2024catk, wang2025llm, zhou2024behaviorgpt, rowe2024ctrl, yan2025distributionally]在短期设置(通常<8s)下表现出色,但在长期、行程级仿真中,当智能体持续进出场景时,它们难以胜任。为解决此问题,近期工作[Tan_2025_CVPR, infgen_iccv]将长期交通仿真重新定义为联合建模问题,在统一的展开过程中整合场景生成[rowe2025scenario, tan_2021_scenegen, trafficgen, chitta2024sledge](智能体注入)和运动生成。尽管取得了进展,但两个根本挑战仍未解决:(i) 联合建模智能体群体动态与交互感知运动时存在的持续性能权衡,以及(ii) 缺乏可靠的长期仿真评估协议。
第一个挑战源于场景生成和运动生成本质上不同的学习目标。场景生成关注空间分布(预测新智能体出现的地点和时间),而运动生成强调时间一致性(预测智能体如何移动)。联合优化这些目标的现有方法[infgen_iccv, peng2025infgen]往往难以平衡这两个任务。如图1(b)上部所示,最新工作SceneStreamer[peng2025infgen]与专门的短期模型(如UniMM[lin2025revisit])相比落后较大。这种失衡表明,当前的建模范式无法同时充分表示智能体群体动态和长期运动依赖关系。
与此同时,大规模序列模型(如大语言模型LLMs)在建模同质序列[Brown2020Language, Touvron2023Llama, Yang2025Qwen3, Grattafiori2024Llama](如文本)和异构模态[Lu2022Frozen, Liu2023Visual, Kim2024OpenVLA](如视觉、机器人控制)中的长程依赖关系方面展现出强大能力。然而,它们在交通仿真中的应用仍然有限。当前方法通常将语言模型用作可控仿真[Tan2024Promptable]或场景生成[Hu2024Gump]的条件工具。其他工作则重新设计受语言模型启发的组件[Zhou2024BehaviorGPT, Wang2025LLM, Peng2025InfGen],或者简单地将类比应用于下一个令牌预测[Philion2023Trajeglish, Nips24Smart, InfGen_ICCV]。这些工作均未证明LLM对结构序列的建模能力能否应用于交通仿真,更不用说长期仿真了。
因此,一个有趣的问题浮现出来:大规模序列模型能否在不依赖语言监督的情况下有效建模交通动态?如果能,原因何在?我们认为,LLM的潜力不在于语言语义,而在于它们自回归地建模结构化、组合性序列的能力。具体来说,如图2所示,我们观察到离散化的交通运动令牌的频率分布与自然语言的统计特性非常相似。受[Chan2022Data]启发,我们假设在相似机制下训练的序列模型为交通动态提供了一个高度优化的初始化流形。为实证验证这一点,我们对使用完全和部分冻结LLM的运动生成进行了探测实验。即使是一个小规模、高度冻结的LLM也能快速适应,证实了这些模型能有效处理具有长程依赖的结构化序列数据,类似于学习一种“外语”。此外,我们观察到LLM在处理语言和运动数据时表现出高度相似的注意力局部性¹,进一步支持了我们的假设。
¹ 注意力局部性定义为注意力权重在主对角线及其紧邻对角线上的和,衡量一个令牌分配给自身及其直接邻居的注意力比例。
基于这些见解,我们提出一个统一范式,将几何拓扑、现有智能体状态和生成意图无缝投射到可变长度的结构化自回归令牌序列中。我们将其命名为RosettaSim,它如同语言与运动之间的“罗塞塔石碑”。通过对序列进行结构化建模,RosettaSim既能继承在灵活令牌长度下的建模能力,也能继承预训练的结构先验,从而显著缓解场景生成与运动生成之间的性能权衡。如图1(a)所示,与先前方法[InfGen_ICCV]相比,RosettaSim展示了改善的交通流真实性和多智能体交互一致性。
第二个瓶颈在于评估。标准指标(如WOSAC[Montali2023Waymo])依赖于严格的一对一智能体匹配,因此不适用于动态长期展开。现有变通方法[InfGen_ICCV, Tan_2025_CVPR]将展开直方图与整个验证集进行比较;然而,由于整个验证集的聚合分布不是上下文感知的,全局匹配会给平凡策略带来误导性的高分。例如,要求一个高速场景匹配以低速场景为主的整体分布是不合理的。为解决此问题,我们提出基于检索的交通评估(RTE)框架。RTE通过利用预训练VAE[Rowe2025Scenario, Kingma2013Auto]的潜在空间检索最语义相似的真实世界场景的Top-K来缓解统计偏差。这些场景作为有根据的参考锚点,确保严格、上下文感知且公平的评估。通过在Waymo开放运动数据集(WOMD)[Ettinger2021WOMD]上进行广泛的闭环实验,我们证明了我们的方法在短期基准测试[Montali2023Waymo]和长期仿真中均达到了与同类方法相比的最优性能(参见图1(b))。
总结而言,我们的贡献有三方面:
- 我们提出了一种长期交通仿真的统一范式,将多智能体场景演化表述为令牌基数动态变化的条件序列生成问题,实现了智能体群体动态与交互感知运动生成之间的一致对齐。
- 我们提出了基于检索的交通评估(RTE),一种上下文感知的评估框架,检索语义相似的真实世界场景作为指标计算的参考锚点,为长期交通仿真提供更可靠的评估。
- 我们提供了广泛的实证分析,展示了大尺度序列模型(LLM)的结构先验为何以及如何适应交互式交通仿真,突出其在语言领域之外建模多智能体动态的有效性。
## 2 相关工作
### 闭环交通仿真
虽然早期工作改编了运动预测模型[Montali2023Waymo, Shi2022Motion],但近期最先进方法将仿真形式化为下一个令牌预测[Nips24Smart, Philion2023Trajeglish, Zhang2024CatK, Zhao2024KiGRAS],通常通过强化学习[Guo2025DecompGAIL, Pei2025Advancing]或高级分词[ZhangTrajTok]增强。然而,这些方法主要针对短期生成,未能解决长期仿真中复杂的群体动态。
### 非语言任务的語言模型
除了自然语言处理,LLM通过任务到文本格式化[Dinh2022LIFT, Mirchandani2023Large, Tan2024Promptable]或指令微调[Kim2024OpenVLA, Liu2023Visual]越来越多地适应不同领域。关键在于,完全冻结的LLM已被证明可作为连续任务(如3D场景理解[Lu2022Frozen, PangFrozen])的结构先验有效。然而,利用这些预训练先验来编排自回归的长期交通动态仍然是一个关键的开放空白,我们的工作正是填补这一空白。
## 3 预备知识
我们将长期交通仿真问题表述为条件序列生成任务[Seff2023MotionLM, Philion2023Trajeglish]。设s_t^i表示第i个智能体在时间步t的状态令牌(如位置、航向、速度)。全局交通场景表示为S_t = {s_t^1, s_t^2, ..., s_t^{N_t}},其中活跃智能体数量N_t在扩展的仿真视界T上动态变化[InfGen_ICCV, Tan_2025_CVPR]。与假设固定智能体集合的标准短期仿真不同,长期仿真必须持续管理智能体的进入和退出。因此,我们将标准的转移概率p(S_{t+1} | S_t, C)[Nips24Smart, Philion2023Trajeglish]分解为两个可处理的过程:并行运动更新和自回归智能体生成。
### 3.1 形式化
我们引入一个中间状态Ŝ_{t+1},表示现有智能体在进行任何拓扑变化之前的运动更新场景。下一场景的生成被分解为:
p(S_{t+1} | S_t, C) = p_agent(S_{t+1} | Ŝ_{t+1}, C) · p_motion(Ŝ_{t+1} | S_t, C)
对于并行运动更新,给定当前场景S_t,所有N_t个现有智能体的未来状态被同时预测。为保证仿真效率,我们通过假设在丰富的历史场景上下文S_t和地图C条件下智能体之间条件独立来近似此联合更新:
p_motion(Ŝ_{t+1} | S_t, C) = ∏_{i=1}^{N_t} p(ŝ_{t+1}^i | S_t, C)
对于自回归智能体生成,以运动更新后的中间场景Ŝ_{t+1}为条件,模型自回归地确定最终的新场景S_{t+1}。此过程动态处理新智能体的生成,确保一致的交通密度和合理的边界交互。
### 3.2 交通仿真指标
标准短期评估依赖于WOSAC指标[Montali2023Waymo](运动学、交互和基于地图的真实性),通过与真实日志的一对一智能体对应关系计算。在智能体动态进出的长期设置中,先前工作[InfGen_ICCV, Tan_2025_CVPR]通过统计量如进入/退出次数、进入/退出距离(#Enter, #Exit, D_enter, D_exit)以及计算与整个验证集的聚合分布散度来增强这些指标。
## 4 RosettaSim
### 4.1 动机
参见图2说明
图2:WOMD上交通运动令牌的令牌频率分布[Montali2023Waymo]。该分布遵循齐普夫定律[ZipfGeorgeKingsley1965Hbat],与自然语言类似。(a) 语言令牌的频率比例[FrancisW.Nelson1979Bcmm]。(b) 运动令牌的频率比例。(c) 运动令牌与语言令牌在log-log空间中的比较。
近期交通模拟器[Yan2023Learning, Nips24Smart, Philion2023Trajeglish, Zhang2024CatK, Wang2025LLM]的进展越来越倾向于大型序列模型的表述,采用下一个令牌预测范式和基于分词器的设计[ZhangTrajTok]。然而,将标准短期交通仿真扩展到长期仿真带来了重大挑战。它需要一个统一的自回归框架,能够同时处理连续运动生成和离散的智能体群体动态(即智能体的进入和退出)[Peng2025InfGen, InfGen_ICCV]。从头优化这样一个复杂的、统一的序列模型是出了名的困难,常常遭受训练不稳定和长期上严重的复合误差。
为应对这一优化瓶颈,我们退一步研究离散化交通动态的基本统计特性。受[Chan2022Data]启发,我们经验性地发现了一个惊人的对齐:交通运动令牌的分布严格遵循齐普夫定律[ZipfGeorgeKingsley1965Hbat](图2(c)),这是自然语言的一个标志性统计特性。如图2(a)和(b)所示,WOMD中运动令牌的频率[Montali2023Waymo]与语言令牌呈现几乎相同的分布特征,其中少数特定动作(如巡航、静止)占据主导出现次数,而复杂机动则相似文章
TRACER:面向交通事故重建的免训练闭环结构化推理
TRACER是一个用于交通事故重建的免训练框架,它将问题表述为闭环结构化推理,通过迭代优化基于事件的运动假设,并施加几何和运动学约束,从而比数据驱动和基于物理的基线方法获得更高的保真度和一致性。
Chat2Scenic:一种基于迭代RAG的自动驾驶场景生成框架
Chat2Scenic是一种基于迭代RAG的框架,能够从法规描述中生成可执行的领域特定语言场景脚本,用于自动驾驶测试,实现了76.42%的编译成功率,优于现有方法。
结构化强化学习在贝叶斯劝导中的应用:面向智能交互驾驶
本文针对交互驾驶中的贝叶斯劝导问题,提出了一种结构化强化学习框架。在该框架中,领航车辆通过选择性披露交通信息来引导网联车辆。该方法引入了MAPL和SQP算法,相比现有方法实现了30%的成本效率提升。
AI交通科学家自主发现交通法规
本文介绍了TrafficSci,一种自主AI系统,通过迭代工作流程自动化发现跨城市的通用交通法规,成功重新发现了已建立的法规,并识别出城市驾驶行为中一种新的时间记忆尺度。
面向部分可观测环境下自动驾驶的统一风险地图学习
提出了一种面向部分可观测环境的自动驾驶统一风险地图建模框架,该框架通过时空建模和基于扩散的场景生成,整合了交通流风险和碰撞风险。在Waymo Open Motion数据集上,该方法优于最先进的遮挡感知基线。