PlannerForge:用于自动驾驶运动规划器基于场景测试的LLM代理
摘要
PlannerForge引入了一个用于自动驾驶统一基于场景测试的LLM代理框架,展示了相对于现有方法的改进,包括商业和开源模型。
查看缓存全文
缓存时间: 2026/09/10 14:17
论文页面 - PlannerForge:面向自动驾驶运动规划器场景测试的LLM智能体框架
来源:https://huggingface.co/papers/2609.08965
摘要
PlannerForge 是一个LLM智能体框架,它统一了基于场景的自动驾驶测试的所有阶段,并在商业与开源模型中提升了场景生成、选择、修改和规划性能。
确保自动驾驶安全性是一项关键挑战。基于场景的测试(https://huggingface.co/papers?q=Scenario-based%20testing)是验证自动驾驶系统(ADS,https://huggingface.co/papers?q=Autonomous%20Driving%20Systems)的系统性流程,但目前仍是一个碎片化的模块化流水线,其中场景生成(https://huggingface.co/papers?q=scenario%20generation)、检索、修改、ADS执行和结果分析由不同工具完成,交互有限。大型语言模型(LLM)智能体在ADS子系统(如感知、规划和控制)中已展现出潜力。然而,此前尚无研究使用统一的LLM智能体框架(https://huggingface.co/papers?q=LLM-agent%20framework)覆盖用于ADS的整个基于场景的测试(https://huggingface.co/papers?q=scenario-based%20testing)流程。
我们提出了 PlannerForge,一个LLM智能体框架(https://huggingface.co/papers?q=LLM-agent%20framework),它扩展了所有基于场景的测试(https://huggingface.co/papers?q=scenario-based%20testing)阶段(从场景生成(https://huggingface.co/papers?q=Scenario%20Generation)到ADS评估(https://huggingface.co/papers?q=ADS%20Assessment)),并增加了两个进一步的LLM增强阶段:ADS增强和ADS基准测试。我们使用10个现成LLM,在5种提示条件(https://huggingface.co/papers?q=prompt%20conditions)下,针对所有任务(生成、选择、修改、模块路由、规划器测试和增强)对 PlannerForge 进行了评估。最佳任务得分范围在0.88至1.00之间,开源的20-35B参数后端在大多数任务上可与商业API相媲美。像 Qwen3.6:35B 这样的开源模型在五个任务中的三个上达到了商业API的水平。端到端链接模块可保留83% / 78%的种子查询(商业 / 开源)。在自然语言生成方面,它优于 Scenario Factory 2.0 (Finkeldei et al., 2025)(在200个生成中,193个可执行 vs. 144个可执行),并实现了请求的城市、道路和车辆属性的92-96%。在排名1的选择上,它优于 BM25 (Robertson and Zaragoza, 2009)(92.0% vs. 67.5%),在物理有效编辑方面优于 From-Words-to-Collisions (Gao et al., 2025)(>=94% vs. 31%)。在N=400时,成本调优将规划器成功率从50.4%提升至70.2%,并将碰撞率从19.0%降至8.4%,无需特定领域的微调。
查看 arXiv 页面 | 查看 PDF | 项目页面 | GitHub 仓库 | 添加到收藏夹
在您的智能体中获取此论文:
hf papers read 2609.08965
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。
引用此论文的数据集
0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。
引用此论文的 Spaces
0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。
包含此论文的收藏夹
0
暂无收藏夹包含此论文
将此论文添加到收藏夹 以从本页面链接它。
相似文章
MultiUAV-Plat:面向大语言模型的多无人机协同任务规划平台、基准测试与框架
MultiUAV-Plat 是一个轻量级仿真平台和基准测试,用于评估大语言模型智能体在多无人机协同任务规划任务上的表现。本文还提出了 Agent4Drone,一个针对特定任务的大语言模型智能体框架,其性能显著优于基线方法。
三思而后行:LLM 智能体的自主探索
本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。
基于真实世界故障记录的自动驾驶系统测试场景生成
本文提出了一种模块化的LLM流水线,利用历史故障记录(例如NHTSA碰撞数据)生成多样化的自动驾驶系统测试场景,从而在有限的测试预算内实现有效的故障发现。
LLM智能体使用模拟模型进行受控实验
本文提出了一种多智能体框架,使LLM智能体能够使用模拟模型为药物过程设计进行受控实验,从而产生比纯语言推理更具体和可操作的建议。
ScenePilot: 可控的边界驱动型自动驾驶关键场景生成
ScenePilot 提出了一个可行性引导的、边界驱动的框架,用于为自动驾驶生成安全关键场景,通过约束多目标强化学习来生成物理上有效但会诱发失败的场景。