PlannerForge:用于自动驾驶运动规划器基于场景测试的LLM代理

Hugging Face Daily Papers 论文

摘要

PlannerForge引入了一个用于自动驾驶统一基于场景测试的LLM代理框架,展示了相对于现有方法的改进,包括商业和开源模型。

确保自动驾驶安全是一项关键挑战。基于场景的测试是用于验证自动驾驶系统(ADS)的系统性过程,但它仍然是一个碎片化的模块化管道,其中场景生成、检索、修改、ADS执行和结果分析由不同的工具执行,交互甚少。大语言模型(LLM)代理在ADS子系统如感知、规划和控制中显示出潜力。然而,先前没有工作使用统一的LLM代理框架覆盖ADS的整个基于场景的测试管道。我们提出了PlannerForge,一个LLM代理框架,扩展了所有基于场景的测试阶段(从场景生成到ADS评估),并增加了两个进一步的LLM增强阶段:ADS增强和ADS基准测试。我们使用10个现成的LLM在所有任务(生成、选择、修改、模块路由、规划器测试和增强)下,以5种提示条件评估PlannerForge。最佳任务分数范围从0.88到1.00,开源20-35B后端在大多数任务上与商业API匹配。像Qwen3.6:35B这样的开源模型在五项任务中的三项上匹配商业API。端到端链接模块保留83% / 78%的种子查询(商业/开源)。它在自然语言生成上优于Scenario Factory 2.0(Finkeldei等人,2025)(在200个中193个可执行 vs 144个),并实现了92-96%的所请求的城市、道路和车辆属性。它在排名1选择上优于BM25(Robertson和Zaragoza,2009)(92.0% vs 67.5%),在物理有效编辑上优于From-Words-to-Collisions(Gao等人,2025)(>=94% vs 31%)。在N=400时,成本调整将规划器成功率从50.4%提升到70.2%,并将碰撞从19.0%减少到8.4%,无需领域特定微调。
查看原文
查看缓存全文

缓存时间: 2026/09/10 14:17

论文页面 - PlannerForge:面向自动驾驶运动规划器场景测试的LLM智能体框架

来源:https://huggingface.co/papers/2609.08965

摘要

PlannerForge 是一个LLM智能体框架,它统一了基于场景的自动驾驶测试的所有阶段,并在商业与开源模型中提升了场景生成、选择、修改和规划性能。

确保自动驾驶安全性是一项关键挑战。基于场景的测试(https://huggingface.co/papers?q=Scenario-based%20testing)是验证自动驾驶系统(ADS,https://huggingface.co/papers?q=Autonomous%20Driving%20Systems)的系统性流程,但目前仍是一个碎片化的模块化流水线,其中场景生成(https://huggingface.co/papers?q=scenario%20generation)、检索、修改、ADS执行和结果分析由不同工具完成,交互有限。大型语言模型(LLM)智能体在ADS子系统(如感知、规划和控制)中已展现出潜力。然而,此前尚无研究使用统一的LLM智能体框架(https://huggingface.co/papers?q=LLM-agent%20framework)覆盖用于ADS的整个基于场景的测试(https://huggingface.co/papers?q=scenario-based%20testing)流程。

我们提出了 PlannerForge,一个LLM智能体框架(https://huggingface.co/papers?q=LLM-agent%20framework),它扩展了所有基于场景的测试(https://huggingface.co/papers?q=scenario-based%20testing)阶段(从场景生成(https://huggingface.co/papers?q=Scenario%20Generation)到ADS评估(https://huggingface.co/papers?q=ADS%20Assessment)),并增加了两个进一步的LLM增强阶段:ADS增强和ADS基准测试。我们使用10个现成LLM,在5种提示条件(https://huggingface.co/papers?q=prompt%20conditions)下,针对所有任务(生成、选择、修改、模块路由、规划器测试和增强)对 PlannerForge 进行了评估。最佳任务得分范围在0.88至1.00之间,开源的20-35B参数后端在大多数任务上可与商业API相媲美。像 Qwen3.6:35B 这样的开源模型在五个任务中的三个上达到了商业API的水平。端到端链接模块可保留83% / 78%的种子查询(商业 / 开源)。在自然语言生成方面,它优于 Scenario Factory 2.0 (Finkeldei et al., 2025)(在200个生成中,193个可执行 vs. 144个可执行),并实现了请求的城市、道路和车辆属性的92-96%。在排名1的选择上,它优于 BM25 (Robertson and Zaragoza, 2009)(92.0% vs. 67.5%),在物理有效编辑方面优于 From-Words-to-Collisions (Gao et al., 2025)(>=94% vs. 31%)。在N=400时,成本调优将规划器成功率从50.4%提升至70.2%,并将碰撞率从19.0%降至8.4%,无需特定领域的微调。

查看 arXiv 页面 | 查看 PDF | 项目页面 | GitHub 仓库 | 添加到收藏夹

在您的智能体中获取此论文: hf papers read 2609.08965

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。

引用此论文的数据集

0

暂无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。

引用此论文的 Spaces

0

暂无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.08965 以从本页面链接它。

包含此论文的收藏夹

0

暂无收藏夹包含此论文

将此论文添加到收藏夹 以从本页面链接它。

相似文章

三思而后行:LLM 智能体的自主探索

Hugging Face Daily Papers

本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。

LLM智能体使用模拟模型进行受控实验

arXiv cs.AI

本文提出了一种多智能体框架,使LLM智能体能够使用模拟模型为药物过程设计进行受控实验,从而产生比纯语言推理更具体和可操作的建议。