AlphaTransit:学习设计城市规模的公交线路

Hugging Face Daily Papers 论文

摘要

AlphaTransit 结合蒙特卡洛树搜索与神经策略-价值网络,通过预测下游质量而无需模拟器 rollout,从而优化公交线路设计。在 Bloomington 公交基准上,它实现了显著的服务率提升。

设计公交网络需要一系列顺序的线路延伸决策,但其质量往往只有在完整网络建成后才能显现。这种延迟反馈的挑战位于公交线路网络设计问题(TRNDP)的核心,其中线路间的相互作用可能具有欺骗性:一个看似有用的局部延伸可能会造成换乘瓶颈、产生冗余重叠或降低整体吞吐量。为了在延迟模拟器反馈下引导线路构建,我们引入了 AlphaTransit,一个面向城市规模公交网络设计的基于搜索的规划框架。AlphaTransit 将蒙特卡洛树搜索(MCTS)与神经策略-价值网络相结合:策略网络提出线路延伸,价值网络估计下游设计质量,搜索则利用这些预测来优化每个决策。这在线路构建过程中提供了决策时的前瞻能力,而无需在搜索树内运行模拟器 rollout。我们在一个新的 Bloomington TRNDP 基准上评估了 AlphaTransit,该基准使用了现实的道路拓扑和基于人口普查的出行需求,并在混合和完全公交需求设定下进行了测试。在 Bloomington 网络中,AlphaTransit 在两种需求设定下均达到了最高的服务率,分别为 54.6% 和 82.1%。与没有搜索的强化学习相比,这分别对应 9.9% 和 11.4% 的服务率提升;与没有学习指导的 MCTS 相比,则对应 2.5% 和 11.2% 的提升。这些结果表明,将学习指导与 MCTS 结合使用比单独使用其中任一方法更有效。我们的代码和数据已在 https://github.com/poudel-bibek/AlphaTransit 公开发布。
查看原文
查看缓存全文

缓存时间: 2026/06/01 19:21

论文页面 - AlphaTransit:学习设计城市级公交线路

来源:https://huggingface.co/papers/2605.28730

摘要

AlphaTransit 将蒙特卡洛树搜索与神经策略值网络相结合,通过预测下游设计质量并实现决策时的前瞻性判断(无需模拟器展开),以优化公交线路设计。

设计公交网络需要大量顺序的线路扩展决策,但这些决策的质量往往只有在完整网络搭建完成后才能显现。这种延迟反馈的挑战构成了公交线路网络设计问题(TRNDP)的核心,其中线路间的相互作用具有欺骗性:一个看似局部有用的扩展可能造成换乘瓶颈、产生冗余重叠,或降低整体运输能力。为了在延迟模拟器反馈下引导线路构建,我们引入了 AlphaTransit,一个用于城市规模公交网络设计的、基于搜索的规划框架。AlphaTransit 将蒙特卡洛树搜索(MCTS)与神经策略值网络相结合:策略网络提出线路扩展,值网络估计下游设计质量,而搜索利用这些预测来优化每一步决策。这在线路构建过程中提供了决策时的前瞻性,而无需在搜索树内运行模拟器展开。我们在一个新的 Bloomington TRNDP 基准上评估了 AlphaTransit,该基准具有真实道路拓扑和基于人口普查的出行需求,并在混合和全公交出行需求设置下进行了测试。在 Bloomington 网络中,AlphaTransit 在两种需求设置下均达到了最高的服务率,分别为 54.6% 和 82.1%。相对于不使用搜索的强化学习,这分别对应 9.9% 和 11.4% 的服务率提升;相对于没有学习指导的 MCTS,则分别对应 2.5% 和 11.2% 的提升。这些结果表明,将学习指导与 MCTS 相结合比单独使用其中任何一种方法都更有效。我们的代码和数据已在 https://github.com/poudel-bibek/AlphaTransit 公开。

查看 arXiv 页面 (https://arxiv.org/abs/2605.28730) 查看 PDF (https://arxiv.org/pdf/2605.28730) 项目页面 (https://alphatransit.app/) GitHub4 (https://github.com/poudel-bibek/AlphaTransit) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.28730)

在您的代理中获取此论文:

hf papers read 2605.28730

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

matrix-multiply/alphatransit-checkpoints 强化学习• 更新于约 5 小时前 (https://huggingface.co/matrix-multiply/alphatransit-checkpoints)

引用此论文的数据集1

matrix-multiply/bloomington-tndp 查看器• 更新于约 5 小时前 • 6.12k (https://huggingface.co/datasets/matrix-multiply/bloomington-tndp)

引用此论文的 Space0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.28730 即可从此页面链接。

包含此论文的收藏0

没有包含此论文的收藏

添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

无神经元智能交通——基于表格强化学习的公平地铁网络扩展

arXiv cs.LG

阿姆斯特丹大学的研究人员提出了一种基于表格强化学习的地铁网络扩展问题方法,表明该方法在性能上与深度强化学习相当,同时平均减少18倍的训练回合数和12倍的碳排放量。该方法还融入了社会公平标准,并在西安和阿姆斯特丹的真实地铁网络上进行了评估。

面向运行时可调公交信号优先的偏好条件多目标强化学习

arXiv cs.LG

本文提出了一种偏好条件多目标强化学习控制器,用于公交信号优先,可在无需重新训练的情况下,在运行时调整公交优先与整体交通延误之间的权衡。实验表明,该控制器在维持可行性约束的同时,优于固定时间和基于规则的基线方法。