TransitLM:一个用于无地图公交路线生成的大规模数据集与基准

arXiv cs.CL 论文

摘要

本文介绍了TransitLM,一个包含来自中国城市超过1300万条公交路线规划记录的大规模数据集,通过直接在规划数据上训练的LLM实现无地图路线生成。

arXiv:2605.22355v1 公告类型:新 摘要:公交路线规划传统上依赖于结构化地图基础设施和复杂的路线引擎,目前尚无现有数据集支持训练模型绕过这一依赖。我们提出了TransitLM,一个包含来自四个中国城市超过1300万条公交路线规划记录的大规模数据集,覆盖120,845个站点和13,666条线路,作为持续预训练语料库和用于三个评估任务(具有互补指标)的基准数据发布。实验表明,在TransitLM上训练的LLM能够高精度地生成结构有效的路线,并隐式地将任意GPS坐标映射到适当的站点,而无需任何显式地图。这些结果表明,公交路线规划可以完全从数据中学习,从而实现直接从起点-终点信息进行端到端、无地图的路线生成。数据集和基准可在https://huggingface.co/datasets/GD-ML/TransitLM获取,评估代码可在https://github.com/HotTricker/TransitLM获取。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:46

# TransitLM:面向无地图公交路线生成的大规模数据集与基准

来源:https://arxiv.org/html/2605.22355

郭涵宇\* 杨杰东\* 陈超 徐龙飞 刘开奎 储翔翔  
阿里巴巴集团高德地图,中国北京  
\{guohanyu\.ghy, jiedong\.yjd, cc201598, longfei\.xl, damon\}@alibaba\-inc\.com  
cxxgtxy@gmail\.com

###### 摘要

传统公交路线规划依赖结构化的地图基础设施和复杂的路线引擎,目前尚无现成数据集支持训练模型绕过这一依赖。我们提出 TransitLM,这是一个包含来自中国四座城市超过 1300 万条公交路线规划记录的大规模数据集,覆盖 120,845 个站点和 13,666 条线路。该数据集以持续预训练语料库和基准数据的形式发布,并附带三项评估任务及互补性评估指标。实验表明,在 TransitLM 上训练的 LLM 能够以高准确率生成结构有效的路线,并能在无需任何显式地图的情况下,将任意 GPS 坐标隐式映射到合适的站点。这些结果表明,公交路线规划可以完全从数据中学习,实现从起终点信息直接进行端到端、无地图的路线生成。数据集和基准可在 https://huggingface.co/datasets/GD-ML/TransitLM 获取,评估代码见 https://github.com/HotTricker/TransitLM。

## 1 引言

公交路线规划支撑着日常城市出行,但传统系统严重依赖结构化的地图基础设施和复杂的工程流程,以完成基于拓扑网络的候选路线检索与排序。值得注意的是,公交平台持续产生的大量路线规划日志隐式编码了丰富的路线规划知识,包括上车点、换乘点,以及用户在速度、便利性和线路偏好之间的权衡。这种对比引出一个自然的问题:能否直接从这些数据中学习路线规划,从而完全绕过地图和路线引擎?

或许有人认为,像 GPT-3 [4](https://arxiv.org/html/2605.22355#bib.bib41)、GPT-4 [1](https://arxiv.org/html/2605.22355#bib.bib1) 和 Qwen3 [41](https://arxiv.org/html/2605.22355#bib.bib2) 这样的通用 LLM,凭借其强大的推理能力和广泛的通用知识,能够解答这个问题。然而,近期研究表明,自回归 LLM 本身无法可靠地执行规划 [34, 20](https://arxiv.org/html/2605.22355#bib.bib37)。尽管这些模型可能回忆起频繁提及的站点或热门路线,但它们始终会生成包含幻觉站点或连接断裂的路线 [19](https://arxiv.org/html/2605.22355#bib.bib38),尤其是在处理不常见的起终点对时。这种局限性源于缺乏合适的训练数据。

现有的数据源各自只捕捉了问题的部分方面。车辆轨迹数据集(如 T-Drive [42](https://arxiv.org/html/2605.22355#bib.bib3) 和 Porto Taxi [25](https://arxiv.org/html/2605.22355#bib.bib4))缺乏站点结构。静态网络数据集(包括 GTFS [38](https://arxiv.org/html/2605.22355#bib.bib5) 和 CPTOND-2025 [36](https://arxiv.org/html/2605.22355#bib.bib6))不包含用户行为或规划轨迹。因此,没有现有数据源可以提供学习端到端公交规划所需的完整路线结构和行为标注。

参见图注 图 1:公交路线规划的三种范式。**上方**:传统基于地图的流程。**左下方**:通用 LLM 缺乏结构依据,产生幻觉站点、不连通的路线以及无效的上车/下车点。**右下方**:TransitLM 通过隐式空间定位,无需地图基础设施,即可端到端生成结构有效的连续路线。

如图 1 所示,我们提出 TransitLM 来填补这一空白。TransitLM 是一个大规模数据集,包含来自中国四座城市(北京、上海、深圳、成都)超过 1300 万条路线规划记录,覆盖 120,845 个站点和 13,666 条公交线路。每条记录包含完整的规划会话,包括 GPS 坐标、站点序列、换乘点、线路标识符、分段计时和路线类型标注。我们发布了两种互补资源:持续预训练语料库包含 1390 万条文本化路线描述,用于下一词元预测训练,使模型能够内化公交网络拓扑和空间关系;基准专用的 SFT 数据则为三个核心任务提供标准化提示和标签,即最优路线生成、偏好感知规划和多路线生成,每项任务通过互补性指标(涵盖连通性、可达性、路线重叠和数值字段准确性)进行评估。

为验证该数据集,我们通过持续预训练和监督微训练了一个 LLM。实验揭示了三个关键发现:

(1) **端到端、无地图的路线生成是可行的。** 训练后的模型能以高准确率生成结构有效的连通路线,表明仅凭丰富的轨迹数据就能替代传统基于地图的路线引擎。

(2) **隐式的空间定位从数据中涌现。** 给定起终点的 GPS 坐标,模型学会将任意坐标解析到合适的上下车站点,无需任何显式的坐标到站点映射或地理数据库,实际上内化了公交网络的空间拓扑。

(3) **单个模型可泛化到多种规划目标。** 联合训练的模型在所有三个基准任务上均能达到或超过专门模型的表现,且没有出现负迁移,证实数据集中编码的公交知识是任务无关的,支持在多样化规划场景中的统一部署。

我们的贡献如下:

- •**数据集。** 我们提出 TransitLM,这是一个大规模数据集,包含来自中国四座城市、120,845 个站点和 13,666 条线路的超过 1300 万条公交路线规划记录。以预训练语料库和附带标准化提示与标签的基准数据的形式发布。
- •**基准。** 我们定义了三个评估任务:最优路线生成、偏好感知规划和多路线生成。每项任务通过互补性指标(连通性、可达性、路线重叠和数值字段准确性)进行评估。
- •**验证。** 我们通过训练一个 LLM 来验证数据集,该 LLM 实现了准确的无地图路线生成,展现出从 GPS 坐标到公交站点的隐式空间定位能力,并通过单个联合训练模型泛化到多种规划目标,证实底层公交知识是任务无关的。

## 2 相关工作

### 2.1 公交路线规划方法

经典公交路线规划在显式图表示上运行。基础算法如 Dijkstra [11](https://arxiv.org/html/2605.22355#bib.bib7) 和 A* [17](https://arxiv.org/html/2605.22355#bib.bib8) 已通过公交专用方法(包括 RAPTOR [9](https://arxiv.org/html/2605.22355#bib.bib15) 及其帕累托最优扩展 [8](https://arxiv.org/html/2605.22355#bib.bib43)、连接扫描算法 [10](https://arxiv.org/html/2605.22355#bib.bib16) 和换乘模式 [2](https://arxiv.org/html/2605.22355#bib.bib17))得到扩展,从而能在大规模网络上进行高效的多准则出行规划 [3](https://arxiv.org/html/2605.22355#bib.bib18)。所有这些方法本质上都需要结构化的地图基础设施和实时时刻表数据。

近期工作探讨了 LLM 能否减少这种依赖。LLM-A* [24](https://arxiv.org/html/2605.22355#bib.bib19) 将 LLM 生成的启发式信息融入 A* 搜索,但仍需要图作为输入。GridRoute [22](https://arxiv.org/html/2605.22355#bib.bib20) 在合成网格环境中对 LLM 的路径推理进行基准测试。MapBench [40](https://arxiv.org/html/2605.22355#bib.bib22) 和 MapTrace [28](https://arxiv.org/html/2605.22355#bib.bib21) 评估多模态 LLM 在像素级地图导航上的表现。ReasonMap [14](https://arxiv.org/html/2605.22355#bib.bib10) 针对公交地图阅读,但显示出视觉推理准确率方面的重大局限。TraveLLM [12](https://arxiv.org/html/2605.22355#bib.bib9) 将 LLM 应用于公交中断场景,但仍依赖外部地图数据。在这些工作中,尚无方法实现从起终点信息进行端到端、无地图的公交路线生成。

### 2.2 公交数据源

现有的公交相关数据集各自只覆盖了路线规划问题的部分方面。车辆轨迹数据集(如 T-Drive [42](https://arxiv.org/html/2605.22355#bib.bib3)、Porto Taxi [25](https://arxiv.org/html/2605.22355#bib.bib4) 和 GeoLife [44](https://arxiv.org/html/2605.22355#bib.bib13))记录了出租车或个人的 GPS 轨迹 [45](https://arxiv.org/html/2605.22355#bib.bib12),但缺乏站点结构、换乘逻辑和公交线路标识符。静态网络数据集(包括 GTFS [38](https://arxiv.org/html/2605.22355#bib.bib5)、OpenStreetMap [16](https://arxiv.org/html/2605.22355#bib.bib14) 和 CPTOND-2025 [36](https://arxiv.org/html/2605.22355#bib.bib6))提供了数百个城市的全面拓扑和时刻表,但不包含用户行为或实际出行轨迹。目前没有数据集能将完整的路线结构与用于数据驱动公交路线规划的行为标注相结合。

### 2.3 出行规划与路线规划基准

近期基准测试评估 LLM 智能体在规划和导航任务上的表现,但没有一个针对端到端公交路线生成。TravelPlanner [39](https://arxiv.org/html/2605.22355#bib.bib23)、NATURAL PLAN [43](https://arxiv.org/html/2605.22355#bib.bib24)、TripCraft [5](https://arxiv.org/html/2605.22355#bib.bib25)、ChinaTravel [31](https://arxiv.org/html/2605.22355#bib.bib26)、TripTailor [35](https://arxiv.org/html/2605.22355#bib.bib27)、TP-RAG [26](https://arxiv.org/html/2605.22355#bib.bib28)、TravelBench [6](https://arxiv.org/html/2605.22355#bib.bib31) 和 TRIP-Bench [32](https://arxiv.org/html/2605.22355#bib.bib30) 都专注于通过工具调用智能体 [30](https://arxiv.org/html/2605.22355#bib.bib42) 进行多日行程规划,评估高层约束满足程度而非站点级路线准确性。城市智能基准(如 CityBench [13](https://arxiv.org/html/2605.22355#bib.bib11) 和 USTBench [21](https://arxiv.org/html/2605.22355#bib.bib29))覆盖多种城市任务,但排除或边缘化了公交路线规划。MobilityBench [33](https://arxiv.org/html/2605.22355#bib.bib32) 与我们的设置最为接近,但它评估的是智能体编排地图 API 的能力,而非直接生成路线。目前没有任何基准测试旨在评估 LLM 能否直接生产出具有站点级精度的结构有效的公交路线。

## 3 数据集构建

### 3.1 数据收集

TransitLM 构建自高德地图(中国领先的导航平台)提供的公交路线规划日志。我们从四座主要城市(北京、上海、深圳、成都)收集数据,覆盖 120,845 个站点和 13,666 条公交及地铁线路。从单日的导航日志中,我们提取了超过 1290 万个规划会话。由于所有候选路线均由平台的生产级路线引擎生成,它们天然满足连通性和可行性约束,无需人工验证即可提供高质量的训练信号。

每个会话记录了起终点的 GPS 坐标、POI 名称、候选路线(包含完整的站点 ID 序列和线路标识符,其中站点由唯一数字 ID 而非自然语言名称表示)、分段行驶距离和时间、路线类型标注、首末公里接驳详情以及用户选择标签。所有记录均已完全去标识化,隐私保护措施详见附录 H。

参见图注 图 2:TransitLM 概览。**左侧**:来自高德的数据源,包括跨四座城市的路线规划、站点信息、站点连通性和线路信息。**中央**:TransitBench 定义了三个评估任务(ORG、PRG、DRG),每个任务包含 10K 个测试样本,通过五大类共 10 个指标进行评估。**右侧**:TransitLM 通过三个知识源的持续预训练和三个任务的监督微调,结合词表扩展和多样化数据设置,弥补了通用 LLM 的不足。

### 3.2 数据模式

TransitLM 发布了两种互补的数据资源。

**持续预训练 (CPT) 语料库。** 一个包含 1390 万条记录的文本语料库,由 1290 万条路线规划会话和 100 万条站点与线路的静态描述组成。领域自适应持续预训练 [15](https://arxiv.org/html/2605.22355#bib.bib33) 已被证明能有效使语言模型专精于新领域。每条会话记录将规划查询编码为自然语言:一个查询头(包含城市、起终点坐标和 POI 名称),后跟带有分段详细信息的候选路线。用户选择的路线被置于候选路线的首位,从而使模型能够通过下一词元预测隐式学习用户偏好模式。静态记录描述单独的线路和站点,包含线路长度、停靠站序列、运营时间和连通性等属性。这些记录类型的代表性示例见附录 B。这种设计使模型能够内化公交网络拓扑和空间关系。

**基准监督微调 (SFT) 数据。** 为三个基准任务(第 4 节)构建的任务专用数据:最优路线生成、偏好感知规划和多路线生成。每个任务根据任务定义的标准从候选路线集中选择特定路线来构建结构化标签。每项任务提供 30,000 个训练示例和 10,000 个测试示例,并附有任务特定的过滤标准。所有示例遵循标准化的提示-标签格式,如附录 C 所示,确保跨不同模型和训练配置的可重复比较。

### 3.3 数据统计与分析

CPT 语料库包含来自三种互补来源的 1390 万条记录:12,945,264 条路线规划会话、880,854 条站点描述和 147,918 条线路描述。表 1 总结了四个城市的关键统计信息。每个会话平均包含来自导航引擎的 6.32 条候选路线;在 CPT 语料库构建过程中,经过多样性筛选后,我们每个会话最多保留五条路线。

**路线模态分布。** 我们根据每条候选路线的公交段(不包括仅作为段之间连接的步行)将其分为四类。纯公交路线占 33.0%,纯地铁占 19.0%,公交+地铁占 16.8%。混合路线(其中至少有一个段涉及出租车或自行车作为与公交线路的首/末公里接驳)占 30.5%。其余 0.7% 由非公交替代方案(例如纯出租车或纯自行车路线)组成。没有任何单一模态在语料库中占据主导地位,这证实了跨公交类型的平衡覆盖。

**路线距离和出行时间。** 路线距离从不足 5 公里到超过 30 公里不等。5 公里以内的短距离路线占 22.8%,5–20 公里的中距离路线合计占 47.4%,

相似文章

AlphaTransit:学习设计城市规模的公交线路

Hugging Face Daily Papers

AlphaTransit 结合蒙特卡洛树搜索与神经策略-价值网络,通过预测下游质量而无需模拟器 rollout,从而优化公交线路设计。在 Bloomington 公交基准上,它实现了显著的服务率提升。

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。