GenMatch:一个用于网约车微视图订单调度的端到端生成匹配框架

arXiv cs.AI 论文

摘要

GenMatch 是一个用于网约车微视图订单调度的端到端生成匹配框架,解决了批量编码和效用学习等挑战,以提高调度质量,并在实际测试中展示了其有效性。

arXiv:2608.19751v1 公告类型:新 摘要:微视图订单调度在每个调度批次内将可用司机分配给乘客订单,对网约车平台的服务质量和运营效率至关重要。主流工业解决方案遵循模型预测、价值计算和调度匹配的多阶段范式。尽管调度质量由最终的批次级分配决定,但这些阶段优化不同的中间目标。这种跨阶段目标不一致性意味着改进单个阶段并不一定改善整体调度结果。因此,我们将微视图订单调度表述为一个生成匹配问题,并提出 GenMatch,一个端到端的生成匹配框架,也是首个部署在真实生产环境中的此类框架。将生成建模应用于该问题引入了三个挑战。首先,每个调度批次形成一个动态稀疏二部图,需要高效的结构化批次级编码。其次,替代手工价值函数需要从异构反馈中学习统一的业务效用。第三,直接生成分配需要跟踪不断演变的匹配状态,因为每个选定的订单-司机对都会改变剩余的可行候选。GenMatch 通过上下文感知二部图编码器、业务感知效用学习器和状态感知指针解码器来解决这些挑战。在滴滴国际网约车市场的五个城市中进行的广泛离线评估和在线 A/B 测试显示,与竞争基线相比,GenMatch 始终有所改进,证实了其在工业订单调度中的有效性和实用性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:02

# GenMatch:用于网约车微视角订单调度的端到端生成式匹配框架
来源:https://arxiv.org/html/2608.19751
刘创,张宇雪清
所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected]),吕腾飞
所属机构:香港科技大学(广州),中国广州,邮箱:[[email protected]](mailto:[email protected]),袁子睿
所属机构:香港科技大学(广州),中国广州,邮箱:[[email protected]](mailto:[email protected]),胡伟奇
所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected]),程扬瀚
所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected]),王铭
所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected]),马丽
所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected])以及
卢子昊
注:通讯作者。所属机构:滴滴出行,中国北京,邮箱:[[email protected]](mailto:[email protected])
© 无
###### 摘要。微视角订单调度是在每个调度批次内将可用司机分配给乘客订单的过程。它对网约车平台的服务质量和运营效率至关重要。主流工业解决方案遵循包含模型预测、价值计算和调度匹配的多阶段范式。尽管调度质量由最终的批次级分配决定,但这些阶段优化的是不同的中间目标。这造成了跨阶段目标不一致性,因此改进任何单个阶段不一定能提升整体调度结果。生成式建模通过将系统上下文直接映射到最终输出,提供了一个自然的解决方案。基于这一能力,我们将微视角订单调度表述为一个生成式匹配问题,并提出了一个端到端的生成式匹配框架(GenMatch),这是首个部署在真实生产环境中的此类生成式框架。然而,将生成式建模应用于该问题带来了三个挑战。首先,模型必须编码整个调度批次,但每个批次构成一个动态稀疏二分图,需要高效的结构化批次级编码。其次,替代手工设计的价值函数需要从异构反馈中学习统一的业务效用。第三,直接生成分配方案需要跟踪不断演变的匹配状态,因为每个选定的订单-司机对都会改变剩余的可行候选者。GenMatch通过上下文感知二分图编码器、业务感知效用学习器和状态感知指针解码器来解决这些挑战。在滴滴国际网约车市场的五个城市进行的广泛离线评估和在线A/B测试表明,其性能持续优于具有竞争力的基线方法,证实了GenMatch在工业订单调度中的有效性和实用性。
###### 关键词:网约车;微视角订单调度;生成式匹配;顺序决策
(a) 所提出的端到端生成式调度框架,将每个调度批次作为整体建模,并以自回归方式直接生成调度结果。(b) 传统的多阶段调度范式,在不同阶段执行对级预测、价值计算和调度匹配。
图1。比较了(a)端到端生成式范式与(b)传统的微视角订单调度多阶段范式。
(a) 所提出的端到端生成式调度框架,将每个调度批次作为整体建模,并以自回归方式直接生成调度结果。(b) 传统的多阶段调度范式,在不同阶段执行对级预测、价值计算和调度匹配。

## 1. 引言
订单调度指的是将乘客订单实时分配给可用司机的过程。它直接影响乘客和司机体验,进而影响平台收入。因此,它是网约车平台的核心流程。现有研究从两个互补视角展开([34](https://arxiv.org/html/2608.19751#bib.bib5))。宏观视角在长期供需演变下评估和协调当前决策([29](https://arxiv.org/html/2608.19751#bib.bib1); [15](https://arxiv.org/html/2608.19751#bib.bib2); [22](https://arxiv.org/html/2608.19751#bib.bib3))。相比之下,微视角考虑的是城市内短期、实时的分配。在每个固定的调度间隔,系统收集可用的订单和司机;每个可行的订单-司机组合构成一个订单-司机(OD)对,它们共同组成一个调度批次。在严格的延迟约束下,从这个批次中选择一对一的分配被称为微视角订单调度(MICOD)。
主流工业MICOD解决方案遵循图[1](https://arxiv.org/html/2608.19751#acmlabel1)(b)所示的多阶段范式,在单个可行的OD对(对级)和整个调度批次(批次级)上进行操作。它们预测对级的业务信号,如司机应答(DA)概率、应答后乘客取消(PCAA)概率和应答后司机取消(DCAA)概率;使用手工设计的价值函数将其聚合为匹配权重;并应用如Kuhn-Munkres匹配([10](https://arxiv.org/html/2608.19751#bib.bib6); [14](https://arxiv.org/html/2608.19751#bib.bib7))之类的批次级求解器。尽管这种方法很实用,但分别优化这些阶段会导致*跨阶段目标不一致性*:更好的中间预测或权重未必能改善最终分配。生成式模型通过在搜索和查询建议([1](https://arxiv.org/html/2608.19751#bib.bib17); [5](https://arxiv.org/html/2608.19751#bib.bib16))、推荐([3](https://arxiv.org/html/2608.19751#bib.bib10); [40](https://arxiv.org/html/2608.19751#bib.bib23))和广告([30](https://arxiv.org/html/2608.19751#bib.bib22))领域中将上下文直接映射到最终输出来解决相同的问题。因此,我们将MICOD表述为从完整调度批次端到端生成分配方案。这种表述必须恢复被替换流程的三种能力:表示候选者、结合异构业务目标以及构建可行的批次级匹配。这带来了三个领域特定的挑战。
C1:动态稀疏二分图的结构化批次级编码。与独立的对级模型不同,生成式模型必须编码整个调度批次。其二分图的订单、司机和可行OD对各不相同且高度稀疏,这要求进行结构化批次级编码以保持在线计算效率。
C2:从异构反馈中学习统一的业务效用。替代手动调整的价值规则需要直接学习业务效用。然而,生成目标并未完全表达DA、PCAA和DCAA等结果,其不同的语义和方向必须整合成稳定、统一的指导。
C3:在演变的匹配状态下生成批次级分配。调度通过其联合分配而非单个对分数来评估。在生成过程中,选择一个OD对会使其共享订单或司机的所有其他对失效,并改变剩余机会,这需要一个演变的状态来支持可行的、批次协调的决策。
为了解决这些问题,我们提出了生成式匹配(GenMatch),它通过图[1](https://arxiv.org/html/2608.19751#acmlabel1)(a)所示的编码器-解码器范式,将调度批次直接映射到分配序列。其上下文感知二分图编码器在可行OD边上执行稀疏消息传递;其业务感知效用学习器使用辅助监督从异构结果中导出业务指导;其状态感知指针解码器在跟踪已选和剩余候选者的同时动态掩码不可行的对。它们共同支持在MICOD的结构、业务和匹配约束下进行端到端生成。
主要贡献总结如下:
- 据我们所知,我们提出了首个部署在真实生产环境中的MICOD端到端生成式框架。它直接从整个调度批次生成分配方案,避免了跨阶段目标不一致性。
- 我们为生成式匹配开发了三个组件:一个上下文感知二分图编码器,用于高效编码动态稀疏二分图;一个业务感知效用学习器,用于从异构反馈中学习统一效用;以及一个状态感知指针解码器,在演变的匹配状态下生成可行分配。
- 我们在滴滴国际网约车市场的五个城市进行了广泛的离线评估和在线A/B测试。结果表明,与具有竞争力的基线相比,GenMatch性能持续提升,证实了其在生产系统中的有效性和实用价值。

## 2. 相关工作
### 2.1. 网约车订单调度
有效的订单调度可提高服务质量和平台效率。宏观视角的研究通过区域价值学习([29](https://arxiv.org/html/2608.19751#bib.bib1); [21](https://arxiv.org/html/2608.19751#bib.bib28); [22](https://arxiv.org/html/2608.19751#bib.bib3))、在线或离线强化学习([18](https://arxiv.org/html/2608.19751#bib.bib13); [37](https://arxiv.org/html/2608.19751#bib.bib4))、知识增强的调度控制([7](https://arxiv.org/html/2608.19751#bib.bib36))以及多智能体区域协作([31](https://arxiv.org/html/2608.19751#bib.bib27); [9](https://arxiv.org/html/2608.19751#bib.bib14); [25](https://arxiv.org/html/2608.19751#bib.bib15))来优化长期的供需动态。微观视角的研究则在当前调度批次内通过三种范式做出决策。基于策略的方法(如CoRide和CoopRide)产生区域或网格级别的动作,而非完整的OD对分配([9](https://arxiv.org/html/2608.19751#bib.bib14); [25](https://arxiv.org/html/2608.19751#bib.bib15))。D2SN使用双层马尔可夫决策过程和编码器-解码器强化学习策略,顺序选择OD对或保留动作([34](https://arxiv.org/html/2608.19751#bib.bib5)),但缺乏显式的OD对交互建模和来自异构业务结果的直接监督。工业多阶段范式预测对级信号、计算匹配权重,并应用贪婪算法([38](https://arxiv.org/html/2608.19751#bib.bib26))、Kuhn-Munkres匹配([10](https://arxiv.org/html/2608.19751#bib.bib6); [14](https://arxiv.org/html/2608.19751#bib.bib7))或Gale-Shapley匹配([4](https://arxiv.org/html/2608.19751#bib.bib12))。相关系统使用深度图学习进行约束匹配和快递员池管理([20](https://arxiv.org/html/2608.19751#bib.bib29); [13](https://arxiv.org/html/2608.19751#bib.bib30)),但解决的是通用匹配或一对多分配问题,而非一对一的MICOD。而GenMatch统一了批次编码、业务效用学习和可行分配生成。
### 2.2. 生成式建模
生成式建模根据上下文自回归地生成目标序列,而不仅仅是为预定义输出打分,从而支持大型或可变的输出空间。工业系统已将此表述应用于物品生成和大规模序列推荐([16](https://arxiv.org/html/2608.19751#bib.bib8); [36](https://arxiv.org/html/2608.19751#bib.bib9))、外卖和电子商务推荐([6](https://arxiv.org/html/2608.19751#bib.bib18); [42](https://arxiv.org/html/2608.19751#bib.bib19))以及多业务、本地生活和广告场景([11](https://arxiv.org/html/2608.19751#bib.bib20); [28](https://arxiv.org/html/2608.19751#bib.bib21); [30](https://arxiv.org/html/2608.19751#bib.bib22))。分布式训练系统进一步将生成式推荐扩展到工业负载([27](https://arxiv.org/html/2608.19751#bib.bib41))。最近的扩展结合了行为和语义信息,并行生成长语义标识符,或将语义标识符应用于下一个兴趣点推荐([26](https://arxiv.org/html/2608.19751#bib.bib31); [8](https://arxiv.org/html/2608.19751#bib.bib33); [24](https://arxiv.org/html/2608.19751#bib.bib34))。其他研究通过前缀感知优化来解决训练-推理差距,或结合扩散模型与知识图谱推理([33](https://arxiv.org/html/2608.19751#bib.bib39); [39](https://arxiv.org/html/2608.19751#bib.bib42))。推理增强的语言模型进一步支持生成式下一个兴趣点推荐([41](https://arxiv.org/html/2608.19751#bib.bib38))。非自回归生成也已被探索用于重排序,而大型语言模型将质量感知排序与网络规模的候选生成联系起来([17](https://arxiv.org/html/2608.19751#bib.bib32); [19](https://arxiv.org/html/2608.19751#bib.bib35))。生成式方法还通过用直接推荐生成替代检索和排序来减少跨阶段目标不一致性([3](https://arxiv.org/html/2608.19751#bib.bib10); [40](https://arxiv.org/html/2608.19751#bib.bib23)),统一电子商务搜索和查询建议([1](https://arxiv.org/html/2608.19751#bib.bib17); [2](https://arxiv.org/html/2608.19751#bib.bib24); [5](https://arxiv.org/html/2608.19751#bib.bib16)),或联合训练检索和排序([12](https://arxiv.org/html/2608.19751#bib.bib25))。多阶段对齐进一步从点击中学习偏好以进行生成式查询建议([32](https://arxiv.org/html/2608.19751#bib.bib40)),而强化学习则在生成式搜索排序中提高相关性([35](https://arxiv.org/html/2608.19751#bib.bib37))。指针网络(Pointer Networks)表明,通过从可变大小的输入集中选择元素可以生成结构化解决方案([23](https://arxiv.org/html/2608.19751#bib.bib11))。MICOD具有类似的结构,但其候选者构成一个动态稀疏二分图,其可行集合在每次选择后都会变化。GenMatch扩展了指针生成,以从这种调度批次中构建完整的一对一匹配。
GenMatch架构由上下文感知二分图编码器、业务感知效用学习器和状态感知指针解码器组成。解码器在生成每个OD对后更新已选和剩余的匹配状态。
图2。GenMatch架构:(a) 上下文感知二分图编码器,(b) 业务感知效用学习器,以及 (c) 状态感知指针解码器。
GenMatch架构由上下文感知二分图编码器、业务感知效用学习器和状态感知指针解码器组成。解码器在生成每个OD对后更新已选和剩余的匹配状态。

## 3. 预备知识
在本节中,我们首先描述MICOD流程并介绍相应的业务概念和符号。然后,我们将MICOD表述为一个批次级匹配问题,并给出其生成式表述。
MICOD业务流程。网约车平台在固定间隔触发调度。在调度步骤t,平台首先收集当前可用的乘客订单和司机。令Ot={o1,...,onto}...

相似文章

通过奖励倾斜分布匹配强化少步生成器

Hugging Face Daily Papers

RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。

UniGD:一种用于工业检索的统一生成-判别框架

arXiv cs.AI

快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。