ProfiLLM: 面向工业网约车调度的效用对齐智能用户画像
摘要
ProfiLLM 提出了一种智能LLM流水线,能够从平台级行为日志中生成效用对齐的用户画像,用于工业网约车调度,在滴滴的生产环境中实现了结果预测和GMV的显著提升。
查看缓存全文
缓存时间: 2026/06/18 05:41
# ProfiLLM:面向效用的智能用户画像生成及其在工业网约车调度中的应用
来源:https://arxiv.org/html/2606.18803
###### 摘要
将大语言模型(LLM)引入工业网约车调度系统,作为平台级行为日志的语义特征提取器,是一个引人关注但尚未充分探索的数据系统问题。目前的生产匹配流水线仍然以结构化数值特征为主,然而决定性的行为信号(例如,司机对某些区域的习惯性回避)本质上是上下文相关的,并且可以自然地表示为 LLM 生成的用户画像。然而,将这种画像生成扩展到实时的、毫秒级延迟的调度系统面临三个相互交织的约束,这些约束很少被同时解决:在一个每日订单量达数百万的平台,日志超过任何 LLM 上下文窗口数个数量级;大多数用户属于长尾群体,交互次数太少,无法为每个用户生成画像;表面上流畅的画像并不一定能提高下游预测的效用。我们提出 ProfiLLM,一个智能化的 LLM 数据管道,通过两个模块实现面向效用的用户画像生成,以用于生产匹配系统。(1) 工具增强的全局知识挖掘:为 LLM 智能体配备 27 个分析工具,用于挖掘平台级数据,生成可复用的全局知识、自适应的用户聚类规则以及区域级的供需先验。(2) 面向效用的画像探索:为每个聚类生成多个候选画像,通过轻量级的下游效用代理进行评估,迭代地优化最佳候选者,并构建偏好对用于 DPO 微调。该管道强制执行严格的离线-在线约定:所有 LLM 推理在离线阶段完成,在线服务仅涉及查找预计算的聚类级画像嵌入,增加亚毫秒级开销且无需在线 LLM 推理。在滴滴的生产调度系统中部署后,ProfiLLM 在结果预测中实现了最高 +6.14% 的相对 AUC 提升,在调度模拟中实现了最高 +4.35% 的 GMV 提升,并在为期 14 天的在线 A/B 测试中取得一致改进,包括 +0.47% GMV、+0.33% 完成率和 -0.82% 接单前取消率。代码、扩展实验、额外分析和补充材料可在我们的项目页面 https://profillm.github.io/ 获取。
参见图 1。
**工业订单调度管道:** (a) 候选订单-司机(OD)对的结果预测,(b) 权重分配,(c) 二分图匹配。我们的工作通过 LLM 生成的用户画像改进了阶段 (a)。
一个三阶段管道示意图,展示候选订单-司机对从结果预测流向权重分配,再到二分图匹配。第一阶段被高亮,表示 LLM 生成的用户画像在此注入以增强结构化特征。
## 1. 引言
网约车服务已成为现代城市交通的重要组成部分,从根本上改变了全球人们的通勤和出行方式。这些平台的核心是订单调度,它持续地将乘客请求与可用司机进行匹配,同时满足严格的实时延迟约束。为了评估每个潜在匹配的质量,平台必须预测每个候选订单-司机(OD)对在订单履行漏斗中一系列用户行为结果,包括司机是否会*接受*分配的订单,以及任何一方在接受后但在行程完成前是否会*取消*。如图 1 (https://arxiv.org/html/2606.18803#S0.F1) 所示,一个典型的生产管道分三个阶段运行:(i) 预测每个候选 OD 对在每个阶段的结果;(ii) 将预测的概率组合成匹配权重,量化每个分配带来的预期效用;(iii) 通过二分图匹配(例如,Kuhn-Munkres)计算全局最优分配。在这些阶段中,结果预测是主要的质量瓶颈,因为任何阶段的预测误差都会直接传播到次优匹配,从而增加乘客等待时间、降低司机收入效率,并损害平台收入。当前的生产结果预测器主要依赖于结构化数值特征(例如,距离、价格),使得隐式语义因素基本未被利用。然而,支配接受和取消的决定性信号本质上是上下文相关的,例如司机对某些区域的长期回避,或乘客在工作日早晨严格的时间敏感性。这种模式很难通过手工设计的数值特征捕捉,但可以自然地以语言形式的用户画像表达。特别是,大语言模型(LLM)具有强大的总结和推理能力,能够将复杂的行为轨迹提炼为语义丰富的上下文画像,这激发了基于 LLM 的用户画像用于结果预测的探索。
参见图 2。
**城市 A 为期 38 天内的历史订单数分布,揭示了一个严重的长期尾部分布。**
一个直方图,显示城市 A 在 38 天窗口内每个用户的历史订单数分布。质量集中在少量订单上,并迅速衰减,呈现出较长的长尾,大多数用户只有少数订单。
为验证这一假设,我们在拥有足够历史交互的高频用户上进行了一项初步研究。我们使用 LLM 将他们的历史订单轨迹总结为上下文画像,并将其作为特征加入结果预测中。在高频用户中,与仅使用结构化特征的模型相比,画像增强的方法在司机取消和乘客取消上分别实现了 3.71% 和 9.64% 的相对 AUC 改进,表明 LLM 生成的上下文画像捕捉到了传统基于特征的方法难以发现的 OD 相关信号。然而,该初探研究是在离线环境下进行的,并且仅限于具有丰富订单历史的高频用户。尽管这些离线增益令人鼓舞,但将其推广到生产级在线部署面临几个基本障碍。首先,大多数用户是低频用户,缺乏足够的订单历史来进行可靠的 LLM 画像生成。其次,缺乏平台级知识来指导生成过程时,LLM 缺乏一致的参考框架,当以单个用户的稀疏轨迹为条件时,会生成质量差异很大的画像。第三,即使订单历史丰富,生成的画像也不能保证提高下游预测性能,因为 LLM 没有明确的信号来优化预测效用。这些观察结果引出了必须解决的三个相互关联的挑战。
**挑战 1: 从海量历史数据中可扩展地挖掘全局运营知识。** 生成可靠的知识需要理解平台级的规律性,例如时间模式、区域异质性和订单结果背后的因果因素。这种全局知识提供了单个用户历史无法单独提供的上下文基础,然而原始日志量巨大,我们部署的一个小城市在 38 天窗口内产生了 4430 万条调度记录,远远超过任何 LLM 的上下文容量,而跨多城市的完整刷新则再增加一个数量级。
**挑战 2: 在长尾数据分布下的自适应用户聚类。** 即使拥有全局知识,对占主导地位的低频用户群体进行逐个用户画像仍然不可行。在同一城市 A 的 38 天窗口内,96% 的乘客出现在 ≤30 个订单中(图 2 (https://arxiv.org/html/2606.18803#S1.F2));而司机的参与度较高(73% 为高频),但乘客端的稀疏性从根本上限制了用户画像,因为每个候选匹配都需要预测双方的结果。需要一个原则性的聚类机制,将行为相似的用户分组,以便每个聚类积累足够的数据进行可靠的画像学习。
**挑战 3: 确保 LLM 生成的画像与下游预测目标效用对齐。** 即使有全局知识和用户聚类,LLM 仍然可以生成流畅的画像描述,但无法捕捉驱动行为决策的具体因素。正如我们后续实验所证实的(表 2 (https://arxiv.org/html/2606.18803#S4.T2)),几种强大的现成 LLM 主干在直接使用时会使下游预测 AUC 降低高达 -7.57%,表明画像流畅性不是预测效用的可靠代理。因此,需要一个系统性的机制来基于可测量的下游效用探索、评估和优化画像,同时保持与严格在线延迟约束的兼容性。
为应对这些挑战,我们提出了 ProfiLLM,一个实用的数据框架,用于在实时网约车匹配中部署面向效用的 LLM 用户画像。我们设计了一个**工具增强的全局知识挖掘**模块,其中配备 27 个分析工具的 LLM 智能体按照“探索→深化→验证→综合”的模式分析平台级历史数据,生成 (i) 可操作的全局知识(例如,时间模式、天气影响、因果关系),(ii) 自适应用户聚类及合适粒度的可解释规则,以及 (iii) 来自网格级空间分析的区域供需先验。我们提出了一种**面向效用的画像探索**机制,为每个用户聚类生成候选画像,这些画像以挖掘出的全局知识为条件,通过基于规则的预测作为轻量级效用代理进行评分,并使用来自预测误差分析的反馈迭代优化最佳候选。由此产生的效用比较产生偏好对,用于驱动 DPO 微调,进一步提高画像生成质量。生成的画像被嵌入并与结构化特征融合,用于实时结果预测。关键是,所有 LLM 推理都在离线进行;在线系统仅对预计算的聚类级画像嵌入进行操作,确保与生产要求兼容的可忽略延迟增加。
**我们的贡献:**
- 我们设计了 ProfiLLM,一个智能化的 LLM 数据管道,在工业网约车行为画像中强制执行严格的离线-在线约定:所有 LLM 推理是批量离线的,而生产调度器仅使用预计算的聚类级画像嵌入。据我们所知,这是为生产网约车调度器部署的首个基于 LLM 的用户画像管道。
- 我们设计了一个**工具增强的全局知识挖掘**模块,将 27 个分析工具作为可组合的操作符层,由 LLM 智能体在“探索-深化-验证-综合”模式下驱动。智能体自主组合操作符链,从超过任何 LLM 上下文窗口的平台级日志中提取可操作的全局知识、自适应用户聚类规则和区域供需先验。
- 我们提出了一种**面向效用的画像探索**机制,将预测效用作为首要优化信号:对于每个用户聚类,生成多个候选画像,并通过轻量级的 LOGIC 规则代理对下游预测进行排序;由此产生的跨候选偏好驱动 DPO 微调,使画像生成与下游匹配目标对齐。
- 我们在滴滴的生产调度器上**部署**了 ProfiLLM。在线路径增加了亚毫秒级开销,无需在线 LLM 推理。ProfiLLM 在结果预测 AUC 上实现了最高 +6.14%,在模拟器中实现了 +4.35% 的 GMV;城市 A 为期 14 天的 A/B 测试确认了 +0.47% GMV、+0.33% 完成率和 -0.82% 取消率。
参见图 3。
**ProfiLLM 概览。** (a) 工具增强的全局知识挖掘和 (b) 面向效用的画像探索在离线阶段运行;(c) 是在线服务路径。
ProfiLLM 框架的三面板架构图,阶段 (a) 和 (b) 带有离线标签,阶段 (c) 带有在线标签。面板 (a) 显示 LLM 智能体调用分析工具处理历史数据,生成全局知识、聚类规则和区域先验。面板 (b) 显示一个迭代的探索-评估-优化循环,生成与下游预测效用对齐的聚类级用户画像。面板 (c) 显示生成的画像被编码为嵌入,并与结构化特征融合,用于在线结果预测和二分图匹配。
## 2. 问题形式化
考虑一个在城市中运营的网约车平台,该城市被划分为一组空间网格 \( \mathcal{G} = \{g_1, g_2, \ldots, g_{|\mathcal{G}|}\} \)。设 \( \mathcal{P} = \{p_1, p_2, \ldots, p_M\} \) 表示乘客集合,\( \mathcal{D} = \{d_1, d_2, \ldots, d_N\} \) 表示司机集合。每个用户 \( u \in \mathcal{P} \cup \mathcal{D} \) 都有一个历史交互序列 \( \mathcal{H}_u = \{h_1^u, h_2^u, \ldots, h_{|\mathcal{H}_u|}^u\} \),其中每条记录 \( h_i^u \) 包含订单级信息,例如时间戳、位置和行程详情。在每个调度周期,系统接收待处理订单 \( \mathcal{O} \) 并识别候选匹配 \( \mathcal{C} \subseteq \mathcal{O} \times \mathcal{D} \)。对于每个候选匹配 \( c = (o, d) \) 及其关联的乘客 \( p \),系统预测多个订单级结果(即订单接受),这些结果用于计算匹配权重。设 \( \mathbf{y}_c = (y_c^{(1)}, y_c^{(2)}, \ldots, y_c^{(L)}) \) 表示结果向量,其中 \( L \) 是预测任务的数量,每个 \( y_c^{(l)} \in \{0,1\} \) 指示订单履行过程中第 \( l \) 阶段是否成功(例如,\( l=1 \) 表示订单接受,\( l=2 \) 表示订单完成)。预测模型估计:\( \hat{\mathbf{y}}_c = f(\mathbf{x}_c, \mathbf{e}_p, \mathbf{e}_d) \),其中 \( \hat{\mathbf{y}}_c = (\hat{y}_c^{(1)}, \ldots, \hat{y}_c^{(L)}) \),且 \( \hat{y}_c^{(l)} \in [0,1] \) 是结果 \( l \) 的预测概率,\( \mathbf{x}_c \) 表示结构化特征(ETA、距离、价格),\( \mathbf{e}_p, \mathbf{e}_d \) 是画像嵌入。这些预测被聚合为匹配权重 \( w_c \),量化每个分配的预期效用。最优匹配 \( \mathcal{M}^* \) 通过 Kuhn-Munkres 算法计算,在满足一对一匹配约束的条件下最大化 \( \sum_{c \in \mathcal{M}} w_c \)。我们的工作通过生成面向效用的用户画像来改进结果预测,其嵌入 \( \mathbf{e}_p \) 和 \( \mathbf{e}_d \) 补充了结构化特征。
## 3. 方法论
### 3.1. 系统概览
**生产环境设置。** ProfiLLM 是在滴滴的生产调度服务中设计和部署的,其操作约束决定了以下所有设计选择。调度器以固定的 2 秒周期运行;在每个周期中,它枚举候选订单-司机(OD)对,预测每对的按阶段行为结果,将其组合成匹配权重,并在约 200 毫秒的端到端延迟预算内通过 Kuhn-Munkres (KM) 算法求解分配问题。生产预测器是一个多…(原文截断,但翻译截止到此处)相似文章
EXHOLD:滴滴大规模网约车匹配中基于体验感知的实时保持控制
EXHOLD是一个两阶段框架,用于大规模网约车匹配中的实时保持控制,提升乘客与司机的体验及市场效率。该框架已在滴滴巴西市场部署,通过体验感知的配对评估和约束优化,降低取消率并提高行程完成率。
GenMatch:一个用于网约车微视图订单调度的端到端生成匹配框架
GenMatch 是一个用于网约车微视图订单调度的端到端生成匹配框架,解决了批量编码和效用学习等挑战,以提高调度质量,并在实际测试中展示了其有效性。
Fast-dLLM++:用于更快扩散LLM推理的Fr\'{e}chet剖面解码
Fast-dLLM++ 引入了适用于扩散LLM的Fr\'{e}chet剖面解码,这是一种无需训练的方法,基于异构置信度剖面选择并行提交集。在LLaDA-8B模型的基准测试中,它实现了高达37%的吞吐量提升,同时保持可比的准确性。
SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay
SeqLLM is a framework that injects behavioral-sequence modeling into pretrained LLMs while preserving language ability, enabling joint analysis of text and behavior for high-stakes decisions. Deployed at WeChat Pay, it improves merchant screening precision from 92.0% to 97.5% and achieves state-of-the-art results on open recommendation benchmarks.
FlyRoute:通过数据飞轮实现自适应任务路由的自我进化代理画像
FlyRoute是一种自我进化的画像框架,通过动态更新来自实际流量的代理能力描述,改进多智能体系统中基于LLM的任务路由,相比静态画像取得了显著的准确率提升。