成对排序在离线解释选择中优于单动作强化学习:一个实用教训
摘要
本文提出在可解释推荐系统中将生成与选择分离,以降低服务成本,使用冻结的候选解释池和一个小型CPU常驻选择器。它对离线池选择器进行基准测试,发现成对学习排序在F1分数上优于单动作强化学习公式,如PPO、GRPO和DPO。
arXiv:2608.18531v1 Announce Type: new
摘要:基于大语言模型的工业可解释推荐系统产生巨大的服务成本:每个请求触发一次大语言模型生成,延迟在数百毫秒,成本随流量线性增长。我们将生成与选择分离:解释提前生成为一个冻结的候选池(六种提示风格,两种商品大语言模型),一个小型CPU常驻选择器在请求时选择一个。该堆栈不需要GPU,响应时间在100毫秒以内。
我们的主要基准是一个2,958对的XRec Google Local子集,评估六个离线池选择器(LambdaRank、PPO、GRPO、DPO、教师-学生蒸馏)和三个KG路径选择器(随机游走、边不相交枚举、MMR重排路径)。一个300对的MovieLens-1M分割,使用Claude-Sonnet-4.5作为参考,作为内部跨数据集检查,因为对于这种设置没有公开基准。所有变体使用与XRec和G-Refer相同的BERTScore-F1协议,跨五个种子平均。
LambdaRank在Google Local上达到F1 = 0.500,超过G-Refer和XRec,在MovieLens-1M检查上达到F1 = 0.329。种子方差低于0.003 F1,排序是可靠的:成对学习排序优于单动作强化学习(PPO、GRPO、DPO),后者每次 rollout 仅使用一个标记候选,留下K-1个标签未使用。
KG路径族针对不同的目标:所有三个变体在Google Local上达到USR = 1.000,在MovieLens-1M上达到0.997-1.000,因为每请求路径 grounding 为每个查询产生唯一输出,避免了影响缓存LLM输出的模板崩溃失败。
一个生成器池研究比较Claude 3 Haiku和Claude Haiku 4.5显示了小的F1偏移(0.001-0.006),同时保留选择器排名:选择器和生成器可以独立评估,尽管绝对F1取决于生成器。端到端构建成本在商品硬件上接近15美元。
查看缓存全文
缓存时间: 2026/08/20 10:14
# 成对排序在离线解释选择中优于单动作强化学习:一个实践启示 来源:https://arxiv.org/html/2608.18531 ## 成对排序在离线解释选择中优于单动作强化学习:一个实践启示 会议:第20届ACM推荐系统会议工业赛道;2026年9月28日–10月2日;美国明尼阿波利斯 第20届ACM推荐系统会议工业赛道(RecSys '26),2026年9月28日–10月2日,美国明尼阿波利斯 DOI:10\.1145/nnnnnnn\.nnnnnnn (https://doi.org/10.1145/nnnnnnn.nnnnnnn) ISBN:978\-x\-xxxx\-xxxx\-x/YY/MM CCS:信息系统 推荐系统 CCS:计算方法学 强化学习 CCS:计算方法学 自然语言生成 Tanay Chowdhury 注:两位作者对本研究贡献均等。 隶属机构:亚马逊,美国华盛顿州西雅图市 邮箱:[tanaycho@amazon\.com](mailto:[email protected]) Saeideh Shahrokh Esfahani 隶属机构:亚马逊,美国加利福尼亚州山景城 邮箱:[saeidesh@amazon\.com](mailto:[email protected]) 2026© , 2026; ###### 摘要 围绕大型语言模型构建的工业可解释推荐系统会产生高昂的推理成本:每个请求都会触发一次LLM生成,延迟高达数百毫秒,且每查询成本随流量线性增长。我们将生成与选择过程分离。解释提前生成为一个冻结的候选池,应用六种提示风格于两个常用LLM,并在请求时由一个常驻CPU的小型选择器挑选一个。整个推理栈无需GPU,可在100毫秒内返回结果。我们的主要基准测试是包含2,958对数据的XRec Google Local子集,在此评估了六种离线池选择器(LambdaRank、PPO、GRPO、DPO和两种阶段的教师-学生蒸馏)和三种知识图谱路径选择器(温度偏置随机游走、边不相交枚举和具有双风格生成的MMR重排路径)。一个包含300对数据、由Claude\-Sonnet\-4\.5生成参考答案的MovieLens\-1M子集被用作内部跨数据集一致性检查;由于目前尚无公开的MovieLens\-1M可解释推荐基准测试,这些数字应被视为论文内部一致性的证据,而非第二个基准测试。所有变体均使用与XRec和G\-Refer相同的BERTScore\-F1协议进行评分,结果在五个随机种子上取平均。LambdaRank在Google Local数据集上达到F1 = 0\.500,超过了G\-Refer和XRec在相同2,958对子集上的表现,并在MovieLens\-1M一致性检查上达到F1 = 0\.329。各强化学习方法的种子方差均低于0\.003 F1,排序结果在统计上是可靠的。这一发现在两个数据点上保持一致:在此密集标签的单步多臂老虎机设置中,成对学习排序方法优于单动作强化学习公式(PPO、GRPO、DPO),后者在每次迭代中仅采样一个带标签的候选,导致其他K−1个标签未参与梯度计算。知识图谱路径系列旨在实现不同的目标。其所有三个变体在Google Local上的USR均为1\.000,在MovieLens\-1M上为0\.997–1\.000,因为每次请求的路径定位为每个查询生成唯一输出,避免了可能影响缓存LLM输出的模板坍缩故障模式。对比Claude 3 Haiku和Claude Haiku 4\.5的生成器池研究显示,F1值有虽小但可测量的偏移(跨方法在0\.001–0\.006之间,其中较大范围超过了跨种子标准差),但选择器的相对排序得以保持。其定性设计含义是:选择器和生成器可以独立评估;绝对F1值确实依赖于生成器。在通用硬件上的端到端构建成本接近15美元。 ###### 关键词:可解释推荐,大型语言模型,学习排序,离线候选池 ## 1\.引言 推荐系统越来越多地在排序项目旁附上LLM生成的解释,希望几句上下文能提高用户信任度而不影响点击率。两个最近的基线定义了当前在我们所使用的公共基准测试上的技术水平。XRec(Ma等人,2024 (https://arxiv.org/html/2608.18531#bib.bib9))将基于GNN的偏好编码器与LLM头部结合;G\-Refer(Li等人,2025 (https://arxiv.org/html/2608.18531#bib.bib8))检索协同过滤邻居并使用8B参数LLM合成解释。两者都产生了强劲的BERTScore\-F1分数,并且都支付了相同的推理成本:每个请求调用一次LLM,数百毫秒的延迟,以及随流量线性增长的账单。这种推理成本促成了本项工作的开展。在每秒数万次查询、延迟预算有限的生产流量水平下,每个请求内联调用LLM是系统复杂性的不良部署,我们将其迁移到离线路径中。对于每个(用户,项目)对,我们使用六种提示风格和两个常用LLM(Amazon Nova Lite和Claude Haiku)预生成包含K个候选解释的池。在请求时,一个常驻CPU的小型选择器(可能是LightGBM LambdaRank模型(Burges,2010 (https://arxiv.org/html/2608.18531#bib.bib2))或一个约1M参数的MLP策略)从K个候选中挑选一个。选择器的前向传播仅需几毫秒;结合嵌入查找,在单个c5\.2xlarge核心上可在100毫秒内返回所选解释。服务时无需GPU,每次请求的成本降低为一次键值缓存查找。预生成池还创造了一个干净的实验环境:候选固定,标签(针对参考答案的BERTScore\-F1)密集,任何接受30维特征向量输入的选择器都可以接入。我们用此比较了组织为两个家族的九种选择器。离线池家族对来自冻结池的候选进行排序:结构奖励启发式、LightGBM LambdaRank、具有自适应熵的单步PPO(Schulman等人,2017 (https://arxiv.org/html/2608.18531#bib.bib11))、群组相对PPO(Shao等人,2024 (https://arxiv.org/html/2608.18531#bib.bib12))、DPO(Rafailov等人,2023 (https://arxiv.org/html/2608.18531#bib.bib10))和两阶段教师-学生蒸馏(Hinton等人,2015 (https://arxiv.org/html/2608.18531#bib.bib5))。知识图谱路径家族则更换了候选来源:它不从LLM池提取候选,而是从异构知识图谱中提取用户-项目路径,并基于每条路径条件生成LLM解释。我们测试了三种知识图谱变体:温度偏置随机游走、边不相交枚举和具有双风格生成的MMR重排路径。所有九种变体都在相同的两个测试集上使用XRec和G\-Refer相同的三指标评估协议进行评分。我们的主要实证发现与该领域近期工作的主流方向有所不同。在XRec Google Local基准测试上,LightGBM LambdaRank在相同的2,958对含评论子集上达到F1 = 0\.500,比已发表的G\-Refer 8B(0\.4592)高出0\.041,比已发表的XRec(0\.4311)高出0\.069。我们训练的五种强化学习或蒸馏变体(PPO、GRPO、DPO、蒸馏阶段A、蒸馏阶段A+B)均未达到此水平,并且差距稳健:在每种强化学习方法的五个种子间,标准差至多为0\.0030 F1,因此PPO < GRPO < DPO < 蒸馏阶段A < LambdaRank的排序在统计上是可靠的。知识图谱路径系列在F1上得分较低,但在USR指标上得分最高(Google Local上为1\.000,MovieLens\-1M上为0\.997–1\.000),因为每次请求的路径定位为每个查询生成唯一输出,避免了可能影响缓存LLM输出的模板坍缩故障模式。 ## 3\.方法 ### 3\.1\.知识图谱路径:温度偏置随机游走 给定一个用户-项目异构知识图谱G=(V,E)和目标用户u,我们执行温度偏置随机游走以生成K条候选路径P={p1,p2,...,pK},每条路径在用户节点u处启动。转移概率通过边类型权重W_e和可学习温度参数τ进行调整。对于从当前节点vi出发的边e=(vi,vj),转移概率与exp(W_e/τ)成正比。我们使用τ=1\.0进行探索,并执行1000次游走,修剪重复路径,取长度3-5的前K条唯一路径。每条路径p∈P作为提示条件:“基于路径{p}:[节点序列],为用户{u}解释为什么喜欢项目{i}。”然后将此提示输入LLM(Claude Haiku 4\.5)以生成解释。 ### 3\.2\.知识图谱路径:边不相交枚举 此方法旨在最大化从用户到项目在知识图谱中的路径多样性。我们首先提取用户u到项目i的所有简单路径(长度限制为5),然后使用贪心策略选择一组路径P,使得选择的路径集合共享的边最少。具体地,我们维护一个已使用边的集合E_used,并迭代选择能最大化|p∩E_used|最小化的路径p,直到选满K条路径或无更多路径可选。这确保了路径在图谱结构上尽可能分散。与温度偏置游走相同,每条选定的路径作为LLM的生成条件。 ### 3\.3\.知识图谱路径:MMR重排与双风格生成 此变体结合了路径选择和多样化生成。首先,我们使用MMR(最大边缘相关性)从候选路径池中选择一组K条路径,以平衡相关性与多样性。MMR得分公式为:MMR(p)=λ·Rel(p,pool)-(1-λ)·max_{q∈S}Sim(p,q),其中S是已选路径集合,λ=0\.7。Rel基于路径与用户-项目交互的嵌入相似度计算,Sim为路径嵌入间的余弦相似度。对于每个选中的路径p,我们使用两种不同的提示风格生成解释:一种是面向用户的对话风格(“作为你的助手,我推荐…因为…”),另一种是面向系统的分析风格(“从知识图谱路径分析,该项目与用户偏好的关联在于…”)。最终输出池包含K个路径×2种风格的候选解释。 ### 3\.4\.离线池构建:提示风格与LLM 我们使用两种常用LLM生成候选解释:Amazon Nova Lite和Claude Haiku。对于每个(用户,项目)对,应用六种提示风格以生成不同的解释视角: 1. **摘要式**:简要总结用户历史与项目属性。 2. **对比式**:突出用户偏好与项目特征的匹配点。 3. **推理式**:基于协同过滤信号进行因果推理。 4. **简洁式**:生成一句简短的推荐理由。 5. **详细式**:提供包含多方面理由的详细解释。 6. **面向属性式**:聚焦于项目的具体属性(如价格、评分、类别)。 因此,每个对生成12个候选解释(2个LLM × 6种风格),形成大小为K=12的离线池。 ### 3\.5\.选择器特征 所有选择器均使用相同的30维输入特征向量。这些特征包括: - **嵌入特征(10维)**:用户和项目嵌入的前5个主成分。 - **图特征(10维)**:从知识图谱中提取,如用户和项目的度中心性、路径长度等。 - **文本特征(10维)**:候选解释的预计算特征,如长度、困惑度、情感极性、关键词匹配分数等。 ### 3\.6\.LightGBM LambdaRank选择器 我们训练一个LightGBM模型使用LambdaRank目标进行学习排序。LambdaRank直接优化NDCG类指标。模型使用默认参数,特征维度为30,训练轮次为500。推理时,对K个候选的特征向量进行预测,选择得分最高的一个。 ### 3\.7\.PPO和GRPO选择器 我们训练一个约1M参数的MLP策略网络(两层,隐藏层维度256)。动作空间为离散的K个候选。PPO使用广义优势估计,剪切参数ε=0\.2。GRPO(组相对策略优化)扩展了PPO,通过在组(batch)内比较相对奖励来减少方差。两者均使用熵奖励以鼓励探索,熵系数β初始为0\.01,随训练衰减。训练在CPU上进行,每个更新处理256个状态-动作对。 ### 3\.8\.DPO选择器 DPO(直接偏好优化)将强化学习问题转化为监督学习问题。我们从离线池中为每个状态采样一对(a+, a-),其中a+是F1更高的解释,a-是更低的。在缩放F1上设定δ=2\.0的边距。定义学生策略πθ与冻结参考策略πref(随机初始化的MLP,在训练开始时快照)之间的对数比率rθ(a|s)=log πθ(a|s)-log πref(a|s)。每对贡献的损失为L(s, a+, a-)=−log σ(βdpo[rθ(a+|s)−rθ(a−|s)]),按F1差距加权,使梯度依赖于明确的配对。对数比率形式隐含了向参考的KL正则化;我们设置βdpo=0\.1,训练500个回合。成对监督比PPO或GRPO的单动作 rollout更密集:每个状态每个回合贡献许多梯度更新。参考锚也稳定了训练。经验上,DPO的跨种子标准差0\.0006 F1是我们测试的所有强化学习变体中最低的。 ### 3\.9\.教师-学生蒸馏(仅阶段A) 此变体将LambdaRank的信号直接转移到神经策略。在阶段A,我们在相同的30维特征上训练一个LightGBM LambdaRank教师,使用温度T=1\.0对其每组分数进行softmax,然后训练MLP学生(与PPO/GRPO/DPO相同的架构)最小化与教师软分布的KL散度,学习率10−4,训练200个回合。学生直接继承教师的每候选排名,压缩为约1M参数,前向传播比LightGBM集成快10倍。在Google Local上,它达到F1 = 0\.4817±0\.0003,略低于LambdaRank的0\.5003。剩余差距是softmax压缩的产物:蒸馏将近似均匀的质量传播到高排名候选,而非教师的argmax,学生无法恢复丢失的尖锐性。 ### 3\.10\.蒸馏加强化学习微调(阶段A+B) 阶段A产生了一个近乎最优的学生;自然的后续是使用强化学习对其进行微调,以恢复剩余的F1差距。我们在蒸馏策略之上增加了500个回合的GRPO,使用降低的学习率(10−4)和更紧的熵调度(β∈[0\.05, 0\.005])。结果是性能退化。阶段A+B得分0\.4767,而阶段A为0\.4817,在五个种子间表现出超过10σ的退化。其机制在于熵奖励:它将一个近乎收敛的策略推回探索,远离教师诱导的argmax。移除熵项可恢复约一半的退化。这表明,在蒸馏后进行强化学习微调仅在蒸馏策略仍远未达到最优时才有益,而本实验不满足此条件。知识图谱路径系列(§3\.1 (https://arxiv.org/html/2608.18531#S3.SS1)–§3\.3 (https://arxiv.org/html/2608.18531#S3.SS3))和离线池系列(§3\.4 (https://arxiv.org/html/2608.18531#S3.SS4)–§3\.10 (https://arxiv.org/html/2608.18531#S3.SS10))涵盖了框架的两个自然维度:前者改变*候选源*同时固定选择器架构,后者改变*选择器*同时固定一个LLM候选池。表1 (https://arxiv.org/html/2608.18531#S5.T1)(§5\.1 (https://arxiv.org/html/2608.18531#S5.SS1))报告了所有九种变体在相同三指标评估协议下的结果。 ## 4\.数据集与评估 ### 4\.1\.数据集 **Google Local**。我们使用XRec基准测试(Ma等人,2024 (https://arxiv.org/html/2608.18531#bib.bib9))发布的标准划分:trn\.pkl(94,663对)和tst\.pkl(3,000对),直接使用,未进行预处理或重新划分。从trn\.pkl中,我们确定性采样5,000对,过滤到有评论覆盖的项目(2,495家商户);从tst\.pkl中,我们在所有3,000对上评估,但在评分时丢弃42个无覆盖对,留下2,958个测试对。我们验证了这些对与G\-Refer发布的google\_pred\.jsonl(Li等人,2025 (https://arxiv.org/html/2608.18531#bib.bib8))的字节级一致性:每个测试对(uid, iid)和每个参考解释都匹配。 **MovieLens\-1M**。在标准MovieLens\-1M评分数据集(Harper和Konstan,2015 (https://arxiv.org/html/2608.18531#bib.bib4))基础上,我们使用来自train\_sonnet45\_refs\.jsonl的2,000个由Claude\-Sonnet\-4\.5生成的参考解释,在种子42的洗牌后按位置划分:600对用于训练,300对用于测试(剩余1,100个未使用)。候选池使用Claude Haiku 4\.5 + Nova Lite,每对K=18个候选。我们使用Claude\-Sonnet\-4\.5作为比任何被评估选择器更强的预言机,这避免了因使用与生成我们候选池相同的LLM家族进行评估而可能产生的循环论证问题。 **MovieLens上的知识图谱路径系列**。MMR + 双风格变体在相同的600对MovieLens子集上重新训练。温度偏置游走和边不相交枚举使用在Google上训练的策略在MovieLens测试集上评估:MovieLens图(9,941个节点,581k条边,密度0\.012)使几乎所有用户→电影路径都通过18个类别节点之一,这使得这些路径提取原语在被迫寻找多样路径时变得异常缓慢,否则会退化为最短路径回退。在MovieLens上的所有三种知识图谱配置中,F1均落在±0\.005范围内,这与我们的更广泛发现(§5\.4 (https://arxiv.org/html/2608.18531#S5.SS4))一致,即在该数据集上,选择器的选择影响有限——类别中心拓扑限制了可到达的路径多样性,与选择算法无关。 ### 4\.2\.评估协议 所有方法都在相同的参考解释下使用三个指标进行评估。 **BERTScore\-F1**。使用roberta\-large编码器和基线缩放计算(等同于bert\-score库中的rescale\_with\_baseline=True),与XRec和G\-Refer发布的评估代码字节级一致。这是我们的主要指标。 **BARTScore**(Yuan等人,2021 (https://arxiv.org/html/2608.18531#bib.bib16))。在facebook/bart\-large\-cnn下的对数似然log p(reference|prediction)(批量大小4,CPU)。值越高(负值越小)越好。 **USR(唯一句子比率)**。测试集中输出结果经空白分词后唯一的比例。用于标记仅靠F1可能遗漏的模板坍缩故障模式。 XRec和G\-Refer发布的预测(分别为tst\_pred\.pkl和google\_pred\.jsonl)可供使用,因此我们在完全相同的2,958对子集上使用我们的评估代码重新评分;这些重新运行与我们方法的结果具有直接可比性。表1 (https://arxiv.org/html/2608.18531#S5.T1)中的已发表论文数字直接引用自各论文的评估集,该评估使用完整的3,000对测试划分(比我们的含评论覆盖子集少42对),并且可能使用了略有不同的bert\-score库版本。我们在表中保留了这两行,因为已发表的数字是社区参考的,但严格的直接可比性比较存在于我们的离线池选择器与缓存预测的重新运行之间,而不是我们的选择器与已发表数字之间。 ## 5\.结果 ### 5\.1\.主要比较 表1 (https://arxiv.org/html/2608.18531#S5.T1)报告了Google Local(我们的主要基准)和MovieLens\-1M(内部一致性检查)上的所有三个指标。在Google Local上,LambdaRank达到F1 = 0\.500,分别超越G\-Refer +0\.041和XRec +0\.069。离线池系列的所有六个变体在F1上都超越了XRec;其中五个(GRPO、DPO、蒸馏\-AB、蒸馏\-A、LambdaRank)也超越了G\-Refer。三种知识图谱路径变体在F1上表现不如离线池系列,但获得了最高的USR分数(1\.000),反映了参考对齐与输出多样性之间不同的权衡。在MovieLens\-1M上,针对相同的300对子集和Claude\-Sonnet\-4\.5参考文本,LambdaRank达到F1 = 0\.329,比仅使用池的结构启发式(0\.263)高出0\.066。由于参考解释由更强的模型(Claude\-Sonnet\-4\.5)生成,此分数表明,即使选择器相对简单,高质量的参考答案也能提升性能。
相似文章
主动学习作为高效的PRP重排序器
本文将有对排名提示(PRP)重新定义为从噪声比较中进行主动学习,引入了一个具有随机方向预测器的噪声鲁棒框架,以在调用约束下提高排名质量并解决位置偏差问题。
作为高效PRP重排序器的主动学习器
提出将成对排名提示(PRP)重排序重新构建为从噪声成对比较中进行主动学习,在预算约束下提高每次调用的NDCG@10,并引入一种随机方向预言机,减少每对所需的LLM调用次数。
离线选择器为何无法胜过最佳单一模型:基于edX辍学预测的诊断性研究
本文提出了一个三阶段诊断框架,用于识别离线模型选择器为何无法胜过最佳单一模型,并将其应用于edX点击流数据上的辍学预测。研究发现瓶颈在于局部表征歧义,而非学习器选择或分布偏移,建议重新设计状态或收集新数据,而非进一步调优算法。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
AdaKP:面向推理的强化学习的在线自适应知识点选择
介绍了AdaKP,一种在线自适应知识点选择器,能够在强化学习训练过程中动态重新选择注入哪些原子提示,以缓解推理任务中的奖励稀疏问题,在竞赛级数学基准上取得了改进,且开销可忽略不计。