PEARL:基于对比学习的无偏分位数估计在工业级直播推荐中的应用
摘要
PEARL引入了一种对比分位数近似框架,用以缓解推荐系统中的行为强度不平衡问题,在服务数十亿用户的生产级直播平台上实现了参与度指标的显著提升。
arXiv:2605.21752v1 公告类型:新
摘要:基于用户交互数据训练的推荐系统容易受到行为强度不平衡的影响——这是一种由用户间不同参与模式引起的系统性偏差。这种不平衡会扭曲反馈信号,使得观察到的交互不再真实反映用户的偏好,导致模型不成比例地放大高活跃用户的信号而低估其他用户,最终损害推荐系统在大规模部署下的质量和鲁棒性。为了解决这一问题,我们提出了一种非参数对比分位数近似框架PEARL,该框架建模相对偏好信号而非绝对参与量。基于相对优势去偏技术,PEARL直接利用真实的对比交互样本来近似分位数关系,无需依赖辅助分布估计模型。我们提供了理论证明,表明这种成对比较能够无偏地估计基于分位数的偏好信号。为了增强通用性,我们引入了一种基于预测的自举机制来实现分位数平滑,以处理稀疏和离散的反馈,同时结合了广义值加权公式和协同训练策略,以提高建模灵活性和表示学习能力。大量的离线实验表明,PEARL有效缓解了行为偏差,并在多个排序目标上持续提升了推荐性能。在拥有数十亿用户的生产级直播平台上的在线A/B测试证实了实际收益:观看时长+2.10%,消费金额+0.80%,互动率+1.49%,举报率-6.91%。
查看缓存全文
缓存时间: 2026/05/22 08:51
# PEARL:通过对比学习实现工业级直播推荐的无偏百分位数估计 来源:https://arxiv.org/html/2605.21752 \(2018\) ###### 摘要 基于用户交互数据训练的推荐系统容易受到行为强度不平衡的影响——这是一种由用户间不同参与模式导致的系统性扭曲。这种不平衡扭曲了反馈信号,使得观察到的交互不再真实反映用户的真实偏好,导致模型不成比例地放大了高活跃用户的信号,而低估了其他用户,最终在大规模场景下损害推荐质量和鲁棒性。为解决这一问题,我们提出了一种非参数对比百分位数近似框架PEARL,该框架建模相对偏好信号而非绝对参与量级。基于相对优势去偏方法,PEARL直接利用真实的对比交互样本来近似百分位关系,无需依赖辅助分布估计模型。我们提供了理论证明,表明这种成对比较能产生基于百分位数的偏好信号的无偏估计。为了更广泛的适用性,我们引入了一种基于预测的自举机制来处理稀疏离散反馈的百分位平滑,同时提出广义加权公式和协同训练策略,以增强模型灵活性和表示学习。大量离线实验表明,PEARL有效缓解了行为偏差,并在多个排序目标上持续提升推荐性能。在拥有数十亿用户的生产级直播平台上,在线A/B测试验证了显著的现实收益:观看时长提升+2.10%,消费金额提升+0.80%,互动率提升+1.49%,举报率降低-6.91%。 学习排序,对比学习,推荐系统 ††版权:acm授权 ††期刊年份:2018 ††DOI:XXXXXXX.XXXXXXX ††会议:请从您的权利确认邮件中输入正确的会议标题;2018年6月3-5日;纽约州伍德斯托克 ††ISBN:978-1-4503-XXXX-X/2018/06 ††CCS:信息系统 推荐系统 ††CCS:信息系统 学习排序 ††CCS:信息系统 多媒体流媒体 ## 1. 引言 现代推荐系统依赖大规模用户交互数据来学习个性化模型,以优化参与度、满意度和平台价值 (Zhang等人, 2024 (https://arxiv.org/html/2605.21752#bib.bib1))。这一范式的核心假设是:观察到的反馈(如点击、观看时长或基于消费的交互)是潜在用户偏好的可靠代理变量。然而在实践中,用户交互不仅受内在兴趣影响,还受系统性行为异质性影响:一些用户通过频繁活动或高价值行为产生密集信号,而另一些用户则稀疏或被动地互动 (Li等人, 2017 (https://arxiv.org/html/2605.21752#bib.bib49); Zhou等人, 2018 (https://arxiv.org/html/2605.21752#bib.bib48))。这种行为强度差异导致反馈分布极不均匀,一小部分高度活跃或高消费用户不成比例地主导训练信号 (Park和Tuzhilin, 2008 (https://arxiv.org/html/2605.21752#bib.bib31); Abdollahpouri等人, 2019 (https://arxiv.org/html/2605.21752#bib.bib43))。这种不平衡在观察到的交互和真实偏好之间造成了结构性错配,使学习到的模型偏向于由活动水平或消费倾向驱动的模式,而非用户的真实意图 (Joachims等人, 2017 (https://arxiv.org/html/2605.21752#bib.bib44); Wang等人, 2018 (https://arxiv.org/html/2605.21752#bib.bib50))。 观察到的交互与真实偏好之间的错配,促使了推荐系统中去偏技术的广泛研究。一条主要研究路线通过反事实学习和基于倾向的重新加权来解决偏差,调整交互样本以更好地逼近无偏偏好信号 (Swaminathan和Joachims, 2015 (https://arxiv.org/html/2605.21752#bib.bib51); Schnabel等人, 2016 (https://arxiv.org/html/2605.21752#bib.bib45))。另一类方法采用因果推断框架来建模用户行为与观察到的反馈之间的关系,旨在将内在兴趣与混杂效应分离开来 (Bonner和Vasile, 2018 (https://arxiv.org/html/2605.21752#bib.bib46); Zhan等人, 2022 (https://arxiv.org/html/2605.21752#bib.bib38))。最近,还提出了表示级别的去偏方法,以防止深度模型将虚假行为伪影直接编码到用户嵌入中 (Liang等人, 2018 (https://arxiv.org/html/2605.21752#bib.bib52); Ma等人, 2019 (https://arxiv.org/html/2605.21752#bib.bib47); Chen等人, 2021 (https://arxiv.org/html/2605.21752#bib.bib53))。尽管这些方法有效,但它们大多将偏差视为交互数据分布的一个属性,而隐含地假设用户反馈遵循同质的行为模式。 一种更直接的解决参与度偏差的方法是通过相对偏好建模。RAD (Liu等人, 2025 (https://arxiv.org/html/2605.21752#bib.bib33)) 不是修正原始反馈,而是提出通过估计条件参与分布并将其转换为基于百分位数的偏好得分,从而将观看时长观察值转换为相对优势信号,进而标准化不同用户间的异质参与模式。虽然有效,但这种方法依赖于一个辅助模型来近似参与分布,引入了额外的建模复杂性和潜在的估计误差。 受此视角启发,我们提出了PEARL,一个轻量级但有原则的框架,它通过训练数据中自然观察到的对比样本来近似相对偏好信号。对于每个用户,PEARL构建交互之间的成对比较信号,通过二元交叉熵目标从观察到的参与中学习预测相对偏好排序。通过利用这种自然发生的比较,PEARL消除了显式分布估计的需要,提供了一种更简单且非参数的相对优势建模路径,同时直接缓解了行为强度偏差。 本文的主要贡献如下: - **用户去偏框架**:我们识别出行为强度不平衡是推荐系统中用户侧偏差的关键来源,其中异质参与行为导致偏斜的交互信号和扭曲的偏好学习。为解决此问题,我们提出了一个非参数对比百分位数近似框架,从真实交互比较中推导出相对偏好信号,避免了显式分布估计。我们进一步提供了理论证明,表明这种对比比较构成了基于百分位数的相对优势信号的无偏近似。 - **面向真实世界推荐的扩展**:基于核心公式,我们开发了几种实用扩展以提高鲁棒性和适用性:一种基于预测的自举机制用于百分位平滑,通过用连续的先验预测替换粗糙的经验分布来缓解标签稀疏性;一种考虑异质交互重要性的加权公式;以及一种通过互补监督信号丰富表示学习的协同训练策略。这些扩展共同使PEARL能够处理稀疏、离散反馈,并适应多样的推荐场景。 - **实证有效性**:大量离线实验表明,PEARL一致地缓解了行为偏差,并在多个排序目标上提升了以用户AUC衡量的推荐性能。此外,一系列在线A/B测试显示,在我们在全球拥有数十亿用户的领先在线直播平台上,PEARL在生产推荐系统中实现了观看时长提升+2.1%,消费金额提升+0.80%,互动率提升+1.49%,举报率降低-6.91%。 ## 2. 相关工作 ### 2.1. 用户行为建模 现代推荐系统旨在通过用户参与度的量化来提供个性化内容。这种参与度可以通过各种用户行为来量化,如观看时长、长期留存和基于消费的交互。在这些行为中,回归目标(如观看时长和消费金额)是许多先前工作的重点,主要是因为它们与用户兴趣和参与度高度相关,且建模困难。早期的观看时长技术,如加权逻辑回归 (Covington等人, 2016 (https://arxiv.org/html/2605.21752#bib.bib34)),使用观看时长来加权训练中的曝光样本。CREAD (Sun等人, 2024 (https://arxiv.org/html/2605.21752#bib.bib35)) 通过离散化、分类和恢复的训练优化方法来解决观看时长的长尾分布问题。这些方法优化了模型训练,但并未考虑实例特征中的固有偏差,如时长偏差或曝光偏差。因此,这些方法对用户偏差产生负面影响,因为高值的样本在训练中被过度代表。 ### 2.2. 捕捉建模偏差 为了应对不同来源的偏差,已有各种工作提出了目标训练的去偏解决方案。DVR (Zheng等人, 2022 (https://arxiv.org/html/2605.21752#bib.bib36)) 使用对抗学习来专门去除视频时长偏差。D2Co (Zhao等人, 2023 (https://arxiv.org/html/2605.21752#bib.bib37)) 针对时长和噪声偏差,使用高斯混合模型来估计两者。然而,由于长尾分布,这些方法可能导致较差的泛化能力。为了纠正这一点,研究者提出了分位数回归策略,以更好地捕捉观看时长的完整分布,而不是单一期望值。例如,D2Q (Zhan等人, 2022 (https://arxiv.org/html/2605.21752#bib.bib38)) 按时长对视频进行分段,并在每组内拟合分位数回归,而CQE (Lin等人, 2024 (https://arxiv.org/html/2605.21752#bib.bib39)) 通过建模完整的观看时长分布扩展了这一点,从而在偏斜或不确定的参与模式下实现更灵活的推理。RAD (Liu等人, 2025 (https://arxiv.org/html/2605.21752#bib.bib33)) 在这些工作的基础上,相对于以用户和物品为条件的经验推导参考分布来修正观看时长,解决了与用户、物品和推荐系统相关的多种偏差。虽然这些方法在视频推荐环境下效果良好,但它们不能高效地迁移到直播推荐的场景中。 ### 2.3. 直播推荐中的去偏 直播推荐由于其内容格式的特性而呈现出独特的偏差挑战。与视频推荐不同,直播的时长偏差不严重,因为平均观看时长远小于直播的平均时长。其他工作通过引入更全面的信号来优化直播推荐建模,如ContentCTR中的视频和音频信号 (Deng等人, 2023 (https://arxiv.org/html/2605.21752#bib.bib41)),或训练配置优化,如(Zhao等人, 2025 (https://arxiv.org/html/2605.21752#bib.bib40))提出的多时间窗口。在混合格式平台上,用户对特定内容格式(如短视频)的强烈偏好可能会引入偏差,导致其他格式被跳过,尽管它们可能与用户的潜在兴趣相符。因此,用户在直播内容上的行为可能与他们在短视频上的行为截然不同,导致直播推荐中用户行为的更大方差。我们提出了一种去偏方法,在直播推荐中将内容兴趣与格式不感兴趣分离,从有限交互信号中恢复有意义的信号以吸引用户。我们的方法从稀疏交互信号中捕捉用户对直播格式的兴趣,并可应用于应用中其他少数供应内容(不限于直播)。与先前工作相比,我们的方法聚焦于混合格式场景下直播推荐面临的挑战,因此我们关注用户偏差问题而非时长偏差问题。 ## 3. 方法 在工业级推荐系统中,直接在[0,1][0,1]区间内对连续百分位数值进行回归并非易事。这种复杂性源于两个主要障碍:实时分布跟踪的系统性开销以及百分位数回归本身固有的建模挑战。更根本的是,如第3.1节 (https://arxiv.org/html/2605.21752#S3.SS1)所述,一个稳健的排序框架必须有效区分用户侧行为强度与内在偏好,以解决固有的用户偏差。为应对这些挑战,我们引入了基于对比学习的百分位数估计与回归(PEARL)框架用于推荐系统。PEARL通过一种无分布对比学习范式,将预测目标从原始量级(例如观看时长)转换为相对用户级百分位数,从而在不同用户群体间恢复一致的偏好信号。PEARL框架的概述在图1 (https://arxiv.org/html/2605.21752#S3.F1)中系统说明。  用户键控的存储池(N=50),动态维护无偏历史分布。(2) 对比学习:一个多样本比较器,交叉评估模型预测与历史样本,计算多样本对比损失(LMBCE),无需显式分布跟踪。) 本节组织如下。我们首先阐述标准回归建模的局限性和百分位数建模的动机(第3.1节 (https://arxiv.org/html/2605.21752#S3.SS1))。然后我们通过**单样本对比学习**推导出一个无偏百分位数估计器(第3.2节 (https://arxiv.org/html/2605.21752#S3.SS2)),并引入**多样本对比学习**以减少估计方差(第3.3节 (https://arxiv.org/html/2605.21752#S3.SS3))。为了弥合相对排序与奖励量级之间的差距,我们将框架扩展为广义的**值加权对比学习**(第3.4节 (https://arxiv.org/html/2605.21752#S3.SS4))。此外,我们通过**基于预测的自举机制**(第3.5节 (https://arxiv.org/html/2605.21752#S3.SS5))解决离散分类目标(例如点击或礼物)的挑战,并提出一种**协同训练策略**来增强标准回归目标的排序能力(第3.6节 (https://arxiv.org/html/2605.21752#S3.SS6))。最后,我们涵盖PEARL在十亿级推荐系统中实现的实际考量(第3.7节 (https://arxiv.org/html/2605.21752#S3.SS7))。 ### 3.1. 问题形式化与动机 在推荐系统中,排序模型通常设计为预测给定用户对多个候选物品的偏好。标准回归范式通常试图拟合连续的隐式或显式反馈目标,例如观看时长、消费金额等。
相似文章
轻量级排序头:加速生产推荐系统中的多任务实验
本文介绍了轻量级排序头框架,通过启用动态任务注入,无需重新训练骨干模型,来加速生产推荐系统中的多任务实验,从而在YouTube规模下将迭代周期从数周缩短至数天。
通过后分层降低排序实验中重尾变现指标的方差
研究人员提出了一种实用的方差缩减框架,将后分层与 CUPED 相结合,用于处理排序实验中的重尾变现指标。该框架已在 ShareChat 部署,可在减少 45% 流量的情况下达到同等统计置信度。本文已被 SIGIR 2026 收录。
PPDL:结合物理先验与深度学习的真实工业用户留存率预测框架
PPDL是一种新颖的预测框架,它结合物理先验与深度学习来预测多渠道付费用户获取中的用户留存率,解决了渠道异质性和时间模式等挑战,并在工业数据集上验证了改进效果。
基于预测驱动推理的统计可靠LLM排名评估
本文介绍了PRECISE,它是预测驱动推理(Prediction-Powered Inference)的一种扩展,将少量人工标注与大量LLM判断结合,以生成无偏且方差减小的排名评估指标(如Precision@K)估计。该方法在ESCI基准测试和实际生产环境的A/B测试中进行了验证,仅使用100个人工标注就正确识别出了最佳系统变体,并通过+407 bps的销售改进得到了确认。
主动学习作为高效的PRP重排序器
本文将有对排名提示(PRP)重新定义为从噪声比较中进行主动学习,引入了一个具有随机方向预测器的噪声鲁棒框架,以在调用约束下提高排名质量并解决位置偏差问题。