OrDA:面向首页营销区块推荐的正交解耦访问习惯框架
摘要
OrDA 是一个利用正交正则化和因果干预,在首页营销区块推荐中将用户访问习惯与真实内容兴趣解耦的框架,在芝麻信用首页上实现了 5.64% 的 UCTR 提升。
arXiv:2607.13420v1 公告类型:新
摘要:首页营销区块的点击由内容兴趣和访问习惯的双重机制驱动。然而,习惯性点击往往在营销位中产生伪正样本,位置优势掩盖了平庸的内容质量,导致推荐系统产生偏差。我们提出了一种名为正交解耦访问习惯(OrDA)的框架来净化兴趣信号。OrDA 采用双塔结构,并引入门控分配层自适应地路由特征、最小化干扰。为确保严格分离,我们使用正交正则化约束潜在的兴趣和习惯流形在几何上正交。OrDA 在推理阶段进行因果干预(do-演算),仅根据净化后的兴趣分数对项目进行排序。在大型数据集上的在线实验表明,OrDA 有效消除了访问习惯偏差,在预测准确性上优于当前最先进的方法。在线 AB 测试显示,在芝麻信用首页营销区块和芝麻信用租房推荐中,用户点击率(UCTR)提升了 5.64%。
查看缓存全文
缓存时间: 2026/07/16 04:22
# OrDA:面向首页营销块推荐的访问习惯正交解耦框架
来源:https://arxiv.org/html/2607.13420
###### 摘要。
首页营销块的点击受内容兴趣和访问习惯的双重机制驱动。然而,习惯性点击往往在营销位中产生“伪正例”,即位置优势掩盖了平庸的内容质量,导致推荐生态系统的偏差。
我们提出一个名为访问习惯正交解耦(OrDA)的框架,用于净化兴趣信号。OrDA采用双塔结构并配有门控分配层,以自适应地路由特征并最小化干扰。为确保严格分离,我们使用正交正则化将潜在的兴趣和习惯流形约束为几何垂直。推理时,OrDA执行因果干预(do-演算(Tucci,2013(https://arxiv.org/html/2607.13420#bib.bib11))),仅根据纯净的兴趣分数对物品进行排序。在大规模数据集上的在线实证评估表明,OrDA有效消除了访问习惯偏差,在预测准确性上优于现有最先进方法。在线A/B测试显示,芝麻首页营销块(芝麻租房推荐)的用户点击率(UCTR)提升了5.64%。
解耦学习,因果干预,推荐系统
††ccs:信息系统 检索模型与排序
## 1. 引言
互联网应用的首页可概括为具有核心功能:从海量内容到用户兴趣的精准导航和生态分发。首页营销块(如图1(https://arxiv.org/html/2607.13420#S1.F1)所示)起到将海量用户流量引导至不同垂直子场景(Zheng 等,2025(https://arxiv.org/html/2607.13420#bib.bib16))的作用。这些模块经常遭受一种微妙而广泛的混杂偏差:用户-频道访问习惯依赖性。具体而言,在突出的营销块中——经常被“重度用户”作为其日常数字旅程的一部分访问——观察到的点击数据常被“伪正例”污染。这些交互并非由用户兴趣与内容之间的真实匹配驱动,而是由用户在其主要访问渠道中的习惯性惯性驱动。
请参阅图注
图1. 芝麻首页营销块推荐示例
标准模型将所有点击视为同等偏好信号,不经意地捕获了这种“习惯性红利”,导致用户兴趣的扭曲表示。从因果角度看,用户的频道亲和力充当了混杂因子,仅仅因为内容处于用户的“最小阻力路径”上就夸大了其感知效用。因此,这类模型通常对冷启动用户表现不佳,并且难以泛化到更广泛、非习惯性的场景,因为它们难以区分用户-频道访问习惯与用户-内容兴趣。
为了解决这个问题,我们提出了面向首页营销块推荐的访问习惯正交解耦(OrDA)框架。本工作的主要贡献总结如下:
- **访问习惯偏差的问题形式化**:我们对首页营销块中普遍存在的访问习惯偏差进行了正式的因果分析。与传统暴露偏差不同,我们识别并定义了习惯诱发的伪正例现象,即用户在主要入口点的导航惯性掩盖了其真实的内容偏好,为偏差分解提供了新的视角。
- **访问习惯的正交解耦(OrDA)**:我们提出OrDA框架,一种新颖的多塔架构,旨在将用户意图与习惯性访问模式解耦。我们的模型通过正交正则化和基于do-演算的干预策略,有效隔离用户-内容兴趣与用户-频道访问习惯之间的虚假相关性。
- **在工业数据集上的优越性能**:在广泛的离线实验中,OrDA在芝麻首页数据集上达到了最先进的性能。在线A/B测试显示,芝麻租房推荐的UCTR提升了5.64%。
## 2. 相关工作
### 2.1. 推荐系统中的去偏
识别和消除偏差(如位置偏差(Guo 等,2019(https://arxiv.org/html/2607.13420#bib.bib4))和流行度偏差(Zheng 等,2021a(https://arxiv.org/html/2607.13420#bib.bib17)))对于构建鲁棒的推荐系统至关重要(Chen 等,2023(https://arxiv.org/html/2607.13420#bib.bib3))。传统方法主要包括基于倾向性的方法(Schnabel 等,2016(https://arxiv.org/html/2607.13420#bib.bib9);Zheng 等,2025(https://arxiv.org/html/2607.13420#bib.bib16)),该方法根据曝光概率对样本重新加权;双学习(Wang 等,2019(https://arxiv.org/html/2607.13420#bib.bib13);Zhang 等,2020(https://arxiv.org/html/2607.13420#bib.bib15);Zhu 等,2023(https://arxiv.org/html/2607.13420#bib.bib20)),学习辅助模型来估计偏差;解耦表示学习(Zheng 等,2021a(https://arxiv.org/html/2607.13420#bib.bib17),b(https://arxiv.org/html/2607.13420#bib.bib18)),使用对比学习将兴趣与从众分离;以及伪标签方法(Huang 等,2024(https://arxiv.org/html/2607.13420#bib.bib5)),通过为未观察到的条目分配估计标签来完善反事实空间。我们的工作与这些不同,专门关注首页场景中的访问习惯,并通过几何正交约束(而非简单的分数调整)进行去偏,以强制执行清晰的因果边界,并确保用户内在兴趣的更鲁棒表示。
### 2.2. 多塔架构与因果推理的协同
多塔模型(例如,ESMM(Ma 等,2018a(https://arxiv.org/html/2607.13420#bib.bib8)),MMOE(Ma 等,2018b(https://arxiv.org/html/2607.13420#bib.bib7)),PLE(Tang 等,2020(https://arxiv.org/html/2607.13420#bib.bib10)))在工业推荐中被广泛用于处理多个任务。实际上,这些架构为任务或特征分解提供了结构基础(Zhang 等,2020(https://arxiv.org/html/2607.13420#bib.bib15);Zhu 等,2023(https://arxiv.org/html/2607.13420#bib.bib20);Zheng 等,2025(https://arxiv.org/html/2607.13420#bib.bib16);Wang 等,2022(https://arxiv.org/html/2607.13420#bib.bib12))。从因果角度看,传统多塔模型一个显著的限制是特征干扰:由于塔通常共享公共嵌入底层,来自有偏信号(例如访问习惯)的梯度很容易污染其他塔(例如内容兴趣)的表示。我们的工作通过将多塔拓扑重新解释为结构因果模型(SCM)的物理实现,推进了这种结构分解。
## 3. 方法
### 3.1. 问题定义
为了正式描述习惯诱发的伪正例机制,并证明OrDA架构的合理性,我们使用因果图来表示首页营销块中的数据生成过程。如图2(https://arxiv.org/html/2607.13420#S3.F2)所示,我们定义以下变量:
- \(X\):用户-内容对。
- \(H\):潜在的导航惯性或访问习惯偏差。
- \(I\):用户对内容的潜在兴趣。
- \(Y\):观察到的点击结果。
- \(u\):用户特征,如人口统计偏好。
- \(c\):内容特征,如类别和质量。
- \(u2c\):用户对内容的统计特征。
请参阅图注
图2. 训练ESMM方法、倾向性方法、OrDA的因果图。空心圆表示潜在变量,阴影圆表示观测变量。
我们将用户-频道访问习惯和用户-内容兴趣定义为支配首页营销块点击行为的主要因素。这些潜在空间的结构方程如下:
\(1\) \[\begin{cases} I = f_I(u, c, u2c), \\ H = f_H(u) \end{cases}\]
我们旨在从混淆中获得纯粹的用户-内容兴趣。图2(a)展示了ESMM方法(Ma 等,2018a(https://arxiv.org/html/2607.13420#bib.bib8)),它使用两个塔分别预测访问习惯概率 \(P(\hat{h}) = \sigma(H)\) 和用户-内容兴趣概率 \(P(\hat{i}) = \sigma(I)\),并将它们相乘来预测习惯诱发的用户兴趣概率 \(P(\hat{y}) = \sigma(Y)\):
\(2\) \[P(\hat{y}) = P(\hat{h}) \cdot P(\hat{i})\]
这种方法并未在两个塔之间强制执行清晰的因果边界或关系,因此引入了错误的独立先验。
图2(b)展示了基于倾向性的方法(Wang 等,2022(https://arxiv.org/html/2607.13420#bib.bib12);Zhu 等,2023(https://arxiv.org/html/2607.13420#bib.bib20);Zheng 等,2025(https://arxiv.org/html/2607.13420#bib.bib16);Zhang 等,2020(https://arxiv.org/html/2607.13420#bib.bib15)),它将反事实推理整合到多任务学习中,通过逆倾向加权技术和do-演算(Tucci,2013(https://arxiv.org/html/2607.13420#bib.bib11))来缓解选择偏差。习惯诱发的用户兴趣概率定义为:
\(3\) \[P(\hat{y}) = P(\hat{h}) \cdot P(\hat{i} | do(\hat{h}=1))\]
在训练阶段,该方法添加另一个塔来预测习惯诱发的兴趣概率 \(P(\hat{i} | do(\hat{h}=1)) = \frac{P(\hat{y})}{P(\hat{h})}\)。依赖数值重新加权的表达式除法形式可能遭受高方差和不稳定性。
OrDA(如图2(c)所示)将因果哲学扩展到表示层面,如下式所示:
\(4\) \[Y = H \oplus I\]
其中 \(\oplus\) 表示联合logit融合,代表潜在空间中用户-内容内在兴趣与访问习惯之间的加性交互。我们的模型假设 \(I\) 和 \(H\) 是并行的因果驱动因素,当内容满足用户兴趣或该模块触发其访问习惯时,点击发生。因此,我们强制执行潜在正交约束,以确保兴趣塔本质上是习惯混杂因子的不变项。
### 3.2. 训练与反事实推理
在训练阶段,偏差CTR和习惯的损失函数定义为:
\(5\) \[\begin{cases} \mathcal{L}_{bCTR} = \mathcal{L}_{BCE}(y, \sigma(Y)) = \mathcal{L}_{BCE}(y, \sigma(H \oplus I)) \\ \mathcal{L}_{Habit} = \mathcal{L}_{BCE}(y, \sigma(H)) \end{cases}\]
其中 \(\mathcal{L}_{BCE}\) 是二元交叉熵损失:
\(6\) \[\mathcal{L}_{BCE} = -\frac{1}{N}\sum_{i=1}^{N}\left[ y_i \log(p_i) + (1-y_i)\log(1-p_i) \right]\]
其中 \(y\) 是真实标签,\(p\) 是正类概率。为确保严格分离,采用正交余弦正则化(Luo 等,2017(https://arxiv.org/html/2607.13420#bib.bib6);Bousmalis 等,2016(https://arxiv.org/html/2607.13420#bib.bib2))来约束潜在流形,强制兴趣向量和习惯向量几何垂直:
\(7\) \[\mathcal{L}_{Orth} = \left( \frac{\mathbf{v}_{int} \cdot \mathbf{v}_{hab}}{\|\mathbf{v}_{int}\| \cdot \|\mathbf{v}_{hab}\|} \right)^2\]
其中 \(\mathbf{v}_{int}\) 是兴趣塔向量,\(\mathbf{v}_{hab}\) 是习惯塔向量。总损失函数如下:
\(8\) \[\mathcal{L}_{total} = \mathcal{L}_{bCTR} + \alpha \cdot \mathcal{L}_{Habit} + \beta \cdot \mathcal{L}_{Orth}\]
其中 \(\alpha\) 和 \(\beta\) 是控制习惯任务和正交任务权重的超参数。
在在线推理阶段,对习惯变量进行因果干预以消除伪正例效应。形式上,通过应用 do-算子 \(do(H=0)\) 计算纯净的用户-内容兴趣分数 \(S\):
\(9\) \[S = \mathbb{E}[Y \mid I, do(H=0)] = \sigma(I)\]
### 3.3. 模型架构
如图3(https://arxiv.org/html/2607.13420#S3.F3)所示,模型架构由三个核心组件组成:门控分配层(GAL)、骨干模型(BM)和因果融合层(CFL)。
请参阅图注
图3. OrDA的模型架构。整个组件用于训练阶段,蓝色框内的组件用于在线推理阶段。
#### 3.3.1. 门控分配层(GAL)
解耦学习中的一个潜在陷阱是信息抑制,其中正交约束可能无意中从共享嵌入中擦除通用用户信号。为了解决这个问题,我们引入门控分配层(GAL)作为可学习的路由器,避免所有特征流入两个塔。对于输入嵌入 \(\mathbf{e}_i \in \mathbb{R}^d\),GAL 使用sigmoid激活的门控网络计算路由分数 \(gate_i \in [0,1]\):
\(10\) \[gate_i = \sigma(\mathbf{w}_g^{\top}\mathbf{e}_i + b_g)\]
特征被自适应地分配到两个不同的潜在流中:
\(11\) \[\begin{cases} \mathbf{e}_{u,hab} = gate_A \cdot \mathbf{e}_u, \\ \mathbf{e}_{u,int} = gate_B \cdot \mathbf{e}_u \end{cases}\]
其中 \(gate_A\) 用于习惯塔,\(gate_B\) 用于兴趣塔。请注意,GAL仅用于用户特征,因为我们假设用户-频道访问习惯仅受用户特征影响(如式1所述)。这种机制确保正交约束仅抑制冗余的干扰信号,同时允许多面特征(例如用户人口统计)通过不同的投影在两个流形中共存。
#### 3.3.2. 骨干模型(BM)
骨干模型是一个正交双塔。两个特征流分别馈入习惯塔 \(\mathcal{F}_{hab}\) 和兴趣塔 \(\mathcal{F}_{int}\)。每个塔被设计为将过滤后的特征投影到其各自的潜在流形中:
\(12\) \[\begin{cases} \mathbf{v}_{hab} = \mathcal{F}_{hab}(\mathbf{e}_{u,hab}) \\ \mathbf{v}_{int} = \mathcal{F}_{int}(\text{concat}(\mathbf{e}_{u,int}, \mathbf{e}_c, \mathbf{e}_{u2c})), \end{cases}\]
其中 \(\mathbf{e}_{u,hab}\) 和 \(\mathbf{e}_{u,int}\) 如式11所示。 \(\mathbf{e}_c\) 和 \(\mathbf{e}_{u2c}\) 分别是内容特征和用户-内容特征的嵌入。 \(\mathcal{F}_{hab}\) 和 \(\mathcal{F}_{int}\) 参数化习惯和兴趣塔。相似文章
ODRPO:离散奖励的序数分解用于鲁棒策略优化
介绍了ODRPO,一个将离散奖励分解为序数二元指标的框架,旨在提升LLMs中基于AI反馈的强化学习(RLAIF)策略优化的鲁棒性,在最小开销下实现了高达14.8%的相对改进。
幻觉作为正交噪声:通过动态上下文正交化实现推理时流形对齐
本文提出动态上下文正交化(DCO),一种推理时方法,通过将注意力头输出与上下文流形对齐来减少大型语言模型中的幻觉,在Llama-3模型的基准测试中实现了更优的忠实度。
Orchard:一个开源的智能体建模框架
Orchard是一个用于可扩展智能体建模的开源框架,能够训练多样化的自主智能体,在编程、GUI导航和个人辅助任务上取得了最先进的结果。
ORCA:面向优化的根本原因分析的端到端交互式副驾驶
ORCA 是一款端到端因果分析的副驾驶,利用代理引导用户完成包括因果发现、效应估计和根本原因分析在内的工作流,并生成结构化报告。
面向鲁棒的上下文学习:利用分布外代理进行目标不可访问的示例检索
本文介绍了DOPA,一种演示搜索框架,该框架在目标领域不可访问时,利用分布外代理为大语言模型检索鲁棒的演示,从而增强在分布偏移下的上下文学习性能。