面向腾讯UNI-REC挑战赛的字段感知RankMixer与双流双线性融合
摘要
本文提出FA-RankMixer模型,该模型结合字段感知语义标记化、目标感知多域深度兴趣网络(DIN)、RankMixer模块以及分组双线性融合,用于腾讯UNI-REC挑战赛中的统一pCVR预测。该方案在官方排行榜上排名第九。
arXiv:2607.15590v1 Announce Type: new
摘要:本文介绍了我们针对2026年KDD Cup腾讯UNIREC挑战赛的解决方案。该任务需要对多域用户行为序列和非序列多字段特征进行联合建模,以实现目标广告的pCVR预测。我们开发了一种带有双流双线性融合的字段感知RankMixer(FA-RankMixer)。该模型首先应用目标感知DIN模块从多个行为域中提取用户兴趣。同时,针对最长行为序列,分别对近期和早期兴趣进行建模。然后,模型基于特征字段和行为域形成语义标记,并使用RankMixer模块进行跨标记交互。浅层MLP流作为深层RankMixer流的补充,分组双线性模块融合两者的表示。我们的最终方案在官方排行榜上排名第九。代码已在https://github.com/PixelCookie-zyf/TAAC-2026-SeRankMixer上开源。
查看缓存全文
缓存时间: 2026/07/20 09:29
# Field-Aware RankMixer with Dual-Stream Bilinear Fusion for the Tencent UNI-REC Challenge
来源: https://arxiv.org/html/2607.15590
###### 摘要
本文提出了我们对 KDD Cup 2026 腾讯 UNI-REC 挑战赛的解决方案。该任务要求联合建模多域用户行为序列和非序列多域特征,以进行目标广告的 pCVR 预测。我们开发了一种带有双流双线性融合的场感知 RankMixer (FA-RankMixer)。该模型首先应用目标感知的 DIN 模块从多个行为域中提取用户兴趣。它还对最长行为序列分别建模近期和早期兴趣。随后,模型基于特征域和行为域构建语义令牌,并使用 RankMixer 块进行跨令牌交互。一个浅层 MLP 流补充了深层 RankMixer 流,而一个分组双线性模块融合了它们的表示。我们的最终方案在官方排行榜上排名第九。我们的代码可在 PixelCookie-zyf/TAAC-2026-SeRankMixer(https://github.com/PixelCookie-zyf/TAAC-2026-SeRankMixer)获取。
††copyright:none††conference:KDD Cup 2026 Tencent UniRec Challenge Workshop; August 12, 2026; Jeju, Korea††journalyear:2026††footnotetext:KDD Cup 2026 Tencent UniRec Challenge Workshop, August 12, 2026, Jeju, Korea。
竞赛网站: https://algo.qq.com/。
## 1. 引言
大规模广告推荐系统需要从众多候选物品中实时识别用户兴趣。同时,它们还需要准确估计目标广告的预测转化率 (pCVR)。预测质量直接影响用户体验和平台商业价值。现有推荐模型主要遵循两个方向:序列模型从行为历史中学习动态用户兴趣(Zhou et al., 2019 (https://arxiv.org/html/2607.15590#bib.bib15)),而特征交互模型则捕获用户、广告和上下文特征之间的高阶关系(Wang et al., 2021 (https://arxiv.org/html/2607.15590#bib.bib16))。然而,这两类信息通常由结构不同的独立网络处理,限制了它们的交互,并使计算和模型扩展复杂化(Huang et al., 2026a (https://arxiv.org/html/2607.15590#bib.bib6))。因此,将多域行为序列和非序列多域特征结合在一个统一且可扩展的架构中,仍然是工业推荐中的一个重要问题。
由 TAAC 2026 和 KDD Cup 2026 联合举办的腾讯 UNI-REC 挑战赛,正好聚焦于这一问题。参赛者需要共同建模多域用户行为序列和非序列多域特征,以预测目标广告的 pCVR。挑战赛注重预测准确性,并鼓励使用同质、可堆叠的模块构建统一的推荐架构,同时研究模型扩展性。
在这项工作中,我们开发了用于 pCVR 预测的 FA-RankMixer。它结合了场感知 RankMixer 主干网络和双流双线性融合。该模型以目标广告作为查询,应用 DIN 聚合来自多个域的行为。它对最长行为序列中的近期和早期兴趣分别建模。然后,模型按特征域和行为域形成语义令牌。RankMixer 块对跨令牌交互进行建模,而分组双线性模块则融合了深层 RankMixer 分支和浅层 MLP 分支。
我们的主要贡献如下:
- • 我们开发了 FA-RankMixer,它结合了场和域感知的语义分词、目标感知的多域 DIN、RankMixer 块以及分组双线性融合,以实现统一特征建模。
- • 我们的最终方案在 TAAC-2026 腾讯 UNI-REC 挑战赛官方排行榜上排名第九,展示了 FA-RankMixer 在大规模 pCVR 预测中的实用价值。
## 2. 相关工作
大型推荐模型主要遵循两个方向:构建可扩展的 Mixer 架构,以及联合建模行为序列与序列化特征。
### 2.1. 可扩展的 Mixer 架构
近期一些工作专注于用于特征交互的可扩展 Mixer 架构。RankMixer(Zhu et al., 2025 (https://arxiv.org/html/2607.15590#bib.bib1))结合了无参数令牌混合与每令牌前馈网络。TokenMixer-Large(Jiang et al., 2026 (https://arxiv.org/html/2607.15590#bib.bib2))通过更强的残差路径和稀疏每令牌 MoE 提升了模型深度和规模,而 UniMixer(Ha et al., 2026 (https://arxiv.org/html/2607.15590#bib.bib3))则用可学习的参数化模块替换了固定的令牌混合。这些方法主要处理特征令牌或序列摘要,而非原始行为序列。
### 2.2. 统一序列与特征建模
另一个方向是将行为序列与其他特征域结合。InterFormer(Zeng et al., 2025 (https://arxiv.org/html/2607.15590#bib.bib4))通过全局、序列和桥接分支交换信息。OneTrans(Zhang et al., 2026 (https://arxiv.org/html/2607.15590#bib.bib5))使用单因果 Transformer 流,而 MixFormer(Huang et al., 2026a (https://arxiv.org/html/2607.15590#bib.bib6))在单个主干网络中共同缩放稠密特征和行为序列。HyFormer(Huang et al., 2026b (https://arxiv.org/html/2607.15590#bib.bib7))交替进行查询解码和查询增强,TokenFormer(Zhou et al., 2026 (https://arxiv.org/html/2607.15590#bib.bib8))则将域、行为和目标视为单一实体流。我们的方法则采用分阶段设计。它首先从每个行为域中提取目标感知表示,然后通过 RankMixer 和双流双线性融合将其与多域特征结合。下一节将详细描述这些阶段。
## 3. 方法论
本节介绍用于 pCVR 预测的 FA-RankMixer。我们首先阐述任务定义,然后描述其三个主要组成部分:目标感知特征构建、场感知 RankMixer 主干网络以及双流双线性融合。图1 (https://arxiv.org/html/2607.15590#S3.F1) 展示了整体架构。该模型从稀疏域、稠密域以及多域行为序列中构建目标感知表示。经过输入归一化和通道重加权后,一个深层 RankMixer 流和一个浅层 MLP 流处理相同的特征向量。它们的 logits 和隐藏层交互被组合起来以预测 pCVR。
参见图注 图 1. FA-RankMixer 概述。在进入深层 RankMixer 流和浅层 MLP 流之前,目标感知序列表示和非序列域被拼接并重新加权。分组双线性融合将两个流组合用于最终预测。用户和物品域以及多域序列表示进入加权对池化、输入归一化和 ChannelSENET。并行 RankMixer 和浅层 MLP 流处理结果,然后进行分组双线性融合和 sigmoid pCVR 预测。
### 3.1. 问题定义
对于每个点击样本,输入包含用户特征 \(\mathbf{x}^u\)、目标广告特征 \(\mathbf{x}^i\) 以及来自多个域的行为序列 \(\{ \mathcal{S}^m \}_{m \in \mathcal{M}}\)。每个特征集包含稀疏域和稠密域。序列 \(\mathcal{S}^m = \{ (\mathbf{s}^m_j, \Delta t^m_j) \}_{j=1}^{L_m}\) 记录了行为特征及其与当前点击的时间间隔。给定一个二元转化标签 \(y \in \{0,1\}\),任务是估计
\[
\hat{y} = P(y=1 \mid \mathbf{x}^u, \mathbf{x}^i, \{\mathcal{S}^m\}_{m \in \mathcal{M}}) = \sigma(z),
\]
其中 \(z\) 是输出 logit,\(\sigma(\cdot)\) 是 sigmoid 函数。
### 3.2. 目标感知特征构建
非序列域描述相对稳定的用户和广告属性,而行为序列则反映与目标广告相关的动态兴趣。由于这两种来源具有不同的结构和含义,以相同方式处理它们可能会丢失有用信息。因此,我们构建两种互补的表示:用于非序列特征的域表示和用于多域序列的目标感知表示。然后它们被拼接并重新加权,形成 RankMixer 和浅层 MLP 流的共享输入。
**非序列域。** 每个稀疏域都有自己的嵌入表。对于与稠密值配对的变长稀疏域,我们使用加权均值而不是均匀池化。配对的稠密值指示每个 ID 的强度,如果所有有效 ID 都获得相同权重,则会忽略该强度。图2 (https://arxiv.org/html/2607.15590#S3.F2) 的右侧说明了这一过程:
\[
\mathbf{e}_f = \frac{\sum_j m_{f,j} w_{f,j} E_f(v_{f,j})}{\sum_j m_{f,j} w_{f,j} + \epsilon},
\]
其中 \(m_{f,j}\) 掩码填充项,\(w_{f,j}\) 是配对的稠密值。其他多值域使用均值池化。我们取目标广告域嵌入的均值作为 DIN 查询 \(\mathbf{q}\)。
**多域行为序列。** 接下来,我们使用目标广告来聚合来自每个域的行为。所有事件域的嵌入被拼接并投影到一个 \(d\) 维事件向量。然后添加一个分桶的时间间隔嵌入以保留时间信息。令 \(\mathbf{e}^m_j\) 表示结果向量。DIN 使用目标广告对每个事件进行评分:
\[
\begin{aligned}
a^m_j &= g_m([\mathbf{q}, \mathbf{e}^m_j, \mathbf{q} - \mathbf{e}^m_j, \mathbf{q} \odot \mathbf{e}^m_j]), \\
\alpha^m_j &= \operatorname{softmax}_j(a^m_j), \\
\mathbf{h}^m &= \mathbf{q} + W_o^m \sum_j \alpha^m_j W_v^m \mathbf{e}^m_j.
\end{aligned}
\]
填充事件从 softmax 中排除。在长序列上的单个 DIN 可能被近期事件主导,削弱来自早期偏好的信号。因此,对于最长域序列,将按时间从新到旧排序的列表分成近期和早期两半。两个独立的 DIN 模块分别聚合这两半,并通过拼接保留其输出:
\[
\mathbf{h}^{m^*} = [\mathbf{h}^{m^*}_{\mathrm{recent}} \| \mathbf{h}^{m^*}_{\mathrm{earlier}}].
\]
最后,用户嵌入、目标广告嵌入、序列表示和稠密域被拼接。这些块具有不同的值范围,因此首先通过批归一化对齐其尺度。然后 ChannelSENET(Hu et al., 2018 (https://arxiv.org/html/2607.15590#bib.bib14))对信息通道进行重加权,\(\widetilde{\mathbf{x}} = \mathbf{x} \odot \sigma(g_{\mathrm{se}}(\mathbf{x}))\)。得到的 SENET 后向量由 RankMixer 和浅层 MLP 流共享。
参见图注 图 2. 两个关键组件的结构。(a) 具有无参数令牌混合和令牌特异性 pSwiGLU FFN 的 RankMixer 块;(b) 使用变换后的稠密值对配对的稀疏嵌入进行加权的加权对池化。左面板展示了 RankMixer 块中的令牌混合、残差归一化和令牌特异性 pSwiGLU 前馈网络。右面板展示了变换后的稠密值在池化前对配对的稀疏嵌入进行加权。
### 3.3. 场感知 RankMixer
接下来,我们将共享的 SENET 后向量转换为语义令牌,并使用 RankMixer(Zhu et al., 2025 (https://arxiv.org/html/2607.15590#bib.bib1))对它们的交互进行建模。将所有稠密特征映射到单个令牌会隐藏它们的域身份。我们改为为每个稠密域,或一小个预定义的相关稠密域组,分配一个单独的分词器组。用户和目标广告稀疏块以及每个行为域也使用单独的映射。对于组 \(g\),分词器将对应切片 \(\widetilde{\mathbf{x}}_g\) 映射到 \(n_g\) 个令牌:
\[
\mathbf{X}_g = \operatorname{reshape}(W_g \widetilde{\mathbf{x}}_g + \mathbf{b}_g, n_g, D), \quad \mathbf{X} = [\mathbf{X}_1 \| \cdots \| \mathbf{X}_G].
\]
我们的最终模型使用 \(T=24\) 个令牌,维度 \(D=1152\):5 个用户令牌,3 个目标广告令牌,4 个行为域令牌,9 个用户稠密令牌,以及 3 个物品稠密令牌。图2 (https://arxiv.org/html/2607.15590#S3.F2) 的左侧展示了 RankMixer 块的结构。
每个 RankMixer 块保留无参数令牌混合。我们将每个令牌分成 \(T\) 等份。第 \(h\) 个输出令牌拼接来自所有输入令牌的第 \(h\) 部分:
\[
\operatorname{Mix}(\mathbf{X})_h = [\mathbf{x}_1^{(h)} \| \mathbf{x}_2^{(h)} \| \cdots \| \mathbf{x}_T^{(h)}], \quad h = 1, \ldots, T.
\]
此操作跨令牌交换信息,而不引入混合参数。我们将原始 RankMixer 块中的 LayerNorm 替换为 RMSNorm,以避免因均值中心化改变特征的原始偏移信息。然后,给定输入 \(\mathbf{X}^\ell\),第 \(\ell\) 个 RankMixer 块计算如下:
\[
\begin{aligned}
\mathbf{S}^\ell &= \operatorname{RMSNorm}(\operatorname{Mix}(\mathbf{X}^\ell) + \mathbf{X}^\ell), \\
\mathbf{X}^{\ell+1} &= \operatorname{RMSNorm}(\operatorname{PFFN}(\mathbf{S}^\ell) + \mathbf{S}^\ell).
\end{aligned}
\]
我们还用令牌特定的 pSwiGLU(Jiang et al., 2026 (https://arxiv.org/html/2607.15590#bib.bib2))替换了标准的每令牌 FFN。来自不同特征域和行为域的令牌有不同的含义。因此,每个令牌使用自己的 pSwiGLU 参数,而不是所有令牌共享一个 FFN。学习到的门控控制变换后令牌的哪些维度传递给输出。对于令牌 \(t\),我们有:
\[
\operatorname{PFFN}_t(\mathbf{s}_t) = \left( \operatorname{SiLU}(\mathbf{s}_t W_{\mathrm{gate}}^t) \odot (\mathbf{s}_t W_{\mathrm{up}}^t) \right) W_{\mathrm{down}}^t.
\]
矩阵不在令牌间共享。我们堆叠两个块,并对最终令牌进行均值池化以获得深层表示,然后将其传递给深层预测 MLP。
### 3.4. 双流双线性融合与目标函数
为了将高阶令牌交互与直接特征路径相结合,我们使用一个深层 RankMixer 流和一个浅层 MLP 流。深层流对 RankMixer 输出应用隐藏大小分别为 1024、512、256 和 128 的 MLP。同时,浅层流将 SENET 后特征向量通过隐藏大小分别为 512 和 128 的 MLP。令 \(\mathbf{h}^d, \mathbf{h}^w \in \mathbb{R}^{128}\) 为它们最后的隐藏向量,\(z_d\) 和 \(z_w\) 为它们的 logits。我们将两个隐藏向量均分成 \(K\) 组,并计算如下:
\[
z_{\mathrm{bi}} = \sum_{k=1}^{K} (\mathbf{h}^d_k)^\top W_k \mathbf{h}^w_k, \qquad z = z_d + z_w + z_{\mathrm{bi}}.
\]
双线性矩阵初始化为零,因此交互项在训练开始时为零,使得优化更加稳定。相似文章
M$^2$FedAQI: 用于异构边缘设备空气质量预测的多模态联邦学习
提出了M²FedAQI,一种轻量级多模态联邦学习框架,用于跨异构边缘设备的空气质量预测,在基准数据集上相比基线取得了显著改进。
UOL@IDEM在BEA 2026共享任务1中的提交:融合神经与丰富特征建模的L1感知词汇难度预测
本文描述了UOL@IDEM在BEA 2026 L1感知词汇难度预测共享任务中的封闭赛道提交方案,结合多语言上下文表示与工程化特征。该系统在西班牙语、德语和中文上取得了有竞争力的RMSE分数,其中词频是最稳定的预测因子。
信任先于融合:QIMG-7与面向污染多模态RAG的源感知解析方案
介绍了QIMG-7,一个针对事实QA中多模态检索污染的基准测试,并提出了源感知信任解析方案(SATR),一种无需训练的方法,相比朴素融合提高了鲁棒性。
超越最后一层:用于视觉标记化的多层表示融合
本文提出了 DRoRAE,这是一种通过融合预训练视觉编码器中的多层特征(而非仅依赖最后一层)来改善视觉标记化的方法。该方法在 ImageNet 上展示了重构和生成质量的显著提升,并确立了融合容量与性能之间的缩放定律。
始终学习,始终混合:高效简单的全时数据混合
本文介绍了OP-Mix,一种数据混合算法,它利用在当前模型上训练的低秩适配器来廉价模拟候选数据混合,从而在预训练、持续中间训练和持续指令微调中实现高效统一的数据混合。OP-Mix 始终能找出接近最优的混合方案,而计算量仅为基线方法的一小部分;在预训练中将平均困惑度提升了6.3%,在持续学习场景中减少了66-95%的计算量。