QueryFormer:KDD Cup 2026 腾讯 UniRec 挑战赛的获胜方案
摘要
QueryFormer 是一种统一的 Transformer 架构,它赢得了 KDD Cup 2026 腾讯 UniRec 挑战赛,专注于点击后转化率预测,重点在查询生成和高效扩展。
arXiv:2609.16548v1 公告类型:新
摘要:点击后转化率(pCVR)预测需要联合建模特征交互和序列用户行为。KDD Cup 2026 腾讯 UniRec 挑战赛要求一个统一的架构来同时解决这两个问题。我们观察到,现有的统一架构通常通过基于投影的多层感知机(MLP)生成查询令牌——核心信息枢纽,但没有显式的令牌到查询注意力来细化查询端。我们提出了 QueryFormer,它以一个可堆叠的统一字段-序列块为中心,连接非序列多字段特征和行为序列,并提供了对视图宽度 $H$、模型宽度、深度、数据和计算的延迟感知扩展研究。该块通过交叉注意力生成查询,并将序列查询打包为共享参数注意力。QueryFormer 在工业赛道中获得第一名,官方测试集 ROC 曲线下面积(AUC)为 0.83254;赛后适度扩展后达到 0.832713。在我们的网格中,$H$-扩展将验证集 AUC 从 0.84540 提高到 0.84615,并在可比预算下击败了 HyFormer。消融实验表明查询生成是最大的贡献者。打包的共享参数交叉注意力使 H=8 的推理延迟仅为 H=1 的 1.89 倍,定位该桥接为一个高效的可堆叠统一块。
查看缓存全文
缓存时间: 2026/09/16 09:00
# QueryFormer:KDD Cup 2026 腾讯 UniRec 挑战赛获胜方案
来源:https://arxiv.org/html/2609.16548
会议:KDD Cup 2026 腾讯 UniRec 挑战赛研讨会;2026年8月12日;韩国济州岛
作者:曾朝阳
单位:中山大学
邮箱:[mailto:](mailto:)
年份:2026
###### 摘要
点击后转化率 (\(pCVR\)) 预测需要联合建模特征交互和用户行为序列。KDD Cup 2026 腾讯 UniRec 挑战赛要求构建一个能同时解决这两项任务的统一架构。我们观察到,现有的统一架构通常使用基于投影的多层感知机 (\(MLP\)) 生成查询令牌(核心信息枢纽),而没有显式的令牌到查询注意力来优化查询侧。我们提出了 **QueryFormer**,其核心是一个**可堆叠的统一字段-序列模块**,用于连接非序列多字段特征和行为序列,并提供了一个针对视图宽度 \(H\)、模型宽度、深度、数据量和计算量的延迟感知缩放研究。该模块通过交叉注意力生成查询,并将序列查询打包到共享参数注意力中。QueryFormer 获得了工业赛道**第一名**,官方测试集 ROC 曲线下面积 (\(AUC\)) 为 0.83254;赛后适度的规模扩展将 AUC 提升至 0.832713。在我们的实验网格中,将 \(H\) 从 1 扩展到 8,验证集 AUC 从 0.84540 提升至 0.84615,并在相似计算预算下优于 HyFormer。消融研究表明,查询生成是性能提升的最大贡献者。打包的共享参数交叉注意力使得 \(H=8\) 的推理延迟仅为 \(H=1\) 的 \(1.89\times\),证明了该桥接结构是一个高效的可堆叠统一模块。
图 1. QueryFormer 架构。可复用的可堆叠查询生成桥接模块接收非序列字段令牌和行为序列令牌作为输入,返回生成的查询探针和混合表示,并保留 \(H\) 维作为具有 \((B_s, H, T, d_{\text{model}})\) 形状的并行令牌化列视图,其中 \(B_s\) 是批次大小,\(T\) 是令牌数量,之后每列输出被组合。架构图展示了 QueryFormer 从非序列令牌到行为序列的查询驱动桥接,通过 CoTransformerBlock、QuerySeqCrossAttn 和 SeqQueryCrossAttn 实现,并具有 H 个独立的令牌化列。
图 2. 可堆叠查询生成桥接的缩放证据。
(a) 参数缩放:QueryFormer 在所探索的参数预算内,描绘了比 HyFormer (\(Huang\ et\ al.,\ 2026\)) 更强的 AUC-稠密参数前沿,具有分离的 \(d_{\text{model}}\)-和 \(H\)-缩放路径。
(b) 数据效率:QueryFormer (\(P_{\text{dense}}=87.1\text{M}, H=4\)) 从约 20% 到全部训练数据上,始终优于 HyFormer (\(P_{\text{dense}}=105.8\text{M}\))。两个 x 轴均为对数坐标;\(P_{\text{dense}}\) 表示稠密参数数量。两面板缩放分析。(a) 参数缩放:QueryFormer 的 \(d_{\text{model}}\) 缩放、\(H\) 缩放和 HyFormer 的 AUC 与稠密参数关系图。(b) 数据效率:HyFormer (\(P_{\text{dense}}=105.8\text{M}\)) 和 QueryFormer (\(P_{\text{dense}}=87.1\text{M}, H=4\)) 的 AUC 与训练样本关系图。两个子图均使用对数 x 轴。
## 1. 引言
KDD Cup 2026 腾讯 UniRec 挑战赛要求构建能同时处理多字段特征和用户行为序列的点击后转化率 (\(pCVR\)) 模型。我们的解决方案 **QueryFormer** 赢得了工业赛道。关键观察在于,现有的统一架构通常使用基于投影的多层感知机 (\(MLP\)) 生成查询令牌,这种机制提供了非线性的上下文压缩,但缺乏显式的令牌到查询注意力。由于字段到序列交叉注意力通道 \(\langle N, B \rangle\)(非序列字段令牌关注行为序列令牌)是主导交互通道 (\(Liu\ et\ al.,\ 2026\)),查询质量直接决定了检索哪些序列证据以及如何聚合用户-物品上下文。
QueryFormer 将查询处理重新设计为一种更强的查询生成机制。它结合了令牌级的自/交叉注意力、物品到序列检索以及基于交叉注意力的查询生成(图 1)。其可复用单元是一个可堆叠的统一字段-序列模块:字段和行为令牌进入一个令牌输入/令牌输出桥接模块,生成的查询探针检索序列证据,而打包的共享参数注意力则保持多视图执行的高效性。消融研究表明,将 SeqQueryCrossAttn 替换为 MLP 会导致最大的性能下降,而扩展嵌入矩阵宽度 \(H\) 则能带来持续的收益。图 2 展示了与 HyFormer 相比的缩放结果预览。
我们的主要贡献如下:
1. **查询生成机制**:交叉注意力驱动的查询生成在基于投影的 MLP 生成之外,增加了显式的令牌到查询注意力。
2. **统一模块**:一个令牌输入/令牌输出的字段-序列桥接模块,可与基于令牌的推荐器组合,并使用打包的共享参数注意力。
3. **延迟感知的缩放研究**:\(H=4\) 个独立的令牌化列构成一个形状为 \((B_s, H, T, d_{\text{model}})\) 的嵌入矩阵,支持跨视图、深度、宽度、数据和计算的批量并行缩放。
4. **工业验证**:在 KDD Cup 2026 工业赛道中获得第一名(测试 AUC 0.83254),并在多个维度展现出一致的缩放趋势。
## 2. 相关工作
### 2.1. 特征交互与序列建模
DeepFM (\(Guo\ et\ al.,\ 2017\))、DCN-V2 (\(Wang\ et\ al.,\ 2021\))、Fi-GNN (\(Li\ et\ al.,\ 2019\)) 和 DLRM (\(Naumov\ et\ al.,\ 2019\)) 通过乘积、交叉网络、图或嵌入交互层对静态特征交互进行建模。序列推荐器如 DIN (\(Zhou\ et\ al.,\ 2018\))、DIEN (\(Zhou\ et\ al.,\ 2019\))、SIM (\(Pi\ et\ al.,\ 2020\))、BERT4Rec (\(Sun\ et\ al.,\ 2019\))、SASRec (\(Kang\ and\ McAuley,\ 2018\)) 和 HSTU (\(Zhai\ et\ al.,\ 2024\)) 从行为历史中提取兴趣。这些方向通常作为独立模块进行优化;而 QueryFormer 让字段令牌和行为证据通过一个统一的查询管道进行交互。
### 2.2. 基于令牌的架构
近期的基于令牌的模型 (\(Ding\ et\ al.,\ 2023;\ Huang\ et\ al.,\ 2026;\ Zhang\ et\ al.,\ 2026;\ Zhou\ et\ al.,\ 2026\)) 将异构的推荐特征表示为由 Transformer 式模块处理的令牌。EST (\(Liu\ et\ al.,\ 2026\)) 表明 \(\langle N, B \rangle\) 交叉注意力是主导的交互通道,但并未优化查询侧的生成方式。HyFormer 和 OneTrans 重用 MLP 生成的查询;LENS、GAP-Net 和 HeMix 则通过门控、级联或混合静态/动态组件来校准 MLP 查询。QueryFormer 采取了更强的步骤:它通过交叉注意力生成查询探针,并通过一个以查询为中心的管道反复优化它们(表 1)。在表 1 中,“桥接”描述了某方法在查询生成过程中将非序列字段令牌与行为序列证据显式连接的程度。
表 1. 统一定位。Tok→Q:显式的令牌到查询注意力;令牌 I/O:令牌输入/输出;Packed:用于多视图查询的共享参数打包注意力。近期的推荐缩放研究 (\(Li\ et\ al.,\ 2026\)) 激励我们将容量分配视为一个首要的设计轴。在优化方面,我们结合了 Muon 风格的稠密更新 (\(Jordan\ et\ al.,\ 2024;\ Devin\ et\ al.,\ 2025;\ Zhou,\ 2026\))、用于稀疏嵌入的 Adagrad (\(Duchi\ et\ al.,\ 2011\)) 和指数移动平均 (EMA) 权重平均 (\(Izmailov\ et\ al.,\ 2018\))。
## 3. 预备知识
基于令牌的统一架构将异构特征嵌入到一个共享的 \(d_{\text{model}}\) 维空间中。我们将非序列 (NS) 用户令牌记为 \(N_u\),物品令牌记为 \(N_i\),它们的并集为 \(N = N_u \cup N_i\),来自 \(S\) 个领域的行为序列令牌记为 \(B = \{B_1, \ldots, B_S\}\)。对于两个令牌集 \(X\) 和 \(Y\),\(\langle X, Y \rangle\) 表示使用 \(X\) 作为查询,\(Y\) 作为键/值的交叉注意力交互。我们将在下文中使用此表示法来区分物品到序列检索与行为初始化的查询生成。
现有架构通常通过基于投影的 MLP 生成查询:
(1) \(\mathbf{q} = \text{MLP}\big(\text{pool}(B) \oplus \mathbf{N}\big)\),其中 \(\oplus\) 表示拼接。此类 MLP 具有非线性并能融合池化上下文,但它们并未明确地让查询令牌去关注字段或序列令牌。近期的方法通过门控 (\(Wang\ et\ al.,\ 2026b\)) 或级联 (\(Ke\ et\ al.,\ 2026\)) 来校准查询质量;而 QueryFormer 则通过上下文感知的注意力来生成查询。
## 4. 方法论
### 4.1. 概述
QueryFormer 通过一个统一的令牌管道处理用户/物品稀疏特征、稠密特征、四个行为域和时间上下文。它的两个层级分别是**查询驱动架构**(第 4.2 节),其中三个注意力阶段构建高质量的查询表示,以及**支持组件**(第 4.3 节),提供令牌化和交互基础设施。
### 4.2. 查询驱动架构
**设计原则**
(1) 通过注意力生成,而非仅投影。对 NS 令牌的交叉注意力生成数据相关的查询探针,超越了仅基于投影的摘要。
(2) 通过交互优化。查询在检索行为证据之前,通过自注意力和交叉注意力得到增强。
(3) 通过多样性缩放。嵌入矩阵提供了 \(H\) 个独立的令牌化视图,改善了所探索的缩放前沿。
#### 4.2.1. 查询生成管道
查询生成管道更新 NS 上下文,然后构建最终的查询探针:
(2) \(N' = \mathrm{FeatureInteract}(N_u, N_i)\)
(3) \(R = \mathrm{SeqRetrieve}(N'_i, B)\)
(4) \(Q = \mathrm{QueryGenerate}\big(\mathrm{pool}(B), N' \cup R\big)\)
(5) \(Y = \mathrm{Mix}(Q, N', B)\)。这里 \(N'_i\) 表示 \(N'\) 中的物品令牌切片。此管道展示了 QueryFormer 的可复用桥接组件:NS 令牌首先检索序列证据,然后生成的查询令牌重新查询优化后的 NS 上下文。该桥接模块针对基于令牌推荐器的字段-序列交互点:它以字段令牌和行为令牌作为输入,返回生成的查询探针以及供下游塔使用的混合表示。由于其接口是令牌输入/令牌输出,该桥接在架构上可与现有统一推荐器堆叠,而非绑定于单一主干。它在计算上也是可堆叠的:序列查询被拼接并通过共享参数交叉注意力进行评估,摊销了键/值投影和图形处理单元 (GPU) 内核启动成本,而不是串行调用交叉注意力。表 2 给出了算子到机制的映射。
表 2 列出了按架构阶段组织的四种注意力机制。它们共同形成了一个*以查询为中心*的优化管道:查询通过自注意力得到增强,与对等令牌进行交叉交互,关注行为序列,并通过显式的令牌到查询注意力驱动查询生成。
表 2. 按架构阶段划分的注意力机制。对于 SeqQueryCrossAttn,\(Q_B\) 表示行为初始化的查询探针。
#### 4.2.2. 嵌入矩阵
QueryFormer 没有使用扁平的令牌序列,而是使用一个具有 \(H\) 个独立列的嵌入矩阵。每一列通过自己的管道对相同的输入进行令牌化,产生一个形状为 \((B_s, H, T, d_{\text{model}})\) 的张量,其中 \(B_s\) 是批次大小,\(T\) 是令牌数量。这在一个批量并行的前向传播中实现了视图多样性,并提供了一个直接的缩放轴。图 3 显示,在固定 \(d_{\text{model}}=272\) 时,将 \(H\) 从 1 增加到 8 一致地提升了验证集 AUC 和 LogLoss。
图 3. 在 \(d_{\text{model}}=272\) 下,不同 \(H \in \{1,2,4,8\}\) 的验证集 AUC 和 LogLoss 随训练步数的变化。训练曲线显示,更宽的嵌入矩阵达到了更好的最终 AUC 和 LogLoss。
#### 4.2.3. 协同 Transformer
协同 Transformer 包含两层。每层首先在用户和物品令牌集内应用 QuerySelfAttn,然后在用户和物品令牌之间应用 QueryCrossAttn 并通过门控融合。这分离了字段内优化和跨侧交互,使我们能够独立地消融这两种效应。
#### 4.2.4. 检索
QuerySeqCrossAttn 使用聚合后的物品 NS 令牌作为查询,对四个行为域进行检索,以获取行为证据。检索到的向量总结了与物品相关的历史证据,并被附加到 NS 令牌集中。
#### 4.2.5. SeqQueryCrossAttn
SeqQueryCrossAttn 为每个序列域生成 \(N_q=2\) 个查询探针。均值/最大池化的行为摘要初始化探针,并通过在优化后的 NS 令牌上进行交叉注意力使其具备上下文感知能力:
(6) \(\mathbf{q}_{d,k} = \mathrm{CrossAttn}_{d}(\mathbf{q}_{d,k}^{(0)}, \mathbf{N}, \mathbf{N})\)
### 4.3. 支持组件
#### 4.3.1. NS 令牌构建
NS 令牌由用户/物品整数特征、稠密特征切片、时间特征、物品 ID 和四个检索到的序列令牌构建,共产生 26 个 NS 令牌。
#### 4.3.2. 稠密特征融合
用户和物品稠密特征由 DenseFusionModel 处理,该模型结合了一个低秩 DCN-V2 层 (\(L=1\), 秩 \(r=8\))、一个 SiLU 激活的 MLP 和 Squeeze-and-Excitation (SENet) 重校准 (\(Hu\ et\ al.,\ 2018\))。
#### 4.3.3. 序列令牌嵌入
每个行为域独立地嵌入其辅助信息,将其投影到 \(d_{\text{model}}\),并添加一个 65 桶的时效性嵌入。
#### 4.3.4. 模块
遵循 HyFormer 和 OneTrans (\(Huang\ et\ al.,\ 2026;\ Zhang\ et\ al.,\ 2026\)),堆叠 \(K=2\) 个相似文章
UniGD:一种用于工业检索的统一生成-判别框架
快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。
QO-Bench:诊断类型化事件元组上的查询算子保留检索
QO-Bench 是一个针对类型化事件元组上查询算子问答的诊断性基准测试,涵盖 22,984 篇新闻文章和 614 个企业事件,涉及 18 种查询模板。该基准对 RAG、ReAct RAG、GraphRAG 以及抽取转 SQL 系统进行评估,发现算子执行——而非仅仅是检索——才是核心瓶颈,单纯使用更强的模型并不能解决这一问题。
Q2D-Web: 大规模评估第一阶段检索器(阅读时长约11分钟)
Q2D-Web是一个大规模的基准和排行榜,用于评估网络搜索中的检索模型,具有1.9亿文档和查询,涵盖十种语言,并采用方法以最小化偏差并降低评估成本。
Caraman 在 SemEval-2026 任务 8 中的表现:采用查询重写、混合检索和交叉编码器重排的多轮检索三阶段方法
本文介绍了一个用于 SemEval-2026 任务 8 的系统,该系统采用三阶段流水线,包括使用微调后的 Qwen 模型进行查询重写、混合检索以及交叉编码器重排,以提升多轮检索的性能。
UniQL:面向文本到SQL的方言通用基准测试
介绍了UniQL,这是一个经过人工验证的可执行基准测试,用于跨方言文本到SQL评估,解决了像Spider和BIRD等现有基准测试中缺乏方言多样性的问题。