残差主导作为因果自注意力推荐器中最后一项依赖的结构解释

arXiv cs.AI 论文

摘要

本文提出残差主导作为因果自注意力基于序列推荐器中最后一项依赖的结构解释,利用预测时诊断和基于范数的分析,将这种行为与Transformer模型中的残差加法联系起来。

arXiv:2608.14021v1 公告类型:新 摘要:基于Transformer的因果自注意力序列推荐器在推理时通常严重依赖最近的交互,但这种行为在用于预测的表示中如何结构化表达仍不清楚。我们结合预测时诊断和基于范数的完整注意力块分析。首先,我们展示SASRec风格的模型表现出高度局部化的最后一项依赖。然后我们发现,尽管自注意力聚合上下文信息,但残差加法使完整块表示急剧转向同位置贡献,我们称之为残差主导。为了验证这一解释,我们使用推理时残差缩放作为受控诊断干预。改变残差强度会在结构混合和最后一项依赖之间诱导单调权衡,而降低残差强度可恢复最终位置遗漏的子集,其中非最终位置的表示已正确排列真实项目。我们的结果提供了将极端最后一项依赖与推理时残差主导联系起来的结构解释。代码已公开可用。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:00

# 残差优势:因果自注意力推荐器中最后项依赖的结构解释  
来源:https://arxiv.org/html/2608.14021  
## 残差优势:因果自注意力推荐器中最后项依赖的结构解释  
会议:第20届ACM推荐系统会议;2026年9月27日–10月2日;美国明尼阿波利斯  
第20届ACM推荐系统会议(RecSys ’26),2026年9月27日–10月2日,美国明尼阿波利斯  
DOI:10.1145/3773078.3831798 (https://doi.org/10.1145/3773078.3831798)  
ISBN:979-8-4007-2284-4/2026/09  
CCS:信息系统 推荐系统  

Keito Kozaki、Keigo Sakurai  
所属:北海道大学,札幌,北海道,日本  
邮箱:[[email protected]](mailto:[email protected])、Ren Togo  
所属:北海道大学,札幌,北海道,日本  
邮箱:[[email protected]](mailto:[email protected])、Takahiro Ogawa  
所属:北海道大学,札幌,北海道,日本  
邮箱:[[email protected]](mailto:[email protected])  
以及 Miki Haseyama  
所属:北海道大学,札幌,北海道,日本  
邮箱:[[email protected]](mailto:[email protected])  

2026;© cc  

###### 摘要  
基于Transformer的序列推荐器在使用因果自注意力时,往往在推理阶段严重依赖最近的交互项,但这种行为如何在用于预测的表示中体现其结构仍不明确。我们结合推理时的诊断方法与基于范数的完整注意力块分析。首先,我们证明了SASRec风格的模型表现出高度局域化的最后项依赖。随后我们发现,尽管自注意力会聚合上下文信息,但残差相加会显著将整个块的表示转向同位置的贡献,我们称之为**残差优势**。为了验证这一解释,我们采用推理时的残差缩放作为受控的诊断干预。改变残差强度会在结构混合与最后项依赖之间产生单调的权衡,而降低残差强度则能恢复部分在最终位置被遗漏的预测——这些预测在非最终位置的表示中已能正确排序真实目标项。我们的研究结果为推理阶段极端最后项依赖与残差优势之间的联系提供了结构性解释。代码已公开:111 https://github.com/keito0329/Residual  

###### 关键词:  
序列推荐;因果自注意力;最后项依赖  

†† cc-许可:by  

## 1. 引言  
该图左侧为序列打乱示意图,右侧为九张柱状图。在部分打乱示意图中,最终项保持在最终位置不变,其余所有项随机排列;在完全打乱示意图中,所有项(包括原始最终项)均被打乱。柱状图按三行三列排列,行对应GRU4Rec、BERT4Rec和SASRec三种模型,列对应Toys、ML-1M和Steam三个数据集。每张图比较了原始时序序列、部分打乱和完全打乱三种情况下的NDCG@10指标。对于SASRec在Toys和ML-1M数据集上的表现,部分打乱引起的性能变化显著小于完全打乱;而在Steam数据集上,两种扰动引起的变化都相对较小。GRU4Rec和BERT4Rec在部分打乱与完全打乱之间的对比差异通常弱于SASRec。  
**图1.** 推理阶段序列排序的影响。空柱:时序排列序列;浅斜线填充:*部分打乱*(仅固定最终位置 v_t,其余项重新排列);深斜线填充:*完全打乱*(包括 v_t 在内的所有位置均重新排列)。  
**关键发现:** 在稀疏和稠密数据集上,仅保留 v_t 时SASRec的性能变化远小于完全打乱,表明存在不连续的最终位置特权;这种对比在非序列数据集上较弱。  

该图左侧为序列打乱示意图,右侧为九张柱状图。在部分打乱示意图中,最终项保持在最终位置不变,其余所有项随机排列;在完全打乱示意图中,所有项(包括原始最终项)均被打乱。柱状图按三行三列排列,行对应GRU4Rec、BERT4Rec和SASRec三种模型,列对应Toys、ML-1M和Steam三个数据集。每张图比较了原始时序序列、部分打乱和完全打乱三种情况下的NDCG@10指标。对于SASRec在Toys和ML-1M数据集上的表现,部分打乱引起的性能变化显著小于完全打乱;而在Steam数据集上,两种扰动引起的变化都相对较小。GRU4Rec和BERT4Rec在部分打乱与完全打乱之间的对比差异通常弱于SASRec。  

序列推荐旨在根据用户过去交互的有序序列预测其下一次交互[4, 37, 24]。在众多方法[28, 44, 10, 33]中,基于Transformer[36]并采用因果自注意力[39, 31]的模型(以SASRec[12]为代表)因其强大的经验表现[13, 17]已成为主流范式。这类模型通常从最终位置的表示生成推荐,隐含假设该表示聚合了完整交互历史中的有效信号。在本研究中,我们重新审视这一假设在推理阶段的适用性:**用于预测的表示中,不同位置的信息实际上是如何表达的?**  
重要的是,我们的目标不是探究为何数据集或训练过程使最后一项具有预测性,而是考察训练后的因果自注意力推荐器在推理阶段如何结构性地表达最后项依赖。  

近期研究[41, 23]表明,因果自注意力推荐器在推理阶段常表现出高度局域化的行为,预测强烈锚定于最近一次交互。如图1所示,仅保留最后一项而扰动较早位置仅引起轻微变化,而扰动最终位置则导致性能急剧下降。互补的排序诊断[23]显示,因果自注意力模型常将最近交互项排在首位,而对紧邻的前一项则很少如此。尽管这些诊断捕捉了模型行为的不同方面,但它们共同表明最终位置存在不连续的特权。虽然这种行为符合“近期交互通常更具信息性”的直觉,但其极端局域化现象仍未得到充分解释。  

如果位置影响主要由注意力权重决定,人们可能预期影响力会从最终位置向邻近前位置逐渐衰减[38]。然而我们观察到不连续的模式:预测影响集中于最后一项,而紧邻的前位置贡献甚微。基于近期偏差或注意力模式的现有解释在很大程度上是描述性的,无法完全说明学习到的信号在预测阶段的实际利用方式[38, 41]。这表明注意力权重之外的组件在塑造推理行为中起重要作用。  

为研究这一问题,我们采用基于范数的分解方法[15, 16]分析了包含残差连接和归一化在内的完整注意力块。结果表明,尽管注意力输出聚合了上下文信息,但添加残差路径会显著降低前位置的相对贡献,并强烈保留同位置信息。由于SASRec基于最终位置的表示进行预测,这种自信息保留结构为最近项主导预测表示提供了直接途径。我们将这种结构性倾向称为**残差优势**。我们并不将残差优势视为最后项依赖的唯一来源,而是将其视为已学习的最后项依赖在推理阶段表达的重要机制。  

为验证这一解释,我们采用推理时残差缩放作为受控的诊断干预。残差缩放在保持训练参数固定的前提下对残差贡献进行一维调整,使我们能检查表示结构和预测行为是否随残差强度系统性变化,而无需重新训练。此干预旨在作为机制敏感性探针,而非严格的因果识别或新推荐方法。研究结果表明,降低残差强度会减弱对最终位置输入的直接保留,同时能恢复部分先前被遗漏的预测——这些预测在非最终位置的表示中已能在标准推理下正确排序真实目标项。这些发现表明,预测误差不仅取决于编码的信息内容,还取决于该信息在推理阶段的表达方式。  

综上,我们提供了残差优势如何与最后项依赖相关的结构性解释,并利用残差缩放探究预测阶段的信息利用机制。  

本文主要贡献如下:  
- •通过跨多样数据集的互补推理时诊断方法,系统性地表征了因果序列推荐器中的最后项依赖现象。  
- •分析了完整注意力块,揭示残差路径在保留同位置信息的同时显著降低上下文混合度,为最终项如何主导预测表示提供了结构性解释。  
- •采用推理时残差缩放作为受控诊断探针,证明残差强度与最后项依赖、上下文混合度以及具有正确非最终预测的最终位置漏检恢复之间存在系统性关联。  

## 2. 预备知识与总体设置  
本节定义任务符号,并概述数据集、基线模型和评估协议。除特别说明外,此处设置适用于第3–5节的所有实验和诊断。  

### 2.1 预备知识  
考虑用户集 \(\mathcal{U}=\{u_1, u_2, \dots, u_{|\mathcal{U}|}\}\) 和物品集 \(\mathcal{V}=\{v_1, v_2, \dots, v_{|\mathcal{V}|}\}\)。对用户 \(u\),其时序交互序列表示为 \(S_u = (v_1, v_2, \dots, v_t)\),其中 \(t=|S_u|\) 且 \(v_t\) 为最近交互项。下一项预测任务旨在估计给定 \(S_u\) 时,下一交互项 \(v_{t+1}\) 在 \(\mathcal{V}\) 上的概率分布:  
\[
p(v_{t+1}=v \mid S_u; \Theta), \quad v \in \mathcal{V},
\]  
其中 \(\Theta\) 表示模型参数。后文将最终位置记为 \(L\)(即 \(L=t\)),在讨论位置诊断时将前序位置称为 \(L-1\)、\(L-2\) 等。  

### 2.2 总体设置  
**表1.** 经 \(p\)-核心过滤(\(p=5\))并移除连续重复项后处理数据集的统计信息。  

#### 2.2.1 数据集  
我们在九个公开可用的数据集上展开分析,这些数据集广泛应用于序列推荐研究,覆盖了不同的领域、稀疏度、序列长度和时序特性。  

如表1所示,这些数据集在规模和结构上差异显著,涵盖短会话式交互和长期用户历史。所有交互均视为隐式反馈,遵循标准下一项预测设置[13, 35]。  

重要的是,本研究选用的数据集有意反映近期文献中讨论的不同程度的序列结构[14]。具体而言,我们的基准包括普遍认为具有清晰序列依赖性且适合序列推荐的数据集(如Amazon Beauty、Sports和Zvuk),以及先前研究[14]指出序列结构较弱或有限的数据集(如Diginetica和Steam)。通过涵盖内在序列性差异显著的数据集,实验设置使我们能检验预测阶段的信息利用(特别是最后项依赖)是否在不同数据集中一致出现,而非特定数据集选择的偶然结果。  

为确保数据质量及跨数据集可比性,我们采用5核心过滤[29, 5, 34]。此外,移除用户序列中的连续重复项[9],因为此类重复不传递额外的序列依赖信息,并可能人为夸大近期效应。  

#### 2.2.2 基线模型  
我们考虑三个代表性序列推荐基线模型:GRU4Rec、SASRec和BERT4Rec。这些模型是广泛使用的基准,代表三种不同的建模范式。如[13, 1]等分析研究所采用,这三个模型均从单一序列级表示生成预测。这种共享的预测接口使我们能直接比较不同归纳偏置下的推理时行为。除标准基线外,我们引入两个模型以扩展分析:  
- •SASRec[12]代表基于因果自注意力的Transformer,其中下一项预测依赖于严格自回归信息流下的最终位置表示。  
- •GRU4Rec[10]代表循环架构,用户偏好通过序列隐藏状态转换逐步聚合。  
- •BERT4Rec[33]代表基于双向自注意力的Transformer,通过物品掩码目标同时利用过去和未来上下文。推理时,我们通过掩码目标位置进行预测。

相似文章

τ-Rec:面向智能推荐系统的可验证基准

Hugging Face Daily Papers

τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。