理解语义ID:从物品表征到生成式推荐中的物品选择
摘要
本文系统性地研究了生成式推荐中的语义ID(SID),发现SID虽然保留了物品的粗粒度组织,但丢失了编码器中的细粒度局部结构。作者提出物品支持解码(ISD),一种轻量级的推理时方法,在无需额外参数或重新训练的情况下,将NDCG@10提升高达31.2%。
arXiv:2607.24995v1 公告类型:新论文
摘要:语义ID(SID)现在是生成式推荐的核心组件。当前基于SID的系统将三个角色分配给同一个令牌序列。共享前缀用于组织相关物品,完整的SID标识单个物品,每个生成的令牌缩小了仍可返回的物品范围。我们系统地研究了从物品编码和SID构建到自回归生成和最终推荐的SID。我们考察了SID构建如何改变物品表征以及这些变化如何影响生成。在三个亚马逊域和八个SID构建中,SID邻域平均仅恢复编码器十个最近邻的32.2%。替代物品描述在99.57%的控制案例中仍能首先检索到对应物品,但改变了38.4%的精确SID。这些结果表明SID保留了广泛的组织结构,但丢失了编码器大量的细粒度局部结构,同时其确切令牌并不仅由物品含义决定。这种损失在生成过程中变得显著。在最后一个语义令牌后,TIGER仅保留了29.9%的保留目标,这些目标在SID过滤前本是合理的推荐。受这些发现启发,我们提出物品支持解码(ISD),一种轻量级的推理时方法,允许用户特定的物品排序在波束搜索丢弃对应SID前缀之前支持它们。然后相同的排序对生成的物品进行排序。ISD不需要额外参数或重新训练SID构造器或解码器。我们通过实验证明,ISD在每种评估设置下都能在相应的SID骨干网络上提升NDCG@10,相对增益高达31.2%。我们的结果表明,SID提供了有用的粗粒度物品组织,但它们的细粒度边界不应单独决定生成过程中哪些物品仍然可用。
查看缓存全文
缓存时间: 2026/07/29 09:52
# 理解语义ID:从物品表示到生成式推荐中的物品选择 来源:https://arxiv.org/html/2607.24995 \\@ACM@balancefalse ,Xinrui He xhe33@illinois\.edu (https://arxiv.org/html/2607.24995v1/mailto:[email protected])伊利诺伊大学厄巴纳-香槟分校 厄巴纳 伊利诺伊 美国,Yunzhe Li yunzhel2@illinois\.edu (https://arxiv.org/html/2607.24995v1/mailto:[email protected])伊利诺伊大学厄巴纳-香槟分校 厄巴纳 伊利诺伊 美国,Hari Sundaram hs1@illinois\.edu (https://arxiv.org/html/2607.24995v1/mailto:[email protected])伊利诺伊大学厄巴纳-香槟分校 厄巴纳 伊利诺伊 美国 ###### 摘要。 语义ID(Semantic IDs, SIDs)现已成为生成式推荐的核心组件。当前基于SID的系统将三个角色赋予同一个Token序列。共享前缀旨在组织相关物品,完整SID标识单个物品,每个生成的Token则缩小可被返回的物品范围。我们系统地研究了SID,从物品编码和SID构建,到自回归生成和最终推荐。我们考察SID构建如何改变物品表示,以及这些改变如何影响生成。在三个亚马逊领域和八种SID构建上,SID邻域平均仅恢复编码器十个最近邻的32.2%。替代物品描述在99.57%的受控案例中仍能首先检索到对应的物品,但却改变了38.4%的确切SID。这些结果表明,SID保留了广泛的组织结构,但丢失了编码器大量精细的局部结构,同时其确切Token并非仅由物品语义决定。这种损失在生成过程中变得至关重要。在最终语义Token之后,TIGER仅保留了在SID过滤前属于合理推荐范围的29.9%的留出目标。受这些发现启发,我们提出物品支持解码(Item-Supported Decoding, ISD),这是一种轻量级的推理时方法,允许在束搜索丢弃用户特定物品排序对应的SID前缀之前,让该排序支持这些前缀。之后,同一个排序对生成的物品进行排序。ISD无需额外参数或重新训练SID构造器或解码器。我们通过实验证明,在每种评估设置下,ISD相较于对应的SID主干网络在NDCG@10上均有提升,相对增益最高达31.2%。我们的结果表明,SID提供了有用的粗粒度物品组织,但其精细边界不应单独决定生成过程中哪些物品仍然可用。代码和实验制品可在https://anonymous.4open.science/r/ISD-CF7C获取。 生成式推荐,语义ID,离散物品表示,量化 ††版权:无 ††会议:ACM SIGKDD知识发现与数据挖掘会议;2027年;美国加利福尼亚州圣何塞## 1. 引言 生成式推荐系统越来越多地使用语义ID(SID)来表示物品\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Wang等人,2024 (https://arxiv.org/html/2607.24995#bib.bib3);Liu等人,2025 (https://arxiv.org/html/2607.24995#bib.bib4);Hou等人,2025 (https://arxiv.org/html/2607.24995#bib.bib5);Fu等人,2026 (https://arxiv.org/html/2607.24995#bib.bib7)\)。它们利用码本将物品内容转换为离散Token的短序列。其动机颇具说服力:内容指导物品如何被Token化,而共享码本允许相关产品共享Token或前缀。因此,在训练过程中,交互数据可以强化预测中的共同部分,而不是教模型将每个物品都视为不相关的标签。 现有的SID推荐器使用共享Token来编码共同的语义或协同结构\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Wang等人,2024 (https://arxiv.org/html/2607.24995#bib.bib3)\),同时将完整的Token序列视为待生成的物品标识符\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Liu等人,2024 (https://arxiv.org/html/2607.24995#bib.bib4);Fu等人,2026 (https://arxiv.org/html/2607.24995#bib.bib7)\)。这对同一个表示提出了两个要求。共享Token应组织相关物品,使其能受益于共同结构,而完整序列必须唯一标识每个物品。在解码阶段,自回归SID推荐器使用约束束搜索生成预测序列\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Wang等人,2024 (https://arxiv.org/html/2607.24995#bib.bib3);Liu等人,2024 (https://arxiv.org/html/2607.24995#bib.bib4)\)。因此,自回归生成赋予了SID在物品选择中的第三个角色。在每个解码步骤,预测的Token仅保留具有该前缀的物品,并移除其余物品。因此,用于标识单个物品的区分性特征,也成为了关于哪些物品仍符合推荐资格的中间决策。 参见图注图1。SID保留了广泛的语义组织,但丢失了精细的局部物品结构。一个从左到右的连续图表总结了本文。同一物品的两个描述通过相同的编码器,但获得了不同的确切SID。在生成过程中,解码器偏好Token a,即使留出目标位于Token b之下;选择Token a会将目标从所有后续决策中移除。ISD从训练交互中构建一个排序的物品集,将其最强物品映射到其SID前缀,并在束缩减之前将该支持与解码器排名相结合,从而保持目标可用。我们提出两个问题。将物品表示转换为SID时会发生什么变化?由此产生的SID如何影响生成过程中的物品选择?我们通过测试等价描述是否产生相同的确切SID,以及连续物品空间的组织是否在离散化后得以保留来回答第一个问题。我们通过追踪在每个生成Token之后仍可推荐的物品集合如何变化来回答第二个问题。 为了研究SID构建过程中物品表示如何变化,我们考察了内容编码器和SID构造器(§3 (https://arxiv.org/html/2607.24995#S3))。遵循受控行为测试的原则\(Ribeiro等人,2020 (https://arxiv.org/html/2607.24995#bib.bib34)\),对于每个物品,我们创建一个替代描述,其中包含完全相同的词汇,但以不同顺序呈现其字段,例如将标题放在描述之前而不是之后。在三个编码器家族中,原始描述和替代描述的平均余弦相似度约为0.99。在基于所有原始物品表示的最近邻检索中,替代表示在99.57%的办公用品和科学案例中首先检索到其对应的物品。在八种SID构建和三个领域上,平均38.4%的物品获得了不同的确切SID,而由此产生的代码空间仅恢复了编码器十个最近邻的32.2%。因此,SID保留了广泛的组织结构,但丢失了编码器大量精细的局部结构,并且语义身份本身并不能决定其确切Token。 为了研究由此产生的SID如何影响物品选择,我们跟踪每个留出目标通过SID生成的过程,并记录该目标在哪个Token处无法再被返回(§4 (https://arxiv.org/html/2607.24995#S4))。每个生成的Token都会缩小剩余物品集合,而移除一个SID前缀会永久删除所有以其开头的SID对应的物品。在最终排序之前,仅有5.1%的目标得以保留。一个单独的推荐器随后对所有符合条件的物品进行排序。在固定SID和束大小的情况下,允许排名较高的物品支持其前缀,可将目标可用性提高到8.5%。 这些结果共同揭示了SID组织物品的方式与其在生成过程中使用方式之间的不匹配。SID Token必须区分单个物品,但束搜索也使用这些Token来决定哪些物品仍然符合条件。因此,用于标识的区分性特征可能变成一个过早的相关性决策。这启发了我们的方法:利用SID来组织和标识物品,同时引入独立的物品级证据来确定哪些物品仍在考虑之中。 当前工作。我们提出了*物品支持解码*(ISD),一种轻量级的解码干预措施,无需额外参数或重新训练。给定一个从用户历史推导出的物品排序,ISD在束缩减之前为与高排名物品相关联的SID前缀赋予额外权重。因此,一个前缀可以因为解码器偏好它,或者因为它包含一个对用户排名很高的物品而得以保留。生成后,ISD使用相同的排序对生成的物品进行排序。 近期工作通过架构改变减少了对早期SID决策的依赖。SETRec预测一个与顺序无关的Token集合,而不是有序的SID\(Lin等人,2025 (https://arxiv.org/html/2607.24995#bib.bib6)\)。LIGER保留了SID生成,但增加了密集检索作为遗漏物品的第二路径\(Yang等人,2025 (https://arxiv.org/html/2607.24995#bib.bib16)\)。而ISD则在现有的自回归解码器内部运行,在束搜索使Token决策不可逆之前进行干预。在所评估的系统中,ISD将NDCG@10提升了最高31.2%。我们的主要贡献如下: SID结构的受控研究:我们引入了一个同一物品评估,将连续物品识别、确切SID分配和局部结构保存分开。不同于仅基于重建或推荐准确性的评估,我们的分析测试了包含相同物品事实的描述在SID构建后是否仍然等价。在三个领域和八种SID构建上,我们表明当前的SID保留了广泛的语义组织,但丢失了编码器大量精细的局部结构,而其确切Token并非仅由语义身份决定。 对自回归生成的影响:我们通过跟踪每个语义Token之后的留出目标,将SID结构与生成联系起来。我们的分析显示了精细的SID区分如何在束搜索过程中变成不可逆的物品选择决策。一个受控的干预进一步表明,允许物品级证据在束缩减之前起作用,可以在相同的SID和束大小下保留更多的真实目标。 物品支持解码:基于这些发现,我们提出了ISD,一种轻量级的推理时方法,无需重新训练SID构造器或解码器。ISD接受来自任何排序方法的物品排序,使用它在束缩减之前支持相关的SID前缀,并在之后仅对生成的物品进行排序。在TIGER和LIGER、三个领域以及由训练统计、SASRec和UniSRec产生的排序上,ISD一致地提升了NDCG@10,增益最高达31.2%。 参见图注图2。SID构建、物品过滤和物品支持解码(ISD)概览。一个从左到右的连续图表总结了本文。同一物品的两个描述通过相同的编码器,但获得了不同的确切SID。在生成过程中,解码器偏好Token a,即使留出目标位于Token b之下;选择Token a会将目标从所有后续决策中移除。ISD从训练交互中构建一个排序的物品集,将其最强物品映射到其SID前缀,并在束缩减之前将该支持与解码器排名相结合,从而保持目标可用。 ## 2. 准备工作 本节定义生成式推荐任务以及本文中使用的符号。 ##### 生成式推荐。 令I=\{1,...,N\}\mathcal{I}=\{1,\ldots,N\}为物品集合,U\mathcal{U}为用户集合。对于用户u∈Uu\in\mathcal{U},交互历史Hu=(i1,...,iT)H_u=(i_1,\ldots,i_T)是来自I\mathcal{I}的有序物品序列。给定HuH_u,下一物品推荐任务是将目标物品i+∈Ii^+\in\mathcal{I}排在其余物品之前。我们将训练样本记为D={(Hu,i+)}\mathcal{D}=\{(H_u,i^+)\}。 ##### 语义ID。 每个物品ii关联着内容xix_i,例如其标题、品牌、类别或描述。一个SID流水线将该内容编码为连续表示hi=f(xi)h_i=f(x_i),并将其离散化为语义元组zi=q(hi)=(zi,1,...,zi,L)z_i=q(h_i)=(z_{i,1},\ldots,z_{i,L})\(Lee等人,2022 (https://arxiv.org/html/2607.24995#bib.bib31);Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Wang等人,2024 (https://arxiv.org/html/2607.24995#bib.bib3)\)。一些构造器还应用碰撞解决或唯一性规则aa\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1)\);因此我们写 (1)hi=f(xi),zi=q(hi),Ci=a(zi,i),h_i=f(x_i),\qquad z_i=q(h_i),\qquad C_i=a(z_i,i),其中Ci=(ci,1,...,ci,Li)C_i=(c_{i,1},\ldots,c_{i,L_i})是推荐系统使用的完整SID。当不需要额外规则时,aa是恒等映射,Ci=ziC_i=z_i。此符号区分了连续物品表示hih_i、内容导出的离散元组ziz_i以及呈现给推荐模型的完整物品序列CiC_i。 ##### 基于SID的预测。 令C(Hu)=(Ci1,...,CiT)C(H_u)=(C_{i_1},\ldots,C_{i_T})为用户历史的SID表示。一个生成式推荐器将概率pθ(Ci∣C(Hu))p_\theta(C_i\mid C(H_u))赋予物品的完整SID,并通过以下方式进行训练\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1)\) (2)Lrec(θ)=−∑(Hu,i+)∈Dlog pθ(Ci+∣C(Hu))。\mathcal{L}_{\mathrm{rec}}(\theta)=-\sum_{(H_u,i^+)\in\mathcal{D}}\log p_\theta\!\left(C_{i^+}\mid C(H_u)\right)。对于自回归解码器,此序列概率分解为pθ(Ci∣C(Hu))=∏l=1Lipθ(ci,l∣C(Hu),ci,<l)p_\theta(C_i\mid C(H_u))=\prod_{\ell=1}^{L_i}p_\theta(c_{i,\ell}\mid C(H_u),c_{i,<\ell})\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1)\);并行解码器使用不同的分解,但预测相同的完整物品序列\(Hou等人,2025 (https://arxiv.org/html/2607.24995#bib.bib5)\)。在推理时,生成的SID通过系统的SID到物品映射解析为物品,物品按序列得分排序。后面的章节将在构造器或解码规则需要时区分语义元组和完整SID。 ## 3. 语义ID保留了什么,丢失了什么 语义ID基于一个共同前提:物品内容既能提供用于跨相关物品共享信息的结构,也能提供在生成过程中标识物品的离散标签\(Rajput等人,2023 (https://arxiv.org/html/2607.24995#bib.bib1);Wang等人,2024 (https://arxiv.org/html/2607.24995#bib.bib3);Liu等人,2024 (https://arxiv.org/html/2607.24995#bib.bib4);Hou等人,2025 (https://arxiv.org/html/2607.24995#bib.bib5);Fu等人,2026 (https://arxiv.org/html/2607.24995#bib.bib7)\)。SID期望将相似物品置于相似代码下,同时为每个物品分配一个可识别的序列。我们从两个角度研究这一转换过程中发生了什么变化。首先,我们测试同一物品的等价描述是否产生相同的确切SID。其次,我们测试连续物品空间的组织在SID构建后还有多少得以保留。这些属性之所以重要,是因为确切SID是监督
相似文章
赋能跨域序列推荐:混合分词与串并化解码
本文提出GenCDSR,一种用于跨域序列推荐的生成式框架,采用混合分词与串并化解码,在准确率上优于现有最优基线,并将推理延迟显著降低。
GuidedRAG: Semantic Steering of Retrieval-Augmented Generation
GuidedRAG is a research paper proposing a novel RAG extension that adds a semantics-based selection stage before retrieval, improving retrieval relevance and reducing overhead across diverse RAG variants.
SENSE:基于语义嵌入导航与软门控评估的检索式推测解码
提出SENSE,一种用于检索式推测解码的语义嵌入导航方法,利用隐状态进行语义对齐和软门控评估,在LLaMA和Qwen系列上实现高达3.26倍加速,同时保持生成质量。
超越语义相似性:通过直接语料库交互重新思考智能体搜索的检索
论文提出了直接语料库交互(DCI),这是一种新颖的方法,允许AI代理使用标准终端工具直接查询原始文本,而不是传统的基于嵌入的检索。通过绕过固定的相似性接口和离线索引,DCI在多个信息检索和智能体搜索基准上显著优于传统的稀疏、密集和重排序基线。
idSCD:通过语义相关描述符识别训练数据集
本文介绍了 idSCD,一种使用语义相关描述符来识别数据集是否用于模型训练的白盒方法,在多种设置下均优于现有基线。