语义ID推荐系统的离线策略评估:模型自身的代码层次结构能否提供帮助?

arXiv cs.LG 论文

摘要

本文探讨了在生成式推荐器中使用模型的语义ID层次结构进行离线策略评估,表明在生产日志约束下,通过粗化到代码前缀聚类可以提高估计精度。

arXiv:2608.28905v1 Announce Type: new 摘要: 生成式推荐器越来越多地使用语义ID(SIDs):每个项目是从残差量化器中得到的层次离散代码的短序列,通过自回归方式解码。在进行昂贵的A/B测试之前,团队可能会离线决定哪些解码器或重排序变体值得测试——这是离线策略评估(OPE)的任务。我们提出一个简单的问题:模型自身的SID树能否作为该OPE的动作抽象?我们的答案有三个部分。 (i) 在真实推荐器使用的近似最大对数记录下,单个项目的OPE是无望的——因为生产日志中项目级别的有效样本量通常很小——但将项目聚合到代码前缀聚类中可以恢复可估计的支持并减少误差。 (ii) 这种增益得益于粗化,而非层次结构本身;但SID树使得粗化在生成系统中可行——每个聚类的质量可以准确且低成本地通过解码器返回,而平坦聚类需要枚举项目/叶节点质量,这仅代码解码器无法直接暴露。 (iii) 分辨率深度是关键调节参数——在支持稀缺时更粗化——并且一个条件偏差界限将粗化偏差与量化器的最坏情况重建残差和目标日志分歧联系起来。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:59

# 语义ID推荐器的离线策略评估:模型自身的代码层级结构是否有帮助?
来源:https://arxiv.org/html/2608.28905
###### 摘要。

生成式推荐系统越来越多地输出*语义ID*(SIDs):每个物品对应一个来自残差量化器的简短分层离散代码序列,通过自回归方式解码。在进行昂贵的A/B测试之前,团队可能需要*离线*决定哪些解码器或重排序变体值得测试——这正是离线策略评估(OPE)的任务。我们提出一个简单的问题:模型自身的SID树能否作为该OPE的*动作抽象*?我们的答案包含三个部分。(i)在真实推荐系统使用的近似最大值记录策略下,单物品OPE是无望的——因为生产日志中物品级别的有效样本量通常很小——但将物品聚合到代码前缀*簇*中可以恢复可估计的支持量并降低误差。(ii)这种增益源于*粗粒化*,而非层级结构本身;但SID树使得在生成式系统中进行粗粒化*可行*——每个簇的质量能通过解码器精确且低成本地返回,而扁平聚类则需要枚举物品/叶节点质量,这是仅输出代码的解码器无法直接提供的。(iii)分辨率深度是关键调控参数——在支持量稀缺时采用更粗粒度——条件偏差界将粗粒化偏差与量化器的*最差*重建残差及目标-记录分布散度联系起来。

## 1.引言

生成式检索——将每个物品编码为称为*语义ID*(SID)的简短分层离散代码序列,并自回归解码下一个物品的SID——正逐步进入生产级推荐系统(Rajput等人,2023;Wang等人,2024)。对此类系统的任何改动(如新解码器、解码温度或重排序规则)都会改变其分发物品的分布。决定哪些候选改动值得进行稀缺而昂贵的A/B测试,正是*离线策略评估*(OPE)的作用:从现有策略收集的日志中估计候选策略的线上奖励,从而在实时测试前对候选策略进行排序和筛选。

障碍在于生产系统的记录方式。探索通常是*近似最大值*策略——按物品分数加权,而非均匀采样——因此少量物品主导每次展示,单物品逆倾向评分(IPS)的重要性权重会爆炸。在我们的生产日志中,物品级别的有效样本量(ESS)仅约为原始计数的0.003:单物品OPE无法作为可行的决策工具。我们的研究范围是固定物品池上的*物品选择*策略(记录策略和目标策略从同一池中选择物品);我们不涉及改变候选生成器的情况,因为这会改变动作集并可能分发没有记录支持的物品(Wang等人,2025)。

SID模型为我们提供了现成的动作抽象:其代码前缀形成了对物品池的嵌套划分。将单物品倾向聚合到代码前缀*簇*中,可以汇集支持量并使权重重新可估计,代价是簇内偏差。关键的是,自回归解码器已经*精确*生成每个前缀的概率,作为各级条件概率的乘积,无需对物品池求和——因此代码深度是一个原生、低成本的分辨率调控参数。SID树是否具有足够的*奖励一致性*使得这种做法值得,并不显然,且取决于具体代码。

我们提供以下贡献:i)我们将动作抽象*即*模型SID树的OPE问题形式化,并提供一个生产诊断,表明在现实的近似最大值记录策略下,单物品OPE不可行。ii)我们提出随后聚合到代码前缀;一个条件偏差界(命题3.1)将簇聚合IPS的粗粒化偏差与量化器的最差重建残差及目标-记录分布散度联系起来。iii)我们进行了一系列实验,包括支持量恢复、SID树的不同取值、跨域评估器比较、嵌入源、量化器以及从记录数据中选择深度。

#### 相关工作。

大规模动作OPE提供了我们在代码粒度上复用的估计器:*MIPS*在较粗的动作嵌入上重新加权,用方差换取聚合偏差(Saito和Joachims,2022);*OffCEM*添加奖励模型加残差权重,使偏差仅来自模型缺失部分(Saito等人,2023);*策略卷积*(PC)在嵌入核上平滑,其带宽扮演分辨率角色(Sachdeva等人,2024);*POTEC*将问题分解为簇进行策略*学习*(Saito等人,2025)。这些方法都假设给定扁平嵌入或临时聚类。最接近的生成式检索工作是在离线REINFORCE学习目标*内部*调整双重稳健估计,针对稠密双塔嵌入,而非代码树(Matveev等人,2026);据我们所知,先前没有工作在SID树本身上评估策略。其他工作*学习*动作嵌入(Cief等人,2024a)或从数据中选择估计器和超参数(Udagawa等人,2023;Felicioni等人,2024)——这些是开放深度选择步骤(研究问题5)的构建模块。精神上最接近的是边际密度比估计器(Taufiq等人,2023),它从基础单动作倾向*学习*其比率,因此重新引入了仅输出代码的解码器不暴露的物品级依赖性。我们则测试检索器的*原生*树。

## 2.在语义ID树上进行OPE

*设置与符号。* 记录策略π₀(a|x)生成日志{(x_i, a_i, r_i)}_{i=1}^M:上下文x_i,从物品池A中选择的物品a_i,奖励r_i,其均值为q(x, a)。我们想要目标策略的价值,V(π_e) = E_x E_{a∼π_e}[q(x, a)]。每个物品a有来自物品嵌入z(a)的残差量化器生成的SID c(a) = (c₁, ..., c_L);长度ℓ的前缀c_≤ℓ(a)定义一个*簇*A_c = {a' : c_≤ℓ(a') = c}。策略在该簇上的质量为π(c|x) = Σ_{a∈A_c} π(a|x)。单物品IPS通过π_e(a)/π₀(a)重新加权,需要单物品重叠;自归一化变体(SNIPS)除以权重总和以控制方差。

*聚合到树上。* 核心操作是在簇粒度上重新加权:\hat{V}_ℓ = (1/M) Σ_i [π_e(c_≤ℓ(a_i)|x_i) / π₀(c_≤ℓ(a_i)|x_i)] r_i,这是一个层次化MIPS估计器(Saito和Joachims,2022)。它校正目标策略在簇*上*的分布,同时保持记录策略在每个簇*内*的分布不变,因此其唯一偏差是簇内目标-记录不匹配(第3节)。它仅需要*簇正性*——只要π_e(c|x) > 0则π₀(c|x) > 0——这远弱于单物品正性。更粗的ℓ增加支持量但提高簇内偏差:深度是偏差-方差调控参数。

*为何是树,而非任意聚类。* 对于自回归SID策略,簇质量不是对A的求和,而是精确的前缀概率π(c_≤ℓ|x) = ∏_{t≤ℓ} π(code_t | x, code_{<t}),可直接从解码器以O(ℓ)获得。为*扁平*聚类形成相同质量需要单物品倾向π₀(a|x)和O(|A|)求和——而生成式检索器输出代码,而非归一化物品分布,因此这些物品倾向通常不可用。因此,SID树是实际可在线运行的簇表示。(如果多个物品共享完整代码,该叶节点就是一个小簇;没有变化。)我们验证这种等价性是精确的,而非近似的:构建自回归树策略并以缀乘积读取质量,在每个层级精确复现物品求和簇边际(附录A)——因此我们受控实验中使用的物品求和簇质量正是解码器免费返回的结果。

## 3.偏差与量化质量

*直觉。* 由于聚合精确匹配目标策略的簇质量,估计器只能在簇*内*出错:其偏差是π_e和π₀在簇内不一致的程度,乘以该处奖励变化的程度——这是OffCEM簇内残差效应的非正式对应物(Saito等人,2023)。奖励一致的代码使该变化较小。量化质量是自然代理:簇内物品共享重建ẑ_ℓ,如果奖励在嵌入中平滑,簇内奖励扩散由重建残差控制。

*界。* 令ẑ_ℓ(a)表示用前ℓ个代码对z(a)的重建,δ_ℓ(a) = ||z(a) - ẑ_ℓ(a)||,令δ_ℓ^{max} = max_a δ_ℓ(a)为最差残差;ε_ℓ = E_{a∼μ} δ_ℓ(a)^2是量化器训练以最小化的平均平方重建误差。令TV_ℓ^{in}(x) = Σ_c π_e(c|x) TV(π̃_e(·|c,x), π̃_0(·|c,x))表示π_e加权的*簇内*不一致,其中π̃(·|c,x)是策略在簇A_c内诱导的条件分布。假设(A0)簇正性、已知倾向且E[r|x,a] = q(x,a);(A1)无直接效应,q(x,a) = q̃(x, z(a))——MIPS的假设,在此施加于*完整*嵌入使得粗粒化偏差有界而非零;(A2)q̃(x, ·)在包含每个物品嵌入和簇重建的集合上是L_q-Lipschitz连续的。

###### 命题 3.1。

令Bias(\hat{V}_ℓ) = E[\hat{V}_ℓ] - V(π_e)为级别ℓ簇聚合IPS估计器(MIPS_{hier})相对于真实目标值的误差。在(A0)-(A2)下,

||Bias(\hat{V}_ℓ)|| ≤ 2 L_q δ_ℓ^{max} E_x[TV_ℓ^{in}(x)] ≤ 4 L_q δ_ℓ^{max} E_x[TV(π_e, π₀)],

且第二项物品级别形式中的常数无法改进(证明见附录B)。若还有δ_ℓ^{max} ≤ κ√ε_ℓ,则两种形式均成立,δ_ℓ^{max}替换为κ√ε_ℓ。

*解读界。* 两个量控制偏差,平均重建误差不是其中之一。*最差*残差首当其冲:更细的码本仅在其改善最差重建物品时才能收紧界,因此它可能降低ε_ℓ而保持δ_ℓ^{max}不变——达到ε_ℓ形式需要特定于码本的κ,因此ε_ℓ在不同分词器或源之间不可比。第二是*簇内*不一致:粗粒化在策略条件一致的地方不产生偏差,无论它们在簇间多远。物品级别形式丢弃了这一点,因此有上述排序。

三个极限,详见附录B:该界仅涵盖原始簇聚合IPS;仅在量2 L_q δ_ℓ^{max} E_x[TV_ℓ^{in}]低于1时它优于平凡界||Bias|| ≤ 1;且(A1)在我们的测试平台中仅近似成立,因此我们用其推理粗粒化*机制*,而非预测测量偏差。*方差*则朝相反方向变化:簇聚合IPS具有通常的聚合权重二阶矩(Saito和Joachims,2022),随粗粒化汇集支持量而下降。对于我们要突出的估计器,闭式方差难以处理,因此我们通过ESS(反方差代理;研究问题1的崩溃是权重方差爆炸)和自助法置信区间来跟踪它。

## 4.实验

我们回答六个问题。研究问题1:单物品OPE在真实推荐日志上是否可行?研究问题2:代码簇聚合是否恢复支持量,已知估计器在代码粒度上如何比较?研究问题3:*何时*层级结构有帮助,最佳分辨率如何随支持量变化?研究问题4:代码源和分词器如何影响?研究问题5:自适应分辨率能否优于固定层级?研究问题6:它能否推广到第二个数据集?

### 4.1.数据集与协议

生产日志(动机,研究问题1)。一个大型电子商务推荐系统通过分数加权(Plackett-Luce)采样进行探索,因此服务物品的倾向可从记录的归一化器中恢复。由于缺乏随机化曝光的预言机,我们仅用这些日志进行支持量诊断(附录A)。

KuaiRand(*主要*受控测试平台,研究问题2-研究问题5)。其随机曝光切片(Gao等人,2022)均匀随机展示物品,因此单物品点击率是无偏的,且无需担心曝光混淆即可识别预言机。我们按行划分:一半设置点击率以构建记录和目标策略,不相交的另一半是评估真相q_{eval}——既是奖励r∼Bernoulli(q_{eval}(a))的数据生成过程(DGP),也是预言机价值V(π_e) = Σ_a π_e(a) q_{eval}(a) = 0.499。没有估计器通过策略看到评估结果:该协议*无信息泄漏*(附录A)。这是一个包含|A|=7339个物品及内容元数据、语义、协同和融合代码树的目录老虎机(第4.5节)。

Amazon Reviews(跨域复制,研究问题6)。乐器类别的数据。

相似文章

生成式推荐中的难度感知语义ID优化

arXiv cs.AI

本文提出DASO,一种针对生成式推荐的树感知后训练方法,通过分析rollout组并根据前缀匹配深度重新分配,解决GRPO中的难度不匹配问题,在公开基准测试中提升性能。

理解语义ID:从物品表征到生成式推荐中的物品选择

arXiv cs.AI

本文系统性地研究了生成式推荐中的语义ID(SID),发现SID虽然保留了物品的粗粒度组织,但丢失了编码器中的细粒度局部结构。作者提出物品支持解码(ISD),一种轻量级的推理时方法,在无需额外参数或重新训练的情况下,将NDCG@10提升高达31.2%。