ScaleToT: 泛化结构化LLM推理以用于十亿级低活跃用户建模

arXiv cs.AI 论文

摘要

ScaleToT提出了一种方法,旨在将结构化LLM推理泛化到十亿级低活跃用户建模中,通过思维树(ToT)精炼和训练学生模型来降低成本。在广告部署中的在线A/B测试显示,LT30提升了6.738%。

arXiv:2606.24605v1 Announce Type: new Abstract: 准确的用户建模通常依赖于丰富的交互历史,但对于数十亿的低活跃用户而言,这些历史数据是不可用的。大语言模型(LLM)可以从静态档案中推断潜在的用户状态,但当档案稀疏时,这种推理变得不可靠,并且对数十亿用户应用LLM的成本过高。我们提出了ScaleToT,它从一个小的LLM处理子集中学习结构化推理,并将其扩展到更广泛的低活跃用户群体。为了提高推理的可靠性,ScaleToT通过有界熵引导的思维树(ToT)精炼过程构建带类型的用户状态链。为了使这种结构化推理能够从稀疏档案中可用,教师精炼的链被用于通过监督微调(SFT)和结果驱动的分段感知隐式奖励策略优化(OSIPO)在静态档案上训练学生模型。然后ScaleToT将学生的推理表示转移到一个轻量级的档案编码器中,为其余用户提供共享的推理信号,而无需LLM推理。我们在十亿级广告部署中评估了ScaleToT在生命周期价值(LTV)预测上的表现。一项随机在线A/B测试将LT30提升了6.738\%,而离线推理仅覆盖了潜在人口的7.32\%,与全人口推理相比大大降低了计算成本。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:48

# 为十亿级低活跃用户建模泛化结构化LLM推理

来源:https://arxiv.org/html/2606.24605
习畅 邹一川 李成根 陈林轩 卢子龙 牛亚楠 刘赵杰 李涵 盖坤

###### 摘要

精确的用户建模通常依赖于丰富的交互历史,但对于数十亿的低活跃用户而言,这种历史数据不可用。大型语言模型(LLM)可以从静态档案中推断潜在的用户状态,但当档案稀疏时,这种推理变得不可靠,并且将LLM应用于数十亿用户的成本高得令人望而却步。我们提出ScaleToT,它从一小部分LLM处理的子集中学习结构化推理,并将其推广到更广泛的低活跃用户群体。为了提高推理可靠性,ScaleToT构建了带类型的用户状态链,并采用了有界熵引导的思维树(ToT)优化过程。为了使这种结构化推理在稀疏档案下可用,教师精选的链条被用于在静态档案上通过监督微调(SFT)和结果驱动分段感知隐式奖励策略优化(OSIPO)训练学生模型。然后,ScaleToT将学生的推理表示转移到一个轻量级的档案编码器,为其余用户提供共享的推理信号,而无需LLM推理。我们在十亿级广告部署中评估了ScaleToT在生命周期价值(LTV)预测上的表现。随机在线A/B测试使LT30提升了6.738%,而离线推理仅覆盖了潜在人群的7.32%,与全人群推理相比大幅降低了计算成本。

用户建模,大型语言模型,结构化推理,思维树,生命周期价值预测

## 1 引言

用户理解是十亿级推荐、个性化及用户增长平台的基础(He et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib6)),其目标是推断驱动行为的潜在状态和意图,而不仅仅是拟合表面交互模式(Chang et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib2))。主流范式将其建模为对点击、购买和浏览事件等交互流的行为序列建模(Zhang et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib34); Xia et al., 2022 (https://arxiv.org/html/2606.24605#bib.bib28)),并且恰好当每个用户提供足够、最近且信息丰富的历史时效果最佳(Zhai et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib33))。一个庞大且具有商业重要性的群体从根本上违背了这一假设:低活跃用户,特别是广告客户获取活动所针对的休眠用户,留下的历史数据过于稀疏或陈旧,无法作为可靠的行为证据(Monteil et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib14); Li et al., 2022b (https://arxiv.org/html/2606.24605#bib.bib9); Zhang et al., 2022 (https://arxiv.org/html/2606.24605#bib.bib35); Li et al., 2022a (https://arxiv.org/html/2606.24605#bib.bib8))。对于这些用户,工业目标也发生了变化,从预测下一个项目转向估计生命周期价值(LTV)、留存潜力和重新参与后的广告收益(Su et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib18); Wang et al., 2024b (https://arxiv.org/html/2606.24605#bib.bib23)),这几乎完全依赖于稀疏的静态档案(Yang et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib30))。现有的稀疏性解决方案,包括辅助信息融合和跨领域迁移,仍然将结构化行为信号作为其主要输入(Li et al., 2022b (https://arxiv.org/html/2606.24605#bib.bib9); Xiao et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib29)),而这恰恰是这些用户所不提供的。

我们的出发点是重新审视这种机制实际所需的条件。行为稀疏性并不意味着用户无法被理解(Li et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib10));即使是一个休眠用户也携带了潜在的偏好和重新参与的潜力,这些在静态档案线索中微弱地反映出来(Liu et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib12))。困难在于,这些状态必须从稀疏的证据中推断,而不是从观察到的行为中得出。因此,任务从外推下一次交互转变为从静态档案构建可靠的用户表示。这正是大型语言模型(LLM)的用武之地:不是作为更大的序列编码器,而是作为推理器,在行为轨迹缺失时应用关于用户动机和行为驱动因素的世界知识(Xi et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib26); Wang et al., 2024c (https://arxiv.org/html/2606.24605#bib.bib24), 2025 (https://arxiv.org/html/2606.24605#bib.bib22); Zhai et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib32))。

参见图注(a)
参见图注(b)

图1:将LLM推理应用于低活跃用户的两个障碍。(a) 在稀疏档案上,直接LLM查询给出一个嘈杂且不透明的预测,没有可检查的中间状态。(b) 每个用户运行一次LLM推理使得成本随用户基数线性增长。这两者共同使得对十亿级人群的LLM推理既不可靠又负担不起。在此场景下直接使用LLM推理面临两个挑战。首先,从稀疏档案中得出的单一预测将多个潜在维度压缩成一个不透明的判断,没有留下可检查、约束或优化的中间状态。其次,每个用户的推理使得生产成本与目标人群线性增长。因此,有用的LLM推理必须在稀疏证据下可靠,并且对其生成用户之外的其他用户也可重用。

ScaleToT从一个小的离线子集中学习结构化推理,并将其应用于从稀疏档案进行的人群规模预测。训练示例可能包含推理时无法获得的特权信息。由于稀疏档案不能直接揭示任务相关的潜在状态,教师利用这些信息在一个有界的思维树(ToT)过程中构建与结果一致的推理链。该过程维护对类型化用户状态的并行解释,评估其不确定性,并选择性地修正不确定的字段,而不是重新生成整个链。由此产生的链作为学生模型的训练数据,该模型通过监督微调(SFT)和我们提出的结果驱动分段感知隐式奖励策略优化(OSIPO)从静态档案进行推理。然后,ScaleToT将轻量级档案编码器与学生推理对齐,并使用向量量化(VQ)码本检索共享的推理模式,从而在没有LLM推理的情况下实现人群规模的预测。我们将ScaleToT一般性地表述,但仅在对低活跃用户LTV预测的评估中,五个类型化字段捕捉了生命周期维度。

本工作的主要贡献总结如下:

- •我们通过将潜在用户状态表示为类型化链,并使用有界熵引导的ToT优化过程进行优化,使基于LLM的用户状态推理在稀疏档案下变得可靠。该过程保留可行的替代方案并局部修正不确定状态,而OSIPO则提供分段感知、结果驱动的监督,无需状态级标注。
- •我们通过将轻量级档案编码器与学生生成的链对齐,并将重复出现的推理模式量化到VQ码本中,使结构化推理在人群规模下可重用。在推理时,用户检索档案条件的推理原型,无需LLM生成或链嵌入。
- •我们在十亿级广告部署中验证了ScaleToT用于LTV预测。仅为潜在人群的7.32%生成了结构化推理,而随机在线A/B测试将LT30提升了6.738%。

## 2 相关工作

##### 低活跃用户建模。

现有方法通过元数据(Gantner et al., 2010 (https://arxiv.org/html/2606.24605#bib.bib4); Monteil et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib14))、元学习(Vartak et al., 2017 (https://arxiv.org/html/2606.24605#bib.bib20); Moghaddam et al., 2026 (https://arxiv.org/html/2606.24605#bib.bib13))、Bandit探索(Nguyen et al., 2014 (https://arxiv.org/html/2606.24605#bib.bib15))或多模态证据(Pan et al., 2022 (https://arxiv.org/html/2606.24605#bib.bib16))来弥补稀疏交互。其他方法跨用户、跨活动水平或跨领域传递信息(Zhu et al., 2021 (https://arxiv.org/html/2606.24605#bib.bib36)):Cold-Transformer(Li et al., 2022b (https://arxiv.org/html/2606.24605#bib.bib9))跨活动水平调整表示,MARS(Xiao et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib29))检索高活跃用户以丰富稀疏历史,跨领域LTV方法学习不变表示(Su et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib18))或使用外部数据增强样本(Wang et al., 2024b (https://arxiv.org/html/2606.24605#bib.bib23))。这些方法仍然锚定在观察到的行为或与行为相关的信号上,使得当历史几乎缺失或过时时效果较差。

##### 用于用户建模和推荐的LLM。

LLM可以为推荐提供外部知识或显式推理。KAR(Xi et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib26))引出偏好和事实知识以丰富传统表示,而LLMRG(Wang et al., 2024c (https://arxiv.org/html/2606.24605#bib.bib24))从档案和行为序列构建并验证个性化推理图。更一般地,思维链(CoT)提示(Wei et al., 2022 (https://arxiv.org/html/2606.24605#bib.bib25))、思维树(ToT)搜索(Yao et al., 2023 (https://arxiv.org/html/2606.24605#bib.bib31))、过程奖励模型(PRM)(Lightman et al., 2024 (https://arxiv.org/html/2606.24605#bib.bib11))以及使用可验证奖励的强化学习(RL)(Guo et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib5))暴露或监督中间推理。近期方法如LettinGo(Wang et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib22))、EXP3RT(Kim et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib7))、ELEC(Dong et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib3))和ChoirRec(Zhai et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib32))将这些能力应用于用户表示,但没有共同解决从近乎空白的档案进行不可靠推理以及人群规模的推理成本问题。

面向效率的系统预计算兴趣簇转换(Wang et al., 2024a (https://arxiv.org/html/2606.24605#bib.bib21))或将LLM处理与推理分离(Xi et al., 2025 (https://arxiv.org/html/2606.24605#bib.bib27)),但仍然主要从行为历史中推导可重用结构。ScaleToT则将ToT实例化为对一组有限的任务定义状态字段的有界类型搜索,而非开放式树扩展;从仅训练可用的特权监督中学习;通过共享的VQ原型在人群水平上传递推理,而非每个用户的蒸馏;并且仅从档案进行推理。熵对优化优先级进行排序,而非估计校准误差;评估的采样比例特定于我们的部署环境。

## 3 问题形式化

### 3.1 通用稀疏输入结构化推理迁移

我们考虑带有训练专属特权上下文的稀疏输入预测。令U\\mathcal{U}为全量人群,Usp⊂U\\mathcal{U}_{\\mathrm{sp}}\\subset\\mathcal{U}为其推理时输入过于稀疏以至于无法进行序列建模的子集。每个实例u∈Uspu\\in\\mathcal{U}_{\\mathrm{sp}}在预测截止点前有一个稀疏输入xu∈Rd\\bm{x}_u\\in\\mathbb{R}^d,一个目标yu∈Yy_u\\in\\mathcal{Y},以及仅用于历史监督的可选特权上下文pup_u。

我们用KK个任务定义的类型化字段表示yu\y_u背后的潜在状态:

cu\\displaystyle\\bm{c}_u=\(cu1,...,cuK\),\\displaystyle=\(c_u^1,\\dots,c_u^K\),\(1\)cuk\\displaystyle c_u^k∈Tk=\{tk,m\}m=1\|Tk\|,k=1,...,K,\\displaystyle\\in\\mathcal{T}_k=\\\{t_{k,m}\\\}_{m=1}^{\|\\mathcal{T}_k\|},\\quad k=1,\\dots,K,其中cukc_u^k是字段kk的值,Tk\\mathcal{T}_k是其有限候选集,tk,mt_{k,m}是其第mm个候选。字段独立生成并按固定顺序序列化;此顺序既不暗示时间也不暗示因果依赖,且\|Tk\|\|\\mathcal{T}_k\|可能因字段而异。

ScaleToT在以下条件下适用。

###### 假设1。

*\(i\)*潜在的与任务相关的状态可以由一组有限的类型化字段表示;*\(ii\)*训练实例允许可选的带特权监督;*\(iii\)*在预测路径中,每个实例的LLM推理不可行或不理想。

### 3.2 预测时信息边界

对于每个实例,t0t_0是预测截止点。输入xu\\bm{x}_u仅包含截至t0t_0可用的信息;特权上下文pup_u可以标注训练示例,但被排除在学生、输入编码器、码本查询、验证/测试数据以及推理请求之外。

### 3.3 ScaleToT目标

由于每个实例的LLM推理在规模上不可行,它被限制在一个历史子集ULLM⊂Usp\\mathcal{U}_{\\mathrm{LLM}}\\subset\\mathcal{U}_{\\mathrm{sp}}中,其比例为ρ=\|ULLM\|/\|Usp\|\\rho=\|\\mathcal{U}_{\\mathrm{LLM}}\|/\|\\mathcal{U}_{\\mathrm{sp}}\|。令c~u\\tilde{\\bm{c}}_u为稀疏输入下的学生链,fllmf_{\\mathrm{llm}}为产生其推理嵌入的固定函数,fuserf_{\\mathrm{user}}为输入编码器,fθf_\\theta为预测器,Ψθ\\Psi_\\theta为VQ检索与融合函数。我们优化:

minfθ,fuser,Ψθ\\displaystyle\\min_{f_\\theta,\\,f_{\\mathrm{user}},\\,\\Psi_\\theta}\\quad∑u∈UspLcal\(fθ\(xu,euagg\),yu\)\\displaystyle\\sum_{u\\in\\mathcal{U}_{\\mathrm{sp}}}\\mathcal{L}_{\\mathrm{cal}}\\\!\\bigl(f_\\theta\(\\bm{x}_u,\\bm{e}_u^{\\mathrm{agg}}\),y_u\\bigr)\(2a\)s.t.\\displaystyle\\mathrm{s.t.}\\quadC1:cuk∈Tk,u∈ULLM,k=1,...,K,\\displaystyle\\mathrm{C1}:\\ c_u^k\\in\\mathcal{T}_k,\\quad u\\in\\mathcal{U}_{\\mathrm{LLM}},\\ k=1,\\ldots,K,\(2b\)C2:zu=\{fllm\(c~u\),u∈ULLM,fuser\(xu\),u∉ULLM,\\displaystyle\\mathrm{C2}:\\ \\bm{z}_u=\\begin{cases}f_{\\mathrm{llm}}\(\\tilde{\\bm{c}}_u\),&u\\in\\mathcal{U}_{\\mathrm{LLM}},\\\\ f_{\\mathrm{user}}\(\\bm{x}_u\),&u\\notin\\mathcal{U}_{\\mathrm{LLM}},\\end{cases}\(2c\)C3:euagg=Ψθ\(xu\),u∈Usp.\\displaystyle\\mathrm{C3}:\\ \\bm{e}_u^{\\mathrm{agg}}=\\Psi_\\theta\(\\bm{x}_u\),\\quad u\\in\\mathcal{U}_{\\mathrm{sp}}\.\(2d\)这里Lcal\\mathcal{L}_{\\mathrm{cal}}是交叉熵损失。C1约束每个字段,C2对齐学生推理和稀疏输入表示,C3使得部署的表示仅依赖于xu\\bm{x}_u。因此,特权证据塑造了在ULLM\\mathcal{U}_{\\mathrm{LLM}}上的离线监督,但当模型应用于Usp\\mathcal{U}_{\\mathrm{sp}}时不可用。

### 3.4 广告LTV实例化

对于广告投放场景,xu\\bm{x}_u包含人口统计信息、设备属性、使用时长、注册

相似文章

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。