具有全局约束的激励广告生成式优化

arXiv cs.LG 论文

摘要

本文提出GOAL,一种约束感知的生成式激励广告框架,将激励分配建模为条件序列生成问题,并引入SCPO来学习一个能够跨ROI约束泛化的单一生成策略。实验表明,该方法在降低ROI违规率的同时,改善了长期收入和用户留存。

arXiv:2608.04421v1 公告类型:新 摘要:激励广告通过分配货币或虚拟奖励来驱动用户参与,其中关键挑战是在严格的全局约束下优化连续的激励强度。该问题因高频交互、延迟反馈以及非马尔可夫用户动态(如疲劳效应)而变得复杂,这些因素限制了现有提升建模和约束强化学习方法的有效性。为应对这些挑战,我们提出GOAL,一种约束感知的生成式框架,将激励分配建模为条件序列生成问题。GOAL直接基于用户历史和系统级全局压力生成激励强度,并集成层次化因果状态编码器以捕获局部行为动态和长期依赖。为实现灵活的约束控制,我们引入安全约束策略优化(SCPO),该算法学习一个能够跨多种ROI约束泛化而无需重新训练的单一生成策略。在大规模真实数据及合成疲劳感知环境上的实验表明,与强基线相比,GOAL在显著降低ROI违规率的同时,改善了长期收入和用户留存。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:50

# 面向全局约束的激励广告生成式优化

来源:https://arxiv.org/html/2608.04421 (2026)

###### 摘要

激励广告通过分配货币或虚拟奖励来驱动用户参与,其关键挑战在于严格全局约束下优化连续激励幅度。这一问题因高频交互、延迟反馈以及疲劳等非马尔可夫用户动态而变得尤为复杂,这些因素限制了现有增量建模和约束强化学习方法的效果。为应对上述挑战,我们提出GOAL,一种约束感知的生成式框架,将激励分配建模为条件序列生成问题。GOAL直接基于用户历史与系统级全局压力生成激励幅度,并集成分层因果状态编码器以同时捕捉局部行为动态与长程依赖。为支持灵活的约束控制,我们引入安全约束策略优化(SafeConstrainedPolicyOptimization,SCPO),该算法仅需训练一次,即可学习一个能够在多种ROI约束区间内泛化的单一生成式策略,无需重新训练。基于大规模真实数据与合成疲劳感知环境的实验表明,与强基线相比,GOAL在提升长期收益与用户留存的同时,显著降低了ROI违约束率。

自回归生成,激励广告,策略优化

††期刊年份:2026††版权:cc††会议:第32届ACM SIGKDD知识发现与数据挖掘会议V.2;2026年8月9日–13日,韩国济州岛††论文集:第32届ACM SIGKDD知识发现与数据挖掘会议V.2论文集(KDD ’26),2026年8月9日–13日,韩国济州岛††DOI:10.1145/3770855.3818423††ISBN:979-8-4007-2259-2/2026/08††CCS:信息系统→推荐系统

## 1. 引言

激励广告已成为现代推荐与广告系统中驱动用户参与的核心机制,平台通过动态分配货币激励(如虚拟币或优惠券)来刺激用户互动(Zhang等,2021 (https://arxiv.org/html/2608.04421#bib.bib85);Chen等,2022 (https://arxiv.org/html/2608.04421#bib.bib86))。与仅关注内容选择的传统广告推荐设置不同(Deng等,2025 (https://arxiv.org/html/2608.04421#bib.bib95);Rajput等,2023 (https://arxiv.org/html/2608.04421#bib.bib75)),激励广告需要在严格全局约束下联合决策每次交互应分配多少激励(Wu等,2018 (https://arxiv.org/html/2608.04421#bib.bib78);Goldenberg等,2020 (https://arxiv.org/html/2608.04421#bib.bib77)),如图1 (https://arxiv.org/html/2608.04421#S1.F1)所示。过高的激励可能带来短期参与度提升,但会严重损害长期盈利能力;而过于保守的策略则无法维持用户参与。设计一种在长期价值与财务安全之间取得平衡的激励分配策略,仍是大规模工业系统中的根本性挑战。

从决策视角看,激励分配可被视为一个具有延迟与累积效应的序贯优化问题。每一次激励决策不仅影响用户的即时响应,还会通过用户疲劳、激励饱和等潜在动态影响未来行为。然而,现有方法难以有效应对这一挑战。增量建模方法虽在生产系统中被广泛采用,但其聚焦于短期处理效应(Pei等,2019 (https://arxiv.org/html/2608.04421#bib.bib82);Zou等,2019 (https://arxiv.org/html/2608.04421#bib.bib83);Zheng等,2018 (https://arxiv.org/html/2608.04421#bib.bib84)),且依赖对预测误差高度敏感的两阶段流水线,导致在投资回报率(ROI)等约束下决策次优(Hansotia和Rukstales,2002 (https://arxiv.org/html/2608.04421#bib.bib80);Zhao等,2019 (https://arxiv.org/html/2608.04421#bib.bib81);Goldenberg等,2020 (https://arxiv.org/html/2608.04421#bib.bib77))。离线强化学习(RL)方法显式优化长期目标,但通常依赖马尔可夫假设,而该假设在高频用户交互中并不成立(Hausknecht和Stone,2015 (https://arxiv.org/html/2608.04421#bib.bib99);Zhao等,2018 (https://arxiv.org/html/2608.04421#bib.bib100);Li等,2024 (https://arxiv.org/html/2608.04421#bib.bib101)),且由于分布偏移与探索受限,容易学习到过于保守的策略(Kiyohara等,2021 (https://arxiv.org/html/2608.04421#bib.bib87);Korenkevych等,2024 (https://arxiv.org/html/2608.04421#bib.bib88);Liu等,2025 (https://arxiv.org/html/2608.04421#bib.bib89))。

参见标题下的图1。图1.激励广告框架概览。平台利用在线模型基于用户上下文与历史行为直接生成激励金额,并将其分发给用户以鼓励其参与广告互动。同时收集相应的用户互动历史,使平台能够在成本与效果约束下进行持续优化。

近年来,受大语言模型启发的生成式序列建模范式在建模复杂用户行为方面展现出潜力,其核心思想是直接基于历史轨迹生成动作(Geng等,2022 (https://arxiv.org/html/2608.04421#bib.bib93);Deng等,2025 (https://arxiv.org/html/2608.04421#bib.bib95);Guo等,2025a (https://arxiv.org/html/2608.04421#bib.bib107);Tay等,2022 (https://arxiv.org/html/2608.04421#bib.bib108))。尽管标准Transformer架构具有强大的表达能力,但在激励广告场景中存在一个关键局限(Li等,2023 (https://arxiv.org/html/2608.04421#bib.bib90);Xiao等,2021 (https://arxiv.org/html/2608.04421#bib.bib91)):决策关键信号(如突发的用户疲劳或意图转变)通常在时间上高度局部化,而全局自注意力在处理长交互历史时往往会稀释这些信号(Zhou等,2021 (https://arxiv.org/html/2608.04421#bib.bib102);Liu等,2024 (https://arxiv.org/html/2608.04421#bib.bib103))。此外,现有生成式对齐方法主要优化无约束的标量奖励,难以适应跨时间耦合决策的严格系统级约束(Xiao等,2021 (https://arxiv.org/html/2608.04421#bib.bib91))。

为应对上述挑战,我们提出GOAL——一个带有全局级约束的生成式优化框架,专门针对激励广告设计。我们的改进主要聚焦于两个关键维度来增强生成式决策模型:(i) 捕捉长交互历史中的非马尔可夫与局部化用户动态;(ii) 在统一生成式决策框架内实施严格的全局级ROI约束。

具体而言,GOAL集成了一种分层因果状态编码器,在进行全局时序推理之前显式建模密集的局部行为动态,并结合约束条件生成策略,根据系统级压力自适应调整激励策略。在此架构之上,我们提出了安全约束策略优化(SCPO),通过在拉格朗日乘子分布上训练单一生成式策略。通过在每种约束水平下分离并归一化偏好信号,SCPO使学习到的策略能够在推理时自适应不同全局约束目标,而无需重新训练。综上,我们的主要贡献如下:

- **面向激励广告的生成式框架**。我们提出GOAL,探索生成式范式在激励广告中的应用,使模型能够捕捉更细粒度的行为模式以及短期与长期依赖。
- **SCPO对齐策略**。我们提出SCPO,一种用于安全探索的约束感知对齐算法。与仅通过最大化系统价值可能导致收益-成本失衡的GRPO不同,SCPO将生成式策略优化与拉格朗日乘子相结合,在优化长期生态价值的同时严格执行全局约束。
- **工业级规模验证**。我们在多样化的真实工业数据集与合成数据集上验证了所提方法的优越性能,结果显示核心指标均有显著提升。

## 2. 预备知识

在本节中,我们将激励决策问题形式化为生成式序列建模任务,并介绍基于拉格朗日对偶性的约束优化框架。

### 2.1. 问题定义

给定数据集D = {(H_i, λ_i, a_i)}_{i=1}^N,其中N为数据集大小。对于第i个样本(对应于用户某个具体决策时刻t),H_i表示通过长度为L的滑动窗口得到的历史交互轨迹:H_i = [x_{t−L}, …, x_{t−1}],其中每个复合事件x_τ = (s_τ, a_τ) ∈ S × A由第τ步的高维状态特征s_τ与所收到的激励a_τ组成。此外,λ_i ∈ R^+表示反映实时系统压力的系统级约束乘子,a_i ∈ A是当前时刻t分配的真实激励值。

为利用生成式架构的序列推理能力进行连续控制,我们将激励决策重构为自回归生成任务。具体而言,我们引入离散词表V,其中每个词元表示一个量化数值单元。我们将连续目标动作a_i分解为词元序列g_i = (g_i^1, g_i^2, …, g_i^{T_i}),其中g_i^k ∈ V表示第k个生成步的词元,T_i表示序列长度。相应地,我们设计确定性映射函数φ(·)从g_i重建原始标量值a_i,即a_i = φ(g_i) = Σ_{k=1}^{T_i} φ(g_i^k) ∈ R^+,其中φ(g_i^k)表示该词元的数值大小。词表构建与映射的细节见3.1节。我们的目标是训练一个生成式策略π_θ,给定用户历史与约束特征(H_i, λ_i),生成相应的预测词元序列ĝ_i = (ĝ_i^1, ĝ_i^2, …, ĝ_i^{T_i})。进而,通过â_i = φ(ĝ_i) = Σ_{k=1}^{T_i} φ(ĝ_i^k)重建的预测激励值â_i近似于实际激励a_i,同时遵循由λ_i支配的成本效益权衡。

参见标题下的图2。图2.GOAL的总体架构。(1) 分层因果编码器:协同DCC与自注意力机制,捕捉高频局部动态与全局时间依赖。(2) λ条件生成解码器:以MoE替代标准FFN,使专家能够感知不同水平的λ所诱导的约束压力。(3) 优化:通过加权NTP目标L_W-NTP进行优化。

### 2.2. 原始-对偶约束策略优化

尽管生成式策略在给定系统级状态λ的情况下最大化用户价值,但λ的定义受制于全局业务需求,尤其是激励场景中的严格ROI约束。

原始问题。考虑一个包含N次交互的轨迹,其中动作a_i产生成本c_i并获得收益r_i。全局ROI定义为Σ_{i=1}^N r_i / Σ_{i=1}^N c_i,要求其不低于最小阈值τ。由此得到的奖励决策问题可表述为:

max_{ {a_i} } Σ_{i=1}^N r_i  s.t.  Σ_{i=1}^N r_i / Σ_{i=1}^N c_i ≥ τ,  0 ≤ c_i ≤ C_max.   (1)

分数形式的ROI约束使得决策在时间上相互耦合,直接优化十分困难。

拉格朗日对偶性与解耦。我们利用拉格朗日对偶框架对全局约束进行解耦。具体而言,我们对ROI约束进行线性化,并引入拉格朗日乘子λ′ ≥ 0将其纳入优化目标:

L(π, λ′) = Σ_{i=1}^N r_i + λ′(Σ_{i=1}^N r_i − τ Σ_{i=1}^N c_i) = (1+λ′) Σ_{i=1}^N r_i − λ′τ Σ_{i=1}^N c_i.   (2)

优化该目标在数学上等价于最大化归一化回报:

max_{π∈Π} L(π, λ) = max_{π∈Π} Σ_{i=1}^N (r_i − λc_i),  其中 λ = λ′τ / (1+λ′).   (3)

在一个温和的可行性假设下,强对偶性成立。因此,原始问题等价于拉格朗日对偶问题:min_{λ∈R+} max_{π∈Π} L(π, λ)。因此,给定最优对偶变量λ∗,优化目标可简化为:

max_π Σ_{i=1}^N (r_i − λ∗c_i).   (4)

## 3. 方法论

如图2所示,我们提出GOAL,摒弃传统的两阶段激励优化流水线,将生成、约束建模与策略优化统一到单一生成式框架中。该模型以两个紧密耦合的阶段运行。首先,因果状态编码器捕捉用户兴趣在时间上的连贯演化,同时注入拉格朗日乘子嵌入作为全局控制信号,以显式参数化约束紧度。其次,配备约束感知MoE路由的自回归解码器生成激励序列,并根据约束上下文在保守策略与激进策略之间动态切换。在此架构之上,我们引入λ泛化的安全约束策略优化方案(SCPO),使单个训练模型能够适应多样化的ROI约束。这些组件共同将约束感知嵌入到表示空间与优化动态中,从而提供一种灵活且安全的方法。

相似文章

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。

用于离散策略优化的引导对比Token信用分配

Hugging Face Daily Papers

本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。

GenPO++: 生成式策略优化与无雅可比似然比

arXiv cs.LG

GenPO++ 提出了一种可逆生成式策略优化框架,该框架在高阶可逆 ODE 求解器中使用历史状态作为辅助记忆,从而为强化学习中的流式策略实现精确反演和无雅可比似然比计算。它在大规模控制、微调和真实世界机器人任务上取得了有竞争力的性能,同时提高了稳定性和效率。