HOBA: 面向自适应在线广告的分层在线策略竞价代理

arXiv cs.AI 论文

摘要

HOBA提出了一种用于在线广告的分层强化学习框架,该框架利用大型语言模型进行超参数推断,使用SARSA代理进行专家模型选择,并通过动态专家池执行出价,在大规模A/B测试中实现了+3.6%的提升。

arXiv:2607.24779v1 公告类型: 新 摘要:在线广告竞价系统通常部署多个离线训练的专家模型(例如PID控制器、模型预测控制、离线RL策略),但面临两个关键限制:缺乏对非平稳拍卖市场的在线适应性,以及依赖昂贵的手动调整超参数(如出价范围和预算节奏约束)。我们提出了HOBA(分层在线策略竞价代理),这是一个分层强化学习框架,在三个时间尺度上解耦了策略推理、模型选择和出价执行。在高层,大型语言模型通过思维-行动-观察-反思循环并结合历史经验检索,从上下文信号中推断超参数。在中层,SARSA代理动态选择专家模型,并引入因果调整以消除选择偏差。在底层,动态专家池(PID、MPC、IQL、Decision Transformer)在高层约束下执行出价。这种设计将在线学习限制在离散的专家选择上,而不是连续的出价优化,显著降低了探索风险,同时保持了适应性。在AuctionNet基准和大规模A/B测试上的实验表明,相比最先进的基线方法,一致性地取得了改进。在一次大规模在线部署中,HOBA带来了显著的商业价值,实现了目标成本+3.6%的提升,证明了我们的分层多代理竞价范式的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:52

# HOBA: 面向自适应在线广告的分层在策略竞价智能体

来源:https://arxiv.org/html/2607.24779

\(2026\)

###### 摘要。

在线广告竞价系统通常部署多个离线训练的专业模型(如 PID 控制器、模型预测控制、离线强化学习策略),但面临两个关键限制:缺乏对非平稳拍卖市场的在线适应性,以及依赖对竞价边界和预算节奏约束等超参数进行昂贵的手动调整。我们提出 HOBA(分层在策略竞价智能体),这是一个分层强化学习框架,将战略推理、模型选择和竞价执行在三个时间尺度上解耦。在高层次,一个大语言模型通过思考-行动-观察-反思循环,结合历史经验检索,从上下文信号中推断超参数。在中层次,一个 SARSA 智能体动态选择专业模型,并结合因果调整消除选择偏差。在低层次,一个动态专家池(PID、MPC、IQL、Decision Transformer)在高层次约束下执行竞价。这种设计将在线学习限制在离散的专家选择上,而非连续的竞价优化,从而在保持适应性的同时显著降低探索风险。在 AuctionNet 基准测试和大规模 A/B 实验上的实验表明,该方法持续优于最先进的基线。在大型在线部署中,HOBA 带来了显著的商业价值,实现了 +3.6% 的目标成本提升,证明了我们分层多智能体竞价范式的有效性。

在线广告、自动竞价、强化学习、智能体、大语言模型

††journalyear:2026††copyright:cc††conference:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2††date:2026年8月09–13日††location:韩国济州岛††booktitle:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD ’26), 2026年8月09–13日, 韩国济州岛††doi:10.1145/3770855.3818435††isbn:979-8-4007-2259-2/2026/08††ccs:信息系统 在线广告

## 1. 引言

在线广告拍卖构成了一个价值数十亿美元的市场,广告商在实时竞争中最大化目标(转化、收入),同时受到预算和每次获取成本(CPA)约束。一个核心挑战是在非平稳市场中的自动竞价,其中竞争对手策略、用户行为和平台动态不断演变 (Hu et al., 2022 (https://arxiv.org/html/2607.24779#bib.bib147)),需要系统在线适应并保持安全性。

当前行业实践部署离线训练的专业模型——PID 控制器 (Zhang et al., 2014 (https://arxiv.org/html/2607.24779#bib.bib60))、模型预测控制 (MPC) (Han et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib61)) 和离线强化学习策略 (Kumar et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib62); Kostrikov et al., 2022 (https://arxiv.org/html/2607.24779#bib.bib63); Chen et al., 2021 (https://arxiv.org/html/2607.24779#bib.bib92)) 作为竞价控制器。然而,这些系统面临两个关键限制:(1) 缺乏在线适应性,因为专家参数在部署后固定,无法响应市场变化而无需昂贵的重新训练,以及 (2) 需要手动调整每个活动的竞价边界、预算节奏和探索系数。实现安全的在线学习仍然具有挑战性:在策略方法(PPO (Schulman et al., 2017 (https://arxiv.org/html/2607.24779#bib.bib81)), A3C (Mnih et al., 2016 (https://arxiv.org/html/2607.24779#bib.bib82)))可能带来灾难性探索,在几分钟内耗尽预算,而离策略方法则遭受动作坍缩,无法在多样化条件下泛化。此外,现有方法将战略规划与战术执行混为一谈,将竞价视为一个缺乏可解释性的单一优化问题。

我们提出 **HOBA(分层在策略竞价智能体)**,一个将竞价分解为三个层次的框架:(1) **高层 LLM 智能体**(1小时周期)通过思考-行动-观察-反思与经验检索推断超参数 θ_t;(2) **中层 SARSA 智能体**(2分钟周期)使用因果调整对历史数据进行去偏选择专家;(3) **低层专家池**(每次拍卖)在高层次约束下执行竞价。我们将每个层次视为具有自身观测空间、决策周期和优化目标的自主智能体,形成一个在共享收益约束下的合作多智能体系统。这种设计将在线学习限制在**离散的专家选择**(5-10 个经过验证的模型),而非连续的竞价优化,实现了无需无约束探索的安全适应。

我们的贡献是:(1) 提出首个跨时间尺度解耦战略推理、专家选择和竞价执行的分层多智能体竞价框架。(2) 引入 LLM 引导的超参数优化,具有自然语言推理和因果调整的在策略专家选择,实现安全的在线适应。(3) 在大规模 A/B 实验中展示 +3.6% 的成本目标提升,验证实际可行性。

## 2. 相关工作

### 2.1. 在线广告中的自动竞价

自动竞价系统旨在优化广告商在预算和成本约束下的目标。早期方法采用基于规则的控制器:PID 控制器 (Zhang et al., 2014 (https://arxiv.org/html/2607.24779#bib.bib60)) 通过比例-积分-微分反馈调整竞价乘数以调节 CPA 偏差,而模型预测控制 (MPC) (Han et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib61)) 求解未来视界上的约束优化,以平衡转化和预算消耗。这些方法具有可解释性和快速部署的优点,但需要大量的手动调整,并且难以适应非平稳市场。

近期工作越来越多地采用**强化学习**进行竞价。Cai 等人 (2017 (https://arxiv.org/html/2607.24779#bib.bib10)) 将竞价建模为 MDP,并应用 Q 学习优化实时展示广告。Han 等人 (2020 (https://arxiv.org/html/2607.24779#bib.bib61)) 引入一个通用框架,通过约束策略梯度方法优化多样化的 KPI。然而,这些在策略方法在生产部署中面临安全风险——无约束的探索可能在几分钟内耗尽预算或违反成本目标,导致广告商流失。

为了实现安全学习,从业者转向了**离线 RL** (Levine et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib96)),在记录数据上训练策略,无需在线探索。近期工作应用了保守 Q 学习 (CQL) (Kumar et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib62)) 以缓解竞价中的过估计,使用隐式 Q 学习 (IQL) (Kostrikov et al., 2022 (https://arxiv.org/html/2607.24779#bib.bib63)) 进行在奖励噪声下的鲁棒价值估计,以及利用 Decision Transformer (DT) (Chen et al., 2021 (https://arxiv.org/html/2607.24779#bib.bib92)) 通过监督序列建模建模顺序依赖关系。虽然这些方法避免了危险的探索,但它们遭受动作坍缩——由于离线数据和在线部署之间的分布漂移,策略无法在多样化的市场条件下泛化 (Fu et al., 2021 (https://arxiv.org/html/2607.24779#bib.bib102))。

我们的工作通过**将专家训练与在线适应解耦**而根本不同:我们维护一个多样化的离线训练专家池,并将在线学习限制在离散的专家选择上,而非连续的竞价优化,实现了安全性而不牺牲适应性。

### 2.2. 分层强化学习

分层强化学习将复杂任务分解为多个抽象层次,实现高效的学习和迁移 (Barto and Mahadevan, 2003 (https://arxiv.org/html/2607.24779#bib.bib64); Pateria et al., 2021 (https://arxiv.org/html/2607.24779#bib.bib65))。选项框架 (Sutton et al., 1999 (https://arxiv.org/html/2607.24779#bib.bib66)) 扩展了 MDP,包含时间扩展的动作,而封建 RL (Dayan and Hinton, 1992 (https://arxiv.org/html/2607.24779#bib.bib67); Vezhnevets et al., 2017 (https://arxiv.org/html/2607.24779#bib.bib68)) 将管理(设置子目标)与执行(实现子目标)分离。Nachum 等人 (2018 (https://arxiv.org/html/2607.24779#bib.bib100)) 提出了具有目标条件价值函数的分层离策略学习。在机器人学中,Osa 等人 (2020 (https://arxiv.org/html/2607.24779#bib.bib101)) 调查了需要协调运动基元的操作任务的分层方法。

在在线广告中,先前的工作主要将分层方法应用于跨活动的预算分配或多个广告商之间的协调 (Yuan et al., 2021 (https://arxiv.org/html/2607.24779#bib.bib69)),将单个竞价者视为整体策略。相比之下,HOBA 将**单一**广告商的竞价系统分解为三个分层层级:战略推理(用于超参数推断的 LLM)、战术选择(用于专家模型选择的 SARSA)和操作执行(用于竞价生成的专家池)。这种时间尺度分离将在线学习限制在离散的模型选择上,而非连续的竞价优化,显著降低了探索风险。

### 2.3. 基于 LLM 的决策与智能体系统

大语言模型已通过自然语言推理成为顺序决策的强大工具 (Huang et al., 2022 (https://arxiv.org/html/2607.24779#bib.bib70); Yao et al., 2023 (https://arxiv.org/html/2607.24779#bib.bib71))。诸如 ReAct (Yao et al., 2023 (https://arxiv.org/html/2607.24779#bib.bib71)) 的方法将推理与动作执行相结合,而 Reflexion (Shinn et al., 2023 (https://arxiv.org/html/2607.24779#bib.bib72)) 通过经验回放实现自我改进。近期工作将 LLM 应用于超参数调整 (Yang et al., 2024 (https://arxiv.org/html/2607.24779#bib.bib73)) 和 AutoML 配置 (Chen et al., 2023 (https://arxiv.org/html/2607.24779#bib.bib74)),展示了在离线设置中的优越样本效率。然而,这些方法侧重于模拟环境或离线优化。HOBA 是首个在生产广告系统中部署 LLM 引导推理进行**在线超参数推断**的工作,其中思考-行动-观察-反思循环结合历史经验检索实现了对非平稳市场的持续适应,且没有每次拍卖的 LLM 推理成本。

### 2.4. 强化学习中的因果推断

从记录数据中进行的离策略学习面临混淆偏差,当某些动作在有利的上下文中被优先选择时 (Li et al., 2015 (https://arxiv.org/html/2607.24779#bib.bib75); Swaminathan and Joachims, 2015 (https://arxiv.org/html/2607.24779#bib.bib76))。逆倾向得评分 (IPS) (Horvitz and Thompson, 1952 (https://arxiv.org/html/2607.24779#bib.bib77)) 通过记录策略概率对样本进行重新加权,但具有高方差,而双重鲁棒估计 (Bang and Robins, 2005 (https://arxiv.org/html/2607.24779#bib.bib78); Dudík et al., 2014 (https://arxiv.org/html/2607.24779#bib.bib79)) 结合基于模型的预测与重要性加权以实现更好的鲁棒性。在广告领域,先前的工作已将这些方法应用于点击率预测 (Li et al., 2010 (https://arxiv.org/html/2607.24779#bib.bib97)) 和排序评估 (Gilotte et al., 2018 (https://arxiv.org/html/2607.24779#bib.bib98))。我们的中层 SARSA 智能体结合了双重鲁棒因果调整(公式12)以对专家选择进行去偏,确保 Q 学习不会从专家模型在非随机策略下部署的历史数据中继承虚假相关。

## 3. 预备知识

我们将自动竞价形式化为一个顺序决策问题,其中广告商在活动视界内以预算和成本约束为目标,最大化转化价值。

### 3.1. 作为约束优化的自动竞价

对于参与拍卖 j ∈ {1,...,J} 的广告商 i,竞价问题形式化为 (Han et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib61)):

(1) max_{b_i} ∑_{j} A_{ij}(b_j) · v_{ij}  s.t.
∑_{j} A_{ij}(b_j) · P_{ij} ≤ B_i,
∑_{j} A_{ij}(b_j) · P_{ij} / ∑_{j} A_{ij}(b_j) · v_{ij} ≤ C_i,

其中 b_j 表示所有广告商的出价,v_{ij} ∈ R_+ 是转化价值,A_{ij}(b_j) ∈ {0,1} 表示广告商 i 是否赢得拍卖 j,P_{ij} 是获胜时的支付。约束条件强制执行预算限制 B_i 和每次价值最大成本比 C_i(等价于最低广告支出回报率)。

### 3.2. 直接策略学习的挑战

标准强化学习方法在在线广告中面临根本性困难:

**安全-适应性权衡**。在策略方法(例如,PPO (Schulman et al., 2017 (https://arxiv.org/html/2607.24779#bib.bib81)), A3C (Mnih et al., 2016 (https://arxiv.org/html/2607.24779#bib.bib82)))需要在线探索,但面临灾难性失败的风险——一个信息不足的出价可能在几分钟内耗尽每日预算。离策略方法(例如,CQL (Kumar et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib62)), IQL (Kostrikov et al., 2022 (https://arxiv.org/html/2607.24779#bib.bib63)))在记录数据上安全训练,但遭受分布漂移:当市场条件(竞争对手行为、流量模式)偏离历史数据时,策略会失败 (Levine et al., 2020 (https://arxiv.org/html/2607.24779#bib.bib96))。

**超参数敏感性**。性能关键地依赖于诸如竞价边界、预算节奏率和探索奖励等超参数。手动调整是劳动密集且针对特定活动的,而诸如贝叶斯优化等自动化方法 (Snoek et al., 2012 (https://arxiv.org/html/2607.24779#bib.bib95)) 需要数百次评估——当每次评估涉及将策略部署整个活动日时,这是不可行的。

**可解释性需求**。生产系统要求透明度:广告商需要理解竞价决策,平台运营商必须审计约束遵守情况。端到端神经策略提供的可解释性有限,使调试和信任复杂化。

### 3.3. 分层分解原理

HOBA 通过三个时间尺度的分层分解应对这些挑战:

- • **战略层(每小时)**:LLM 通过自然语言推理从活动上下文中推断超参数,将**施加什么约束**与**如何竞价**分开。
- • **战术层(分钟级别)**:SARSA 智能体在预验证的专家模型中进行选择。通过在离散的专家选择(|A| ≈ 5-10)而不是连续竞价值上学习,探索风险显著降低。
- • **操作层(每次拍卖)**:离线训练的专家在高层次约束下执行竞价,实现快速推理而无需在线策略更新。

这种设计...

相似文章

统一建模与探索的生成式自动竞价

arXiv cs.AI

本文介绍了Guide框架,该框架结合了决策Transformer、Q值引导和逆动力学模块,在数字广告自动出价中平衡探索与安全性,并在公开数据集和模拟拍卖中展示了有效性。