DMRL:用于广告推荐中技能优化的文档介导强化学习
摘要
DMRL 是一种文档介导强化学习框架,通过结构化编辑动作、策略优化和长期奖励预测来优化广告推荐中的技能文档,并在大规模部署中展示了优于基线的性能。
arXiv:2609.02170v1 公告类型:新
摘要:广告推荐需要持续调整复杂的系统参数,同时平衡商业回报和用户体验。近期研究引入了具有技能文档的大语言模型(LLMs)来协助这一劳动密集型过程,但技能优化仍然主要依赖提示驱动,缺乏一种将奖励归因于特定文档编辑的原则性机制。为解决此限制,我们提出文档介导强化学习(DMRL),一种技能自进化框架,将技能文档优化建模为一系列结构化编辑动作。在DMRL中,上层代理执行受控的文档编辑,而冻结的下层任务代理通过A/B测试评估其效果。为解决信用分配和长期结果,我们引入两个关键组件:(1)双相对策略优化(DRPO),一种用于鲁棒和风险感知优势估计的后训练策略优化方法;(2)长期奖励预测器(LRP),通过使用解耦表示学习和跨注意力传递来建模群体异质性,从而估计长期结果。DMRL已部署在大规模短视频广告平台上,广泛的实证评估表明,DMRL在关键广告指标上优于最先进的基线。
查看缓存全文
缓存时间: 2026/09/03 06:17
# DMRL:面向广告推荐中技能优化的文档中介强化学习 来源:https://arxiv.org/html/2609.02170 **上海交通大学** **快手科技** *同等贡献 †通讯作者* 洪吉、李松、孙鹏宇、杨雪、赵磊、江鹏 单位:上海交通大学 单位:快手科技 2026年9月2日 ###### 摘要 广告推荐需要在平衡商业收益与用户体验的同时持续调优复杂的系统参数。近期研究引入了配备技能文档的大语言模型(LLMs)以辅助这一繁琐流程,但技能优化仍然主要依赖提示驱动,缺乏一种将奖励归因于具体文档编辑的原理性机制。为解决这一局限,我们提出文档中介强化学习(DMRL),一种将技能文档优化建模为结构化编辑动作序列的技能自进化框架。在DMRL中,高层代理执行受控的文档编辑,而冻结的底层任务代理通过A/B测试评估其影响。为解决信用分配与长期结果问题,我们引入两个关键组件:(1)双相对策略优化(DRPO),一种用于鲁棒且风险感知优势估计的后训练策略优化方法;(2)长期奖励预测器(LRP),通过解耦表征学习与交叉注意力迁移建模群体异质性来估计长期结果。DMRL已部署于大规模短视频广告平台,广泛实证评估表明DMRL在关键广告指标上优于现有最先进基线。 ## 1 引言 图1:广告中的显著群体异质性。(a)不同用户群体在短期信号与长期结果之间的映射关系存在显著差异。短期信号在干预后1天内测量,长期结果定义为7天内。(b)不同用户群体在干预后的归一化累积结果呈现不同时间动态。 参考图注图2:广告推荐系统中不同参数调优范式的比较。 在线广告推荐依赖于持续平衡商业收益与用户体验[39]。如图2(a)所示,基于人工的方法需要大量人力与计算资源。尽管超参数优化(HPO)提供了通用框架[3],该过程仍严重依赖具有经验直觉和迭代实验能力的领域专家。尽管能带来增量收益,但存在三个根本局限:第一,所需人力与参数数量线性增长,形成显著操作瓶颈;第二,调优经验难以形式化并在从业者间传递;第三,试错过程无法保证参数空间的系统探索,容易收敛至局部最优配置。 基于LLM的代理为解决上述局限提供了潜在方案。近期研究表明,大语言模型可通过将领域专业知识外化为可复用技能文档来辅助复杂工作流程[15,13],这些文档规定了任务流程、决策规则与工具使用模式。在广告推荐系统中,此类技能文档为编码调优知识提供了一种有前景的接口,其形式既可被代理执行,又能跨场景复用。然而,如图2(b)所示,现有方法仍主要通过文本优化或类提示更新[40,1,48,23,35]来优化此类技能,缺乏将观察奖励归因于具体文档编辑的原理性机制。我们将此范式称为技能指导方法。 除编辑级信用分配外,更根本的挑战源于长期结果。广告参数调优的终极目标通常需要数天后才显现[4],使得直接优化高层策略不切实际。先前关于长期结果的研究[45,20]提供了部分解决方案,但未明确解决广告推荐系统中显著的群体异质性。如图1(a)所示,短期信号与长期结果的关系在不同用户群体间存在显著差异。因此,在聚合数据上训练的预测器会受多数群体主导,导致对代表性不足群体的估计偏差和泛化能力差。此外,图1(b)揭示了干预后的结果轨迹在不同群体间也呈现不同时间模式。这些观察共同表明,长期结果建模应具群体感知性,而非依赖单一预测器。 如图2(c)所示,我们提出DMRL,它超越了基于人工和技能指导方法,将技能优化显式分解为长期结果估计与编辑级奖励归因。我们将此范式称为技能优化方法。具体而言,DMRL核心包含三个协同模块:(1)结构解耦机制,将负责文档修改的高层技能优化器与负责参数干预的底层任务代理分离,技能文档作为两级间的语义接口;(2)双相对策略优化(DRPO),一种用于鲁棒且风险感知优势估计的后训练策略优化方法,可处理结果异常值、利用治疗-控制实验结构并以编辑成本正则化编辑;(3)长期奖励预测器(LRP),一个从短期信号估计长期结果的预测模块,使用解耦表征学习与基于交叉注意力的历史迁移。这些模块通过两阶段训练策略优化,旨在稳定长期结果预测并确保准确的优势估计。通过结合长期结果预测的结构解耦与鲁棒优势估计,DMRL为广告推荐平台上的技能优化提供了原理性且工业可行的解决方案。 我们的贡献总结如下: - •提出DMRL,一种新型技能优化框架,通过结构化语义接口将技能文档编辑与下游参数优化相连接。 - •提出DRPO,一种后训练策略优化算法,通过引入双相对优势估计器扩展GRPO;提出LRP,一种通过缓解高延迟与群体异质性的长期奖励预测模块。 - •将框架部署于真实广告平台并展示显著的线上改进。 ## 2 相关工作 ### 2.1 技能获取与优化 将操作知识外化以指导代理行为的想法已在多个相关研究中出现。早期关于LLM代理工具使用与动作生成的研究,如ReAct[42]和Toolformer[25]表明,向模型暴露明确的交互流程或外部API可显著提升任务性能。近期研究进一步将此类外部知识系统化为可复用的代理技能[15,13]。在技能获取方面,Voyager[31]通过开放环境中的终身交互积累可执行技能,而AgentTuning[47]从交互数据中学习可复用代理行为。Trace2Skill[22]则直接从完整执行轨迹中提炼结构化技能,将被动情景记录转换为可复用流程。另一类工作从预存资源而非开放探索构建技能:SkillFoundry[28]与AutoSkill[41]从领域知识库合成技能包以增强领域对齐,而SkillX[30]与MemP[7]进一步利用API文档、执行轨迹和外部知识源等异构资源,减少对环境内执行的依赖。 除初始技能构建外,另一类工作研究技能如何通过执行结果迭代改进。EvoSkill[1]与SkillForge[17]通过失败分析优化技能:收集失败执行轨迹、诊断潜在技能缺陷并重写问题部分以消除重复出现的失败模式。CoEvoSkills[48]、AutoRefine[23]与ProcMem[21]采用创建-评估-修订循环,其中技能生成器与独立验证器通过迭代周期共同进化,使用结构化结果在无需真实监督下逐步提升技能质量。SkillClaw[19]与Evolver[34]采用集体方法,聚合多个用户或代理的执行证据以识别一致的成功模式与重复的失败模式,实现跨代理技能改进,使一个用户的经验惠及所有用户。SkillOpt[40]应用深度学习式范式迭代优化技能——这些方法仍缺乏对结构化技能文档进行编辑的清晰方法论。从强化学习视角,SKILLRL和SAGE利用技能的下游任务表现作为奖励信号来调整涉及技能生成与利用的轨迹概率[32,36]。虽然这些方法与迭代文本优化的精神一致,但它们主要操作于单个提示或整体技能再生成的层面,缺乏对结构化技能文档进行精确、可追溯局部修改并因果归因每项编辑贡献的系统性机制。 ### 2.2 用于LLM的后训练RL算法 强化学习(RL)已成为现代LLM后训练的核心范式,通过提升推理能力和下游任务表现补充监督微调。近端策略优化(PPO)[26]引入裁剪代理目标和信任域约束以稳定策略更新。直接偏好优化(DPO)[24]通过将RLHF目标重参数化为成对偏好数据上的分类损失完全消除奖励模型。组相对策略优化(GRPO)[27]通过计算组相对优势消除价值网络。基于可验证奖励的强化学习(RLVR)[14]通过使用自动可验证信号(如代码执行正确性或数学有效性)作为奖励源进一步减少对人工标注的依赖。在此范式内,针对其局限性已提出多个GRPO变体。DAPO[46]引入解耦优势估计以缓解不同重要性令牌间的信用稀释。Dr. GRPO[18]识别并纠正了GRPO组级归一化中对较长生成序列过度惩罚的偏差。GSPO[50]提出组序列级策略优化以更好地对齐序列级奖励信号。SAPO[9]引入温度控制的软门机制,用平滑温度衰减替代硬裁剪,实现训练中策略偏离的更灵活控制。尽管这些后训练算法在不同训练环境中针对GRPO提出了多种改进并取得可喜结果,但应用于在线广告系统仍需进一步适应该领域的独特特性。 ### 2.3 广告中的延迟结果建模 延迟反馈在广告与推荐中很常见,转化或长期结果仅在显著滞后后才可观察[49]。一类研究聚焦于延迟转化反馈,通过反馈偏移校正、多任务学习、耗时建模、标签校正、去偏估计和持续训练缓解未成熟或假阴性标签[44,12,37,43,33,5,10]。DelayAdapter进一步将此问题表述为从可靠标注的历史数据到近期未标注流量的无监督域适应[45]。这些方法主要处理延迟二元转化标签。另一类工作使用早期行为信号或短期代理估计未来结果。点击后方法利用中间用户行为改进最终转化预测[29,38,11],而基于代理的方法学习从短期代理到长期结果的映射[2]。通用预测器……
相似文章
SocialRL:通过多轮强化学习和奖励设计提升大语言模型的社会智能
本文介绍了SocialRL,一个多轮强化学习框架,通过延迟奖励传播和细粒度过程奖励增强大语言模型的社会智能,显著改善了对话系统的目标完成度。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
超越Top-$k$技能检索:面向LLM代理的多样性感知技能路由
本文提出了多样性感知技能路由(DSR),一种使用行列式点过程来平衡LLM代理技能选择中的相关性和非冗余性的重排序框架,从而在基准测试中提升召回率和覆盖率。
智能体强化学习中的动态技能生命周期管理
本文介绍了 SLIM 框架,该框架通过在智能体强化学习中将主动技能集与策略学习联合更新,优化动态技能生命周期。实验表明,SLIM 通过高效的技能保留与扩展提升了任务性能,优于基线方法。
Search2Skill:通过基于规则表的强化学习在知识边界之外进行技能蒸馏
Search2Skill 是一个框架,它训练 LLM 智能体识别能力差距、搜索外部来源,并使用基于规则表的强化学习将检索到的知识提炼为可复用的技能,在专家领域基准测试上优于基线方法。