RecHarness:面向自进化推荐系统的Bandit路由智能体框架
摘要
RecHarness是一个bandit路由的智能体框架,通过将方向选择与假设生成分离来自动化推荐模型优化,在在线A/B测试中实现了稳定的改进和显著收益。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - RecHarness:一种用于自进化推荐系统的Bandit路由智能体框架
来源:https://huggingface.co/papers/2607.29241
摘要
优化现代推荐模型仍然严重依赖工程师手动迭代架构、目标和训练策略的修改。虽然基于LLM的智能体可以自动化这种试错过程,但让LLM同时选择修改方向并生成具体假设,往往在有限的实验预算下导致搜索不稳定。受上述挑战启发,我们提出了RecHarness,一种用于自动化推荐模型优化的Bandit路由智能体框架。RecHarness将优化过程分为两步:bandit路由器根据历史验证反馈选择下一个修改方向,而LLM在选定方向内生成具体的优化假设和可执行代码编辑。为了维持长期探索,RecHarness使用跳跃盆地机制,在局部编辑停滞时激活结构性跳跃分支。在多个推荐任务、数据集和模型骨干上,RecHarness比LLM推理搜索实现了更稳定的性能提升,并更有效地利用有限的试验预算。在一个大型短视频广告平台进行的为期7天的在线A/B测试中,选中的候选方案将ADVV提高了2.084%,收入提高了0.534%,曝光量提高了0.559%。代码可在https://github.com/6lyc/RecHarness获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.29241) 查看 PDF (https://arxiv.org/pdf/2607.29241) GitHub1 (https://github.com/6lyc/RecHarness) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29241)
在您的智能体中获取该论文:
hf papers read 2607\.29241
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文。请在模型README.md中引用arxiv.org/abs/2607.29241,以便从此页面链接该论文。
引用此论文的数据集 0
没有数据集链接此论文。请在数据集README.md中引用arxiv.org/abs/2607.29241,以便从此页面链接该论文。
引用此论文的Space 0
没有Space链接此论文。请在Space README.md中引用arxiv.org/abs/2607.29241,以便从此页面链接该论文。
收录此论文的合集 0
没有合集包含此论文。请将此论文添加到合集 (https://huggingface.co/new-collection),以便从此页面链接该论文。
相似文章
递归式 Harness 自我改进
介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。
RewardHarness:自演进的代理式后训练框架
RewardHarness 是一个用于后训练的自演进代理框架,通过迭代优化工具和技能库来替代大规模偏好标注,在图像编辑评估基准上的表现优于 GPT-5。
Harness-G:面向搜索代理的图结构检索框架
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
流程感知自进化: 协同进化模型权重、流程与任务解决方案
HASE 是一个强化学习框架,它在统一的智能体过程中协同进化模型权重、任务解决方案以及流程组件(引导与评估),使单个8B参数的模型在文本分类和阿尔法因子挖掘任务上能够匹配更大系统的性能。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。