协同匹配:基于强化学习的协同进化生成检索器

Hugging Face Daily Papers 论文

摘要

CoGR是一个检索框架,采用协同进化强化学习来训练LLMs在查询和项目两侧生成关键词,在检索任务中实现了显著的性能提升。

检索是现代搜索和广告系统的第一阶段,从大量项目候选集中为下游排序和拍卖选择候选集。近年来,越来越多的工作利用LLMs通过查询扩展、数据合成和检索反馈训练来改进检索。然而,生成组件通常仅用于查询侧的增强,最终匹配仍委托给下游检索器。我们引入CoGR,一个检索框架,它训练LLMs直接在查询和项目两侧构建检索表示。每个生成器产生一组紧凑的关键词,通过倒排索引直接匹配,与现有基于关键词的检索基础设施保持兼容。CoGR采用两阶段训练流程。监督微调首先建立对齐的关键词空间,之后协同进化强化学习使用GRPO交替优化查询侧和项目侧的生成器,针对对方侧的冻结索引。两侧优化相同的查询到项目检索F_1目标:查询侧直接接收检索F_1,而项目侧接收一个反事实边际奖励,衡量其生成关键词引起的查询侧F_1变化。在10个代表性的稀疏、密集和生成基线中,CoGR在内部APP Marketplace数据集和公开WANDS基准上均实现了最佳性能,将F_1分别比最强基线提高了10.9%和36.1%。进一步分析表明,训练过程中协同进化稳定,查询--项目关键词空间日益对齐。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:52

论文页面 - 协同进化生成检索与强化学习的双重匹配

来源:https://huggingface.co/papers/2609.00638

摘要

CoGR通过协同进化强化学习训练大语言模型,为查询与文档项生成紧凑关键词集,实现直接基于倒排索引的检索优化。

检索是现代搜索与广告系统的第一阶段,负责从海量文档集中为下游排序与竞价筛选候选集。近期研究越来越多地利用大语言模型(LLMs)通过查询扩展、数据合成及检索反馈训练来提升检索效果。然而,生成式组件通常仅用于查询侧增强,最终匹配仍交由下游检索器完成。我们提出CoGR检索框架,它训练大语言模型直接在查询与文档两侧构建检索表示。每个生成器产出一组紧凑关键词,通过倒排索引直接匹配,从而兼容现有基于关键词的检索基础设施。CoGR采用两阶段训练流程:先通过监督微调建立对齐的关键词空间,再通过协同进化强化学习,使用GRPO算法交替优化查询侧与文档侧生成器——以对方冻结的索引为环境进行训练。两侧均优化查询到文档的检索F1目标:查询侧直接获取检索F1分数,文档侧则获得反事实边际奖励,衡量其生成的关键词对查询侧F1的提升程度。在包含10种代表性稀疏、稠密及生成式基线的对比实验中,CoGR在内部应用商店数据集及公开WANDS基准测试上均取得最佳性能,相比最强基线分别实现10.9%和36.1%的F1提升。进一步分析显示训练过程中两侧生成器稳定协同进化,查询-文档关键词空间逐渐对齐。

查看arXiv页面 (https://arxiv.org/abs/2609.00638) 查看PDF (https://arxiv.org/pdf/2609.00638) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.00638)

通过您的代理获取本文: hf papers read 2609\.00638

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型关联本文

在模型README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。

引用本文的数据集 0

暂无数据集关联本文

在数据集README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。

引用本文的空间 0

暂无空间关联本文

在空间README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。

包含本文的收藏集 1

相似文章

互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型

arXiv cs.CL

# 互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型 来源:[https://arxiv.org/html/2604.16378](https://arxiv.org/html/2604.16378) Yunshuo Tian¹, Akayou Kitessa¹, Tanuja Chitnis², 和 Yijun Zhao¹ 1 纽约市福特汉姆大学计算机与信息科学系 2 马萨诸塞州波士顿市Mass General Brigham医院神经科 ###### 摘要 大型语言模型 \(LLMs\) 与经典机器学习方法提供互补...

通过联合生成与评估实现自进化深度研究

arXiv cs.CL

来自香港科技大学、字节跳动和UCL的研究人员提出了SCORE——一种协同进化训练框架,将LLM同时训练为深度研究报告生成器和评估器,并通过元约束机制动态调整评估难度,防止奖励饱和。实验表明,该方法在开放式研究报告质量上取得了持续提升。

超越检索:代码搜索的多任务基准与模型

Hugging Face Daily Papers

本文介绍了 CoREB,这是一个针对代码搜索的、受数据污染限制的多任务基准测试,具备微调重排序能力,可评估文本到代码、代码到文本以及代码到代码的检索效果。