协同匹配:基于强化学习的协同进化生成检索器
摘要
CoGR是一个检索框架,采用协同进化强化学习来训练LLMs在查询和项目两侧生成关键词,在检索任务中实现了显著的性能提升。
查看缓存全文
缓存时间: 2026/09/03 03:52
论文页面 - 协同进化生成检索与强化学习的双重匹配
来源:https://huggingface.co/papers/2609.00638
摘要
CoGR通过协同进化强化学习训练大语言模型,为查询与文档项生成紧凑关键词集,实现直接基于倒排索引的检索优化。
检索是现代搜索与广告系统的第一阶段,负责从海量文档集中为下游排序与竞价筛选候选集。近期研究越来越多地利用大语言模型(LLMs)通过查询扩展、数据合成及检索反馈训练来提升检索效果。然而,生成式组件通常仅用于查询侧增强,最终匹配仍交由下游检索器完成。我们提出CoGR检索框架,它训练大语言模型直接在查询与文档两侧构建检索表示。每个生成器产出一组紧凑关键词,通过倒排索引直接匹配,从而兼容现有基于关键词的检索基础设施。CoGR采用两阶段训练流程:先通过监督微调建立对齐的关键词空间,再通过协同进化强化学习,使用GRPO算法交替优化查询侧与文档侧生成器——以对方冻结的索引为环境进行训练。两侧均优化查询到文档的检索F1目标:查询侧直接获取检索F1分数,文档侧则获得反事实边际奖励,衡量其生成的关键词对查询侧F1的提升程度。在包含10种代表性稀疏、稠密及生成式基线的对比实验中,CoGR在内部应用商店数据集及公开WANDS基准测试上均取得最佳性能,相比最强基线分别实现10.9%和36.1%的F1提升。进一步分析显示训练过程中两侧生成器稳定协同进化,查询-文档关键词空间逐渐对齐。
查看arXiv页面 (https://arxiv.org/abs/2609.00638) 查看PDF (https://arxiv.org/pdf/2609.00638) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.00638)
通过您的代理获取本文:
hf papers read 2609\.00638
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型关联本文
在模型README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。
引用本文的数据集 0
暂无数据集关联本文
在数据集README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。
引用本文的空间 0
暂无空间关联本文
在空间README.md中引用 arxiv.org/abs/2609.00638 即可从本页链接。
包含本文的收藏集 1
相似文章
互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型
# 互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型 来源:[https://arxiv.org/html/2604.16378](https://arxiv.org/html/2604.16378) Yunshuo Tian¹, Akayou Kitessa¹, Tanuja Chitnis², 和 Yijun Zhao¹ 1 纽约市福特汉姆大学计算机与信息科学系 2 马萨诸塞州波士顿市Mass General Brigham医院神经科 ###### 摘要 大型语言模型 \(LLMs\) 与经典机器学习方法提供互补...
CoHyDE:面向工具检索的LLM改写器与稠密编码器迭代协同训练
CoHyDE提出了一种LLM改写器与稠密编码器的迭代协同训练过程,以提升从大型API目录中的工具检索性能。通过使用InfoNCE和DPO联合训练两个组件,它在模糊查询上显著优于单一组件基线。
通过联合生成与评估实现自进化深度研究
来自香港科技大学、字节跳动和UCL的研究人员提出了SCORE——一种协同进化训练框架,将LLM同时训练为深度研究报告生成器和评估器,并通过元约束机制动态调整评估难度,防止奖励饱和。实验表明,该方法在开放式研究报告质量上取得了持续提升。
超越检索:代码搜索的多任务基准与模型
本文介绍了 CoREB,这是一个针对代码搜索的、受数据污染限制的多任务基准测试,具备微调重排序能力,可评估文本到代码、代码到文本以及代码到代码的检索效果。
LIGE-GR:在LLM时代从排名到生成式推荐的平滑跃迁
本文介绍了LIGE-GR,一种使用大型语言模型平滑地从传统排名过渡到生成式推荐系统的方法,旨在提升LLM时代的推荐性能。