GRASP:面向代理型RAG的粒度感知搜索策略

Hugging Face Daily Papers 论文

摘要

介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。

代理型检索增强生成(RAG)扩展了静态RAG,允许语言模型迭代地进行推理、生成搜索查询、检索证据并预测答案。然而,模型在决定何时检索、是使用词法匹配还是语义相似度、以及如何控制上下文粒度以防止无关标记干扰智能体推理方面仍然具有挑战性。在本文中,我们引入了GRASP,一种强化学习(RL)框架,用于训练智能体在多步推理中自适应地协调互补的检索工具。GRASP为智能体提供了语义搜索、关键词搜索和段落读取操作,使其能够检索句子级别的证据,并仅在需要时扩展更多上下文。我们使用一个联合考虑答案准确性、基于证据的阅读、互补搜索和回合效率的奖励来训练策略。在多跳推理基准上的实验表明,与单步检索、基于提示的代理型RAG以及基于RL的检索基线相比,GRASP提高了检索召回率和下游问答性能。定性和消融分析表明,学习到的策略发展出了可解释的略读和扫描行为:它使用语义搜索进行广泛探索,段落读取进行局部验证,关键词搜索寻找特定实体的证据。这些结果表明,学习协调检索信号和上下文粒度对于智能体的正确推理至关重要。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - GRASP:面向智能体RAG的粒度感知搜索策略

来源:https://huggingface.co/papers/2607.10463

摘要

智能体检索增强生成(RAG)通过允许语言模型迭代推理、生成搜索查询、检索证据并预测答案,扩展了静态RAG的能力。然而,模型在决定何时检索、是否使用词汇匹配或语义相似度、以及如何控制上下文粒度以防止无关标记干扰智能体推理方面仍面临挑战。本文提出了GRASP,一个用于训练智能体在多步推理过程中自适应协调互补检索工具的强化学习(RL)框架。GRASP为智能体提供语义搜索、关键词搜索和段落阅读动作,使其能够检索句子级证据,并仅在必要时扩展更多上下文。我们使用一个联合考虑答案准确性、基于证据的阅读、互补搜索和轮次效率的奖励来训练策略。在多跳推理基准上的实验表明,与单步检索、基于提示的智能体RAG以及基于RL的检索基线相比,GRASP提高了检索召回率和下游问答性能。定性和消融分析表明,学习到的策略发展出可解释的扫读和跳读行为:它使用语义搜索进行广泛探索,使用段落阅读进行局部验证,使用关键词搜索寻找特定实体的证据。这些结果表明,学习协调检索信号和上下文粒度对于智能体的正确推理至关重要。

查看arXiv页面 (https://arxiv.org/abs/2607.10463)查看PDF (https://arxiv.org/pdf/2607.10463)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10463)

在你的智能体中获取这篇论文:

hf papers read 2607\.10463

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型的README.md中引用arxiv.org/abs/2607.10463,以从本页面链接到它。

引用此论文的数据集0

没有数据集关联此论文

在数据集的README.md中引用arxiv.org/abs/2607.10463,以从本页面链接到它。

引用此论文的Space0

没有Space关联此论文

在Space的README.md中引用arxiv.org/abs/2607.10463,以从本页面链接到它。

包含此论文的收藏1

相似文章

GRASP:在多人物非语言交互中建立社交推理的根基

Hugging Face Daily Papers

GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。