Search-G1:通过基于表示的内部奖励实现有依据的搜索代理
摘要
Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。
arXiv:2608.07531v1 公告类型:新
摘要:搜索增强语言代理应仅在必要时检索外部信息,并基于检索到的证据给出答案。现有的外部奖励要么提供稀疏的结果监督,要么提供来自过程注释和LLM评判器的更丰富反馈。结果奖励易于扩展,但无法区分有依据的检索与冗余搜索;而更丰富的信号在训练时需要昂贵的注释或推理。基于策略侧信号(如熵、似然或信息增益)的内部奖励是分级且评估廉价的,但主要反映模型置信度而非证据依据。我们提出Search-G1,一种基于表示的内部奖励框架,通过两个干预校准的读出(readouts)衡量代理答案的操作性依据。提示状态读出(prompt-state readout)预测闭卷充分性,其补数定义了策略相对的检索必要性;答案承诺读出(answer-commit readout)根据答案阶段对证据删除的敏感性来估计证据依赖。两者共同作用,当检索被估计为必要且答案对证据敏感时,为正确的搜索轨迹提供额外奖励;当闭卷知识足够时,偏好正确的直接答案;并惩罚重复搜索。校准后,奖励评分在策略优化期间既不需要过程注释,也不需要LLM评判器推理。由于强化学习会改变策略表示,Search-G1定期在最新检查点的轨迹上重新拟合这两个读出,使奖励与策略共同演化。在多个基于搜索的问答基准和两种模型规模上的实验表明,Search-G1改善了依据-搜索成本的权衡,在任务准确率具有竞争力的同时产生更短的响应侧轨迹。代码可在 https://github.com/Rosy0912/Search-G1 获取。
查看缓存全文
缓存时间: 2026/08/11 08:05
# Search-G1:基于表示的内在奖励实现证据锚定的搜索智能体 Source: https://arxiv.org/html/2608.07531 Ruoxi Cheng1,2, Haoxuan Ma3, Hongyi Zhang4, Junming Zhang5, Ranjie Duan2, Qiaolin Xia2, Hao Wang2,†, Yu Lu2, Haibo Shi2, Xing
相似文章
SlimSearcher:通过自适应奖励门控训练效率感知的网络代理
SlimSearcher 是一个框架,通过结合帕累托高效轨迹过滤和自适应奖励塑形,提升深度研究代理的效率,在 GAIA、BrowseComp 和 XBenchDeepSearch 等基准测试中,将工具调用轮次减少 17%-58%,同时保持准确率。
Harness-G:面向搜索代理的图结构检索框架
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
GRASP:面向代理型RAG的粒度感知搜索策略
介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。
Search-on-Graph-R1:使用强化学习训练大型语言模型搜索知识图谱
本文提出了Search-on-Graph-R1(SoG-R1),该模型通过首先使用黄金SPARQL查询搭建前沿教师模型以生成有依据的轨迹,然后应用监督微调和强化学习,训练一个8B参数的大型语言模型在知识图谱中导航。这个紧凑的模型在WebQSP、CWQ和GrailQA上超越了冻结的前沿系统,尤其是在CWQ上取得了所有对比方法中的最佳结果。
SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习
SAAS 提出了一种强化学习框架,通过增强智能体的自我感知能力,减少基于 LLM 的问答系统中的不必要搜索,从而平衡准确性与计算成本。