Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers 论文

摘要

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。

强化学习(RL)搜索代理通常将检索建模为自由形式的自然语言查询生成,并使用最终答案奖励来优化多轮交互。当前研究主要通过更密集或更结构化的信用信号来改进训练,但很少检查检索在策略-环境接口上的形式化是否恰当。我们观察到Search-R1训练中存在明显的检索别名化现象:对于同一问题,rollout持续生成不同的查询字符串,但它们积累的证据集合却越来越重叠。我们将这种现象称为检索等价崩溃;在这种状态下,轨迹在检索决策方面接近效用等价,导致组内回报在检索对比上缺乏有效区分。为解决此问题,我们提出了Harness-G,一种图结构检索框架,重新设计了这一接口。它将自由形式的查询生成重构为有限动作选择:策略选择一个证据句子或实体,或选择回答,而环境负责构建菜单、跟踪检索状态,并验证和执行每个选择。该接口减少了语言别名化,使同状态下的备选项可以直接比较。在此接口基础上,我们引入了结构化非短视信用(SNC),它使用冻结的答案评分器将所选动作与其备选项进行比较,并将下游收益分配给促成这些收益的早期动作。在六个问答基准测试中,Harness-G在两种评估模型规模下均取得了最高的平均F1分数,在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Harness-G:用于搜索智能体的图结构化 Harness

来源:https://huggingface.co/papers/2607.27652

摘要

强化学习(RL)搜索智能体通常将检索建模为自由形式的自然语言查询生成,并利用最终答案奖励来优化多轮交互。现有研究主要通过更密集或更具结构化的信用信号来改进训练,但很少审视检索在策略-环境接口层面上的形式化是否恰当。我们在 Search-R1 训练过程中观察到了显著的检索别名化现象:针对同一问题的 rollout 会持续生成不同的查询字符串,但它们的累积证据集却逐渐重叠。我们将这一现象称为“检索等价坍缩”;在此状态下,轨迹在检索决策方面趋近于效用等价,导致组内回报之间缺乏有效的检索对比度。为了解决这一问题,我们提出了 Harness-G,一种重新设计该接口的图结构化检索框架。它将自由形式的查询生成重构为有限动作选择:策略选择一个证据句子或实体,或者选择作答,而环境则负责构建选项菜单、跟踪检索状态,并验证和执行每个选择。该接口减少了语言别名化,使得同一状态下的备选动作可以直接比较。基于该接口,我们引入了结构化非近视信用(SNC),它使用冻结的答案评分器将所选动作与其备选动作进行比较,并将下游收益归因于那些使这些收益得以实现的早期动作。在六个问答基准上,Harness-G 在两种评估模型规模下均取得了最高平均 F1,分别比最强基线 Graph-R1 高出 1.5B 规模下的 10.74 个百分点和 3B 规模下的 3.98 个百分点。

查看 arXiv 页面 查看 PDF GitHub2 添加到收藏

在你的智能体中获取此论文:

hf papers read 2607\.27652

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型引用此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该模型。

引用此论文的数据集 0

没有数据集引用此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该数据集。

引用此论文的 Space 0

没有 Space 引用此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。

相似文章

Harness Handbook:使不断演化的智能体Harness可读、可导航、可编辑

arXiv cs.AI

Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。