Harness-G:面向搜索代理的图结构检索框架
摘要
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Harness-G:用于搜索智能体的图结构化 Harness
来源:https://huggingface.co/papers/2607.27652
摘要
强化学习(RL)搜索智能体通常将检索建模为自由形式的自然语言查询生成,并利用最终答案奖励来优化多轮交互。现有研究主要通过更密集或更具结构化的信用信号来改进训练,但很少审视检索在策略-环境接口层面上的形式化是否恰当。我们在 Search-R1 训练过程中观察到了显著的检索别名化现象:针对同一问题的 rollout 会持续生成不同的查询字符串,但它们的累积证据集却逐渐重叠。我们将这一现象称为“检索等价坍缩”;在此状态下,轨迹在检索决策方面趋近于效用等价,导致组内回报之间缺乏有效的检索对比度。为了解决这一问题,我们提出了 Harness-G,一种重新设计该接口的图结构化检索框架。它将自由形式的查询生成重构为有限动作选择:策略选择一个证据句子或实体,或者选择作答,而环境则负责构建选项菜单、跟踪检索状态,并验证和执行每个选择。该接口减少了语言别名化,使得同一状态下的备选动作可以直接比较。基于该接口,我们引入了结构化非近视信用(SNC),它使用冻结的答案评分器将所选动作与其备选动作进行比较,并将下游收益归因于那些使这些收益得以实现的早期动作。在六个问答基准上,Harness-G 在两种评估模型规模下均取得了最高平均 F1,分别比最强基线 Graph-R1 高出 1.5B 规模下的 10.74 个百分点和 3B 规模下的 3.98 个百分点。
查看 arXiv 页面 查看 PDF GitHub2 添加到收藏
在你的智能体中获取此论文:
hf papers read 2607\.27652
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型引用此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该模型。
引用此论文的数据集 0
没有数据集引用此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该数据集。
引用此论文的 Space 0
没有 Space 引用此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27652,即可从本页面链接到该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。
相似文章
Harness-1:采用状态外化约束的搜索代理强化学习
介绍了 Harness-1,一个使用状态外化约束训练的 200 亿参数开源搜索代理,实现了强大的检索性能,并在多个基准测试上超越了更大的前沿模型。
@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…
Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。
@jerryjliu0: 我们在2026年创建了一个全面的 Retrieval Harness,用于现代的智能体检索。该 Harness 提供了持久化的…
LlamaIndex 创建了一个用于现代智能体检索的 Retrieval Harness,提供了持久化数据管道,用于连接、索引和查询大型知识库,并配备语义搜索和正则表达式 grep 等工具,使智能体能够自主导航知识库。
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。
Harness Handbook:使不断演化的智能体Harness可读、可导航、可编辑
Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。