Harness-1:采用状态外化约束的搜索代理强化学习

Hugging Face Daily Papers 论文

摘要

介绍了 Harness-1,一个使用状态外化约束训练的 200 亿参数开源搜索代理,实现了强大的检索性能,并在多个基准测试上超越了更大的前沿模型。

搜索代理通常作为基于不断增长的转录文本的策略进行训练:模型必须决定如何搜索,同时记住它看到了什么、哪些证据有用、哪些约束仍然开放、哪些主张已被实际核实。我们认为这种表述将过多的常规状态管理放在了策略内部:强化学习被迫同时优化语义搜索决策和可恢复的簿记工作,而这些簿记工作环境可以更可靠地维护。我们引入了 Harness-1,一个 200 亿参数的搜索代理(检索子代理),它在有状态搜索约束内使用强化学习进行训练。该约束维护环境端的工作记忆,包括候选池、重要性标记的精选集、紧凑的证据链接、验证记录、压缩去重的观察结果以及预算感知的上下文渲染。策略保留语义决策:搜索什么、保留或丢弃哪些文档、验证什么以及何时停止。在涵盖网页、金融、专利和多跳问答的八个检索基准测试中,Harness-1 实现了 0.730 的平均精选召回率,比次强的开源搜索子代理高出 11.4 个百分点,并且与更大的前沿模型搜索器保持竞争力。其增益在保留的迁移基准测试上尤为强劲,这表明基于显式搜索状态的强化学习可以产生超越训练领域的检索行为。我们的代码可在 https://github.com/pat-jj/harness-1 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/02 19:33

论文页面 - Harness-1:基于状态外化框架的搜索代理强化学习

来源:https://huggingface.co/papers/2606.02373

https://huggingface.co/papers/2606.02373#%F0%9F%94%A5-introducing-harness-1-%F0%9F%94%A5🔥 介绍 Harness-1 🔥

Harness-1 是一个 20B 参数的开源搜索代理,采用状态外化框架进行训练,在多项困难的检索任务上匹配甚至超越了多个规模大得多的前沿模型搜索器。

Harness-1 性能表现

https://huggingface.co/papers/2606.02373#motivation动机

许多搜索代理基于不断增长的对话记录进行训练。因此,模型在搜索的同时还需要进行大量隐式记录工作:

  • 记住候选文档,
  • 追踪有用证据,
  • 维护验证状态,
  • 回忆搜索历史,
  • 避免重复查看已看过的内容。

这使得模型不仅要负责搜索决策,还要在上下文中管理整个搜索状态。

https://huggingface.co/papers/2606.02373#key-idea核心思想

Harness-1 将这些职责分离开来。

策略仍然负责语义层面的决策:

  • 搜索什么,
  • 检查什么,
  • 整理什么,
  • 验证什么,
  • 以及何时停止。

而框架则围绕这些决策维护可恢复的搜索状态,包括候选池、整理后的证据、证据链接、验证记录以及预算感知的上下文渲染。

通过这种设置,强化学习无需教模型从头管理非结构化的对话记录,而是训练模型在一个结构化的搜索工作空间中进行操作。

https://huggingface.co/papers/2606.02373#results结果

在 8 个困难的检索基准上,Harness-1 平均精选召回率达到 0.730,比次强的开源搜索子代理高出 +11.4 个百分点,同时与规模更大的前沿模型搜索器保持竞争力。

对我们来说最有趣的结果是迁移能力:在留出的迁移基准上的提升幅度明显大于源家族基准。消融实验还表明,移除框架机制会改变代理行为并损害召回率。

https://huggingface.co/papers/2606.02373#takeaway要点

对于搜索代理而言,模型并非整个学习系统的全部。

框架——内存布局、动作空间、整理接口、验证记录和上下文渲染——都是强化学习学着去使用的一部分。

相似文章

Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。