Harness-1:采用状态外化约束的搜索代理强化学习
摘要
介绍了 Harness-1,一个使用状态外化约束训练的 200 亿参数开源搜索代理,实现了强大的检索性能,并在多个基准测试上超越了更大的前沿模型。
查看缓存全文
缓存时间: 2026/06/02 19:33
论文页面 - Harness-1:基于状态外化框架的搜索代理强化学习
来源:https://huggingface.co/papers/2606.02373
https://huggingface.co/papers/2606.02373#%F0%9F%94%A5-introducing-harness-1-%F0%9F%94%A5🔥 介绍 Harness-1 🔥
Harness-1 是一个 20B 参数的开源搜索代理,采用状态外化框架进行训练,在多项困难的检索任务上匹配甚至超越了多个规模大得多的前沿模型搜索器。
Harness-1 性能表现
https://huggingface.co/papers/2606.02373#motivation动机
许多搜索代理基于不断增长的对话记录进行训练。因此,模型在搜索的同时还需要进行大量隐式记录工作:
- 记住候选文档,
- 追踪有用证据,
- 维护验证状态,
- 回忆搜索历史,
- 避免重复查看已看过的内容。
这使得模型不仅要负责搜索决策,还要在上下文中管理整个搜索状态。
https://huggingface.co/papers/2606.02373#key-idea核心思想
Harness-1 将这些职责分离开来。
策略仍然负责语义层面的决策:
- 搜索什么,
- 检查什么,
- 整理什么,
- 验证什么,
- 以及何时停止。
而框架则围绕这些决策维护可恢复的搜索状态,包括候选池、整理后的证据、证据链接、验证记录以及预算感知的上下文渲染。
通过这种设置,强化学习无需教模型从头管理非结构化的对话记录,而是训练模型在一个结构化的搜索工作空间中进行操作。
https://huggingface.co/papers/2606.02373#results结果
在 8 个困难的检索基准上,Harness-1 平均精选召回率达到 0.730,比次强的开源搜索子代理高出 +11.4 个百分点,同时与规模更大的前沿模型搜索器保持竞争力。
对我们来说最有趣的结果是迁移能力:在留出的迁移基准上的提升幅度明显大于源家族基准。消融实验还表明,移除框架机制会改变代理行为并损害召回率。
https://huggingface.co/papers/2606.02373#takeaway要点
对于搜索代理而言,模型并非整个学习系统的全部。
框架——内存布局、动作空间、整理接口、验证记录和上下文渲染——都是强化学习学着去使用的一部分。
相似文章
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。
@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…
Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。
Harness-G:面向搜索代理的图结构检索框架
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。