@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…
摘要
Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。
查看缓存全文
缓存时间: 2026/06/09 08:57
再次感谢您对我们工作的关注! 以下是链接,以免被“显示更多”折叠: 论文:https://arxiv.org/abs/2606.02373 代码:https://github.com/pat-jj/harness-1… 模型:https://huggingface.co/pat-jj/harness-1…
所有内容均开放。欢迎给 GitHub 仓库加星标以便稍后查阅。
Harness-1:利用状态外化框架的搜索代理强化学习
来源:https://arxiv.org/abs/2606.02373 查看 PDF(https://arxiv.org/pdf/2606.02373)
摘要: 搜索代理通常被训练为基于不断增长的对话记录的策略:模型必须决定如何搜索,同时记住已看到的内容、哪些证据有用、哪些约束条件尚未满足、以及哪些声明已被实际验证。我们认为,这种表述将过多的常规状态管理放在了策略内部:强化学习被迫同时优化语义搜索决策和可由环境更可靠维护的、可恢复的簿记工作。我们引入了 Harness-1,一个包含 20B 参数的搜索代理(检索子代理),它在一个有状态搜索框架内通过强化学习进行训练。该框架在环境端维护工作记忆,包括候选池、带重要性标记的精选集、紧凑的证据链接、验证记录、经过压缩和去重的观察结果,以及预算感知的上下文渲染。策略保留了语义决策:搜索什么、保留或丢弃哪些文档、验证什么内容、以及何时停止。在涵盖网络、金融、专利和多跳问答的八个检索基准上,Harness-1 的平均精选召回率达到 0.730,比次强的开源搜索子代理高出 11.4 个百分点,并与规模大得多的前沿模型搜索器保持竞争力。其在保留的迁移基准上的增益尤为显著,这表明对显式搜索状态的强化学习可以产生超越训练领域的检索行为。我们的代码可在以下网址获取:https://github.com/pat-jj/harness-1。
提交历史
来自:Pengcheng Jiang 查看邮件 [v1] 2026年6月1日星期一 15:21:41 UTC (6,831 KB)
相似文章
Harness-1:采用状态外化约束的搜索代理强化学习
介绍了 Harness-1,一个使用状态外化约束训练的 200 亿参数开源搜索代理,实现了强大的检索性能,并在多个基准测试上超越了更大的前沿模型。
Harness-G:面向搜索代理的图结构检索框架
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
@omarsar0:大家,构建你自己的框架。这是来自NVIDIA关于自进化代理框架的绝佳论文。(收藏它…)
论文介绍了SoL-Pi,一种自动化框架发现方法,可将token使用量减少近一半,并将API成本削减约三分之一,同时在基准测试中保持性能,使用诸如GPT-5.6 Sol和Opus 5的模型。
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。
@dair_ai: 关于自进化代理框架的精彩论文。自进化代理框架有两个实际问题:1. 搜索很慢…
论文提出了 Ecdysis,一个用于训练LLM代理运行时框架的框架,它通过识别重复的失败模式来提高效率和准确性,实现了1.84倍更快的训练和18.56%更高的推理准确性。