@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…

X AI KOLs Following 论文

摘要

Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。

再次感谢您对我们工作的兴趣! 链接在此,以免被“显示更多”埋没: 论文:https://arxiv.org/abs/2606.02373 代码:https://github.com/pat-jj/harness-1… 模型:https://huggingface.co/pat-jj/harness-1… 所有内容均已开源。欢迎为 GitHub 仓库点星,以便稍后收藏。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:57

再次感谢您对我们工作的关注! 以下是链接,以免被“显示更多”折叠: 论文:https://arxiv.org/abs/2606.02373 代码:https://github.com/pat-jj/harness-1… 模型:https://huggingface.co/pat-jj/harness-1…

所有内容均开放。欢迎给 GitHub 仓库加星标以便稍后查阅。


Harness-1:利用状态外化框架的搜索代理强化学习

来源:https://arxiv.org/abs/2606.02373 查看 PDF(https://arxiv.org/pdf/2606.02373)

摘要: 搜索代理通常被训练为基于不断增长的对话记录的策略:模型必须决定如何搜索,同时记住已看到的内容、哪些证据有用、哪些约束条件尚未满足、以及哪些声明已被实际验证。我们认为,这种表述将过多的常规状态管理放在了策略内部:强化学习被迫同时优化语义搜索决策和可由环境更可靠维护的、可恢复的簿记工作。我们引入了 Harness-1,一个包含 20B 参数的搜索代理(检索子代理),它在一个有状态搜索框架内通过强化学习进行训练。该框架在环境端维护工作记忆,包括候选池、带重要性标记的精选集、紧凑的证据链接、验证记录、经过压缩和去重的观察结果,以及预算感知的上下文渲染。策略保留了语义决策:搜索什么、保留或丢弃哪些文档、验证什么内容、以及何时停止。在涵盖网络、金融、专利和多跳问答的八个检索基准上,Harness-1 的平均精选召回率达到 0.730,比次强的开源搜索子代理高出 11.4 个百分点,并与规模大得多的前沿模型搜索器保持竞争力。其在保留的迁移基准上的增益尤为显著,这表明对显式搜索状态的强化学习可以产生超越训练领域的检索行为。我们的代码可在以下网址获取:https://github.com/pat-jj/harness-1。

提交历史

来自:Pengcheng Jiang 查看邮件 [v1] 2026年6月1日星期一 15:21:41 UTC (6,831 KB)

相似文章

Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。