ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI 论文

摘要

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

arXiv:2608.05102v1 公告类型:新 摘要:长时程搜索智能体必须执行多个顺序动作(步骤)来搜索、检索、验证并整合证据,以得出最终答案。然而,现有的训练这些智能体的方法在监督微调(SFT)和强化学习(RL)阶段通常将轨迹中的所有步骤统一对待,无法区分有用的动作与错误的或冗余的动作。本文提出了答案回溯信用分配(ABC),一种细粒度的信用分配框架,通过将稀疏的轨迹级结果转换为密集的步级监督,奖励有用的动作(即使是在失败的轨迹中),同时抑制错误或冗余的动作。具体来说,给定一个可能模糊的查询及其对应的真实答案,ABC首先执行答案回溯线索恢复(Answer-Backtracked Clue Recovery),从答案回溯恢复解题所需的中间线索。然后应用线索锚定的步骤评分(Clue-Anchored Step Scoring)根据这些线索评估每个搜索步骤,将稀疏的二元结果监督转换为密集的步级奖励。基于这些奖励,我们开发了ABC-SFT(重新加权每轮损失)和ABC-GRPO(在GRPO中使用步级分数作为奖励)。在此框架基础上,我们仅用8.5k个示例训练了基于Qwen3.5-4B的ABSeeker。ABSeeker在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。通过上下文管理,分数分别进一步提升至55.3%和52.9%,显著优于同规模(4B)智能体,甚至与更大规模(约30B)的智能体性能相当。这些结果证明了答案回溯的步级信用分配对于训练长时程搜索智能体的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:43

# 通过答案回溯的信用分配训练长时程搜索智能体

Yijun Lu<sup>1,\*</sup>, Rui Ye<sup>1,\*,†</sup>, Jiajun Wang<sup>1</sup>, Yuwen Du<sup>1</sup>, Tian Jin<sup>1</sup>, Songhua Liu<sup>1,†</sup>, Siheng Chen<sup>1,†</sup>

1上海交通大学,\*共同第一作者,†通讯作者:{yr991129, liusonghua, sihengc}@sjtu.edu.cn

###### 摘要

长时程搜索智能体必须执行多个顺序动作(步骤)来搜索、检索、验证和整合证据,最终得出答案。然而,现有的训练方法通常在监督微调(SFT)和强化学习(RL)中统一对待轨迹中的所有步骤,无法区分有用动作与错误或冗余动作。在本文中,我们提出了答案回溯信用分配(Answer-Backtracked Credit Assignment, ABC),一种用于训练长时程搜索智能体的细粒度信用分配框架,通过将稀疏的轨迹级结果转换为密集的步骤级监督,奖励有用的动作(即使在失败的轨迹中),同时抑制错误或冗余的动作。具体来说,给定一个可能模糊的查询及其对应的真实答案,ABC首先执行答案回溯线索恢复(Answer-Backtracked Clue Recovery),从答案回溯恢复出解决问题所需的中间断线。然后,它应用线索锚定步骤评分(Clue-Anchored Step Scoring)来评估每个搜索步骤与这些线索的匹配程度,将稀疏的二值结果监督转换为密集的步骤级奖励。基于这些奖励,我们开发了ABC-SFT(重新加权每一轮的损失)和ABC-GRPO(在GRPO中使用步骤级分数作为奖励)。在此框架上,我们仅使用8.5k个示例基于Qwen3.5-4B训练了ABSeeker。ABSeeker在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。启用上下文管理后,分数分别进一步提升至55.3%和52.9%,显著优于同规模(4B)智能体,甚至能与更大规模(∼30B)的智能体相匹配。这些结果证明了基于答案回溯的步骤级信用分配对于训练长时程搜索智能体的有效性。

图1:ABSeeker在4B模型中达到最佳性能,并与多个更大的搜索智能体保持竞争力。条纹区域表示启用了上下文管理的结果。

## 1 引言

搜索智能体已成为解决复杂信息寻求任务的重要方法。代表性的系统如OpenAI Deep Research (OpenAI,2025 (https://arxiv.org/html/2608.05102#bib.bib31))、Tongyi DeepResearch (Team et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib2))和MiroThinker (Team et al.,2026a (https://arxiv.org/html/2608.05102#bib.bib3))超越了单轮检索,通过进行多步调查、迭代地制定查询、检查证据、修订假设,并根据新获取的信息调整后续动作。然而,在长交互时程上训练搜索智能体带来了根本性的信用分配挑战。现有方法通常在监督微调(SFT)和强化学习(RL)中统一对待轨迹中的所有步骤,而不区分它们对最终结果的个体贡献 (Jin et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib4); Song et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib5); Chen et al.,2025b (https://arxiv.org/html/2608.05102#bib.bib6); Zheng et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib7); Gao et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib8); Xie et al.,2026 (https://arxiv.org/html/2608.05102#bib.bib15))。这种统一处理在长时程搜索中尤其成问题,因为单条轨迹往往包含异构动作:即使是一条成功的轨迹也可能包含错误或冗余的步骤,而一条失败的轨迹仍可能包含有用的动作,如检索到决定性证据或修正解决方案方向。因此,平等对待所有步骤无法捕捉单个动作的质量,也限制了针对关键搜索和推理行为的优化。为了应对这一挑战,关键是找到一种有效的反馈信号,能够在细粒度层面评估轨迹,区分训练过程中单个动作的贡献。我们的核心想法源于搜索任务的一个独特性质:一旦已知真实答案,任务就变得自然可回溯。从答案出发,可以恢复出搜索过程中应发现的关键实体、事实、关系和约束。这些答案回溯线索为对轨迹的不同部分分配差异化信用提供了原则性基础。遵循这一想法,我们提出了答案回溯信用分配(ABC),一种用于训练长时程搜索智能体的细粒度信用分配框架。具体来说,它包含两个阶段:(1)答案回溯线索恢复,从已验证答案回溯恢复一组中间线索——共同刻画解决问题所需证据的实体、事实和关系。(2)线索锚定步骤评分,根据每个搜索步骤如何发现、验证、细化或错误推理这些恢复的线索来评估该步骤,将稀疏的二值结果监督转换为密集的轮级奖励。基于这些细粒度步骤奖励,我们开发了(1)ABC-SFT,它建立在标准SFT之上,根据分配的奖励对每一轮的损失进行重新加权;以及(2)ABC-GRPO,它建立在标准GRPO之上,使用步骤级分数作为奖励。这些方法共同提供了步骤级监督:即使在失败的轨迹中也奖励有用的动作,抑制成功轨迹中的错误或冗余行为,并通过固定的答案回溯评估标准实现细粒度信用分配。在此框架上,我们基于Qwen3.5-4B (Yang et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib21))训练了ABSeeker。ABSeeker在BrowseComp (Wei et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib20))上达到37.3%,在BrowseComp-ZH (Zhou et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib23))上达到39.1%,在xbench-2505 (Chen et al.,2025a (https://arxiv.org/html/2608.05102#bib.bib24))上达到77.0%,在xbench-2510 (Chen et al.,2025a (https://arxiv.org/html/2608.05102#bib.bib24))上达到46.0%,在GAIA-text (Mialon et al.,2024 (https://arxiv.org/html/2608.05102#bib.bib25))上达到81.6%。启用上下文管理后,其性能进一步提高,在BrowseComp和BrowseComp-ZH上分别达到55.3%和52.9%,优于最近同规模4B基线,如QUEST-4B (Xie et al.,2026 (https://arxiv.org/html/2608.05102#bib.bib15))和Dr. Venus (Team et al.,2026b (https://arxiv.org/html/2608.05102#bib.bib16)),以及更大的∼30B搜索智能体,如Tongyi DeepResearch (Team et al.,2025 (https://arxiv.org/html/2608.05102#bib.bib2))和OpenSeeker (Du et al.,2026 (https://arxiv.org/html/2608.05102#bib.bib18))。我们的主要贡献总结如下:

- 我们提出了答案回溯信用分配,一个细粒度信用分配框架,在失败的轨迹中奖励有用的动作,同时在成功的轨迹中抑制错误的动作。
- 基于ABC,我们开发了ABC-SFT,根据步骤奖励对每一轮的损失进行重新加权,以及ABC-GRPO,将步骤级奖励纳入GRPO。

相似文章

ACC:编译智能体轨迹以实现长上下文训练

arXiv cs.CL

ACC将多轮智能体轨迹转化为长上下文问答对,用于训练LLMs在无需额外标注的情况下进行长程推理,在MRCR和GraphWalks基准测试上取得了显著提升,同时保持通用能力。

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。