CAFE:自我改进的搜索智能体需要协同进化的反馈

Hugging Face Daily Papers 论文

摘要

CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。

结果监督的搜索智能体学习何时以及如何检索证据,但终端奖励既无法定位中间错误,也无法在错误累积前重定向进行中的轨迹。将纠正反馈视为一种学习的轨迹内干预,将这两个角色耦合起来:智能体必须决定何时请求和使用反馈,而评价器必须从结果混淆的展开中推断有用的纠正,其失败模式随着智能体的改进而变化。我们引入CAFE(耦合智能体-反馈进化),这是一个框架,其中共享参数模型在搜索智能体和评价器角色之间交替。CAFE从围绕基础智能体自身失败构建的轨迹初始化反馈条件恢复,然后耦合在线和离线优化。在在线强化学习期间,比较反馈估计使用提示级别的调用-跳过成功差距来塑形请求回报,而反馈感知优势塑形在反馈前后重新加权令牌优势。离线时,展开衍生的偏好优化从匹配的成功和不成功轨迹中学习反馈。在七个智能搜索基准测试中,CAFE平均优于评估的基于强化学习的搜索智能体,在所有六个域外基准测试中保持其优势,并减少答案级幻觉。单侧消融研究表明,仅改进智能体或仅改进评价器最终会达到平台期,而交替更新两者则能持续提升性能。这些发现表明,自我改进的搜索智能体需要与其指导的策略协同进化的反馈。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:17

论文页面 - CAFE:自我改进的搜索智能体需要协同演化的反馈

来源:https://huggingface.co/papers/2608.24794 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

CAFE 通过共享参数将搜索智能体与评估器耦合,以学习轨迹内校正反馈,从而在各类基准测试中提升搜索性能并减少幻觉现象。

基于结果监督的搜索智能体(https://huggingface.co/papers?q=Outcome-supervised%20search%20agents)学习了何时以及如何检索证据,但终端奖励既无法定位中间错误,也无法在错误累积前重定向进行中的轨迹。我们将校正反馈(https://huggingface.co/papers?q=corrective%20feedback)视为一种可学习的轨迹内干预(https://huggingface.co/papers?q=in-trajectory%20intervention),从而将这两个角色耦合起来:智能体必须决定何时请求和使用反馈,而评估器则必须从结果混杂的轨迹展开中推断出有用的修正——随着智能体的改进,其失败模式也会发生变化。我们提出了 CAFE(https://huggingface.co/papers?q=CAFE)(Coupled Agent-Feedback Evolution,耦合智能体-反馈演化)框架,其中的共享参数模型(https://huggingface.co/papers?q=shared-parameter%20model)在搜索智能体和评估器角色之间交替。CAFE(https://huggingface.co/papers?q=CAFE)首先基于基础智能体自身的失败轨迹初始化反馈条件恢复(https://huggingface.co/papers?q=feedback-conditioned%20recovery),然后将在线优化与离线优化相耦合。在在线强化学习(RL)(https://huggingface.co/papers?q=online%20RL)阶段,一种比较性反馈估计(https://huggingface.co/papers?q=comparative%20feedback%20estimate)利用提示级别的调用-跳过成功差距来塑造请求回报,同时反馈感知优势塑造(https://huggingface.co/papers?q=feedback-aware%20advantage%20shaping)在反馈前后重新加权 token 优势(https://huggingface.co/papers?q=token%20advantages)。在离线阶段,轨迹衍生的偏好优化(https://huggingface.co/papers?q=rollout-derived%20preference%20optimization)从匹配的成功与失败轨迹中学习反馈。在七个智能体搜索基准测试(https://huggingface.co/papers?q=agentic%20search%20benchmarks)上,CAFE(https://huggingface.co/papers?q=CAFE)平均性能优于所评估的基于 RL 的搜索智能体(https://huggingface.co/papers?q=RL-based%20search%20agents),在所有六个域外基准测试(https://huggingface.co/papers?q=out-of-domain%20benchmarks)中均保持了其优势,并减少了答案级别的幻觉(https://huggingface.co/papers?q=answer-level%20hallucinations)。单侧消融实验表明,仅改进智能体或仅改进评估器最终都会达到性能瓶颈,而交替更新两者则能持续提升性能。这些发现表明,自我改进的搜索智能体需要与其引导策略协同演化的反馈。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24794)查看 PDF (https://arxiv.org/pdf/2608.24794)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24794)

在您的智能体中获取本文:

hf papers read 2608\.24794

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有链接本文的模型 在模型 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。

引用本文的数据集0

没有链接本文的数据集 在数据集 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。

引用本文的空间0

没有链接本文的空间 在空间 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。

包含本文的收藏集0

没有包含本文的收藏集 将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

CAS:基于自适应检索与策略加权的保形智能搜索

arXiv cs.AI

本文介绍了保形智能搜索(CAS),这是一个利用保形预测来增强搜索代理可靠性的框架,通过在强化学习过程中自适应检索文档和加权策略,从而提高准确性并减少冗余工具调用。