CAFE:自我改进的搜索智能体需要协同进化的反馈
摘要
CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。
查看缓存全文
缓存时间: 2026/08/26 03:17
论文页面 - CAFE:自我改进的搜索智能体需要协同演化的反馈
来源:https://huggingface.co/papers/2608.24794 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
CAFE 通过共享参数将搜索智能体与评估器耦合,以学习轨迹内校正反馈,从而在各类基准测试中提升搜索性能并减少幻觉现象。
基于结果监督的搜索智能体(https://huggingface.co/papers?q=Outcome-supervised%20search%20agents)学习了何时以及如何检索证据,但终端奖励既无法定位中间错误,也无法在错误累积前重定向进行中的轨迹。我们将校正反馈(https://huggingface.co/papers?q=corrective%20feedback)视为一种可学习的轨迹内干预(https://huggingface.co/papers?q=in-trajectory%20intervention),从而将这两个角色耦合起来:智能体必须决定何时请求和使用反馈,而评估器则必须从结果混杂的轨迹展开中推断出有用的修正——随着智能体的改进,其失败模式也会发生变化。我们提出了 CAFE(https://huggingface.co/papers?q=CAFE)(Coupled Agent-Feedback Evolution,耦合智能体-反馈演化)框架,其中的共享参数模型(https://huggingface.co/papers?q=shared-parameter%20model)在搜索智能体和评估器角色之间交替。CAFE(https://huggingface.co/papers?q=CAFE)首先基于基础智能体自身的失败轨迹初始化反馈条件恢复(https://huggingface.co/papers?q=feedback-conditioned%20recovery),然后将在线优化与离线优化相耦合。在在线强化学习(RL)(https://huggingface.co/papers?q=online%20RL)阶段,一种比较性反馈估计(https://huggingface.co/papers?q=comparative%20feedback%20estimate)利用提示级别的调用-跳过成功差距来塑造请求回报,同时反馈感知优势塑造(https://huggingface.co/papers?q=feedback-aware%20advantage%20shaping)在反馈前后重新加权 token 优势(https://huggingface.co/papers?q=token%20advantages)。在离线阶段,轨迹衍生的偏好优化(https://huggingface.co/papers?q=rollout-derived%20preference%20optimization)从匹配的成功与失败轨迹中学习反馈。在七个智能体搜索基准测试(https://huggingface.co/papers?q=agentic%20search%20benchmarks)上,CAFE(https://huggingface.co/papers?q=CAFE)平均性能优于所评估的基于 RL 的搜索智能体(https://huggingface.co/papers?q=RL-based%20search%20agents),在所有六个域外基准测试(https://huggingface.co/papers?q=out-of-domain%20benchmarks)中均保持了其优势,并减少了答案级别的幻觉(https://huggingface.co/papers?q=answer-level%20hallucinations)。单侧消融实验表明,仅改进智能体或仅改进评估器最终都会达到性能瓶颈,而交替更新两者则能持续提升性能。这些发现表明,自我改进的搜索智能体需要与其引导策略协同演化的反馈。
查看 arXiv 页面 (https://arxiv.org/abs/2608.24794)查看 PDF (https://arxiv.org/pdf/2608.24794)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24794)
在您的智能体中获取本文:
hf papers read 2608\.24794
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有链接本文的模型 在模型 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。
引用本文的数据集0
没有链接本文的数据集 在数据集 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。
引用本文的空间0
没有链接本文的空间 在空间 README.md 中引用 arxiv.org/abs/2608.24794 以从本页链接它。
包含本文的收藏集0
没有包含本文的收藏集 将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
学习适应:基于认知感知探索的自我改进网络智能体
提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。
CAS:基于自适应检索与策略加权的保形智能搜索
本文介绍了保形智能搜索(CAS),这是一个利用保形预测来增强搜索代理可靠性的框架,通过在强化学习过程中自适应检索文档和加权策略,从而提高准确性并减少冗余工具调用。
Critic-R: 使用指令调优检索器与自然语言内省反馈改进Agentic Search
Critic-R引入了一个框架,使用评判模型在推理智能体和检索器之间提供内省反馈,在推理和训练时间同时提升智能体搜索性能,且无需重新训练智能体。
迭代优化搜索:用于评估电商中智能搜索架构的双智能体模拟框架
eBay的这篇论文提出了一个模块化的双智能体模拟框架,用于评估对话式购物助手架构,能够对响应器设计进行受控比较。关键发现包括:滚动窗口内存在速度上比意图提取内存快35%,系统性故障分析将故障率降低了62%。
EvoBrowseComp:面向演进知识的搜索智能体基准测试
EvoBrowseComp是一个演进式基准测试集,包含800个无污染的问题,用于评估搜索智能体,旨在通过三智能体框架防止参数记忆并保持时间新鲜度。