标签
FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。
本文介绍了检索基础投票(RGV),通过使用与检索文档的词汇重叠来解决多轮搜索代理中基于置信度投票的局限性,实现了高达5.4%的准确率提升。
CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。
Introduces SSPO, a step-level self-distilled policy optimization method for training deep search agents, which uses evidence anchors and advantage weights to improve credit assignment beyond sparse outcome rewards. SSPO outperforms GRPO on benchmarks like BrowseComp and GAIA with only ~5% overhead per step.
本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。
Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。
本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
文章认为,声称能追踪AI搜索回答中品牌存在的AI可见性仪表盘并不可靠,且缺乏预测有效性,将其比作称量烟雾,因为AI输出结果的不一致性以及缺乏与业务结果的有意义关联。
DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。
提出ProMSA,一种用于基于知识的视觉问答的渐进式多模态搜索智能体,它能自适应选择搜索策略并通过序列级强化学习进行优化,在E-VQA和InfoSeek上取得了一致的性能提升。
DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。
本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。
LoHoSearch是一个用于评估长时域搜索智能体的新基准,基于包含700万维基百科实体的知识图谱构建。它引入了具有大搜索空间和结构复杂性的问题,以超越人类编写的难度上限,并显示出最佳模型仅达到34.74%的准确率。
EvoBrowseComp是一个演进式基准测试集,包含800个无污染的问题,用于评估搜索智能体,旨在通过三智能体框架防止参数记忆并保持时间新鲜度。
FORT-Searcher 提出了一种框架,通过识别和缓解四种捷径风险,为深度搜索智能体合成抗捷径的训练数据。由此产生的智能体经过监督微调训练,在可比较的开源搜索智能体中取得了最先进的性能。
Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。
ARBOR 引入了一种可复用的评分缓存,为基于LLM的搜索代理提供在线过程奖励,在仅依赖结果奖励不足时提升训练效率。它在多跳问答基准测试中优于 GRPO 和 DAPO,将多达42%的零梯度训练组转化为信息丰富的训练组。