search-agents

标签

Cards List
#search-agents

FinFIRST: 金融信息检索、来源与可追溯性搜索代理基准测试

arXiv cs.CL ↗ · 2天前 缓存

FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。

0 人收藏 0 人点赞
#search-agents

超越置信度:基于检索基础的多轮搜索代理测试时扩展

arXiv cs.AI ↗ · 2026-08-26 缓存

本文介绍了检索基础投票(RGV),通过使用与检索文档的词汇重叠来解决多轮搜索代理中基于置信度投票的局限性,实现了高达5.4%的准确率提升。

0 人收藏 0 人点赞
#search-agents

CAFE:自我改进的搜索智能体需要协同进化的反馈

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。

0 人收藏 0 人点赞
#search-agents

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

arXiv cs.LG ↗ · 2026-08-14 缓存

Introduces SSPO, a step-level self-distilled policy optimization method for training deep search agents, which uses evidence anchors and advantage weights to improve credit assignment beyond sparse outcome rewards. SSPO outperforms GRPO on benchmarks like BrowseComp and GAIA with only ~5% overhead per step.

0 人收藏 0 人点赞
#search-agents

缓解上下文干扰以实现可靠高效的搜索智能体

arXiv cs.CL ↗ · 2026-08-12 缓存

本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。

0 人收藏 0 人点赞
#search-agents

Search-G1:通过基于表示的内部奖励实现有依据的搜索代理

arXiv cs.CL ↗ · 2026-08-11 缓存

Search-G1提出了一种面向搜索增强语言代理的基于表示的内部奖励框架,利用干预校准的读出机制来平衡检索必要性与证据依赖,从而在无需昂贵标注的情况下提高搜索效率。

0 人收藏 0 人点赞
#search-agents

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI ↗ · 2026-08-07 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#search-agents

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

0 人收藏 0 人点赞
#search-agents

自我对弈遇上技能进化:能提问、求解并记忆的自进化搜索代理

arXiv cs.AI ↗ · 2026-08-03 缓存

本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。

0 人收藏 0 人点赞
#search-agents

Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。

0 人收藏 0 人点赞
#search-agents

称量烟雾:为何AI可见性仪表盘基本无用

Hacker News Top ↗ · 2026-07-07 缓存

文章认为,声称能追踪AI搜索回答中品牌存在的AI可见性仪表盘并不可靠,且缺乏预测有效性,将其比作称量烟雾,因为AI输出结果的不一致性以及缺乏与业务结果的有意义关联。

0 人收藏 0 人点赞
#search-agents

搜索代理何时该提问:DiscoBench——面向澄清感知的深度搜索基准

arXiv cs.CL ↗ · 2026-06-29 缓存

DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。

0 人收藏 0 人点赞
#search-agents

ProMSA:用于基于知识的视觉问答的渐进式多模态搜索智能体

Hugging Face Daily Papers ↗ · 2026-06-26 缓存

提出ProMSA,一种用于基于知识的视觉问答的渐进式多模态搜索智能体,它能自适应选择搜索策略并通过序列级强化学习进行优化,在E-VQA和InfoSeek上取得了一致的性能提升。

0 人收藏 0 人点赞
#search-agents

DailyReport:一个用于评估日常搜索任务中搜索代理的开放式基准

arXiv cs.AI ↗ · 2026-06-12 缓存

DailyReport 是一个开放式基准,用于评估搜索代理在日常生活搜索任务中的表现,包含150个任务和3,546条评分标准,可实现可解释的、以用户为中心的评估。

0 人收藏 0 人点赞
#search-agents

EvoBrowseComp:面向演进知识的搜索代理基准测试

arXiv cs.CL ↗ · 2026-06-12 缓存

本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。

0 人收藏 0 人点赞
#search-agents

LoHoSearch:超越人类难度上限的长时域搜索智能体基准

arXiv cs.CL ↗ · 2026-06-12 缓存

LoHoSearch是一个用于评估长时域搜索智能体的新基准,基于包含700万维基百科实体的知识图谱构建。它引入了具有大搜索空间和结构复杂性的问题,以超越人类编写的难度上限,并显示出最佳模型仅达到34.74%的准确率。

0 人收藏 0 人点赞
#search-agents

EvoBrowseComp:面向演进知识的搜索智能体基准测试

Hugging Face Daily Papers ↗ · 2026-06-11 缓存

EvoBrowseComp是一个演进式基准测试集,包含800个无污染的问题,用于评估搜索智能体,旨在通过三智能体框架防止参数记忆并保持时间新鲜度。

0 人收藏 0 人点赞
#search-agents

FORT-Searcher: 合成抗捷径搜索任务用于训练深度搜索智能体

Hugging Face Daily Papers ↗ · 2026-06-10 缓存

FORT-Searcher 提出了一种框架,通过识别和缓解四种捷径风险,为深度搜索智能体合成抗捷径的训练数据。由此产生的智能体经过监督微调训练,在可比较的开源搜索智能体中取得了最先进的性能。

0 人收藏 0 人点赞
#search-agents

@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…

X AI KOLs Following ↗ · 2026-06-08 缓存

Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。

0 人收藏 0 人点赞
#search-agents

ARBOR:通过可复用评分缓存为搜索代理提供在线过程奖励

arXiv cs.CL ↗ · 2026-06-03 缓存

ARBOR 引入了一种可复用的评分缓存,为基于LLM的搜索代理提供在线过程奖励,在仅依赖结果奖励不足时提升训练效率。它在多跳问答基准测试中优于 GRPO 和 DAPO,将多达42%的零梯度训练组转化为信息丰富的训练组。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈