DeepSearch-World:可验证环境中深度搜索代理的自我蒸馏
摘要
DeepSearch-Evolve 引入了一个用于 Web 代理的自我蒸馏框架,该框架使用可验证环境(DeepSearch-World)和 420K 多跳问答任务,无需从更强模型蒸馏即可实现有竞争力的性能。
查看缓存全文
缓存时间: 2026/07/10 06:11
# DeepSearch-World:可验证环境下的深度搜索代理自我蒸馏 来源:https://arxiv.org/abs/2607.07820 查看PDF (https://arxiv.org/pdf/2607.07820) > 摘要:训练工具使用型代理从其自身经验中改进仍然具有挑战性,因为监督微调依赖于固定的教师蒸馏轨迹,而稀疏奖励强化学习为长周期交互提供的监督信号较弱。我们提出DeepSearch-Evolve,这是一个基于DeepSearch-World构建的Web代理自我蒸馏框架。DeepSearch-World是一个确定且可验证的环境,提供可复现的搜索和页面阅读工具。该环境包含42万个从实体级随机游走构建的多跳QA任务,并支持自我进化所需的关键代理认知行为,包括进度验证、基于事实的反思和失败恢复。DeepSearch-Evolve通过迭代执行轨迹生成、过滤、数据混合和微调来训练更强的代理。在不借助更强大模型蒸馏的情况下,DeepSearch-World-9B在开放源码代理中取得了有竞争力的性能:BrowseComp上31.2%,GAIA上61.5%,HotpotQA上93.4%,表明可验证环境能够实现长周期Web代理的可扩展自我进化。我们将公开环境、42万训练池、验证集、模型和代码,以促进深度搜索代理自我改进的未来研究。 ## 提交历史 来自:Xinyu Geng [查看邮件 (https://arxiv.org/show-email/31d1c647/2607.07820)] **[v1]** 2026年7月8日星期三 18:03:41 UTC (2,480 KB)
相似文章
@DanKornas:DeepDive 是一种深度搜索代理的模式:从知识图谱合成问答,然后用……训练多轮浏览
DeepDive 是一种用于构建深度搜索代理的模式,它从知识图谱合成问答,并通过强化学习(GRPO)训练多轮浏览。该模式包括实体混淆和结合工具调用的测试时缩放。
通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化
# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,
Echoverse:大规模训练计算机使用代理的深度演进环境
Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。
Self-Verified Distillation:你的语言模型实则就是它自己的合成数据流水线
提出了Self-Verified Distillation方法,该方法让LLM从无标注的种子问题中生成候选解决方案,并通过基于提示的自我验证进行筛选,然后在过滤后的数据集上进行训练,从而在Qwen3模型的数学、科学和编程基准测试上取得了显著提升。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua