BaRA: BFS与反思网络数据采集代理
摘要
BaRA是一个框架,用于站点级网络数据采集,结合了有界BFS遍历和基于历史的自反思,在链接发现和可下载提取方面优于现有方法。
arXiv:2607.00007v1 公告类型: 交叉
摘要:基于大型语言模型(LLM)的网络代理减少了网络数据采集的手动脚本需求,但在实际网站上,它们常常遗漏相关页面、返回不完整的多模态输出,或返回无法直接下载的媒体URL。我们提出了BFS与反思代理(BaRA),这是一个在固定交互预算下进行站点级采集的框架。该框架结合了有界广度优先搜索(BFS)遍历和基于历史的自反思。我们在50个具有真实参考集的合成网站上评估了BaRA。此外,我们在三个布局杂乱或动态的公共网站上进行了测试。BaRA在链接发现和可下载多模态提取方面优于Pure LLM、SeeAct-Vision和Browser-use,尤其在可下载图像和视频的有效恢复方面提升最大。我们的代码可在 https://github.com/MLAI-Yonsei/BaRA-Agent 获取。
查看缓存全文
缓存时间: 2026/07/02 05:41
# BaRA:基于BFS与反思的网络数据采集智能体 来源:https://arxiv.org/abs/2607.00007 查看PDF (https://arxiv.org/pdf/2607.00007) > 摘要:基于大型语言模型(LLM)的网络智能体减少了网络数据采集中的手动脚本编写,但在真实网站上,它们常常遗漏相关页面、返回不完整的多模态输出,或者返回无法直接下载的媒体 URL。我们提出了 BFS-and-Reflection Agent(BaRA),一种在固定交互预算下进行网站级采集的框架。该框架将有限广度优先搜索(BFS)遍历与基于历史的自省机制相结合。我们在 50 个包含真实参考集的合成网站上评估了 BaRA。此外,我们还在三个布局杂乱或动态的公开网站上进行了测试。BaRA 在链接发现和可下载多模态提取方面优于 Pure LLM、SeeAct-Vision 和 Browser-use,其中在可下载图片和视频的恢复上提升最为显著。我们的代码可从此 https URL 获取 (https://github.com/MLAI-Yonsei/BaRA-Agent)。 ## 提交历史 来自:李秀晶 [查看邮件 (https://arxiv.org/show-email/8dae5879/2607.00007)] **\[v1\]** 2026年5月2日 星期六 08:09:10 UTC (1,151 KB)
相似文章
@DeRonin_: 你明白 Browserbase 刚刚开源了什么吗???一个只需学习一次任何网站,就能以十分之一成本永久完成任务的智能体……
Browserbase 开源了 Autobrowse,这是一个智能网页浏览工具,通过迭代探索学习网站结构,并将发现的模式保存为可复用的 Markdown 技能文件,大幅减少重复网页自动化任务的时间和成本。
我制作了一个小工具,用于在将检索结果输入RAG之前进行检查
一位开发者创建了一个小型本地工具,用于在将检索结果输入RAG流水线之前,检查来自Brave、Serper、Tavily和Exa等搜索提供商的检索结果,并关注源多样性、重复性、时效性以及SEO/GEO污染风险等信号。
构建网页代理让我意识到多少上下文被浪费在不良 URL 上。你是如何过滤爬取的?
作者讨论了网页代理在爬取不良 URL 时上下文窗口浪费的问题,并询问如何使用元数据来过滤爬取以提高效率。
ARBOR:通过可复用评分缓存为搜索代理提供在线过程奖励
ARBOR 引入了一种可复用的评分缓存,为基于LLM的搜索代理提供在线过程奖励,在仅依赖结果奖励不足时提升训练效率。它在多跳问答基准测试中优于 GRPO 和 DAPO,将多达42%的零梯度训练组转化为信息丰富的训练组。
Region4Web:重新思考网络智能体的观测空间粒度
本文介绍了 Region4Web 框架,该框架通过将观测空间组织成功能区域而非单个元素,从而提升了网络智能体的性能。研究表明,这种方法在 WebArena 基准测试上缩短了观测长度并提高了任务成功率。