web-agents

标签

Cards List
#web-agents

OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习

Hugging Face Daily Papers · 2026-06-01 缓存

OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。

0 人收藏 0 人点赞
#web-agents

GTA: 大规模生成Web智能体的长时域任务

arXiv cs.AI · 2026-05-29 缓存

本文介绍了GTA,一个可扩展的框架,用于自动生成具有可执行轨迹的长时域、多跳Web智能体任务,解决了Web智能体基准测试中缺乏过程级监督的问题。该框架集成了爬取、基于检索的种子生成和自动质量控制,以在多个网站上产生现实的任务。

0 人收藏 0 人点赞
#web-agents

@googledevs: Modern Web Guidance + Chrome DevTools for agents = A powerful new workflow. Matthias Rohmer takes you inside the #Googl…

X AI KOLs Following · 2026-05-26 缓存

Google 在 Google I/O 上演示了 Chrome DevTools 与 AI 代理的新工作流,包括 WebMCP 和 HTML-in-Canvas 等 API,旨在让开发者轻松将网页功能暴露给 AI 代理,并保持语义、无障碍和安全边界。

0 人收藏 0 人点赞
#web-agents

DRIVE:在持续学习环境下为Web智能体建模推理与交互层面的技能

arXiv cs.AI · 2026-05-26 缓存

DRIVE提出了一种双层技能建模框架,将推理知识与交互知识分离,用于持续学习下的Web智能体。该方法在WebArena上实现了52.8%的任务成功率,比无技能基线高出7.3个百分点。

0 人收藏 0 人点赞
#web-agents

Weasel:基于重要性与多样性的数据选择实现Web代理的域外泛化

arXiv cs.LG · 2026-05-21 缓存

Weasel是一种用于Web代理离线训练的轨迹选择方法,通过平衡重要性与多样性来提升域外泛化能力。该方法在多个基准测试中实现了高达12.5倍的训练加速并提升了性能。

0 人收藏 0 人点赞
#web-agents

Skim:用于快速高效网络代理的推测执行框架

arXiv cs.AI · 2026-05-19 缓存

Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。

0 人收藏 0 人点赞
#web-agents

ShopGym:一个用于电子商务网络代理的现实模拟和可扩展基准测试的集成框架

arXiv cs.AI · 2026-05-18 缓存

ShopGym 是一个框架,它将实时的电子商务店面转换为自包含的沙盒商店,用于对网络代理进行真实、可控和可重复的基准测试,并包含涵盖七类技能的合成任务。

0 人收藏 0 人点赞
#web-agents

SimPersona:从原始点击流学习离散买家画像以构建接地气的电商代理

arXiv cs.AI · 2026-05-15 缓存

SimPersona 使用 VQ-VAE 从原始点击流中学习离散的买家画像,并将其映射为 LLM 驱动的网络代理的画像令牌,在多个在线商店中实现了高转化率对齐。

0 人收藏 0 人点赞
#web-agents

WebHarbor - 我们将真实网站“对接”到本地,供网页代理使用![R]

Reddit r/MachineLearning · 2026-05-14

WebHarbor 将 15 个真实网站(Amazon、GitHub、BBC 等)打包为自包含的 Flask+SQLite 应用,置于单个 Docker 镜像中,支持亚秒级重置,专为可重复的网页智能体评估与训练而设计。该项目邀请社区贡献,以扩展到 100 多个网站,并提供合著机会。

0 人收藏 0 人点赞
#web-agents

LongMemEval-V2:评估长期智能体记忆,迈向经验丰富的同事

Hugging Face Daily Papers · 2026-05-12 缓存

本文介绍了 LongMemEval-V2,这是一个用于评估 Web 智能体长期记忆系统的基准,同时提出了两种记忆方法:AgentRunbook-R 和 AgentRunbook-C。

0 人收藏 0 人点赞
#web-agents

@AdinaYakup: Qwen 发布了 WebWorld,一个用于 Web Agent 的开放世界模型系列(8B/14B/32B),附带数据集,采用 Apache 2.0 许可证,在 MiniWob++ 上提升 9.9%,在 W…

X AI KOLs Following · 2026-05-11 缓存

Qwen 发布了 WebWorld,这是一个用于 Web Agent 的开源模型系列(8B/14B/32B),采用 Apache 2.0 许可证,在 MiniWob++ 和 WebArena 基准测试中提升了性能。

0 人收藏 0 人点赞
#web-agents

Weblica:用于视觉 Web 智能体的可扩展且可复现的训练环境

arXiv cs.AI · 2026-05-11 缓存

Apple Research 推出了 Weblica,这是一个利用 HTTP 缓存和基于大语言模型(LLM)的合成技术,为视觉 Web 智能体创建可扩展且可复现训练环境的框架。

0 人收藏 0 人点赞
#web-agents

Region4Web:重新思考网络智能体的观测空间粒度

arXiv cs.CL · 2026-05-11 缓存

本文介绍了 Region4Web 框架,该框架通过将观测空间组织成功能区域而非单个元素,从而提升了网络智能体的性能。研究表明,这种方法在 WebArena 基准测试上缩短了观测长度并提高了任务成功率。

0 人收藏 0 人点赞
#web-agents

哪里出了问题?基于语义状态追踪的网页代理过程级评估

Hugging Face Daily Papers · 2026-04-08 缓存

本文介绍了WebStep,一个基于语义状态追踪的网页代理过程级评估基准和框架。它揭示了超越最终成功指标的详细性能差异和错误定位。

0 人收藏 0 人点赞
#web-agents

WebShaper:基于信息搜寻形式化的代理式数据合成

Papers with Code Trending · 2025-07-20 缓存

WebShaper 是一个形式化驱动的框架,利用集合论和知识投影(Knowledge Projections)合成信息搜寻数据集,在 GAIA 和 WebWalkerQA 基准测试中,其开源代理达到了最先进的性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈