web-agents

标签

Cards List
#web-agents

你真正想训练浏览器代理模型擅长什么?

Reddit r/AI_Agents · 2天前

本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。

0 人收藏 0 人点赞
#web-agents

@yoheinakajima: 智能体就绪检查

X AI KOLs Following · 3天前 缓存

AgentJourney 是一款免费工具,它通过在网站上运行意图来测试 AI 智能体如何与产品交互,提供有关其旅程、token 使用情况和定价的实时洞察。

0 人收藏 0 人点赞
#web-agents

@browser_use: Browser Use CLI 将代理转变为 SOTA 网络代理

X AI KOLs Following · 6天前 缓存

Browser Use CLI 是一款浏览器工具,使AI代理能够通过脚本运行完整的网页浏览工作流,提高效率并降低网络任务的成本。

0 人收藏 0 人点赞
#web-agents

@browser_use:规模化可靠网络代理的时代已经到来。

X AI KOLs Timeline · 2026-08-07 缓存

Browser Use Cloud v4 推出了一个网络代理平台,号称能够解决准确性和成本限制,使得规模化可靠网络代理成为可能,并提供 15 美元免费额度供试用。

0 人收藏 0 人点赞
#web-agents

@ms_aifrontiers:今天我们将介绍Web Skill Factory:一个将已解决的网络任务转化为可复用、已验证代码的流水线。大多数智…

X AI KOLs Following · 2026-08-04 缓存

Microsoft AI Frontiers推出了Web Skill Factory,这是一个将已解决的网络任务转换为可复用、已验证代码程序的流水线。在WebArena子集上使用gpt-5.4重用该库,将保留实例的准确率从55%提升至70%,并将平均步骤从17.1减少到14.7。

0 人收藏 0 人点赞
#web-agents

PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

arXiv cs.AI · 2026-07-24 缓存

PersonaTrail 是一个用于个性化网络代理的基准测试,它利用真实的浏览轨迹来评估代理推断用户偏好和回忆过去信息的能力。该论文还提出了 PACMem,一个在两项任务上都优于现有基线方法的内存框架。

0 人收藏 0 人点赞
#web-agents

实际构建智能体基础设施所需的条件(18分钟阅读)

TLDR AI · 2026-07-22 缓存

本文剖析了运行生产级网络智能体所需的五层基础设施(不仅仅是浏览器),涵盖热池(warm pools)、隔离(isolation)、身份(identity)、可观测性(observability)和模型网关(model gateways),并讨论了何时适合自建而非购买。

0 人收藏 0 人点赞
#web-agents

DeepSearch-World:可验证环境中深度搜索代理的自我蒸馏

arXiv cs.CL · 2026-07-10 缓存

DeepSearch-Evolve 引入了一个用于 Web 代理的自我蒸馏框架,该框架使用可验证环境(DeepSearch-World)和 420K 多跳问答任务,无需从更强模型蒸馏即可实现有竞争力的性能。

0 人收藏 0 人点赞
#web-agents

Ko-WideSearch:用于Web智能体穷举集合枚举的韩语广度搜索基准

arXiv cs.CL · 2026-06-29 缓存

介绍了Ko-WideSearch,这是一个用于Web智能体的韩语广度搜索基准,在228个表格上评估穷举集合枚举能力。结果表明,智能体的项目召回率较高,但在行完成上存在困难,尤其是开放式的单元格。

0 人收藏 0 人点赞
#web-agents

@dair_ai: 如果你在构建 Web 代理,这篇关于如何让代理技能可复用的文章值得你花时间阅读。(收藏它)LLM web…

X AI KOLs Following · 2026-06-18 缓存

本文介绍了 SkillMigrator,一个 LLM Web 代理,它通过匹配布局结构而非领域特定元数据来学习可复用技能并在网站间迁移这些技能,在 WebArena 和 Mind2Web 基准测试中将 LLM 操作次数减少了 8-10%。

0 人收藏 0 人点赞
#web-agents

超越域名:通过可迁移交互模式复用网页技能

arXiv cs.AI · 2026-06-17 缓存

本文介绍了SkillMigrator——一个能够学习可复用网页技能(作为可迁移交互模式,TIP)的代理,它通过匹配布局结构在不同网站间迁移技能,在基准测试中将LLM动作次数减少8-10%。

0 人收藏 0 人点赞
#web-agents

@rsalakhu: 恭喜 @browser_use 团队在 Odysseys(一项极具挑战性的长周期 Web 智能体基准测试)中夺得第一名…

X AI KOLs Following · 2026-06-16 缓存

browser_use 团队在 Odysseys 基准测试中夺得第一名,这是一项针对长周期 Web 智能体的挑战性评估,其性能超越了 Opus 4.6 和 GPT-5.4 等模型。

0 人收藏 0 人点赞
#web-agents

在线技能与记忆模块是否总是值得其令牌消耗?一项关于网络代理的预算受限研究

arXiv cs.CL · 2026-06-16 缓存

本文研究了在固定推理预算下,网络代理的在线技能和记忆模块是否值得其令牌成本,发现预算匹配的朴素基线方法在三个领域和模型上通常与增强方法性能相当或更优。

0 人收藏 0 人点赞
#web-agents

电商欺骗性界面下的Web Agent安全性基准测试

arXiv cs.CL · 2026-06-15 缓存

本文介绍了WebDecept,一个用于将欺骗性界面模式注入到Web环境中以评估自主Web Agent安全性的框架。实验表明,当前的Agent极易受到此类操纵,突显了实际部署中的安全性挑战。

0 人收藏 0 人点赞
#web-agents

长时域Web代理的信号驱动观测

arXiv cs.CL · 2026-06-08 缓存

论文提出信号驱动观测(SDO)方法,使Web代理避免上下文退化,仅读取DOM中与任务相关的部分,并仅在特定信号触发时重新调用观测,而不是在每个动作步骤读取完整页面状态。

0 人收藏 0 人点赞
#web-agents

AsyncWebRL:面向视觉Web代理的高效多步强化学习

arXiv cs.LG · 2026-06-05 缓存

AsyncWebRL提出了一种异步多步强化学习系统,用于视觉语言Web代理,通过用常数替换每条轨迹的归一化项以减少轨迹长度低效问题,实现了高达2.9倍的训练加速,并在WebGym上取得了新的最优结果。

0 人收藏 0 人点赞
#web-agents

SlimSearcher:通过自适应奖励门控训练效率感知的网络代理

Hugging Face Daily Papers · 2026-06-05 缓存

SlimSearcher 是一个框架,通过结合帕累托高效轨迹过滤和自适应奖励塑形,提升深度研究代理的效率,在 GAIA、BrowseComp 和 XBenchDeepSearch 等基准测试中,将工具调用轮次减少 17%-58%,同时保持准确率。

0 人收藏 0 人点赞
#web-agents

基于状态感知动态检索的Web智能体在线技能学习

arXiv cs.AI · 2026-06-04 缓存

本文提出了SGDR(State-Grounded Dynamic Retrieval,状态感知动态检索),一种面向Web智能体的在线技能学习方法,支持逐步、感知当前状态的技能复用,而非静态的任务级检索。在WebArena上的实验表明,SGDR结合GPT-4.1可达到37.5%的成功率,相较于强基线取得了约10.6%的相对提升。

0 人收藏 0 人点赞
#web-agents

学习适应:基于认知感知探索的自我改进网络智能体

arXiv cs.AI · 2026-06-01 缓存

提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。

0 人收藏 0 人点赞
#web-agents

OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习

Hugging Face Daily Papers · 2026-06-01 缓存

OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈