标签
AI初创公司Hark推出Handoff,这是一款可自主浏览网页的计算机使用代理,声称在基准测试中得分领先,并表示其token价格远低于前沿模型。
StepGuard 提出了一个结合动态双策略优化(DDPO)和置信引导自适应导航反思(CANR)的框架,以解决网页导航智能体中的奖励不对齐和错误传播问题,实现了最先进的性能。
WebChallenger是一个新的Web智能体框架,通过架构设计而非模型规模来复现人类认知优势,使用开放权重模型无需微调即可在多个基准测试中取得出色性能。
本文提出了一种多智能体计算机使用 (MACU) 系统,该系统使用管理者模型将任务分解为有向无环图,供子智能体并行执行。在多个基准测试上,它相比单智能体基线有一致的改进,并展现出更好的测试时扩展能力。
本文介绍了GTA,一个可扩展的框架,用于自动生成具有可执行轨迹的长时域、多跳Web智能体任务,解决了Web智能体基准测试中缺乏过程级监督的问题。该框架集成了爬取、基于检索的种子生成和自动质量控制,以在多个网站上产生现实的任务。
StableBrowse 是一种新的AI代理浏览器层,通过将网站转换为可重用的执行图,将令牌使用量减少70%,执行速度提升3-4倍。
作者描述了观察一个AI代理自主完成竞争情报工作流程的过程,该流程通常需要4小时,而它在18分钟内完成,突出了它浏览网站、处理PDF和迭代搜索的能力,暗示着从简单聊天机器人向自主执行的转变。
MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。
本文解释了Manus的Browser Operator如何通过在用户授权的本地浏览器会话中运行,使其能够访问超出典型AI搜索能力的订阅和认证内容,并提供了启用和使用它的逐步指南。
普渡大学研究团队推出 Mango,一种多智能体网页导航系统,利用全局站点结构和汤普森采样选择最优起始 URL,在 WebVoyager 和 WebWalkerQA 基准测试中显著提升成功率。
# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,
OpenAI 与 Be My Eyes 合作使用 GPT-4 实现视觉无障碍,使盲人和低视力用户能够通过智能摘要和实时指导来浏览网站、电商平台和物理空间。该系统利用 GPT-4 的视觉能力来识别重要内容,并提供模拟视力正常用户自然浏览信息方式的上下文协助。