gui-agents

标签

Cards List
#gui-agents

AndroidReality: How Far Are Mobile Agents from the Real World?

arXiv cs.AI · 昨天 缓存

Introduces AndroidReality, a perturbation-based framework for evaluating and improving the robustness of mobile agents, with a taxonomy of real-world interface perturbations and a training-free Test-Time Introspective Recovery (TTIR) mechanism.

0 人收藏 0 人点赞
#gui-agents

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

arXiv cs.AI · 2026-08-05 缓存

This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.

0 人收藏 0 人点赞
#gui-agents

FocusMem:潜在GUI记忆中的内容、读出与信任分解

Hugging Face Daily Papers · 2026-08-05 缓存

FocusMem为GUI智能体引入了一种潜在记忆接口,将内容保留、状态条件读出和信任门控分离,以提高记忆可靠性。在五个GUI智能体基准测试中,它始终优于固定记忆基线。

0 人收藏 0 人点赞
#gui-agents

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

arXiv cs.AI · 2026-08-03 缓存

This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.

0 人收藏 0 人点赞
#gui-agents

Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体

Hugging Face Daily Papers · 2026-07-30 缓存

Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。

0 人收藏 0 人点赞
#gui-agents

通过通用关键帧提取桥接VideoQA与视频引导的代理任务

Hugging Face Daily Papers · 2026-06-28 缓存

本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。

0 人收藏 0 人点赞
#gui-agents

结合自主评估的计算机操作代理强化学习

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。

0 人收藏 0 人点赞
#gui-agents

@omarsar0: // 自动化 SKILL.md 生成 // 越来越多的挖掘会话是提升智能体的最佳方式之一。打开…

X AI KOLs Following · 2026-06-19 缓存

这篇来自麻省理工学院和哈佛大学的论文探讨了通过挖掘 GUI 交互轨迹来自动化生成 SKILL.md,发现聚类结果可读性强,但未能提升跨领域的策略性能。

0 人收藏 0 人点赞
#gui-agents

VISUALSKILL:面向计算机使用智能体的多模态技能

arXiv cs.CL · 2026-06-18 缓存

VisualSkill 提出了一种层级化的多模态技能库,用于计算机使用智能体,结合文本与图像,通过在 GUI 交互中保留视觉信息,在 CUA 基准测试上相较于纯文本基线实现了 15.3 个百分点的绝对提升。

0 人收藏 0 人点赞
#gui-agents

面向GUI代理的技能引导连续蒸馏

arXiv cs.AI · 2026-06-18 缓存

该论文提出了技能引导连续蒸馏(SGCD),这是一个迭代式自我改进框架,利用技能引导策略在闭环执行过程中为偏离轨迹的状态生成监督信号,将OSWorld-Verified上GUI代理的成功率从约30%提升至超过50%。

0 人收藏 0 人点赞
#gui-agents

Teach-and-Repeat: 从移动屏幕演示中准确提取操作知识以赋能GUI代理

arXiv cs.AI · 2026-06-12 缓存

介绍了Teach VLM,一种从移动屏幕演示中提取逐步操作知识的模型,以及Teach-and-Repeat范式,该范式利用这些知识指导GUI代理,在新基准上实现了最先进的性能。

0 人收藏 0 人点赞
#gui-agents

MacArena:在在线macOS环境中对计算机使用代理进行基准测试

arXiv cs.LG · 2026-06-08 缓存

介绍了MacArena,这是一个包含50个应用程序中421项任务的基准测试,用于评估macOS上的计算机使用代理,强调现有基准测试可能无法捕捉macOS特有的挑战。

0 人收藏 0 人点赞
#gui-agents

StainFlow: GUI代理中基于实体污点追踪和证据关联的过程奖励机制

arXiv cs.AI · 2026-06-08 缓存

StainFlow为GUI代理引入了一种实体污点流过程奖励模型,通过全局实体污点追踪和局部证据关联来改进强化学习中的信用分配,在AndroidWorld上实现了3.2%的相对提升。

0 人收藏 0 人点赞
#gui-agents

DeskCraft:在专业工作流和人机协作中评估桌面代理的基准

arXiv cs.AI · 2026-06-03 缓存

DeskCraft 是一个新的基准,用于评估桌面GUI代理在长周期专业创意工作流中的表现,并纳入了人机协作协议。它通过需要超过50个步骤的设计、视频、音频和3D软件任务来测试代理。

0 人收藏 0 人点赞
#gui-agents

从策略错误中恢复:鲁棒GUI代理的基准测试与轨迹合成

Hugging Face Daily Papers · 2026-05-28 缓存

引入GUI-RobustEval(一个用于GUI代理错误恢复的基准)和鲁棒性驱动轨迹合成(RoTS)以生成训练数据,在OSWorld上达到当前最佳性能。

0 人收藏 0 人点赞
#gui-agents

AQuaUI:基于自适应四叉树的GUI代理视觉令牌减少方法

arXiv cs.AI · 2026-05-20 缓存

AQuaUI是一种无需训练、推理时即用的GUI代理模型令牌减少方法,利用自适应四叉树降低截图中的空间冗余,实现了高达13.22%的加速和29.52%的视觉令牌减少,同时保留了99.06%的性能。

0 人收藏 0 人点赞
#gui-agents

MementoGUI:学习智能体多模态记忆控制以支持长时域GUI代理

Hugging Face Daily Papers · 2026-05-18 缓存

MementoGUI 提出了一种用于 GUI 代理的插件式智能体记忆框架,该框架使用学习到的控制器进行选择性记忆管理与检索,通过压缩的视觉与文本表示提升了长期任务的性能。

0 人收藏 0 人点赞
#gui-agents

Video2GUI:合成大规模交互轨迹以进行通用GUI智能体预训练

arXiv cs.CL · 2026-05-15 缓存

提出了Video2GUI,一个从无标签教学视频中自动提取GUI交互轨迹的框架,构建了包含12M条轨迹、覆盖1500+应用的WildGUI数据集。在该数据上进行预训练,在GUI定位和动作基准测试上提升了5-20%。

0 人收藏 0 人点赞
#gui-agents

WebHarbor - 我们将真实网站“对接”到本地,供网页代理使用![R]

Reddit r/MachineLearning · 2026-05-14

WebHarbor 将 15 个真实网站(Amazon、GitHub、BBC 等)打包为自包含的 Flask+SQLite 应用,置于单个 Docker 镜像中,支持亚秒级重置,专为可重复的网页智能体评估与训练而设计。该项目邀请社区贡献,以扩展到 100 多个网站,并提供合著机会。

0 人收藏 0 人点赞
#gui-agents

ClawGUI:用于训练、评估和部署 GUI Agent 的统一框架

Papers with Code Trending · 2026-04-13 缓存

ClawGUI 是一个开源框架,用于通过强化学习训练、评估和部署 GUI Agent,具备标准化基准测试能力,并支持跨平台部署至 Android、iOS 和 HarmonyOS。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈