gui-agents

标签

Cards List
#gui-agents

从自身交互中学习行动:GUI代理的在策略自蒸馏

arXiv cs.AI ↗ · 2026-09-24 缓存

本文介绍了GUI-SD-v2,一个用于多轮GUI代理的两阶段在策略自蒸馏框架,该框架增强了特权跟随和指导能力,在AndroidWorld和MobileWorld基准测试中表现出色。

0 人收藏 0 人点赞
#gui-agents

基于LLM的GUI代理中助推易感性的双过程视角

arXiv cs.AI ↗ · 2026-09-18 缓存

本文实证研究了基于LLM的GUI代理对数字助推的易感性,发现推理配置会重定向而非减少助推效应,将界面设计定位为自主AI的治理问题。

0 人收藏 0 人点赞
#gui-agents

反思、修订、复用:面向GUI代理的无需训练技能进化

arXiv cs.LG ↗ · 2026-09-17 缓存

本文介绍了EvoSkill-GUI,一个无需训练的框架,允许GUI代理通过执行中的反思、修订和复用来改进技能,在多个基准测试中展示了无需重新训练的性能提升。

0 人收藏 0 人点赞
#gui-agents

EchoPath:GUI代理的执行级可重放记忆系统

arXiv cs.AI ↗ · 2026-09-16 缓存

EchoPath 引入了一种模型无关的记忆系统,用于GUI代理,该系统重放经过验证的执行轨迹,显著降低了企业重复任务的token成本和执行时间。

0 人收藏 0 人点赞
#gui-agents

LLaDA-UI:将块级扩散引入视觉-语言GUI智能体

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

LLaDA-UI是一个拥有16.7B参数的专家混合扩散视觉-语言智能体,通过块并行解码效率实现强大的多模态GUI性能,在基准测试中优于现有模型。

0 人收藏 0 人点赞
#gui-agents

TRACE: 面向高效GUI代理的轨迹稳健准入与证据排序

Hugging Face Daily Papers ↗ · 2026-09-09 缓存

TRACE是一个免训练框架,通过基于效用和多样性对视觉证据进行排序来优化GUI代理效率,利用自适应令牌管理和KV收缩减少延迟和内存使用。

0 人收藏 0 人点赞
#gui-agents

GUI代理是否知晓何时不应行动?实现多模态GUI代理的冲突感知终止

arXiv cs.AI ↗ · 2026-09-04 缓存

论文引入ConflictGUI,一个用于GUI代理冲突感知终止的基准,并提出ConflictGuard,一个推理时框架,旨在减少过度服从行为并提升在冲突指令下的性能。

0 人收藏 0 人点赞
#gui-agents

高效GUI代理:观察、记忆、动作与运行时优化的系统调研

arXiv cs.CL ↗ · 2026-09-03 缓存

本调研通过系统视角审视高效GUI代理,重点关注观察、记忆、动作和运行时优化,并识别关键重复出现的概念,如选择性阅读和混合运行时。

0 人收藏 0 人点赞
#gui-agents

基于动作引发视觉差异的桌面GUI代理反思方法

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出证据优先反思(EFR)方法,通过解耦动作引发的视觉差异提取与结果验证,以改进桌面GUI代理中的反思过程,在基准测试上实现7.11%的准确率提升。

0 人收藏 0 人点赞
#gui-agents

超越成功与失败:面向GUI代理的长度感知对比学习

arXiv cs.AI ↗ · 2026-08-25 缓存

本文提出了一种面向GUI代理的长度感知对比学习(LACL-GUI),这是一种对比强化学习框架,通过纳入轨迹级质量信号来解决奖励-梯度错位问题,从而提升代理性能。

0 人收藏 0 人点赞
#gui-agents

Android GUI代理能抵御运行时异常吗?AnTrap:在动态对抗环境中评估代理

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

本文介绍了AnTrap,一个评估Android GUI代理对运行时异常稳健性的基准测试,揭示了普遍漏洞,并区分了可学习的陷阱与内在推理限制。

0 人收藏 0 人点赞
#gui-agents

UI-Mate:通过上下文演示推进开放权重基础GUI代理

Hugging Face Daily Papers ↗ · 2026-08-16 缓存

UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。

0 人收藏 0 人点赞
#gui-agents

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

arXiv cs.AI ↗ · 2026-08-13 缓存

CoAdapt-GUI is a test-time adaptation framework for mobile GUI agents that jointly adapts workflow context and policy, improving performance on unseen-app benchmarks like AndroidWorld-Generalization and AndroidWorld Plus.

0 人收藏 0 人点赞
#gui-agents

AndroidReality: How Far Are Mobile Agents from the Real World?

arXiv cs.AI ↗ · 2026-08-11 缓存

Introduces AndroidReality, a perturbation-based framework for evaluating and improving the robustness of mobile agents, with a taxonomy of real-world interface perturbations and a training-free Test-Time Introspective Recovery (TTIR) mechanism.

0 人收藏 0 人点赞
#gui-agents

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

arXiv cs.AI ↗ · 2026-08-05 缓存

This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.

0 人收藏 0 人点赞
#gui-agents

FocusMem:潜在GUI记忆中的内容、读出与信任分解

Hugging Face Daily Papers ↗ · 2026-08-05 缓存

FocusMem为GUI智能体引入了一种潜在记忆接口,将内容保留、状态条件读出和信任门控分离,以提高记忆可靠性。在五个GUI智能体基准测试中,它始终优于固定记忆基线。

0 人收藏 0 人点赞
#gui-agents

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

arXiv cs.AI ↗ · 2026-08-03 缓存

This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.

0 人收藏 0 人点赞
#gui-agents

Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。

0 人收藏 0 人点赞
#gui-agents

通过通用关键帧提取桥接VideoQA与视频引导的代理任务

Hugging Face Daily Papers ↗ · 2026-06-28 缓存

本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。

0 人收藏 0 人点赞
#gui-agents

结合自主评估的计算机操作代理强化学习

arXiv cs.AI ↗ · 2026-06-24 缓存

本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈