标签
本文介绍了GUI-SD-v2,一个用于多轮GUI代理的两阶段在策略自蒸馏框架,该框架增强了特权跟随和指导能力,在AndroidWorld和MobileWorld基准测试中表现出色。
本文实证研究了基于LLM的GUI代理对数字助推的易感性,发现推理配置会重定向而非减少助推效应,将界面设计定位为自主AI的治理问题。
本文介绍了EvoSkill-GUI,一个无需训练的框架,允许GUI代理通过执行中的反思、修订和复用来改进技能,在多个基准测试中展示了无需重新训练的性能提升。
EchoPath 引入了一种模型无关的记忆系统,用于GUI代理,该系统重放经过验证的执行轨迹,显著降低了企业重复任务的token成本和执行时间。
LLaDA-UI是一个拥有16.7B参数的专家混合扩散视觉-语言智能体,通过块并行解码效率实现强大的多模态GUI性能,在基准测试中优于现有模型。
TRACE是一个免训练框架,通过基于效用和多样性对视觉证据进行排序来优化GUI代理效率,利用自适应令牌管理和KV收缩减少延迟和内存使用。
论文引入ConflictGUI,一个用于GUI代理冲突感知终止的基准,并提出ConflictGuard,一个推理时框架,旨在减少过度服从行为并提升在冲突指令下的性能。
本调研通过系统视角审视高效GUI代理,重点关注观察、记忆、动作和运行时优化,并识别关键重复出现的概念,如选择性阅读和混合运行时。
本文提出证据优先反思(EFR)方法,通过解耦动作引发的视觉差异提取与结果验证,以改进桌面GUI代理中的反思过程,在基准测试上实现7.11%的准确率提升。
本文提出了一种面向GUI代理的长度感知对比学习(LACL-GUI),这是一种对比强化学习框架,通过纳入轨迹级质量信号来解决奖励-梯度错位问题,从而提升代理性能。
本文介绍了AnTrap,一个评估Android GUI代理对运行时异常稳健性的基准测试,揭示了普遍漏洞,并区分了可学习的陷阱与内在推理限制。
UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。
CoAdapt-GUI is a test-time adaptation framework for mobile GUI agents that jointly adapts workflow context and policy, improving performance on unseen-app benchmarks like AndroidWorld-Generalization and AndroidWorld Plus.
Introduces AndroidReality, a perturbation-based framework for evaluating and improving the robustness of mobile agents, with a taxonomy of real-world interface perturbations and a training-free Test-Time Introspective Recovery (TTIR) mechanism.
This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.
FocusMem为GUI智能体引入了一种潜在记忆接口,将内容保留、状态条件读出和信任门控分离,以提高记忆可靠性。在五个GUI智能体基准测试中,它始终优于固定记忆基线。
This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。
本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。