UI-Mate:通过上下文演示推进开放权重基础GUI代理

Hugging Face Daily Papers 论文

摘要

UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。

基础GUI代理可以自动化复杂的数字任务,但部署受到稀缺和偏置的训练数据、模糊提示和不可靠执行的阻碍。日常工作流程依赖于用户特定的工具和隐含约定,因此未明确的指令可能导致运行间的任意差异。我们提出UI-Mate,一个集成环境接地训练栈和上下文演示学习的基础GUI代理。UI-Mate做出三项贡献:可扩展的环境接地训练栈:一个闭环数据引擎通过统一的任务-验证器捆绑包,在大规模并行环境中自动化任务生成、环境构建、滚动、过滤、能力平衡、SFT和在线RL。上下文演示学习:一种机制将多模态演示转化为灵活的子任务级工作流程,遵循相关的演示步骤,并从实时界面重新规划。OSWorkerBench基准测试和见解:一个包含100个跨41个应用程序的长期办公任务的基准测试,支持仅指令和演示指导评估。其演示资源将33个自演示设置(基于相同目标的成功强代理滚动构建)与45个变体演示设置(基于相关但非相同任务的人类记录构建)分开。实验表明,UI-Mate-27B在通用计算机使用基准测试中设定了新的开放权重最先进水平,在OSWorld-Verified上得分为77.0%,在WindowsAgentArena上得分为66.2%。在OSWorkerBench上,它达到了41.0%的严格成功率和76.9%的进展,分别比其基础模型Qwen3.6-27B高出17.7和24.5个百分点。在33个任务的自演示子集中,一个演示将严格成功率从17.2%提高到35.4%,进展从67.9%提高到81.1%,显著提高了长期可靠性。项目页面:https://ui-mate.github.io.
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:50

论文页面 - UI-Mate:通过上下文演示推进开放权重基础GUI智能体

来源:https://huggingface.co/papers/2608.15930 发布于 8月16日

·

由 https://huggingface.co/lkeab 提交

Lei Ke (https://huggingface.co/lkeab) 于 8月18日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

UI-Mate 是一种基础 GUI 智能体,它使用基于环境的训练和上下文演示学习来提高长期办公任务的可靠性,在计算机使用基准测试中取得了最先进的成果。

基础 GUI 智能体 (https://huggingface.co/papers?q=Foundation%20GUI%20agent) 可以自动化复杂的数字任务,但其部署受到稀缺且有偏的训练数据、模糊的提示和不可靠执行的阻碍。常规工作流依赖于用户特定的工具和默示的惯例,因此未说明的指令可能导致每次运行产生任意的差异。我们提出了 UI-Mate,一种基础 GUI 智能体 (https://huggingface.co/papers?q=foundation%20GUI%20agent),它在上下文演示学习 (https://huggingface.co/papers?q=in-context%20demonstration%20learning) 框架内集成了基于环境的训练 (https://huggingface.co/papers?q=environment-grounded%20training) 技术栈。UI-Mate 做出了三项贡献:一个可扩展的基于环境的训练 (https://huggingface.co/papers?q=Environment-Grounded%20Training) 技术栈:一个闭环数据引擎 (https://huggingface.co/papers?q=closed-loop%20data%20engine) 通过统一的任务验证器包 (https://huggingface.co/papers?q=task-verifier%20bundles),在海量并行环境中自动化任务生成、环境构建、执行、过滤、能力平衡、SFT (https://huggingface.co/papers?q=SFT) 和在线 RL (https://huggingface.co/papers?q=online%20RL)。上下文演示学习 (https://huggingface.co/papers?q=In-Context%20Demonstration%20Learning):一种将多模态演示 (https://huggingface.co/papers?q=multimodal%20demonstrations) 转化为灵活的子任务级工作流 (https://huggingface.co/papers?q=subtask-level%20workflows) 的机制,遵循相关的演示步骤,并根据实时界面重新规划。OSWorkerBench (https://huggingface.co/papers?q=OSWorkerBench) 基准与洞察:一个包含 41 个应用程序中 100 项长期办公任务的基准,支持仅指令和演示引导的评估。其演示资源将 33 项任务的自我演示 (https://huggingface.co/papers?q=self-demo) 设置(由针对相同目标的强大智能体的成功执行构建)与 45 项任务的变体演示 (https://huggingface.co/papers?q=variant-demo) 设置(由人类录制的相关但非完全相同任务构建)区分开来。实验表明,UI-Mate-27B 在通用计算机使用基准测试中设立了新的开放权重最先进水平,在 OSWorld-Verified (https://huggingface.co/papers?q=OSWorld-Verified) 上得分 77.0%,在 WindowsAgentArena (https://huggingface.co/papers?q=WindowsAgentArena) 上得分 66.2%。在 OSWorkerBench (https://huggingface.co/papers?q=OSWorkerBench) 上,它达到了 41.0% 的严格成功率和 76.9% 的进展率,分别比其基础模型 Qwen3.6-27B 提高了 17.7 和 24.5 个百分点。在 33 项任务的自我演示 (https://huggingface.co/papers?q=self-demo) 子集中,一个演示将严格成功率从 17.2% 提高到 35.4%,进展率从 67.9% 提高到 81.1%,显著提高了长期任务的可靠性。项目页面:https://ui-mate.github.io\。

查看 arXiv 页面 (https://arxiv.org/abs/2608.15930) 查看 PDF (https://arxiv.org/pdf/2608.15930) 项目页面 (https://ui-mate.github.io/) GitHub (https://github.com/Tencent/UI-Mate) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15930)

在您的智能体中获取此论文:

hf papers read 2608\.15930

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。

引用此论文的空间 0

无空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。

包含此论文的收藏 0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏

Hugging Face Daily Papers

本文提出UI-MOPD方法,将多教师在线策略蒸馏与持续学习相结合,用于跨平台训练GUI智能体,同时介绍了Uni-GUI数据集。该方法在OSWorld和MobileWorld上分别达到38.2%和12.0%的任务成功率,展示了有效的跨平台能力保持与适应。

UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理

Papers with Code Trending

UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。