UI-Mate:通过上下文演示推进开放权重基础GUI代理
摘要
UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。
查看缓存全文
缓存时间: 2026/08/18 03:50
论文页面 - UI-Mate:通过上下文演示推进开放权重基础GUI智能体
来源:https://huggingface.co/papers/2608.15930 发布于 8月16日
·
由 https://huggingface.co/lkeab 提交
Lei Ke (https://huggingface.co/lkeab) 于 8月18日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
UI-Mate 是一种基础 GUI 智能体,它使用基于环境的训练和上下文演示学习来提高长期办公任务的可靠性,在计算机使用基准测试中取得了最先进的成果。
基础 GUI 智能体 (https://huggingface.co/papers?q=Foundation%20GUI%20agent) 可以自动化复杂的数字任务,但其部署受到稀缺且有偏的训练数据、模糊的提示和不可靠执行的阻碍。常规工作流依赖于用户特定的工具和默示的惯例,因此未说明的指令可能导致每次运行产生任意的差异。我们提出了 UI-Mate,一种基础 GUI 智能体 (https://huggingface.co/papers?q=foundation%20GUI%20agent),它在上下文演示学习 (https://huggingface.co/papers?q=in-context%20demonstration%20learning) 框架内集成了基于环境的训练 (https://huggingface.co/papers?q=environment-grounded%20training) 技术栈。UI-Mate 做出了三项贡献:一个可扩展的基于环境的训练 (https://huggingface.co/papers?q=Environment-Grounded%20Training) 技术栈:一个闭环数据引擎 (https://huggingface.co/papers?q=closed-loop%20data%20engine) 通过统一的任务验证器包 (https://huggingface.co/papers?q=task-verifier%20bundles),在海量并行环境中自动化任务生成、环境构建、执行、过滤、能力平衡、SFT (https://huggingface.co/papers?q=SFT) 和在线 RL (https://huggingface.co/papers?q=online%20RL)。上下文演示学习 (https://huggingface.co/papers?q=In-Context%20Demonstration%20Learning):一种将多模态演示 (https://huggingface.co/papers?q=multimodal%20demonstrations) 转化为灵活的子任务级工作流 (https://huggingface.co/papers?q=subtask-level%20workflows) 的机制,遵循相关的演示步骤,并根据实时界面重新规划。OSWorkerBench (https://huggingface.co/papers?q=OSWorkerBench) 基准与洞察:一个包含 41 个应用程序中 100 项长期办公任务的基准,支持仅指令和演示引导的评估。其演示资源将 33 项任务的自我演示 (https://huggingface.co/papers?q=self-demo) 设置(由针对相同目标的强大智能体的成功执行构建)与 45 项任务的变体演示 (https://huggingface.co/papers?q=variant-demo) 设置(由人类录制的相关但非完全相同任务构建)区分开来。实验表明,UI-Mate-27B 在通用计算机使用基准测试中设立了新的开放权重最先进水平,在 OSWorld-Verified (https://huggingface.co/papers?q=OSWorld-Verified) 上得分 77.0%,在 WindowsAgentArena (https://huggingface.co/papers?q=WindowsAgentArena) 上得分 66.2%。在 OSWorkerBench (https://huggingface.co/papers?q=OSWorkerBench) 上,它达到了 41.0% 的严格成功率和 76.9% 的进展率,分别比其基础模型 Qwen3.6-27B 提高了 17.7 和 24.5 个百分点。在 33 项任务的自我演示 (https://huggingface.co/papers?q=self-demo) 子集中,一个演示将严格成功率从 17.2% 提高到 35.4%,进展率从 67.9% 提高到 81.1%,显著提高了长期任务的可靠性。项目页面:https://ui-mate.github.io\。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15930) 查看 PDF (https://arxiv.org/pdf/2608.15930) 项目页面 (https://ui-mate.github.io/) GitHub (https://github.com/Tencent/UI-Mate) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15930)
在您的智能体中获取此论文:
hf papers read 2608\.15930
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。
引用此论文的空间 0
无空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2608.15930 以从此页面链接。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏
本文提出UI-MOPD方法,将多教师在线策略蒸馏与持续学习相结合,用于跨平台训练GUI智能体,同时介绍了Uni-GUI数据集。该方法在OSWorld和MobileWorld上分别达到38.2%和12.0%的任务成功率,展示了有效的跨平台能力保持与适应。
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理
UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。
MemGUI-Agent:一种具有主动上下文管理的端到端长周期移动GUI智能体
MemGUI-Agent 引入了针对长周期移动GUI任务的主动上下文管理,利用上下文即动作(ConAct)来维护关键信息。它包含 MemGUI-3K 数据集,并使用一个 80 亿参数的模型在 MemGUI-Bench 和 MobileWorld 基准测试上达到了最先进的性能。
GUICrafter:弱监督GUI智能体,利用海量未标注截图
GUICrafter提出了一种弱监督GUI智能体,利用海量未标注截图和两阶段课程学习框架,减少对昂贵人工标注的依赖,仅用UI-TARS系统0.1%的数据即达到了与之竞争的性能。