Tencent/UI-Mate-27B · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

UI-Mate-27B 是腾讯推出的一个开放权重基础GUI代理,它使用实时截图和演示引导适应来执行长期计算机任务。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/18 08:35

tencent/UI-Mate-27B · Hugging Face

来源:https://huggingface.co/tencent/UI-Mate-27B

https://huggingface.co/tencent/UI-Mate-27B#ui-mate-advancing-open-weight-foundation-gui-agents-with-in-context-demonstrationsUI-Mate:通过上下文演示推进开源基础GUI智能体

展示一次工作流程。让智能体将其适应到当前任务中。

腾讯 HY Frontier · 多模态智能体团队

项目页面 (https://ui-mate.github.io/) · GitHub (https://github.com/Tencent/UI-Mate)

https://huggingface.co/tencent/UI-Mate-27B#overview概述

UI-Mate-27B 是一个开源的基础GUI智能体,用于跨应用程序和操作系统的长期工作。它观察实时截图,对可见状态进行推理,并生成结构化的键盘和鼠标操作以实现原生桌面交互。

UI-Mate 支持两种互补模式:

  • 通用计算机使用: 根据自然语言指令和实时截图执行任务。
  • 演示引导的计算机使用: 将从一次成功演示中提取的可复用工作流程调整到新任务。

演示被视为指导,而非固定的操作脚本。当内容、布局或应用程序状态发生变化时,模型会根据实时界面持续重新规划。

https://huggingface.co/tencent/UI-Mate-27B#model-details模型详情

  • 参数量: 27B
  • 基础模型: Qwen3.6-27B (https://huggingface.co/Qwen/Qwen3.6-27B)
  • 输入: 任务指令、截图、交互历史以及可选的演示上下文
  • 输出: 推理过程、简洁的操作描述和结构化的计算机使用工具调用
  • 动作空间: 鼠标、键盘、滚动、等待、用户交互和任务完成
  • 训练: 在可执行GUI环境中进行监督微调,然后进行在线强化学习
  • 许可证: Apache-2.0

UI-Mate 是一个智能体检查点,而不是独立的视觉聊天模型。我们建议使用来自UI-Mate仓库 (https://github.com/Tencent/UI-Mate) 的官方提示、响应解析器和交互框架。

https://huggingface.co/tencent/UI-Mate-27B#highlights亮点

  • 在Ubuntu和Windows基准测试中表现出强大的通用计算机使用性能。
  • 跨多个应用程序的长期任务执行能力。
  • 从演示中进行一次性程序学习。
  • 基于实时屏幕而非坐标重放。
  • 结构化操作兼容pyautogui
  • 提供OpenAI兼容的服务和客户端接口。

https://huggingface.co/tencent/UI-Mate-27B#evaluation评估

https://huggingface.co/tencent/UI-Mate-27B#instruction-only-execution仅指令执行

基准测试UI-Mate-27B
OSWorld-Verified · 平均分77.0
WindowsAgentArena · 平均分66.2
OSWorkerBench · 严格成功率41.00
OSWorkerBench · 进度76.86

https://huggingface.co/tencent/UI-Mate-27B#demonstration-guided-execution演示引导执行

评估集 · 指标仅指令+ 一次演示提升
OSWorkerBench-Subset (33) · 严格成功率17.1735.35+18.18 pp
OSWorkerBench-Subset (33) · 进度67.8581.14+13.29 pp
OSWorld-Subset (30) · 进度40.2765.75+25.48 pp
GameDev (10) · 平均分76.7681.15+4.39 pp

在GameDev上,演示引导还将平均轨迹长度从303.6步减少到253.1步。

结果在OSWorkerBench-Subset上是每个目标三次运行的平均值,其他地方是五次运行的平均值。评估详情和更新请参见项目页面 (https://ui-mate.github.io/)。

https://huggingface.co/tencent/UI-Mate-27B#quick-start快速开始

https://huggingface.co/tencent/UI-Mate-27B#1-serve-the-model-with-vllm1. 使用 vLLM 部署模型

vLLM 首次启动时会自动从 Hugging Face Hub 下载检查点。

pip install -U vllm openai pillow

vllm serve tencent/UI-Mate-27B \
    --trust-remote-code \
    --served-model-name UI_Mate \
    --port 8000 \
    --tensor-parallel-size 2 \
    --gpu-memory-utilization 0.85 \
    --mm-encoder-tp-mode data \
    --chat-template-content-format openai \
    --limit-mm-per-prompt '{"image":6,"video":0}'

默认智能体在上下文中保留五张截图。因此,服务器必须至少接受六张图像,因为最新的截图在最旧的截图被折叠之前到达。

确认端点公开了预期的模型名称:

curl -s http://127.0.0.1:8000/v1/models

https://huggingface.co/tencent/UI-Mate-27B#2-run-the-reference-examples2. 运行参考示例

git clone https://github.com/Tencent/UI-Mate.git
cd UI-Mate

python examples/run_agent.py \
    --base-url http://127.0.0.1:8000/v1

运行一个完整的录制轨迹:

python examples/run_agent.py \
    --replay \
    --base-url http://127.0.0.1:8000/v1

或提供你自己的截图:

python examples/run_agent.py \
    --image /path/to/screen.png \
    --instruction "将此电子表格导出为HTML并在Chrome中打开"

https://huggingface.co/tencent/UI-Mate-27B#3-use-the-python-agent3. 使用 Python 智能体

from agents.ui_mate_agent import UIMateAgent

agent = UIMateAgent(
    base_url="http://127.0.0.1:8000/v1",
    model="UI_Mate",
)

with open("screen.png", "rb") as f:
    response, actions = agent.predict(
        "在VS Code中安装autoDocstring扩展。",
        {"screenshot": f.read()},
    )

print(response)
print(actions)

# 在开始新任务前重置交互历史。
agent.reset()

模型在一个归一化的1000 × 1000坐标空间中进行推理。参考智能体会自动将预测的坐标重新缩放到原始截图分辨率。

https://huggingface.co/tencent/UI-Mate-27B#demonstration-guided-execution-1演示引导执行

UI-Mate 演示记录了每次键盘或指针操作前后的截图。然后,该轨迹将:

  1. 被归一化为一致的动作和帧表示;
  2. 用观察、意图、动作和验证证据进行标注;
  3. 被分割为具有完成标准的命名子任务;并在
  4. 在推理时作为当前子任务的紧凑工作流程注入。

实时截图在整个执行过程中始终具有权威性。有关演示录制和管理,请参见UI-Mate项目页面 (https://ui-mate.github.io/)。

https://huggingface.co/tencent/UI-Mate-27B#intended-use-and-limitations预期用途和限制

UI-Mate-27B 旨在用于受控桌面环境中基于截图的GUI智能体的研究和开发。

其行为可能受到应用程序版本、屏幕布局、显示缩放、延迟和意外UI状态的影响。基准性能并不能保证在任意环境中的可靠执行,并且该模型需要外部运行时来执行其预测的操作。

https://huggingface.co/tencent/UI-Mate-27B#safety安全

计算机使用智能体可能犯错、遇到提示注入或触发重大操作。

  • 优先使用隔离或一次性环境。
  • 避免无人值守、高风险或破坏性工作流程。
  • 在执行敏感操作前要求人工确认。
  • 监控交互轨迹并验证产生的应用程序状态。
  • 不要将模型报告的成功视为已实现预期结果的证明。

https://huggingface.co/tencent/UI-Mate-27B#license许可证

UI-Mate 在 Apache License 2.0 (https://www.apache.org/licenses/LICENSE-2.0) 下发布。第三方组件仍受其各自许可证的约束。详情请参见仓库LICENSE (https://github.com/Tencent/UI-Mate/blob/main/LICENSE)。

https://huggingface.co/tencent/UI-Mate-27B#citation引用

技术报告公开发布后,将更新引用详情。

@article{uimate2026,
  title   = {UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations},
  author  = {{Tencent HY Frontier Multimodal Agent Team}},
  journal = {arXiv preprint},
  year    = {2026}
}

相似文章

microsoft/Fara1.5-27B · Hugging Face

Reddit r/LocalLLaMA

微软发布了 Fara1.5-27B,这是一个 270 亿参数的多模态计算机使用代理,专为网页浏览器设计,基于 Qwen3.5-27B 微调,能够通过截图执行端到端的网页任务。

Xiaomi-GUI-0 技术报告

Hugging Face Daily Papers

本技术报告介绍了Xiaomi-GUI-0,一个原生多模态GUI智能体,在真实设备环境中使用混合基础设施和渐进式训练管道进行训练和评估,在真实移动任务上实现了高成功率和改进的稳定性。

UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理

Papers with Code Trending

UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。