Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体

Hugging Face Daily Papers 论文

摘要

Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。

GUI 智能体有潜力成为现有数字设备上的通用执行器。为了推动它们走向真实世界应用,我们设想智能体能够在真实设备上可靠运行,跨平台执行工作流,将 GUI 交互与 CLI 执行相结合,完成长期任务,主动发起有用的服务,并在最少人工干预下自主提升自身能力。在这一愿景的指导下,我们推出 Qwen-UI-Agent,这是一个以真实世界为中心的基座 GUI 智能体,覆盖移动端、电脑操作、网页和 DeepSearch 环境。Qwen-UI-Agent 将多样化的沙盒环境与大规模真实设备移动运行时相结合。其统一的动作空间将 GUI 操作与 CLI 执行交织,并能在单次模型轮次中生成批量动作。一个 AutoResearch 风格的数据飞轮利用智能体构建任务和环境、诊断失败并规划后续迭代。在线 RL 支持对超过 100 轮次的轨迹进行训练,并有超过 10000 个并发环境加速 rollout。一个轻量级编排层支持在移动端和电脑上主动发起服务和有状态工作流。 在广泛的评估中,Qwen-UI-Agent 在移动端使用基准上取得了最先进的性能,同时在与前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)的电脑和浏览器使用任务中展现了具有竞争力的表现。在移动端使用方面,它在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。在电脑使用方面,它在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上获得 40.0% 的部分进度得分。在浏览器使用和 GUI 元素定位方面,它分别在 WebArena 上达到 73.6%,在 ScreenSpot-Pro 上达到 81.5%。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:52

论文页面 - Qwen-UI-Agent 技术报告:迈向下一代以真实世界为中心的基座 GUI 代理

来源:https://huggingface.co/papers/2607.28227 作者:

摘要

GUI 代理有潜力成为现有数字设备上的通用执行器。为了推动它们走向真实世界应用,我们设想这样的代理:能够在真实设备上可靠运行、跨平台执行工作流、将 GUI 交互与 CLI 执行相结合、完成长周期任务、主动发起有用服务,并以最少的人力投入自主提升能力。在这一愿景的指导下,我们提出了 Qwen-UI-Agent,一个以真实世界为中心的基座 GUI 代理,覆盖移动端、电脑操作、网页和 DeepSearch 环境。Qwen-UI-Agent 将多样化的沙盒环境与大规模真实设备移动运行时相结合。其统一动作空间将 GUI 操作与 CLI 执行交错融合,并在单次模型推理中生成批量动作。一个 AutoResearch 风格的数据飞轮利用代理来构建任务和环境、诊断失败并规划后续迭代。在线强化学习支持在超过 100 步的轨迹上进行训练,并借助超过 10,000 个并发环境加速采样。一个轻量级的 harness 层支持跨移动端和电脑端的主动服务发起与有状态工作流。在广泛的评测套件中,Qwen-UI-Agent 在移动端使用基准上取得了最先进的性能,同时在电脑端和浏览器使用任务上提供了与前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)相比具有竞争力的表现。在移动端使用方面,它在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。在电脑端使用方面,它在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上取得 40.0% 的部分进展分数。在浏览器使用和 GUI 接地方面,它在 WebArena 上达到 73.6%,在 ScreenSpot-Pro 上达到 81.5%。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28227) 查看 PDF (https://arxiv.org/pdf/2607.28227) 项目页面 (https://tongyi-mai.github.io/Qwen-UI-Agent/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28227)

在您的代理中获取此论文:

hf papers read 2607\.28227

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该 Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

Qwen3.7:智能代理前沿(15分钟阅读)

TLDR AI

阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。

Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。

Qwen-Image-Agent:弥合真实图像生成中的上下文差距

Hugging Face Daily Papers

Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。

Qwen3.7-Max:智能体前沿

Hacker News Top

Qwen3.7-Max 是一个专注于智能体能力的新 AI 模型发布,推动了自主 AI 智能体的边界。