Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
摘要
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
查看缓存全文
缓存时间: 2026/07/31 05:52
论文页面 - Qwen-UI-Agent 技术报告:迈向下一代以真实世界为中心的基座 GUI 代理
来源:https://huggingface.co/papers/2607.28227 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
GUI 代理有潜力成为现有数字设备上的通用执行器。为了推动它们走向真实世界应用,我们设想这样的代理:能够在真实设备上可靠运行、跨平台执行工作流、将 GUI 交互与 CLI 执行相结合、完成长周期任务、主动发起有用服务,并以最少的人力投入自主提升能力。在这一愿景的指导下,我们提出了 Qwen-UI-Agent,一个以真实世界为中心的基座 GUI 代理,覆盖移动端、电脑操作、网页和 DeepSearch 环境。Qwen-UI-Agent 将多样化的沙盒环境与大规模真实设备移动运行时相结合。其统一动作空间将 GUI 操作与 CLI 执行交错融合,并在单次模型推理中生成批量动作。一个 AutoResearch 风格的数据飞轮利用代理来构建任务和环境、诊断失败并规划后续迭代。在线强化学习支持在超过 100 步的轨迹上进行训练,并借助超过 10,000 个并发环境加速采样。一个轻量级的 harness 层支持跨移动端和电脑端的主动服务发起与有状态工作流。在广泛的评测套件中,Qwen-UI-Agent 在移动端使用基准上取得了最先进的性能,同时在电脑端和浏览器使用任务上提供了与前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)相比具有竞争力的表现。在移动端使用方面,它在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。在电脑端使用方面,它在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上取得 40.0% 的部分进展分数。在浏览器使用和 GUI 接地方面,它在 WebArena 上达到 73.6%,在 ScreenSpot-Pro 上达到 81.5%。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28227) 查看 PDF (https://arxiv.org/pdf/2607.28227) 项目页面 (https://tongyi-mai.github.io/Qwen-UI-Agent/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28227)
在您的代理中获取此论文:
hf papers read 2607\.28227
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28227,即可从此页面链接到该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
Qwen3.7-Plus:多模态智能体 (36分钟阅读)
Qwen3.7-Plus 是一个多模态智能体模型,统一了视觉与语言,实现图形界面与命令行界面的无缝交互,现可通过阿里云模型服务平台使用。
Qwen/Qwen-AgentWorld-35B-A3B
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
Qwen-Image-Agent:弥合真实图像生成中的上下文差距
Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。
Qwen3.7-Max:智能体前沿
Qwen3.7-Max 是一个专注于智能体能力的新 AI 模型发布,推动了自主 AI 智能体的边界。