UI-Venus-2 技术报告

Hugging Face Daily Papers 论文

摘要

UI-Venus-2 是一个开源的多模态图形用户界面代理,旨在通过移动、网络和桌面环境实现数字化自动化。它采用统一的推理-行动循环与强大的验证机制,以支持可靠的实际应用。

多模态图形用户界面代理已成为数字化任务自动化领域的一个有前景的研究方向,但要将面向基准的模型转化为可靠的实际应用仍面临诸多挑战,包括有限的环境覆盖、脆弱的任务构建以及不可靠的奖励验证。为此,我们推出了 UI-Venus-2,一个通用的基础图形用户界面代理。它通过一个统一的闭环推理-行动框架,旨在跨移动、网络和桌面环境运行。为弥合与实际部署之间的差距,我们共同扩展了三个关键维度:(1)环境:将覆盖范围扩展至超过 170 个多语言移动应用及原生桌面操作系统;(2)任务:采用基于深度研究的流程生成功能导向的指令;(3)验证:采用具有视觉关键点和多模型投票机制的追踪级与样本级评估器,以确保可靠的强化学习训练信号。此外,我们集成了安全感知机制,以确保对高风险行动进行受控执行。通过提供一个功能强大、高效且开源的基础平台,UI-Venus-2 推动了该领域向更通用、可验证且具备自我反思能力的代理发展,以适应实际应用需求。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:44

论文页面 - UI-Venus-2 技术报告

来源: https://huggingface.co/papers/2609.00028 发布于 2026年8月27日

#2 每日精选论文 (https://huggingface.co/papers/date/2026-09-02) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

UI-Venus-2 是一个通用的多模态图形界面智能体,它使用统一的推理-行动循环、扩展的环境覆盖范围以及鲁棒的验证机制,以实现可靠的现实世界数字自动化。

多模态图形界面智能体 (https://huggingface.co/papers?q=Multimodal%20GUI%20agents)已成为数字任务自动化领域一个极具前景的范式。然而,由于环境覆盖有限、任务构建脆弱以及奖励验证不可靠,从面向基准测试的模型过渡到可靠的现实世界应用仍然面临挑战。本文介绍了 UI-Venus-2,一个基础性的通用图形界面智能体,旨在通过一个统一的闭环推理-行动框架 (https://huggingface.co/papers?q=closed-loop%20reasoning-action%20framework) 跨移动、网络和桌面环境运行。为弥合与实际部署之间的差距,我们联合扩展了三个关键维度:(1) 环境,将覆盖范围扩展至超过170个多种语言的移动应用和原生桌面操作系统;(2) 任务,采用深度研究流水线进行基于功能的指令生成 (https://huggingface.co/papers?q=function-grounded%20instruction%20generation);(3) 验证,采用具有视觉关键点 (https://huggingface.co/papers?q=visual%20keypoints) 和多模型投票 (https://huggingface.co/papers?q=multi-model%20voting) 的轨迹级和样本级评估器 (https://huggingface.co/papers?q=sample-level%20evaluators),以确保训练信号 (https://huggingface.co/papers?q=RL%20signals) 的可靠性。此外,我们整合了安全感知机制 (https://huggingface.co/papers?q=safety-aware%20mechanisms) 以确保关键操作的可控执行。UI-Venus-2 作为一个强大、高效且开源的基础模型,推动该领域向着更通用、可验证且具备自我反思能力的现实世界应用智能体迈进。

查看arXiv页面 (https://arxiv.org/abs/2609.00028)查看PDF (https://arxiv.org/pdf/2609.00028)项目页面 (https://ui-venus.github.io/UI-Venus-2/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.00028)

在你的智能体中获取这篇论文:

hf papers read 2609\.00028

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

inclusionAI/UI-Venus-2-9B 图文转文本• 1.47万• 25分钟前更新 • 2.07千 • 20 (https://huggingface.co/inclusionAI/UI-Venus-2-9B)

引用本文的数据集1

inclusionAI/VenusBench-验证码查看器• 19分钟前更新 • 219 • 2 (https://huggingface.co/datasets/inclusionAI/VenusBench-CAPTCHA)

引用本文的空间1

包含本文的收藏集0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection)以从本页面链接它。

相似文章

UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理

Papers with Code Trending

UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。

MAI-UI技术报告:以现实世界为中心的基础GUI代理

Papers with Code Trending

MAI-UI技术报告介绍了一系列不同规模的基础GUI代理,通过自演进数据管道、设备云协作和在线强化学习来应对现实世界部署挑战,在GUI定位和移动导航基准测试上取得了最先进的结果。

Xiaomi-GUI-0 技术报告

Hugging Face Daily Papers

本技术报告介绍了Xiaomi-GUI-0,一个原生多模态GUI智能体,在真实设备环境中使用混合基础设施和渐进式训练管道进行训练和评估,在真实移动任务上实现了高成功率和改进的稳定性。