UI-Venus-2 技术报告
摘要
UI-Venus-2 是一个开源的多模态图形用户界面代理,旨在通过移动、网络和桌面环境实现数字化自动化。它采用统一的推理-行动循环与强大的验证机制,以支持可靠的实际应用。
查看缓存全文
缓存时间: 2026/09/02 03:44
论文页面 - UI-Venus-2 技术报告
来源: https://huggingface.co/papers/2609.00028 发布于 2026年8月27日
#2 每日精选论文 (https://huggingface.co/papers/date/2026-09-02) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
UI-Venus-2 是一个通用的多模态图形界面智能体,它使用统一的推理-行动循环、扩展的环境覆盖范围以及鲁棒的验证机制,以实现可靠的现实世界数字自动化。
多模态图形界面智能体 (https://huggingface.co/papers?q=Multimodal%20GUI%20agents)已成为数字任务自动化领域一个极具前景的范式。然而,由于环境覆盖有限、任务构建脆弱以及奖励验证不可靠,从面向基准测试的模型过渡到可靠的现实世界应用仍然面临挑战。本文介绍了 UI-Venus-2,一个基础性的通用图形界面智能体,旨在通过一个统一的闭环推理-行动框架 (https://huggingface.co/papers?q=closed-loop%20reasoning-action%20framework) 跨移动、网络和桌面环境运行。为弥合与实际部署之间的差距,我们联合扩展了三个关键维度:(1) 环境,将覆盖范围扩展至超过170个多种语言的移动应用和原生桌面操作系统;(2) 任务,采用深度研究流水线进行基于功能的指令生成 (https://huggingface.co/papers?q=function-grounded%20instruction%20generation);(3) 验证,采用具有视觉关键点 (https://huggingface.co/papers?q=visual%20keypoints) 和多模型投票 (https://huggingface.co/papers?q=multi-model%20voting) 的轨迹级和样本级评估器 (https://huggingface.co/papers?q=sample-level%20evaluators),以确保训练信号 (https://huggingface.co/papers?q=RL%20signals) 的可靠性。此外,我们整合了安全感知机制 (https://huggingface.co/papers?q=safety-aware%20mechanisms) 以确保关键操作的可控执行。UI-Venus-2 作为一个强大、高效且开源的基础模型,推动该领域向着更通用、可验证且具备自我反思能力的现实世界应用智能体迈进。
查看arXiv页面 (https://arxiv.org/abs/2609.00028)查看PDF (https://arxiv.org/pdf/2609.00028)项目页面 (https://ui-venus.github.io/UI-Venus-2/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.00028)
在你的智能体中获取这篇论文:
hf papers read 2609\.00028
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
inclusionAI/UI-Venus-2-9B 图文转文本• 1.47万• 25分钟前更新 • 2.07千 • 20 (https://huggingface.co/inclusionAI/UI-Venus-2-9B)
引用本文的数据集1
inclusionAI/VenusBench-验证码查看器• 19分钟前更新 • 219 • 2 (https://huggingface.co/datasets/inclusionAI/VenusBench-CAPTCHA)
引用本文的空间1
包含本文的收藏集0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection)以从本页面链接它。
相似文章
UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理
UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。
MAI-UI技术报告:以现实世界为中心的基础GUI代理
MAI-UI技术报告介绍了一系列不同规模的基础GUI代理,通过自演进数据管道、设备云协作和在线强化学习来应对现实世界部署挑战,在GUI定位和移动导航基准测试上取得了最先进的结果。
UI-Mate:通过上下文演示推进开放权重基础GUI代理
UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
Xiaomi-GUI-0 技术报告
本技术报告介绍了Xiaomi-GUI-0,一个原生多模态GUI智能体,在真实设备环境中使用混合基础设施和渐进式训练管道进行训练和评估,在真实移动任务上实现了高成功率和改进的稳定性。