MintAct: 数字环境的统一视觉代理
摘要
MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。
查看缓存全文
缓存时间: 2026/09/21 03:20
论文页面 - MintAct:用于数字环境的统一视觉智能体
来源:https://huggingface.co/papers/2609.22083 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出MintAct,这是一系列视觉语言模型,统一了UI定位、跨移动、桌面和网页的多步导航以及视觉工具使用功能,并在2B、4B和8B规模下进行了训练。通过对环境、数据和训练方案的精心设计,MintAct模型在所有这些能力上都达到了与特定领域专家模型相当的性能。为此,我们开发了一个可扩展的环境和强化学习(RL)基础设施。在环境方面,我们在异构的特定领域后端上托管了数百个并发实例,用于轨迹数据收集和在线RL训练。为实现高效且可扩展的RL训练,一个异步框架对跨域训练分布保持显式控制,并在嘈杂的环境反馈和离策略漂移下保持稳定。实验结果表明,MintAct在同等模型规模下,在广泛的基准测试中取得了最先进的性能(在OSWorld-Verified上达到48.9)。
查看arXiv页面 (https://arxiv.org/abs/2609.22083) 查看PDF (https://arxiv.org/pdf/2609.22083) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.22083)
在您的智能体中获取本文:
hf papers read 2609.22083
没有最新的CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用本文的模型0
暂无模型链接本文
在模型的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该模型。
引用本文的数据集0
暂无数据集链接本文
在数据集的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该数据集。
引用本文的Space0
暂无Space链接本文
在Space的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该Space。
包含本文的收藏0
暂无收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection),即可从此页面链接至该收藏。
相似文章
UI-Mate:通过上下文演示推进开放权重基础GUI代理
UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。
MIRAGE:具备隐式推理与生成式世界模型的移动智能体
MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。
MAI-UI技术报告:以现实世界为中心的基础GUI代理
MAI-UI技术报告介绍了一系列不同规模的基础GUI代理,通过自演进数据管道、设备云协作和在线强化学习来应对现实世界部署挑战,在GUI定位和移动导航基准测试上取得了最先进的结果。
MAG:用于多模态动作和指南生成的Web-Agent基准与框架
MAG引入了一个用于多模态Web代理的基准和框架,这些代理既执行任务又生成逐步指南文本,使用截图和接地方案。该工作包括一种GRPO训练方法,几乎将9B代理的成功率提高了一倍。
UI-Venus-2 技术报告
UI-Venus-2 是一个开源的多模态图形用户界面代理,旨在通过移动、网络和桌面环境实现数字化自动化。它采用统一的推理-行动循环与强大的验证机制,以支持可靠的实际应用。