MintAct: 数字环境的统一视觉代理

Hugging Face Daily Papers 论文

摘要

MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。

我们推出 MintAct,这是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,并以 2B、4B 和 8B 规模进行训练。通过精心设计我们的环境、数据和训练方案,MintAct 模型在所有这些能力上与领域专家相匹配。为了实现这一点,我们开发了一个可扩展的环境和强化学习(RL)基础设施。在环境方面,我们在异构的领域后端上托管了数百个并发实例,服务于轨迹数据收集和在线 RL。为了启用高效和可扩展的 RL 训练,一个异步框架保持了对跨领域训练分布的明确控制,并在噪声环境反馈和离策略漂移下保持稳定。实验结果表明,MintAct 在可比模型规模下,在广泛基准测试中取得了最先进的性能(在 OSWorld-Verified 上为 48.9)。
查看原文
查看缓存全文

缓存时间: 2026/09/21 03:20

论文页面 - MintAct:用于数字环境的统一视觉智能体

来源:https://huggingface.co/papers/2609.22083 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们推出MintAct,这是一系列视觉语言模型,统一了UI定位、跨移动、桌面和网页的多步导航以及视觉工具使用功能,并在2B、4B和8B规模下进行了训练。通过对环境、数据和训练方案的精心设计,MintAct模型在所有这些能力上都达到了与特定领域专家模型相当的性能。为此,我们开发了一个可扩展的环境和强化学习(RL)基础设施。在环境方面,我们在异构的特定领域后端上托管了数百个并发实例,用于轨迹数据收集和在线RL训练。为实现高效且可扩展的RL训练,一个异步框架对跨域训练分布保持显式控制,并在嘈杂的环境反馈和离策略漂移下保持稳定。实验结果表明,MintAct在同等模型规模下,在广泛的基准测试中取得了最先进的性能(在OSWorld-Verified上达到48.9)。

查看arXiv页面 (https://arxiv.org/abs/2609.22083) 查看PDF (https://arxiv.org/pdf/2609.22083) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.22083)

在您的智能体中获取本文:

hf papers read 2609.22083

没有最新的CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用本文的模型0

暂无模型链接本文

在模型的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该模型。

引用本文的数据集0

暂无数据集链接本文

在数据集的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该数据集。

引用本文的Space0

暂无Space链接本文

在Space的README.md中引用 arxiv.org/abs/2609.22083,即可从此页面链接至该Space。

包含本文的收藏0

暂无收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection),即可从此页面链接至该收藏。

相似文章

MIRAGE:具备隐式推理与生成式世界模型的移动智能体

arXiv cs.AI

MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。

MAI-UI技术报告:以现实世界为中心的基础GUI代理

Papers with Code Trending

MAI-UI技术报告介绍了一系列不同规模的基础GUI代理,通过自演进数据管道、设备云协作和在线强化学习来应对现实世界部署挑战,在GUI定位和移动导航基准测试上取得了最先进的结果。

UI-Venus-2 技术报告

Hugging Face Daily Papers

UI-Venus-2 是一个开源的多模态图形用户界面代理,旨在通过移动、网络和桌面环境实现数字化自动化。它采用统一的推理-行动循环与强大的验证机制,以支持可靠的实际应用。