MAG:用于多模态动作和指南生成的Web-Agent基准与框架
摘要
MAG引入了一个用于多模态Web代理的基准和框架,这些代理既执行任务又生成逐步指南文本,使用截图和接地方案。该工作包括一种GRPO训练方法,几乎将9B代理的成功率提高了一倍。
查看缓存全文
缓存时间: 2026/07/14 04:18
# MAG:用于多模态动作与引导生成的网络智能体基准与框架
来源:https://arxiv.org/html/2607.10079
韩俊伟² 云浩梁² 志希蔡³ 庆浩张⁴ 世文倪⁵
¹独立研究者 ²中国科学院大学 ³蒙纳士大学 ⁴釜山大学 ⁵深圳大学先进技术研究院
{weihanjun23, liangyunhao22}@mails.ucas.ac.cn, [email protected], [email protected], [email protected]
###### 摘要
数字采纳平台(DAP)是广泛嵌入在网页系统中的覆盖层,用于引导用户在页面内进行操作,帮助用户快速熟悉不熟悉的界面。然而,完成一个真实任务很少只是点击单个页面上的几个按钮:它需要一系列操作,这些操作在不同页面状态间展开。先前的研究也将自动化的网络智能体动作与引导文本生成视为两个分离的问题,并且大多数研究给模型提供文本化的页面表示(如DOM或无障碍树),而不是人类实际操作的渲染屏幕。在本工作中,我们引入了 **MAG**,这是第一个将任务执行与引导撰写统一为单一**多模态动作与引导(Multimodal Action and Guide)** 任务的基准,并在截图上提供两种接地方案:标注集的元素选择(Set-of-Mark)和原始像素坐标。我们还为这一复合任务构建了一个完整的框架,涵盖借助大语言模型辅助的标注与人工验证、训练、在真实环境中的评估,以及动作与引导的联合指标。利用该框架,我们评估了前沿API模型和开源多模态模型,并报告了详细分析。最后,我们设计了一种结合专家轨迹的GRPO训练方法,该方法几乎将监督学习的9B智能体的成功率翻倍(从6.9%提升至13.2%),同时改善了引导质量。即使是最强模型,完成任务的比例也低于40%,为未来研究留下了充足空间。
**MAG:用于多模态动作与引导生成的网络智能体基准与框架**
## 1. 引言
参考图注
图1:MAG概览。(a) 数字采纳平台在实时网页上叠加人工撰写的引导;目前这些引导是手动撰写和更新的。(b) MAG任务要求单个智能体完成任务,并在每一步撰写引导,采用两种接地方案:标注集元素选择(步骤1)和原始像素坐标(步骤2)。(c) 一次运行产生两个产物:一个可验证的任务结果和一个引导,未来用户可将其复用为DAP覆盖层。
商用数字采纳平台(DAP)在网页系统上叠加引导,以帮助新用户操作复杂、不熟悉的界面。当用户面对不熟悉的页面时,平台会高亮相关元素并在旁边显示简短指令(图1(a))。这种便利依赖于人工劳动:供应商需要定位每一步的目标元素并撰写引导文本,而每次重新设计都迫使两者重做。由于一个目标通常跨越多个页面和一系列依赖操作,整个系统的引导编写和维护成本高昂。
网络智能体是消除这种劳动的自然选择,但两个相关研究方向一直独立发展。智能体基准仅对任务完成度进行评分(Zhou et al., 2024;Deng et al., 2023;Yao et al., 2022a;Koh et al., 2024a):没有一个要求智能体生成每一步人类所需的指令,或对其评分。引导生成则以相反方向研究,为给定单页生成引导(Gan et al., 2026),但不执行任何操作,且基于文本化页面表示,尽管多模态智能体表明从渲染屏幕行动是可行的(Zheng et al., 2024;He et al., 2024;Hong et al., 2024)。我们通过MAG(多模态动作与引导生成基准)填补这一空白。据我们所知,这是第一个要求智能体在实时网站上完成多步任务,并在每一步撰写未来用户所需引导句子的基准(图1(b))。智能体通过截图观察网站,并在两种接地方案之一行动:标注集元素选择(Set-of-Mark,Yang et al., 2023)或原始像素坐标。MAG基于WebArena(Zhou et al., 2024)的六个实时网站:581个任务附带验证成功的演示,分为407个训练和174个测试。其中563个任务的演示被重新标注为金标准轨迹,共4,760个标注集步骤和5,779个坐标步骤,每一步都携带由大语言模型草拟后经人工标注者修正的引导。
我们发布了围绕该基准的完整框架:结合大语言模型草稿与人工修正的标注、监督学习和强化学习训练流程、带有功能检查器和LLM评判的实时评估,以及任务成功与引导质量的联合指标。每次成功运行都会产生一个可验证的结果和一个候选引导(图1(c)),将引导编写减少为审查工作。在此协议下,对三个前沿API模型和一个开源9B模型进行基准测试显示,该任务远未解决:最佳配置完成了37.4%的测试任务。同时表明,接地是一个真实的设计选择,没有通用答案:Gemini在标注集元素选择上显著更强,GPT-5.5和Claude无明显偏好,而训练的9B模型仅在标注集接地方案下有所提升(13.2%对比9.2%)。
最后,我们研究了训练能在多大程度上推动小模型。在金标准演示上的监督微调教会了输出格式,但未教会任务:在标注集接地方案下达到6.9%,低于未微调基线的8.1%,因为微调模型过早声明完成。纯GRPO(Shao et al., 2024)随后陷入停滞:全失败组不携带奖励方差且不产生梯度,这也是大规模RL系统中报告的问题(Yu et al., 2026)。将来自前沿模型的缓存专家轨迹注入组中,借鉴离策略引导的思想(Yan et al., 2026),恢复了信号:标注集集成功率从6.9%攀升至13.2%(坐标接地未受益),引导质量也得到提升,并且pass@6分析显示新能力而非锐化采样。剩余的差距集中在长任务上:每个9B变体在超过九个金标准步骤时仍接近零,而API模型仍能完成26%到34%。
我们做出三项贡献:
- • **MAG任务**,据我们所知,首个将多步网络任务执行与截图上的引导生成统一起来的基准,具有两种接地方案和每一步的人工验证金标准引导。
- • **完整框架**,从标注到实时评估和联合指标,用于基准测试前沿和开源模型,揭示模型特定的接地偏好和共同的长视野差距。
- • **一种增强专家轨迹的GRPO方案**,几乎将监督9B智能体的标注集成功率翻倍(6.9%至13.2%),同时改善其引导,并通过显著性检验和pass@k研究验证。
参考图注
图2:MAG标注流水线(顶部)和一个工作示例步骤通过每个阶段(底部)。失败步骤被丢弃;407/174的划分基于581个源任务,其中563个幸存。
## 2. 相关工作
**从文本到视觉的网络智能体**。网络智能体已从合成平台(Shi et al., 2017)发展到在真实网站上对功能性验证任务进行评分的基准(Yao et al., 2022a;Deng et al., 2023;Zhou et al., 2024;Drouin et al., 2024;Lù et al., 2024),通常基于文本化的页面抽象,强智能体在此基础上叠加提示或搜索(Yao et al., 2022b;Yang et al., 2025;Koh et al., 2024b)。第二条线转向用户所见:标注集提示在截图上叠加编号标记(Yang et al., 2023);SeeAct、WebVoyager、CogAgent和Pix2Act从渲染页面或原始像素行动(Zheng et al., 2024;He et al., 2024;Hong et al., 2024;Shaw et al., 2023);专用接地模型从像素定位元素(Cheng et al., 2024;Gou et al., 2025);基准现在涵盖视觉网络任务、桌面和手机(Koh et al., 2024a;Xie et al., 2024;Rawles et al., 2025)。在所有这些中,智能体仅发出动作,并通过完成度单独评判。
**网络界面的引导生成**。商用DAP将人工编写的引导附着在生产网站上,使其与不断演变的界面同步是一个公认的维护负担。关于自动化的研究很少。Gan等人(2026)为单个给定页面公式化了引导生成:选择用户应交互的元素并编写匹配的指令。不执行任何操作,因此引导从未针对任务成功进行验证,且辅助止步于一个页面。
**网络智能体的强化学习**。GRPO(Shao et al., 2024;Guo et al., 2025)使无评论家强化学习对LLM实用;提示反射在不更新权重的情况下改进智能体(Shinn et al., 2023);WebRL和WebAgent-R1将在线RL应用于网络智能体(Qi et al., 2025;Wei et al., 2025)。两个失败模式塑造了我们的方案。一个组的所有采样全部失败,携带零优势,DAPO通过动态采样解决(Yu et al., 2026);而在策略探索无法发现策略尚不能做到的事情,LUFFY通过将离策略专家轨迹混合到组中来应对(Yan et al., 2026)。来自实时网站的二元奖励使这两个问题对9B智能体尤为严重。
**我们的工作**。MAG在任务层面与所有三条线不同:智能体必须在同一步骤中行动并解释,两个输出都进行评分。这种耦合并非装饰:只有当引导描述的步骤推进了任务时,引导才可信,而实时执行正是验证这一点。与智能体基准相比,MAG添加了第二个监督输出;与单页面引导生成相比,它覆盖了实时网站上的整个任务,且从用户所见视觉输入出发,并且据我们所知,提供了标注集接地与坐标接地在相同任务上的首次受控比较。在训练方面,我们将离策略引导引入多模态网络RL,并展示了它是启用组件:没有专家轨迹,GRPO在此处未带来提升。
## 3. MAG基准
### 3.1 任务定义
一个MAG回合是一个三元组 \((q, s_0, \Phi)\):一个自然语言意图 \(q\),在六个实时网站之一的初始页面状态 \(s_0\),以及一个继承自WebArena的功能性检查器 \(\Phi\)。在步骤 \(t\),智能体接收观察 \(o_t\) 和其自身引导历史的嵌入……(此处公式和文本省略,保持LaTeX格式)
### 3.2 数据集构建
(数据收集、标注流程、金标准生成等细节)
### 3.3 评估协议
(实验设置、评估指标、联合得分等)
## 4. 框架与指标
(描述标注工具、训练流水线、实时评估、联合指标等)
## 5. 实验
### 5.1 设置与基线
我们评估了三个前沿API模型:GPT-5.5 (OpenAI, 2026)、Gemini 3.5 Flash (Google DeepMind, 2026) 和 Claude Sonnet 4.6 (Anthropic, 2026),以及开源Qwen3.5 9B VLM (Qwen Team, 2026)¹¹¹ https://huggingface.co/Qwen/Qwen3.5-9B;我们的SFT和GRPO检查点随框架发布。作为基线,我们测试了基础模型、SFT后、以及GRPO第5轮和第10轮后的模型,每种均采用两种接地方案。每次运行遵循3.3节的协议,使用相同的提示、解析器、预算和评判器。我们有意不与任何早期的WebArena智能体进行比较。MAG是一个新任务,带有第二个评分输出;其任务来自一个智能体可解子集的重标注(3.2节);且其指标要求现有智能体不生成的引导。因此,评估回答了当前模型在MAG上表现如何,而非它们在WebArena上的排名。
### 5.2 主要结果
表1报告了整套结果;四个发现组织如下。
#### MAG远未解决。
最佳配置,GPT-5.5结合坐标,完成了37.4%的测试任务;最佳训练的9B智能体达到13.2%。每个模型还支付了引导税:即使最佳GGS(0.226)也远低于其自身的SR。
#### 协议可学习;能力并非同一回事。
API模型开箱即满足输出协议(OFCR 0.88至0.999);9B基础模型则不行(SoM 0.19,Coord 0.14),而SFT正好修复了这一点,每个微调行均达到0.97或更高(4.2节)。任何运行中都没有评估步骤将标记ID或坐标泄漏到……相似文章
MM-WebAgent: 一种用于网页生成的分层多模态Web智能体
MM-WebAgent是一种分层智能体框架,通过联合优化布局和多模态内容来协调基于AIGC的元素生成,从而生成连贯且视觉一致的网页。本文引入了一个基准测试和多级评估协议,展示了该框架相比代码生成和基于智能体的基线方法的改进。
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.
Mango:通过全局视图优化的多智能体网页导航
普渡大学研究团队推出 Mango,一种多智能体网页导航系统,利用全局站点结构和汤普森采样选择最优起始 URL,在 WebVoyager 和 WebWalkerQA 基准测试中显著提升成功率。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks
UrbanAgent is a tool-augmented agent framework that uses LLMs with code execution, API calls, and MCP to handle cross-system urban requests. The authors also introduce UrbanEval, a benchmark for evaluating task results and execution quality, achieving 71% success rate over baselines.