标签
本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。
RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。
ERPBench 引入了一个基准,用于评估仅基于截图的计算机使用代理在实时 ERP 系统上的表现,表明强大的通用 GUI 性能无法转移到企业可靠性,并包含一个具有人工批准的生产工具,以实现安全部署。
HazardAuditor 引入了一个基于执行的框架,用于监督计算机使用代理的安全性,其中 Guard Policy Optimization 将安全结果的准确率提高了多达 16.5%,相比之前的方法。
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。
任务模型归纳(TMI)是一种从原始计算机使用痕迹中归纳结构化任务模型的方法,将代理性能提升30%,并为现实世界工作流提供可审计、可重用的技能。
ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。
本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。
This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.
微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。
OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。
Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。
微软研究院在ICML 2026上的亮点包括Fara 1.5计算机使用智能体系列、抗批评基准测试、通过FLIP2扩展的蛋白质机器学习基准测试以及改进的大语言模型推理稳定性,共有超过100篇论文被接收。
介绍了PPT-Eval,一个包含120个PowerPoint任务的基准测试,用于评估计算机使用代理,采用基于评分标准的打分系统,可给予部分分数。像Claude-4.5-Opus这样的前沿强代理仅达到45%的成功率,凸显了此类任务的难度。
本文介绍了智能体-计算机观察接口(AOI),这是一种模型无关的感知层,它将计算机使用智能体的连续自适应观察与离散动作解耦。AOI 在动态浏览器任务上实现了显著的性能提升(+17 到 +48 个百分点),且无需重新训练,关键洞察在于将捕获的帧叙述为持久文本是改进的主要驱动因素。
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
本文研究了计算机使用代理中的执行瓶颈,比较了仅屏幕的基于GUI的方法与基于技能中介的CLI方法,识别了关键性能差异。
本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。
本文介绍了AgentCIBench,一个用于评估计算机使用代理隐私风险的基准测试,发现15个前沿代理中有11个在超过50%的场景中泄露信息。
重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。