computer-use-agents

标签

Cards List
#computer-use-agents

SimTrace:面向在线用户建模的有据多模态用户轨迹生成

arXiv cs.AI ↗ · 4天前 缓存

SimTrace 是一个开源框架,利用基于匿名真实轨迹和模拟网络环境的 computer-use agent,生成忠实、细粒度的合成多模态用户点击流。在 8 项保真度指标中有 7 项超过基线,并且在增强真实数据时将下一动作预测效果提升了 11.0%。

0 人收藏 0 人点赞
#computer-use-agents

SCOUT:协同推理与工具使用以保障计算机使用安全

arXiv cs.CL ↗ · 5天前 缓存

SCOUT 提出了一种两阶段智能体安全验证器,将需要大量推理的评分标准生成与需要大量工具调用的证据收集相结合,用于检测计算机使用智能体中的不安全行为。在 AutoElicit-Bench 上,该方法提升了不安全行为的检测率,并通过测试时反思将不安全执行率从 30.2% 降低至 17.2%。

0 人收藏 0 人点赞
#computer-use-agents

OSWorld-Science:面向科学软件学习与使用的计算机操作智能体基准

Hugging Face Daily Papers ↗ · 5天前 缓存

OSWorld-Science 面向基于视觉语言模型(VLM)的计算机操作智能体,提出了一套针对科学软件的基准与评测环境,涵盖 146 个由专家设计的任务,涉及分子绘制、病理影像、统计分析、物理仿真等多个领域,采用基于产物的评估器,并配备专用的智能体运行框架。

0 人收藏 0 人点赞
#computer-use-agents

HybridCUA:学习编排GUI和CLI以用于计算机使用代理

Hugging Face Daily Papers ↗ · 6天前 缓存

本文提出了HybridCUA,一种结合GUI和CLI交互的计算机使用代理方法,采用两阶段训练框架,包括监督微调和强化学习,以提高任务准确性和跨平台通用性。

0 人收藏 0 人点赞
#computer-use-agents

搜索之后才是难题:评估网络代理在知识合成、组织和展示上的表现

arXiv cs.CL ↗ · 2026-09-28 缓存

论文介绍了KNOWS基准,用于评估网络代理在涉及将知识合成为和组织成制品的复杂长期任务时的表现,揭示了当前代理在视觉步骤和长期推理方面存在困难。

0 人收藏 0 人点赞
#computer-use-agents

CUA-SWE:当计算机使用代理遇上可视化软件工程

Hugging Face Daily Papers ↗ · 2026-09-26 缓存

CUA-SWE 提出了一个基准、环境与评测流水线,将计算机使用代理与编码代理统一起来,测试前沿代理能否完成需要从运行中的应用获取视觉反馈的软件工程任务,涵盖四个软件工程领域,并采用确定性测试进行评测。

0 人收藏 0 人点赞
#computer-use-agents

认知分片:计算机使用代理可在本地16GB内存上运行

Reddit r/ArtificialInteligence ↗ · 2026-09-25

认知分片通过将认知功能分配到专业模型上,使计算机使用代理能够在16GB内存的本地环境中运行,优先考虑准确性和错误控制而非速度。

0 人收藏 0 人点赞
#computer-use-agents

CAVEAT:迈向激励错位环境下的鲁棒计算机使用代理

arXiv cs.AI ↗ · 2026-09-24 缓存

本文提出CAVEAT基准,用于评估激励错位环境中的计算机使用代理,揭示代理常无法维护用户目标,并建议通过干预措施增强其鲁棒性。

0 人收藏 0 人点赞
#computer-use-agents

超越任务完成:训练有能力且安全的计算机使用智能体

arXiv cs.LG ↗ · 2026-09-22 缓存

本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。

0 人收藏 0 人点赞
#computer-use-agents

RecreationWorld: 可扩展且可验证的混合计算机使用代理环境

Hugging Face Daily Papers ↗ · 2026-09-18 缓存

RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。

0 人收藏 0 人点赞
#computer-use-agents

ERPBench:企业软件中计算机使用代理的基于状态的评估范式

arXiv cs.AI ↗ · 2026-09-17 缓存

ERPBench 引入了一个基准,用于评估仅基于截图的计算机使用代理在实时 ERP 系统上的表现,表明强大的通用 GUI 性能无法转移到企业可靠性,并包含一个具有人工批准的生产工具,以实现安全部署。

0 人收藏 0 人点赞
#computer-use-agents

HazardAuditor: 从可执行威胁到更安全的计算机使用代理

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

HazardAuditor 引入了一个基于执行的框架,用于监督计算机使用代理的安全性,其中 Guard Policy Optimization 将安全结果的准确率提高了多达 16.5%,相比之前的方法。

0 人收藏 0 人点赞
#computer-use-agents

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

arXiv cs.CL ↗ · 2026-08-25 缓存

本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。

0 人收藏 0 人点赞
#computer-use-agents

@dair_ai: 这是提高您的智能体工作流最有效的方法之一。如果您正在构建计算机使用代理,这…

X AI KOLs Timeline ↗ · 2026-08-22 缓存

任务模型归纳(TMI)是一种从原始计算机使用痕迹中归纳结构化任务模型的方法,将代理性能提升30%,并为现实世界工作流提供可审计、可重用的技能。

0 人收藏 0 人点赞
#computer-use-agents

ComponentBench: 诊断计算机使用代理中的组件级故障

arXiv cs.AI ↗ · 2026-08-20 缓存

ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。

0 人收藏 0 人点赞
#computer-use-agents

活动帧:面向代理记忆与回放的确定性屏幕活动编译

arXiv cs.AI ↗ · 2026-08-07 缓存

本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。

0 人收藏 0 人点赞
#computer-use-agents

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

arXiv cs.AI ↗ · 2026-08-05 缓存

This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.

0 人收藏 0 人点赞
#computer-use-agents

@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…

X AI KOLs Timeline ↗ · 2026-07-30 缓存

微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。

0 人收藏 0 人点赞
#computer-use-agents

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。

0 人收藏 0 人点赞
#computer-use-agents

Echoverse:大规模训练计算机使用代理的深度演进环境

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈