computer-use-agents

标签

Cards List
#computer-use-agents

活动帧:面向代理记忆与回放的确定性屏幕活动编译

arXiv cs.AI · 2天前 缓存

本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。

0 人收藏 0 人点赞
#computer-use-agents

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

arXiv cs.AI · 4天前 缓存

This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.

0 人收藏 0 人点赞
#computer-use-agents

@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…

X AI KOLs Timeline · 2026-07-30 缓存

微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。

0 人收藏 0 人点赞
#computer-use-agents

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Hugging Face Daily Papers · 2026-07-30 缓存

OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。

0 人收藏 0 人点赞
#computer-use-agents

Echoverse:大规模训练计算机使用代理的深度演进环境

Hugging Face Daily Papers · 2026-07-30 缓存

Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。

0 人收藏 0 人点赞
#computer-use-agents

@MSFTResearch: 在首尔ICML上,微软有超过100篇论文被接收、3个口头报告和1个展台演示,亮点包括Fara…

X AI KOLs Following · 2026-07-07 缓存

微软研究院在ICML 2026上的亮点包括Fara 1.5计算机使用智能体系列、抗批评基准测试、通过FLIP2扩展的蛋白质机器学习基准测试以及改进的大语言模型推理稳定性,共有超过100篇论文被接收。

0 人收藏 0 人点赞
#computer-use-agents

PPT-Eval:面向PowerPoint任务的计算机使用代理基准测试

arXiv cs.LG · 2026-07-01 缓存

介绍了PPT-Eval,一个包含120个PowerPoint任务的基准测试,用于评估计算机使用代理,采用基于评分标准的打分系统,可给予部分分数。像Claude-4.5-Opus这样的前沿强代理仅达到45%的成功率,凸显了此类任务的难度。

0 人收藏 0 人点赞
#computer-use-agents

智能体-计算机观察接口实现动态计算机使用

arXiv cs.AI · 2026-06-30 缓存

本文介绍了智能体-计算机观察接口(AOI),这是一种模型无关的感知层,它将计算机使用智能体的连续自适应观察与离散动作解耦。AOI 在动态浏览器任务上实现了显著的性能提升(+17 到 +48 个百分点),且无需重新训练,关键洞察在于将捕获的帧叙述为持久文本是改进的主要驱动因素。

0 人收藏 0 人点赞
#computer-use-agents

OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测

Hugging Face Daily Papers · 2026-06-28 缓存

OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。

0 人收藏 0 人点赞
#computer-use-agents

GUI vs. CLI:仅屏幕和技能中介的计算机使用代理的执行瓶颈

arXiv cs.AI · 2026-06-24 缓存

本文研究了计算机使用代理中的执行瓶颈,比较了仅屏幕的基于GUI的方法与基于技能中介的CLI方法,识别了关键性能差异。

0 人收藏 0 人点赞
#computer-use-agents

结合自主评估的计算机操作代理强化学习

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。

0 人收藏 0 人点赞
#computer-use-agents

能力强但粗心:计算机使用代理是否遵循情境完整性?

Hugging Face Daily Papers · 2026-06-22 缓存

本文介绍了AgentCIBench,一个用于评估计算机使用代理隐私风险的基准测试,发现15个前沿代理中有11个在超过50%的场景中泄露信息。

0 人收藏 0 人点赞
#computer-use-agents

@dair_ai: https://x.com/dair_ai/status/2068724104815890889

X AI KOLs Following · 2026-06-21 缓存

重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。

0 人收藏 0 人点赞
#computer-use-agents

VISUALSKILL:面向计算机使用智能体的多模态技能

arXiv cs.CL · 2026-06-18 缓存

VisualSkill 提出了一种层级化的多模态技能库,用于计算机使用智能体,结合文本与图像,通过在 GUI 交互中保留视觉信息,在 CUA 基准测试上相较于纯文本基线实现了 15.3 个百分点的绝对提升。

0 人收藏 0 人点赞
#computer-use-agents

OSGuard:计算机使用代理安全基准测试

arXiv cs.AI · 2026-06-16 缓存

OSGuard是一个双粒度基准测试,用于在良性用户指令下评估计算机使用代理的安全性,包含动作级判断和风险增强执行套件,以检测不安全捷径。

0 人收藏 0 人点赞
#computer-use-agents

MyPCBench:面向个人智能计算机使用代理的基准测试

Hugging Face Daily Papers · 2026-06-15 缓存

MyPCBench 在模拟的 Linux 桌面环境中,通过真实世界的网络应用评估作为个人助手的计算机使用代理,结果显示 Claude Opus 4.6 的任务完成率最高,达到 55.4%,但在涉及多个应用和长时间操作的任务上仍存在困难。

0 人收藏 0 人点赞
#computer-use-agents

MacArena:在在线macOS环境中对计算机使用代理进行基准测试

arXiv cs.LG · 2026-06-08 缓存

介绍了MacArena,这是一个包含50个应用程序中421项任务的基准测试,用于评估macOS上的计算机使用代理,强调现有基准测试可能无法捕捉macOS特有的挑战。

0 人收藏 0 人点赞
#computer-use-agents

WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试

Hugging Face Daily Papers · 2026-06-08 缓存

WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。

0 人收藏 0 人点赞
#computer-use-agents

MedCUA-Bench:面向临床计算机操作智能体的截图型基准测试

arXiv cs.AI · 2026-06-03 缓存

MedCUA-Bench是一个新的基准测试,用于评估计算机操作智能体在临床软件任务上的表现,涵盖10个医学领域的18个场景,并包含安全维度。结果显示,当前智能体表现不佳,尤其在真实OpenEMR上,凸显了可靠性方面的显著差距。

0 人收藏 0 人点赞
#computer-use-agents

@NielsRogge: Holo 3.1 在流行的计算机使用代理基准 AndroidWorld 上达到了新的 SOTA,可在此处探索 https://paper…

X AI KOLs Following · 2026-06-02 缓存

Holo 3.1 在面向计算机使用代理的 AndroidWorld 基准测试中取得了最先进的性能,展示了在本地部署中改进的速度和成本效益。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈