OpenComputer:面向计算机使用智能体的可验证软件世界
摘要
OpenComputer 提出了一种框架,用于为计算机使用智能体创建可验证的软件环境,集成了状态验证器、自改进验证层、任务合成以及评估系统,覆盖33个桌面应用程序。实验表明,其验证器与人类判断的一致性优于LLM作为判断者,且前沿智能体在端到端完成方面仍面临困难。
查看缓存全文
缓存时间: 2026/05/20 02:35
论文页面 - OpenComputer:面向计算机使用代理的可验证软件世界
来源:https://huggingface.co/papers/2605.19769
摘要
OpenComputer 提出了一个框架,用于为计算机使用代理创建可验证的软件环境,该框架通过集成状态验证、自我改进层、任务合成以及跨多个桌面应用程序的评估系统实现。
我们提出 OpenComputer,一个基于验证器的框架(https://huggingface.co/papers?q=verifier-grounded%20framework),用于构建面向计算机使用代理的可验证软件世界。OpenComputer 集成了四个组件:(1)应用特定的状态验证器(https://huggingface.co/papers?q=state%20verifiers),暴露真实应用程序上的结构化检查端点;(2)自我演进的验证层(https://huggingface.co/papers?q=self-evolving%20verification%20layer),利用执行反馈提高验证器可靠性;(3)任务生成流水线(https://huggingface.co/papers?q=task-generation%20pipeline),综合生成真实且可机器检查的桌面任务;(4)评估工具包(https://huggingface.co/papers?q=evaluation%20harness),记录完整轨迹并计算可审计的部分信用奖励(https://huggingface.co/papers?q=partial-credit%20rewards)。目前,OpenComputer 涵盖 33 个桌面应用程序(https://huggingface.co/papers?q=desktop%20applications)和 1,000 个最终确定的任务,涵盖浏览器、办公工具、创意软件、开发环境、文件管理器和通信应用。实验表明,OpenComputer 的硬编码验证器与人工评判(https://huggingface.co/papers?q=human%20adjudication)的一致性高于 LLM 作为评判者评估(https://huggingface.co/papers?q=LLM-as-judge%20evaluation),尤其是在成功依赖于细粒度应用状态的情况下。前沿代理在端到端完成上仍显吃力,尽管有部分进展,而开源模型在 OSWorld-Verified 评分上出现急剧下降,暴露出稳健计算机自动化(https://huggingface.co/papers?q=computer%20automation)方面的持续差距。
查看 arXiv 页面(https://arxiv.org/abs/2605.19769)查看 PDF(https://arxiv.org/pdf/2605.19769)GitHub(https://github.com/echo0715/OpenComputer)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19769)
在您的智能代理中获取本文:
hf papers read 2605\.19769
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
在模型 README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
引用本论文的数据集0
没有数据集链接本论文
在数据集 README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
引用本论文的 Space0
没有 Space 链接本论文
在 Space README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
收藏本论文的集合0
没有包含本论文的集合
将本论文添加到集合(https://huggingface.co/new-collection)中,以从本页链接它。
相似文章
OpenComputer | 一款为智能体打造的开源计算机
OpenComputer 是一个面向AI智能体的开源虚拟机环境,提供人类可操作的电脑界面,让智能体安全运行的同时,用户能够观察并协作。它可在本地运行并使用小型上下文模型,避免基于截图的导航方式,以提高效率。
RecreationWorld: 可扩展且可验证的混合计算机使用代理环境
RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。
OSWorld-Science:面向科学软件学习与使用的计算机操作智能体基准
OSWorld-Science 面向基于视觉语言模型(VLM)的计算机操作智能体,提出了一套针对科学软件的基准与评测环境,涵盖 146 个由专家设计的任务,涉及分子绘制、病理影像、统计分析、物理仿真等多个领域,采用基于产物的评估器,并配备专用的智能体运行框架。
通过环境基础验证评估开放权重电商代理
本文介绍了一个确定性的电商模拟环境,用于评估开放权重AI代理,通过验证其行动与隐藏目标购物车的匹配度,并使用环境基础指标来区分诸如行动不足和搜索不佳等失败情况。
Open Computer Use
Open Computer Use 是一个开源的 MCP (模型上下文协议),用于 AI 代理控制计算机界面。