OpenComputer:面向计算机使用智能体的可验证软件世界
摘要
OpenComputer 提出了一种框架,用于为计算机使用智能体创建可验证的软件环境,集成了状态验证器、自改进验证层、任务合成以及评估系统,覆盖33个桌面应用程序。实验表明,其验证器与人类判断的一致性优于LLM作为判断者,且前沿智能体在端到端完成方面仍面临困难。
查看缓存全文
缓存时间: 2026/05/20 02:35
论文页面 - OpenComputer:面向计算机使用代理的可验证软件世界
来源:https://huggingface.co/papers/2605.19769
摘要
OpenComputer 提出了一个框架,用于为计算机使用代理创建可验证的软件环境,该框架通过集成状态验证、自我改进层、任务合成以及跨多个桌面应用程序的评估系统实现。
我们提出 OpenComputer,一个基于验证器的框架(https://huggingface.co/papers?q=verifier-grounded%20framework),用于构建面向计算机使用代理的可验证软件世界。OpenComputer 集成了四个组件:(1)应用特定的状态验证器(https://huggingface.co/papers?q=state%20verifiers),暴露真实应用程序上的结构化检查端点;(2)自我演进的验证层(https://huggingface.co/papers?q=self-evolving%20verification%20layer),利用执行反馈提高验证器可靠性;(3)任务生成流水线(https://huggingface.co/papers?q=task-generation%20pipeline),综合生成真实且可机器检查的桌面任务;(4)评估工具包(https://huggingface.co/papers?q=evaluation%20harness),记录完整轨迹并计算可审计的部分信用奖励(https://huggingface.co/papers?q=partial-credit%20rewards)。目前,OpenComputer 涵盖 33 个桌面应用程序(https://huggingface.co/papers?q=desktop%20applications)和 1,000 个最终确定的任务,涵盖浏览器、办公工具、创意软件、开发环境、文件管理器和通信应用。实验表明,OpenComputer 的硬编码验证器与人工评判(https://huggingface.co/papers?q=human%20adjudication)的一致性高于 LLM 作为评判者评估(https://huggingface.co/papers?q=LLM-as-judge%20evaluation),尤其是在成功依赖于细粒度应用状态的情况下。前沿代理在端到端完成上仍显吃力,尽管有部分进展,而开源模型在 OSWorld-Verified 评分上出现急剧下降,暴露出稳健计算机自动化(https://huggingface.co/papers?q=computer%20automation)方面的持续差距。
查看 arXiv 页面(https://arxiv.org/abs/2605.19769)查看 PDF(https://arxiv.org/pdf/2605.19769)GitHub(https://github.com/echo0715/OpenComputer)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19769)
在您的智能代理中获取本文:
hf papers read 2605\.19769
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
在模型 README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
引用本论文的数据集0
没有数据集链接本论文
在数据集 README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
引用本论文的 Space0
没有 Space 链接本论文
在 Space README.md 中引用 arxiv.org/abs/2605.19769,以从本页链接它。
收藏本论文的集合0
没有包含本论文的集合
将本论文添加到集合(https://huggingface.co/new-collection)中,以从本页链接它。
相似文章
OpenComputer | 一款为智能体打造的开源计算机
OpenComputer 是一个面向AI智能体的开源虚拟机环境,提供人类可操作的电脑界面,让智能体安全运行的同时,用户能够观察并协作。它可在本地运行并使用小型上下文模型,避免基于截图的导航方式,以提高效率。
Open Computer Use
Open Computer Use 是一个开源的 MCP (模型上下文协议),用于 AI 代理控制计算机界面。
训练需要可信的世界:用于智能体学习的验证合成网络环境
本文介绍了一个构建验证合成网络环境的框架,以改进网络智能体的训练,展示了在基准测试中增强的性能和可迁移性。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
OpenLife:面向开放世界的自主LLM智能体人工生命
本文介绍OpenLife,一个概念验证系统,采用具有持久记忆和基于预算的新陈代谢的自主LLM智能体,实现开放世界人工生命。为期十二周的实验展示了涌现的生命样动态,包括自发活动、个体化和社会结构。