OSWorld-Science:面向科学软件学习与使用的计算机操作智能体基准
摘要
OSWorld-Science 面向基于视觉语言模型(VLM)的计算机操作智能体,提出了一套针对科学软件的基准与评测环境,涵盖 146 个由专家设计的任务,涉及分子绘制、病理影像、统计分析、物理仿真等多个领域,采用基于产物的评估器,并配备专用的智能体运行框架。
查看缓存全文
缓存时间: 2026/10/01 08:23
论文页面 - OSWorld-Science:面向科学软件学习与使用的计算机使用智能体基准
来源:https://huggingface.co/papers/2609.39903 发布于 9 月 30 日
·
提交者:https://huggingface.co/iLOVE2D
Tianyu (https://huggingface.co/iLOVE2D)于 10 月 1 日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
科学软件对基于视觉语言模型(VLM)的计算机使用智能体提出了严苛的考验:完成一项研究工作流需要解读专业化的软件界面、操作科学对象,并产出可验证的结果。为此,我们提出 OSWorld-Science——一个基准测试与评估环境,将具有科学意义的任务、基于工件(artifact)的评估方式,以及用于研究科学领域计算机使用的高效智能体运行框架(harness)整合在一起。该基准包含针对 12 种 VLM 的 146 个高质量任务,覆盖多个科学领域与软件配置,所涉工作流包括分子绘制与逆合成、病理图像分析、统计计算以及物理仿真等。任务的开发采用专家提案与迭代式人机协同设计的方式,并根据科学价值与难度进行筛选。针对每个任务设计的基于执行的评估器会检查应用状态与生成的工件(包括分子结构、分割掩码、图像以及数值结果),并对不完整的输出给予部分分数。我们的专用运行框架集成了模型适配器、交互循环控制与轨迹日志记录功能,便于对不同模型及交互策略进行对比。实验结果表明,即使配备强大的运行框架,当前最先进的 VLM 在解决科学领域的关键问题时仍面临诸多挑战。我们还从多语言能力、推理投入(reasoning effort)、上下文长度等多个维度对基准测试结果进行了分析,得出若干重要结论与后续发展方向,以助力未来的研究工作。总体而言,我们提供了一个集成框架,将专家定义的科学目标与可验证的软件产出连接起来,从而实现对科学工作流中智能体能力与运行框架设计的系统性评估。
查看 arXiv 页面 (https://arxiv.org/abs/2609.39903) · 查看 PDF (https://arxiv.org/pdf/2609.39903) · 项目页面 (https://discoailab.github.io/osworld-science-page/) · GitHub 仓库 (https://github.com/DiscoAILab/OSWorld-Science) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.39903)
在你的智能体中获取本文:
hf papers read 2609\.39903
没有最新版 CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.39903,即可将该模型链接到本页面。
引用本文的数据集 1
SciAILab/OSWorld-Science-data 约 2 小时前更新 • 429 • 2 (https://huggingface.co/datasets/SciAILab/OSWorld-Science-data)
引用本文的 Spaces 1
包含本文的合集 0
暂无包含本文的合集
将本文添加到合集 (https://huggingface.co/new-collection),即可从本页面链接到该合集。
相似文章
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
OpenComputer:面向计算机使用智能体的可验证软件世界
OpenComputer 提出了一种框架,用于为计算机使用智能体创建可验证的软件环境,集成了状态验证器、自改进验证层、任务合成以及评估系统,覆盖33个桌面应用程序。实验表明,其验证器与人类判断的一致性优于LLM作为判断者,且前沿智能体在端到端完成方面仍面临困难。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
OR-Space:面向工业优化代理的全生命周期工作台基准
OR-Space是一个基准测试,用于评估大语言模型代理在工业运筹工作流中的表现,重点关注多阶段任务生命周期和超越简单文本生成的持久工作空间。
SciToolAgent-Evo:面向开放世界科学工具获取的本体感知自进化智能体
介绍了SciToolAgent-Evo,一种面向开放世界科学工具获取的本体感知自进化LLM智能体,以及包含900个真实任务的OpenSciToolBench基准。该智能体利用进化记忆和基于LinUCB的赌博机门控,动态探索并获取新工具。