@seclink: Workspace-Bench-Workspaces 存储完整的原始工作区文件系统:各种文档、电子表格、代码、P…

X AI KOLs Timeline 工具

摘要

Workspace-Bench 是一个基准测试,模拟真实员工的文件工作区,以评估AI代理在涉及文件发现和理解关系的任务上的表现。它包括各种文件类型和基于角色的场景,用于测试代理的能力。

Workspace-Bench-Workspaces 存储完整的原始工作区文件系统: 各种文档、电子表格、代码、PPT、会议记录、依赖文件等,模拟真实员工电脑上那一堆繁多且杂乱、相互关联的文件。 代理必须在这个工作区中自行查找文件,理解文件关系,并完成任务。 配套任务位于 Workspace-Bench / Workspace-Bench-Lite,共有5种基于角色的工作区: Operations Manager Logistics Manager AI Product Manager Backend Developer Researcher 完整版包含388个任务,约20,000个文件,超过70种格式,最大的工作区约20GB。评估不仅看最终答案是否正确,还看代理是否找到并正确使用了必要的文件。
查看原文
查看缓存全文

缓存时间: 2026/09/03 12:08

Workspace-Bench 工作区存储了完整的原始工作区文件系统:

包含各类文档、电子表格、代码、PPT、会议记录、依赖文件等,模拟真实员工电脑上那堆数量庞大、杂乱无章、相互关联的文件。

智能体需在此工作区中自主查找文件,理解文件关系并完成任务。

相关任务位于 Workspace-Bench / Workspace-Bench-Lite 中,共包含5种基于角色的工作区类型:

运营经理
物流经理
AI产品经理
后端开发工程师
研究员

完整版包含388个任务、约20,000个文件、超过70种文件格式,最大工作区容量约20GB。评估不仅考察最终答案是否正确,还将验证智能体是否找到并正确使用了必要文件。

相似文章

回到未来:用于电子表格创建基准的工作簿时间机器

arXiv cs.AI

本文介绍了工作簿时间机器(workbook time machine),这是一个自动创建基准的流水线,用于评估语言模型在创建派生电子表格对象(如公式、图表、数据透视表和条件格式)方面的能力。作者构建了 WTM-Corpus 和一个经过整理的 150 任务基准 WTM-Bench,并在不同工件类型、步骤复杂度和指令粒度上对电子表格智能体进行了评估。

WorkBench再访:两年后的工作场所智能体

arXiv cs.CL

本文在WorkBench基准发布两年后再次对其进行评估,显示当前最佳智能体(Claude Opus 4.8)能完成89%的任务,且仅有2.5%的有害副作用,而2024年GPT-4的完成率为43%,有害率为26%。研究发现,能力与安全性同步提升,开放权重模型大幅降低了成本,但一些基本错误仍然存在。