@seclink: Workspace-Bench-Workspaces 存储完整的原始工作区文件系统:各种文档、电子表格、代码、P…
摘要
Workspace-Bench 是一个基准测试,模拟真实员工的文件工作区,以评估AI代理在涉及文件发现和理解关系的任务上的表现。它包括各种文件类型和基于角色的场景,用于测试代理的能力。
查看缓存全文
缓存时间: 2026/09/03 12:08
Workspace-Bench 工作区存储了完整的原始工作区文件系统:
包含各类文档、电子表格、代码、PPT、会议记录、依赖文件等,模拟真实员工电脑上那堆数量庞大、杂乱无章、相互关联的文件。
智能体需在此工作区中自主查找文件,理解文件关系并完成任务。
相关任务位于 Workspace-Bench / Workspace-Bench-Lite 中,共包含5种基于角色的工作区类型:
运营经理
物流经理
AI产品经理
后端开发工程师
研究员
完整版包含388个任务、约20,000个文件、超过70种文件格式,最大工作区容量约20GB。评估不仅考察最终答案是否正确,还将验证智能体是否找到并正确使用了必要文件。
相似文章
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。
@stainlu:我们开源了一个工作区智能体实现——任意模型、可自托管、按会话沙箱、凭据隔离…
OpenClaw 是一个可自托管的开源工作区智能体平台,支持按会话沙箱和凭据隔离。
SaaS-Bench:计算机使用代理能否利用真实世界的SaaS解决专业工作流程?
SaaS-Bench是一个新的基准测试,基于23个可部署的SaaS系统,覆盖六个专业领域,包含106个长周期任务,用于评估计算机使用代理。实验表明,即使是最强的模型,端到端完成任务的比例也不足4%,凸显了当前代理能力的显著限制。
回到未来:用于电子表格创建基准的工作簿时间机器
本文介绍了工作簿时间机器(workbook time machine),这是一个自动创建基准的流水线,用于评估语言模型在创建派生电子表格对象(如公式、图表、数据透视表和条件格式)方面的能力。作者构建了 WTM-Corpus 和一个经过整理的 150 任务基准 WTM-Bench,并在不同工件类型、步骤复杂度和指令粒度上对电子表格智能体进行了评估。
WorkBench再访:两年后的工作场所智能体
本文在WorkBench基准发布两年后再次对其进行评估,显示当前最佳智能体(Claude Opus 4.8)能完成89%的任务,且仅有2.5%的有害副作用,而2024年GPT-4的完成率为43%,有害率为26%。研究发现,能力与安全性同步提升,开放权重模型大幅降低了成本,但一些基本错误仍然存在。