OmegaUse-OfficeVal:基于经济基准的长期办公套件任务LLM代理评估

Hugging Face Daily Papers 论文

摘要

OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。

大型语言模型(LLM)代理日益被期望协助用户完成任务。然而,现有基准测试对评估代理是否能够以合理成本完成办公套件工作流程的支持有限。我们引入了OmegaUse-OfficeVal,这是一个用于评估LLM代理在长期办公套件任务中表现并具有任务级经济基准的基准测试。该基准包含100个任务,这些任务来源于实践者提出的办公套件请求,并通过保护隐私的过程进行了改编。平均而言,这些任务需要2.32小时的人力劳动才能完成。该基准的一个重要特点是,每个任务都配有两个经济信号:人力劳动时间和任务价格代理。这些信号使得能够直接比较人力成本与LLM推理成本,并进行价值加权评估。为了支持稳定的评估,我们基于细粒度评分标准开发了基于代码的验证器。我们评估了多个前沿LLM以及一个人工基线。尽管所有被评估的LLM都比人类工作者便宜得多、快得多,但它们尚未达到人类水平的交付质量。代码和数据集完全开源,更多信息请访问我们的项目网站:https://omegause-officeval.github.io。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - OmegaUse-OfficeVal: 基于经济量化基准评估LLM代理在长周期办公套件任务中的表现

来源: https://huggingface.co/papers/2607.27155 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

大语言模型(LLM)代理被越来越多地期望帮助用户完成任务。然而,现有基准测试在评估代理能否以合理成本完成办公套件工作流程方面支持有限。我们推出了 OmegaUse-OfficeVal,这是一个在长周期办公套件任务中评估 LLM 代理的基准测试,并提供了任务级经济量化基准。该基准包含 100 个任务,这些任务源自从业者提出的办公套件请求,并经过隐私保护流程改编。平均而言,这些任务需要 2.32 小时的人工才能完成。该基准的一个重要特点是每个任务都配有两个经济信号:人工时长和任务价格代理。这些信号使得直接比较人力成本与 LLM 推理成本成为可能,也支持了价值加权评估。为了支持稳定的评估,我们从细粒度评分标准出发开发了基于代码的验证器。我们评估了几个前沿 LLM 以及一个人工基线。尽管所有被评估的 LLM 在成本和速度上都显著优于人类工人,但它们尚未达到人类级别的交付质量。代码和数据集完全开源,更多信息可访问我们的项目网站:https://omegause-officeval.github.io/。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27155)查看 PDF (https://arxiv.org/pdf/2607.27155)项目页面 (https://omegause-officeval.github.io/)GitHub3 (https://github.com/baidu-frontier-research/OmegaUse-OfficeVal)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27155)

在你的代理中获取这篇论文:

hf papers read 2607\.27155

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型引用此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。

引用此论文的数据集 0

没有数据集引用此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。

引用此论文的 Spaces 0

没有 Space 引用此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。

包含此论文的收藏 0

没有收藏包含此论文

请将此论文添加至一个收藏 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章

注意差距:前沿大语言模型能否通过标准办公能力考试?

arXiv cs.AI

本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。