OmegaUse-OfficeVal:基于经济基准的长期办公套件任务LLM代理评估
摘要
OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - OmegaUse-OfficeVal: 基于经济量化基准评估LLM代理在长周期办公套件任务中的表现
来源: https://huggingface.co/papers/2607.27155 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
大语言模型(LLM)代理被越来越多地期望帮助用户完成任务。然而,现有基准测试在评估代理能否以合理成本完成办公套件工作流程方面支持有限。我们推出了 OmegaUse-OfficeVal,这是一个在长周期办公套件任务中评估 LLM 代理的基准测试,并提供了任务级经济量化基准。该基准包含 100 个任务,这些任务源自从业者提出的办公套件请求,并经过隐私保护流程改编。平均而言,这些任务需要 2.32 小时的人工才能完成。该基准的一个重要特点是每个任务都配有两个经济信号:人工时长和任务价格代理。这些信号使得直接比较人力成本与 LLM 推理成本成为可能,也支持了价值加权评估。为了支持稳定的评估,我们从细粒度评分标准出发开发了基于代码的验证器。我们评估了几个前沿 LLM 以及一个人工基线。尽管所有被评估的 LLM 在成本和速度上都显著优于人类工人,但它们尚未达到人类级别的交付质量。代码和数据集完全开源,更多信息可访问我们的项目网站:https://omegause-officeval.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27155)查看 PDF (https://arxiv.org/pdf/2607.27155)项目页面 (https://omegause-officeval.github.io/)GitHub3 (https://github.com/baidu-frontier-research/OmegaUse-OfficeVal)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27155)
在你的代理中获取这篇论文:
hf papers read 2607\.27155
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型引用此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。
引用此论文的数据集 0
没有数据集引用此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。
引用此论文的 Spaces 0
没有 Space 引用此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.27155 以将其链接至此页面。
包含此论文的收藏 0
没有收藏包含此论文
请将此论文添加至一个收藏 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。
注意差距:前沿大语言模型能否通过标准办公能力考试?
本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。
ORAgentBench:LLM代理能否端到端解决具有挑战性的运筹学任务?
本文介绍ORAgentBench,一个用于评估LLM代理在端到端运筹学任务中表现的执行基准,包含107个经过人工审查的任务。实验表明,当前最佳代理仅通过35.51%的任务,揭示了在可靠决策制定方面的重大不足。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。