办公理解基准

arXiv cs.CL 论文

摘要

介绍了 Office Comprehension Bench (OCB),这是首个公开基准,用于联合评估 LLM 系统在处理原生文件格式(Word、Excel、PowerPoint)上的理解能力,涵盖结构感知和跨 12 个领域的专家级推理。

arXiv:2607.01245v1 发布类型:新 摘要:我们提出 Office Comprehension Bench (OCB),这是首个公开基准,用于联合评估 LLM 系统在 Word、Excel 和 PowerPoint 原生文件格式(.docx、.xlsx、.pptx)及其变体上的理解能力。OCB 包含两个任务。File Fidelity Q&A 测试办公制品(表格、图表、嵌入图像、公式以及特定应用元素如页眉、演讲者备注和命名区域)的结构和视觉感知能力。Domain Q&A 测试基于真实行业文档的专家级推理,涵盖 12 个专业领域,查询需要跨文档进行多步分析和综合。每个参考答案被分解为原子化的、可二值评分的陈述,并由一组 LLM 评判器独立地对每个陈述进行评分。即使是默认推理模式下最强的前沿系统,在 Domain Q&A 上也仅达到约 59.3%;在同一层级内增加思考深度并未显著提升性能,而转向更高产品层级则带来适度提升。我们发布了数据集、评估工具、评判提示词以及一个公开排行榜。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:39

# Office Comprehension Benchmark  
来源:https://arxiv.org/abs/2607.01245  
作者:Firoz Shaik (https://arxiv.org/search/cs?searchtype=author&query=Shaik,+F),Mateus Picanço Lima Gomes (https://arxiv.org/search/cs?searchtype=author&query=Gomes,+M+P+L),Tanvir Aumi (https://arxiv.org/search/cs?searchtype=author&query=Aumi,+T),Jingci Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+J),Milos Milunovic (https://arxiv.org/search/cs?searchtype=author&query=Milunovic,+M),Filip Basara (https://arxiv.org/search/cs?searchtype=author&query=Basara,+F),Ivana Jovanovic (https://arxiv.org/search/cs?searchtype=author&query=Jovanovic,+I),Vishwas Suryanarayanan (https://arxiv.org/search/cs?searchtype=author&query=Suryanarayanan,+V),Neha Nandan Kenkare (https://arxiv.org/search/cs?searchtype=author&query=Kenkare,+N+N),Weiyao Xie (https://arxiv.org/search/cs?searchtype=author&query=Xie,+W),Zhipeng Han (https://arxiv.org/search/cs?searchtype=author&query=Han,+Z),Zheng Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Z),Waleed Shahid (https://arxiv.org/search/cs?searchtype=author&query=Shahid,+W),Jay Rathi (https://arxiv.org/search/cs?searchtype=author&query=Rathi,+J),Russell Scherer (https://arxiv.org/search/cs?searchtype=author&query=Scherer,+R),Thong Q. Nguyen (https://arxiv.org/search/cs?searchtype=author&query=Nguyen,+T+Q),Michael Bentley (https://arxiv.org/search/cs?searchtype=author&query=Bentley,+M),Tamara Stankovic (https://arxiv.org/search/cs?searchtype=author&query=Stankovic,+T),Rasika Chakravarthy (https://arxiv.org/search/cs?searchtype=author&query=Chakravarthy,+R),Vishal Chowdhary (https://arxiv.org/search/cs?searchtype=author&query=Chowdhary,+V)  

查看PDF (https://arxiv.org/pdf/2607.01245)  

> 摘要:我们提出了Office Comprehension Bench (OCB),这是第一个公开的基准测试,用于联合评估LLM系统在Word、Excel和PowerPoint的原生文件格式(.docx, .xlsx, .pptx)及其变体上的理解能力。OCB包含两个赛道。文件保真度问答测试对办公制品(表格、图表、嵌入图像、公式以及特定应用元素,如页眉、演讲者备注和命名区域)的结构和视觉感知。领域问答测试基于真实世界行业文档在12个专业领域中的专家级推理,查询需要跨文档的多步骤分析和综合。每个参考答案被分解为原子化的、可二元评分的声明,一组LLM评判器独立对每个声明进行评分。即使是最强的前沿系统在其默认推理模式下也只能达到约59.3%的领域问答准确率;在同一层级内增加思考深度并不会显著提升性能,而迁移到更高的产品层级只会带来有限的增益。我们发布了数据集、评估工具、评判提示词和公共排行榜。

## 提交历史  

来自:Firoz Shaik [查看电子邮件 (https://arxiv.org/show-email/1b6987ba/2607.01245)] **[v1]**2026年5月29日,星期五 03:19:32 UTC (1,503 KB)

相似文章

注意差距:前沿大语言模型能否通过标准办公能力考试?

arXiv cs.AI

本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。

OmegaUse-OfficeVal:基于经济基准的长期办公套件任务LLM代理评估

Hugging Face Daily Papers

OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。

XL-DocBench:证据支撑的超长文档理解基准测试

arXiv cs.CL

介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。

BBOWP-Bench:评估LLM在黑盒优化文字问题上的性能

arXiv cs.CL

介绍了BBOWP-Bench,一个用于评估LLM在黑盒优化文字问题上的基准测试套件。在这些问题中,系统必须从自然语言描述中推断搜索空间和优化算法。初步结果显示,LLM能够选择合适算法,但在搜索空间设计方面存在困难。