办公理解基准

arXiv cs.CL 论文

摘要

介绍了 Office Comprehension Bench (OCB),这是首个公开基准,用于联合评估 LLM 系统在处理原生文件格式(Word、Excel、PowerPoint)上的理解能力,涵盖结构感知和跨 12 个领域的专家级推理。

arXiv:2607.01245v1 发布类型:新 摘要:我们提出 Office Comprehension Bench (OCB),这是首个公开基准,用于联合评估 LLM 系统在 Word、Excel 和 PowerPoint 原生文件格式(.docx、.xlsx、.pptx)及其变体上的理解能力。OCB 包含两个任务。File Fidelity Q&A 测试办公制品(表格、图表、嵌入图像、公式以及特定应用元素如页眉、演讲者备注和命名区域)的结构和视觉感知能力。Domain Q&A 测试基于真实行业文档的专家级推理,涵盖 12 个专业领域,查询需要跨文档进行多步分析和综合。每个参考答案被分解为原子化的、可二值评分的陈述,并由一组 LLM 评判器独立地对每个陈述进行评分。即使是默认推理模式下最强的前沿系统,在 Domain Q&A 上也仅达到约 59.3%;在同一层级内增加思考深度并未显著提升性能,而转向更高产品层级则带来适度提升。我们发布了数据集、评估工具、评判提示词以及一个公开排行榜。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:39

# Office Comprehension Benchmark  
来源:https://arxiv.org/abs/2607.01245  
作者:Firoz Shaik (https://arxiv.org/search/cs?searchtype=author&query=Shaik,+F),Mateus Picanço Lima Gomes (https://arxiv.org/search/cs?searchtype=author&query=Gomes,+M+P+L),Tanvir Aumi (https://arxiv.org/search/cs?searchtype=author&query=Aumi,+T),Jingci Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+J),Milos Milunovic (https://arxiv.org/search/cs?searchtype=author&query=Milunovic,+M),Filip Basara (https://arxiv.org/search/cs?searchtype=author&query=Basara,+F),Ivana Jovanovic (https://arxiv.org/search/cs?searchtype=author&query=Jovanovic,+I),Vishwas Suryanarayanan (https://arxiv.org/search/cs?searchtype=author&query=Suryanarayanan,+V),Neha Nandan Kenkare (https://arxiv.org/search/cs?searchtype=author&query=Kenkare,+N+N),Weiyao Xie (https://arxiv.org/search/cs?searchtype=author&query=Xie,+W),Zhipeng Han (https://arxiv.org/search/cs?searchtype=author&query=Han,+Z),Zheng Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Z),Waleed Shahid (https://arxiv.org/search/cs?searchtype=author&query=Shahid,+W),Jay Rathi (https://arxiv.org/search/cs?searchtype=author&query=Rathi,+J),Russell Scherer (https://arxiv.org/search/cs?searchtype=author&query=Scherer,+R),Thong Q. Nguyen (https://arxiv.org/search/cs?searchtype=author&query=Nguyen,+T+Q),Michael Bentley (https://arxiv.org/search/cs?searchtype=author&query=Bentley,+M),Tamara Stankovic (https://arxiv.org/search/cs?searchtype=author&query=Stankovic,+T),Rasika Chakravarthy (https://arxiv.org/search/cs?searchtype=author&query=Chakravarthy,+R),Vishal Chowdhary (https://arxiv.org/search/cs?searchtype=author&query=Chowdhary,+V)  

查看PDF (https://arxiv.org/pdf/2607.01245)  

> 摘要:我们提出了Office Comprehension Bench (OCB),这是第一个公开的基准测试,用于联合评估LLM系统在Word、Excel和PowerPoint的原生文件格式(.docx, .xlsx, .pptx)及其变体上的理解能力。OCB包含两个赛道。文件保真度问答测试对办公制品(表格、图表、嵌入图像、公式以及特定应用元素,如页眉、演讲者备注和命名区域)的结构和视觉感知。领域问答测试基于真实世界行业文档在12个专业领域中的专家级推理,查询需要跨文档的多步骤分析和综合。每个参考答案被分解为原子化的、可二元评分的声明,一组LLM评判器独立对每个声明进行评分。即使是最强的前沿系统在其默认推理模式下也只能达到约59.3%的领域问答准确率;在同一层级内增加思考深度并不会显著提升性能,而迁移到更高的产品层级只会带来有限的增益。我们发布了数据集、评估工具、评判提示词和公共排行榜。

## 提交历史  

来自:Firoz Shaik [查看电子邮件 (https://arxiv.org/show-email/1b6987ba/2607.01245)] **[v1]**2026年5月29日,星期五 03:19:32 UTC (1,503 KB)

相似文章

注意差距:前沿大语言模型能否通过标准办公能力考试?

arXiv cs.AI

本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。

KWBench:衡量知识工作中无提示的问题识别能力

Hugging Face Daily Papers

# 论文页面 - KWBench:衡量知识工作中无提示的问题识别能力 来源:[https://huggingface.co/papers/2604.15760](https://huggingface.co/papers/2604.15760) ## 摘要 KWBench 提供了一个基准,用于评估大模型在无提示情况下识别专业场景的能力,重点考察其能否从原始输入中识别出潜在的博弈论结构。我们发布了 KWBench(Knowledge Work Bench)的首个版本,一个针对无提示问题识别的基准。