办公理解基准
摘要
介绍了 Office Comprehension Bench (OCB),这是首个公开基准,用于联合评估 LLM 系统在处理原生文件格式(Word、Excel、PowerPoint)上的理解能力,涵盖结构感知和跨 12 个领域的专家级推理。
查看缓存全文
缓存时间: 2026/07/03 05:39
# Office Comprehension Benchmark 来源:https://arxiv.org/abs/2607.01245 作者:Firoz Shaik (https://arxiv.org/search/cs?searchtype=author&query=Shaik,+F),Mateus Picanço Lima Gomes (https://arxiv.org/search/cs?searchtype=author&query=Gomes,+M+P+L),Tanvir Aumi (https://arxiv.org/search/cs?searchtype=author&query=Aumi,+T),Jingci Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+J),Milos Milunovic (https://arxiv.org/search/cs?searchtype=author&query=Milunovic,+M),Filip Basara (https://arxiv.org/search/cs?searchtype=author&query=Basara,+F),Ivana Jovanovic (https://arxiv.org/search/cs?searchtype=author&query=Jovanovic,+I),Vishwas Suryanarayanan (https://arxiv.org/search/cs?searchtype=author&query=Suryanarayanan,+V),Neha Nandan Kenkare (https://arxiv.org/search/cs?searchtype=author&query=Kenkare,+N+N),Weiyao Xie (https://arxiv.org/search/cs?searchtype=author&query=Xie,+W),Zhipeng Han (https://arxiv.org/search/cs?searchtype=author&query=Han,+Z),Zheng Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Z),Waleed Shahid (https://arxiv.org/search/cs?searchtype=author&query=Shahid,+W),Jay Rathi (https://arxiv.org/search/cs?searchtype=author&query=Rathi,+J),Russell Scherer (https://arxiv.org/search/cs?searchtype=author&query=Scherer,+R),Thong Q. Nguyen (https://arxiv.org/search/cs?searchtype=author&query=Nguyen,+T+Q),Michael Bentley (https://arxiv.org/search/cs?searchtype=author&query=Bentley,+M),Tamara Stankovic (https://arxiv.org/search/cs?searchtype=author&query=Stankovic,+T),Rasika Chakravarthy (https://arxiv.org/search/cs?searchtype=author&query=Chakravarthy,+R),Vishal Chowdhary (https://arxiv.org/search/cs?searchtype=author&query=Chowdhary,+V) 查看PDF (https://arxiv.org/pdf/2607.01245) > 摘要:我们提出了Office Comprehension Bench (OCB),这是第一个公开的基准测试,用于联合评估LLM系统在Word、Excel和PowerPoint的原生文件格式(.docx, .xlsx, .pptx)及其变体上的理解能力。OCB包含两个赛道。文件保真度问答测试对办公制品(表格、图表、嵌入图像、公式以及特定应用元素,如页眉、演讲者备注和命名区域)的结构和视觉感知。领域问答测试基于真实世界行业文档在12个专业领域中的专家级推理,查询需要跨文档的多步骤分析和综合。每个参考答案被分解为原子化的、可二元评分的声明,一组LLM评判器独立对每个声明进行评分。即使是最强的前沿系统在其默认推理模式下也只能达到约59.3%的领域问答准确率;在同一层级内增加思考深度并不会显著提升性能,而迁移到更高的产品层级只会带来有限的增益。我们发布了数据集、评估工具、评判提示词和公共排行榜。 ## 提交历史 来自:Firoz Shaik [查看电子邮件 (https://arxiv.org/show-email/1b6987ba/2607.01245)] **[v1]**2026年5月29日,星期五 03:19:32 UTC (1,503 KB)
相似文章
注意差距:前沿大语言模型能否通过标准办公能力考试?
本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。
KWBench:衡量知识工作中无提示的问题识别能力
# 论文页面 - KWBench:衡量知识工作中无提示的问题识别能力 来源:[https://huggingface.co/papers/2604.15760](https://huggingface.co/papers/2604.15760) ## 摘要 KWBench 提供了一个基准,用于评估大模型在无提示情况下识别专业场景的能力,重点考察其能否从原始输入中识别出潜在的博弈论结构。我们发布了 KWBench(Knowledge Work Bench)的首个版本,一个针对无提示问题识别的基准。
ComBench:一个用于奥林匹克级组合数学严谨证明推理与构造实现的基准
ComBench 是一个奥林匹克级组合数学基准测试,包含100道题目,旨在评估大语言模型的严谨证明推理与构造实现能力。结果表明,像GPT-5.5这样的前沿模型仅达到65.4%的总体平均分,并且这两种能力是截然不同的。
@_reachsumit: OBLIQ-Bench: 揭示现代检索器中因潜在和隐式查询而被忽视的瓶颈 @dianetc_ 等人提出…
OBLIQ-Bench 是一个新的基准测试,揭示了当前检索系统在处理需要潜在或隐式推理的间接查询时的弱点,表明即使复杂的检索流程也无法提供相关文档,而这些文档是推理型大语言模型容易验证的。