回到未来:用于电子表格创建基准的工作簿时间机器

arXiv cs.AI 论文

摘要

本文介绍了工作簿时间机器(workbook time machine),这是一个自动创建基准的流水线,用于评估语言模型在创建派生电子表格对象(如公式、图表、数据透视表和条件格式)方面的能力。作者构建了 WTM-Corpus 和一个经过整理的 150 任务基准 WTM-Bench,并在不同工件类型、步骤复杂度和指令粒度上对电子表格智能体进行了评估。

arXiv:2608.07873v1 公告类型:新 摘要:我们介绍了工作簿时间机器(workbook time machine),这是一个自动创建基准的流水线,用于评估语言模型在电子表格中创建派生对象(公式、图表、数据透视表和条件格式)的能力。将其应用于公开的工作簿语料库,可生成 wtmcorpus——一个包含(输入工作簿、输出工作簿、查询)三元组的集合,涵盖四种工件类型且复杂度各异。从该语料库中,我们精选出 wtmbench,这是一个包含 150 个任务的评估基准,查询分为三个特异性级别。我们在 wtmbench 上评估了现有的电子表格操作智能体和基线模型,覆盖不同工件类型、步骤复杂度和指令粒度。评估结果表明,查询特异性、智能体编排以及用于控制电子表格的接口 API 对 LLM 在 Excel 任务上的表现有重要影响。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:03

# 工作表创建基准测试的“工作簿时间机器” 来源:https://arxiv.org/html/2608.07873 ## ↺\circlearrowleft回到未来:用于工作表创建基准测试的*工作簿时间机器* Mukul SinghGust VerbruggenVu LeSumit GulwaniMicrosoft邮箱按顺序:\{mansiuniyal, t\-agasingh, ananyasingha, priyansgupta, singhmukul, gverbruggen, levu, sumitg\}@microsoft\.com ###### 摘要 我们引入了*工作簿时间机器*(workbook time machine),这是一个流水线,可自动创建用于评估语言模型在工作表中创建派生对象(公式、图表、数据透视表和条件格式)能力的基准测试。将其应用于公开的工作簿语料库,可生成WTM\-Corpus——一个由(输入工作簿、输出工作簿、查询)三元组组成的集合,涵盖四种工件类型和不同复杂度。我们从中整理出WTM\-Bench,一个包含150个任务的评估基准,其查询具有三个级别的具体程度。我们在WTM\-Bench上评估了现有工作表操作代理和基线,涵盖工件类型、步骤复杂度和指令粒度。我们的评估表明,查询具体程度、代理编排方式以及用于控制工作表的接口API,对LLM在Excel任务上的表现起着重要作用。 ## 1引言 参见图注图1:使用*工作簿时间机器*创建基准测试的示例,该机器从工作簿中移除对象(左),然后生成描述被移除对象的指令(右)。 工作表是全球使用最广泛的低代码平台,拥有超过7.5亿用户(Bendre等,2019(https://arxiv.org/html/2608.07873#bib.bib26);Microsoft,2024a(https://arxiv.org/html/2608.07873#bib.bib27)),是分析师、会计师以及非专业开发人员领域专家的主要计算工具(Hermans,2016(https://arxiv.org/html/2608.07873#bib.bib28))。用户不只是进行数据录入,还会构建公式、图表、数据透视表和条件格式规则——以及其他派生工件——将原始条目转化为结构化分析。 编码代理在提升开发者生产力方面的近期成功(Peng等,2023(https://arxiv.org/html/2608.07873#bib.bib29))表明,如果模型能够可靠地创建真实工作簿中所包含的全范围*派生工件*,那么工作表用户也能获得类似的收益。这推动了面向工作表环境的企业级代理的发展(Microsoft,2025(https://arxiv.org/html/2608.07873#bib.bib30);Anthropic,2026(https://arxiv.org/html/2608.07873#bib.bib31);OpenAI,2026(https://arxiv.org/html/2608.07873#bib.bib32))。 然而,进展一直难以衡量:现有基准各自只覆盖了问题的一部分——有些使用真实工作簿,但将任务限制在公式和数据录入上(Ma等,2024(https://arxiv.org/html/2608.07873#bib.bib2));有些支持多种工件类型,但仅在简单的手工文件上运行(Li等,2023(https://arxiv.org/html/2608.07873#bib.bib1));还有些则面向表推理而非工件创建(Dong等,2024(https://arxiv.org/html/2608.07873#bib.bib8)),或专注于对话式数据分析(Dutta等,2025(https://arxiv.org/html/2608.07873#bib.bib15))(详细比较见第2节(https://arxiv.org/html/2608.07873#S2))。据我们所知,现有基准没有同时评估:(i)具有复杂结构的真实用户编写工作簿(多工作表、非标准布局、跨工作表依赖);(ii)多步骤派生工件创建——公式、图表、数据透视表和条件格式;(iii)可控制具体程度的指令。 我们通过*逆向工程*真实用户作品来弥补这一空白。受强化学习中逆向课程生成方法的启发(Florensa等,2017(https://arxiv.org/html/2608.07873#bib.bib33);Andrychowicz等,2017(https://arxiv.org/html/2608.07873#bib.bib34)),该方法通过从目标状态反向工作来构建训练分布,我们从完成的、用户编写的工作表出发,自动重建候选编辑历史——即派生工件可能被创建的顺序。从这些历史中,我们为同一变换生成多个具体程度级别的自然语言指令,从而能够系统性地评估代理如何处理不同细节程度的指令。我们将这一过程称为*工作簿时间机器*(图1(https://arxiv.org/html/2608.07873#S1.F1))。 ###### 示例1 考虑一个工作表,其中包含根据身高和体重列计算BMI的公式、突出显示高值的条件格式规则,以及绘制BMI与年龄关系的散点图。向后步骤会剥离这些工件,以恢复原始数据。向前步骤会生成诸如“计算BMI并绘制其与年龄的关系”之类的指令(抽象),或“在单元格D2中输入=10000\*C2/(B2\*B2),向下填充至D7,然后根据A2:A7与D2:D7创建XY散点图”(完全指定)。 这一过程产生了三个受控变化维度:(1)*工件类型*——必须创建哪个派生对象;(2)*步骤复杂度*——该变换需要多少中间工件;(3)*指令具体度*——查询提供了多少细节。 将该流水线应用于Enron(Hermans和Murphy\-Hill,2015(https://arxiv.org/html/2608.07873#bib.bib4))和FUSE(Barik等,2015(https://arxiv.org/html/2608.07873#bib.bib5))语料库,可生成WTM\-Corpus:涵盖Excel派生工件主要类别的2,977个独特任务上的8,931个查询。我们从中整理出WTM\-Bench,这是一个均衡的150任务评估子集,在三个具体度级别上具有近乎均匀的工件分布。 我们做出以下贡献: - •我们引入了*工作簿时间机器*,这是一个通过依赖感知的DAG构建来建模候选编辑历史,从而将真实用户编写的工作表逆向工程为基准三元组(输入工作簿、输出工作簿、查询)的流水线。将其应用于公开语料库,可生成WTM\-Corpus。 - •我们从WTM\-Corpus中整理出WTM\-Bench,这是一个150任务的评估基准,在工件类型、复杂度和查询具体度方面具有受控变化。 - •我们在WTM\-Bench上评估了6个前沿模型的多种代理配置,发现:(a)API选择从根本上影响性能——OfficeJS提供更丰富的Excel功能覆盖,而OpenPyXL在图表和数据透视表方面表现不佳;(b)指令具体度对模型的影响不对称——直接代码生成擅长处理详细指令,而代理方法能更好地处理抽象查询;(c)工件难度差异显著——公式最容易处理,而数据透视表几乎尚未解决。 ## 2相关工作 表1:基准属性比较∗论文中提到,但在实际数据集中没有发现。 #### 工作表基准。 现有工作表基准各自覆盖了问题空间的不同部分(表1(https://arxiv.org/html/2608.07873#S2.T1))。SheetCopilotBench(Li等,2023(https://arxiv.org/html/2608.07873#bib.bib1))支持多种工件类型(图表、数据透视表、条件格式),但运行在手工业制作的工作簿上,这些工作簿缺乏真实用户文件的结构复杂性——多工作表、非标准布局、跨工作表引用。InstructExcel(Payan等,2023(https://arxiv.org/html/2608.07873#bib.bib9))扩展到数千个指令-代码对并使用真实工作簿,但每个任务只针对单个隔离操作;不支持多步骤工作流和不同指令粒度。SpreadsheetBench(Ma等,2024(https://arxiv.org/html/2608.07873#bib.bib2))将评估建立在来自论坛的真实用户编写工作簿上,但其任务范围仅限于数据录入和公式操作——尽管论文中提到了图表和数据透视表,实际上并未包含。SheetRM(Chen等,2025(https://arxiv.org/html/2608.07873#bib.bib3))引入了基于合成工作簿训练的工作表代理奖励模型,这限制了其向实践中遇到的杂乱多表环境的迁移能力。ConDABench(Dutta等,2025(https://arxiv.org/html/2608.07873#bib.bib15))评估LLM在*对话式*数据分析任务上的表现,这些任务需要多轮交互和对不明确目标的消歧,但其目标是表格数据上的分析洞见,而非WTM\-Bench所关注的创建电子表格工件(公式、图表、数据透视表),并且避免了手工单元格操作等低价值操作。相比之下,WTM\-Bench将真实工作簿与多工件创建任务和可控指令具体度结合起来。 #### 工作表理解与代码生成。 SpreadsheetLLM(Dong等,2024(https://arxiv.org/html/2608.07873#bib.bib8))开发了保留空间关系的编码方案,用于工作表问答,而TableTalk(Liang等,2025(https://arxiv.org/html/2608.07873#bib.bib13))实现了与结构化表的自然语言交互——两者均只读,不修改工作簿内容。SheetMind(Zhu等,2025(https://arxiv.org/html/2608.07873#bib.bib12))对单元格依赖和公式关系进行推理,我们在第4.2节(https://arxiv.org/html/2608.07873#S4.SS2)的依赖感知剪枝中利用了这种能力。在代码生成方面,程序化工作表控制(Payan等,2023(https://arxiv.org/html/2608.07873#bib.bib9);Zhu等,2025(https://arxiv.org/html/2608.07873#bib.bib12))和多步骤任务规划(Li等,2023(https://arxiv.org/html/2608.07873#bib.bib1);Chen等,2025(https://arxiv.org/html/2608.07873#bib.bib3))的方法解决了复杂工作流的编排问题——但都假设干净起点,而非真实工作簿中富含工件的环境。更广泛地说,代码生成的LLM代理(Yang等,2024(https://arxiv.org/html/2608.07873#bib.bib21))在自动化多步骤任务方面显示出前景,但工作表特有的挑战(非标准布局、跨工作表依赖、API异构性)仍未得到充分探索。 #### 向后生成与自我改进。 我们的逆向工程视角也与那些从已知目标状态反向构建学习问题的方法相关。逆向课程学习和事后经验回放(Florensa等,2017(https://arxiv.org/html/2608.07873#bib.bib33);Andrychowicz等,2017(https://arxiv.org/html/2608.07873#bib.bib34))使用可达目标来加密监督信号,而代理式自我调试和动作-观察循环(Chen等,2023(https://arxiv.org/html/2608.07873#bib.bib19);Yao等,2023(https://arxiv.org/html/2608.07873#bib.bib20))使用中间反馈来改进多步骤解决方案。编辑DAG的目的不同:它不是训练时的搜索策略,而是一种数据构建机制,从真实最终工作簿中枚举可达的工作表变换。 ## 3问题形式化 设W=\{W1,W2,...,Wm\}\mathcal\{W\}=\{W\_\{1\},W\_\{2\},\ldots,W\_\{m\}\}为一个Excel工作簿语料库。每个工作簿W∈WW\in\mathcal\{W\}由原始数据DD和一组构建于DD之上的*派生工件*C=\{c1,...,cn\}C=\{c\_\{1\},\ldots,c\_\{n\}\}——公式、图表、数据透视表、条件格式规则——组成。我们记W=\{D\}∪CW=\{D\}\cup C。给定W\mathcal\{W\},我们的目标是生成一个基准 B=\{\(Wkin,Wkout,qk\)\}k=1K,\mathcal\{B\}=\bigl\{(W^\{\text\{in\}\}\_\{k\},\;W^\{\text\{out\}\}\_\{k\},\;q\_\{k\}\)\bigr\}\_\{k=1\}^\{K\},其中Wkin⊂Wkout⊆WW^\{\text\{in\}\}\_\{k\}\subset W^\{\text\{out\}\}\_\{k\}\subseteq W是中间工作簿状态,彼此之间相差≥\geq1个工件,qkq\_\{k\}是描述从WkinW^\{\text\{in\}\}\_\{k\}到WkoutW^\{\text\{out\}\}\_\{k\}变换的自然语言指令。在评估时,模型接收(Wkin,qk)\(W^\{\text\{in\}\}\_\{k\},q\_\{k\}\),并且必须产生一个与WkoutW^\{\text\{out\}\}\_\{k\}匹配的状态。给定一个最终工作簿,我们的方法分两遍运行。在*向后步骤*中,我们通过剥离派生工件来分解工作簿,并估计各种*候选编辑历史*——即可能产生最终工作簿的编辑时间线。在*向前步骤*中,我们从这些候选历史中采样变换,并生成不同具体度级别的自然语言指令。 参见图注图2:生成流水线流程图 ### 4\.1组件提取。 回顾第3节(https://arxiv.org/html/2608.07873#S3)中的工作簿W=\{D\}∪CW=\{D\}\cup C,它由原始数据DD和派生工件C=\{c1,...,cn\}C=\{c\_\{1\},\ldots,c\_\{n\}\}组成。从最终工作簿WW出发,向后步骤剥离派生工件以恢复原始状态W0=\{D\}W^\{0\}=\{D\},然后重建候选编辑历史——即工件可以重新添加回去的所有语义有效顺序。 我们通过剥离WW中所有派生工件来构建W0W^\{0\}。除了直接移除之外,我们还应用两个启发式策略以确保干净提取。首先,我们执行*公式分组*:诸如FlashFill(Gulwani,2011(https://arxiv.org/html/2608.07873#bib.bib16))和公式拖拽等电子表格功能允许用户在连续区域中复制公式,因此我们对单元格引用进行匿名化处理,并将共享同一模板的相邻公式分组为一个*公式组*,从而大幅减少工件数量。其次,我们执行*语义描述符映射*:标记描述相邻公式的单元格——例如“合计”单元格位于=SUM\(\)旁边——这些单元格会泄露目标变换的信息,必须与源状态关联,并且如果相应组件被移除,它们也应被移除。我们使用LLM来识别语义表区域,并标记作为公式组描述符的行标题和列标题。 ### 4\.2向后步骤:分解 #### 编辑DAG构建。 我们将这些候选历史紧凑地表示为一个有向无环图(DAG)。设工作簿的真实编辑历史为T=\(W0,W1,W2,...,W\)\mathcal\{T\}=\(W^\{0\},W^\{1\},W^\{2\},\ldots,W\)。由于T\mathcal\{T\}不可用,我们通过*编辑DAG*G=\(V,E\)\mathcal\{G\}=\(V,E\)来建模所有可能的候选编辑历史,其中VV包含通过将\{c1,...,cn\}\{c\_\{1\},\ldots,c\_\{n\}\}的子集添加到W0W^\{0\}而获得的所有工作簿状态,并且当且仅当对于某个工件ckc\_\{k\}有Wj=Wi∪\{ck\}W^\{j\}=W^\{i\}\cup\{c\_\{k\}\}时,存在有向边(Wi,Wj)∈E\(W^\{i\},W^\{j\}\)\in E。G\mathcal\{G\}中从W0W^\{0\}到WW的每条路径都对应一个候选编辑历史。 #### 依赖感知剪枝。 朴素地看,具有nn个工件的工作簿最多允许n\!n\!种顺序。然而,并非所有顺序在语义上都有效——基于派生列构建的图表不能先于该列的产生。基于先前关于单元格依赖分析的工作(Tang等,2023(https://arxiv.org/html/2608.07873#bib.bib14);Zhu等,2025(https://arxiv.org/html/2608.07873#bib.bib12)),我们通过*工件依赖图*GD=\(\{c1,...,cn\},ED\)\mathcal\{G\}\_\{D\}=(\{c\_\{1\},\ldots,c\_\{n\}\},E\_\{D\})来捕获此类约束,其中当cjc\_\{j\}的输入范围与cic\_\{i\}的输出范围重叠时,存在(cic\_\{i\}, cjc\_\{j\})∈ED\in E\_\{D\}。我们剪掉E\mathcal\{G\}中每个满足cjc\_\{j\}的至少一个前置条件在WiW^\{i\}中缺失的边(Wi,Wi∪\{cj\})∈E\(W^\{i\},W^\{i\}\cup\{c\_\{j\}\}\)\in E。如果剪枝后的图不再是完全连通的,我们保留包含WW的连通工件集合,并优先选择工件密集的状态。我们将结果称为*依赖剪枝DAG*GP。

相似文章

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。