语言模型在统计问题表述上的基准测试

arXiv cs.AI 论文

摘要

本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。

arXiv:2609.01982v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地被用作统计和数据科学工作的助手,然而现有评估大多假设分析目标已经指定。在实践中,用户带着非正式目标和异质数据而来,留下模型来决定隐含的统计任务和哪些数据是相关的。我们首先将这个上游步骤形式化为统计问题表述,并将其分解为两个子任务:(1) 统计问题分类和 (2) 变量识别与角色分配。然后,我们介绍StatFormBench,这是一个基于五本跨领域统计教科书和一个数据科学案例库构建的基准测试,涵盖多样化的问题类型、数据表示和场景风格。它包含1,013个样本,跨越20个粗粒度和85个细粒度统计问题类别。在14个开源和闭源LLMs中,最佳的零样本模型仅达到72.0的细粒度分类准确率和63.2的变量集重叠度。没有模型在两个子任务上都表现最佳,而增强提示策略仅带来有限或不一致的提升。我们在Hugging Face上发布基准数据:https://huggingface.co/datasets/THU-CongLab/StatFormBench,并在GitHub上发布评估代码:https://github.com/THU-CongLab/StatFormBench。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:58

# 面向统计问题构型的语言模型基准测试  
来源:https://arxiv.org/html/2609.01982  

陈王111同等贡献。  
隶属机构:清华大学统计与数据科学系  
邮箱:[[email protected]](mailto:)  

赵俊哲111同等贡献。  
隶属机构:清华大学统计与数据科学系  
邮箱:[[email protected]](mailto:)  

丛鑫222通讯作者。  
隶属机构:清华大学统计与数据科学系  
邮箱:[[email protected]](mailto:)  

邓万露  
隶属机构:清华大学统计与数据科学系  
邮箱:[[email protected]](mailto:)  

邓科  
隶属机构:清华大学统计与数据科学系  
邮箱:[[email protected]](mailto:)  

###### 摘要  
大语言模型(LLMs)正日益被用作统计与数据科学工作的助手,然而现有评估大多假设分析目标已经明确。在实践中,用户往往带着非正式的目标和异构数据而来,需要模型判断隐含的统计任务以及哪些数据是相关的。我们首先将这一上游步骤形式化为**统计问题构型**,并将其分解为两个子任务:(1)**统计问题分类**,以及(2)**变量识别与角色分配**。我们引入了**StatFormBench**,这是一个基于五本跨学科统计教科书和一个数据科学案例库构建的基准,涵盖多样化的问题类型、数据表示和场景风格。它包含1,013个样本,跨越20个粗粒度和85个细粒度统计问题类别。在14个开源和闭源LLMs中,最佳零样本模型仅达到72.0的细粒度分类准确率和63.2的变量集重叠率。没有模型在两个子任务上表现持续最佳,而增强的提示策略仅带来有限或不一致的提升。我们在Hugging Face(https://huggingface.co/datasets/THU-CongLab/StatFormBench)上发布基准数据,在GitHub(https://github.com/THU-CongLab/StatFormBench)上发布评估代码。  

## 1 引言  
![图示](https://arxiv.org/html/2609.01982#S1.F1)  
图1:统计问题构型概述。给定一个包含异构数据的场景,模型必须分类统计问题类型并提取相关变量及其角色。  

大语言模型(LLMs)正越来越多地被期望成为数据科学和统计分析工作的通用助手,帮助用户检查数据集、选择分析方法,并回答基于数据的问题(Huang 等人, 2024; Zhang 等人, 2025; Chen 等人, 2025)。许多这类工作假设分析目标已经明确,例如通过指定一个预测任务、假设检验或建模目标(Lu 等人, 2026; Liu 等人, 2024; Huang 等人, 2024; Zhang 等人, 2025)。然而,在实践中,用户通常从非正式的目标开始,而不是正式的分析规范。如图1所示,即使是一个简单的实际请求,也可能需要模型区分预期的假设检验与表面上看似合理的预测任务。它还需要确定该检验需要哪些数据对象,而不是将所有可用字段都视为相关。这些隐式选择决定了后续分析在统计上是否有效。我们将这一上游的规范步骤称为**统计问题构型**。  

我们将**统计问题构型**定义为将非正式的、自然语言的分析请求映射到(i)其隐含的**统计问题类型**,以及(ii)相关的数据对象及其**分析角色**的任务。这两个组成部分对应于两个紧密关联的决策。第一个,**统计问题分类**,确定场景需要什么类型的统计任务,例如比较组均值、检查变量之间的关系或预测未来结果。第二个,**变量识别与角色分配**,确定哪些数据对象与任务相关,以及每个对象扮演什么分析角色,例如自变量或因变量。一旦这些决策做出,后续的统计方法选择就会受到更多约束。相比之下,构型本身通常取决于对用户意图、可用数据和周围领域背景的解释。LLMs 能否可靠地执行这一步骤在很大程度上尚未被探索。  

最近的基准测试已经考察了LLMs在统计和数据科学领域的能力,涵盖了统计知识和推理(Lu 等人, 2026; Liu 等人, 2024; Su 等人, 2025)以及数据科学执行(Huang 等人, 2024; Zhang 等人, 2025; Chen 等人, 2025)。这些研究为LLMs能否进行统计概念推理或执行指定分析提供了有用的证据,但它们通常假设分析目标已经给出或强烈暗示。因此,它们没有直接测试模型能否首先从非正式的实际请求中构型统计任务。评估这一能力具有挑战性,因为构型在几个方面不同于标准问答或任务执行。首先,输入通常不是用统计语言写的:用户可能用有歧义的、特定领域的措辞和干扰性的上下文细节来描述实际目标。其次,相关数据可能以异构的形式表示,包括原始表格变量、汇总统计量(如均值和标准差)、列联表以及其他结构化或半结构化对象。第三,目标标签空间广阔且边界模糊。决定一个场景是需要比较、关联分析、预测、可靠性评估还是其他统计任务,需要联合解释用户的目标、数据结构和领域背景。同样,也需要对问题的理解来将相关变量与偶然信息分开,并分配它们的分析角色。  

为此,我们引入了**StatFormBench**,这是一个在现实、非结构化环境中进行统计问题构型的基准。**StatFormBench**通过与上述决策一致的两个任务来实现构型。**统计问题分类**要求模型识别场景所表达的统计问题类型,**变量识别与角色分配**要求它识别与任务相关的数据对象并分配其分析角色。该基准基于跨应用领域的统计教科书习题和反映多样化业务场景的数据科学案例库构建,使我们能够涵盖受控的教学问题和更开放的实际分析请求。每个样本都通过统一的流水线构建,该流水线提取问题、答案和数据的原始三元组,将多部分问题拆分为单独实例,进行质量过滤,并标注问题类型和变量角色。然后,问题描述被重写为现实场景风格的语言。  

我们评估了14个开源和闭源LLMs。最佳零样本细粒度分类准确率为72.0,而最高的变量集重叠率为63.2,这两个结果由不同的模型达成。细粒度分析进一步表明,性能在不同问题类别和数据源之间差异显著,而标准提示策略带来的提升有限且不一致。我们的贡献如下:(1)我们首次将统计问题构型作为LLMs的评估问题进行研究,将其分解为统计问题分类和变量识别与角色分配;(2)我们构建了**StatFormBench**基准,涵盖多样化的统计问题类型、数据表示和场景风格,样本来源于教科书和现实世界的数据科学案例;(3)我们评估了14个开源和闭源LLMs,表明没有模型在构型任务上表现持续最佳,并且无论使用何种提示策略,当前模型在将非正式请求映射到精确统计构型方面仍然存在困难。  

## 2 相关工作  
### 2.1 用于统计和数据科学的LLMs  
最近的基准测试主要从两个方面评估LLMs在统计和数据科学中的能力。两者都与我们的设定密切相关,但这些研究通常假设分析目标已经指定或暗示。  

#### 统计知识和推理。  
第一个方面研究一旦分析目标明确或强烈暗示,LLMs能否进行统计概念的推理。StatQA(Zhu 等人, 2024)评估预先构型的问题在结构化表格上的方法适用性和变量选择,StatEval(Lu 等人, 2026)将这一方向扩展到基础练习和研究级别的证明任务,QRData(Liu 等人, 2024)和ClimateViz(Su 等人, 2025)考察数据表和科学图表上的统计或因果推理。这些基准评估了在目标分析目标已经定义的场景下的统计能力,而我们专注于推断统计问题本身并识别解决它所需的数据对象。  

#### 数据科学执行。  
第二个方面评估LLMs作为指定分析任务的执行者。DA-Code(Huang 等人, 2024)和DataSciBench(Zhang 等人, 2025)专注于数据预处理、分析和建模的代码生成,而ScienceAgentBench(Chen 等人, 2025)、LMR-Bench(Yan 等人, 2025)、DSBench(Jing 等人, 2025)和BLADE(Gu 等人, 2024)将评估扩展到数据驱动的科学、机器学习研究复现和现实世界的数据科学工作流程。这些工作越来越多地考虑中间决策,但它们仍然主要假设研究问题或分析目标已经给出。  

### 2.2 用于问题构型的LLMs  
#### 优化建模。  
另一条工作线评估LLMs能否将自然语言描述映射到正式的问题表示。优化建模是最成熟的例子。NL4Opt(Ramamonjison 等人, 2022)以及后续的基准如OptiMUS(AhmadiTeshnizi 等人, 2024)、Chain-of-Experts(Xiao 等人, 2024)、ORLM(Huang 等人, 2025)、LLMOPT(Jiang 等人, 2025)和OptiBench(Yang 等人, 2025)将构型视为一个明确的目标,而不是解决问题的隐藏前提。  

#### 数学和领域特定构型。  
相关的基准将这一构型视角扩展到更广泛的领域。ModelingAgent(Qian 等人, 2025)和MM-Agent(Liu 等人, 2025)研究来自竞赛问题的数学建模,MedCalc-Bench(Khandekar 等人, 2024)和MedRaC(Wang 等人, 2025)通过公式选择、实体提取和计算评估临床计算,DiscoveryBench(Majumder 等人, 2025)评估科学发现中通过上下文、变量和关系进行的数据驱动的假设生成。总之,这些研究表明了评估中间抽象而不只是最终答案的价值。统计问题构型共享这一映射挑战,但受固定模式的约束较少。与优化构型(主要相当于实例化固定模式的元素如目标和约束)不同,统计构型必须从领域特定的描述中推断分析问题,并从一个庞大、异构且边界模糊的问题类型空间中进行选择。它还必须识别多样化的数据对象,从原始变量到分组汇总和列联表。据我们所知,目前还没有基准系统地评估这种上游构型能力。  

![图示](https://arxiv.org/html/2609.01982#S2.F2)  
图2:**StatFormBench**基准构建流水线概述。  

## 3 任务构型  
我们将统计问题构型分解为基于输入三元组 $(B, Q, D)$ 定义的两个任务,其中 $B$ 描述实际背景,$Q$ 陈述用户请求,$D$ 指代数据。$D$ 在形式和内容上都各不相同(例如,表格、文本描述、单独文件等)。在内容上,它从原始观测到汇总统计和列联表不等。  

### 3.1 任务1:统计问题分类  
给定 $(B, Q, D)$,任务是预测 $c = (c_{\text{CG}}, c_{\text{FG}})$,其中 $c_{\text{CG}} \in \mathcal{C}_{\text{CG}}$,$c_{\text{FG}} \in \mathcal{C}_{\text{FG}}$,$c$ 表示统计问题类型。标签空间是一个两层层次结构。$\mathcal{C}_{\text{CG}}$ 捕获粗粒度的分析意图,如描述性统计、分类与预测、假设检验与区间估计,而 $\mathcal{C}_{\text{FG}}$ 将每个第一层类别细分为具体问题类型。我们分类问题类型而不是解决方法,因为相同的统计问题可以采用多种方法,而固定于一种方法会模糊问题识别和方法选择之间的区别。  

### 3.2 任务2:变量识别与角色分配  
给定相同的输入,任务是产生一组 $V = \{v_1, \ldots, v_k\}$ 变量,这些变量是解决 $Q$ 所必需的,其中每个变量对象表示为 $v_i = (\text{id}_i, \text{desc}_i, \text{value}_i, \text{role}_i)$。  
$$v_i = (\mathrm{id}_i, \mathrm{desc}_i, \mathrm{value}_i, \mathrm{role}_i)$$  
这里 $\text{id}_i$ 是一个短标识符,通常重用 $D$ 中的名称。$\text{desc}_i$ 描述其领域含义,$\text{value}_i$ 存储来自 $D$ 的相应值。角色字段指定 $v_i$ 如何参与解决 $Q$,并取以下四个值之一:$\text{predictor}$、$\text{response}$、$\text{both}$ 或 $\text{N/A}$。当问题暗示方向性关系时,分配角色 $\text{predictor}$ 和 $\text{response}$。当变量相关但不需要方向时(如相关分析),使用角色 $\text{both}$。

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

大语言模型能否用 TLA+ 建模实际系统?

Hacker News Top

Specula 团队的研究人员创建了 SysMoBench 基准测试,用于评估大语言模型能否准确建模实际计算系统的 TLA+ 规范,还是仅仅照本宣科地背诵教材内容。该基准测试涵盖四个阶段共 11 个系统,揭示了当前大语言模型在准确建模系统实现与参考论文方面的系统性差距。

评估盲点:大语言模型基准覆盖的体视学理论

arXiv cs.LG

本文运用体视学理论分析大语言模型基准,揭示当前排行榜仅测量3-5个独立维度,产生的几何盲点主导统计噪声。文章提供了基准覆盖的理论界限,并提出一个用于高效基准选择的子模算法。