GSM-SEM:用于生成语义变体增强数据的基准与框架

arXiv cs.CL 论文

摘要

本文介绍了 GSM-SEM,这是一个用于生成多样化基准变体的框架,旨在减少数学推理评估中的记忆效应。作者证明,与静态基准相比,这种方法揭示了当前最先进的大语言模型(LLM)存在显著的性能下降。

arXiv:2605.07053v1 发布类型:新论文 摘要:像 GSM8K 这样的基准测试是衡量数学推理能力的热门标准,但由于对固定测试集的记忆效应,排行榜上的成绩往往高估了模型的真实能力。大多数稳健性变体应用的是表面层的扰动(如释义、重命名、数字替换、干扰项),这些扰动大多保留了底层的事实,而静态发布的内容随着时间的推移本身也可能成为记忆的目标。我们引入了 GSM-SEM,这是一个可复用的随机框架,用于生成语义多样化的基准变体,其语义方差远高于以往的方法。GSM-SEM 通过修改实体、属性和/或关系来扰动问题陈述,经常改变底层事实,并要求模型在新条件下重新计算解决方案,同时限制生成过程以保留原始计算/答案并近似保持问题的难度。GSM-SEM 在每次运行时生成新的变体,无需重新标注,从而减少了对静态公共基准测试的依赖,进而降低了记忆偏差。我们将 GSM-SEM 应用于 GSM8K 和两个现有的变体套件(GSM-Symbolic 和 GSM-Plus),生成了 GSM8K-SEM、GSM-Symbolic-SEM 和 GSM-Plus-SEM。通过对 14 个最先进的大语言模型进行评估,我们观察到性能一致下降,当语义扰动与符号/plus 变体结合时,下降幅度更大(在 GSM-SEM 的最大严格度配置下,平均下降率为 28%)。我们公开发布了这三个 SEM 变体作为完全经过人工验证的数据集。最后,为了证明其适用于 GSM 风格数学问题之外的领域,我们将 GSM-SEM 应用于其他基准测试,包括 BigBenchHard、LogicBench 和 NLR-BIRD。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:43

# GSM-SEM:生成语义变体增强的基准与框架

来源:https://arxiv.org/html/2605.07053
作者:Jyotika Singh, Fang Tu, Aziza Mirzadova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Yassine Benajiba, Weiyi Sun, Graham Horwood, Sujith Ravi, Dan Roth
机构:Oracle AI
通讯:jyotika\.s\.singh@oracle\.com (https://arxiv.org/html/2605.07053v1/mailto:[email protected])

###### 摘要

像 GSM8K 这样的基准测试是衡量数学推理能力的流行指标,但由于对固定测试集的过拟合记忆,排行榜上的成绩提升往往高估了模型的真实能力。大多数稳健性变体仅应用表层扰动(如改写、重命名、数字替换、干扰项),这些扰动在很大程度上保留了底层的既定事实,且静态发布的变体本身也会随着时间的推移成为记忆的目标。我们提出了 **GSM-SEM**,这是一个可重复使用的随机框架,用于生成*语义多样化*的基准变体,其语义方差远高于以往的方法。GSM-SEM 通过修改实体、属性和/或关系来扰动问题陈述,经常改变底层事实,并要求模型在新条件下重新计算解决方案,同时限制生成过程以保留原始计算/答案并近似保持问题难度。GSM-SEM 在每次运行时生成全新的变体,无需重新标注,减少了对静态公共基准测试的依赖,从而降低了随着模型和训练语料库演变而产生的记忆偏差。我们将 GSM-SEM 应用于 GSM8K 和两个现有的变体套件(GSM-Symbolic 和 GSM-Plus),生成了 **GSM8K-SEM**、**GSM-Symbolic-SEM** 和 **GSM-Plus-SEM**。通过对 14 个 SOTA LLM 的评估,我们观察到性能一致下降,当语义扰动与符号/增强变体相结合时,下降幅度更大(在 GSM-SEM 的最大严格性配置中,平均下降率约为 28%)。我们公开发布了这三个经过完全人工验证的 SEM 变体数据集。最后,为了证明其在 GSM 风格数学问题之外的适用性,我们将 GSM-SEM 应用于其他基准测试,包括 BigBenchHard、LogicBench 和 NLR-BIRD。

GSM-SEM:生成语义变体增强的基准与框架
Jyotika Singh, Fang Tu, Aziza Mirzadova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Yassine Benajiba, Weiyi Sun, Graham Horwood, Sujith Ravi, Dan Roth
Oracle AI
通讯:jyotika\.s\.singh@oracle\.com (https://arxiv.org/html/2605.07053v1/mailto:[email protected])

## 1 引言

基准排行榜被广泛用于追踪语言模型推理能力的进展,成绩的提升通常被解释为数学和逻辑能力改善的证据。然而,越来越多的研究表明,高基准分数可能反映的是对数据集特定特征的过拟合、数据污染或记忆,而非强大的泛化能力(Sclar et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib22); Gonen et al., 2023 (https://arxiv.org/html/2605.07053#bib.bib7))。对于像 GSM8K(Cobbe et al., 2021 (https://arxiv.org/html/2605.07053#bib.bib5))这样广泛使用的数据集,这一担忧尤为突出,通过训练混合数据和衍生资源反复暴露,使得静态评估集的诊断价值逐渐降低。

参见图注
**图 1:** 示例扰动及每次运行的准确率。顶部:原始 GSM8K 问题。中部:GSM-Symbolic 和 GSM-Plus 改写。底部:GSM-SEM 变体(橙色高亮表示编辑片段)。每个面板显示了五次独立运行的准确率(✓正确,✗错误),表明在 SEM 变体上失败率更高。L3.1 = Llama-3.1-405B-Ins; GPT-5 使用中等/默认推理努力。

一种常见的应对措施是通过改写、实体重命名和数值替换引入稳健性变体(Mirzadeh et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib14); Li et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib9); Lunardi et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib11); Wang and Zhao, 2024 (https://arxiv.org/html/2605.07053#bib.bib30); Rabinovich et al., 2023 (https://arxiv.org/html/2605.07053#bib.bib17); Raj et al., 2022 (https://arxiv.org/html/2605.07053#bib.bib18); Sclar et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib22))。虽然这些扰动对于测试对措辞和表面线索的敏感性很有用,但它们通常保留每个问题的原始事实骨干和关系结构。因此,它们往往更多地探测对表面形式的不变性,而非对意义不同的语义条件的适应性。此外,大多数评估集中在较旧或较小的模型上,这些模型的效果显著,而当时评估的少数较新的 SOTA 模型显示出较小的下降,这留下了一个开放性问题:最近的 SOTA 系统是否发展出了更强大的推理能力。

我们用 **GSM-SEM** 填补了这一空白,这是一个可重复使用的框架,用于生成*语义多样化*的变体,其语义方差远高于以往的转换(图1 (https://arxiv.org/html/2605.07053#S1.F1)),经常改变底层事实,要求模型在新条件下重新计算解决方案,同时限制生成以保留原始的真实最终答案(及相关计算)。重要的是,GSM-SEM 是*随机且可重复使用的*:它在每次运行时生成新的变体而无需重新标注(得益于真实答案和计算的保留),减少了对静态公共基准的依赖,从而随着模型和训练语料库的演变降低了由记忆引起的评价偏差。

我们的主要贡献如下:

- • **GSM-SEM**:一个随机、可重复使用的框架,用于生成语义多样化的基准变体,同时保留原始计算/答案并针对相似难度。
- • **人工验证的基准发布**:公开发布三个完全经过人工验证的基准——GSM8K-SEM、GSM-Symbolic-SEM、GSM-Plus-SEM。[^1]
- • **综合评估**:研究跨越多个模型家族的 14 个 SOTA LLM,显示在 GSM-SEM 变体中相对于原始基准的性能一致退化,当语义扰动与符号和增强变体耦合时,失败被放大。
- • **扩展**:证明该框架适用于来自 BigBenchHard(Suzgun et al., 2022 (https://arxiv.org/html/2605.07053#bib.bib28))、LogicBench(Parmar et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib16))和 NLR-BIRD(Singh et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib25))的非 GSM 域外样本。

[^1]: https://sites.google.com/view/gsm-sem/home

## 2 相关工作

GSM8K 是一个广泛用于评估 LLM 小学水平数学推理能力的基准。然而,其广泛的采用和相对标准化的问题格式引发了担忧,即排行榜上的成绩提升可能部分反映了过拟合、污染或记忆,而非稳健的推理(Xie et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib33); Zhang et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib41))。大量工作表明,对问题陈述的小幅更改——包括实体替换、改写和插入无关上下文——会导致性能大幅下降(Shi et al., 2023b (https://arxiv.org/html/2605.07053#bib.bib24); Li et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib9); Wu et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib31); Zhou et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib42); Srivatsa and Kochmar, 2024 (https://arxiv.org/html/2605.07053#bib.bib27); Bhuiya et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib3); Shi et al., 2023a (https://arxiv.org/html/2605.07053#bib.bib23); Karim et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib8)),这表明仅凭强大的 GSM8K 准确率可能是泛化能力脆弱的指标。

**对抗性上下文和干扰项:** 一条研究路线通过引入对抗性或无关信息来探测脆弱性。GSM-IC(无关上下文)(Shi et al., 2023b (https://arxiv.org/html/2605.07053#bib.bib24))表明,LLM 可能会将干扰句纳入中间推理,从而降低性能。iGSM(Ye et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib35))进一步研究了提示和问题结构变化的敏感性。虽然这些对于隔离特定故障模式很有价值,但与最近的多现象套件相比,它们通常针对更窄的扰动集。

**综合扰动套件:** GSM-Plus(Li et al., 2024 (https://arxiv.org/html/2605.07053#bib.bib9))扩展了 GSM8K,包含大量跨越多个扰动类别(例如,改写、干扰项、数值变化、算术/运算变化和高阶推理需求)的衍生变体。这种广度使 GSM-Plus 成为一个有用的现代测试平台,涵盖了干扰项风格的失败(包括 GSM-IC 强调的那些),同时也探测了额外的稳健性维度。许多 GSM-Plus 转换修改了底层计算,因此需要新的真实答案。

**符号合成:** 另一条互补的研究路线通过生成变体的*分布*来解决单点基准的不稳定性。GSM-Symbolic(Mirzadeh et al., 2025 (https://arxiv.org/html/2605.07053#bib.bib14))使用符号模板通过变化名称和数字来合成问题的受控实例,从而支持跨多种实现的统计评估。这种基于模板的观点揭示,模型准确率可能对看似微小的变化(例如,特定值及因此产生的计算)高度敏感,并能支持比小规模迭代扰动更严格的测量。由于 GSM-Symbolic 通常会更改数字,变体需要更新的真实答案。

参见图注
**图 2:** GSM-SEM:语义变体生成管道。GSM-SEM 针对的是以往变体不同的轴:通过对叙述的编辑实现*高语义方差*,同时限制生成以保留原始答案并近似保持难度。这解决了现有许多基准的两个实际限制:(i) 发布的变体是静态的,随着时间的推移可能成为记忆目标;(ii) 用新鲜、可比的扰动扩展它们往往不可行,或者需要重新标注真实答案,这在大规模自动化环境中难以可靠地完成。通过生成新鲜变体同时保持最终答案固定,GSM-SEM 支持无需重新标注的可重复评估,并启用*组合式*稳健性测试:它可以直接应用于 GSM8K,也可以叠加在现有稳健性套件之上。我们特别关注 GSM-Plus 和 GSM-Symbolic,因为它们为这种组合提供了互补的基础——一个广泛的多现象扰动套件(GSM-Plus)和一个模板驱动的框架,支持对同一问题的不同计算进行评估(GSM-Symbolic)。扩展的相关工作/方法细节分享在附录 A (https://arxiv.org/html/2605.07053#A1) 中。

## 3 方法 - GSM-SEM 管道

GSM-SEM 框架(图2 (https://arxiv.org/html/2605.07053#S2.F2))通过双重策展和验证过程,随后基于相似度冗余和可调节的严格性过滤对生成的集合进行修剪,从而生成基于 GSM 的数据集(GSM8k、GSM-Symbolic、GSM-Plus)的语义变体。这些扰动保持与原始数据相同的答案,不改变解决方案所需的计算和数值。该方法还进一步应用于域外数据集(BigBenchHard、LogicBench、NLR-BIRD),以展示其在 GSM 之外更广泛适用的潜力。附录 B (https://arxiv.org/html/2605.07053#A2) 包含提示、模型和设置的详细信息。

##### 语义变体生成

设 $x=(q, a)$ 表示一个包含问题 $q$ 和真实数值答案 $a$ 的原始样本。我们使用两种互补的增强策略生成语义多样化的变体 $\tilde{x}=(\tilde{q}, a)$。这两种策略旨在互补。一种策略以解决方案和答案为条件,固定计算同时允许更大的语义变化。另一种策略以原始问题为条件,在修改叙事元素的同时保留细粒度的结构约束。这些流覆盖了多样性-控制权权衡的不同点,结合它们减少了单独使用任一策略的故障模式。

首先,给定 $(q, a)$,我们提示多样的 LLM 逆向工程一个新问题 $\tilde{q}$,该问题保留由 $a$ 暗示的底层数值计算,同时允许表面形式和上下文事实发生实质性变化(例如,从“新细菌感染”变为“病毒传播”;图1 (https://arxiv.org/html/2605.07053#S1.F1))。由于评估过程仅比较最终数值答案(或者对于基于 LLM 裁判的评估也包括计算),真实值 $a$ 对于这些变体仍然有效。

其次,我们提示 LLM 保持所有数值固定,同时改变问题中的场景/主题,从而保留所需的计算但增加语义多样性(例如,从“瘟疫感染”变为“谣言传播”和“火灾爆发”;图1 (https://arxiv.org/html/2605.07053#S1.F1))。

最后,我们应用基于规则的验证器,以确保每个 $\tilde{q}$ 中出现的所有数值都与相应原始问题 $q$ 中的数值匹配。

##### 自动化质量验证

我们设计自动化验证器的方法是首先让人类评审员评估 70 个随机抽样的增强变体,标记可接受和有缺陷的示例(细节见附录 C.1 (https://arxiv.org/html/2605.07053#A3.SS1))。两名独立评审员对数据的质量和逻辑连贯性进行了标注,这些标注(与我们主要评估中使用的样本不同)被用作输入,以工程化一个裁判 LLM 提示,以镜像相同的决策标准来调整管道。

##### 基于相似度的冗余修剪

设 $x$ 表示基础样本,$\tilde{x}$ 表示候选变体。我们基于词频向量计算余弦相似度 $s(x, \tilde{x})$,并丢弃 $s(x, \tilde{x}) > 0.85$ 的候选者,仅保留与基础样本充分不同的变体。为了进一步促进保留变体之间的多样性,我们额外执行集合级别的去重。具体来说,给定当前保留集 $\mathcal{S}$,仅当 $s(\tilde{x}, x') \leq 0.85$ 对所有 $x' \in \mathcal{S}$ 成立时,才接受候选者 $\tilde{x}$。这一标准确保每个添加的变体既不同于原始样本,也不同于之前保留的变体。

##### 严格性过滤

此步骤应用严格性过滤器来控制最终样本的挑战程度,以进一步过滤简单和冗余的变体。我们首先使用保留集参考模型 $\mathcal{M}_{\text{hold}}$ 评估 $\tilde{x}$,并计算跨模型一致性分数 $c(\tilde{x})$,该分数捕捉 $\mathcal{M}_{\text{hold}}$ 在正确性上的一致性。具有全票一致同意的变体被视为可能*简单*,因为它们可能要么 (i) 过度简化底层任务,从而无法探测稳健性,要么 (ii) 相对于 $x$ 而言扰动不足。为了减轻这两种情况,对于高一致性变体,我们通过约束语义相似度 $s(x, \tilde{x})$ 位于接受窗口 $[\alpha, \beta]$ 内来应用更严格的语义修剪规则;相似度 $s(x, \tilde{x}) \notin [\alpha, \beta]$ 的变

相似文章

LGMT:基于逻辑的变形测试用于评估LLM推理可靠性

arXiv cs.AI

本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。