ADAGE:一种语言无关的类比推理评估流水线
摘要
ADAGE 是一种语言无关的流水线,用于构建具有挑战性且无需翻译的抽象类比推理基准。它揭示了模型在阿拉伯语、阿姆哈拉语和日语中普遍存在的文化推理差距。
arXiv:2607.23058v1 公告类型:新
摘要:多语言推理评估在很大程度上依赖于翻译英语基准,这种做法引入了语言伪影,且未能测试基于文化背景的推理。我们提出了 ADAGE(面向基础评估的类比难度设计评估),这是一种语言无关的流水线,结合母语专家策展与 LLM 辅助生成,构建用于抽象类比推理的高难度、无需翻译的基准。我们通过为阿拉伯语、阿姆哈拉语和日语构建基准来验证 ADAGE。评估 14 个开放权重模型后,我们发现了一致的文化推理差距:在英语谚语推理上表现良好的模型,在所有三个母语基准上均表现吃力,准确率较英语下降 12–52 个百分点。我们发布了该流水线、所有三个基准以及完整的评估套件。
查看缓存全文
缓存时间: 2026/07/28 06:27
# ADAGE: 面向类比推理评估的语言无关流水线 来源: https://arxiv.org/html/2607.23058 ###### 摘要 多语言推理评估严重依赖翻译英文基准测试,这种做法会引入语言伪影,且无法测试扎根于文化的推理能力。我们提出 ADAGE(面向扎根评估的类比难度设计评估),这是一种语言无关的流水线,结合了母语者审核与 LLM 辅助生成,用于构建具有挑战性、无需翻译的抽象类比推理基准。我们通过为阿拉伯语、阿姆哈拉语和日语构建基准来验证 ADAGE。在评估来自三个系列的 14 个开放权重模型时,我们发现了一致的文化推理鸿沟:在英语谚语推理上表现良好的模型,在三种母语基准上的准确率相比英语下降了 12–52 个百分点。我们发布该流水线、所有三个基准以及完整的评估套件¹。 ¹代码与数据:https://github.com/AhmedHajAhmed/adage-benchmark ADAGE: 面向类比推理评估的语言无关流水线 Ahmed Haj Ahmed, Alvin Grissom II 哈弗福德学院 联系方式:[email protected] (https://arxiv.org/html/2607.23058v1/mailto:[email protected]) ## 1 引言 大型语言模型在通常被认为需要复杂推理的任务上表现出色(Hendrycks et al., 2021 (https://arxiv.org/html/2607.23058#bib.bib37);Cobbe et al., 2021 (https://arxiv.org/html/2607.23058#bib.bib38);Srivastava et al., 2023 (https://arxiv.org/html/2607.23058#bib.bib39);Wei et al., 2023 (https://arxiv.org/html/2607.23058#bib.bib1)),然而这一进展几乎完全通过以英语为中心的基准来衡量。多语言评估的主流做法是机器翻译这些基准至其他语言(Fabbri et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib2);Ghosh et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib3))——我们主张,这种做法制造了一种多语言能力的假象。与此同时,即使在英语中,近期工作也表明基准性能可能反映脆弱的启发式而非稳健的推理(Mirzadeh et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib4))。如果我们对英语中的真实推理都没有信心,那么当这些本就脆弱的评估被简单翻译时,情况只会更糟。 通过翻译进行评估存在两个问题:首先,机器翻译引入了不自然的措辞和细微错误——即翻译腔——这会干扰度量:模型的失败可能反映的是翻译质量差而非推理能力差(Graham et al., 2019 (https://arxiv.org/html/2607.23058#bib.bib5);Dey et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib6))。其次,更根本的是,翻译保留了源文化的假设,却丢弃了目标文化的推理模式(rystrøm2025multilingualmulticulturalevaluating)。抽象类比推理——解读像“不认识隼的人会把它烤了”这样的谚语,并将其应用于新情境——通常无法通过翻译幸存,因为底层的文化图式是不可转移的。因此,基于翻译的基准测试模型能否在另一种语言中应用以英语为中心的类比,而非测试它们能否在具有不同假设的另一种文化内部进行推理。 #### 文化推理 我们使用“文化推理”这一术语,特指利用文化共享的隐喻、规范和情境假设(这些并未在文本中明确说明)来恰当应用抽象含义的能力——这是一种本质上与语言和文化绑定的能力(Gentner, 1983 (https://arxiv.org/html/2607.23058#bib.bib26);Holyoak, 2012 (https://arxiv.org/html/2607.23058#bib.bib27))。谚语解读是这种能力的典型实例。认知心理学已表明,谚语理解需要识别上下文之间结构上的对应关系,而这些上下文共享极少甚至没有词汇重叠,而不仅仅是解码字面含义(Gentner, 1983 (https://arxiv.org/html/2607.23058#bib.bib26);Nippold et al., 2001 (https://arxiv.org/html/2607.23058#bib.bib28))。成功的解读依赖于执行功能和更高层次的抽象(Nippold et al., 1998 (https://arxiv.org/html/2607.23058#bib.bib29);Holyoak, 2012 (https://arxiv.org/html/2607.23058#bib.bib27)):推理者必须推断出底层的隐喻,将该关系结构映射到新的上下文,并推导出非字面的结论(Honeck, 1997 (https://arxiv.org/html/2607.23058#bib.bib30))。这些过程并非纯粹语言性的,而是扎根于文化——谚语理解产生于隐喻映射、世界知识和文化熟悉度的相互作用(Alhazmi et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib31);Liu et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib25))。这使得谚语推理成为严格测试系统能否恢复抽象含义并灵活应用(而非依赖表层共现模式)的一项指标。 越来越多的研究工作开始通过母语撰写的基准来填补基于翻译的评估与本土文化推理之间的鸿沟。MultiNRC(Fabbri et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib2))针对法语、西班牙语和汉语中的文化扎根推理;IOLBENCH(Goyal and Dan, 2025 (https://arxiv.org/html/2607.23058#bib.bib8))评估形式语言学推理;Jawaher(Magdy et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib9))提供多方言阿拉伯语谚语集。ProverbEval(Azime et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib10))对低资源埃塞俄比亚语言中的谚语理解进行基准测试。然而,这些工作存在两个共同局限:每个基准都是针对单一语言或语族临时构建的,没有可供其他社区遵循的可复现流水线;而且大多数测试的是谚语解释或含义检索,而非类比应用:即模型能否将谚语的抽象含义映射到新场景。近期证据表明,模型能记住谚语却无法以文化细微的方式对它们进行推理(Liu et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib25)),这凸显了需要测试应用而非回忆的基准。 我们提出 **ADAGE**(面向扎根评估的类比难度设计评估),这是一种语言无关、半合成的流水线,用于构建扎根于文化的推理基准,无需翻译。ADAGE 结合了母语者审核、LLM 辅助场景生成以及一种新颖的干扰项策略:谚语按主题聚类,并利用这一结构选择同簇、跨主题近匹配和随机干扰项,在每个项目中创建受控的难度梯度。由于每个阶段都作用于抽象主题结构而非语言特定特征,该流水线可直接迁移到任何拥有谚语语料库或类似文化推理素材的语言。 #### 贡献 我们通过为三种类型多样的语言——阿拉伯语、阿姆哈拉语和日语——构建基准来验证 ADAGE 的可迁移性,这些语言涵盖两个语系、三种文字和三种资源水平。在零样本条件下评估来自三个系列的 14 个开放权重模型(270M–35B 参数),我们发现了一致的文化推理鸿沟:在英语谚语推理上表现良好的模型(Ghosh and Srivastava, 2022 (https://arxiv.org/html/2607.23058#bib.bib11)),在三种母语基准上的准确率大幅下降 12–52 个百分点。错误分析确认干扰项策略按设计发挥作用,跨主题近匹配吸引了不成比例的错误,且其梯度随模型能力提升而加剧。 我们的贡献如下: 1. ADAGE —— 一个可复现、语言无关的流水线,用于构建扎根于文化的推理基准,并在三种类型多样的语言上经过实证验证。 2. 三个基准——CAPR-ar、CAPR-am 和 CAPR-ja(扎根于文化的类比谚语推理)——用于阿拉伯语、阿姆哈拉语和日语的抽象类比谚语推理,这是首次针对这些语言中该任务的基准。 3. 实证证据表明存在文化推理鸿沟,该鸿沟在模型系列和规模上一致,证明基于翻译的评估高估了多语言推理能力。 ## 2 相关工作 #### 多语言评估及其局限。多语言基准已迅速扩展语言覆盖。BenchMAX(Huang et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib12))评估数十种语言;MMATH(Luo et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib13))将数学推理扩展到多语言环境;XCOPA(Ponti et al., 2020 (https://arxiv.org/html/2607.23058#bib.bib14))测试跨十一种语言的因果常识。然而,主要的构建方法仍然是翻译自英语,由此产生的基准继承了以英语为中心的推理结构。SynDARin(Ghazaryan et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib15))试图通过以英语生成推理步骤再翻译来规模化多语言推理数据,这延续了这种依赖。经验证据证实了问题所在:即使内容涉及其他语言,模型在英语提示下通常表现更好(Dey et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib6);Belay et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib19)),这表明翻译后的提示是降级信号。更根本的是,rystrøm2025multilingualmulticulturalevaluating 认为多语言流畅并不意味多文化理解;模型可以生成语法正确的阿拉伯语,却默认采用西方关于社会规范和推理的假设。 #### 母语撰写与文化推理基准。最近一波工作已超越翻译,转向母语构建的评估。MultiNRC(Fabbri et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib2))针对法语、西班牙语和汉语中的文字游戏和文化扎根推理。IOLBENCH(Goyal and Dan, 2025 (https://arxiv.org/html/2607.23058#bib.bib8))评估与文化知识无关的形式语言学推理。CulturalBench(Chiu et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib17))和 Global PIQA(Chang et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib18))探索多种语言中的文化特定常识。针对阿拉伯语,ARB(Ghaboura et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib16))提供了全面的多模态基准,Jawaher(Magdy et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib9))提供了带解释的多方言谚语集。在谚语推理领域,ePiC(Ghosh and Srivastava, 2022 (https://arxiv.org/html/2607.23058#bib.bib11))通过 BIG-bench 测试英语谚语到叙事的匹配;ProverbEval(Azime et al., 2025 (https://arxiv.org/html/2607.23058#bib.bib10))对包括阿姆哈拉语在内的低资源埃塞俄比亚语言的谚语理解进行基准测试。然而,Jawaher 和 ProverbEval 测试的是谚语*解释*——一种知识检索任务——而非*应用*到新场景。ePiC 针对应用但仅限于英语。与我们的工作相比,这些基准中的每一个都是临时构建的,没有共享的、可复现的流水线可供社区应用于新语言。 #### ADAGE 的定位。ADAGE 填补了这一领域的三个空白。首先,它针对类比*应用*:模型必须将谚语的抽象含义映射到新场景,而不仅仅是解释它;其次,它提供了一个可复现的流水线,带有原则性的干扰项策略——按主题聚类谚语使得同簇干扰项能够测试精细推理,而不仅仅是主题识别;第三,我们在三种类型和正字法上多样的语言(阿拉伯语、阿姆哈拉语和日语)上验证了该流水线,展示了可移植性和灵活性。据我们所知,ADAGE 是首个使母语者社区无需翻译基础设施或临时设计,就能在其自身语言中构建严谨、难度可控的推理基准的方法论。 ## 3 方法论 ADAGE 流水线通过七个阶段构建扎根于文化的推理基准:(1) 数据获取,(2) 主题聚类,(3) 场景生成,(4) 自动过滤,(5) 干扰项选择,(6) 多智能体验证,(7) 数据集整理。每个阶段解决一个不同的失败模式——生成针对质量,过滤针对有效性,干扰项选择针对难度——因此各阶段解耦并可独立跨语言移植。图 1 (https://arxiv.org/html/2607.23058#S3.F1) 提供了视觉概览。完整提示和参数设置见附录;完整流水线以开源代码发布²。 ²代码:https://github.com/AhmedHajAhmed/adage-benchmark 1. 数据获取 谚语语料库 → 标准化与去重 2. 主题聚类 标注 → 嵌入 → 聚类 → 命名 3. 场景生成 每条谚语 10 个场景 via GPT-OSS-120B 4. 自动过滤 语言、长度、关键词、嵌入检查 人工质量审计 母语者合理性检查 5. 干扰项选择与 MCQ 组装 同簇 + 跨主题近匹配 + 随机 6. 多智能体验证 3 个 LLM 裁判 × 3 个准则 7. 数据集整理 按谚语划分训练/开发/测试集 图 1:ADAGE 流水线。七个阶段自上而下流动:(1) 获取并去重谚语,(2) 嵌入并按主题聚类,(3) 通过 LLM 生成场景,(4) 通过语言/长度/关键词/嵌入检查过滤,(5) 组装同簇、跨主题近匹配和随机干扰项,(6) 使用 3 个 LLM 裁判 × 3 个准则验证,(7) 按谚语划分训练/开发/测试集。实线框为自动阶段;虚线框(阶段 4 和 5 之间)为人工质量审计。除阶段 (1) 外所有阶段均语言无关。 ### 3.1 主题聚类与干扰项策略 ADAGE 的核心方法论贡献在于利用主题聚类实现*难度设计*的干扰项选择。聚类过程分三步进行。 **第一步**,给定谚语文本及其母语解释,大型语言模型为每条谚语分配一个简洁的英文主题标签(例如“耐心与坚持”、“背叛的后果”)。使用英文标签是因为它们仅作为中间聚类目标——在最终基准项目中从不暴露——且标注模型在英文中表现出更强的指令遵循能力(Dey et al., 2024 (https://arxiv.org/html/2607.23058#bib.bib6))。 **第二步**,使用多语言句子转换器(Reimers and Gurevych, 2019 (https://arxiv.org/html/2607.23058#bib.bib21))嵌入唯一主题标签,并通过 Ward 链接的凝聚聚类进行分组。聚类数 \(k\) 通过穷举搜索 \(k \in [10, 25]\) 选择,选取使加权轮廓系数(Rousseeuw, 1987 (https://arxiv.org/html/2607.23058#bib.bib22))最大化的值³。 ³三种语言的最优加权轮廓分数均较低:0.058(阿拉伯语,\(k=24\))、0.052(阿姆哈拉语,\(k=20\))和 0.075(日语,\(k=8\))。这是预期而非问题。谚语本质上是多义的:一条谚语可能编码重叠的主题(例如,
相似文章
通过类比教学:教育类比生成的模块化流水线
本文提出了一种用于教育类比生成的模块化流水线,将任务分解为四个阶段,并评估了12种大语言模型和7种嵌入模型。结果表明,子概念基础化能够提升解释质量和检索精度,同时采用了一种新颖的LLM作为裁判的评估方法,并针对七名人类标注员的标注进行了验证。
AdaMame: 自适应多语言推理的训练方案
本文介绍了AdaMame,一种两阶段训练方案(SFT + GRPO),用于在多语言数学推理中自适应地将推理语言与查询语言对齐,在不牺牲准确性的情况下缓解语言崩溃。
A2RBench:一种自动化的可形式化验证抽象推理基准生成范式
本文介绍了A2RBench,一个用于为LLM生成可形式化验证的抽象推理基准的自动化流水线,它利用循环一致性来确保唯一解,并揭示当前LLM在3D推理任务上显著落后于人类。
AGORA: 基于档案的智能体工作场所文档推理基准
AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。
GraphARC:基于图结构的抽象推理综合基准
GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。