\textsc{DiARC}: 区分正负样本有助于提升大语言模型的类ARC推理能力

arXiv cs.CL 论文

摘要

DiARC是一种方法,通过从正负样本构建偏好对来提升大语言模型在类ARC任务上的推理能力,在多个基准测试中优于基线模型。

arXiv:2606.26530v1 公告类型:新 摘要:抽象与推理语料库(ARC;~\citealp{chollet2019measure})包含需要从有限的网格样本中总结模式并预测输出网格的任务。近期,许多基于大语言模型的方法尝试将其转化为基于文本的推理任务。然而,基于开源模型的方法普遍效果不佳,而依赖闭源模型的方法成本过高。当前的研究主要集中在数据增强上,即构建类ARC数据以进行更全面的监督微调。本文认为,解决类ARC问题不仅需要正样本监督,还需要通过区分负样本来提升模型推理能力。为此,我们借鉴偏好对齐的思想,提出了一种名为\textsc{DiARC}的方法,通过构建偏好对使模型能够区分正负样本。具体而言,我们提出了三种构建负样本的方式:输出级视觉变换、DSL级规则反转以及任务特定规则编辑。生成的负样本在不改变观察示例的前提下提供了具有信息性的接近错误替代方案。在多个类ARC基准上的实验结果表明,\textsc{DiARC}持续提升了基线模型的性能。代码已发布在 https://github.com/szu-tera/DiARC。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:18

# DiARC: 区分正负样本有助于提升大语言模型的类ARC推理能力 来源: https://arxiv.org/html/2606.26530 Yuxuan Yang∗, Feiyang Li∗, Yile Wang🖂 深圳大学计算机与软件学院 ###### 摘要 抽象推理语料库 (ARC;Chollet,2019 (https://arxiv.org/html/2606.26530#bib.bib9)) 包含需要从有限的网格样本中总结模式并预测输出网格的任务。最近,许多基于大语言模型的方法试图将其转化为基于文本的推理任务。然而,基于开源模型的方法效果普遍不理想,而基于闭源模型的方法成本过高。当前的努力主要集中在数据增强上,构建类似ARC的数据以进行更全面的监督微调。在这项工作中,我们认为解决类似ARC的问题不仅需要正样本监督,还需要通过区分负样本来提升模型推理能力。为此,我们借鉴偏好对齐的思想,提出DiARC,一种通过构建偏好对使模型能够区分它们的方法。具体来说,我们提出了三种构建负样本的方法,包括输出级视觉变换、DSL级规则反转和任务特定规则编辑。所得到的负样本在保持观察到的演示不变的同时,提供了信息丰富的“近似错误”替代方案。在多个类似ARC基准上的实验结果表明,DiARC在基线模型上持续提升性能。代码发布在 https://github.com/szu-tera/DiARC。

## 1 引言

大语言模型 (LLMs) 在自然语言理解 (Yang et al., 2024b (https://arxiv.org/html/2606.26530#bib.bib1)) 和数学推理 (Ahn et al., 2024 (https://arxiv.org/html/2606.26530#bib.bib8)) 方面取得了显著进展。然而,它们在解决抽象符号任务方面的能力仍存在一些局限性 (Gendron et al., 2023 (https://arxiv.org/html/2606.26530#bib.bib65); Wang et al., 2024b (https://arxiv.org/html/2606.26530#bib.bib64)),并且近期的工作尝试改进LLM以解决典型的抽象推理语料库 (ARC; Chollet, 2019 (https://arxiv.org/html/2606.26530#bib.bib9))。在该任务中,模型必须从少量的基于网格的输入输出示例中推断出一个潜在的变换规则,并将其应用于一个新的测试输入,如图1(a)所示。

图1: ARC任务及我们方法的示意图。 (a) ARC问题的可视化示例。 (b) 仅使用正确目标监督的传统方法。 (c) DiARC 利用负样本并通过偏好对齐目标优化模型。

然而,目前的结果仍然有限,并且更强的前沿LLM系统通常需要大量的推理时间成本才能获得更高的ARC性能,这凸显了ARC中抽象规则归纳的难度 (ARC Prize, 2026 (https://arxiv.org/html/2606.26530#bib.bib13); Vahdati et al., 2026 (https://arxiv.org/html/2606.26530#bib.bib7))。近期在提升LLM的ARC推理能力方面的进展日益依赖于扩大超出原始基准任务的监督。Franzen et al. (2025 (https://arxiv.org/html/2606.26530#bib.bib17)) 利用RE-ARC数据集 (Hodel, 2024 (https://arxiv.org/html/2606.26530#bib.bib10)) 构建了围绕ARC特定数据增强的训练流程。Wang和Huang (2025 (https://arxiv.org/html/2606.26530#bib.bib29)) 提出了基于程序的ARC任务数据合成方法,使模型接触到更多类似ARC的监督。NVARC (Sorokin和Puget, 2025 (https://arxiv.org/html/2606.26530#bib.bib14)) 进一步推动了这一趋势,引入了一个多阶段的合成数据生成流程,其中使用LLM生成谜题摘要、组合更复杂的任务描述,并用代码生成相应的输入输出网格逻辑,从而为类似ARC的训练产生了一个大规模的合成语料库。尽管这些方法在构建额外监督的方式上有所不同,但整体流程仍然仅依赖于对正确目标的输入输出监督,如图1(b)所示。

从学习和认知科学的角度来看,解决难题不仅来自于正确的示例,也来自于识别和纠正信息丰富的错误 (Metcalfe, 2017 (https://arxiv.org/html/2606.26530#bib.bib18); Dieterich et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib2))。这个想法对于训练LLM也很有用。例如,从步骤级的偏好信号和错误轨迹中学习可以提升长链数学推理性能 (Lai et al., 2024 (https://arxiv.org/html/2606.26530#bib.bib3); Lu et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib4))。LeGris et al. (2025 (https://arxiv.org/html/2606.26530#bib.bib20)) 也表明,在ARC中的人类解题者可以通过多次尝试利用反馈来改进。受此启发,我们提出DiARC,一个偏好对齐框架,通过鼓励LLM区分正确输出和被拒绝的替代方案来提升ARC推理能力,示例如图1(c)所示。

具体来说,DiARC 构建偏好对,其中选中的响应是查询输入的答案,而被拒绝的响应是从该任务中派生的负样本。负样本的构建分为三个层次:(1) 直接应用于输出网格的视觉修改,以产生看似合理但违反底层规则的候选答案;(2) 从任务特定的变换程序中提取的重复领域特定语言模式,生成可在不同任务间复用的程序级重写,从而产生规则级别的负样本;(3) 利用LLM辅助编辑每个任务的变换规则,构建尽可能接近原始规则语义对立的任务特定负样本。在这些偏好对上训练,使得模型不仅优化正确性,还优化区分正确规则和看似合理的近似错误替代方案的能力。

我们在六个ARC基准上进行评估,包括:ARC-AGI-1 (Chollet, 2019 (https://arxiv.org/html/2606.26530#bib.bib9))、ARC-AGI-2 (Chollet et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib16))、MiniARC (Kim et al., 2022 (https://arxiv.org/html/2606.26530#bib.bib6))、ConceptARC (Moskvichev et al., 2023 (https://arxiv.org/html/2606.26530#bib.bib27))、1D-ARC (Xu et al., 2024 (https://arxiv.org/html/2606.26530#bib.bib32)) 和 ARCcommunity。使用三个开源LLM的实验结果表明,DiARC 在所有ARC数据集上均取得一致的性能提升。使用Qwen3模型时,在ARC-AGI-1、MiniARC和ConceptARC上取得超过96%的准确率,优于各种ARC专用模型和强大的闭源LLM。

图2: DiARC 的负样本构建策略示例。 (a) ARC任务1f0c79e5的可视化。 (b) 输出级视觉变换 (§3.2 (https://arxiv.org/html/2606.26530#S3.SS2))。 (c) DSL级规则反转 (§3.3 (https://arxiv.org/html/2606.26530#S3.SS3))。 (d) 任务特定规则编辑 (§3.4 (https://arxiv.org/html/2606.26530#S3.SS4))。

## 2 预备知识与动机

#### ARC任务形式化。
一个类ARC任务 τ 由一个支持集 Sτ = {(Ii, Oi)}_(i=1)^(nτ)、一个查询输入网格 qτ 和一个目标输出网格 Oτ* 组成。每个网格被转换为 {0,...,9} 中的数值条目,其中每个整数表示相应颜色的网格。每个任务由一个潜在的任务特定变换 Tτ 控制,使得对于 i=1,...,nτ 有 Oi = Tτ(Ii),并且 Oτ* = Tτ(qτ)。支持集 Sτ 和查询 qτ 被序列化到输入提示 xτ 中,目标输出 Oτ* 被序列化到输出 yτ 中,用于LLM。因此,每个ARC任务被转换为一个标准的序列到序列示例 (xτ, yτ),并且可以被视为语言建模风格中的下一个网格预测。

#### 监督微调。
给定一个自回归LLM πθ,令 DSFT = {(xτ, yτ)} 表示从序列化的ARC任务构建的训练集,监督微调 (SFT) 通过最大化给定输入提示的目标序列中每个token的条件似然来优化模型:
LSFT(θ) = -E_(xτ, yτ)~DSFT [ Σ_(t=1)^(|yτ|) log πθ(yτ_t | xτ, yτ_<t) ]

#### 使用正负样本进行偏好学习。
然而,SFT仅最大化正确输出的可能性,并未利用关于不正确答案的信息。为了解决这个问题,我们采用偏好对齐。令 DPF = {(xτ, yτ^w, yτ^l)} 表示一个偏好数据集,其中 yτ^w 是选中的输出(正确输出),yτ^l 是被拒绝的输出(负样本)。DPO (Rafailov et al., 2023 (https://arxiv.org/html/2606.26530#bib.bib15)) 无需显式奖励模型即可优化,其目标是最小化以下损失:
L_DPO(πθ; πref) = -E_(x, y^w, y^l)~DPF [ log σ(β * (log(πθ(y^w|x) / πref(y^w|x)) - log(πθ(y^l|x) / πref(y^l|x)))) ]

许多现有工作通过生成或数据增强扩展了微调数据,但仅关注正确输出。相比之下,我们基于SFT初始化的模型,通过构建偏好对来训练模型区分正输出和负输出。

## 3 DiARC

我们现在介绍DiARC。核心思想是构建偏好对,其中选中的响应是任务的正确答案,被拒绝的响应是使用三种不同策略之一构建的负样本:输出级视觉变换、DSL级规则反转和任务特定规则编辑。这三种策略从不同层面生成信息丰富的负样本,帮助模型学习区分正确模式与看似合理的错误替代方案。

### 3.1 问题设置:偏好对构建

对于每个ARC任务 τ,DiARC 首先从查询输入 qτ 生成一个候选集 Cτ。然后,我们构建偏好对 (xτ, yτ^w, yτ^l),其中:
- xτ 是通过序列化支持集 Sτ 和查询输入 qτ 得到的输入提示。
- yτ^w 是任务的目标输出网格 Oτ*。
- yτ^l 是候选集 Cτ 中的一个负样本,使用 §3.2-§3.4 中描述的三种策略之一构建。

### 3.2 输出级视觉变换策略 (OVT)

我们通过在输出空间直接应用视觉变换来生成负样本,保持网格布局但修改视觉细节。这些变换包括:随机扰动(对网格对象的颜色、位置或形状随机扰动)、刚性平移(整体平移网格模式,类似于对称变换)、网格块变换(对选定的连续块进行变换)、形态学变换(侵蚀或膨胀对象边界)。给定原始输出 Oτ*,应用随机选择的变换得到负样本 ŷτ^l。

### 3.3 DSL级规则反转策略 (DLI)

我们利用与ARC任务相关的特定领域语言 (DSL) 中的变换程序。对于每个任务 τ,假设其与一个变换程序 pτ 相关联,该程序实现任务规则。DSL提供了一组常用操作(如 set、extract、topological_operations 等)。我们定义一个反转操作集合 R_DSL,使得对于每个程序 pτ,可以生成其反转版本 pτ⁻¹,该版本在保持程序结构的前提下改变其语义效果。然后,将 pτ⁻¹ 应用于查询输入 qτ,得到负样本 ŷτ^l。

注意:在实际实现中,并非所有程序都有简单、合理的反转。我们仅为那些反转后能产生与原始输出明显不同但在语义上仍有意义的程序生成反转。

### 3.4 任务特定规则编辑策略 (TSE)

我们利用LLM辅助编辑每个任务的变换规则,以创建接近正确规则语义反面的新规则。给定任务 τ 的描述和可选的DSL程序 pτ,我们使用LLM(如GPT-4)生成编辑后的规则 rτ^edit。具体说明如下:编辑后的规则应保持与原始规则相同的输入输出关系类型,但修改核心变换逻辑,使其结果与原始规则产生的结果在视觉上明显不同。然后,我们应用这个编辑后的规则到查询输入 qτ,得到负样本 ŷτ^l。

与DSL级反转不同,任务特定编辑允许更灵活的规则修改,不局限于DSL操作的反转,而是利用LLM的语义理解和创造力。

图2展示了这三种策略的示例。

## 4 实验

### 4.1 设置

基准和评估。我们在六个类ARC基准上评估我们的方法:ARC-AGI-1 (Chollet, 2019 (https://arxiv.org/html/2606.26530#bib.bib9))(400个训练任务,100个公共验证任务)及其私有测试集、ARC-AGI-2 (Chollet et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib16))(400个训练任务)、MiniARC (Kim et al., 2022 (https://arxiv.org/html/2606.26530#bib.bib6))(100个训练任务)、ConceptARC (Moskvichev et al., 2023 (https://arxiv.org/html/2606.26530#bib.bib27))(200个训练任务)、1D-ARC (Xu et al., 2024 (https://arxiv.org/html/2606.26530#bib.bib32))(100个任务)、ARCcommunity(来自社区收集的ARC任务集合,我们使用其公开发布的训练集)。我们使用自回归解码生成候选网格,然后使用产品专家评分进行选择。主要指标是任务准确率:如果最终输出与目标完全匹配,则认为任务成功。

基线和骨干模型。我们使用三个开源LLM作为骨干:Llama-3.2-3B (AI@Meta, 2024 (https://arxiv.org/html/2606.26530#bib.bib11))、Qwen3-4B (Yang et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib12)) 和 Minitron-8B (Sridhar et al., 2025 (https://arxiv.org/html/2606.26530#bib.bib66))。这些模型覆盖了不同规模和能力范围,能够评估DiARC的泛化能力。每个骨干模型的基线是经过SFT的初始化模型。我们还与先前报告的结果进行比较,包括广泛使用的闭源模型(如ChatGPT-4 (OpenAI, 2023 (https://arxiv.org/html/2606.26530#bib.bib67))、Claude 3.5 Sonnet (Anthropic, 2024 (https://arxiv.org/html/2606.26530#bib.bib68)))以及ARC领域中的现有开源方法。

表1:不同骨干模型在六种基准上的结果(准确率%)。'SFT Init.' 行显示监督微调初始化的性能,'DiARC' 显示偏好对齐后的性能。每个基准的最佳结果以粗体显示,每种骨干模型的最佳结果以下划线标出。'n/a' 表示模型在此基准上未测试或报告。对于ARC-AGI-2,验证集结果基于发布的100个任务子集。

表3:输出级负样本族在不同骨干模型和基准上的消融结果。报告的是测试或验证准确率。对于每个骨干-基准组合,相对于相应的SFT初始化模型,我们报告增益(gain > 1.00)或损失(gain ≤ 1.00,或loss)。对于1D-ARC,仅适用随机扰动和刚性平移操作,因此不报告网格块和形态学结果。

偏好数据构建。对于ARC-AGI-1,三种负样本构建策略均基于RE-ARC (Hodel, 2024 (https://arxiv.org/html/2606.26530#bib.bib10)),该数据集为400个原始ARC训练任务提供了任务特定的生成器。对于输出级视觉变换,我们首先使用这些生成器采样ARC任务,然后应用输出空间变换构建被拒绝的输出。对于DSL级规则反转和任务特定规则编辑,我们操作相应的任务特定变换程序来生成选中/被拒绝对。对于其余五个基准,没有可用的RE-ARC风格每任务生成器。因此,我们仅使用输出级视觉变换策略进行偏好构建。对于ARC-AGI-2,偏好数据从发布的NVARC-full (Sorokin和Puget, 2025 (https://arxiv.org/html/2606.26530#bib.bib14)) 资源构建。对于MiniARC、ConceptARC、1D-ARC和ARCcommunity,我们使用其官方训练集,使用相同的面向ARC的负样本构建流程来构建偏好数据。在所有六个基准上,我们尽可能保持偏好学习设置一致:原始支持演示和查询输入始终保留,仅根据可用的负样本构建策略改变被拒绝的输出。这种设计有助于将DiARC的贡献与其他变化来源隔离开,并使跨基准和跨骨干的比较更易解释。这些实验中使用的构建偏好数据集的详细统计信息见附录A (https://arxiv.org/html/2606.26530#A1)。

训练细节。我们使用共享设置训练所有模型:学习率1×10^(-6),有效批量大小8,余弦学习调度,预热比例0.1,最大序列长度4096,最大提示长度3584。使用LoRA (Hu et al., 2022 (https://arxiv.org/html/2606.26530#bib.bib62)) 微调,模型特定设置总结在附录B (https://arxiv.org/html/2606.26530#A2) 中。所有实验在单个NVIDIA L40 GPU上进行。

### 4.2 主要结果

表4.1 (https://arxiv.org/html/2606.26530#S4.SS1) 和 4.1 (https://arxiv.org/html/2606.26530#S4.SS1) 展示了所有六个类ARC基准的结果,表3 (https://arxiv.org/html/2606.26530#S4.T3) 按不同输出级负样本族分解结果,表4 (https://arxiv.org/html/2606.26530#S4.T4) 比较ARC-AGI-1上的DSL级反转和任务特定编辑。

#### DiARC 在多种骨干和基准上带来广泛提升。
如表4.1 (https://arxiv.org/html/2606.26530#S4.SS1) 和 4.1 (https://arxiv.org/html/2606.26530#S4.SS1) 所示,DiARC 在Llama-3.2-3B、Qwen3-4B和Minitron-8B的所有六个基准上均提升了SFT基线的性能,在18个模型-基准对上的平均绝对增益为2.48个百分点。这些增益不仅出现在较弱的SFT基线上,也出现在像Qwen3-4B这样的强基线上。增益并非随模型规模单调增加:三个骨干分别获得平均2.52、2.21和2.72个百分点的提升。当使用Qwen3骨干模型时,DiARC 在ARC-AGI-1、MiniARC和ConceptARC上达到超过96的准确率,超过了闭源模型和现有开源模型方法,展示了其有效性。

#### 可以在多个层次构建有用的偏好信号。
表3 (https://arxiv.org/html/2606.26530#S4.T3) 显示,四个输出级负样本族在平均上比初始化模型有所提升,其中形态学变换给出最强的平均性能,尽管最佳族因数据集和骨干而异。一个可能的原因是ARC是围绕一组类似于人类的先验构建的,尤其是对象性以及基本几何和拓扑 (Chollet, 2019 (https://arxiv.org/html/2606.26530#bib.bib9))。与其他扰动相比,基于形态学的负样本更直接地改变对象边界、连通性和其他结构属性,同时保留对象布局。这使得它们更可能保持在ARC旨在测试的面向对象的变换空间内,因此更有可能提供信息丰富的近似错误替代方案。同时,最有效的负样本族因骨干而异,这可能与模型底层能力的差异有关,因为它们可能发展出不同的归纳偏差和特征错误模式,从而从不同形式的困难负样本监督中受益。

表4 (https://arxiv.org/html/2606.26530#S4.T4) 显示,DSL级反转和任务特定编辑在ARC-AGI-1上均带来增益。然而,在任务特定编辑下,我们观察到当大约200个任务被编辑时出现暂时的性能下降,然后随着编辑任务数量的增加而恢复。这是因为LLM辅助编辑往往将负样本映射到少数重复的任务类型,如集合/提取操作、压缩摘要以及边界框或轮廓提取。当编辑集相对较小时,这些重复模式可能主导训练信号,使模型偏向于一组狭窄的负样本构造。随着编辑集变得更大且更多样化,这种偏差被稀释,使得模型能够更好地捕获正负规则之间的预期对比。总的来说,结果表明DiARC的益处并不依赖于单一的负样本构建方案。

| 模型 | SFT Init. | DSL-Level | Task-Specific Edit 100 | 200 | 400 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| Llama-3.2-3B | 59.38 | 60.25 | 60.12 | 59.13 | 59.62 |
| Minitron-8B | 71.25 | 72.38 | 71.88 | 71.38 | 72.00 |
| Qwen3-4B | 96.25 | 96.75 | 97.00 | 96.50 | 97.00 |

表4: ARC-AGI-1上DSL级反转与任务特定编辑的比较。对于任务特定编辑,我们报告了分别在100、200和400个编辑任务三种数据设置下的结果。

## 5 分析

### 5.1 生成和判别的影响

我们的ARC系统首先生成候选解决方案,然后使用产品专家评分来选择最终答案。因此,DiARC 可以通过两个不同的渠道提升性能:它可能增加

相似文章

GraphARC:基于图结构的抽象推理综合基准

arXiv cs.AI

GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。