CDR-Bench:评估组合性、顺序敏感数据精炼指令的忠实执行能力

arXiv cs.AI 论文

摘要

介绍CDR-Bench,一个包含3,462个任务的基准,用于评估LLM忠实执行组合性、顺序敏感数据精炼指令的能力。在10多个LLM上的实验表明,在组合性和顺序敏感的设置中性能显著下降,凸显了缺乏执行流程的忠实性。

arXiv:2606.31435v1 公告类型: 新 摘要:数据精炼涉及在演变的文本状态上执行多步骤指令,其中处理算子的组合和执行顺序共同决定结果。现有基准要么孤立地处理文本编辑,要么将其与代码和工具执行混杂在一起,尚不清楚LLM能否直接且忠实地执行这些组合性、顺序敏感的数据精炼指令。为填补这一空白,我们提出了CDR-Bench,一个全面的基准,包含3,462个高质量任务,涵盖四个真实世界的数据精炼领域和29个不同的算子。我们的基准在原子级、顺序无关和顺序敏感三种设置下评估模型,利用确定性参考输出来实现精确评估。在10多个最先进的LLM上的实验揭示了一致的失败模式:性能在组合设置中急剧下降,顺序敏感的指令成功几乎崩溃。这些发现强调了当前LLM缺乏可靠组合数据精炼所需的流程忠实性。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:38

# CDR-Bench:评估组合性、顺序敏感数据精炼指令的忠实执行

**来源**:[https://arxiv.org/html/2606.31435](https://arxiv.org/html/2606.31435)

Yuchen Huang¹³,Xiang Li²³††,Zhenqing Ling³,Sijia Li¹,Qianli Shen³,Daoyuan Chen³††,Yi R. (May) Fung¹††,Yaliang Li³

¹HKUST,²NUS,³通义实验室,阿里巴巴集团

![[未配图标题]](https://arxiv.org/html/2606.31435v1/figs/tongyi.jpeg)

###### 摘要

数据精炼涉及在演变中的文本状态上执行多步指令,其中处理算子的组合和执行顺序共同决定结果。现有基准要么孤立地评估文本编辑,要么将其与代码和工具执行纠缠在一起,因此尚不清楚LLM是否能够直接且忠实地执行这些组合性、顺序敏感的数据精炼指令。为填补这一空白,我们引入了CDR-Bench,一个全面的基准,包含3,462个高质量任务,涵盖四个真实世界的数据精炼领域和29个不同的算子。我们的基准在原子级、顺序无关和顺序敏感设置下评估模型,利用确定性参考输出实现精确评估。对10余个最先进LLM的实验揭示了一致的失败模式:在组合设置下性能急剧下降,顺序敏感指令的成功率大幅下降。这些发现表明,当前LLM缺乏实现可靠组合数据精炼所需的过程忠实性¹¹¹我们的代码和数据发布在https://github.com/lukahhcm/data-juicer-hub/tree/CDR-Bench。

---

# CDR-Bench:评估组合性、顺序敏感数据精炼指令的忠实执行

Yuchen Huang¹³††(工作期间在阿里巴巴集团实习),Xiang Li²³††,Zhenqing Ling³,Sijia Li¹,Qianli Shen³,Daoyuan Chen³††(通讯作者),Yi R. (May) Fung¹††,Yaliang Li³

¹HKUST,²NUS,³通义实验室,阿里巴巴集团

![[未配图标题]](https://arxiv.org/html/2606.31435v1/figs/tongyi.jpeg)

## 1 引言

见图1

**图1**:组合数据精炼过程示意图。语言模型接收原始输入文档以及指定多步指令过程的用户请求,直接输出处理后的目标文本以及最终执行判断。

数据精炼,即将嘈杂、异构的原始文本转换为干净、任务就绪数据的过程,是现代LLM流水线的核心组件。它支撑着预训练语料构建(Chen et al., 2024a;Qin et al., 2025)、RAG系统中的可靠知识检索(Liu et al., 2026;Khan et al., 2024)以及隐私敏感部署(Garza et al., 2025;Pal et al., 2024)等应用。传统上,精炼流水线依赖于启发式规则和手工编写的脚本(Lee et al., 2021;Li, 2019)。尽管可重复,但随着语料、数据策略和下游需求的变化,这些流水线变得脆弱。LLM的崛起为数据精炼提供了更灵活的接口,允许用户在文本清洗、质量过滤、信息提取、个人身份信息(PII)编辑和幻觉处理等任务中,用自然语言指定目标。

**表1**:与代表性任务特定编辑基准和数据中心智能体基准的范围比较。CDR-Bench独特地要求在原始文本上对组合精炼指令进行忠实、顺序敏感的执行,并具有确定性评估。

尽管具有这种灵活性,但这些操作很少孤立执行。真实世界的数据精炼需要在不断演变的文本状态上执行一个*组合性*且*顺序敏感*的相互依赖操作流水线,其中指令不仅指定了*应用什么*,还指定了*何时应用*。即使LLM可以作为单一原子操作的能力代理,精炼的组合性意味着小错误很容易在顺序执行中累积,导致最终流水线失败。除了组合性之外,顺序敏感的要求还带来了更严峻的挑战:由于流水线执行中的每一步都可能改变后续步骤看到的上下文,重新排序操作会 drastically 改变中间状态、最终的编辑文本以及最终的保留/丢弃决策。因此,此设置中的正确性严格来说是过程性的:模型必须忠实地执行一个潜在的序列,而不仅仅是生成一个表面上合理的输出。

然而,如表1所示,现有基准未能充分评估这种过程忠实性。标准的指令驱动文本编辑基准(Dwivedi-Yu et al., 2022;Zeng et al., 2026)侧重于孤立的编辑,完全忽略了组合性和顺序敏感的指令。相反,最近的数据中心智能体处理多步流水线(Liu et al., 2025;Lei et al., 2025),但其端到端评估将模型的内在过程理解与沙盒执行、调试和代码生成纠缠在一起。为了理清这些因素并隔离底层模型的真实数据精炼能力,*直接指令执行*是一个关键的诊断原语。如图1所示,它直接评估LLM是否能够在没有外部支撑的情况下,将正确的操作以正确的顺序应用到正确的中间状态。

这一关键空白引发了一个问题:LLM能否忠实且直接地执行组合性、顺序敏感的数据精炼指令?

为了回答这个问题,我们引入了**CDR-Bench**,一个旨在评估LLM在组合性、顺序敏感数据精炼方面能力的全面基准。如图2所示,CDR-Bench包含3,462个任务,涵盖四个真实世界的数据精炼领域——Web精炼、LaTeX精炼、RAG准备和隐私编辑——包含29个算子、63个指令模板、两个原子轨道(Atomic-M/F)和三个组合轨道(Agnostic-M、Order-M和Order-F)。关键的是,所有任务都有确定性参考输出,从而实现精确、客观的评估,而无需依赖LLM作为评判者的范式。我们的评估框架将模型能力分为三个不同层次:原子算子执行、顺序无关指令执行和顺序敏感指令执行。为了严格评估这些层次的性能,我们进一步提出了三个互补指标:指令成功(RS)用于精确匹配验证、顺序一致成功(OCS)用于衡量对顺序排列的鲁棒性、以及精炼增益(RG)用于部分进展。通过对十几个最先进的LLM进行广泛实验,我们发现组合指令执行暴露了一个根本性限制,即单个算子的性能无法预测。模型经常产生表面上看起来合理、但实际上 silently 违反了预期执行顺序的输出,并且在所有测试的顺序中,不到5%(Order-M)和19%(Order-F)的顺序敏感组被正确解决,尽管整体文本质量保持相对稳定。延迟的过滤决策尤其脆弱:仅仅将过滤器从转换序列之前移到之后,精确指令成功就下降超过47个百分点(pp),这个差距既不是提示工程也不是少样本示例能够完全弥补的。这些发现表明,数据精炼的进步需要从表面文本编辑转向真正的过程忠实性,而CDR-Bench提供了一个可复现的测试平台来测量和推动这一进步。

见图2

**图2**:CDR-Bench概览。该基准涵盖四个数据精炼领域(隐私编辑、Web精炼、LaTeX精炼和RAG准备)。基准评估三个级别的指令执行:(i) 单一算子(Atomic-M/F);(ii) 顺序无关指令(Agnostic-M);(iii) 顺序敏感指令:映射器排列(Order-M)和过滤器在Pre/Mid/Post位置上的放置(Order-F)。这里,映射器(M)和过滤器(F)分别表示转换和过滤算子。百分比是基于各领域和轨道中独特指令模板计算的。

## 2 CDR-Bench

在本节中,我们介绍定义、数据集构建流程、指标和统计数据。

### 2.1 任务形式化

#### 组合数据精炼

我们的基准评估大型语言模型能否执行以自然语言描述的*组合数据精炼指令*。一个精炼指令 \(r = (o_1, o_2, \dots, o_n)\) 是一个有序的数据处理算子序列²²每个\(o_i\)表示一个数据处理算子。遵循Data-Juicer(Chen et al., 2024a, 2025)的术语,我们考虑两种算子类型:*映射器*(M),根据预定义规则重写文本;以及*过滤器*(F),返回二进制的KEEP/DROP决策。, 应用于输入文本 \(t_0\)。形式上,指令 \(r\) 在输入 \(t_0\) 上的确定性参考执行表示为 \(E(t_0, r) = (s^\star, t^\star)\)。这里,\(s^\star \in \{\texttt{KEEP}, \texttt{DROP}\}\) 表示真实执行状态,\(t^\star\) 表示参考编辑文本。具体来说,如果 \(s^\star = \texttt{KEEP}\),则 \(t^\star\) 是执行所有算子后的最终文本;如果 \(s^\star = \texttt{DROP}\),则 \(t^\star\) 是紧接在第一个拒绝过滤器之前应用的最后文本状态。相应地,给定输入文本 \(t_0\) 和描述指令 \(r\) 的自然语言指令 \(q(r)\),语言模型 \(M\) 的执行定义为 \(M(t_0, q(r)) = (\hat{s}, \hat{t})\)。模型预测其自己的执行状态 \(\hat{s}\) 和生成的文本 \(\hat{t}\)。核心任务是评估 LLM 的执行 \(M(t_0, q(r))\) 是否与确定性参考 \(E(t_0, r)\) 一致。

#### 顺序敏感指令

除了基本的组合性,我们进一步评估模型是否正确处理执行顺序依赖。如果一个指令组中的多个指令共享相同的算子集合但在不同算子排序下产生不同的执行结果,我们称该指令组为*顺序敏感*。形式上,对于给定输入文本 \(t_0\),由相同算子的不同排列形成的两个指令 \(r_i\) 和 \(r_j\),如果它们的参考执行结果不同,即 \(E(t_0, r_i) \neq E(t_0, r_j)\),则它们是顺序敏感的。例如,一个*文本长度过滤器*放在编辑映射器之前可能产生KEEP,而同一个过滤器放在之后则产生DROP,因为清洗后的文本变短了。

### 2.2 基准构建

#### 概述

图2展示了CDR-Bench数据集的概览。CDR-Bench旨在评估LLM是否能忠实地执行基于真实数据处理需求的组合数据精炼指令。基准构建流程分为四个阶段:(1)收集异构语料并在单个记录上激活映射算子;(2)挖掘频繁算子共现模式以识别指令候选;(3)用确定性参考实现轨道;(4)将每个指令口头化为多样的自然语言指令。

#### 数据收集和算子激活

我们从Common Crawl 2026快照、arXiv预印本(TIGER-Lab, 2025)、Wikipedia、GovReport(Huang et al., 2021)以及多个PII数据集(Nutrient.io, 2025;Ai4Privacy Community, 2023a;Steier et al., 2025)中获取数据,并按四个功能领域组织:Web精炼(WR)、LaTeX精炼(LR)、RAG准备(RP)和隐私编辑(PR)。对于每个领域,我们定义一组针对常见精炼需求的候选映射器和过滤器算子(详见附录A.1)。然后,我们对原始记录进行算子级激活分析,以识别哪些映射器在每个样本上产生非平凡变化,从而得到一个特定领域的记录池,这些记录附带有其激活的映射算子。该标注池作为后续指令挖掘步骤的经验基础,确保指令构建基于自然出现的算子模式而不是作者任意定义的组合。

#### 指令挖掘

在每个标注池内,我们通过贪婪覆盖过程识别代表性的映射器共现模式。候选算子组合按其覆盖的记录总数进行排序,并列时优先选择较长的组合。这产生了一组紧凑的指令族锚点,捕捉了多样化的真实世界算子组合。然后,我们选择每个保留族内最频繁的精确组合作为最终指令。挖掘算法的伪代码见附录A.2。

#### 轨道实现

从挖掘的映射器指令出发,我们实现三个指令级别的评估轨道。对于每个指令,我们将其与激活其所有组成算子的原始输入样本配对,执行流水线以获得确定性参考输出 \(t^\star\)。

- **Agnostic-M**:直接从固定的映射器组合实例化指令,以评估基线顺序执行。
- **Order-M**:通过交换算子位置构建顺序敏感对,仅保留两个顺序在同一初始文本 \(t_0\) 上产生不同结果的实例。
- **Order-F**:动态检查中间文本状态,以实例化具有校准阈值的有效过滤器。然后,它将每个过滤器插入到固定映射器序列中的三个不同位置(*pre*、*mid* 和 *post*),仅保留那些至少有两个放置位置产生不同最终结果的组(详见附录A.3)。

此外,还包括 **Atomic-M** 和 **Atomic-F** 用于评估单算子任务,作为孤立能力基线。

#### 指令口头化

当所有轨道实现后,我们首先通过将每个指令口头化为自然语言指令(跨11种提示风格,表5)来构建提示库,确保每个指令与实现期间定义的算子序列、过滤器语义和阈值一致。我们使用基于LLM的评判者来筛选候选指令,确保其与目标指令的功能等价性、正确保留执行顺序、以及数值约束的自然表达,而不暴露代码级标识。

相似文章

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。