CRAFT:聚类评分标准以诊断弱项LLM能力并生成有针对性的微调数据

arXiv cs.AI 论文

摘要

CRAFT将基于评分标准的评估转化为LLM的分层能力诊断,识别特定弱点并生成有针对性的微调数据,在四个开源模型的金融和法律基准上取得了更强结果。

arXiv:2607.16122v1 公告类型:新 摘要:评估不应仅仅衡量模型当前的表现。它们还应告诉我们下一次模型迭代需要修复什么,并提供一种生成针对性后训练数据的方法。大多数评估流水线都能识别出弱示例、主题或类别,但潜在的能力失败却被隐去:它们指出了模型在何处失败,而非为何失败。我们引入CRAFT,一种将任何基于评分标准的评估数据集转化为模型特定弱能力诊断的方法。CRAFT将每个评分标准视为能力探针:它从每个提示-评分标准对中提取能力描述,将这些描述聚类成层级能力树,在每个节点上对目标模型进行评分,并跨树层级动态选择低性能节点,粒度精确到每个失败最清晰的程度。选定的弱能力随后指导生成有针对性的监督微调数据。在保持数据生成、微调和评估设置不变的情况下,我们将CRAFT与基于提示的EvalTree聚类和随机无目标生成在四个开源模型、两个专业领域(金融和法律)以及13个与诊断数据无关的保留基准上进行了比较。在重复温度解码下,CRAFT在金融领域对所有四个模型均取得了最强平均结果;在法律领域,它对四个模型中的三个表现最强,并在第四个模型上保持在最佳基线的解码方差内。因此,在评分标准层面(而非提示或类别层面)诊断弱点,既能更清晰地呈现模型无法做到什么,也能在对该诊断进行微调后得到可测量性能提升的模型。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:23

# CRAFT: 聚类评分准则以诊断大语言模型弱能力并生成针对性微调数据
来源: https://arxiv.org/html/2607.16122
\\papertype

Scale AI Research\\contactvipul\.gupta@scale\.com,yunzhong\.he@scale\.com

Zihao WangScale AIRazvan\-Gabriel DumitruScale AIMohammadHossein RezaeiScale AIAakash SabharwalScale AIYunzhong HeScale AI

###### 摘要

评估不仅应衡量模型当前性能,更应告诉我们下一次模型迭代应修复什么,并提供生成针对性后训练数据的途径。大多数评估流程能识别出薄弱的样例、主题或类别,但隐含了底层能力失败的原因:它们指出了模型*在哪里*失败,而非*为什么*失败。我们提出 CRAFT,一种将任何基于评分准则的评估数据集转化为模型特定弱能力诊断的方法。CRAFT 将每个评分标准视为一个能力探针:它从每个提示-评分准则对中提取能力描述,将这些描述聚类成层次化的能力树,对目标模型在树上每个节点进行评分,并在树的不同层级动态选择表现不佳的节点,粒度精确到每个失败最清晰的程度。选中的弱能力随后会指导生成针对性监督微调数据。在固定数据生成、微调和评估设置的情况下,我们将 CRAFT 与提示级别的 EvalTree 聚类和未经目标选择随机生成的方法在四个开源模型、两个专业领域(金融与法律)以及 13 个与诊断数据不相交的留出基准上进行比较。在重复温度解码下,CRAFT 在金融领域为所有四个模型取得了最强平均表现;在法律领域,它在四个模型中的三个上表现最强,并在第四模型上保持在最佳基线的解码方差带内。因此,在评分准则级别(而非提示或类别级别)诊断弱点,既能更清晰地描绘模型无法做到的事情,也能在基于该诊断微调后获得可测量的更优模型。

## 1 引言

对大语言模型的评估服务于两个目的。第一个,衡量模型今天的表现,已受到极大关注:广泛的测试套件和针对性基准在日益增多的场景、任务和指标上对模型进行排名\[12, 26, 21, 30\]。第二个,告诉我们修复什么以使模型明天表现更好,仍发展不足,尽管它对后训练数据收集最为重要。基准结果通常仍以任务或类别级别的分数总结。此类总结识别了模型*在哪里*薄弱,但极少能足够精确地识别出失败的答案要求,以指导下一步微调数据收集。

这种差距至关重要,因为一个低分可能混淆多种不同的失败。面向能力和行为的评估\[28, 36\]通过将模型行为分解为具体技能或测试,向更精细的分辨率迈进。但即使在技能导向的观点下,数学基准上的低分可能源于选择错误方程、算术错误、跳过中间步骤或遗漏所需单位——这些失败即使在同一提示上发生,也需要不同的干预。一个止步于“数学薄弱”的评估无法在这些失败中做出选择。

评分准则为此类更精细的诊断提供了自然基础。评分标准将答案质量分解为明确的要求:例如,一个数学题的评分准则可能分别检查解决方案是否识别了相关量、是否建立了正确方程、是否准确求解、以及是否以正确单位陈述最终答案。评分准则越来越多地用于评估和强化学习\[27, 32, 11, 22, 17, 33\],但现有工作将其视为评分工具:用于做出判断或训练奖励模型。我们则将评分准则数据集视为成千上万个能力探针的池子。每个标准衡量模型必须能够做到的某事。当跨数据集聚合时,评分准则揭示了每次单独看待每条准则时所看不见的重复出现的弱点。

我们提出 CRAFT(Clustering Rubrics for Actionable Fine-Tuning,聚类评分准则以实现可操作微调),一种将带有评分注释的评估数据转化为模型特定弱能力诊断的方法。CRAFT 从每个提示-评分准则对中提取能力描述,将这些描述聚类成层次化的能力树,并在每个节点上评估目标模型。由于弱点并不总以相同粒度出现,CRAFT 动态地在树层级中选择表现不佳的节点,而非固定在特定深度。在 CRAFT 产生这个弱节点集合后,一个独立的下游生成步骤使用选中的节点来生成专注于模型弱能力的微调数据。

我们在两个专业领域(金融与法律)上对四个开源模型(Qwen3-4B、Qwen3-8B、Gemma-3-4B 和 Llama-3.1-8B-Instruct)评估 CRAFT。我们与 EvalTree\[37\](它在整个提示而非评分准则上构建能力树)以及一个随机基线(采用非树基随机数据选择方法,无弱点定位)相比较;所有方法共享相同的下游生成、微调和评估设置,因此它们仅在训练数据如何针对性选择上有所不同。在 13 个留出基准(7 个法律、6 个金融)上,所有基准与用于诊断的评分准则数据集不相交,CRAFT 在所有四个模型上取得了最佳的重复解码金融领域平均成绩,并在四个模型中的三个上取得最佳重复解码法律性能;在剩余的法律模型上,其分数与最佳基线的解码方差带重叠。这一模式凸显了我们方法的有效性:优于随机表明构建并定位一个经过评分的能力层级本身就有价值,而优于 EvalTree 则表明评分准则(而非提示)是更佳的信息组织单元。我们证明,在此共享设置下,评分准则级别的诊断比提示级别或未经目标选择的识别为下游微调数据提供了更佳的目标。

我们的主要贡献是:

1. 1. 我们提出 CRAFT,一种将评分准则数据集聚类成层次化、模型特定的弱能力诊断的方法,该诊断直接有助于微调数据生成。
2. 2. 在相同的合成数据生成和微调设置下,CRAFT 在金融领域为所有四个模型取得最强性能,在法律领域为四个测试模型中的三个取得最强性能。
3. 3. 我们证明弱点选择的粒度至关重要:动态跨层级选择优于固定层级选择,且更好的固定层级因模型和领域而异,因此没有单一深度是万能的。

1 输入:评分准则数据集 2 提取能力 3 聚类、评分、跨层级选择 4 针对性微调
提示:*250 个基点利率冲击将如何影响净债务/EBITDA 为 2.5 倍且浮动债务占比 40% 的公司的资本支出和派息政策?*
准则 1 更高的政策利率提高融资成本、WACC 或门槛利率。
准则 2 回复明确陈述了维护性资本支出与增长性资本支出的政策。
分析政策传导
战略资本配置
每个准则一个能力
L0 L1 L2 L3
金融
公司金融 84% 通过率
⋯
财务政策 48% 通过率
融资成本 86% 通过率
流动性风险
资本支出政策 55% 通过率
派息政策 48 个评分准则 · 35% 通过率 已选择(广泛,L2)
政策利率传导 75 个评分准则 · 90% 通过率 未选择:已很强
资本支出预算 82% 通过率
战略资本配置 87 个评分准则 · 15% 通过率 已选择(狭窄,L3)
弱节点在弱点最清晰的层级被选中
SFT 数据瞄准
每个弱节点
(合成或人工撰写)
微调
目标模型
在 7/8 设置中的最佳平均分数
(4 个模型 × 2 个领域)

图 1:CRAFT 流程。CRAFT 提取每个准则的能力,构建并评分层级,选择弱节点(红色),并使用它们生成针对性微调数据。
## 2 相关工作

### 2.1 评分准则

基于评分准则的评估将回复判断分解为明确的标准,而非要求单一的总体分数。这使得评分信号更具可解释性:模型可能在事实依据上正确但在完整性上错误,或在推理上正确但在最终答案格式上错误。诸如 HealthBench\[2\] 和 PRBench\[1\] 的基准在专业领域使用了大量专家编写的评分准则,相关数据集将评分监督扩展到其他专业和后训练设置\[40, 20\]。第二方面的工作使用类似评分准则的标准来改进基于大语言模型的评估,其中标准使评估者的决策过程更明确和细粒度\[22, 17\]。另一工作将准则或细粒度反馈用作后训练信号,包括奖励建模和 AI 反馈流程\[39, 27, 33, 23, 11, 7\]。CRAFT 将相同的准则级别信号用于不同目的:它不是仅将准则视为独立的评分项或奖励,而是跨数据集对其进行聚类,以恢复重复出现的能力和失败的结构化地图。

### 2.2 提示级别层次聚类与 EvalTree

最接近的先前方法是 EvalTree\[37\],它通过将评估提示组织成层次化的能力树来刻画模型特征。EvalTree 聚类整个提示,用自然语言能力标签描述每个内部节点,在每个子树上对目标模型评分,并使用表现不佳的提示聚类来指导生成针对性数据。一个提示级别的节点可以说模型在某种问题上挣扎;它无法孤立出答案中缺失了哪种能力。CRAFT 则聚类提示-评分准则对。这使得一个提示可以贡献多个叶子节点,每个对应它测试的一个标准,并且一个节点可以代表一种回复能力,例如应用法定例外或基于正确行项目进行财务计算。因此,与 EvalTree 的比较直接测试了当所选数据经过相同的下游微调流程时,评分准则是否提供了除提示聚类之外的诊断信息。

## 3 方法

CRAFT 输入 (i) 一个评分准则数据集,即如图 1 所示带有评分标准注释的提示,以及 (ii) 一个目标语言模型。它返回一个模型特定的弱能力节点集合,旨在作为微调目标,而不仅仅是更细粒度的分数报告。该方法将评分标准转换为能力描述,对能力进行层次聚类,在每个节点上对目标模型评分,并选择低性能节点。第 4 节描述了使用这些选中的节点生成训练示例的独立下游步骤。

### 3.1 评分准则

评分准则是一组回复必须满足的明确要求。每个标准是一段简短的自然语言陈述,例如“回复引用了相关法规”或“回复在计算比率之前识别出现金流项目”。每个标准可以独立打分(通过/失败或小型离散分数)。一条回复可能通过一些标准而未能通过其他标准。这使得评分准则不仅作为评分工具有用,也可作为能力探针:每个标准命名了模型为了使答案被接受而必须能做到的事情。在这个意义上,一个标准类似于对一项所需技能的小型行为测试,将评分准则评分与细粒度行为评估\[28, 36\]联系起来。CRAFT 基于这一观察,通过跨数据集聚合准则,而不仅仅将其用作每个示例的评分规则。

### 3.2 从评分准则中提取能力

一个提示可能包含许多准则,而这些准则可能测试不同的技能。因此,我们将数据集扁平化为提示-评分准则对,并独立处理每一对。对于每一对,一个独立的语言模型生成一段简短、去语境化的描述,说明满足该准则所需的能力。输出是一个元组集合,包含原始提示、评分标准以及提取的能力描述。这种表示允许不同提示或不同措辞的准则,只要它们测试相同的底层能力,就能够聚类在一起。

### 3.3 层次聚类

我们采用自底向上、逐层构建的方式组织提取的能力描述为一棵树,该过程改编自 Clio\[31\] 的层次化器。与经典凝聚聚类(每次贪婪合并最近的一对节点)不同,我们的方法一次性构建一个完整层级:给定当前层级的聚类,大语言模型编写一个更少数量、更通用能力标签的清单,每个当前聚类被路由到恰好一个标签,并且该过程重复,直到该层级包含目标数量的顶层聚类。叶子节点对应单个提示-评分准则对,每个内部节点携带一个自然语言能力描述,该描述比其子节点更通用,同时保留其领域内容(图 1)。

#### 固定顶层。

当评分准则数据集已提供分类元数据时,例如领域标签或每个标准的子类别注释,我们使用这些元数据定义树的顶层,而非学习这些:每个元数据属性成为一个固定层级(例如,领域在层级 0,注释的子类别在层级 1)。然后,在每个结果组内独立对能力进行聚类,并将学到的子树嫁接在相应的固定节点下。这保证了学到的聚类永远不会混合注释的类别,并保留了数据集作者预期的任何分类体系。如果没有此类元数据可用,则整个数据集形成一个单一组,并完全学习整棵树。

#### 基础层级聚类。

在每个组内,我们对每个能力描述进行嵌入,并用 k 均值将嵌入划分为 n_base 个基础聚类,这是学到的层次结构中最精细的层级。n_base 和顶层聚类目标数量 n_top 均为超参数。

相似文章

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

arXiv cs.CL

CalibratedRubric is a task-adaptive framework for building compact, measurable rubric banks for open-ended LLM evaluation, using Bayesian measurability filtering and IRT-based selection to improve human-gold agreement and rank fidelity across financial, healthcare, general, and legal benchmarks.

LLM能否生成可靠的评分标准?实验复现的元评估

arXiv cs.CL

本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。