模型能力增强的数据与评估闭环
摘要
介绍了能力切片这一单元,用于将评估失败与LLM中的数据干预联系起来,实现诊断和修复模型弱点的闭环流程。通过两个案例研究进行演示,展示了从训练回归中恢复以及数学推理能力的显著提升。
arXiv:2606.28471v1 公告类型:新\n摘要:模型能力是LLM预训练中的核心变量,但从未被直接观测:数据前瞻性地塑造它,而评估仅在事后揭示它,将样本、提示、解码和评分规则压缩为一个含噪的分数。实际优化过程是反向进行的:先观察到失败,工程师必须推断语料库的修复方案。双方使用不兼容的术语——基准名称和单个样本的正确性 versus 数据来源、领域和质量标签——因此这种推断通常基于直觉而非方法。我们通过\emph{能力切片}弥合这一差距:一组共享背景条件、任务类型、求解操作和输出约束的评估样本——精确到足以定位单一弱点,又稳定到足以经受聚合,不同于过于粗糙的基准名称或过于嘈杂的单个样本。围绕这一单元,评估分类法、非指令数据分类法和映射规则形成了一个闭环,将基准级别的失败转化为有针对性的、可测试的数据干预。我们在两个方向相反的案例研究中测试了这个闭环。首先,闭环排除了数据原因:继续预训练导致BBH下降$-46.82\%$,但诊断将其追溯到单个掩码的\texttt{\textless EOS\textgreater}损失,而非推理能力减弱;恢复它后BBH回升至$66.44$,高于原始检查点,且未改变数据。其次,闭环确认了数据原因:一个持续的数学推理弱点按求解操作分解为特定的失败组合,由此构建的弱点定向采样程序将AIME2025/AIME2026的Pass@128从$6.67$/$0.00$分别提升至$26.67$。同一个未修改的闭环在两种情况下得出了相反但正确的结论,表明从评估到数据的推断可以成为常规、可审计且经过实验验证的过程,而非凭直觉。
查看缓存全文
缓存时间: 2026/06/30 05:31
# 数据与评估闭环:增强模型能力的数据驱动方法 来源:https://arxiv.org/html/2606.28471 李志轩 百度公司 [email protected] 袁江安¹ 百度公司 [email protected] 韩旭 百度公司 [email protected] ###### 摘要 模型能力是LLM预训练的核心变量,却从未被直接观测:数据以预期方式塑造它,而评估只能事后揭示它,将样本、提示、解码和评分规则压缩成一个嘈杂的分数。实际优化是反向运行的:先观察到失败,工程师必须推断出语料库的修复方案。双方使用的词汇互不兼容——基准名称和逐样本正确性 vs 数据源、领域和质量标签——因此这种推断通常靠直觉而非方法。我们通过*能力切片*来弥补这一差距:一组共享背景条件、任务类型、求解操作和输出约束的评估样本——既足够精确以定位单一弱点,又足够稳定以经受聚合,这不同于太粗糙的基准名称或太嘈杂的单个样本。围绕这一单元构建的评估分类法、非指令数据分类法和映射规则形成了一个闭环,将基准级别的失败转化为有针对性的、可测试的数据干预。我们在两个方向相反的研究案例中测试了这一闭环。首先,闭环将数据排除在外:持续预训练导致BBH下降−46.82%,但诊断将其追溯到单个掩码损失而非推理能力减弱;恢复该损失后BBH回升至66.44,超过原始检查点,且无需更改数据。其次,闭环将数据纳入:一个持续的数学推理弱点通过求解操作分解为特定的失败组合,基于此构建的弱点定向采样程序将AIME2025/AIME2026 Pass@128从6.67/0.00提升至各26.67。同一未修改的闭环在两个案例中得出了相反但正确的结论,表明评估到数据的推断可以成为常规、可审计且可实验验证的过程,而非凭直觉。 ## 1 引言 在大型语言模型(LLM)预训练中,最终重要的量是模型能力,但能力本身从未被直接观测:它被模型消耗的训练数据前瞻性地塑造,事后才以基准分数的形式回顾性地显现。那个分数本身是一个聚合体,将异质的评估样本、提示模板、解码配置、答案提取规则和评分协议压缩成一个附加在基准名称上的数字。最先进的系统现在在包含数十个此类基准的套件上评估,涵盖语言理解、事实知识、数学推理和代码生成(Hendrycks 等,2021a;Zellers 等,2019;Bisk 等,2020;Suzgun 等,2023;Cobbe 等,2021;Hendrycks 等,2021b;Chen 等,2021;Austin 等,2021;Joshi 等,2017;Lai 等,2017;Dua 等,2019;Wang 等,2024;Huang 等,2023;Li 等,2024a;Zhong 等,2024),每个基准名称的报告性能为一个单一数字。这种压缩掩盖的内容远多于揭示的内容:两个具有相同MMLU分数的模型可能在不同类型的问题上失败;在广泛基准上的进步可能源于改进的闭卷事实回忆而非更强的推理;BBH上的退步可能源于输出格式违规而非任务求解能力的变化。只要基准名称被视为模型能力的直接读数,对下一次训练运行至关重要的那个问题——添加、重新加权或过滤什么数据信号才能解决失败——就仍然是不确定的。 然而,实际优化必须反向穿越这个关系:失败首先出现在评估结果中,然后工程师才能反向工作,寻找可能解决该问题的训练语料库变更。这与一个简单的操作主张一致,该主张激励了本文的其余部分:在固定的模型架构、训练目标和优化方案下,训练数据是塑造模型能力的主要可控因素,而评估仅提供对该能力的嘈杂观测。因此,数据方面的问题受到了相当大的关注,出现了搜索或优化数据混合的语料库组成方法(Xie 等,2023;Liu 等,2024;Ye 等,2024)、大规模质量过滤(Penedo 等,2024;Li 等,2024b)和合成指令生成(Wang 等,2023b;Xu 等,2024;Taori 等,2023;Wang 等,2023a)。在评估方面,同样大量的工作通过更细粒度的基准(Rein 等,2024;Glazer 等,2024)和样本级失败模式分析来细化衡量内容。这两个领域都很成熟,我们都借鉴;相比之下,发展不足的是两者之间的*接口*。障碍在于评估和训练数据的描述语言不同:评估结果以基准分数或逐样本正确性呈现,而训练数据按来源、领域和质量标签编目,二者之间的桥接至今更多是直觉而非方法。面对评估失败,该失败实际上是什么样的训练数据信号证据?如何决定例如是添加更多数学内容、重新加权现有来源还是修复监督密度?本文开发了这个接口。 在基准名称级别进行映射太粗糙,无法隔离单一弱点,而在单个样本级别进行映射则太嘈杂,不可靠;两种粒度都不支持从失败到修复的可靠推断。因此,我们引入一个中间表示——*能力切片*:一组评估样本,它们沿着四个维度共享结构化条件——背景条件、任务类型、求解操作和输出约束。能力切片比基准更具体,比单个样本更稳定,并且是我们诊断、数据侧映射和干预验证操作的基本单元。 围绕这个表示,我们构建了一个包含三个组件的分析工具包(第3节),实例化了第2节中发展的概念框架。首先,**评估样本分类法**(第3.2节)沿着上述四个维度标注每个样本,应用于预训练中常用的16个基准;该分类法支持基准组成分析、基准级别以下弱能力切片的定位,以及干预后分数变化的结构化归因。其次,**非指令数据分类法**(第3.3节)沿着四个数据侧维度——内容世界、话语结构、操作机会和监督密度——表征原始语料段,这些维度的选择使得在有意义的情况下与评估侧维度对应。第三,**评估到数据映射规则**(第3.4节)连接了这两种分类法:一组小的分类法对齐对应关系覆盖了两侧共同设计的维度,而一个互补的LLM辅助机制处理超出这些对应关系的切片。这三个组件共同定义了一个闭环: 弱能力切片 → 数据可供性画像 → 数据操作 → 实验验证 → 结果分析 该闭环将基准级别的观察转化为可审计、可迭代的优化过程。我们将映射规则视为生成数据干预假设的结构化启发式方法,而非因果主张;任何由此产生的干预仍需接受下游实验验证。 我们通过一个持续预训练流水线上的两个案例研究来压力测试这个闭环,特意选择使诊断方向相反。在第一个案例(第4.1节)中,闭环被要求解释一个退步,而正确答案最终完全排除了数据因素:持续预训练改善了几乎每个基准,但导致BBH大幅退步(相对−46.82%)。通过输出约束维度解读这个退步表明,模型经常输出正确的金牌答案然后继续生成超出答案的内容,导致过滤后的响应异常长,并且——将失败追溯到训练流水线本身——发现持续预训练期间掩蔽了`<EOS>`标记上的损失。恢复这一单一监督信号将BBH从25.14提升到66.44,高于热启动检查点,且没有降低其他基准,在多个案例中甚至略有提升;训练数据本身从未被触及。因此,诊断循环将最初看似推理倒退的问题转化为一个局部的、完全可纠正的终止监督错误。 第二个案例研究(第4.2节)讨论了预训练中一个更典型的失败模式——数学问题求解能力弱,这里闭环朝着相反方向运行:诊断将数据纳入。热启动检查点在AIME2025 Pass@1上仅达到0.05,在AIME2026 Pass@1上为0.00;在AIME2026上,模型即使在Pass@128下也无法产生正确的轨迹,表明仅靠测试时扩展无法解决差距。按求解操作分解评估集显示,弱点并非孤立的算术,而是涉及约束跟踪、边界情况推理、符号变换、计数和比较的特定操作组合;成对效应和组合效应分析进一步表明,其中几个组合是非加性的,其表现比成对效应之和预测的更差。基于此诊断,我们推导出一个重要性采样程序(第4.2.3节),该程序按诊断对齐的弱点分数对操作组合进行排名,将合成指令示例匹配到最高分组合,并使用Efraimidis–Spirakis加权蓄水池无放回采样(Efraimidis and Spirakis, 2006)在有限重复因子下从结果池中抽取。在保持训练配方和指令数据预算固定的情况下,结果检查点在AIME2025 Pass@128上达到26.67,在AIME2026 Pass@128上达到26.67,同时通用领域性能基本保持不变。 在进入正文之前,我们在此对本文所做的贡献类型进行两点澄清。首先,贡献是方法论上的,而非关于任何特定模型或基准的主张:分类法和映射规则提供了词汇表和一组启发式方法,用于将基准级别的观察转化为可测试的数据干预假设,并且每个这样的假设在作为发现之前仍需通过受控的单变量实验设计验证。其次,将两个案例研究统一为单一演示(而非两个无关的调试轶事)的是,同一个闭环在两个方向上都得出了正确的诊断:在第一个中,它将数据排除在外,将看似数据或能力问题引导向训练目标,而修复实际上属于那里;在第二个中,它将数据纳入,将真实的能力差距定位到特定的操作组合,并通过有针对性的数据干预解决。因此,闭环不仅在被指向数据修复时具有信息量,而且在正确排除数据干预时也如此。两个案例研究从相反侧面证明了同一个观点:将评估失败转化为数据修复是同一个过程可以可靠完成的事情,每一步推理都开放检查,每个结果假设都通过实验验证,而非依赖于工程师的直觉。 本文的其余部分遵循上述结构:第2节充分发展概念框架,第3节介绍分析工具包及其实现的闭环,第4节报告两个案例研究,第5节讨论所得方法论的适用范围和局限性。 ## 2 概念框架 我们围绕三个核心对象组织框架:**评估**、**模型能力**和**训练数据**。评估产生对模型行为的观察,但这些观察与实现选择(如提示模板、解码策略、答案提取规则和评分协议)纠缠在一起。模型能力指的是模型在结构化条件下的稳定行为模式,而非附加在基准名称上的分数。训练数据提供了主要的能力形成信号:它将知识、话语结构、推理机会和受监督的输入-输出模式暴露给模型,能力从中涌现并通过这些模式表达。本工作的核心前提是:评估是模型能力的嘈杂观测,而模型能力在固定模型架构、训练目标和优化方案下又由训练数据塑造。因此,基准分数不应被解释为单一模型能力的直接读数;相反,它是由模型能力、样本组成、评估协议和测量噪声相互作用产生的聚合结果。这激励一种更结构化的分析形式,其中基准结果被分解为样本级别的观测条件,聚合成能力级别的行为模式,然后映射回训练数据。
相似文章
你的评估会出问题,而你却察觉不到
讨论当前LLM评估方法的结构性弱点,这些方法未能预见能力的质变,并指出开发主动评估基础设施是实现安全能力跃升的关键瓶颈。
反事实评估揭示临床大语言模型和智能体的隐藏能力画像
本文介绍了因果敏感性得分(CSS),一种干预性指标,用于评估临床大语言模型和智能体在患者输入沿临床意义维度变化时,是否适当地更新其建议。该指标揭示了标准覆盖度指标未能捕捉的隐藏能力画像,暴露了安全盲点和结构性响应能力缺陷。
CLExEval:一种用于定性评估LLM临床推理的人机交互框架
CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。
能力前沿:基准测试遗漏了82%的模型性能
本文提出了能力前沿(Capability Frontier),这是一个针对模型的帕累托前沿,用于纠正单模型和单次运行评估中的偏差,表明标准基准测试遗漏了高达82%的模型性能,并且集体LLM能力被严重低估。
Found in Conversation: LLMs 自我学习以缩小多轮对话差距
本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。