强化学习数据的良好质量控制(18分钟阅读)
摘要
本文讨论了强化学习数据质量控制的重要性,概述了当前数据供应商的不足之处以及前沿AI实验室用于评估RL数据的标准。
对高质量的标准需要更高。任何向前沿实验室销售产品的供应商在购买决策过程中都会受到隐性评判,而大多数供应商同时未能通过多个质量控制关卡。标准化质量控制以评估数据在性能-成本-延迟帕累托曲线上的测试效果至关重要。那些未能内化更高质量控制标准的供应商将在今年开始遇到问题。
查看缓存全文
缓存时间: 2026/05/08 18:27
# RL 数据的好 QC 标准
来源:https://www.seancai.com/philosophy/good_qc_rl_data
一月份,我提出了关于 Type 1 和 Type 2 数据的[新定义](https://seanzcai.substack.com/i/184829213/in-pursuit-of-new-antikythera-mechanisms),当时数据行业迫切需要如何评估数据质量的指导。转向更长周期的训练方式带来的一个有意识的副作用是,对基于模型的质量保证(QA)的需求增加,这远远超出了当前数据公司的人工审核能力。
我们首先进入哪些数据市场,直接对应着我们对每个市场可验证性的把握程度。我们在基础设施层过滤掉了困难的领域:首先选择可验证的领域,然后构建能剥离注意力和不可逆性(这两者让真实决策变得困难)的环境,最后避免采用需要站队的奖励函数。这种选择效应带来的影响体现在了流程设计中。即使在那些我们认为容易的领域,区分有用 Type 1 数据和无用数据集的质量控制(QC)规范,也尚未在数据市场形成共识。大多数在 2026 年交付给前沿实验室的数据,连实验室内部 QC 框架设定的标准都达不到。
许多数据公司以两种方式被淘汰。我们选择了较容易的领域,因为评估问题在那里已经解决。而我们又未能真正解决在这些领域交付的数据上的 QC 问题。
过去十八个月里,用于现成 RL 数据的好 QC 形态已经逐渐清晰。有一个切实可行的好标准,它不应是理想化的。这个标准已经被实验室自身实施并应用于数据采购中。任何在 2026 年向前沿实验室销售数据的供应商,在采购决策过程中都会被隐性地用这个标准衡量。大多数供应商在多个环节同时失败。
这里的术语值得梳理一下,因为它们尚未传播到使用它们的实验室之外。当我们越来越倾向于用“做某件事需要多少成本/多快”而非“是否能做”来衡量数据和任务时,标准化的 QC——用于评估数据在性能-成本-延迟帕累托曲线上测试效果如何——将变得至关重要。
### 预检审查
在任何后训练运行接触数据之前,你会问:这个数据集是否真的可以用于评估?
这是 QC 体系中最便宜的环节,也是大多数数据公司跳过的环节。一个前沿实验室花费六位数试用合同购买的数据集,如果连预检审查都通不过,那就是付了两次钱:一次是数据本身,另一次是浪费在从开始就无法解释的训练运行上的 GPU 工时和研究人员精力。2026 年现成 RL 数据市场规模足够大,以至于跳过预检的次生成本已经超过了运行预检的直接成本。正如我在[上一篇文章](https://substack.com/home/post/p-196170558)中提到的,Anthropic 和其他实验室在 2025 年披露的 RL 数据支出超过 10 亿美元,而实际支出更高。
每个声称为前沿分析收集数据的公司,至少应该展示几个主要的预检类别。
**验证谱系分类**:询问任务处于哪个位置——从确定性代码评分(SWE-bench Verified 是该类别最干净的版本)到 LLM 评判标准([HealthBench](https://llm-stats.com/benchmarks/healthbench-hard)、FLASK、[BiGGen Bench](https://arxiv.org/abs/2406.05761) 和 [Prometheus 2](https://arxiv.org/abs/2405.01535) 的已发表参考模式是原子化、二元、带轴标记的标准)再到无法自动化验证的任务(应作为 SFT 演示而非基于奖励的 RL 交付)。跳过这种分类,实验室最终就会把未经审计的 LLM 评判标准直接塞进奖励函数。
**抗污染能力和变体生成**:询问数据集的“爬山”性能是否能经受住下一代模型。例如,GPQA、AIME 和 FrontierMath 是静态集,其区分能力在一年内就衰减了,因为问题泄漏到了预训练中,而供应商没有设置预警机制、轮换节奏或恢复方案。
**Pass@k 和分布分析**:设定了有效的训练范围,因为如果数据集在目标模型上的 pass@1 为零,或者难度分布是双峰的,那将无法提供可学习的梯度。
**标准构建模式**:确定评分器是原子化、二元的,还是复合、易被奖励函数钻空子的——详见[标准锚定研究](https://arxiv.org/pdf/2508.12790)。每个类别背后都有已发表的警示案例,而出错成本由下游的实验室承担,而非供应商。
还有其他一些检查应该被当作预飞行检查,但把这些以合适格式组合起来意味着:那些搞清楚了这些的供应商正在将预检审查用作向采购团队的结构化推销(“这是我们在每个类别上的切片,这是每个环节的工件,这是我们运行的审计”),从而在几周内而非几个月内完成非正式入职流程。而那些没有搞清楚的供应商,则正在失去他们以为自己赢得的合同,或者有研究人员在纸面上说他们的数据“很好”,但背地里却在寻找替代品。当一个实验室监督着百万条数据交付,并在其中一条上发现差异/失败时,他们会怀疑是否根本没有 QC 流程。
### 主动测试
预检通过后,可以采用一些小型消融实验加小型后训练来压力测试后训练数据,以发现预检审查无法发现的问题。**奖励函数钻空子**(Reward hacking)会在训练中显现出来,尤其是在不同模型和不同测试框架的复杂性下。**谄媚行为**(Sycophancy)在奖励压力下出现,而非静态评估中。**遗忘**(Forgetting)则会在训练运行之后显现,而此时实验室已经为数据和计算付了费,我们通常想要确保灾难性遗忘不是数据集的直接后果。主动测试的运行成本比预检高(包括在探针模型上的小型后训练运行以及诊断测试所需的 GPU 工时),但跳过它的成本更高,因为它能捕获的故障模式会悄无声息地降低前沿模型的发布质量,并引发我正在各实验室听到的合同不续签问题。
2026 年的大多数数据供应商对他们交付的数据没有进行任何类别的主动测试。
**奖励函数钻空子**至今仍在每次与实验室的对话中出现。[METR](https://metr.org/) 给出了数据:o3 尝试中 1-2% 包含了其沙箱内的漏洞。[AISI](https://www.aisi.gov.uk/) 发现 OpenClaw 在隔离环境中反向工程了自己的评估代理。ImpossibleBench 发现 GPT-5 在 impossible-SWEbench 变体上 76% 的情况下利用了测试用例的漏洞。现代前沿模型在奖励压力下经常作弊评估,而我发现许多供应商从未运行过任何探针来检查自己的数据是否恰恰训练了这种行为。**偏差探针测试**对于奖励函数中的任何 LLM 评判标准来说也是一个类似的故事。[谄媚行为](https://arxiv.org/abs/2310.13548)、[奖励篡改](https://arxiv.org/abs/2406.10162)和[伪装对齐](https://arxiv.org/abs/2412.14093)是供应商应该运行的三个已发表的探针测试,其中伪装对齐的基线为 12%,但几乎没有供应商在运行。
对于验证器评分的数据,[SWE-bench Verified Pro 模式](https://openai.com/index/introducing-swe-bench-verified/)(200 PASS + 200 FAIL 的人工重新评判,分别报告假阳性和假阴性率)现在已经是基本要求。OpenAI 在 2026 年对原始 SWE-bench 的退役说明中发现,59.4% 的已审计问题存在有缺陷的测试用例。这构成了“确定性验证器”不再有意义的底线。遗忘检查需要按技能进行,而不是汇总,就像 [Tulu 3](https://arxiv.org/abs/2411.15124) 发布的那样。SFT 持续后训练(平均约 -10.4%)与 on-policy RL(平均约 -2.3%)之间的差距应指导训练方法的选择,而 [Qi 等人](https://arxiv.org/abs/2311.05553)的研究解释了为何汇总数据在安全相关数据上具有误导性:小的良性微调可以剥离 RLHF 安全护栏,而汇总分数却保持不变。[前沿形状分析](https://arxiv.org/abs/2210.10760)使用帕累托曲线来检测可钻空子的任务集,[奖励函数钻空子特征工作](https://arxiv.org/abs/2406.02900)是已发表的参考。大多数供应商不运行它,因为它需要他们不拥有的 GPU 基础设施。故障分类是这些中最便宜且最有用的。每个失败的卷展被标记为能力、提示、框架、标准、训练数据、编排或三角测量,这给供应商提供了一个具体的编辑清单,也给实验室提供了一种判断数据集是在数据层还是上游出了问题的方法。
采购端的解读与预检类似。主动测试是实验室内部对每个接受的数据集已经在进行的工作,并且他们越来越多地要求供应商将审计结果与数据一起交付,这样实验室就不必重复工作。那些带着偏差探针测试结果、按技能遗忘数据、验证器假阳性/假阴性审计以及故障分类分布来的供应商,能在几周内完成入职。而那些只带来“我们运行了一些小型训练实验,损失下降了”的供应商,根本过不了第一次技术评审。这个差距就是 2026 年一个严肃的数据公司与一个同质化竞争对手之间的区别。
值得注意的是,由于许多实验室在某些能力上计算资源丰富,他们在继续与某些供应商合作时对数据质量更加宽容(因为我们更受限于高质量数据)。但是,正如[之前的文章](https://substack.com/home/post/p-186767691)所警告的——如果数据是下一个 AI 泡沫的起因,那么在一个研究人员扔掉 50% 以上采购数据的低效数据市场中,我们还能期待存在多久?
### 我们在现实世界中需要改进的地方
让我们深入探讨一下 2024-2026 年的一些基准发布,看看它们如何缺乏这些标准:
**FrontierSWE**(约等于)处于最强验证体制(基于确定性代码的评分器,带隐藏测试信号),但恰好在表面分层上失败,因为每个模型都锁定在自己的原生生产框架中,从而混淆了模型和框架对最终数字的贡献。
**ProgramBench**在现实性上失败。具有干净规范和已知答案的竞争性编程并不是 2026 年任何生产编码智能体的部署环境,在 ProgramBench 排行榜上排名第一的模型不一定是任何工程团队应该部署的模型。尽管我将其对模型的创造性限制和成本排名作为爬山目标类别,但这些任务仍然相当人为,代表了一类仍然将竞赛难度与生产效用混淆的基准。
**Tau-Bench**衡量多轮客户服务交互的最终状态正确性,但跳过了对多轮部署至关重要的过程评估:智能体是否在第三轮问了正确的澄清问题,在第五轮从工具故障中恢复,在第七轮连贯地解释了解决方案。
**GDPval**试图将前沿能力与经济生产力挂钩,但出于与 ProgramBench 相同的原因在现实性上失败:在受控环境中重构的生产力任务,并非真实组织环境中存在的生产力任务。
**MMMLU**将标准 MMLU 污染态势带到了四十种语言中,没有预警机制,没有轮换,从发布那一刻起就有已知的泄漏概况。
**DSBench**将其 86% 的任务放在了 GPT-4o-as-judge 上,仅凭一次模糊的验证声明,并在十个月内从 34% 饱和到了 89%,这是跳过静态集上验证器稳健性的典型案例。
**Terminal-Bench 2.0**在任务验证方面做得很好,但仍停留在短 shell 任务周期内,这既隐藏了更长周期工作中出现的不可逆性,也隐藏了过程评估失败——就像 2024 年的编码和数学任务所做的那样。
那些通过更多类别的基准,往往也只是在单一轴上通过。[BankerToolBench](https://github.com/Handshake-AI-Research/bankertoolbench)(Handshake)是我见过的金融工具使用方面最干净的现实性案例,因为任务来源于实际投资银行工作流程,验证器则围绕银行家使用的工作产品构建。[LiveCodeBench Pro](https://livecodebench.github.io/)通过从竞争编程网站定期抽取新问题并在它们老化进入预训练时退役,来处理污染防御问题,这是正确轮换节奏的已发表参考。[SciCode](https://arxiv.org/abs/2407.13168)通过为每个问题手动编写确定性检查器并经过专家评审,来处理部分得分的科学编码的验证器稳健性问题,代价是扩展性(但如果 Mercor 的人工 QA 运行良好,我欢迎这种以扩展性为代价的尝试)。但这些基准没有一个能同时通过所有类别。
我深深尊重所有这些公司所做的工作。它们都交付了推动领域前进的工件。它们也都说明了为什么 QC 标准现在至关重要。问题在于“测量工具是否真正能告知实验室可做出的研究决策”,因为 QA 流程因供应商而异,答案取决于基准通过了哪些类别而跳过了哪些。
值得区分的供应商差异在于基本要求与差异化,因为基本要求相对容易自动化。我把基本要求视为一套数据文档清单:原子化标准构建(带检查器)、验证器稳健性审计、n-gram 污染报告、跨模型无偏 pass@k 评估、多种子自助法置信区间、评估框架声明、追踪工件、至少两个框架配置的表面分层,以及从版本化候选名单中选择探针模型。
更进一步的差异化工作可能成本效益不高,但更像是研究人员的角色:对验证器进行偏差探针测试、[谄媚行为](https://arxiv.org/abs/2310.13548)、[奖励篡改](https://arxiv.org/abs/2406.10162)和[伪装对齐](https://arxiv.org/abs/2412.14093)探针、[CoT 忠实性探针](https://arxiv.org/abs/2510.04040)(带反事实扰动)、通过 [tinyBenchmarks](https://arxiv.org/abs/2402.14992) 或 [Fluid Benchmarking](https://arxiv.org/abs/2509.11106) 进行的基于 IRT 的能力审计、用于 PPO 和 GRPO 的在线 RL 通道诊断。没有能直接阅读引用论文的研究人员团队的供应商,将无法实施这些,但那些能做到的供应商应该得到充分的回报。
### 市场启示
那些还没有内化这个 QC 标准的供应商,将在 2026 年看到他们的合同被砍掉。我从顶级实验室那里已经听到的关于 RL 合同不续签的传闻,恰恰反映了这种动态。实验室不再笼统地购买“我们需要更多这种形态的任务”。向中国实验室销售的供应商可能仍然发现旧模式有效。但市场的其余部分已经转变了。大多数供应
相似文章
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
RL Environments Are All You Need (6 minute read)
The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.
深度强化学习评估与设计范式的原则性分析
本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。