ImpossibleRubrics: 对生成的评分标准作为奖励信号进行压力测试

Hugging Face Daily Papers 论文

摘要

本文介绍了ImpossibleRubrics,一个开源评估框架,它使用细粒度的对抗性评分标准对大型语言模型进行压力测试,旨在减少评估偏差并揭示隐藏的失败模式。

语言模型生成的评分标准越来越多地被用作基于评分标准的强化学习、LLM-as-a-judge评估和自动评分的奖励信号。此类评分标准只有在奖励诚实答案而非为利用它们而优化的对抗性答案时才可靠。然而,它们对这种优化的鲁棒性仍然知之甚少。我们隔离了最困难的领域:不可能任务,其中提示迫使模型走向不支持的结论,因此唯一诚实的响应是承认其不可能性。我们引入ImpossibleRubrics,这是一个包含169个不可能任务的基准,跨越六个不可能性类别,每个任务都配有一个可验证的预言证书,指定诚实答案可以和不可以声称的内容,以及48个可回答的控制项。与提供固定评分标准不同,ImpossibleRubrics提供任务环境和证书,允许评分标准在下游生成,然后进行对抗性测试,看它们是否奖励违反证书的答案。在无偏差的150/169环境切片中,11个生成器中有8%到26%的时间被利用;在专门选择的压力切片中,我们测量的最强生成器仍然有36%的时间被利用,而遵循证书的评分标准被利用0%,因此我们测量的是评分标准质量差距,而不是任务不可能性。一个结果与直觉相反。一个单一的通用评分标准('要果断,惩罚犹豫')在每个任务中不变使用时,有64%的时间被利用,而十一个生成器中有七个在编写针对每个任务的定制评分标准时,被利用的频率更高。定制的标准似乎告诉攻击者要捏造哪个声称。问题不在于评分标准模糊,而在于它们对错误的事情具体化了。
查看原文
查看缓存全文

缓存时间: 2026/09/16 14:47

论文页面 - ImpossibleRubrics:压力测试生成评估标准作为奖励信号

来源:https://huggingface.co/papers/2609.16816

通过单一汇总分数来评估大型语言模型(LLMs)往往会掩盖细微缺陷,并为基准测试操纵留下空间。Impossible Rubrics 推出了一个开源评估框架和数据集,旨在通过细粒度、多维度和对抗性评估标准,超越粗略的摘要指标。

该基准测试针对在复杂推理、严格约束遵循和细粒度逻辑判断方面会使最先进模型陷入困境的边缘案例,揭示了隐藏的失败模式,并减少了 LLM 作为法官(LLM-as-a-Judge)的评估偏差。

主要亮点:

  • 多维标准: 基于细粒度的操作性评估标准来评估模型性能,而非依赖单一总体分数。
  • 对抗性与高难度测试用例: 聚焦于复杂的边缘案例场景,旨在揭示前沿模型的真实能力边界。
  • 可靠的评估协议: 实施严格的评分机制,以减轻 LLM 评判者的偏见和不一致性。
  • 完全开源: 包含数据集、评估流程和基线结果,便于整个社区复现。

📌 项目页面:https://impossiblerubrics.github.io/

相似文章

评分标准作为开放式生成中的特权信息

arXiv cs.LG

本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。