ImpossibleRubrics: 对生成的评分标准作为奖励信号进行压力测试
摘要
本文介绍了ImpossibleRubrics,一个开源评估框架,它使用细粒度的对抗性评分标准对大型语言模型进行压力测试,旨在减少评估偏差并揭示隐藏的失败模式。
查看缓存全文
缓存时间: 2026/09/16 14:47
论文页面 - ImpossibleRubrics:压力测试生成评估标准作为奖励信号
来源:https://huggingface.co/papers/2609.16816
通过单一汇总分数来评估大型语言模型(LLMs)往往会掩盖细微缺陷,并为基准测试操纵留下空间。Impossible Rubrics 推出了一个开源评估框架和数据集,旨在通过细粒度、多维度和对抗性评估标准,超越粗略的摘要指标。
该基准测试针对在复杂推理、严格约束遵循和细粒度逻辑判断方面会使最先进模型陷入困境的边缘案例,揭示了隐藏的失败模式,并减少了 LLM 作为法官(LLM-as-a-Judge)的评估偏差。
主要亮点:
- 多维标准: 基于细粒度的操作性评估标准来评估模型性能,而非依赖单一总体分数。
- 对抗性与高难度测试用例: 聚焦于复杂的边缘案例场景,旨在揭示前沿模型的真实能力边界。
- 可靠的评估协议: 实施严格的评分机制,以减轻 LLM 评判者的偏见和不一致性。
- 完全开源: 包含数据集、评估流程和基线结果,便于整个社区复现。
📌 项目页面:https://impossiblerubrics.github.io/
相似文章
生成减少智能体评估中过度信任的无奖励评判标准
RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。
Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL
A Scale AI research paper proposes Rubric Dropout, a dropout-style regularization for rubric criteria in rubric-as-reward RL, showing it mitigates reward hacking and improves out-of-distribution gold judge scores on medical and science benchmarks.
评分标准作为开放式生成中的特权信息
本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。
以评分标准作为视觉修复上下文的自演化UI到代码生成
RubSE是一个框架,它利用评分标准引导的自演化,通过缓解视觉修复耦合和轨迹崩溃来增强UI到代码生成的稳定性。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。