直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器
摘要
本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。
查看缓存全文
缓存时间: 2026/09/25 11:45
论文页面 - 请直接问 Jev:基于校准决策的强化学习作为 AI 对齐失败的零样本检测器
来源:https://huggingface.co/papers/2609.29429 发布于 9月24日
·
由 https://huggingface.co/sumleo 提交
YI LIU (https://huggingface.co/sumleo) 于 9月25日
摘要
对齐失败检测器用于筛选已部署的语言模型并对对齐基准进行评分。大多数是生成式判断器,每个标准需要一次解码过程,而像 LlamaGuard 这样读取 token 概率的分类器,每次调用仍只输出一个固定标签。Jev 是一个通过校准决策的强化学习训练的模型,可以在一次调用中,以校准的概率回答关于一个输入的多种类型问题。它检测对齐失败的能力尚未被评估。我们提出 RLCDAlignBench,在十个对齐失败类别上对 Jev 进行基准测试:谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐藏不确定性和追求权力。该基准涵盖 44 个基准测试和五个目标模型,由每个基准的评分者标注,其中两个基准由人类标注。这些失败中的许多是关系性的,需要参照用户信念或注入指令等参考来定义,而单独的回答本身无法揭示这些参照。因此,我们的核心思想是将 Jev 被询问的内容与其看到的内容分开调整:一侧是问题的措辞和答案类型,另一侧是输入的字段。一个单一的通用问题在零样本设置下达到了 0.886 的中位 AUROC,并在大多数基准测试上超越了监督基线。问题措辞影响不大,而上下文更重要,主要通过编码标签的字段体现。Jev 与参考评分者在与人类标注的一致性方面匹配,并能发现现有基准测试中的标签缺陷,且成本比 LLM 判断评分器低 63 倍。代码和数据:https://github.com/sumleo/RLCDAlignBench。
查看 arXiv 页面 (https://arxiv.org/abs/2609.29429)查看 PDF (https://arxiv.org/pdf/2609.29429)项目页面 (https://sumleo.github.io/RLCDAlignBench/)GitHub3 (https://github.com/sumleo/RLCDAlignBench)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.29429)
在您的代理中获取此论文:
hf papers read 2609.29429
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.29429 以从该页面链接它。
引用此论文的数据集 1
sumleo/RLCDAlignBench Viewer • 约 3 小时前更新 • 18.3k • 9 (https://huggingface.co/datasets/sumleo/RLCDAlignBench)
引用此论文的空间 0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.29429 以从该页面链接它。
包含此论文的合集 0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection)以从该页面链接它。
相似文章
@alacheng:TypeSafe AI创始人Diogo Almeida在Jev发布前的演讲中,本应在OpenAI意识到对齐……
TypeSafe AI创始人Diogo Almeida讨论了当前AI模型的局限性,并介绍了Jev,一个使用RLCD对齐的新模型,专为软件自动化而非人机交互设计。
RLCD是什么?Jev背后的秘密
RLCD被解释为一种基于模式的Plackett–Luce目标函数,它推进了奖励建模从标量奖励到成对偏好再到多路校准决策,简化了对Jev的理解。
在人机对齐下借助AI辅助决策的学习
本文研究了在人机对齐条件下学习借助AI做出最优决策的问题,表明对齐可以降低学习的复杂度,并给出了遗憾界。
@rohanpaul_ai: 一个名为JevBench的新基准刚刚发布。针对输出为有界软件决策而非开放式文本…
JevBench是一个新基准,通过结合智能、校准、速度和成本来评估AI模型在有界软件决策上的表现,由@rohanpaul_ai宣布。
为Jev制作了使用RLCD的通用开源模型,并且它超越了所有Jev基准测试。HF空间、基准测试、模型、仓库
本文宣布了Laya的发布,这是一个使用RLCD训练的开源4.21亿参数非自回归决策模型,它超越了Jev基准测试,并可在Hugging Face上进行测试。