直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器

Hugging Face Daily Papers 论文

摘要

本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。

对齐故障检测器筛选已部署的语言模型并为对齐基准测试评分。大多数是生成式评判器,为每个标准执行一次解码,而读取词元概率的分类器,如Llama Guard,每次调用仍只输出一个固定标签。Jev是一个通过强化学习训练的校准决策(RLCD)模型,能在单次调用中回答关于一个输入的多个类型化问题,并提供校准概率。它是否能检测对齐故障尚未被测量。我们提出了RLCDAlignBench,它在十种对齐故障上对Jev进行基准测试:谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐藏不确定性和权力寻求。它涵盖44个基准测试和五个目标模型,由每个基准测试的评分者标注,其中两个由人类标注。这些故障中许多是关系性的,基于参考定义,如用户的信念或注入的指令,仅从响应中无法揭示。因此,我们的关键思想是分别改变Jev被询问的内容和它看到的内容:一方面是问题的措辞和答案类型,另一方面是输入的字段。单个通用问题在零样本情况下达到中位AUROC为0.886,并在大多数基准测试上超越有监督基线。问题措辞影响较小,而上下文更重要,主要通过编码标签的字段。Jev与参考评分者在与人类标签的一致性上匹配,揭示了现有基准测试中的标签缺陷,并且成本比LLM评判评分器低63倍。代码和数据:https://github.com/sumleo/RLCDAlignBench。
查看原文
查看缓存全文

缓存时间: 2026/09/25 11:45

论文页面 - 请直接问 Jev:基于校准决策的强化学习作为 AI 对齐失败的零样本检测器

来源:https://huggingface.co/papers/2609.29429 发布于 9月24日

·

由 https://huggingface.co/sumleo 提交

YI LIU (https://huggingface.co/sumleo) 于 9月25日

摘要

对齐失败检测器用于筛选已部署的语言模型并对对齐基准进行评分。大多数是生成式判断器,每个标准需要一次解码过程,而像 LlamaGuard 这样读取 token 概率的分类器,每次调用仍只输出一个固定标签。Jev 是一个通过校准决策的强化学习训练的模型,可以在一次调用中,以校准的概率回答关于一个输入的多种类型问题。它检测对齐失败的能力尚未被评估。我们提出 RLCDAlignBench,在十个对齐失败类别上对 Jev 进行基准测试:谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐藏不确定性和追求权力。该基准涵盖 44 个基准测试和五个目标模型,由每个基准的评分者标注,其中两个基准由人类标注。这些失败中的许多是关系性的,需要参照用户信念或注入指令等参考来定义,而单独的回答本身无法揭示这些参照。因此,我们的核心思想是将 Jev 被询问的内容与其看到的内容分开调整:一侧是问题的措辞和答案类型,另一侧是输入的字段。一个单一的通用问题在零样本设置下达到了 0.886 的中位 AUROC,并在大多数基准测试上超越了监督基线。问题措辞影响不大,而上下文更重要,主要通过编码标签的字段体现。Jev 与参考评分者在与人类标注的一致性方面匹配,并能发现现有基准测试中的标签缺陷,且成本比 LLM 判断评分器低 63 倍。代码和数据:https://github.com/sumleo/RLCDAlignBench。

查看 arXiv 页面 (https://arxiv.org/abs/2609.29429)查看 PDF (https://arxiv.org/pdf/2609.29429)项目页面 (https://sumleo.github.io/RLCDAlignBench/)GitHub3 (https://github.com/sumleo/RLCDAlignBench)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.29429)

在您的代理中获取此论文:

hf papers read 2609.29429

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.29429 以从该页面链接它。

引用此论文的数据集 1

sumleo/RLCDAlignBench Viewer • 约 3 小时前更新 • 18.3k • 9 (https://huggingface.co/datasets/sumleo/RLCDAlignBench)

引用此论文的空间 0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.29429 以从该页面链接它。

包含此论文的合集 0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection)以从该页面链接它。

相似文章

RLCD是什么?Jev背后的秘密

Hacker News Top

RLCD被解释为一种基于模式的Plackett–Luce目标函数,它推进了奖励建模从标量奖励到成对偏好再到多路校准决策,简化了对Jev的理解。