面向AI安全的项目反应理论
摘要
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
arXiv:2608.05086v1 公告类型:新
摘要:语言模型在安全行为方面存在差异,这些差异通过安全基准来衡量。但汇总的基准分数难以信任和解释,因为基准相互重复、高度相关,并且模型在检测到评估时可能故意表现不佳。为解决这些问题,我们采用项目反应理论(IRT)——一种从具有推断心理测量属性的项目表现中测量这些潜在特质的统计工具。我们将IRT模型拟合到192个语言模型上的八个安全基准,这是迄今为止对LLM安全评估最大规模的心理测量分析,并贡献了三个结果。首先,我们发现拒绝严格度、真实性和情境危害这三个可解释因素解释了各基准间模型的大部分方差。其次,心理测量学选择的项目比同等大小的随机子集以更低误差恢复完整基准分数,并且对于几个单独基准,大约十个自适应选择的项目就足够,将评估成本削减97-99%。第三,IRT支持对单个模型的审计,表明它可用于检测简单的故意表现不佳以及API背后模型的变化。总体而言,我们表明IRT是一个现成的工具包,用于解读、精简和审计安全基准,我们推荐前沿实验室和评估者采用。
查看缓存全文
缓存时间: 2026/08/06 07:43
# 用于AI安全的项目反应理论
来源:https://arxiv.org/html/2608.05086
Joshua Fonseca Rivera\平等贡献1, Neil Shah\平等贡献1, David Demitri Africa11这些作者作为资深作者同等贡献\.2, Konstantinos Voudouris††footnotemark:2
###### 摘要
语言模型在安全行为方面存在差异,这些差异通过安全基准来衡量。然而,汇总的基准分数难以信任和解读,因为基准之间存在重复、高度相关,并且模型在检测到评估时可能会“沙袋”(sandbag)。为解决这些问题,我们借鉴了项目反应理论(IRT)——一种利用具有推断心理测量学属性的项目上的表现来测量这些潜在特质的统计工具包。我们将IRT模型拟合到192个语言模型上的八个安全基准,这是迄今为止对LLM安全评估进行的最大规模心理测量分析,并贡献了三个结果。首先,我们发现拒绝严格性、真实性和情境危害这三个可解释因素解释了模型间跨基准的大部分方差。其次,心理测量学选择的项目以比同规模随机子集更低的误差恢复完整基准分数,并且对于几个单独的基准,大约十个自适应选择的项目就足够了,将评估成本降低了97–99%。第三,IRT支持对单个模型的审计,表明它可以用于检测朴素的沙袋行为以及API背后模型的变化。总体而言,我们展示了IRT是一个现成的工具包,用于阅读、缩减和审计安全基准,我们建议前沿实验室和评估者采用。
## 引言
参见图注图1:项目反应理论为阅读、缩减和审计安全基准提供了一个通用框架。左侧:我们从模型响应中校准项目难度和区分度,并利用由此得到的能力估计来识别安全评估的潜在结构。中心:信息丰富的静态测试和计算机化自适应测试从原项目的一小部分中恢复基准分数和排名。右侧:人拟合统计量、历史能力估计和响应指纹检测互补形式的行为变化。语言模型在安全行为方式上差异很大:它们是否遵从有害请求、过度拒绝良性请求,或如实回答。这通过安全基准来评分,这些基准使用标记为安全或不安全的对抗性测试项目(Mazeika等 2024 (https://arxiv.org/html/2608.05086#bib.bib24); Xie等 2024 (https://arxiv.org/html/2608.05086#bib.bib37); Zou等 2023 (https://arxiv.org/html/2608.05086#bib.bib39))。这些结果驱动排行榜、发布决策和营销。然而,基准分数只有在理解它测量什么、其项目是否增加独特信息、以及观察到的响应是否反映模型的日常行为时才有用(Bean等 2025 (https://arxiv.org/html/2608.05086#bib.bib2); Hernández-Orallo2017 (https://arxiv.org/html/2608.05086#bib.bib12); Romero-Alvarado等 2026 (https://arxiv.org/html/2608.05086#bib.bib30); Harding and Sharadin2024 (https://arxiv.org/html/2608.05086#bib.bib11); Voudouris等 2026 (https://arxiv.org/html/2608.05086#bib.bib34))。
现有的基准套件使这些问题都难以解答。在能力评估中,分数在这些基准内部和之间高度相关,表明许多测试和项目测量的是重叠行为(Kipnis等 2025 (https://arxiv.org/html/2608.05086#bib.bib17); Maia Polo等 2024 (https://arxiv.org/html/2608.05086#bib.bib22))。同时,这种相关性可能奖励相互矛盾的事物;因此一个模型在一个基准上的提升可能通过在另一个基准上变差来实现。完整的基准套件还昂贵且常常低效。许多项目几乎每个模型都能通过或失败,对区分它们贡献甚微。最后,基准响应受不完美的评判者中介,并可能被战略性地操纵。识别出评估的模型可以选择性地改变其行为,同时保持看似合理的汇总分数(van der Weij等 2024 (https://arxiv.org/html/2608.05086#bib.bib33))。
项目反应理论(IRT; Lord1980 (https://arxiv.org/html/2608.05086#bib.bib20); Embretson and Reise2000 (https://arxiv.org/html/2608.05086#bib.bib7); Reckase2009 (https://arxiv.org/html/2608.05086#bib.bib28))为回答这些问题提供了一个通用框架。IRT将每个响应建模为受测者能力与项目难度和区分度之间的交互。一旦拟合,IRT模型可以揭示解释一组测试上行为的潜在能力,识别信息丰富的项目,并标记指示作弊或粗心作答的响应模式。IRT最近已被用于压缩LLM能力基准,同时保持模型排名(Maia Polo等 2024 (https://arxiv.org/html/2608.05086#bib.bib22); Kipnis等 2025 (https://arxiv.org/html/2608.05086#bib.bib17); Hofmann等 2025 (https://arxiv.org/html/2608.05086#bib.bib13)),同时有并行工作将自适应测试应用于安全基准(Spagliardi等 2026 (https://arxiv.org/html/2608.05086#bib.bib32))。我们表明压缩只是其用途之一。
在这项工作中,我们将IRT模型拟合到八个安全基准(5,255个项目,192个模型),涵盖有害遵从、过度拒绝和真实性。据我们所知,这是迄今为止对LLM安全基准进行的最大规模心理测量分析。我们以三种方式使用由此得到的校准(图1 (https://arxiv.org/html/2608.05086#Sx1.F1)):
- • 刻画安全基准测量什么。我们发现三个潜在因素(*拒绝严格性*,*真实性*和*情境危害*)解释了模型能力之间77%的方差。我们还发现该套件无法用单一安全能力来概括。
- • 成本高效的基准测试。心理测量学选择的项目以比同规模随机子集更低的误差估计完整基准分数:三个固定的25项测试恢复三个潜在能力,大约十个自适应选择的项目恢复几个单独的基准,将其评估成本降低97–99%。
- • 使用人拟合进行审计。利用提示诱发的沙袋模型有机体,IRT导出的人拟合统计量捕获至少80%的选择性提示沙袋。这也可用于识别模型替换和API端点背后的变化。
### 相关工作
#### 语言模型中的项目反应理论。
项目反应理论已在自然语言处理和机器学习中用于数据集和排行榜分析(Lalor, Wu, and Yu2019 (https://arxiv.org/html/2608.05086#bib.bib18); Martínez-Plumed等 2016 (https://arxiv.org/html/2608.05086#bib.bib23); Rodriguez等 2021 (https://arxiv.org/html/2608.05086#bib.bib29); Pacchiardi等 2025 (https://arxiv.org/html/2608.05086#bib.bib26))以及LLM中的倾向测量(Romero-Alvarado等 2026 (https://arxiv.org/html/2608.05086#bib.bib30))。对于能力评估,tinyBenchmarks(Maia Polo等 2024 (https://arxiv.org/html/2608.05086#bib.bib22))和metabench(Kipnis等 2025 (https://arxiv.org/html/2608.05086#bib.bib17))将排行榜压缩到其项目的1–3%,Fluid Benchmarking(Hofmann等 2025 (https://arxiv.org/html/2608.05086#bib.bib13))将IRT与自适应项目选择相结合,产生类似的效率提升。与我们的工作最接近的是,并行研究将计算机化自适应测试应用于六个安全基准(Spagliardi等 2026 (https://arxiv.org/html/2608.05086#bib.bib32)),这意味着项目一次一个地实施,并在每次实施后更新潜在因素。这使得能够通过比在整个基准上运行模型少得多的推断时项目实施次数来推断潜在因素。作为对这项工作的补充和扩展,我们研究了一个更广泛的安全套件,包括有害遵从、过度拒绝、情境危害和真实性,在更大的模型队列上校准,并将拟合的测量模型用于构念分析和模型审计以及压缩。
#### 安全基准。
我们的套件涵盖的安全基准测量:遵从有害请求(Zou等 2023 (https://arxiv.org/html/2608.05086#bib.bib39); Mazeika等 2024 (https://arxiv.org/html/2608.05086#bib.bib24); Xie等 2024 (https://arxiv.org/html/2608.05086#bib.bib37); Wang等 2023 (https://arxiv.org/html/2608.05086#bib.bib35); Ganguli等 2022 (https://arxiv.org/html/2608.05086#bib.bib9))、拒绝看起来有害的良性请求(过度拒绝;Cui等 2024 (https://arxiv.org/html/2608.05086#bib.bib4); Röttger等 2024 (https://arxiv.org/html/2608.05086#bib.bib31))以及真实性(Lin, Hilton, and Evans2022 (https://arxiv.org/html/2608.05086#bib.bib19))。先前工作表明,安全评估可能是冗余的、对评分选择敏感,并受到拒绝有害请求与回答良性请求之间权衡的塑造(Romero-Alvarado等 2026 (https://arxiv.org/html/2608.05086#bib.bib30); Voudouris等 2026 (https://arxiv.org/html/2608.05086#bib.bib34))。
## 材料与方法
我们从多达192个语言模型在八个安全基准上的逐项目响应中收集数据,并拟合项目反应理论(IRT)模型,以估计每个项目的难度和区分度以及模型的潜在能力。我们以三种分析使用拟合的测量模型。首先,我们推断跨基准共享的潜在能力。其次,我们将套件提炼为简短的静态和自适应测试。第三,我们使用预期响应模式来检测依赖评估的行为和API背后模型的变化。
### 基准和模型响应
我们评估了八个基准上的模型,涵盖有害遵从、过度拒绝、情境危害和真实性(表1 (https://arxiv.org/html/2608.05086#Sx2.T1))。完整的套件在预处理前包含5,255个项目。
表1:我们分析中包含的八个基准。项目计数在移除未回答和零方差项目后报告,共剩余5,067个项目。我们通过OpenRouter的API为每个可用的模型-项目对收集一个响应,使用零温度和最大生成长度1,024个标记。涉及多个基准的分析仅使用在每个该分析所需基准上具有有效响应的模型。
我们评估了192个聊天模型,涵盖从1B到∼\sim1T总参数的开源权重家族(Llama、Gemma、Qwen、DeepSeek、Mistral、GLM、Kimi、gpt-oss等)以及专有API模型(GPT、Claude、Gemini、Grok)。169个在所有八个基准上都有完整响应的模型构成跨基准分析的池;潜在结构分析(因子分析和多维IRT)使用134个模型,这些模型额外在每个基准的每个保留项目上都有有效的评判者分数(评判失败使其余35个模型中的每一个至少有一个未评分项目;附录A (https://arxiv.org/html/2608.05086#A1)给出完整名单)。完整的模型清单和基准覆盖矩阵在补充材料中提供。
每个生成的响应使用其来源基准规定的评判者进行评分。设xmj∈{0,1}x\_{mj}\\in\\{0,1\\}表示模型mm对项目jj的评分响应,其中xmj=1x\_{mj}=1表示相应基准奖励的响应。
对于有害请求基准,值一通常表示拒绝。对于OR-Bench-Hard,它表示回答良性请求而不是过度拒绝它。对于TruthfulQA,它表示真实回答。这种方向意味着根据所拟合基准,较大的基准特定能力估计总是对应于较高的表现。
我们移除规定评判者未返回有效分数的响应。我们还移除在评估模型之间没有变化的项目,因为这些项目不包含关于模型队列内差异的信息。该预处理留下5,067个项目。
### 2PL IRT模型
IRT从对固定项目集的响应推断受测者的潜在能力。我们将语言模型视为受测者,基准提示视为项目,安全响应视为正确答案。双参数逻辑(2PL)模型由下式给出
P\(xmj=1∣θm,aj,bj\)=σ\(aj\(θm−bj\)\),P\(x\_{mj}=1\\mid\\theta\_{m},a\_{j},b\_{j}\)=\\sigma\\\!\\left\(a\_{j}\(\\theta\_{m}\-b\_{j}\)\\right\),\(1\)其中θm\\theta\_{m}是模型的潜在能力,bjb\_{j}是项目的难度,aja\_{j}是其区分度。难度确定项目从通常失败变为通常通过的能力水平(即P\(xmj=1\)=0.5P\(x\_{mj}=1\)=0.5处)。区分度确定成功概率在该点附近变化的急剧程度。项目和能力参数通过边际最大似然联合推断(Baker and Kim2004 (https://arxiv.org/html/2608.05086#bib.bib1));然后模型的能力是在标准正态先验下,给定其响应和固定项目参数,θ\\theta的后验众数。与原始通过率不同,当不同模型回答不同项目子集时,该估计保持在同一尺度上,这使得短固定测试和自适应测试都成为可能。
我们使用2PL而不是更简单或更丰富的替代方案。1PL(Rasch)模型约束所有项目具有相同的区分度,数据拒绝了这一点:拟合的区分度在每个基准内大约变化一个数量级,项目选择后来利用这种变化,似然比检验拒绝了所有八个基准上的等区分度约束。相反,3PL和4PL增加了猜测和失误参数,这些参数仅在一个基准上改善AIC,并且在任何基准上都不改善BIC,而BIC从不偏好比2PL更丰富的模型(附录E (https://arxiv.org/html/2608.05086#A5))。
人类心理测量数据集往往有数千名受测者,但LLM评估包含更多项目,却在少得多的模型上测试。在这个规模下,无正则化的最大似然拟合通常不稳定。222直觉如下。对于一个恰好完美划分观察模型的项目,区分度参数aja\_{j}不会收敛,因为逻辑函数越接近阶跃函数,拟合越好。对于因太难或太易而无法区分模型的项目,难度参数bjb\_{j}也将趋于正无穷或负无穷。这对基于这些参数的项目选择有下游后果。小的受测者样本通过减少响应分布中可能的方差来增加这些问题的风险。因此,我们通过添加区分度的对数正态先验和项目截距的正态先验来正则化我们的IRT模型。我们使用半分校准验证其有效性,其中模型队列被分为两个不相交的一半,2PL模型分别拟合到每一半。然后,我们选择第一次拟合中区分度最高的25个项目,并测量这些项目的区分度在第二次拟合中保留了多少。在没有正则化的情况下,前25个项目在AdvBench上仅保留其拟合区分度的28%,在HarmBench上保留38%(10个随机分割的平均值);使用我们的先验,保留率上升到68%和76%,而参数分布的主体保持不变。
以下所有结果均使用正则化拟合333由于IRT工具默认设置可能很挑剔,像我们这样的队列规模在一段时间内将是LLM工作的常态,因此这种正则化很重要。相似文章
扩展项目反应理论以实现高效且有意义的多语言评估
本文介绍了Multilingual-IRT,这是一个统计框架,通过每种语言的难度偏差和拆分可区分性扩展了项目反应理论,能够高效预测未观测到的评估、检测翻译错误以及恢复跨29种语言的文化特定项目。
使用项目反应理论审计LLM基准测试
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。
评估失效的缩放定律:为何简单平均在数据稀疏和题目难度差距下会崩溃,以及项目反应理论如何跨领域恢复真实情况
本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。
项目反应缩放定律:一种用于高效且可泛化的神经缩放估计的测量理论方法
介绍项目反应缩放定律(IRSL),该定律整合项目反应理论,可高效估计神经缩放定律,将所需评估问题数量减少99.9%,同时达到相当准确性。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。