标签
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
This paper introduces CurveShift, an analysis method that separates overall ability gains from difficulty-specific improvements in LLM agents. Using METR time-horizon data and LiveCodeBench, it finds that most apparent shifts toward harder tasks are ceiling effects, though a genuine hard-task effect exists for reasoning models in competitive programming.
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
本文研究了LLM生成的数学题目难度评级与实际学生表现的匹配程度,发现LLM系统性地低估了由学习者误解驱动的题目的难度,这一现象被称为“简单陷阱”。
本文提出了一种评估框架,利用正则化回归和信度/设计上限,从文本嵌入预测项目参数。结果表明,难度在很大程度上可从文本预测,而区分度和伪猜测则受限于信度,而非文本信号。
本文介绍了Multilingual-IRT,这是一个统计框架,通过每种语言的难度偏差和拆分可区分性扩展了项目反应理论,能够高效预测未观测到的评估、检测翻译错误以及恢复跨29种语言的文化特定项目。
介绍项目反应缩放定律(IRSL),该定律整合项目反应理论,可高效估计神经缩放定律,将所需评估问题数量减少99.9%,同时达到相当准确性。
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。
本文引入一个多组项目反应理论框架,以解耦非英语语言中安全退化背后的因素,揭示安全性主要是一维的,且低资源语言会产生更多不确定的响应。
本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。