item-response-theory

标签

Cards List
#item-response-theory

面向AI安全的项目反应理论

arXiv cs.AI · 3天前 缓存

本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。

0 人收藏 0 人点赞
#item-response-theory

每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL · 4天前 缓存

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

0 人收藏 0 人点赞
#item-response-theory

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

arXiv cs.CL · 5天前 缓存

This paper introduces CurveShift, an analysis method that separates overall ability gains from difficulty-specific improvements in LLM agents. Using METR time-horizon data and LiveCodeBench, it finds that most apparent shifts toward harder tasks are ceiling effects, though a genuine hard-task effect exists for reasoning models in competitive programming.

0 人收藏 0 人点赞
#item-response-theory

CalibratedRubric:面向开放式LLM评估的任务自适应评分标准库

arXiv cs.CL · 6天前 缓存

CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。

0 人收藏 0 人点赞
#item-response-theory

简单陷阱:为何大语言模型会低估由误解驱动的难度

arXiv cs.AI · 2026-07-31 缓存

本文研究了LLM生成的数学题目难度评级与实际学生表现的匹配程度,发现LLM系统性地低估了由学习者误解驱动的题目的难度,这一现象被称为“简单陷阱”。

0 人收藏 0 人点赞
#item-response-theory

从文本到参数:利用正则化嵌入与信度/设计上限预测项目参数

arXiv cs.CL · 2026-07-09 缓存

本文提出了一种评估框架,利用正则化回归和信度/设计上限,从文本嵌入预测项目参数。结果表明,难度在很大程度上可从文本预测,而区分度和伪猜测则受限于信度,而非文本信号。

0 人收藏 0 人点赞
#item-response-theory

扩展项目反应理论以实现高效且有意义的多语言评估

arXiv cs.CL · 2026-06-16 缓存

本文介绍了Multilingual-IRT,这是一个统计框架,通过每种语言的难度偏差和拆分可区分性扩展了项目反应理论,能够高效预测未观测到的评估、检测翻译错误以及恢复跨29种语言的文化特定项目。

0 人收藏 0 人点赞
#item-response-theory

项目反应缩放定律:一种用于高效且可泛化的神经缩放估计的测量理论方法

arXiv cs.LG · 2026-06-09 缓存

介绍项目反应缩放定律(IRSL),该定律整合项目反应理论,可高效估计神经缩放定律,将所需评估问题数量减少99.9%,同时达到相当准确性。

0 人收藏 0 人点赞
#item-response-theory

使用项目反应理论审计LLM基准测试

arXiv cs.CL · 2026-06-01 缓存

本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。

0 人收藏 0 人点赞
#item-response-theory

为何安全护栏在不同语言中会退化?

arXiv cs.CL · 2026-05-19 缓存

本文引入一个多组项目反应理论框架,以解耦非英语语言中安全退化背后的因素,揭示安全性主要是一维的,且低资源语言会产生更多不确定的响应。

0 人收藏 0 人点赞
#item-response-theory

评估失效的缩放定律:为何简单平均在数据稀疏和题目难度差距下会崩溃,以及项目反应理论如何跨领域恢复真实情况

arXiv cs.LG · 2026-05-13 缓存

本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈