标签
该论文从心理测量学视角评估 LLM-as-a-Judge,使用 Many-Facet Rasch 模型将评分分解为潜在质量、评分者严苛度与残差难度,发现人类与 LLM 在汇总对齐之外仍存在明显的残差难度结构错配。
IQ Tester 是一款AI代理,通过30个自适应问题估算认知能力,基于心理测量学框架提供详细评估报告,涵盖多个推理领域。
本研究通过心理测量方法,探讨接近持平的大语言模型排名在基准测试项目组成变化下的鲁棒性。研究发现,尽管整体排名保持稳定,但个别接近的排序可能因项目选择而发生逆转。
BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。
Introduces an analytically exact framework for controlled behavioral evaluation of LLMs, using fully crossed factorial experiments and exact token-level probability mass functions to isolate causal biases that aggregate benchmarks obscure.
本文介绍了使用基于Qwen3.5的微调多模态大语言模型来模拟学生响应概率,并估计多项选择题的项目难度参数,从而近似3PL和MCM曲线。
本文介绍了NLP心理测量学,这是一个将文本心理预测视为心理测量问题的框架。通过使用LLM人格、情感画像以及句法-语义网络与随机森林回归器,该框架解释了心理健康评分中高达76%的方差,并展示了合成数据在心理测量预测中的前景与局限。
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
CogArena 引入了一个程序化生成的 13 范式基准,用于评估大语言模型是否展现出可分离的认知能力还是单一的通用能力,结果仅发现对 55 个模型稳定五维特征的支持较弱。
本文验证了大型语言模型依赖量表(LLM-D12-SP)的西班牙语版本,确认了其双因子结构和良好的心理测量学特性。
本文提出了一种基于微调的多智能体框架,用于从生活叙事中检测OCEAN人格特质。该框架使用经过条件化的大语言模型子智能体,分别采用高、低或中立视角,并通过一个法官大语言模型汇总输出,以减轻偏见并提高可解释性。
本文提出了一种评估框架,利用正则化回归和信度/设计上限,从文本嵌入预测项目参数。结果表明,难度在很大程度上可从文本预测,而区分度和伪猜测则受限于信度,而非文本信号。
本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。
本文对大型语言模型作为合成调查受访者进行了心理测量学审计,发现它们无法匹配人类的联合分布和信度,因此不适合作为人类受访者的替代品。
本文介绍了EduArt,一个包含871道人工编写题目的教育级基准,用于评估多模态大语言模型的艺术史知识与视觉推理能力,揭示了单格式基准会高估模型能力。
提出M-QCDNet,一种结构感知的深度学习架构,嵌入多层Q矩阵以增强认知诊断中的心理测量可解释性。
本文评估了42个大语言模型在测量阅读理解评估中题目区分度的能力,发现其与人类校准指标弱相关,并指出这是心理测量评估中的一个开放挑战。
本文介绍了一种心理测量数据表协议,用于将LLM裁判作为测量工具进行评估,测量暗电流、位置虚假偏好、稳定交叉敏感性和目标敏感性。基于三个开放权重模型的案例研究揭示了裁判质量和行为的显著差异。
本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。