psychometrics

标签

Cards List
#psychometrics

超越分数对齐的 LLM-as-a-Judge 评估:残差评分难度的心理测量学分析

arXiv cs.CL ↗ · 12小时前 缓存

该论文从心理测量学视角评估 LLM-as-a-Judge,使用 Many-Facet Rasch 模型将评分分解为潜在质量、评分者严苛度与残差难度,发现人类与 LLM 在汇总对齐之外仍存在明显的残差难度结构错配。

0 人收藏 0 人点赞
#psychometrics

@JenovaAIAgent:IQ Tester 是一款AI代理,通过30个自适应问题估算你的认知能力,涵盖七大推理领域…

X AI KOLs Following ↗ · 2026-09-23 缓存

IQ Tester 是一款AI代理,通过30个自适应问题估算认知能力,基于心理测量学框架提供详细评估报告,涵盖多个推理领域。

0 人收藏 0 人点赞
#psychometrics

接近持平的大语言模型排名是否对族DIF引导的基准测试重组具有鲁棒性?

arXiv cs.CL ↗ · 2026-09-02 缓存

本研究通过心理测量方法,探讨接近持平的大语言模型排名在基准测试项目组成变化下的鲁棒性。研究发现,尽管整体排名保持稳定,但个别接近的排序可能因项目选择而发生逆转。

0 人收藏 0 人点赞
#psychometrics

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog ↗ · 2026-09-01 缓存

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。

0 人收藏 0 人点赞
#psychometrics

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

arXiv cs.CL ↗ · 2026-08-12 缓存

Introduces an analytically exact framework for controlled behavioral evaluation of LLMs, using fully crossed factorial experiments and exact token-level probability mass functions to isolate causal biases that aggregate benchmarks obscure.

0 人收藏 0 人点赞
#psychometrics

基于模拟响应概率的多模态项目参数估计

arXiv cs.CL ↗ · 2026-08-12 缓存

本文介绍了使用基于Qwen3.5的微调多模态大语言模型来模拟学生响应概率,并估计多项选择题的项目难度参数,从而近似3PL和MCM曲线。

0 人收藏 0 人点赞
#psychometrics

自然语言处理心理测量学

arXiv cs.CL ↗ · 2026-08-10 缓存

本文介绍了NLP心理测量学,这是一个将文本心理预测视为心理测量问题的框架。通过使用LLM人格、情感画像以及句法-语义网络与随机森林回归器,该框架解释了心理健康评分中高达76%的方差,并展示了合成数据在心理测量预测中的前景与局限。

0 人收藏 0 人点赞
#psychometrics

面向AI安全的项目反应理论

arXiv cs.AI ↗ · 2026-08-06 缓存

本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。

0 人收藏 0 人点赞
#psychometrics

每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL ↗ · 2026-08-05 缓存

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

0 人收藏 0 人点赞
#psychometrics

CogArena:大语言模型中认知能力结构的多元方法评估

arXiv cs.CL ↗ · 2026-07-29 缓存

CogArena 引入了一个程序化生成的 13 范式基准,用于评估大语言模型是否展现出可分离的认知能力还是单一的通用能力,结果仅发现对 55 个模型稳定五维特征的支持较弱。

0 人收藏 0 人点赞
#psychometrics

开发并验证大型语言模型依赖量表(LLM-D12-SP)的西班牙语版本

arXiv cs.CL ↗ · 2026-07-27 缓存

本文验证了大型语言模型依赖量表(LLM-D12-SP)的西班牙语版本,确认了其双因子结构和良好的心理测量学特性。

0 人收藏 0 人点赞
#psychometrics

基于微调的多智能体框架在生活叙事中检测OCEAN人格特质

arXiv cs.CL ↗ · 2026-07-15 缓存

本文提出了一种基于微调的多智能体框架,用于从生活叙事中检测OCEAN人格特质。该框架使用经过条件化的大语言模型子智能体,分别采用高、低或中立视角,并通过一个法官大语言模型汇总输出,以减轻偏见并提高可解释性。

0 人收藏 0 人点赞
#psychometrics

从文本到参数:利用正则化嵌入与信度/设计上限预测项目参数

arXiv cs.CL ↗ · 2026-07-09 缓存

本文提出了一种评估框架,利用正则化回归和信度/设计上限,从文本嵌入预测项目参数。结果表明,难度在很大程度上可从文本预测,而区分度和伪猜测则受限于信度,而非文本信号。

0 人收藏 0 人点赞
#psychometrics

大型语言模型的是-否偏差反映答案顺序和措辞,而非道德判断的转变

arXiv cs.CL ↗ · 2026-07-08 缓存

本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。

0 人收藏 0 人点赞
#psychometrics

看似合理但实际无效:对LLM作为合成调查受访者的心理测量学审计

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

本文对大型语言模型作为合成调查受访者进行了心理测量学审计,发现它们无法匹配人类的联合分布和信度,因此不适合作为人类受访者的替代品。

0 人收藏 0 人点赞
#psychometrics

EduArt:一个用于评估大语言模型艺术史知识的教育级基准

arXiv cs.CL ↗ · 2026-07-03 缓存

本文介绍了EduArt,一个包含871道人工编写题目的教育级基准,用于评估多模态大语言模型的艺术史知识与视觉推理能力,揭示了单格式基准会高估模型能力。

0 人收藏 0 人点赞
#psychometrics

多层Q矩阵嵌入的神经网络用于认知诊断 (M-QCDNet):面向心理测量可解释性的结构感知深度学习架构

arXiv cs.LG ↗ · 2026-07-03 缓存

提出M-QCDNet,一种结构感知的深度学习架构,嵌入多层Q矩阵以增强认知诊断中的心理测量可解释性。

0 人收藏 0 人点赞
#psychometrics

LLMs难以衡量区分不同水平学生的能力:阅读理解评估中题目区分度研究

arXiv cs.CL ↗ · 2026-06-18 缓存

本文评估了42个大语言模型在测量阅读理解评估中题目区分度的能力,发现其与人类校准指标弱相关,并指出这是心理测量评估中的一个开放挑战。

0 人收藏 0 人点赞
#psychometrics

LLM裁判存在暗电流:用于LLM-as-a-Judge评估的心理测量数据表

arXiv cs.CL ↗ · 2026-06-16 缓存

本文介绍了一种心理测量数据表协议,用于将LLM裁判作为测量工具进行评估,测量暗电流、位置虚假偏好、稳定交叉敏感性和目标敏感性。基于三个开放权重模型的案例研究揭示了裁判质量和行为的显著差异。

0 人收藏 0 人点赞
#psychometrics

重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为

arXiv cs.AI ↗ · 2026-06-12 缓存

本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈