psychometrics

标签

Cards List
#psychometrics

在预测人们的偏好时,考虑“三的力量”大有裨益

MIT News — Artificial Intelligence ↗ · 2026-06-11 缓存

MIT研究人员在一篇论文中表明,使用三元比较而非两两比较,可以显著提高预测人类偏好的随机效用模型的准确性。

0 人收藏 0 人点赞
#psychometrics

注释者立场作为信号:针对反自闭症能力歧视检测的心理测量加权

arXiv cs.CL ↗ · 2026-05-27 缓存

本文介绍了一种基于偏见意识的评估框架,用于检测大语言模型中的反自闭症能力歧视语言,该框架使用基于注释者立场的心理测量加权真实值。研究发现,大语言模型经常将社区重新赋予的语言错误分类为能力歧视,并依赖表面关键词匹配而非上下文。

0 人收藏 0 人点赞
#psychometrics

生成-评估一致性:LLM驱动自适应评估的必要效度标准

arXiv cs.AI ↗ · 2026-05-20 缓存

介绍了生成-评估一致性(GEA),这是一种用于LLM驱动自适应评估的效度标准,并在一个两阶段自适应测试中对其进行了测量,发现该模型恢复了大约一半的预期方差,且存在系统性偏差。

0 人收藏 0 人点赞
#psychometrics

基于微调Transformer的无响应项目难度建模用于多项选择题:组件表示与多任务学习

arXiv cs.CL ↗ · 2026-05-19 缓存

本文提出对Transformer编码器进行端到端微调,用于多项选择阅读理解项目的无响应项目难度建模,包括组件变体和多任务变体,表明多任务学习在小样本情况下有所改进。

0 人收藏 0 人点赞
#psychometrics

我们能信任AI推断的用户状态吗?一个用于验证LLM在操作环境中用户状态分类可靠性的心理测量学框架

arXiv cs.AI ↗ · 2026-05-18 缓存

本文实证检验了基于LLM的用户状态分类的心理测量学可靠性,发现213项指标中仅有31项满足可靠性标准,对实时自适应系统中的信任提出了质疑。

0 人收藏 0 人点赞
#psychometrics

生成式人工智能模型代际间认知能力的不均衡演化

Reddit r/singularity ↗ · 2026-05-11 缓存

本文提出了一种心理测量框架及 AIQ 基准测试,用于评估生成式人工智能模型的认知特征,揭示了其演化过程的不均衡性:言语能力表现强劲,但知觉推理能力停滞不前。

0 人收藏 0 人点赞
#psychometrics

我们向50个大语言模型发放了45份心理问卷。我们发现的结果并非“个性”。

Reddit r/artificial ↗ · 2026-05-07

研究人员分析了50个大语言模型在45份心理测量问卷上的表现,识别出一个“匹诺曹维度”(Pinocchio Dimension),该维度衡量模型如何认可内在体验,而非反映真实的人格特质。

0 人收藏 0 人点赞
#psychometrics

元认知监测电池:LLM自我监测的跨域基准

arXiv cs.CL ↗ · 2026-04-20 缓存

一个包含524个项目的新型跨域基准(元认知监测电池)使用人类心理测量方法评估LLM在六个认知领域的自我监测能力。应用于20个前沿LLM后,揭示了三种不同的元认知配置,并表明准确率排名与元认知敏感性排名基本相反。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈