简单陷阱:为何大语言模型会低估由误解驱动的难度

arXiv cs.AI 论文

摘要

本文研究了LLM生成的数学题目难度评级与实际学生表现的匹配程度,发现LLM系统性地低估了由学习者误解驱动的题目的难度,这一现象被称为“简单陷阱”。

arXiv:2607.26067v1 公告类型:cross 摘要:大型语言模型(LLM)越来越多地用于评估教育测评中的题目难度。然而,尚不清楚这些评估是否反映了学习者实际体验到的难度。本研究探讨了LLM生成的难度评级与学生在基础数学任务上的实际表现之间的一致性。四个广泛使用的基于LLM的系统在1-100分制上对32道算术题生成了难度评级,并进行了多次运行(N = 640个评级)。这些评级与来自770名印度尼西亚本科生的答题结果所得到的经验难度进行了比较,使用了经典测量理论(CTT)和项目反应理论(2PL)。结果显示存在中等程度的秩相关(Spearman's rho = 0.52-0.70),表明LLM能够捕捉题目难度的大致顺序。然而,在分数题中出现了显著且系统性的偏离。几道被LLM一致评为简单的题目,在学生看来却是最难的,例如一道100 : 1/2的题目正确率仅为34.16%。我们认为,LLM近似的是课程难度,即根据教学顺序应该容易的难度,而不是由学习者误解所驱动的认知难度。这导致了对误解驱动题目的系统性低估,我们将这一现象称为“简单陷阱”。这些发现凸显了基于LLM的难度估计的一个关键局限性,并表明在缺乏经验依据的情况下依赖此类估计可能会在测评设计和自适应系统中引入偏差。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:01

# Easy Trap:为什么LLM会低估由误解驱动的难度
来源:https://arxiv.org/abs/2607.26067
查看PDF (https://arxiv.org/pdf/2607.26067)

> 摘要:大语言模型 \(LLMs\) 越来越多地被用于估计教育测评中的题目难度。然而,这些估计是否反映了学习者实际体验到的难度,仍不清楚。本研究考察了LLM生成的难度评级与学生在基础数学任务上的实证表现之间的一致性。四个广泛使用的基于LLM的系统对32道算术题在1-100量表上进行了多次难度评级(\(N = 640\) 个评级)。这些评级与来自770名印度尼西亚本科生的回答所获得的实证难度进行了比较,使用了经典测量理论 \(CTT\) 和项目反应理论 \(2PL\)。结果显示中等程度的等级相关(Spearman's rho = 0\.52\-0\.70),表明LLM能够捕捉题目难度的粗略排序。然而,在分数题目中出现了实质性且系统性的不一致。一些被LLM一致评为简单的题目,对学生来说却是最难的,例如一道100 : 1/2的题目正确率仅为34\.16%。我们认为,LLM近似的是课程难度,即基于教学顺序应该容易的题目,而不是由学习者误解驱动的认知难度。这导致对误解驱动题目的系统性低估,我们将这一现象称为“Easy Trap”。这些发现凸显了基于LLM的难度估计的一个关键局限,并表明在没有实证基础的情况下依赖此类估计可能会在测评设计和自适应系统中引入偏差。

## 提交历史

来自:Amanda La Hadi \[查看电子邮件 (https://arxiv.org/show-email/bfe706fe/2607.26067)\] **\[v1\]** 周一,2026年6月22日 09:53:25 UTC \(769 KB\)

相似文章