简单陷阱:为何大语言模型会低估由误解驱动的难度
摘要
本文研究了LLM生成的数学题目难度评级与实际学生表现的匹配程度,发现LLM系统性地低估了由学习者误解驱动的题目的难度,这一现象被称为“简单陷阱”。
arXiv:2607.26067v1 公告类型:cross
摘要:大型语言模型(LLM)越来越多地用于评估教育测评中的题目难度。然而,尚不清楚这些评估是否反映了学习者实际体验到的难度。本研究探讨了LLM生成的难度评级与学生在基础数学任务上的实际表现之间的一致性。四个广泛使用的基于LLM的系统在1-100分制上对32道算术题生成了难度评级,并进行了多次运行(N = 640个评级)。这些评级与来自770名印度尼西亚本科生的答题结果所得到的经验难度进行了比较,使用了经典测量理论(CTT)和项目反应理论(2PL)。结果显示存在中等程度的秩相关(Spearman's rho = 0.52-0.70),表明LLM能够捕捉题目难度的大致顺序。然而,在分数题中出现了显著且系统性的偏离。几道被LLM一致评为简单的题目,在学生看来却是最难的,例如一道100 : 1/2的题目正确率仅为34.16%。我们认为,LLM近似的是课程难度,即根据教学顺序应该容易的难度,而不是由学习者误解所驱动的认知难度。这导致了对误解驱动题目的系统性低估,我们将这一现象称为“简单陷阱”。这些发现凸显了基于LLM的难度估计的一个关键局限性,并表明在缺乏经验依据的情况下依赖此类估计可能会在测评设计和自适应系统中引入偏差。
查看缓存全文
缓存时间: 2026/07/31 04:01
# Easy Trap:为什么LLM会低估由误解驱动的难度 来源:https://arxiv.org/abs/2607.26067 查看PDF (https://arxiv.org/pdf/2607.26067) > 摘要:大语言模型 \(LLMs\) 越来越多地被用于估计教育测评中的题目难度。然而,这些估计是否反映了学习者实际体验到的难度,仍不清楚。本研究考察了LLM生成的难度评级与学生在基础数学任务上的实证表现之间的一致性。四个广泛使用的基于LLM的系统对32道算术题在1-100量表上进行了多次难度评级(\(N = 640\) 个评级)。这些评级与来自770名印度尼西亚本科生的回答所获得的实证难度进行了比较,使用了经典测量理论 \(CTT\) 和项目反应理论 \(2PL\)。结果显示中等程度的等级相关(Spearman's rho = 0\.52\-0\.70),表明LLM能够捕捉题目难度的粗略排序。然而,在分数题目中出现了实质性且系统性的不一致。一些被LLM一致评为简单的题目,对学生来说却是最难的,例如一道100 : 1/2的题目正确率仅为34\.16%。我们认为,LLM近似的是课程难度,即基于教学顺序应该容易的题目,而不是由学习者误解驱动的认知难度。这导致对误解驱动题目的系统性低估,我们将这一现象称为“Easy Trap”。这些发现凸显了基于LLM的难度估计的一个关键局限,并表明在没有实证基础的情况下依赖此类估计可能会在测评设计和自适应系统中引入偏差。 ## 提交历史 来自:Amanda La Hadi \[查看电子邮件 (https://arxiv.org/show-email/bfe706fe/2607.26067)\] **\[v1\]** 周一,2026年6月22日 09:53:25 UTC \(769 KB\)
相似文章
LLM真的能理解题目难度等级吗?对使用LLM自动生成题目的启示
本文研究了LLM能否在大规模阅读和写作测试中准确预测题目难度等级,发现GPT-4.1准确率中等,但不如ConvBERT,且LLM倾向于低估困难题目的难度。
关于LLM“数学证明”声明的问题(15分钟阅读)
本文批判了媒体对LLM局限性数学证明的夸大报道,特别指出关于自我提升的条件性结论如何经常被曲解为普遍不可能性。
错误作为透镜:通过合成误解生成探究LLM推理
本文提出了一个框架,使用LLMs生成针对性的合成误解,这些误解基于从布鲁姆分类学改编的五类分类法,旨在解决教育研究中标记学生错误数据稀缺的问题。
形式主义陷阱:LLM-as-a-Judge 评估器是否在社会负载下被共识模仿所蒙蔽?
本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。
探究LLM的问题解决能力——静力学问题研究
本文评估了LLM在静力学问题上的表现,发现虽然纯文本问题处理得较好,但引入图表和多步推理后准确率下降,表明模型在持续应用视觉信息方面存在困难。