基于模拟响应概率的多模态项目参数估计
摘要
本文介绍了使用基于Qwen3.5的微调多模态大语言模型来模拟学生响应概率,并估计多项选择题的项目难度参数,从而近似3PL和MCM曲线。
arXiv:2608.10154v1 公告类型:新
摘要:我们展示了使用基于Qwen3.5的微调多模态大语言模型(LLM)重建多项选择模型(MCM)和三参数逻辑(3PL)模型曲线的结果。该模型通过提示和微调,在包含图像和文本刺激的大型多项选择题训练语料库上,以标记的学生能力水平为条件,复现选项选择概率。通过学习再现学生在离散能力范围内的系统性错误模式,LLM隐式捕获了3PL和MCM曲线中编码的潜在响应概率。这使我们能够直接从模型预测的选项概率中,准确逼近保留测试集上的项目难度。
查看缓存全文
缓存时间: 2026/08/12 08:32
# 使用模拟响应概率的多模态题目参数估计 来源:https://arxiv.org/html/2608.10154 Christopher Ormerod College Board cormerod@collegeboard\.org &YoungKoung Kim College Board ykim@collegeboard\.org ###### 摘要 我们展示了使用基于 Qwen3\.5 微调的多模态大语言模型 \(LLM\) 重建多选题模型 \(MCM\) 和三参数逻辑斯蒂克 \(3PL\) 模型曲线的结果。该模型经过提示和微调,能够在包含图像和文本刺激的大规模多选题训练语料上,以一组带标签的学生能力水平为条件,复现选项选择概率。通过学习复现学生在离散能力范围内的系统性错误模式,LLM 隐式地捕获了 3PL 和 MCM 曲线中编码的潜在响应概率。这使我们能够直接从模型预测的选项概率中,在留出测试集上准确近似题目难度。 使用模拟响应概率的多模态题目参数估计 Christopher OrmerodCollege Boardcormerod@collegeboard\.orgYoungKoung KimCollege Boardykim@collegeboard\.org ## 1引言 题目难度参数对于评估一项测评是否准确衡量学生知识、区分学生以及识别具体学习差距至关重要。获取这些参数所需的现场测试不仅昂贵且劳动密集,而且还存在固有的安全风险。因此,研究人员探索了机器学习技术来近似这些参数AlKhuzaey et al\. \(2024 (https://arxiv.org/html/2608.10154#bib.bib1)\)。鉴于大语言模型 \(LLMs\) 的能力,越来越多的文献出现在使用它们预测题目难度参数方面。已经提出了两种特征截然不同的方法:将题目刺激及其特征作为微调后 LLM 的输入,采用回归框架Li et al\. \(2025 (https://arxiv.org/html/2608.10154#bib.bib9)\);以及使用 LLM 作为模拟被试来测试刺激Maeda \(2025 (https://arxiv.org/html/2608.10154#bib.bib13)\)。由于训练方法的进步Wang et al\. \(2024 (https://arxiv.org/html/2608.10154#bib.bib26)\)以及将 transformer 架构扩展到出现涌现能力的规模的能力Vaswani et al\. \(2017 (https://arxiv.org/html/2608.10154#bib.bib25)\),生成式 LLM 已变得日益强大Wei et al\. \(2022 (https://arxiv.org/html/2608.10154#bib.bib27)\)。生成模型的主导范式已从开放式文本生成转向通过提示进行指令遵循Chung et al\. \(2022 (https://arxiv.org/html/2608.10154#bib.bib3)\)。提示的灵活性允许研究人员指示 LLM 以有针对性的方式回答问题,从而能够模拟具有特定技能组合Lu and Wang \(2024 (https://arxiv.org/html/2608.10154#bib.bib12)\)、知识He\-Yueya et al\. \(2024 (https://arxiv.org/html/2608.10154#bib.bib7)\)和能力水平Liu et al\. \(2025 (https://arxiv.org/html/2608.10154#bib.bib11)\)的学生。本研究扩展了以参数高效方式微调模型来模拟不同能力学生的相关工作Scarlatos et al\. \(2025 (https://arxiv.org/html/2608.10154#bib.bib21)\),随后将其应用于选择题Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)。先前的工作研究了使用名义响应模型 \(NRM\) 和双参数逻辑斯蒂克 \(2PL\) 模型来重建题目特征曲线Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)以估计题目参数Thissen and Steinberg \(1986 (https://arxiv.org/html/2608.10154#bib.bib23)\)。这两个模型都有一个共同的限制性假设:随着能力降低,正确响应的概率趋近于零。三参数逻辑斯蒂克 \(3PL\) 模型Thissen and Steinberg \(1986 (https://arxiv.org/html/2608.10154#bib.bib23)\)和多选题模型 \(MCM\)Thissen and Steinberg \(1984 (https://arxiv.org/html/2608.10154#bib.bib22)\); Samejima \(1969 (https://arxiv.org/html/2608.10154#bib.bib20)\)通过纳入非零下渐近线来解决这一问题,从而考虑了猜测的可能性。首先,本研究对Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)的框架引入了几项改进,并将其应用于大规模数学题语料。其次,我们通过微调基于混合 transformer 架构的多模态模型,展示了该框架对同时包含文本和图像题目的应用。虽然这看起来可能相当繁琐,但与基于回归的基线方法相比,我们能够以非常高的准确度重现题目难度参数。本文的组织结构如下:方法部分,即§2 (https://arxiv.org/html/2608.10154#S2),涵盖本项目中使用的响应和题目数据的性质、用于确定题目参数的响应建模、我们对能力水平进行离散化的方式、我们使用微调生成式 LLM 的方式、基线方法以及评估指标。在§3 (https://arxiv.org/html/2608.10154#S3) 中,我们展示了结果,最后在§4 (https://arxiv.org/html/2608.10154#S4) 中进行讨论。 ## 2方法 为了解释我们的方法,我们有原始形式的响应数据,以及基于该数据的各种模型:3PL 模型Thissen and Steinberg \(1986 (https://arxiv.org/html/2608.10154#bib.bib23)\)、MCMsThissen and Steinberg \(1984 (https://arxiv.org/html/2608.10154#bib.bib22)\)、离散 MCMsOrmerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)和 LLMsTouvron et al\. \(2023 (https://arxiv.org/html/2608.10154#bib.bib24)\)。这些模型已表示在图1 (https://arxiv.org/html/2608.10154#S2.F1) 中,而标记为iito vii的箭头表示定义每个模型参数的各种方式,无论是根据原始响应还是其他模型。 Responses3PLMCMLLMiiiiiiiiiiii,ivivvvvivi,viivii图 1:本研究所用数据与模型之间关系的示意图。以下各小节专门定义本研究中使用的数据、模型以及推导每个模型参数的方法。在所有这些定义之后,我们的目标是重建由ii和iiii分别定义的 3PL 模型和 MCM 的参数。 ### 2\.1数据 本研究中的原始数据由两个不同的对象组成:题目和针对这些题目的响应。 #### 2\.1\.1题目 每个题目由一个刺激和一组四个不同选项组成。由于我们对数学的理解本质上可以是视觉化的,我们允许刺激和选项都有相关联的图像组件。为了便于将图像作为输入进行组合,我们按照图2 (https://arxiv.org/html/2608.10154#S2.F2) 所示的方式将图像转换为一张图像。 stim abcd abcdStim 图 2:刺激和选项图像组合成单个图像的方式。左图描绘了仅刺激图像,中图描绘了仅选项图像,右图描绘了刺激和选项同时存在的情况。该数据集是使用题目模型生成的,题目模型规定了生成新的、功能正常的测试题目所需的结构、内容和可变特征Gierl and Haladyna \(2013 (https://arxiv.org/html/2608.10154#bib.bib5)\)。总共有 970 个题目模型和总共 4,848 个题目。为了避免混淆,我们按题目模型将题目分为训练集、开发集和测试集。这在题目层面给出了一个自然的划分,如表1 (https://arxiv.org/html/2608.10154#S2.T1) 所示。 ### 2\.2响应建模 共有 1388 万条响应。每个被试的能力水平是独立地从更大的已校准题目数据集中得出的。这些响应为我们提供了每个题目平均约 2860 条响应,最少为 860 条。平均响应能力水平为 0\.31,标准差约为 1。 表 1:题目如何被划分为测试集、训练集和开发集的表示。鉴于这些响应中的每一个都可以与特定学生能力值相关联,我们可以将学生jj(能力水平为θj\\theta\_\{j\})对题目ii给出正确答案的概率建模为 Pij\(X=1\)=ci\+\(1−ci\)σ\(ai\(θj−bi\)\)P\_\{ij\}\(X=1\)=c\_\{i\}\+\(1\-c\_\{i\}\)\\sigma\(a\_\{i\}\(\\theta\_\{j\}\-b\_\{i\}\)\)\(1\)其中σ\\sigma是通常的 sigmoid 函数。对于任何特定题目,至少有 10 个正确或错误响应,这有助于通过使用带边界约束的有限内存 Broyden–Fletcher–Goldfarb–Shanno \(L\-BFGS\-B\) 算法最小化负对数似然函数,获得题目参数\{ai,bi,ci\}\\\{a\_\{i\},b\_\{i\},c\_\{i\}\\\}的稳定估计。为了满足ai\>0a\_\{i\}\>0和0\<ci\<10\<c\_\{i\}\<1的约束,我们通过使用受约束优化来直接估计这些参数。此外,为了将 3PL 模型与模拟响应概率联系起来,我们注意到,如果我们将 \(1 (https://arxiv.org/html/2608.10154#S2.E1)\) 定义为正确选项的选择概率,其形式为 Pij=ci\+\(1−ci\)σ\(ai\(θj−bi\)\)P\_\{ij\}=c\_\{i\}\+\(1\-c\_\{i\}\)\\sigma\(a\_\{i\}\(\\theta\_\{j\}\-b\_\{i\}\)\),那么对于每个选项,概率之和为 1 的约束自动满足。 为了评估每个错误选项的表现,我们可以使用 Thissen 和 Steinberg 提出的更一般的 MCMThissen and Steinberg \(1984 (https://arxiv.org/html/2608.10154#bib.bib22)\)。选项kk的响应概率可以定义如下 Pijk=dik\+\(1−∑k’dik’\)σ\(aik\(θj−bik\)\)P\_\{ijk\}=d\_\{ik\}\+\(1\-\\sum\_\{k’\}d\_\{ik’\}\)\\sigma\(a\_\{ik\}\(\\theta\_\{j\}\-b\_\{ik\)\)\)\(2\)其中dikd\_\{ik\}是选项kk的下渐近线,aika\_\{ik\}是区分度参数,bikb\_\{ik\}是截止点。为简单起见,我们明确选择每个选项的dikd\_\{ik\},使得∑kdik\<1\\sum\_\{k\}d\_\{ik\}<1。为了确保dik\>0d\_\{ik\}>0,这为我们提供了任意题目的∑kdik=1\\sum\_\{k\}d\_\{ik\}=1。该模型是 Thissen 和 Steinberg 的多选题模型的一种重新表述Thissen and Steinberg \(1984 (https://arxiv.org/html/2608.10154#bib.bib22)\)。或者,它推广了 Samejima 的版本,其中dik=K−1d\_\{ik\}=K^\{-1\}Samejima \(1969 (https://arxiv.org/html/2608.10154#bib.bib20)\)。与 3PL 模型类似,我们可以使用优化 \{aik,bik,dik\}=argmax\{∑j=1logPijk\\displaystyle\\\{a\_\{ik\},b\_\{ik\},d\_\{ik\}\\\}=\\mathrm\{argmax\}\\left\\\{\\sum\_\{j=1\}\\log P\_\{ijk\}\\right\.−λ\(aik2\+bik2\)\}\\displaystyle\\left\.\-\\lambda\(a\_\{ik\}^\{2\}\+b\_\{ik\}^\{2\}\)\\right\\\}\(iiii\)其中λ=10−4\\lambda=10^\{-4\},使用 LBFGS。这为我们提供了箭头iiii。结合ii,这为我们的建模提供了目标值。 ### 2\.3离散能力建模 Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)的主要思想是,我们将θj\\theta\_\{j\}的值分箱到LL个类别中。每个类别的截止点表示为γi\\gamma\_\{i\},因此Il=\(γl−1,γl\]I\_\{l\}=\(\\gamma\_\{l\-1\},\\gamma\_\{l\}\],其中−∞=γ0<γ1<...<γL=∞\.\-\\infty=\\gamma\_\{0\}<\\gamma\_\{1\}<\\ldots<\\gamma\_\{L\}=\\infty.这为我们提供了区间I1,...,ILI\_\{1\},\\ldots,I\_\{L\},使得每个θj∈Ilj\\theta\_\{j\}\\in I\_\{l\_\{j\}\}。LL越大,能力划分越精细。每个区间都与一个松散描述性的标签相关联。标签和区间见表2 (https://arxiv.org/html/2608.10154#S2.T2)。 表 2:用于校准语言模型的描述性标签列表。 遵循Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)的工作,对于题目ii,我们将每个区间与每个选项的概率值相关联,这给出了一个函数 fi\(Ij\)=\(ρij1,...,ρijK\)\.f\_\{i\}\(I\_\{j\}\)=\(\\rho\_\{ij1\},\\ldots,\\rho\_\{ijK\}\)\.\(3\)这意味着我们获得了一个L×KL\\times K的概率值矩阵作为数据。我们的底层先验是总体呈正态分布,使得\{θj\}∼N\(μ,ς2\)\\\{\\theta\_\{j\}\\\}\\sim\\mathcal\{N\}\(\\mu,\\varsigma^\{2\}\)。我们发现显式写出与该分布相关的函数很方便。概率和累积分布函数 \(PDF & CDF\),f\(θ\)f\(\\theta\)和F\(θ\)F\(\\theta\)由下式给出 f\(θ\)=1ςφ\(θ−μς\),F\(θ\)=Φ\(θ−μς\),\\displaystyle f\(\\theta\)=\\frac\{1\}\{\\varsigma\}\\phi\\left\(\\frac\{\\theta\-\\mu\}\{\\varsigma\}\\right\),\\,\\,F\(\\theta\)=\\Phi\\left\(\\frac\{\\theta\-\\mu\}\{\\varsigma\}\\right\),其中 φ\(z\)=12πe−z22,Φ\(z\)=∫−∞zφ\(t\)dt,\\displaystyle\\phi\(z\)=\\dfrac\{1\}\{\\sqrt\{2\\pi\}\}e^\{-\\frac\{z^\{2\}\}\{2\}\},\\,\\,\\Phi\(z\)=\\int\_\{\-\\infty\}^\{z\}\\phi\(t\)\\mathrm\{d\}t,将θ∈Ij\\theta\\in I\_\{j\}的条件概率定义为是有意义的 wj=F\(γj\)−F\(γj−1\)w\_\{j\}=F\(\\gamma\_\{j\}\)\-F\(\\gamma\_\{j\-1\}\) 在Ormerod \(2026 (https://arxiv.org/html/2608.10154#bib.bib15)\)中,每个区间都与该先验下的期望值相关联,其中ρijk\\rho\_\{ijk\}被定义为在该值处对 \(2 (https://arxiv.org/html/2608.10154#S2.E2)\) 的求值。实际上,将区间与函数本身的期望值相关联更有意义。假设PijkP\_\{ijk\}由 \(2 (https://arxiv.org/html/2608.10154#S2.E2)\) 定义,则ρijk\\rho\_\{ijk\}的定义可以确定为 ρijk=1wj∫γj−1γjf\(θ\)Piθkdθ,\\displaystyle\\rho\_\{ijk\}=\\frac\{1\}\{w\_\{j\}\}\\int\_\{\\gamma\_\{j\-1\}\}^\{\\gamma\_\{j\}\}f\(\\theta\)P\_\{i\\theta k\}\\mathrm\{d\}\\theta,\(iiiiii\)其中PiθkP\_\{i\\theta k\}是θ\\theta的函数,而不是在θj\\theta\_\{j\}处的特定值。这为我们提供了iiiiii。此外,鉴于这些是连续值而非离散值,我们可以通过优化来近似重建 MCM \(aik,\\displaystyle\(a\_\{ik\},bik,dik\)=argmin\(∑jwj\(ρijk−\\displaystyle b\_\{ik\},d\_\{ik\}\)=\\mathrm\{argmin\}\\Bigg\(\\sum\_\{j\}w\_\{j\}\\Bigg\(\\rho\_\{ijk\}\-1wj∫γj−1γjf\(θ\)Piθkdθ\)2\)\.\\displaystyle\\frac\{1\}\{w\_\{j\}\}\\int\_\{\\gamma\_\{j\-1\}\}^\{\\gamma\_\{j\}\}f\(\\theta\)P\_\{i\\theta k\}\\mathrm\{d\}\\theta\\Bigg\)^\{2\}\\Bigg\).\(iviv\)或者,我们可以将kk的值特化为正确选项k~\\tilde\{k\},在这种情况下我们获得正确的概率,这为重建 \(1 (https://arxiv.org/html/2608.10154#S2.E1)\) 的参数提供了一条可行路径。为完整起见,我们将其写为 \(ai,bi\\displaystyle\(a\_\{i\},b\_\{i\},ci\)=argmin\(∑jwj\(ρijk~\\displaystyle,c\_\{i\}\)=\\mathrm\{argmin\}\\Bigg\(\\sum\_\{j\}w\_\{j\}\\Bigg\(\\rho\_\{ij\\tilde\{k\}\}−1wj∫γj−1γjf\(θ\)Piθdθ\)2\)\\displaystyle\-\\frac\{1\}\{w\_\{j\}\}\\int\_\{\\gamma\_\{j\-1\}\}^\{\\gamma\_\{j\}\}f\(\\theta\)P\_\{i\\theta\}\\mathrm\{d\}\\theta\\Bigg\)^\{2\}\\Bigg\)\(vv\)其中PiθP\_\{i\\theta\}是模型 \(1 (https://arxiv.org/html/2608.10154#S2.E1)\),其对θj\\theta\_\{j\}的依赖性被替换为θ\\theta的一般函数。这为我们提供了所有不依赖于语言模型的箭头。值得注意的是,这些近似在每一步都不是精确的。例如,箭头ii提供了从经验观察到的响应集到 IRT 参数的映射;然而,有一个基本假设,即 \(1 (https://arxiv.org/html/2608.10154#S2.E1)\) 是经验数据的良好拟合。我们假设存在一些回归趋势,其中参数与最终参数线性相关。我们使用开发集来适当地线性建模这种关系,这不会改变整体的 Pearson 相关性,但确实会影响均方误差。 ### 2\.4语言建模 Qwen 模型系列继续为研究社区提供一套用于研究目的的出色可微调模型。最新的模型系列 Qwen3\.5 为我们提供了展示多模态微调能力的机会。我们保守选择的模型是 Qwen3\.5 的 40 亿和 90 亿参数变体。 #### 2\.4\.1参数高效微调 这些模型足够小,可以放入具有足够资源的本地机器上。为了训练这些模型,我们采用了参数高效方法Xu et al\. \(2023 (https://arxiv.org/html/2608.10154#bib.bib28)\),如低秩自适应 \(LoRA\)Hu et al\. \(2021 (https://arxiv.org/html/2608.10154#bib.bib8)\)或带量化的 LoRADettmers et al\. \(2023 (https://arxiv.org/html/2608.10154#bib.bib4)\)来有效调整模型,需要……相似文章
LLM真的能理解题目难度等级吗?对使用LLM自动生成题目的启示
本文研究了LLM能否在大规模阅读和写作测试中准确预测题目难度等级,发现GPT-4.1准确率中等,但不如ConvBERT,且LLM倾向于低估困难题目的难度。
每个错误答案都算数:LLM 多选题基准的选项级心理测量学
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
使用项目反应理论审计LLM基准测试
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化框架
本文介绍MODE,一种用于MoE多模态大语言模型的模态分解专家级混合精度量化框架,通过按模态分解选择频率并过滤冗余视觉标记来解决专家重要性估计中的偏差,在激进量化下实现极小的性能损失。
From token probabilities to calibrated confidence: An empirical study of mathematical question answering
This paper empirically studies token-probability-based confidence estimation and calibration for LLMs in mathematical question answering, comparing single-pass and multi-pass estimators and evaluating post-hoc calibration methods.