高效评分学习:基于多臂老虎机的提示选择框架,用于低成本LLM作文评分
摘要
本文提出一种成本感知框架,使用多臂老虎机控制器自适应选择LLM作文评分的提示策略,在保持准确性的同时将LLM调用减少78.4%。
arXiv:2608.23814v1 Announce Type: new
摘要:大型语言模型(LLMs)在自动作文评分(AES)中展现出强大能力,但当前方法通常采用固定提示选择,未能解决运营成本问题和不断变化的最优配置。我们提出一种新颖的成本感知方法,将每种提示类型视为多臂老虎机(MAB)控制器中的一个臂,从而在推理过程中自适应选择最优提示策略。我们在IELTS写作任务2作文上的实验表明,MAB框架在减少78.4%的LLM调用以找到最佳评分方法的同时,达到了与详尽网格搜索相当的评分准确性。我们实施了四种不同的评分方案(多步骤与单步骤评估,有与无校准示例),并发现带示例的多步骤方法实现了最高准确性。通过跟踪令牌使用和延迟以及一致性指标,我们首次为作文评分生成了成本-可靠性学习曲线,为必须在运营成本与评估有效性之间取得平衡的教育技术平台提供了可操作的见解。这项工作代表了在线控制机制在AES中自适应选择提示策略的首次应用,将提示选择从离线超参数优化问题转变为高效的在线学习任务。
查看缓存全文
缓存时间: 2026/08/26 09:25
# 学习高效评分:基于老虎机驱动的提示词选择框架实现低成本LLM作文评分 来源:https://arxiv.org/html/2608.23814 ###### 摘要 大型语言模型(\(LLMs\))在自动作文评分(AES)中展现出强大能力,但现有方法通常采用固定提示词选择策略,未能解决运营成本关切和不断演化的最优配置问题。我们提出了一种新颖的成本感知方法,将每种提示词类型视为多臂老虎机(MAB)控制器中的一条"臂",从而在推理过程中自适应选择最优提示策略。在雅思写作任务2作文上的实验表明,MAB框架在评分准确性上与穷举网格搜索相当,同时将寻找最佳评分方法所需的LLM调用次数减少了78.4%(表1 (https://arxiv.org/html/2608.23814#S0.T1))。我们实施了四种不同的评分方案(多步与单步评估,包含与不包含校准示例),并发现包含示例的多步方法达到了最高准确率。通过跟踪token使用量、延迟以及一致性指标,我们首次生成了作文评分的成本-可靠性学习曲线,为必须在运营成本与评估效度之间取得平衡的教育科技平台提供了可操作的见解。这项工作首次将在线控制机制应用于AES中自适应选择提示策略,将提示选择从离线超参数优化问题转化为高效的在线学习任务。 ###### 关键词 自动作文评分,大型语言模型,提示词优化,多臂老虎机(自适应选择),成本效益评估 表1:详细资源消耗:MAB与网格搜索对比 | 方法 | 计算方式 | LLM调用次数 | Token消耗量 | |------|----------|-------------|-------------| | 网格搜索 | 787篇作文 × 4种方案 | 7,870 | 10,915,411 | | 多步评估:787 × 4次调用 × 2种方案 = 6,296<br>单步评估:787 × 1次调用 × 2种方案 = 1,574<br>总计:6,296 + 1,574 = 7,870 | | | | | MAB | 500篇作文(每篇分配至4种方案之一) | 1,697 | 2,964,444 | | 多步+示例:332 × 4次调用 = 1,328<br>多步-无示例:67 × 4次调用 = 268<br>单步+示例:56 × 1次调用 = 56<br>单步-无示例:45 × 1次调用 = 45 | | | | | **降低幅度** | | **78.4%** | **72.8%** | ## 1 引言 近期研究表明,大型语言模型(\(LLMs\))在使用精心设计的提示时,在自动作文评分(AES)中已展现出显著能力。多种用于AES的提示技术已被研究,包括评分标准分解\[8 (https://arxiv.org/html/2608.23814#bib.bib2)\]、少样本方法\[16 (https://arxiv.org/html/2608.23814#bib.bib7)\]、思维链推理\[1 (https://arxiv.org/html/2608.23814#bib.bib6)\]和比较判断方法\[7 (https://arxiv.org/html/2608.23814#bib.bib5)\]。尽管取得了这些进展,当代方法通常采用固定的提示选择;研究人员要么预先确定模板,要么在采用标准化解决方案之前对有限的选项集进行穷举评估\[15 (https://arxiv.org/html/2608.23814#bib.bib4)\]。这种静态方法未能解决实际评估场景中的两个关键实际限制: 1. 推理成本受到提示长度和调用频率的严重影响\[11 (https://arxiv.org/html/2608.23814#bib.bib15)\]。包含少样本示例或详细推理的丰富提示策略可能比极简指令消耗更多token,这会对运营成本产生显著影响。 2. 最优的提示配置并非静态;随着模型更新、定价结构变化或作文特征随时间推移而演变,最优配置也在不断变化。在高风险教育环境中,如国际语言测试项目或大规模MOOC平台,将每篇作文应用于每一种可能的提示配置在财务上是不可持续的。 我们提出了一种新颖的、成本感知的框架,将每个提示-模型组合视为多臂老虎机(MAB)控制器中的一条"臂"。在评分过程中,智能体根据LLM预测分数与考官真实分数之间的一致性来观察奖励信号。这使得系统能够逐步将调用集中在最可靠且最具成本效益的提示配置上。这种方法将提示选择从离线超参数优化问题转变为在线学习任务,类似于近期用于提示工程\[13 (https://arxiv.org/html/2608.23814#bib.bib3)\]和检索增强生成\[3 (https://arxiv.org/html/2608.23814#bib.bib1)\]的MAB优化器。 我们在来自雅思写作评分作文数据集\[6 (https://arxiv.org/html/2608.23814#bib.bib11)\]的雅思写作任务2语料库上的初步实验证明了该框架的有效性。基于老虎机的方法在二次加权卡帕(QWK)分数上与穷举网格搜索相当,但所需的LLM调用次数大约只有后者的十分之一,显示出在不牺牲评分质量的情况下显著降低运营成本的潜力。 这项工作做出了两项关键贡献。首先,据我们所知,它首次将在线控制机制(无论是基于老虎机、强化学习还是其他方式)应用于以自适应方式选择AES中的提示策略。所有先前发表的工作都依赖于固定的提示模板。其次,通过跟踪token使用量、延迟以及一致性指标,我们首次为作文评分生成了成本-可靠性学习曲线。这些发现为测试提供者和教育科技平台提供了可操作的见解,帮助它们在成本考虑和心理测量效度之间取得平衡。 本文报告的是进行中的工作。到目前为止,我们已经使用四种提示方法(带示例的单步、不带示例的单步、带示例的多步和不带示例的多步)实施了老虎机控制器。这四种方法在第3节中描述。在我们研究的这一初始阶段,我们使用了Google Gemini Flash 2.5。在未来步骤中,我们将扩展研究至其他模型(GPT-4、Llama-3 70B)和ASAP数据集\[5 (https://arxiv.org/html/2608.23814#bib.bib9)\]以评估泛化能力。通过发布我们的代码和策略日志,我们旨在促进对自适应、低成本、基于LLM的教育评估评分的进一步研究。 ## 2 相关工作 相关工作综述分为三个部分。我们首先从基于LLM的作文评分研究开始,总结关于零样本提示、评分标准对齐、少样本和思维链方法的研究,并指出它们对静态、成本盲目的网格搜索的依赖。接下来,我们转向写作领域,综述NLP中的自适应提示和模型选择技术,重点关注多臂老虎机和其他在线控制器,它们优化了检索和问答任务的准确性-成本权衡。最后,我们总结支撑大多数评估的公开作文数据集,并指出仍然存在的空白:没有先前的工作将这些自适应控制器与作文评分相结合。这一结构阐明了我们的研究如何直接建立在提示工程的进展之上,并首次提出了用于自动作文评分的、成本感知的自适应框架。 ### 2.1 基于LLM的自动作文评分与提示策略 大型语言模型(LLMs)最近在评分学生写作方面显示出有效性,从而消除了对特定任务微调的需求。Lee等人提出的多特征专业化(MTS)框架表明,零样本、评分标准分解的提示可以使GPT-3.5和Llama-2-13B在ASAP和TOEFL11基准测试中达到二次加权卡帕(QWK)的最先进水平,比直接的提示指令高出多达0.35 QWK\[8 (https://arxiv.org/html/2608.23814#bib.bib2)\]。 Stahl等人\[15 (https://arxiv.org/html/2608.23814#bib.bib4)\]比较了零样本、一样本和少样本提示(带和不带思维链)在联合评分和反馈生成中的效果,发现当要求模型解释其分数时,AES准确性有所提高,但代价是提示长度大大增加。 其他提示范式包括比较判断:Kim与Jo\[7 (https://arxiv.org/html/2608.23814#bib.bib5)\]报告称,GPT-4在反复被要求从两篇作文中选出更好的一篇时,在IELTS和ASAP数据集\[5 (https://arxiv.org/html/2608.23814#bib.bib9)\]上超越了基于评分标准的直接评分提示。 对于多特征评分,Chu等人\[1 (https://arxiv.org/html/2608.23814#bib.bib6)\]使用GPT-4生成特征级的理由,并将其输入更小的学生模型;这个经过理由增强的评分器在ASAP++\[10 (https://arxiv.org/html/2608.23814#bib.bib13)\]和Feedback-Prize\[12 (https://arxiv.org/html/2608.23814#bib.bib12)\]数据集上超越了强大的基线,同时提供了透明的解释。 ### 2.2 成本效益 大多数LLM-AES研究在离线状态下评估一小部分固定的提示,然后部署单一的最佳模板。即使少样本提示(包括评分标准和理由)可能超过中等水平LLM的上下文窗口,也很少报告token预算。Yoshida最近关于评分标准粒度的研究\[16 (https://arxiv.org/html/2608.23814#bib.bib7)\]表明,简化的评分标准在四种LLM中有三种保持准确性,同时将提示长度减少了一半以上,这突显了进行成本敏感实验的必要性。然而,主流的评估范式仍然是静态的网格搜索:在每篇作文上尝试每种提示或提示配置,然后事后选择胜出者。 ### 2.3 NLP中的自适应提示与模型选择 在作文评分之外,提示和模型选择已被构建为在线决策问题。Shi等人提出的TRIPLE框架\[13 (https://arxiv.org/html/2608.23814#bib.bib3)\]将提示优化与固定预算的最佳臂识别联系起来,并表明多臂老虎机(MAB)策略可以在多个NLP基准测试中识别出高性能的提示,同时仅使用穷举搜索所需LLM调用次数的50-80%。 在检索增强生成中,AutoRAG-HP\[3 (https://arxiv.org/html/2608.23814#bib.bib1)\]将超参数调整(例如,检索文档数量k、提示压缩比)构建为分层MAB;它以大约20%的API查询量匹配了网格搜索的召回率。 Somerstep等人\[14 (https://arxiv.org/html/2608.23814#bib.bib8)\]引入了CARROT(成本感知速率最优路由器),它应用上下文老虎机路由器为每个查询选择满足目标质量水平的最便宜LLM,从而在不牺牲质量的情况下节省了大量成本。 这些成功表明,自适应控制器可以在保持任务性能的同时减少token预算;然而,这些技术中没有一项被整合到自动作文评分中。我们的工作通过将MAB嵌入AES流程来动态选择四种提示技术之一来解决这一空白,以显著减少token用量的同时达到人类水平的可靠性。 ### 2.4 公开作文评分数据集与仍存在的差距 LLM-AES研究通常使用ASAP语料库(八个提示,约12,000篇作文)\[5 (https://arxiv.org/html/2608.23814#bib.bib9)\]、TOEFL11语料库(12,100篇非母语作文)\[2 (https://arxiv.org/html/2608.23814#bib.bib10)\]以及较新的IELTS写作分数集(约1200篇作文)\[6 (https://arxiv.org/html/2608.23814#bib.bib11)\]进行基准测试。 所有已发表的LLM研究都对这些数据集应用固定的提示模板;没有任何研究使用老虎机或任何在线搜索来分配提示-模型调用。因此,我们的研究是首次将老虎机控制器嵌入基于LLM的AES系统,将每篇作文自适应路由到最具成本效益的提示策略,从而将NLP中的效率研究与高风险写作评估相结合。 ## 3 方法论 本研究采用了一种新方法,利用LLM和MAB优化进行自动雅思作文评分。我们将雅思数据集\[6 (https://arxiv.org/html/2608.23814#bib.bib11)\]分为任务1和任务2子集,本次分析仅专注于任务2作文。我们开发了一个模块化系统,包含四种不同的评分"方案":带作文示例和不带示例的多步基于标准评估,以及带示例和不带示例的单步直接评分。多步方法分别评估任务回应、连贯与衔接、词汇资源以及语法多样性与准确性(雅思官方关键评估标准\[4 (https://arxiv.org/html/2608.23814#bib.bib14)\]),然后计算总分;而单步方法则直接预测总分。对于优化,我们实施了epsilon贪婪MAB算法,以平衡探索与利用,从而识别最有效的评分策略。奖励函数结合了预测准确性(通过与人工评分的负绝对误差衡量),并可选择性地对token使用量进行惩罚以提高效率。我们还进行了穷举网格搜索评估作为基线比较。所有实验都使用了Google的Gemini 2.5模型,因其在性能准确性、低延迟和经济高效的API访问方面取得了平衡。实验在具有人工评分的任务2作文子集上进行,采用并发处理以最大化吞吐量。性能指标包括与人工评分的平均绝对误差(MAE)、token使用量、延迟和预估API成本,从而可以全面评估每种方案的有效性和效率。完整的实现代码可在GitHub上公开访问\[9 (https://arxiv.org/html/2608.23814#bib.bib16)\]。 ### 3.1 数据集 在我们的实验中,我们使用了Kaggle上公开的雅思写作评分作文数据集。该集合包含787篇学术任务2作文,每篇都附有由合格的雅思考官分配的官方分数(范围从1到9)。这些作文回应了传统的任务2指令,要求考生就各种社会和学术主题展开论证或表达观点。该语料库是评估真实、具有重要影响的语言评估环境中自动评分系统的理想测试场。 ### 3.2 动态提示组装 我们的系统采用了一种复杂的两级提示工程方法。核心架构设计将提示模板与其动态实例化分离开来,从而能够系统地实验不同的提示策略。我们方法的基础是提示库模块,它充当模板化提示的集中仓库。它包含详细的系统提示,确立了LLM作为雅思考官的角色,以及每个评估标准的特定指令。出于校准目的,一些模板包含带注释的样本作文(高分和低分),为模型的评估提供参考点。该库为每个实验条件(多步与单步评估,带与不带示例)维护了不同的模板变体。在运行时,作文评分智能体通过以下过程动态组装最终提示: 1. 根据当前评分方案选择适当的系统和用户模板 2. 通过字符串格式化将特定的作文题目和文本注入模板 3. 构建具有不同"系统"和"用户"角色的、结构正确的消息字典 4. 将这些消息组装成...
相似文章
基于贝叶斯老虎机 Gittins 指数的高效成本感知 LLM 评估
本文提出 GittinsEval,这是一个成本感知的贝叶斯老虎机框架,用于高效的 LLM 评估,通过自适应选择配置,在显著降低成本的同时保持高性能。
超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成
本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。
基于有限反馈的LLM专家在线学习
本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。
学习提示:通过自适应基于LLM的高中辅导提高学生参与度
本文提出了一种自适应、学科感知的提示路由框架,用于基于LLM的高中辅导,利用14个教学特征来切换策略。对359名学生进行的A/B测试显示,与静态基线相比,效率和转化率有所提高。