ArguLens:一个用于自动作文评分和标签感知反馈生成的开源系统
摘要
ArguLens 是一个用于自动作文评分的开源系统,它使用微调的LLM进行话语分类,LightGBM进行评分,并通过一个反馈生成器提供可解释的、标签感知的结果。
arXiv:2608.17356v1 公告类型:新
摘要:大多数自动作文评分(AES)系统输出一个整体分数,缺乏可解释的证据,并依赖封闭的API,这带来了数据隐私和成本障碍。我们提出ArguLens,一个开源的、可本地部署的系统,它将AES分解为三个解耦的组件:一个话语移动分类器(使用LoRA在PERSUADE 2.0上微调的Qwen2.5-7B-Instruct),一个基于31个语言和话语特征的独立于分数的LightGBM评分器,以及一个通过vLLM提供的标签感知反馈生成器,其主干网络为Qwen2.5-14BInstruct。一个Gradio web UI提供了可插拔的推理后端,并支持单篇和批量评分,带有可下载的每篇作文分解。在一篇作文不相交的PERSUADE 2.0测试集上,logitprobe分类器达到了82.6%的准确率和0.727的宏F1分数;在按提示分组的5折交叉验证下,评分器在oracle话语特征协议下达到了平均QWK为0.813,消融实验表明,在词汇+句法配置上添加黄金话语标注产生了+0.055 QWK的增量(配对t检验,p = 0.010)。这是一个组件级的诊断,而不是端到端的分类到评分结果。反馈生成器附带了一个结构化的评估协议;其人类评分者研究留待未来工作。该系统在Apache 2.0许可证下发布,地址为https://github.com/wwrwbs/AI_AWE。
查看缓存全文
缓存时间: 2026/08/19 09:55
# 用于自动作文评分与标签感知反馈生成的开源系统 来源:https://arxiv.org/html/2608.17356 王蔚然 史鸿翔 唐汇涛 秦文娟 复旦大学 [email protected] 2026年8月18日 ###### 摘要 大多数自动作文评分(AES)系统仅输出单一整体分数,缺乏可解释的证据,且依赖封闭的API,这带来了数据隐私和成本方面的障碍。我们提出了ArguLens,一个开源的、可本地部署的系统,它将AES分解为三个解耦的组件:一个话语移动分类器(基于Qwen2.5-7B-Instruct模型,在PERSUADE 2.0数据集上使用LoRA进行微调)、一个基于31项语言和话语特征的、独立于评分的LightGBM评分器,以及一个通过vLLM服务、以Qwen2.5-14B-Instruct为骨干的标签感知反馈生成器。一个Gradio Web界面暴露了可插拔的推理后端,并支持单篇作文和批量评分,以及可下载的每篇作文分析报告。在基于作文划分的PERSUADE 2.0测试集上,逻辑探针分类器达到82.6%的准确率和0.727的宏观F1值;在按提示分组的5折交叉验证下,评分器在神谕话语特征协议下的平均QWK达到0.813,消融实验表明,添加黄金话语标注相比词汇+句法配置带来了+0.055的QWK增益(配对t检验,p=0.010)。这是一个组件级的诊断结果,而非端到端的分类器到评分器结果。反馈生成器配备了一个结构化的评估协议;其人工评分者研究有待未来工作。该系统以Apache 2.0许可证在https://github.com/wwrwbs/AI_AWE发布。 ## 1引言 自动作文评分(AES)已从基于表面特征的线性回归(Page 1966 (https://arxiv.org/html/2608.17356#bib.bib13))发展到深度神经架构(Taghipour and Ng 2016 (https://arxiv.org/html/2608.17356#bib.bib21); Mayfield and Black 2020 (https://arxiv.org/html/2608.17356#bib.bib11)),并最终发展到最近基于LLM的整体评分(Beigman Klebanov and Madnani 2020 (https://arxiv.org/html/2608.17356#bib.bib1); Tate et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib22))。尽管取得了这些进展,可解释性和性能之间的根本矛盾依然存在。传统的基于特征的方法提供了透明的评分,但限制了准确性的上限;神经网络模型提高了准确性,但以不透明为代价,而LLM提示则需要封闭的API,这限制了本地部署和数据隐私。 在研究和辅助性教育场景部署方面,仍存在三个具体的差距。首先,端到端模型仅输出单一分数,而没有可解释的语言学或修辞学证据,这使得教师难以理解分数是如何得出的。其次,依赖商业API引入了成本、延迟和数据隐私障碍,限制了在资源有限环境中的采用。第三,大多数AES系统止步于整体分数;能够帮助学习者改进写作的、细粒度的、标签感知的修改建议非常罕见。 我们通过ArguLens来解决这些差距,这是一个可本地部署、采用Apache 2.0许可证的系统,本文将介绍其设计和评估。该系统: - • 将评分分解为话语移动分类、特征提取、LightGBM评分和标签感知反馈; - • 通过支持张量并行的vLLM和4位HuggingFace回退方案支持本地部署,同时保留可选的API后端; - • 提供可复现的制品,包括评分器模型、缩放器、仓库中的LoRA适配器配置,以及作为带校验和的版本化Release资产发布的权重; - • 提供一个配置驱动的堆栈,无硬编码路径,环境变量优先,并包含离线测试套件。 我们在PERSUADE 2.0语料库(Crossley et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib2))上评估了分类器和评分器,该语料库包含美国初中生的论证性作文,评分从1到6。话语移动分类器通过句子级别的准确率和宏观F1值进行评估;评分器通过在按提示分组的交叉验证下的二次加权卡帕系数(QWK)、准确率和宏观F1值进行评估。反馈组件在此仅评估其文档记录的生成工作流和仓库契约;人工评分者结果明确超出本次发布的范围。 ## 2相关工作 #### AES范式。 自动写作评估在预测准确性、可解释性和教学用途之间平衡方面有着悠久的历史(Beigman Klebanov and Madnani 2020 (https://arxiv.org/html/2608.17356#bib.bib1))。传统的特征工程(Kyle and Crossley 2015 (https://arxiv.org/html/2608.17356#bib.bib9); Lu 2010 (https://arxiv.org/html/2608.17356#bib.bib10))提供了语言学证据,而神经网络AES模型(Taghipour and Ng 2016 (https://arxiv.org/html/2608.17356#bib.bib21); Mayfield and Black 2020 (https://arxiv.org/html/2608.17356#bib.bib11))可以以透明性为代价学习更丰富的表示。最近的工作还表明,通用人工智能可以提供有用的整体评分,同时也引发了关于评分标准一致性和有效性的疑问(Tate et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib22))。我们独立于评分的LightGBM评分器保留了明确的特征空间,而LoRA分类器则为其添加了修辞结构。 #### 论证结构与反馈。 在说服性文章和学生作文中的论证挖掘已经模拟了组件结构和作文质量(Persing and Ng 2010 (https://arxiv.org/html/2608.17356#bib.bib14); Stab and Gurevych 2017 (https://arxiv.org/html/2608.17356#bib.bib19))。近期的工作进一步报告称,结合论证段落和衔接特征可以改进与自动反馈相关的评分(Ding et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib3))。最近的基准测试明确了粒度问题:EssayJudge在词汇、句子和话语层面评估AES,仍然发现在话语层面存在显著差距(Su et al. 2025 (https://arxiv.org/html/2608.17356#bib.bib20))。我们采用了PERSUADE 2.0的四个标签(主张、论据、反驳主张、反驳),并微调了一个Qwen2.5-7B LoRA,避免了全参数更新,同时保留了基础模型的语言理解能力。 #### 反馈评估与公平性。 反馈质量是多维的,不能简化为单一的自动分数。LLM-Rubric证明了在评估生成文本时,明确的维度和与人类判断进行校准的价值(Hashemi et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib5))。更新的写作反馈评估发现,模型可能会产生具体的意见,但忽略了最重要的问题,或者错误判断了批评是否恰当(Rashkin et al. 2025 (https://arxiv.org/html/2608.17356#bib.bib16))。因此,本版本将相关性、可操作性和语气定义为评估维度,但不报告人工评分。公平性也无法通过聚合的AES准确性来保证:子组性能可能因人口统计和学习者特征而异(Schaller et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib17))。因此,我们将子组分析视为一项必需的未来研究,而不是根据此处报告的聚合指标做出公平性声明。 #### 开放教育AI。 我们的发布遵循了模型报告实践,记录了模型、训练背景、局限性和资产位置(Mitchell et al. 2019 (https://arxiv.org/html/2608.17356#bib.bib12))。小型制品保存在仓库中,而较大的适配器则作为带校验和的版本化Release资产进行分发。这是一种发布设计选择,而非实验发现。 ## 3系统架构 图1 (https://arxiv.org/html/2608.17356#S3.F1) 展示了端到端的工作流。Gradio前端(essay_score/app_gradio.py)协调三个独立服务,其职责总结于表1 (https://arxiv.org/html/2608.17356#S3.T1)。移动分类器通过可插拔的HF或vLLM后端运行并生成句子标签;特征提取器将TAALED词汇指数、QuanSyn依存度指标和话语计数组合成一个31维特征向量;评分器输出分数、置信度和标志;反馈生成器通过vLLM或兼容OpenAI的API生成结构化反馈。 表1:核心模块及其职责。 图1:基于语言学信息的写作评估项目工作流。上层概述了离线训练和部署;下层展示了在线评估、评分、基于依据的反馈和个性化报告。 ### 3.1配置与可复现性 所有运行时设置遵循严格的优先级:环境变量覆盖config.yaml,config.yaml又覆盖默认的HuggingFace模型ID。配置加载器(essay_score/config.py)根据仓库根目录解析相对路径。一个model_checksums.sha256清单使得能够通过sha256sum -c验证评分器、缩放器、适配器配置、分词器和LoRA权重,确保下游用户可以验证资产完整性。 ## 4话语移动分类器 ### 4.1任务定义 给定一篇作文被划分为N个句子{ s₁, ..., s_N },分类器为每个句子预测一个标签 yᵢ ∈ {主张, 论据, 反驳主张, 反驳}。它在句子级别操作,局部上下文来源于前一个句子和作文开头。 ### 4.2基础模型与LoRA 分类器使用Apache-2.0许可的Qwen/Qwen2.5-7B-Instruct模型(Qwen et al. 2025 (https://arxiv.org/html/2608.17356#bib.bib15))作为其基础。应用了一个LoRA适配器(Hu et al. 2021 (https://arxiv.org/html/2608.17356#bib.bib6)),秩r=32,α=64,丢弃率为0.05,应用于所有线性投影模块(q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj)。训练使用LLaMA-Factory(Zheng et al. 2024 (https://arxiv.org/html/2608.17356#bib.bib24))在PERSUADE 2.0数据集上进行,采用4卡DDP(torchrun)和BF16精度,峰值学习率为1×10⁻⁴,使用余弦调度(预热比例0.05),权重衰减0.01,截断长度为2048个令牌,训练2个epoch,有效批量大小为32(4卡×批量1×梯度累积8)。仓库包含适配器配置文件;权重文件(adapter_model.safetensors,309 MB)作为GitHub Release资产发布,标记为v0.1.0。 ### 4.3训练数据与模型选择 PERSUADE 2.0没有指定官方划分,因此我们使用种子42创建了一个基于作文级别的划分:22,605篇作文用于训练,2,825篇用于验证,2,826篇用于测试,所有划分对之间零作文重叠(通过程序验证)。由于自然标签分布严重偏斜(论据和主张占主导),训练集通过为每个标签重采样25,000个句子(总计100,000个样本)进行类别平衡。一个小型平衡验证集(2,000个句子,每标签500个)用于监控训练,并选择验证损失最低的检查点进行评估;所有报告的测试结果使用来自2,730篇作文的12,000个句子的自然分布测试集。 ### 4.4基于逻辑值的分类 分类器不生成自由文本,而是使用判别式逻辑探针进行确定性推理。对于每个目标句子,使用一个系统定义构建聊天模板提示,将四种移动类型编码为单令牌代码(A, B, C, D)。通过附加了LoRA的基础模型进行前向传播,在最后一个非填充位置生成逻辑值。提取对应于代码令牌的四个逻辑值,并通过softmax处理;argmax是预测的标签,最大softmax概率是每句子的置信度分数。HF后端使用可配置的句子批量大小对提示进行分块,而vLLM后端则向持久服务发送有界请求,进行单令牌解码并限制为四个允许的标签令牌。 ### 4.5推理后端 提供三个后端。hf后端在进程内使用transformers和peft加载基础模型和适配器。vllm后端运行一个持久的FastAPI服务,加载基础模型一次,并通过LoRARequest(Kwon et al. 2023 (https://arxiv.org/html/2608.17356#bib.bib8))附加LoRA。其/health端点报告适配器秩、张量并行大小和GPU数量。如果vLLM服务未就绪,前端将回退到hf。api后端专用于反馈生成器。 ## 5独立于评分的LightGBM评分器 ### 5.1特征集 所有特征的计算均不依赖学习者评分信息,以防止直接的目标泄漏。这种设计并不能保证公平性,因为语言特征仍可能与人口统计或课程变量相关。特征提取对词汇和句法指标使用共享的单个spaCy依存解析。 #### 词汇特征(TAALED(Kyle and Crossley 2015 (https://arxiv.org/html/2608.17356#bib.bib9)))。 十六项词汇特征包括在AW、实词和功能词类别中的十二种词汇多样性变体,以及word_count、awl、basic_n、function_tokens和lexical_density_tokens。 #### 句法特征(QuanSyn(Yang and Liu 2025 (https://arxiv.org/html/2608.17356#bib.bib23)))。 从QuanSyn中保留了八项基于依存的特征:mdd、ndd、mhd、mtdl、vk、mtw、hi和mrd。 #### 话语特征(部署和评估协议)。 部署流水线从Qwen2.5-7B LoRA移动分类器输出中派生出七项特征:n_sent、n_claim、n_data、pct_data、pct_counterclaim、pct_rebuttal和has_counter_rebut(二元变量,仅当同时存在反驳主张和反驳时为真)。报告的交叉验证所使用的评分器特征表包含的是对应的PERSUADE黄金话语标注。因此,我们称报告的评分为器结果为神谕组件评估,不将其呈现为端到端的分类器基准。 #### 处理缺失依赖。 如果quansyn包不可用,评分器默认会引发FeatureExtractionError。一个配置标志(allow_missing_dependency_features)仅在探索性运行时用零填充缺失值。 ### 5.2模型训练 评分器使用LightGBM(Ke et al. 2017 (https://arxiv.org/html/2608.17356#bib.bib7)),目标函数为多类别,覆盖六个有序类别。超参数包括num_leaves=63、learning_rate=0.03、n_estimators=1000、min_child_samples=15、subsample=0.8、colsample_bytree=0.8和reg_lambda=0.1。训练使用种子42;每个交叉验证折的模型种子在基础种子上递增折索引。训练数据是PERSUADE 2.0的独立于评分的特征表,在交叉验证期间保留提示组。训练好的模型(lightgbm_multiclass.txt,33 MB)和特征缩放器(scaler.json)已提交到仓库。 在推理时,原始特征值经过z-score标准化后传递给LightGBM模型,模型输出一个六类概率向量。期望值四舍五入为1-6之间的最近整数以产生最终分数。交叉验证、消融实验和生产推理均使用相同的期望值解码规则。报告的交叉验证使用gold_annotations话语特征来源;生产环境则将这些字段替换为分类器预测的移动标签。当最大类别概率低于0.5时,系统会标记作文为low_confidence,并在
相似文章
超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成
本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。
DysLexLens:一种用于分析在线论坛中阅读障碍学习者见解的低资源LLM框架
本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。
ARES:可扩展LLM强化学习的自动评估标准合成
ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。
Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。