超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成

arXiv cs.CL 论文

摘要

本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。

arXiv:2607.19219v1 Announce Type: new 摘要:大语言模型(LLMs)已广泛应用于自动作文评分(AES)和自动反馈生成(AFG)。然而,现有研究主要依赖于提示工程或有监督微调,而对强化学习(RL)后训练和反馈质量自动评估的系统性研究仍然有限。我们提出RLAES,一个统一的LLM框架,通过强化学习联合优化作文评分与反馈生成。为了使得反馈质量可测量、可解释并可用于训练,我们引入了基于评分标准的反馈评估(RFE),一种基于作文的反馈评估框架,包含166个细粒度二元评分标准项和一个LLM作为评判者。在RFE的基础上,我们提出自适应门控反馈优化(AGFO),在RL过程中按需激活基于评分标准的反馈奖励,降低评估开销的同时提高反馈质量。我们还提出相邻对比推理(ACR),通过显式对比相邻分数级别来改进序数评分校准。实验结果表明,RFE框架捕获了作文-反馈一致性,展现了强大的成对区分能力,并与专家偏好高度一致。在ASAP基准上,RLAES-AGFO在基于LLM的方法中取得了最佳评分性能(QWK = 0.803),同时保持了与GPT-5.5相当的反馈质量,并避免了仅使用分数RL时观察到的反馈退化。代码和数据集已在https://github.com/hellomuyi/RLAES公开。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 超越分数预测:基于LLM的论文评分与反馈生成——通过带有评分标准奖励的强化学习

来源:https://arxiv.org/html/2607.19219

###### 摘要

大型语言模型(LLMs)已被广泛应用于自动作文评分(AES)和自动反馈生成(AFG)。然而,现有研究主要依赖提示工程或监督微调,而对强化学习(RL)后训练以及反馈质量自动评估的系统性研究仍然有限。我们提出RLAES,一种通过强化学习联合优化评分与反馈生成的统一LLM框架。为了使反馈质量可测量、可解释且可用于训练,我们引入了基于评分标准的反馈评估(RFE),这是一种基于作文的反馈评估框架,包含166个细粒度二值评分标准条目和一个LLM-as-Judge。基于RFE,我们提出自适应门控反馈优化(AGFO),它在RL过程中按需激活基于评分标准的反馈奖励,从而降低评估开销并提高反馈质量。我们还提出相邻对比推理(ACR),通过显式对比相邻分数等级来改进序数分数校准。实验结果表明,RFE框架能够捕捉作文-反馈一致性,具有较强的成对判别能力,且与专家偏好高度一致。在ASAP基准上,RLAES-AGFO在基于LLM的方法中取得了最佳评分性能(QWK = 0.803),同时保持了与GPT-5.5相当的反馈质量,并避免了纯分数RL下出现的反馈退化问题。代码和数据集已公开于:https://github.com/hellomuyi/RLAES。

## 1 引言

自动作文评分(AES)和自动反馈生成(AFG)是人工智能在教育领域的核心应用(Abudalfa and Barrot 2026(https://arxiv.org/html/2607.19219#bib.bib28))。这些系统利用自然语言处理、机器学习和大型语言模型(LLMs)自动为学生作文评分并生成建设性反馈。AES和AFG相结合,既能减轻教育工作者的评分负担,又能为学生提供及时、个性化的诊断性反馈,帮助他们识别弱点并逐步提升写作能力(Li and Collins 2026(https://arxiv.org/html/2607.19219#bib.bib36))。对AES的研究可追溯至20世纪60年代(Sun et al. 2025(https://arxiv.org/html/2607.19219#bib.bib32))。传统AES方法已从依赖手工特征的回归模型(Choi et al. 2026(https://arxiv.org/html/2607.19219#bib.bib13))发展到深度学习范式,后者将AES视为具有自动表示学习的数值分类或回归问题。这一演变历程从卷积神经网络(CNNs)和循环神经网络(RNNs)(Taghipour and Ng 2016(https://arxiv.org/html/2607.19219#bib.bib30))推进到更先进的基于Transformer的预训练语言模型,最著名的是BERT系列(Li and Pan 2025b(https://arxiv.org/html/2607.19219#bib.bib16);Xie et al. 2022(https://arxiv.org/html/2607.19219#bib.bib26))。近期基于LLM的AES方法大致可分为提示工程和微调两类。提示工程研究广泛探索了零样本(Seßler et al. 2025(https://arxiv.org/html/2607.19219#bib.bib25);Su et al. 2025(https://arxiv.org/html/2607.19219#bib.bib21))和少样本学习(Huang et al. 2026(https://arxiv.org/html/2607.19219#bib.bib10);Mansour et al. 2024(https://arxiv.org/html/2607.19219#bib.bib8))、包含评分标准的提示(Mansour et al. 2024(https://arxiv.org/html/2607.19219#bib.bib8))、思维链(CoT)推理(Xiao et al. 2025(https://arxiv.org/html/2607.19219#bib.bib20))、成对比较(Choi et al. 2026(https://arxiv.org/html/2607.19219#bib.bib13);Cai et al. 2025(https://arxiv.org/html/2607.19219#bib.bib6);Shibata and Miyamura 2025(https://arxiv.org/html/2607.19219#bib.bib35))以及多智能体框架(Wang et al. 2026(https://arxiv.org/html/2607.19219#bib.bib22))。微调研究主要聚焦于监督微调(SFT)(Xiao et al. 2025(https://arxiv.org/html/2607.19219#bib.bib20);Ormerod and Kwako 2024(https://arxiv.org/html/2607.19219#bib.bib11);Johnsi and Kumar 2025(https://arxiv.org/html/2607.19219#bib.bib9))。这些研究表明,经过微调的LLMs,即使是较小的开源模型,其性能也显著优于配备各种增强提示策略的超大型专有模型。除分数预测外,对AFG(包括反馈的评估与优化)的关注较少,尽管形成性反馈具有重要的教学意义(Liu et al. 2024(https://arxiv.org/html/2607.19219#bib.bib39))。在AES上表现有竞争力的小模型通常使用基于BERT的编码器-仅架构,且无法在没有额外解码器的情况下生成反馈。现有的基于LLM的反馈生成方法要么直接提示LLM(Sasaki et al. 2026(https://arxiv.org/html/2607.19219#bib.bib5);Xiao et al. 2024(https://arxiv.org/html/2607.19219#bib.bib24);Ormerod and Kwako 2024(https://arxiv.org/html/2607.19219#bib.bib11)),要么对由强推理模型生成的反馈进行SFT(Xiao et al. 2025(https://arxiv.org/html/2607.19219#bib.bib20);Li and Pan 2025a(https://arxiv.org/html/2607.19219#bib.bib17))。在反馈评估方面,目前仍缺乏一个被广泛接受的自动评估框架。传统的反馈评估依赖带注释的反馈数据集(Sasaki et al. 2026(https://arxiv.org/html/2607.19219#bib.bib5);Liu et al. 2024(https://arxiv.org/html/2607.19219#bib.bib39))。然而,此类注释通常只覆盖有限的类别,因此不适合评估LLM生成的丰富反馈。LLM生成的反馈通常通过人工评估(Xiao et al. 2025(https://arxiv.org/html/2607.19219#bib.bib20);Ormerod and Kwako 2024(https://arxiv.org/html/2607.19219#bib.bib11)),但人工评估成本高、难以规模化,且难以转化为用于优化反馈质量的奖励信号。Li和Pan(2025a(https://arxiv.org/html/2607.19219#bib.bib17))提出了一种自动评估方法,通过计算生成反馈与金标准分数对应的评分标准描述之间的语义相似度来评估反馈质量。

尽管LLMs为AES和AFG创造了新的技术可能性,但仍存在两大挑战。一方面,在基于LLM的AES和AFG中,强化学习(RL)后训练尚未得到充分探索。当前的LLM方法主要集中于提示工程和SFT。提示工程灵活但对提示设计敏感,而SFT直接模仿金标准分数。RL可能更适合分数推理以及与评分标准的对齐,但其对评分准确性和反馈质量的影响尚未得到系统研究。另一方面,AFG缺乏有效且可扩展的反馈评估与优化方法。LLM生成的反馈通常丰富且结构复杂,导致现有工作严重依赖人工评估(Xiao et al. 2025(https://arxiv.org/html/2607.19219#bib.bib20);Ormerod and Kwako 2024(https://arxiv.org/html/2607.19219#bib.bib11))。替代的自动化方法如BERTScore通过测量生成反馈与金标准分数对应的评分标准描述之间的语义相似度(Li and Pan 2025a(https://arxiv.org/html/2607.19219#bib.bib17))。然而,通用高层级评分标准与作文特定反馈之间的差距限制了该评估策略的有效性。缺乏有效的反馈评估方法直接制约了AFG的优化。

为应对这些挑战,我们提出RLAES,一个统一的基于LLM的RL后训练框架,用于AES和AFG。首先,为填补有效反馈评估的空白,我们引入了基于评分标准的反馈评估(RFE),这是一个基于作文的、特定于提示的框架,包含166个二值评分标准条目和一个LLM-as-Judge。RFE提供了反馈质量的细粒度自动度量,可作为RL奖励。基于RFE,我们提出自适应门控反馈优化(AGFO),在RL过程中按需激活基于评分标准的反馈奖励。AGFO降低了LLM-as-Judge的开销,同时联合优化了评分准确性和反馈质量,从而防止纯分数RL导致的反馈退化。由此产生的RLAES-AGFO模型在基于LLM的AES方法中取得了最佳性能。此外,我们提出相邻对比推理(ACR),这是一种通用策略,显式引导模型对比相邻分数等级。ACR提高了对细粒度质量差异的敏感性,并缓解了序数分类中的相邻混淆问题。

我们的主要贡献总结如下:

- • 我们将基于LLM的AES和AFG方法从提示工程和SFT扩展到RL后训练。由此产生的RLAES-AGFO联合优化了评分准确性和反馈质量,并在基于LLM的方法中取得了最佳性能。
- • 我们引入了RFE,一个基于作文的框架,填补了AFG中细粒度反馈评估的空白。
- • 我们提出了ACR,一种用于序数分类任务的通用策略。ACR使模型能够感知并区分相邻分数等级,从而提高了评分准确性。

## 2 预备知识

### 2.1 任务定义

设D={(e_i, s_i)}_{i=1}^N表示一个数据集,其中e_i代表第i篇作文及其评分上下文,如写作提示、源文本和评分标准指南,s_i是其对应的整体分数。目标是在D上训练一个模型,使其能很好地泛化到未见过的作文,从而为AES实现准确的分数预测,为AFG实现可靠的反馈生成。我们关注特定提示的AES和AFG,其中训练和测试所用的写作提示来自同一集合。我们将反馈(或解释)定义为AES系统输出中除分数预测之外的所有组成部分。我们对输出进行结构化设计,使模型首先生成反馈,然后预测分数。在此设置下,反馈可被视为最终分数之前的类似CoT的中间推理过程。

### 2.2 RL后训练

带可验证奖励的强化学习(RLVR)依赖于显式的、可验证的二值规则作为奖励信号,例如输出正确性。DeepSeek-R1(Guo and others 2025(https://arxiv.org/html/2607.19219#bib.bib34))证明了其在提升推理能力方面的有效性。相关算法如组相对策略优化(GRPO)(Shao et al. 2024(https://arxiv.org/html/2607.19219#bib.bib33))已广泛应用于可检查答案的领域,包括数学和代码。然而,对于作文反馈评估等难以验证的领域,反馈质量无法通过单一的二进制规则确定,而需要多维评估。在此类设置中直接应用RLVR将产生过于粗糙的奖励信号。相反,基于人类反馈的强化学习(RLHF)可以利用人类偏好来处理开放式输出,但偏好判断具有高度主观性,可能诱发奖励破解。评分标准作为奖励(RaR)(Gunjal et al. 2025(https://arxiv.org/html/2607.19219#bib.bib31))将评估标准分解为可独立评估的评分标准条目,弥合了严格可验证奖励与主观人类偏好之间的差距。它为开放式任务提供了结构化奖励,并可直接与GRPO等在线策略RL算法兼容。具体来说,给定输入提示x和模型响应ŷ,评分标准奖励定义为:

r(x, ŷ) = (Σ_{j=1}^k w_j c_j(x, ŷ)) / (Σ_{j=1}^k w_j)      (1)

其中k是评分标准条目的数量,w_j > 0是条目j的权重,c_j: (x, ŷ) ↦ {0, 1}指示模型输入x的响应ŷ是否满足该条目。LLM-as-Judge独立分配每个指示器c_j,所有条目{(w_j, c_j)}_{j=1}^k定义了评分标准。

## 3 方法

### 3.1 基于评分标准的反馈评估(RFE)框架

受Deep Research Bench II(Li et al. 2026(https://arxiv.org/html/2607.19219#bib.bib41))和RaR(Gunjal et al. 2025(https://arxiv.org/html/2607.19219#bib.bib31))的启发,我们提出了基于评分标准的反馈评估(RFE)框架,该框架支持自动反馈评估,并将反馈质量转化为用于RL训练的标量奖励。RFE包含特定提示的清单式评分标准和一个LLM-as-Judge。我们将随代码一起发布这些资源。图1(https://arxiv.org/html/2607.19219#S3.F1)展示了构建流程。请参见标题 图1:RFE评分标准的构建。

#### 参考反馈提取。
我们使用Claude-Opus-4.7从官方ASAP材料(Hamner et al. 2012(https://arxiv.org/html/2607.19219#bib.bib29))中提取手写作文和教师反馈。经人工验证,得到92对横跨八个写作提示的作文-反馈对。我们移除了过于简短、仅重复评分标准指南而无作文具体证据、或遗漏过多特征领域的反馈,保留了50个高质量样本作为伪金标准反馈。由于教师反馈存在实际局限性,例如缺少修改建议或仅提供单一高层面评估,我们通过LLM重写、人工校准和专家验证对这些样本进行精炼,生成了50个金标准反馈样本。为构建负例,我们按提示和分数对样本进行排序,并将每篇作文与同一提示下相邻分数作文的反馈配对,得到88个扰动反馈样本。

#### 评分标准生成与迭代。
主智能体生成初始评分标准,包含手动调整的顶层维度和细粒度评分标准条目。然后它在金标准反馈上评估评分标准,并生成分析报告。五个评分标准精炼智能体——GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.8、DeepSeek-V4-Pro和GLM-5.1——独立提出修订建议。主智能体汇总这些提案并更新评分标准,直至各智能体的评估收敛。经人工修订后,最终评分标准记为R_fb,包含四个维度(覆盖度、证据性、忠实性、安全性)下的166个二值条目。

#### LLM-as-Judge评估。
给定一对作文-反馈(e_i, f_i),LLM-as-Judge独立判断每个评分标准条目是否满足。然后使用公式1(https://arxiv.org/html/2607.19219#S2.E1)计算RFE分数。我们为所有条目赋予相同权重(w_j = 1);因此,每个维度的贡献与其条目数量成正比。

### 3.2 自适应门控反馈优化(AGFO)

我们使用GRPO来联合优化AES和AFG。奖励函数主要由分数奖励和反馈奖励组成。给定学生作文及其上下文e、金标准分数s、模型预测分数ŝ、模型生成的反馈f̂以及反馈评分标准R_fb,总奖励r_total定义为:

r_total = r_score(s, ŝ) + λ_f · r_feedback(e, R_fb, f̂)

相似文章

ARES:可扩展LLM强化学习的自动评估标准合成

arXiv cs.CL

ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

LLM能否生成可靠的评分标准?实验复现的元评估

arXiv cs.CL

本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。