SEFORA:学生论文反馈语料库与LLM反馈评估框架
摘要
本文介绍了SEFORA——一个包含教师对学生论文反馈的公开语料库,以及UniMatch——一种用于评估LLM生成反馈的基于参考的评价框架。实验表明,当前的LLM难以匹配教师反馈,F1值最高仅为0.4。
arXiv:2607.00274v1 Announce Type: new
摘要:有效的写作反馈是学生学习的最强驱动力之一,但大规模提供反馈是劳动密集型的。LLM为扩展写作支持提供了自然途径,但存在两个差距:很少有公开语料库捕捉教师在实际课堂中的反馈方式,也没有可靠方法衡量生成的反馈是否与教师会写的内容一致。我们解决了这两个问题。SEFORA是一个公开语料库,将教师的内联反馈与作业提示、评分标准、分数以及多稿修订配对,涵盖多种大学写作类型,包含564篇草稿和8,240条教师注释。UniMatch是一种基于参考的开放生成评估框架:它将反馈分割为反馈单元,在教师衍生的标准下评分其语义对应关系,并通过最优匹配对齐以产生可解释的精确率、召回率和F1值。在涵盖多个LLM的74个实验配置中,没有任何设置超过0.4 F1。UniMatch揭示了模型难以识别教师会优先考虑的反馈,并且随着模型生成更多内容,性能下降。
查看缓存全文
缓存时间: 2026/07/02 05:36
# 学生论文含反馈语料库与LLM反馈评估框架
来源:https://arxiv.org/html/2607.00274
Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li
匹兹堡大学
\{shayan\.p, xianglli\}@pitt\.edu
###### 摘要
有效的写作反馈是学生学习最强的驱动力之一,然而大规模生成反馈却十分耗费人力。LLM为扩展写作支持提供了一条自然路径,但存在两大障碍:现有公开语料库很少涉及教师在实际课堂中如何提供反馈,而且缺乏可靠的方法来衡量生成的反馈是否与教师会写的内容一致。我们同时解决了这两个问题。**Sefora** 是一个公开语料库¹¹¹https://github.com/ShayanPey/SEFORA,它将教师的行内反馈与作业提示、评分标准、分数以及多次修改的草稿配对,涵盖多种大学写作体裁,包含564份草稿和8,240条教师标注。**UniMatch** 是一个基于参考的开放生成评估框架:它将反馈分割成反馈单元,根据教师派生的标准对其语义对应性进行评分,并通过最优匹配对齐这些单元,从而得到可解释的精确率、召回率和F1值。在涵盖多个LLM的74个实验配置中,没有任何设置的F1值超过0.40.4。UniMatch 揭示了模型难以识别教师会优先考虑的反馈内容,并且随着模型生成更多反馈,性能会下降。
---
## 1 引言
反馈在学生的写作学习中起着至关重要的作用。它帮助学生纠正误解,完善他们应用知识的方式 [Ahea 等人, 2016](https://arxiv.org/html/2607.00274#bib.bib86); [Banihashem 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib87),并且一直被认为是影响学习和成就的最强因素之一 [Hattie 和 Timperley, 2007](https://arxiv.org/html/2607.00274#bib.bib88)。但有效的反馈并非一刀切。学生报告说,最有用的反馈是针对他们自己写作的具体反馈 [Lipnevich 和 Smith, 2009](https://arxiv.org/html/2607.00274#bib.bib55),并且有效的反馈会考虑草稿在修改过程中的位置 [Carless 和 Boud, 2018](https://arxiv.org/html/2607.00274#bib.bib84);目标不当的反馈甚至可能有害 [Kluger 和 DeNisi, 1996](https://arxiv.org/html/2607.00274#bib.bib83)。在写作教学中,产生这样的反馈非常耗费人力,其规模化成本阻碍了有效教学所需的持续实践 [Applebee 和 Langer, 2011](https://arxiv.org/html/2607.00274#bib.bib82); [Graham, 2019](https://arxiv.org/html/2607.00274#bib.bib81)。这为NLP提供了一个自然的机会:能够对草稿生成有用反馈的系统有助于扩展写作支持。

图1:UniMatch 评估流程概览。对于每个段落,将LLM生成的反馈分割成单元,并与教师的反馈单元进行比较。由此产生的语义相似度得分用于计算教师与模型反馈单元之间的最优匹配,从而得到最终的评估指标。
这个问题的进展受到两个瓶颈的制约。首先,很少有公开数据集保留了教师在实际课程中如何提供反馈(表1 [^表1]):多方面的评论(通常同时涉及多个要点)锚定在特定的文本跨度上(段落、句子或单词),并且可以与作业提示、评分标准和修改历史一起解释。一些资源用结构化标签(错误标签或分析性分数)替代了形成性评论 [Crossley 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib71); [Mathias 和 Bhattacharyya, 2018](https://arxiv.org/html/2607.00274#bib.bib67); [Dahlmeier 等人, 2013](https://arxiv.org/html/2607.00274#bib.bib54); [Lee 等人, 2015](https://arxiv.org/html/2607.00274#bib.bib56),将覆盖范围限制在单个提示或狭窄的体裁上 [Kashefi 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib72); [Zyska 等人, 2026](https://arxiv.org/html/2607.00274#bib.bib23),或者放弃了专家标注,转而使用众包或模型生成的反馈 [Behzad 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib22)。如果没有能捕捉教师实际提供反馈方式的数据集,评估LLM是否能生成教师会写的内容就无从谈起。
其次,反馈评估存在三个难点。(i) 无参考评估在概念上很有吸引力,但“好的”写作反馈没有单一的可操作定义,因为其质量取决于许多相互作用的维度,这些维度在不同评分者和不同设置中的权重各不相同 [Pearson, 2022](https://arxiv.org/html/2607.00274#bib.bib8); [Stahl 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib9);LLM作为评判代理继承了这种模糊性,同时加入了自身的偏见 [Zheng 等人, 2023](https://arxiv.org/html/2607.00274#bib.bib10); [Deutsch 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib11)。(ii) 基于参考的评估通过将生成的反馈与教师反馈进行比较来缓解这一问题,但现有指标存在不足:n-gram重叠在开放生成中不可靠 [Novikova 等人, 2017](https://arxiv.org/html/2607.00274#bib.bib13); [Reiter, 2018](https://arxiv.org/html/2607.00274#bib.bib12),而基于嵌入的指标(尽管不那么依赖表面形式)与人类判断的相关性很弱 [Liu 等人, 2016](https://arxiv.org/html/2607.00274#bib.bib14),我们在我们的设置中也发现了这一点(§4.2 [^§4.2])。(iii) 一个更深层次且经常被忽视的问题是粒度:一条反馈消息通常包含几个不同的 **反馈单元** [Yen 等人, 2020](https://arxiv.org/html/2607.00274#bib.bib48); [Zou 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib47)——关于写作特定方面的自包含陈述——即使单个句子也可能包含多个(例如,“这一段写得很好,但可以更简洁些”)。整体比较无法判断哪些观察被恢复或遗漏,因此可靠的评估必须在单元级别并根据其底层含义来比较反馈。
我们同时解决了这两个问题。**Sefora**(**Se**tudent **E**ssays with **F**eedback C**o**rpus)是一个公开语料库,将真实的教师撰写的、锚定在文本跨度上的反馈与作业提示、评分标准、分析性分数以及跨多种大学写作体裁的多次修改草稿配对。**UniMatch** 是一个基于参考的框架,它在单元级别而非整体上评估LLM反馈,将反馈分割成反馈单元,并根据教师派生的相似性标准通过最优匹配进行对齐;由此产生的相似性加权F1值同时捕捉了模型遗漏的内容和过度生成的内容(图1 [^图1])。它们共同使得能够在教师工作的粒度上系统研究LLM生成的写作反馈。我们在涵盖多个LLM的74个配置上的实验表明,没有任何设置的F1值超过0.40.4。模型难以生成教师会强调的评论。反馈的冗长性(指生成更多评论而非更长的评论)是导致对齐不良的主要因素。UniMatch 所惩罚的是具有教学意义的内容:过度冗长的反馈会让学生不堪重负,导致适得其反的结果 [Kluger 和 DeNisi, 1996](https://arxiv.org/html/2607.00274#bib.bib83)。
---
## 2 相关工作
| 数据集名称 | 规模(草稿数) | 反馈字数 | 写作体裁 |
|-----------|---------------|---------|---------|
| | 总计(语料库) | 行内/草稿 | 整体/草稿 |
| Exposía [Zyska 等人, 2026](https://arxiv.org/html/2607.00274#bib.bib23) | 55 | 17.6K | 论文 |
| | | 107 | 213 |
| ArgRewrite V.2 [Kashefi 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib72) | 86 | 12.9K | 论文 |
| | | – | 150 |
| Insta-Reviewer [Jia 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib85) | 484 | 26.6K | 研究报告 |
| | | – | 55 |
| **Sefora(我们的)** | **564** | **136.4K** | **论文、叙事、解释、同理心** |
| | | **147** | **95** |
表1:相关学生写作含教师反馈数据集的比较。表中只统计教师撰写的反馈(排除同伴、用户和AI增强的反馈),每份草稿的平均字数基于每个语料库的草稿总数取平均值。写作体裁遵循 [Gardner 和 Nesi, 2013](https://arxiv.org/html/2607.00274#bib.bib16) 的BAWE分类。行内表示锚定在文本跨度上的反馈;其他特征(例如错误标签、分数)未列出。
#### 论文数据集。
许多现有的写作数据集针对 **自动作文评分**(AES),预测数值分数而非形成性反馈 [Ramesh 和 Sanampudi, 2022](https://arxiv.org/html/2607.00274#bib.bib80); [Ke 和 Ng, 2019](https://arxiv.org/html/2607.00274#bib.bib79); [Hou 等人, 2025](https://arxiv.org/html/2607.00274#bib.bib20),或强调结构化标注(例如错误标签或分析性分数)而非形成性文本,包括 PERSUADE 2.0 [Crossley 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib71)、ASAP/ASAP++²²²https://www.kaggle.com/c/asap-aes [Mathias 和 Bhattacharyya, 2018](https://arxiv.org/html/2607.00274#bib.bib67) 和 NUCLE [Dahlmeier 等人, 2013](https://arxiv.org/html/2607.00274#bib.bib54)。虽然这些数据集对大规模评估很有价值,但分数评价了一份草稿,却没有告诉学生如何修改 [Ke 等人, 2019](https://arxiv.org/html/2607.00274#bib.bib78);而反馈生成则需要与写作者的文本和作业目标相关联的、可操作的、上下文敏感的局部化评论。
近年来,收集基于反馈的论文数据集的努力有所增长,但每个数据集只捕捉了我们目标设置的一部分。它们将专家反馈与狭窄的写作类型配对:Insta-Reviewer [Jia 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib85) 与研究生项目报告配对,ArgRewrite V.2 [Kashefi 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib72) 与单个议论文提示配对,Exposía [Zyska 等人, 2026](https://arxiv.org/html/2607.00274#bib.bib23) 与研究型陈述配对,而 CityU [Lee 等人, 2015](https://arxiv.org/html/2607.00274#bib.bib56)³³³原文描述该语料库当时尚未公开,我们未能验证其当前公开发布状态。提供ESL/EFL写作的简短导师评论。每个数据集在至少一个对课堂反馈至关重要的维度上存在局限:缺乏多份草稿或修改版本 [Jia 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib85); [Lee 等人, 2015](https://arxiv.org/html/2607.00274#bib.bib56),或者只覆盖单一体裁 [Jia 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib85); [Kashefi 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib72); [Zyska 等人, 2026](https://arxiv.org/html/2607.00274#bib.bib23)。LEAF [Behzad 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib22) 扩展到更多的论文-反馈对,但来源是网络用户和AI而非教师。**Sefora** 以更大的规模、跨越多种大学写作体裁(表1 [^表1])的方式,通过真实的、教师撰写的反馈(既有锚定在文本跨度上的也有整体的)来补充这些资源,并配合作业提示、评分标准、分析性分数和多轮修改结构,从而实现现有语料库无法直接支持的分析。
#### 反馈评估。
评估生成的反馈很困难,因为即使针对相同的潜在问题,措辞和传达方式也可能存在很大差异。无参考评估带来了之前讨论过的问题:有效的反馈没有单一的可操作定义 [Pearson, 2022](https://arxiv.org/html/2607.00274#bib.bib8); [Stahl 等人, 2024](https://arxiv.org/html/2607.00274#bib.bib9),而LLM作为评判代理则继承了这种模糊性,同时增加了自身的偏见 [Zheng 等人, 2023](https://arxiv.org/html/2607.00274#bib.bib10); [Deutsch 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib11)。因此,我们专注于基于参考的和以人为中心的评估,这分为三类 [Celikyilmaz 等人, 2020](https://arxiv.org/html/2607.00274#bib.bib68)。内容重叠指标如 BLEU [Papineni 等人, 2002](https://arxiv.org/html/2607.00274#bib.bib65) 和 ROUGE [Lin, 2004](https://arxiv.org/html/2607.00274#bib.bib64) 奖励表面相似性,对于开放生成的反馈来说很脆弱。基于模型的指标如 BERTScore [Zhang 等人, 2019](https://arxiv.org/html/2607.00274#bib.bib60)、BARTScore [Yuan 等人, 2021](https://arxiv.org/html/2607.00274#bib.bib61) 和 BLEURT [Sellam 等人, 2020](https://arxiv.org/html/2607.00274#bib.bib62) 能更好地捕捉一般语义,但难以解释,并且无法判断LLM反馈是否识别出与教师相同的实质性要点。以人为中心的评估可靠但成本高且难以扩展 [Jia 等人, 2022](https://arxiv.org/html/2607.00274#bib.bib85)。**UniMatch** 以可靠性和可解释性为目标,将反馈作为独立单元进行比较,并在反馈特定的相似性标准下对其对应性进行评分。
---
## 3 数据集

图2:来自 **Sefora** 的一份带标注的草稿,展示了数据集锚定在文本跨度上的细粒度教师反馈:便利贴评论与颜色编码的高亮配对。粉色高亮标记尤为有效的段落,黄色高亮标记需要注意的问题,绿色高亮标记值得在后续草稿中发展的想法。完整的标注约定在 §A.2 [^§A.2] 中有文档记录。
**Sefora** 在两个学期内从大学英语系的一系列大一本科课程中收集,涵盖写作、ESL、叙事和创意写作以及一个高年级研讨班。它包括作业提示、评分标准、多稿学生论文以及两种形式的教师反馈:锚定在文本跨度上(行内)的评论(图2 [^图2])和整体评估。该数据集公开可用。⁴⁴⁴https://github.com/ShayanPey/SEFORA
#### 范围、规模和体裁。
**Sefora** 包含来自9个班级34个作业的155名学生的371篇论文,共计564份草稿(220份单稿、109份两阶段、42份三阶段),总计8,186个段落。根据BAWE分类 [Gardner 和 Nesi, 2013](https://arxiv.org/html/2607.00274#bib.bib16),这些草稿涵盖四个体裁家族:论文(Essay)、叙事记叙(Narrative Recount)、解释(Explanation)和同理心写作(Empathy Writing)。⁵⁵⁵对于每个作业,我们将其写作提示映射到最匹配的体裁家族;BAWE的明确定义和示例使得这种映射是直接的。教师贡献了5,684条行内(锚定在文本跨度上的)标注——高亮、便利贴和删除线,几乎都带有评论——平均每份草稿10条标注和147个反馈词。此外,437份草稿带有整体评论(平均121词),295份带有分析性特质分数(平均每份6.5个),205份带有整体分数,总计8,240条教师标注。
#### 标注内容。
**Sefora** 保留了原始的段落结构,并将每条标注与其所针对的文本对齐:大部分是段落级别且**锚定在文本跨度上**——精确绑定到教师标记的文本跨度,无论是一个短语、句子还是单词——并在适用时保留了文档级别的评论和分数(详见 §A.2 [^§A.2])。将 **Sefora** 与仅含错误标签和分数语料库区分开来的是其反馈的**实质**。相似文章
超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成
本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。
LLM能否生成可靠的评分标准?实验复现的元评估
本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。
是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。
SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。