Tag
This paper introduces SEFORA, a public corpus of instructor feedback on student essays, and UniMatch, a reference-based evaluation framework for assessing LLM-generated feedback. Experiments show that current LLMs struggle to match instructor feedback, achieving at most 0.4 F1.