Tag
The paper evaluates LLMs as graders for computer-science exams, finding that prompt design significantly affects grading accuracy, and shows that LoRA fine-tuning can mitigate issues to match human grader performance.