Tag
This paper audits major LLM benchmarks (GPQA, MMLU-Pro, MMMU-Pro) and finds 4.5–11.8% of items have wrong answer keys or are malformed, releasing corrected 'Clean' versions for drop-in use.