Tag
The article examines the issues with MMLU benchmark scores, showing that different model builds can yield incomparable accuracies due to open evaluation variables, and proposes a content-addressed framework for better traceability.
This paper proposes a method to extend factorized probability distributions defined on non-identical variable sets to a common measurable space, enabling principled comparison using distributional discrepancy measures.