Tag
This paper introduces a consensus-based framework for evaluating LLM responses by having a panel of models rank anonymized outputs, producing a Relative Intelligence Index (RII) as a proxy for relative quality across domains.