Tag
This paper proposes a logit-based energy scoring method for evaluating scientific hypotheses using large language models, which outperforms prompted LLM-as-judge methods in hypothesis ranking tasks.