Tag
This paper introduces a factuality-specific annotation policy using failure-space analysis to improve human-anchored factuality evaluation for LLMs under limited annotation budgets, achieving significant efficiency gains on benchmark systems.