fairness-accountability-transparency

Tag

Cards List
#fairness-accountability-transparency

Understanding Annotator Safety Policy with Interpretability

arXiv cs.AI · 2026-05-08 Cached

This paper introduces Annotator Policy Models (APMs) by Apple, which use interpretability techniques to infer annotators' internal safety policies from their labeling behavior without requiring additional annotation effort. The authors demonstrate that APMs can accurately model these policies and distinguish between sources of annotation disagreement, such as operational failures, policy ambiguity, and value pluralism.

0 favorites 0 likes
← Back to home

Submit Feedback