Tag
This paper studies co-training a monitor alongside an adversarial AI worker to prevent monitor evasion in worker-monitor oversight setups, proving a supervisory characterization via Littlestone dimension and proposing a test-time distillation self-supervision method with code-security stress tests.