Tag
This paper introduces ARGUS, a language-model pipeline for auditing identification assumptions in climate-policy causal evaluations, demonstrating improved flaw detection compared to keyword-based methods.
The author audited 112 RL post-training environments for reward-hacking vulnerabilities, building a static and dynamic auditor tool named ratctl that flagged 54 issues with 100% precision and released it as open-source.