Tag
This paper evaluates chain-of-thought monitoring in AI oversight, finding that providing monitors with a trusted answer improves conclusion-checking but not independent reasoning verification, with implications for AI safety evaluations.