Tag
This paper studies criterion revision in language-model agents, identifying failure modes in current implementations like CMB-0.1 and proposing a new trace-anchored protocol, CMB-0.4, for more accurate future evaluation.