calibration-study

Tag

Cards List
#calibration-study

Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol

arXiv cs.AI · 2026-08-24 Cached

This paper studies criterion revision in language-model agents, identifying failure modes in current implementations like CMB-0.1 and proposing a new trace-anchored protocol, CMB-0.4, for more accurate future evaluation.

0 favorites 0 likes
← Back to home

Submit Feedback