Tag
This paper introduces 'canary tools' as diagnostic probes to identify specific tool-selection reasoning failures in LLM agents, proposing a six-type taxonomy and evaluating eight models across 8,640 task runs to show capability-tier disparities and robustness.