Tag
This paper introduces the Oncology Decision Boundary Benchmark and evaluates nine frontier large language models, finding systematic blind spots in guideline-conformant oncology decision-making, indicating that single models cannot serve as sole bases for clinical decisions.