reasoning-mismatch

Tag

Cards List
#reasoning-mismatch

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

arXiv cs.CL · 2026-07-01 Cached

CLExEval introduces a human-in-the-loop framework for evaluating LLM clinical reasoning under progressive information masking, revealing failure patterns such as verbosity bias, hidden knowledge paradox, and reasoning-to-output mismatch in models like GPT-4o-mini and HuatuoGPT-o1.

0 favorites 0 likes
← Back to home

Submit Feedback