Tag
This paper identifies a preformulation gap in LLM medical consultations, where models are evaluated after clinical problems are clarified rather than during initial vague interactions. Through controlled experiments with vignettes and simulations, it demonstrates that instructions can improve response sequencing but not reliably ensure elicitation of key facts.
MedDDC-Eval introduces a diagnosis-decoupled evaluation testbed for multi-turn medical consultation agents, isolating the policy-elicited conversation history from diagnosis generation to enable cleaner measurement of evidence acquisition and diagnostic usefulness.