Tag
This study investigates how class imbalance and batch processing affect LLM-based screening in systematic reviews, revealing that batch processing significantly alters decision-making behavior while prevalence metadata has minimal impact.
This study evaluates how AI chatbots like ChatGPT, Claude, and Gemini retrieve clinical studies for medical questions, finding significant performance differences by model and user role, with a bias toward larger sample sizes.