medical-reasoning

Tag

Cards List
#medical-reasoning

Large Language Models Show Metacognitive Sensitivity in Medical Reasoning

arXiv cs.AI · 2026-08-18 Cached

A controlled study evaluates the metacognitive sensitivity of large language models in medical reasoning, finding partial but flawed confidence calibration that varies with evidence strength and conflicting scenarios.

0 favorites 0 likes
#medical-reasoning

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

arXiv cs.AI · 2026-08-11 Cached

Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.

0 favorites 0 likes
#medical-reasoning

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

arXiv cs.AI · 2026-08-03 Cached

This Perspective paper argues that large language models are not yet safe for autonomous clinical decision support, particularly in triage of undifferentiated patients, due to lack of robust evaluation under incomplete information and asymmetric costs of missed diagnoses.

0 favorites 0 likes
#medical-reasoning

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

arXiv cs.AI · 2026-07-10 Cached

This survey examines recent progress in medical LLMs, presenting a dual-view approach that connects clinical practice with computational methods, and introduces a benchmark dataset for evaluating medical reasoning capabilities across 18 state-of-the-art models.

0 favorites 0 likes
#medical-reasoning

Reasoning-Medical0.1-27B (Qwen3.5-27B medical finetune, claims to surpass MedGemma)

Reddit r/LocalLLaMA · 2026-07-09 Cached

EpistemeAI released Reasoning-Medical0.1-27B, a fine-tuned version of Qwen3.5-27B for medical reasoning, claiming to surpass MedGemma on several medical benchmarks by incorporating chain-of-thought reasoning on a curated dataset of 100,000 records.

0 favorites 0 likes
#medical-reasoning

ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

Hugging Face Daily Papers · 2026-06-11 Cached

ArogyaBodha dataset and ArogyaSutra framework enhance multilingual medical reasoning in low-resource settings through diverse data integration and actor-critic multi-agent reasoning.

0 favorites 0 likes
#medical-reasoning

SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical Reasoning

arXiv cs.CL · 2026-05-19 Cached

SEMA-RAG is a self-evolving multi-agent RAG framework for medical question answering that decouples interpretation, exploration, and adjudication into three specialist agents, achieving significant accuracy improvements over baselines across multiple benchmarks.

0 favorites 0 likes
← Back to home

Submit Feedback