medical-agents

Tag

Cards List
#medical-agents

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

arXiv cs.AI · 2026-07-13 Cached

LongMedBench is a new benchmark for evaluating LLM-based medical agents on long-horizon clinical decision-making using real EHR data from MIMIC-IV. It includes 335 patients with multiple visits and proposes evaluation suites for fact-based QA, temporal reasoning, and long-horizon decision-making.

0 favorites 0 likes
← Back to home

Submit Feedback