evaluation-dataset

Tag

Cards List
#evaluation-dataset

HealthBench-Psych: A Mental Health Subset of OpenAI's HealthBench

arXiv cs.CL · 2026-08-27 Cached

HealthBench-Psych introduces a mental health subset of OpenAI's HealthBench benchmark to evaluate LLMs in mental health conversations, validated through clinician review and assessing 20 models as a reusable resource.

0 favorites 0 likes
← Back to home

Submit Feedback