标签
HealthBench-Psych 引入了 OpenAI HealthBench 基准测试的一个心理健康子集,用于评估 LLMs 在心理健康对话中的表现,经过临床医生审查验证,并评估了 20 个模型作为可重复使用的资源。