evaluation-dataset

标签

Cards List
#evaluation-dataset

HealthBench-Psych: OpenAI HealthBench 的心理健康子集

arXiv cs.CL · 2026-08-27 缓存

HealthBench-Psych 引入了 OpenAI HealthBench 基准测试的一个心理健康子集,用于评估 LLMs 在心理健康对话中的表现,经过临床医生审查验证,并评估了 20 个模型作为可重复使用的资源。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈