HealthBench-Psych: OpenAI HealthBench 的心理健康子集

arXiv cs.CL 论文

摘要

HealthBench-Psych 引入了 OpenAI HealthBench 基准测试的一个心理健康子集,用于评估 LLMs 在心理健康对话中的表现,经过临床医生审查验证,并评估了 20 个模型作为可重复使用的资源。

arXiv:2608.25071v1 公告类型:新 摘要:通用健康基准测试越来越多地用于评估 LLMs 在医学表现上的声称,但它们并不总是按临床专科划分,使得领域特定性能难以隔离。心理健康是一个紧迫的公共卫生关注点,因为数百万人转向 LLMs 寻求心理支持,而大多数现有评估是定制学术基准测试,难以集成到开发者工作流程中。我们引入了 HealthBench-Psych 和 HealthBench-Psych-Hard。我们使用透明的 LLM 应用标准筛选了 HealthBench 的 5,000 个医生评分对话的相关心理健康内容,然后通过两轮盲法临床医生审查验证了该子集,使用隐藏已知排除控制,得到 610 个对话(占语料库的 12.2%)。在由三个 LLM 评审员组成的跨供应商面板下评估 20 个前沿和开放模型,我们发现统计上持平的前沿集群、两个模型中可测量的拒绝行为,以及几乎相同的排名($\tau \ge 0.92$)。我们将子集、流水线、模型响应、评分和分析代码作为可重复使用的资源发布。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:14

# HealthBench-Psych:OpenAI HealthBench的心理健康子集
来源:https://arxiv.org/html/2608.25071
Matthew Flathers, Phuong Anh Nguyen  
所属机构:贝斯以色列女执事医疗中心数字精神病学部,波士顿,马萨诸塞州
Jill Noorily  
所属机构:贝斯以色列女执事医疗中心数字精神病学部,波士顿,马萨诸塞州
Julian Herpertz  
所属机构:贝斯以色列女执事医疗中心数字精神病学部,波士顿,马萨诸塞州
Meiting Chen, Jasreen Multani, Samuel Powell  
所属机构:贝斯以色列女执事医疗中心数字精神病学部,波士顿,马萨诸塞州;贝斯以色列女执事医疗中心精神病学系,波士顿,马萨诸塞州
Mason Granof, Mark Kalinch, John Torous  
所属机构:贝斯以色列女执事医疗中心数字精神病学部,波士顿,马萨诸塞州

###### 摘要
通用健康基准日益成为评估大语言模型医疗性能的核心依据,但这些基准通常不按临床专科细分,使得特定领域的性能难以独立衡量。鉴于数百万人正转向大语言模型寻求心理支持,心理健康已成为亟待关注的公共卫生问题,而现有评估大多为定制化的学术基准,难以融入开发者工作流程。我们推出了 HealthBench-Psych 和 HealthBench-Psych-Hard。我们采用透明的 LLM 应用评分标准,从 HealthBench 的 5,000 次医生评分对话中筛选出与心理健康相关的对话,随后通过两轮双盲临床医生评审(其中包含隐藏的已知排除对照组)验证子集,最终得到 610 次对话(占语料库的 12.2%)。在跨供应商的三名 LLM 评审员小组评估 20 个前沿及开源模型后,我们发现了一个统计上并列的前沿集群,两个模型表现出可测量的拒绝行为,且不同评审员给出的排名几乎完全一致(τ≥0.92)。我们公开发布该子集、流程、模型响应、评分及分析代码,作为可重复利用的资源。††预印本 v1.0.0。代码:https://github.com/mindbench-ai/healthbench-psych 数据:https://huggingface.co/datasets/mindbench-ai/healthbench-psych 通讯作者:[email protected]

## 1 引言
人们日益将心理健康问题诉诸通用大语言模型,往往在急性困境时刻,且不在任何临床路径之内(Bodner et al., 2026;Rousmaniere et al., 2026)。因此,评估这些系统在心理健康对话中的行为至关重要。然而,现有心理健康评估文献主要集中于自杀风险检测和诊断分类(Flathers et al., 2026),而风险分类和考试风格的诊断推理并不能很好地代表可能构成大多数实际使用的开放式、模糊、多轮求助对话(Raji et al., 2025;Stade et al., 2024;Luo et al., 2025)。对话式健康基准已开始缩小这种真实性差距。HealthBench(Arora et al., 2025)是最突出的例子,包含 5,000 次多轮对话,每次回复均根据医生编写的评分标准进行评分。其形式为自由文本而非固定多项选择题(Singhal et al., 2025),且该基准采用开源许可。但它缺乏专科元数据。其项目标签描述的是对话行为(如模糊表达、紧急转诊、寻求上下文)和医生不确定性结构,从未涉及具体医学主题。这一点很重要,因为 HealthBench 已开始出现在人工智能公司的模型卡和技术报告中,作为其健康测试的核心,使其成为开发者最广泛使用的心理健康评估工具之一(OpenAI, 2026;Anthropic, 2026;Meta Superintelligence Labs, 2026)。因此,一个报告了强大 HealthBench 分数的实验室可能看起来在精神病学和临床心理学方面具备能力,但却没有明确的方法来单独隔离该领域的性能。我们分两阶段解决这一差距。我们推出 HealthBench-Psych,这是一个经过临床医生裁决的 610 次与心理健康相关的 HealthBench 对话子集,并首次使用该子集在由三家供应商的三名 LLM 评审员组成的跨供应商小组中,对 20 个前沿及开源模型进行专科分辨的比较。我们的贡献包括:(1)一个透明、可重复的流程,用于从无标签的健康基准中提取经专家验证的专科子集,并首次对 HealthBench 中的心理健康内容进行了实证特征分析;(2)公开发布的 HealthBench-Psych 子集;(3)一个专科分辨的排行榜,揭示了统计上并列的前沿集群,并揭示了模型拒绝行为作为一个可测量、与安全相关的属性;以及(4)关于专科规模下评审员可靠性的证据。

## 2 方法
### 2.1 语料库与筛选评分标准
我们基于公开发布的 HealthBench OSS 版本(OpenAI, 2025)开展工作。我们编写了一个筛选评分标准(附录 A),仅根据用户轮次将每段对话映射为以下三个标签之一:相关、边界或不相关。纳入标准涵盖精神病症状况与症状、自杀倾向与自残、药物使用、精神药物、心理治疗与求医、心理性痛苦以及围产期心理健康;排除标准涵盖触发词在非精神病学语境中出现的躯体问题。边界标签用于精神病学与身体健康意义重叠的模糊案例,这些案例被转交人工评审。平局时倾向于更不包含的标签,使筛选成为有意保守、以精确率为导向的第一阶段。评分标准文本由 LLM(Claude Fable 5)辅助起草,纳入与排除标准由作者设定、审查并最终确定。

### 2.2 子集构建:筛选、专家裁决与召回恢复
我们使用 Claude Opus 4.8(claude-opus-4-8)应用该评分标准,以 50 次对话为一批独立筛选语料库。每批接收原始评分标准,并为每次对话输出一个模式约束的记录(标签;类别,一个包含 18 个术语的受控词表;置信度;理由),无共享上下文、无示例,使用默认采样参数。安全拒绝被标记为边界并转交评审。非英语对话经机器翻译(Claude Opus 4.8)供评审员参考。三名持证临床医生(R1–R3;1 名医学博士,1 名持证临床社会工作者,1 名持证专业咨询师)随后评审一组盲审集合,该集合包含所有相关和边界对话,以及 150 次不相关对话作为隐藏对照,按单个种子随机顺序排列,隐藏筛选标签,每人独立记录相关性(二元)、类别、置信度和自由文本备注(工具见附录 D)。我们使用 Gwet's AC1(Gwet, 2008)量化一致性,因为筛入集的高患病率会降低 κ 值(Feinstein and Cicchetti, 1990)。纳入由评审员多数票决定(≥2/3),保留每项投票和共识层级,以便发布时保留分歧。由于对照组来自筛选出的“不相关”池,多数票纳入对照组的比率可估计筛选的漏检率。对照组纳入率超过 5% 则触发召回轮次;低于该阈值,则接受纳入集为全面集并终止循环。当触发时,召回轮次分析纳入的对照组及评审员对其的备注,以编纂筛选的漏检类型,并定义面向召回的评分标准类别(附录 B)。使用 Claude Sonnet 4.6(claude-sonnet-4-6)在相同的分批协议下对所有未用作对照的排除对话运行,筛选代理分配一个恢复层级(明确/可能/否)。明确和可能对话在完全相同的评审协议下进入新一轮盲审(相同临床医生、相同多数规则、新隐藏对照、独立随机化),其中的对照组重新应用恢复决策规则。轮次计数、对照组结果和每轮产出在结果部分报告。

### 2.3 候选响应生成
我们从八家供应商的 20 个候选模型中,为每次对话引出一个响应(附录 E 列出了每个模型标识符和解码配置)。每个候选模型接收原始的 HealthBench 对话消息,无附加系统消息,无提示修改。候选响应在温度 0 下生成,生成上限为 8,192 个 token(对于 gpt-3.5-turbo 为 4,096,受其上下文窗口限制;见附录 E);固定或拒绝温度参数的模型(仅推理模型)以供应商默认值运行,各模型默认值记录于附录 E。响应按对话存储,每个评审员对相同的存储响应进行评分,以将评审员效应与采样方差分离。返回明确拒绝停止原因的空响应作为模型响应保留并按原样评分。我们未对拒绝响应进行重新采样,因为重新采样直到获得符合要求的响应会歪曲部署后的行为,并且在温度 0 下可能再次发生。可归因于传输失败的空响应被重新请求,且绝不作为模型输出保留。

### 2.4 评分标准评分与评审员小组
评分完全复用 HealthBench 的评分器:使用原始的评分器模板(附录 C)、原始的系统消息和原始的 2,048 个 token 评分器上限,每个评分标准由独立的评审员调用进行评分,返回布尔值 `criteria_met` 判定。我们与参考实现的一个参数不同:评审员在温度 0 下评分,而非默认的 0.5,以确定性、可重复的判定取代了参考的采样方案。当评审员输出格式错误的 JSON 时,我们通过模式提取恢复已输出的布尔判定,而非重新采样,以保持温度 0 的判定。在有限次重试后仍无法恢复的判定被排除并记录。每次对话–候选配对由三名评审员独立评分:GPT-4.1(HealthBench 本身使用的评分器)、Claude Haiku 4.5 和 Gemini 2.5 Flash。评审员来自三个供应商,以便衡量评审员家族效应(Zheng et al., 2023;Panickssery et al., 2024),且所有评审员均作为非推理模型运行(附录 E)。评审员调用通过供应商的批处理 API 发出,对于丢失或无法解析的判定,在相同温度下进行同步回退。为确认测试工具与参考实现一致,我们复制了 OpenAI 公布的 GPT-4.1 在完整 HealthBench-Hard 子集上的评估,并与公布分数进行比较。

### 2.5 评分与分析
响应的分数遵循 HealthBench 的评分惯例:满足标准的得分除以总正分,使用参考评分器计算。候选模型在某一评审员下的分数为对话平均分的均值,按参考实现裁剪到 [0, 1]。不确定性通过对话级自助法(1,000 次重采样)估计,遵循参考的自助法配方。跨评审员一致性、严重性和自我偏好指标的定义与报告见附录 I。候选模型的小组分数为对话级分数的三评审员等权重均值的对话平均值,裁剪到 [0, 1];小组排序对严重性校正不变。所有运行产物(模型快照、解码参数、提示、评分器模板哈希、子集内容哈希、开销和错误日志)均记录在发布的清单中。
表 1:在 HealthBench-Psych(n=610)和 HealthBench-Psych-Hard(n=119)上的三评审员小组均值及 95% CI;完整子集上的单评审员均值见附录 I。

## 3 结果
### 3.1 子集构建与循环终止
筛选将 5,000 次对话的语料库标记为相关 378(7.6%)、边界 263(5.3%)和不相关 4,359(87.2%);一次对话(“蒙古农村地区炭疽的最佳预防措施”)多次引发筛选模型的安全拒绝,作为边界转交评审。围产期心理健康是最大的相关子类别(107/378)。专家评审第一轮覆盖了 791 次对话(641 次筛入 + 150 次隐藏对照;全集相关性 AC1 为 0.79)。多数票纳入 587 次筛入对话和 150 次对照中的 9 次,对照纳入率为 6.0%,超过 5% 的决策阈值,触发召回轮次。临床医生指导的召回评分标准重新检查了 4,209 次未用作对照的排除对话,浮出 81 个候选(9 次明确,72 次可能),它们与 25 个新隐藏对照一起被评审。多数票纳入 14 个候选(6/9 明确,8/72 可能)和 25 个对照中的 1 个;对照纳入率为 4.0%,低于停止阈值,循环终止。第二轮一致性较低(AC1 0.49;剩余配对 0.84),由一名评审员对对照组的较大宽容度驱动,多数规则将其吸收。发布的子集包含 610 次对话(占语料库的 12.2%)。按临床医生众数类别,该子集覆盖了门诊心理健康的广度:围产期心理健康最大(112;18.4%),其次是焦虑(84)、精神药物(69)、心境障碍(57)、睡眠(43)、认知–神经认知(41)、ADHD(36)、药物使用(31)以及自杀倾向/自残(19),另有七个类别 n≤18,65 次对话无类别多数(图 G1)。HealthBench-Psych-Hard(n=119)是此集合与 OpenAI 公布的 HealthBench-Hard 对话索引的交集。

### 3.2 测试工具验证
在 OpenAI 的评审温度 0.5 和 2,048 个 token 生成上限设置下,复制 OpenAI 在完整 1,000 次对话 HealthBench-Hard 子集上的 GPT-4.1 评估,我们的流程得分为 0.157,与公布的 0.16 相比(Δ=-0.003)(Arora et al., 2025),0 次评分失败,1,000/1,000 次对话获得评分。

### 3.3 模型性能
表 1 报告了所有 20 个候选分数:三评审员小组均值及 95% 引导 CI(单评审员分数见附录 I);图 G2 绘制了小组排名。前五名:kimi-k2.6(0.627)、gpt-5.5(0.624)、claude-opus-5(0.620)、grok-4.5(0.612)和 gpt-5.6-sol(0.610)形成一个统计上并列的前沿集群(CI 见表 1)。

相似文章

介绍 HealthBench

OpenAI Blog

OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。

MentalHospital:评估精神病学临床接诊的虚拟环境

arXiv cs.AI

MentalHospital是一个虚拟环境,旨在评估AI智能体与人类专家在精神病学临床接诊中的表现,涵盖问诊、检查、诊断和治疗规划。实验通过客观与主观指标比较人类专家、受训人员及多种大语言模型。