VERA-MH:心理健康领域伦理与负责任AI的验证

arXiv cs.AI 论文

摘要

VERA-MH是一个经过临床验证的评估框架,用于评估聊天机器人在心理健康支持中的安全性,重点关注自杀意念风险。它使用角色扮演对话和一个LLM-as-a-Judge(以LLM作为评判)结合临床评分规则来评估回复。

arXiv:2605.13318v1 公告类型:新 摘要:聊天机器人的使用已经增加,包括在它们从未被开发的领域——尤其是心理健康支持。为此,我们引入了心理健康领域伦理与负责任AI的验证(VERA-MH),一个新颖的经过临床验证的评估框架,用于评估聊天机器人在心理健康支持背景下的安全性。VERA-MH的第一个版本聚焦于自杀意念(Suicidal Ideation, SI)风险,通过评估聊天机器人如何应对可能处于危机中的用户。 VERA-MH包括三个步骤:对话模拟、对话评判和模型评分。首先,为了模拟与被评估聊天机器人的对话,由另一个聊天机器人根据特定角色扮演用户。这些用户角色是在临床指导下开发的,以确保包括多种风险因素、人口特征和披露因素等。在评判步骤中,第二个支持模型被用作LLM-as-a-Judge(以LLM作为评判),结合临床开发的评分规则。该评分规则以流程形式组织,每次只问一个“是/否”问题,以提高答案的一致性并突出模型的失败模式。在最后阶段,每次对话的结果被汇总,以呈现聊天机器人的最终评估。与该框架一起,我们还展示了四个领先LLM提供商的评估结果。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:15

# 心理健康领域中伦理与负责任人工智能的验证
来源:https://arxiv.org/html/2605.13318
Luca Belli Spring Health UC Berkeley Kate H\. Bentley Spring Health Josh Gieringer Spring Health Emily Van Ark Spring Health Nilu Zhao Spring Health Pradip Thachile Spring Health Matt Hawrilenko Spring Health Millard Brown Spring Health Adam M\. Chekroud Spring Health Yale University

###### 摘要

聊天机器人的使用日益增长,包括那些原本并非为其设计的领域——尤其是心理健康支持领域。为此,我们提出了心理健康领域伦理与负责任人工智能的验证(VERA-MH),这是一个新颖的、经过临床验证的聊天机器人在心理健康支持场景下的安全性评估工具。VERA-MH 的第一版聚焦于自杀意念(SI)风险,通过评估聊天机器人如何应对可能处于危机中的用户。

VERA-MH 包含三个步骤:对话模拟、对话评判和模型评级。首先,为了与待评估的聊天机器人模拟对话,另一个聊天机器人被赋予任务,基于特定用户画像扮演用户角色。这些用户画像是在临床指导下开发的,以确保其中包含了多种风险因素、人口统计学特征和披露因素等。在评判步骤中,使用第二个支持模型作为“LLM 作为评判者”,同时结合一个临床开发的评分标准。该评分标准以流程形式构建,每次只提出一个“是/否”问题,以提高答案的一致性并突出模型的失败模式。在最后阶段,每次对话的结果被汇总,以呈现聊天机器人的最终评估结果。与该框架一起,我们还展示了四个主要 LLM 提供商评估的结果。

## 1 引言

基于大型语言模型(LLM)的聊天机器人的使用已扩展到几乎每个领域,改变了信息获取和产生的方式。聊天机器人巨大的多功能性使其能够应用于那些它们未经开发、测试或监管不足的领域。其中一个领域便是心理健康,聊天机器人正在改变人们获取、寻求支持以及看待这一领域的方式[27 (https://arxiv.org/html/2605.13318#bib.bib41),32 (https://arxiv.org/html/2605.13318#bib.bib42),10 (https://arxiv.org/html/2605.13318#bib.bib43)]。仅在美国,就有八分之一的青少年和年轻人使用人工智能聊天机器人获取某种形式的心理健康支持[33 (https://arxiv.org/html/2605.13318#bib.bib45)]。

据估计[53 (https://arxiv.org/html/2605.13318#bib.bib59)],2021 年全球有 74.6 万人死于自杀。在美国,美国自杀预防基金会报告称,2024 年自杀是第十大死因,超过 4.8 万人死于自杀,并有 220 万次自杀未遂[21 (https://arxiv.org/html/2605.13318#bib.bib27)]。最近的悲剧事件[56 (https://arxiv.org/html/2605.13318#bib.bib68),45 (https://arxiv.org/html/2605.13318#bib.bib67),5 (https://arxiv.org/html/2605.13318#bib.bib65),13 (https://arxiv.org/html/2605.13318#bib.bib66)]进一步引起了人们对聊天机器人在美化自杀念头,甚至主动提供自杀方法信息以促进自杀企图方面的角色的关注,尤其对于青少年等弱势群体[34 (https://arxiv.org/html/2605.13318#bib.bib28)]。例如,OpenAI 最近报告称,每周有 120 万人表达自杀意图或计划与 ChatGPT 的对话中[36 (https://arxiv.org/html/2605.13318#bib.bib46)]。迫切需要开发有意义的评估方法来测试聊天机器人的能力和安全性,在心理健康等高度重要的背景下尤为关键。

我们引入了一种新的评估方法,用于测试基于 LLM 的聊天机器人在心理健康背景下的安全性:心理健康领域伦理与负责任人工智能的验证(VERA-MH),旨在为该领域带来更多临床专业知识。VERA-MH 是跨学科合作的成果,由主题专家——AI 开发者、执业临床医生和自杀预防专家——共同设计了该评估方法。VERA-MH 不仅是开源的,还明确征求了社区反馈,设有 60 天的反馈征集期。本文正是基于收到的反馈以及[8 (https://arxiv.org/html/2605.13318#bib.bib2)]的成果。我们有意将范围限定在一个高风险临床问题——自杀意念(SI)上,而不是试图广泛涵盖心理健康安全。这种聚焦的范围使我们能够实现更深的临床特异性、更清晰的安全期望以及更可操作的评估标准,同时为未来扩展到其他心理健康领域奠定基础。

遵循希波克拉底誓言“首先,不造成伤害”的原则,VERA-MH 旨在测试聊天机器人的安全性,而非评估其有效性。VERA-MH 包含三个主要部分。首先,一个对话模拟器,利用一个辅助 LLM 扮演特定用户角色来合成对话。然后,根据一个临床开发的评分标准对模拟对话进行评估,该标准反映了当前人机之间互动的最佳实践以及循证自杀预防策略。最后,将评判过的对话汇总起来,生成一张聊天机器人评估卡。在详细阐述该框架及其设计原则之后,我们将报告对四个主要 LLM 提供商的评估结果。

## 2 先前工作

LLM 及基于 LLM 的应用程序的评估是一个相对较新且充满活力的领域。尽管已发表的评估方法和基准数量不断增加,但标准化的最佳实践和互操作性仍然缺乏[44 (https://arxiv.org/html/2605.13318#bib.bib33),54 (https://arxiv.org/html/2605.13318#bib.bib34)],尽管已有一些努力开始朝这个方向发展[19 (https://arxiv.org/html/2605.13318#bib.bib29),6 (https://arxiv.org/html/2605.13318#bib.bib9)]。对评估方法的批评[42 (https://arxiv.org/html/2605.13318#bib.bib31),18 (https://arxiv.org/html/2605.13318#bib.bib32)]包括缺乏结构效度[7 (https://arxiv.org/html/2605.13318#bib.bib24)],这在临床用例中尤为重要[2 (https://arxiv.org/html/2605.13318#bib.bib25)];任务缺乏现实世界的实用性[43 (https://arxiv.org/html/2605.13318#bib.bib37)];上下文崩塌[26 (https://arxiv.org/html/2605.13318#bib.bib44)];缺乏可靠性[41 (https://arxiv.org/html/2605.13318#bib.bib30)];以及评估背后的政治和激励因素[24 (https://arxiv.org/html/2605.13318#bib.bib7),47 (https://arxiv.org/html/2605.13318#bib.bib22)]。

在心理健康这样一个不幸长期人手不足的领域,基于合成对话的 LLM 基准测试已被创建出来,以帮助培训专业人员,同时尊重患者的隐私[30 (https://arxiv.org/html/2605.13318#bib.bib10),52 (https://arxiv.org/html/2605.13318#bib.bib11),39 (https://arxiv.org/html/2605.13318#bib.bib12),51 (https://arxiv.org/html/2605.13318#bib.bib13)]。关于聊天机器人,研究人员发现已部署的系统中缺少足够的安全护栏[35 (https://arxiv.org/html/2605.13318#bib.bib18)],考虑到这些系统庞大的用户数量,这一点令人深感不安,并凸显了进行更有效的部署前安全性评估[17 (https://arxiv.org/html/2605.13318#bib.bib52)]的必要性。静态数据集[55 (https://arxiv.org/html/2605.13318#bib.bib14)]或单轮数据集[4 (https://arxiv.org/html/2605.13318#bib.bib15)]虽然仍有帮助,但无法捕捉真实对话的完整上下文。用户可能会在经过多轮对话后,以可能不经意或间接的方式披露有关自杀意念的信息。此外,如果相同的、单独看来并不危险的回答被多次重复,而风险未能得到充分处理,那么整个对话可能是有害的,甚至是不安全的。

VERA-MH 是一种基于评判者的安全性评估方法,配备对话生成环境,用于模拟用户与聊天机器人动态交互的过程。与诸如[48 (https://arxiv.org/html/2605.13318#bib.bib51),35 (https://arxiv.org/html/2605.13318#bib.bib18)]之类的有效性评估不同,其目标不是判断聊天机器人的回答如何与临床医生在诊断或治疗方面保持一致,而仅仅是判断聊天机器人的回答是否安全。与 HealthBench[3 (https://arxiv.org/html/2605.13318#bib.bib47)]类似,VERA-MH 是一种基于评判者的评估方法,旨在复制临床医生的判断。然而,VERA-MH 还包含一个完整的对话模拟引擎,类似于 Mindeval[40 (https://arxiv.org/html/2605.13318#bib.bib17)]。但与 Mindeval 不同的是,VERA-MH 具体将范围缩小到一个单一的安全问题——自杀意念(SI),以实现更精确的评估。

## 3 设计原则

VERA-MH 的设计遵循以下原则,我们认为这些原则对于评估的有意义性、科学基础性和临床有效性至关重要。

1. 1. 临床依据。执业临床医生共同设计了该评估,以确保临床最佳实践得到充分体现。
2. 2. 现实世界使用。聊天机器人应基于反映真实用例的任务进行评估,而非仅限于计算机模拟场景。
3. 3. 范围狭窄。为使评估有意义,应严格限定范围,而非成为一个包罗万象的心理健康评估。本次迭代的 VERA-MH 聚焦于自杀意念风险。
4. 4. 对话层面。评估聚焦于对话层面,因为在心理健康背景下,单轮评估可能过于狭窄。这也意味着评估是: 1. (a) 多轮。为全面反映用户与聊天机器人之间真实、复杂的互动,评估聚焦于多轮评估。 2. (b) 无记忆。每次对话独立评估。
5. 5. 动态。对话在每次运行评估时动态生成。
6. 6. 基于 API。VERA-MH 是一种 API 层面的评估。仅评估模型的响应(即文本),忽略所有其他内容,包括图形用户界面中的元素(如弹出窗口或计时器)以及对话之外发生的人工升级工作流。
7. 7. 自动化。为跟上创新的步伐以及模型新能力和功能的快速发展,评估是自动化的。这使得新模型在部署前能够被快速评估。
8. 8. 经专家验证。鉴于评估的自动化性质,有必要验证结果是否与专家(此处指执业临床医生)一致。
9. 9. 多指标。该领域的复杂性和新颖性要求对每个模型采取多指标的性能衡量。
10. 10. 开源。所有代码均开源,以保证透明性和可重复性。
11. 11. 非开发者可访问。鉴于评估涉及多方利益相关者,定义安全与不安全行为的标准(即详细的评分标准内容)以及用户画像应以便于所有人理解的格式呈现,而非仅存在于代码中。
12. 12. 持续演进。在心理健康人工智能这个新兴领域,关于最佳实践的共识正在演变。我们承认每个版本的 VERA-MH 都反映了其发布时的最先进水平,并且指导方针可能会随着时间的推移而改变——甚至发生巨大变化。

## 4 架构

VERA-MH 是一个评估流水线,包含三个部分:生成步骤、评判步骤和评级步骤。这些步骤可以顺序执行,也可以独立运行。

鉴于我们对多轮评估和自动化评估的要求——摒弃单次提示、脚本化对话或人工驱动的对话——我们引入了一种辅助模式:一个被任务化扮演系统用户的 LLM。脚本化对话无法反映在聊天机器人上下文响应下真实对话的流程。人工对话(即让人假装成系统用户)会引发伦理问题,且无法自动化、成本高昂且不可扩展。对话根据一个编码了有关自杀风险的聊天机器人-人类互动最佳实践以及循证自杀预防实践的评分标准进行评估。第二个辅助模型,作为“LLM 作为评判者”[58 (https://arxiv.org/html/2605.13318#bib.bib1)],可确保快速、自动化的评估。在 4.2.3 (https://arxiv.org/html/2605.13318#S4.SS2.SSS3) 节中,我们将详细阐述这种方法的有效性及其与人类专家评分者的比较。在第三步也是最后一步中,评判过的对话被分组,以生成评估的最终指标。

### 4.1 对话生成

为了创建既自动化又动态(即非脚本化,每次评估都会变化)的对话,我们依赖另一个 LLM 被任务化扮演用户角色,与待评估的聊天机器人互动。多个用户画像被用于指导 LLM 扮演用户角色。系统提示指导用户 LLM 尽可能准确地基于特定画像模拟用户,并包含风格性指令,例如使生成的语言和语气与画像特征相匹配。如图 7 (https://arxiv.org/html/2605.13318#A2.F7) 所示,用户的回答往往长度较短,表明指令被正确理解。每次对话都在一个新的 LLM 实例上模拟,使得所有对话相互独立。在早期版本中,用户 LLM 会产生语法正确、多段落的回答,有时会在星号之间描述心理状态,这并不代表真实的人机交互。同样,用户 LLM 会大量感谢聊天机器人的回答,并在对话开始前花费大量时间寒暄。为了提高真实感,用户 LLM 还被指示,如果感觉无法再从聊天机器人那里获得更多有用信息,可以中断对话,这导致许多模拟用户因明显受挫而关闭对话。关于生成文本的统计数据见附录 B (https://arxiv.org/html/2605.13318#A2)。

#### 4.1.1 用户画像

为了更好地控制模拟对话,我们创建了 100 个用户画像。每个画像在人口统计学和临床维度上都有独特特征。人口统计学特征包括年龄(已证明会影响使用的语言)、性别和经济压力。重要的临床标志包括自杀风险水平、自杀念头史、披露情况、心理健康服务可及性、社会孤立以及近期触发因素。完整列表可在代码仓库中找到。生成用户画像的过程如下。临床医生决定自杀风险水平的分布:高风险 30%,中等风险 30%,低风险 30%,无风险 10%(作为对照组)。对于每个组,其他特征——包括临床、个人和人口统计学特征——被随机且独立地分配。我们使用 GPT5.2 生成了传记元素和一个种子短语建议。Grok 4 生成了第二个短语建议。临床医生对最终列表进行了最终检查,以确保准确性和代表性。这组用户画像相比最初为[8 (https://arxiv.org/html/2605.13318#bib.bib2)]开发的 10 个画像增加了 10 倍。正如讨论部分所指出的,存在一个具体风险,即……

相似文章

MentalHospital:评估精神病学临床接诊的虚拟环境

arXiv cs.AI

MentalHospital是一个虚拟环境,旨在评估AI智能体与人类专家在精神病学临床接诊中的表现,涵盖问诊、检查、诊断和治疗规划。实验通过客观与主观指标比较人类专家、受训人员及多种大语言模型。

AI安全的另一半

Hacker News Top

文章批评AI安全领域专注于灾难性风险,却忽视了像ChatGPT这样的聊天机器人对日常心理健康的危害。引用OpenAI自身数据,数百万用户表现出精神病、躁狂或自杀意念的迹象,却仅被重定向,未进行硬性拦截。

我们对心理健康相关诉讼的处理方式

OpenAI Blog

OpenAI 阐述了其处理心理健康相关诉讼的方式,强调透明度、关怀和尊重,同时为相关指控进行辩护。公司详细介绍了其在改进 ChatGPT 安全功能方面的持续努力,包括识别心理困境和引导用户寻求专业支持。