一年后...伤害依旧,但我们仍在!

arXiv cs.CL 论文

摘要

本研究评估了六种专有大型语言模型(LLMs)在16种DSM-5病症中通过对抗性攻击的表现,发现安全防护措施仅对自杀和自伤可靠,而对进食障碍、物质使用障碍等其他病症的失败率高达100%。

arXiv:2606.23884v1 Announce Type: new 摘要:通用型大型语言模型(LLMs)越来越多地被用于心理健康相关对话,但其安全防护措施仍不充分且在不同临床病症中不一致。本研究采用四种对抗性攻击变体,评估了六种专有LLMs在16种DSM-5病症中的表现,并引入了一个八维度伤害分类法及一个多维评估框架。结果显示,防护措施仅对自杀和自伤可靠,而进食障碍、物质使用障碍和重度抑郁症等病症的失败率高达100%。我们认为,这些LLMs的道德设计和部署要求针对不同临床病症明确界定伤害类别,并据此实施防护措施。在防护措施到位之前,这些模型对弱势群体构成重大风险,使其在教育环境中的日益整合尤其令人担忧。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:43

# 一年之后……危害犹存,但我们仍在坚守!
来源:https://arxiv.org/abs/2606.23884
查看 PDF (https://arxiv.org/pdf/2606.23884)

> 摘要:通用大型语言模型(LLMs)越来越多地被用于与心理健康相关的对话,然而安全防护措施仍然不足,且在不同临床状况下缺乏一致性。本研究针对16种DSM-5疾病,采用四种对抗性攻击变体对六款闭源LLM进行评估,引入八维度危害分类体系及多维评估框架。结果表明,安全防护仅在自杀和自伤领域可靠,而饮食障碍、物质使用障碍和重度抑郁障碍等疾病的失败率高达100%。我们认为,这些LLM的道德设计与部署要求对不同临床状况明确定义危害类别,并据此实施防护措施。在相关防护就位之前,这些模型对弱势群体构成重大风险,其在教育环境中的不断整合尤为令人担忧。

## 提交历史

来自:Annika Marie Schoene [查看电子邮件](https://arxiv.org/show-email/397736a3/2606.23884) **[v1]** 2026年6月22日星期一 19:30:14 UTC(460 KB)

相似文章

使用微调LLM识别英国警方事件日志中的脆弱性指标

arXiv cs.CL

本文探讨了使用微调LLM识别英国警方事件日志中的脆弱性指标(精神健康问题、物质滥用、酒精依赖、无家可归),发现虽然LLM能够产生有意义的患病率估计,但需要谨慎的方法学支持,并且不适用于个人层面的决策。