一年后...伤害依旧,但我们仍在!
摘要
本研究评估了六种专有大型语言模型(LLMs)在16种DSM-5病症中通过对抗性攻击的表现,发现安全防护措施仅对自杀和自伤可靠,而对进食障碍、物质使用障碍等其他病症的失败率高达100%。
arXiv:2606.23884v1 Announce Type: new
摘要:通用型大型语言模型(LLMs)越来越多地被用于心理健康相关对话,但其安全防护措施仍不充分且在不同临床病症中不一致。本研究采用四种对抗性攻击变体,评估了六种专有LLMs在16种DSM-5病症中的表现,并引入了一个八维度伤害分类法及一个多维评估框架。结果显示,防护措施仅对自杀和自伤可靠,而进食障碍、物质使用障碍和重度抑郁症等病症的失败率高达100%。我们认为,这些LLMs的道德设计和部署要求针对不同临床病症明确界定伤害类别,并据此实施防护措施。在防护措施到位之前,这些模型对弱势群体构成重大风险,使其在教育环境中的日益整合尤其令人担忧。
查看缓存全文
缓存时间: 2026/06/24 07:43
# 一年之后……危害犹存,但我们仍在坚守! 来源:https://arxiv.org/abs/2606.23884 查看 PDF (https://arxiv.org/pdf/2606.23884) > 摘要:通用大型语言模型(LLMs)越来越多地被用于与心理健康相关的对话,然而安全防护措施仍然不足,且在不同临床状况下缺乏一致性。本研究针对16种DSM-5疾病,采用四种对抗性攻击变体对六款闭源LLM进行评估,引入八维度危害分类体系及多维评估框架。结果表明,安全防护仅在自杀和自伤领域可靠,而饮食障碍、物质使用障碍和重度抑郁障碍等疾病的失败率高达100%。我们认为,这些LLM的道德设计与部署要求对不同临床状况明确定义危害类别,并据此实施防护措施。在相关防护就位之前,这些模型对弱势群体构成重大风险,其在教育环境中的不断整合尤为令人担忧。 ## 提交历史 来自:Annika Marie Schoene [查看电子邮件](https://arxiv.org/show-email/397736a3/2606.23884) **[v1]** 2026年6月22日星期一 19:30:14 UTC(460 KB)
相似文章
分析语言模型中的自伤表征:一项跨架构研究
本文分析了大型语言模型内部如何表征自伤内容,发现自伤信息在最后几层结晶,且线性可分性与探针准确性并不一致。
当症状不足以诊断:大型语言模型在精神科筛查中的证据加权模式
本文介绍了一个以SCID为锚定的555次访谈基准,用于评估五种大型语言模型(LLMs)在精神科筛查中的表现。研究发现,虽然模型展现出潜力,但它们在存在功能保留或保护性背景的情况下倾向于低估症状证据,因此需要谨慎验证。
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。
使用微调LLM识别英国警方事件日志中的脆弱性指标
本文探讨了使用微调LLM识别英国警方事件日志中的脆弱性指标(精神健康问题、物质滥用、酒精依赖、无家可归),发现虽然LLM能够产生有意义的患病率估计,但需要谨慎的方法学支持,并且不适用于个人层面的决策。